Llama 3 (8B)
Neuveriteľné, ako Meta dokázala do 8 miliárd parametrov natlačiť toľko rozumu! Skúšal som ju na logické úlohy a fíha, odpovedá takmer okamžite. Je to môj favorit pre rýchle četovanie.
Môj prvý pokus o spustenie lokálnych jazykových modelov. Ono to naozaj funguje aj bez cloudu! Zisťoval som, ktorý model mi v Trebišove pobeží najrýchlejšie.
Neuveriteľné, ako Meta dokázala do 8 miliárd parametrov natlačiť toľko rozumu! Skúšal som ju na logické úlohy a fíha, odpovedá takmer okamžite. Je to môj favorit pre rýchle četovanie.
Francúzsky klenot. Oproti Llama sa mi zdá o niečo „ukecanejší“, ale v slovenčine robí menej gramatických chýb. Kto by to bol povedal? Ideálny pre generovanie dlhších textov.
Toto bol pre mňa šok! Kvantizácia zmenší model tak, že sa zmestí aj do bežnej grafiky. Stratu kvality som si takmer nevšimol, ale rýchlosť stúpla trojnásobne. Oplatí sa to!
Keď som začínal, netušil som, že modely majú desiatky gigabajtov. Predstavte si to sklamanie, keď mi počítač zamrzol pri prvom pokuse! Potom som objavil GGUF a kvantizáciu. Je to v podstate kompresia, ktorá „zaokrúhli“ čísla v modeli.
Skúšal som rôzne úrovne: Q8 (takmer originál), Q4 (zlatá stredná cesta) a Q2 (už dosť hlúpy model). Nakoniec som zostal pri Q4_K_M. Je to dostatočne inteligentné na programovanie a zároveň to nezabije moju VRAM. Celý proces inštalácie som popísal v sekcii o Python základoch.
Wow, najlepšie na tom je, že s GGUF môžem využiť aj procesor (CPU), ak mi dôjde pamäť na grafike. Nie je to také rýchle, ale na domáce experimenty v Trebišove to úplne stačí.
Využitie pamäte: 4.9 GB VRAM. Rýchlosť: 45 tokenov za sekundu. To je rýchlejšie ako stíham čítať!
Využitie pamäte: 4.5 GB VRAM. Rýchlosť: 52 tokenov za sekundu. Mistral je o kúsok svižnejší.
Využitie pamäte: 22 GB VRAM. Rýchlosť: 2 tokeny za sekundu. Ups, toto už môj stroj nezvláda.
Zistiť, ktorý model je lepší, je jedna vec. Ale napojiť ho na vlastnú aplikáciu? To je ten pravý vau-moment. Pozrite sa, ako som to celé prepojil pomocou API.
Prejsť na API integráciu