external-link

LLM Modely:
Llama vs Mistral

Môj prvý pokus o spustenie lokálnych jazykových modelov. Ono to naozaj funguje aj bez cloudu! Zisťoval som, ktorý model mi v Trebišove pobeží najrýchlejšie.

Llama 3 (8B)

Neuveriteľné, ako Meta dokázala do 8 miliárd parametrov natlačiť toľko rozumu! Skúšal som ju na logické úlohy a fíha, odpovedá takmer okamžite. Je to môj favorit pre rýchle četovanie.

Ako to prepojiť s Pythonom icon-b

Mistral 7B v0.3

Francúzsky klenot. Oproti Llama sa mi zdá o niečo „ukecanejší“, ale v slovenčine robí menej gramatických chýb. Kto by to bol povedal? Ideálny pre generovanie dlhších textov.

Zber dát pre Mistral

Quantization Q4_K_M

Toto bol pre mňa šok! Kvantizácia zmenší model tak, že sa zmestí aj do bežnej grafiky. Stratu kvality som si takmer nevšimol, ale rýchlosť stúpla trojnásobne. Oplatí sa to!

Riešenie chýb pri načítaní

Prečo som si vybral GGUF formát?

Keď som začínal, netušil som, že modely majú desiatky gigabajtov. Predstavte si to sklamanie, keď mi počítač zamrzol pri prvom pokuse! Potom som objavil GGUF a kvantizáciu. Je to v podstate kompresia, ktorá „zaokrúhli“ čísla v modeli.

Skúšal som rôzne úrovne: Q8 (takmer originál), Q4 (zlatá stredná cesta) a Q2 (už dosť hlúpy model). Nakoniec som zostal pri Q4_K_M. Je to dostatočne inteligentné na programovanie a zároveň to nezabije moju VRAM. Celý proces inštalácie som popísal v sekcii o Python základoch.

Wow, najlepšie na tom je, že s GGUF môžem využiť aj procesor (CPU), ak mi dôjde pamäť na grafike. Nie je to také rýchle, ale na domáce experimenty v Trebišove to úplne stačí.

Spotreba VRAM a výkon

Llama 3 8B (Q4_K_M)

Využitie pamäte: 4.9 GB VRAM. Rýchlosť: 45 tokenov za sekundu. To je rýchlejšie ako stíham čítať!

Mistral 7B (Q4_K_M)

Využitie pamäte: 4.5 GB VRAM. Rýchlosť: 52 tokenov za sekundu. Mistral je o kúsok svižnejší.

Llama 3 70B (Q2_K)

Využitie pamäte: 22 GB VRAM. Rýchlosť: 2 tokeny za sekundu. Ups, toto už môj stroj nezvláda.

A technical dashboard showing 3D bar charts of GPU performan
Porovnanie náročnosti modelov na hardvér.

Chcete vidieť kód v akcii?

Zistiť, ktorý model je lepší, je jedna vec. Ale napojiť ho na vlastnú aplikáciu? To je ten pravý vau-moment. Pozrite sa, ako som to celé prepojil pomocou API.

Prejsť na API integráciu
Stránka slúži výhradne na informačné a vzdelávacie účely.
Všetky materiály majú referenčný charakter a nie sú odbornými odporúčaniami.
Nepreberáme zodpovednosť za finančné rozhodnutia založené na tomto obsahu.