VRAM: Prečo je najdôležitejšia súčiastka vášho počítača pre lokálnu AI a koľko jej naozaj treba

VRAM: Prečo je najdôležitejšia súčiastka vášho počítača pre lokálnu AI a koľko jej naozaj treba

Kúpili ste si výkonnú grafickú kartu za 1 500 €, stiahli ste si najnovší jazykový model Llama 3.1 a po spustení sa dozviete len: „Nedostatok pamäte.

Znížte veľkosť modelu alebo zatvorte iné aplikácie.“ Nie je to chyba výkonu – je to chyba VRAM. Táto pamäť je dnes najväčším obmedzením pre každého, kto chce prevádzkovať umelú inteligenciu na vlastnom hardvéri. A práve preto je kľúčové vedieť, koľko jej naozaj potrebujete.

Definícia: Čo je VRAM jednoducho povedané

VRAM (Video Random Access Memory – videopamäť) je vyhradená pamäť na grafickej karte, ktorá slúži ako rýchly sklad pre dáta, s ktorými práve pracuje GPU. Pre lokálnu AI je to miesto, kde sa načítava celý model umelej inteligencie – jeho váhy, architektúra a kontextové okno. Bez dostatočnej VRAM model jednoducho nespustíte, aj keby ste mali najvýkonnejší procesor na svete.

Ako to funguje a prečo na tom záleží

Predstavte si VRAM ako pracovný stôl. Čím je stôl väčší, tým viac vecí naň naraz položíte a tým rýchlejšie s nimi pracujete. Bežná RAM (operačná pamäť) je ako skriňa v rohu miestnosti – veci do nej uložíte, ale kým ich presuniete na stôl, trvá to. GPU potrebuje mať model AI priamo na stole (vo VRAM), aby s ním mohol pracovať v reálnom čase. Ak sa model nezmestí, systém začne presúvať dáta medzi VRAM a RAM, čo spôsobí dramatické spomalenie – v praxi to znamená, že odpoveď od AI môže trvať minúty namiesto sekúnd.

Pre lokálnu AI je VRAM kľúčová z troch dôvodov: - Veľkosť modelu: Jazykové modely majú stovky miliónov až miliardy parametrov. Napríklad model so 7 miliardami parametrov v plnej presnosti (32-bit) zaberá približne 28 GB. - Kontextové okno: Čím dlhší text modelu poskytnete (napríklad celú knihu), tým viac VRAM potrebuje na jeho spracovanie. - Rýchlosť: Rýchlosť generovania odpovedí priamo závisí od toho, či sa celý model zmestí do VRAM. Ak nie, rýchlosť klesá až desaťnásobne.

Konkrétny príklad z praxe

Povedzme, že chcete spúšťať model Mistral 7B (7 miliárd parametrov) v kvantizovanej 4-bitovej verzii. Táto verzia zaberá približne 4,5 GB VRAM. Pridajte kontextové okno s 8 000 tokenmi (približne 6 000 slov) – to je ďalších 2 – 3 GB. Spolu potrebujete približne 7 – 8 GB VRAM. To zvládne grafická karta s 8 GB, napríklad RTX 4060.

Ak však chcete použiť model Llama 3.1 70B v 4-bitovej verzii, potrebujete približne 35 GB VRAM len pre model, plus ďalších 5 – 10 GB pre kontext. To už vyžaduje profesionálne karty ako RTX 4090 (24 GB) alebo RTX 6000 Ada (48 GB). A ak chcete model v plnej 16-bitovej presnosti, potrebujete 140 GB – teda štyri RTX 4090 prepojené dohromady.

Koľko VRAM naozaj potrebujete – praktické odporúčania

Tu je reálny návod podľa toho, čo chcete robiť:

8 GB VRAM – minimálny štart. Zvládnete malé modely (3 – 7 miliárd parametrov) v kvantizovanej verzii. Vhodné na experimentovanie, jednoduché chatovanie a základné úlohy. Príklad karty: RTX 4060 (8 GB, cca 350 €).

12 GB VRAM – ideálny bod pre bežného používateľa. Zvládnete modely do 13 miliárd parametrov v 4-bitovej verzii, napríklad Llama 3.1 8B alebo Mistral 13B. Môžete pracovať s dlhšími textami a vykonávať jednoduché doladenie (fine-tuning). Príklad karty: RTX 4070 (12 GB, cca 600 €).

16 – 24 GB VRAM – pre nadšencov a profesionálov. Zvládnete modely do 34 miliárd parametrov v 4-bitovej verzii, napríklad Code Llama 34B alebo Mixtral 8x7B (ktorý potrebuje približne 24 GB). Môžete pracovať s veľkými kontextovými oknami (32k – 128k tokenov) a vykonávať pokročilé doladenie. Príklad karty: RTX 4080 Super (16 GB, cca 1 100 €) alebo RTX 4090 (24 GB, cca 1 800 €).

48 GB a viac – pre serióznu prácu. Zvládnete modely so 70 miliardami parametrov v 4-bitovej verzii, prípadne menšie modely v plnej presnosti. Vyžaduje profesionálne karty ako RTX 6000 Ada (48 GB, cca 7 000 €) alebo viacero kariet prepojených do klastra.

Časté omyly a na čo si dať pozor

Omyl č. 1: Výkon GPU je dôležitejší ako VRAM. Nie je. Pri lokálnej AI je VRAM prvým a najdôležitejším obmedzením. Rýchlejšie GPU s menšou VRAM je horšie ako pomalšie GPU s väčšou VRAM, pretože model sa do nej jednoducho nezmestí.

Omyl č. 2: Kvantizácia je zadarmo. Kvantizácia (zníženie presnosti modelu) zmenšuje veľkosť, ale mierne znižuje kvalitu výstupov. Pre bežné chatovanie je to zanedbateľné, pre odborné úlohy (napríklad preklad právnych dokumentov) to už môže byť problém.

Omyl č. 3: Stačí len GPU, zvyšok je nepodstatný. Potrebujete aj dostatočnú RAM (aspoň 16 GB, ideálne 32 GB) a rýchle úložisko (NVMe SSD), pretože modely sa načítavajú z disku. Ak máte pomalý disk, načítanie modelu môže trvať minúty.

Pasca č. 1: „Lacné“ riešenia s malou VRAM. Karty so 6 GB VRAM (napríklad RTX 3050) sú na lokálnu AI prakticky nepoužiteľné – zmestí sa do nich len najmenší model (3 miliardy parametrov) a aj ten s obmedzeniami.

Pasca č. 2: Zanedbanie chladenia. Ak používate kartu na dlhodobé behy modelov (napríklad doladenie), generuje obrovské teplo. Bez dostatočného chladenia môže dôjsť k tepelnému škrteniu (throttlingu), ktoré zníži výkon až o 30 %.

Verdikt: Čo si vybrať

Ak začínate a chcete len vyskúšať lokálnu AI, kúpte kartu s 12 GB VRAM – RTX 4070 je dnes najlepší pomer cena/výkon pre tento účel. Ak plánujete serióznu prácu s väčšími modelmi, investujte do 24 GB – RTX 4090 je síce drahá, ale na niekoľko rokov vás pokryje. A ak potrebujete profesionálne nástroje, pripravte sa na náklady od 5 000 € vyššie.

Pamätajte: VRAM je dnes vzácnejšia ako samotný výpočtový výkon. Pri výbere grafickej karty pre lokálnu AI sa najprv pozerajte na kapacitu pamäte, až potom na počet jadier a frekvencie. Ušetríte si tak frustráciu a peniaze.