Čo je LLM — veľký jazykový model po slovensky

Čo je LLM — veľký jazykový model po slovensky

Zadáte do chatbota otázku o vlastnostiach zmluvy a on vám odpovie úplne zlým paragrafom.

Alebo napíšete e-mail kolegovi a AI navrhne vetu, ktorá znie, akoby ju písal človek z 19. storočia. Presne vtedy narazíte na hranice veľkých jazykových modelov (Large Language Models, LLM). LLM je typ umelej inteligencie, ktorý sa učí z obrovského množstva textu a dokáže generovať, sumarizovať, prekladať alebo analyzovať ľudskú reč tak, že jeho výstup často neodlíšite od ľudského – no nie vždy.

Ako LLM funguje – mechanizmus za textom

Veľký jazykový model je v podstate obrovská neurónová sieť trénovaná na miliardách slov z kníh, webových stránok, článkov a dokumentov. Jeho princíp je prekvapivo jednoduchý: predpovedá, ktoré slovo bude nasledovať po predchádzajúcich. Keď napíšete „Bratislava je hlavné…“, model vďaka štatistickým vzorcom z tréningových dát s vysokou pravdepodobnosťou dosadí „mesto“. Tento proces sa opakuje slovo po slove, až kým nedostanete celú odpoveď.

Analógia z bežného života: Predstavte si, že máte obrovskú knižnicu všetkých kníh, ktoré kedy boli napísané. LLM je ako knihovník, ktorý si zapamätal, aké slová sa najčastejšie vyskytujú spolu. Keď sa ho spýtate „Čo je to gravitácia?“, on si rýchlo „prelistuje“ v pamäti tisíce pasáží o fyzike a poskladá odpoveď z najpravdepodobnejších slovných spojení.

Konkrétny príklad z praxe: Používate ChatGPT na napísanie reklamného textu pre svoju firmu. Zadáte: „Napíš krátky popis ručne vyrábaného medu z Liptova.“ Model analyzuje milióny podobných textov z tréningových dát a vygeneruje plynulý opis. Výstup bude gramaticky správny a štylisticky na úrovni – ale vôbec nemusí vedieť, že váš med je z konkrétneho včelína v Kvačanoch. LLM totiž nerozumie realite, iba štatistike slov.

Na čo si dať pozor – časté omyly a pasce

LLM nie je inteligentný v ľudskom zmysle. Nerozumie svetu, necíti emócie a nemá vlastný názor. Jeho najväčšou slabinou je halucinovanie – vymýšľanie si faktov, ktoré znejú presvedčivo, ale sú nepravdivé. Napríklad keď sa opýtate na historickú udalosť, model môže s istotou uviesť nesprávny rok alebo meno, pretože také spojenie slov bolo v tréningových dátach časté.

Druhým problémom je neaktuálnosť. Väčšina LLM je trénovaná na dátach starých niekoľko mesiacov až rokov. Ak sa spýtate na aktuálnu cenu nehnuteľností v Bratislave, dostanete odpoveď založenú na minuloročných trendoch.

Tretím rizikom je zaujatosť (bias). Model preberá predsudky z tréningových dát – ak boli knihy písané prevažne mužmi, model bude častejšie používať mužské tvary pri povolaniach, aj keď to nie je žiaduce.

Prečo na LLM záleží – reálne čísla a porovnania

Trh s LLM explodoval. GPT-4 od OpenAI má približne 1,7 bilióna parametrov (prepojení v neurónovej sieti) a jeho tréning stál odhadom 100 miliónov dolárov. Pre porovnanie: GPT-3 mal 175 miliárd parametrov. Každá nová verzia je rádovo väčšia a presnejšia, no aj náročnejšia na výpočtový výkon.

Ceny za používanie LLM cez API (aplikačné programové rozhranie) sa pohybujú od 0,01 € za milión tokenov (približne 750 000 slov) pri menších modeloch až po 0,10 € pri GPT-4. Pre bežného používateľa je to lacné, pre firmu spracúvajúcu milióny dotazov mesačne to môže byť tisíce eur.

Konkrétne odporúčanie: Ak potrebujete LLM na písanie textov, zvoľte menší a lacnejší model ako GPT-3.5 alebo Claude 3 Haiku. Na analýzu právnych dokumentov alebo vedeckých článkov siahnite po GPT-4 alebo Claude 3 Opus – sú presnejšie, no drahšie. Na slovenský jazyk je vhodný aj model Mistral, ktorý bol čiastočne trénovaný na slovanských jazykoch.

Ako si vybrať správny LLM – praktický verdikt

Na trhu sú desiatky modelov: GPT-4, Claude 3, Gemini, Llama 3, Mistral. Rozhodujúce kritériá:

  1. Presnosť – GPT-4 a Claude 3 Opus sú najpresnejšie, ale aj najdrahšie.
  2. Rýchlosť – menšie modely (Gemini Flash, Mistral 7B) odpovedajú v sekundách, veľké v desiatkach sekúnd.
  3. Cena – pre domáce použitie stačí bezplatná verzia ChatGPT alebo Gemini. Pre firmu zvážte API s platbou za spotrebu.
  4. Jazyk – slovenský jazyk podporujú všetky veľké modely, no kvalita klesá pri špecifických odborných termínoch. Vyskúšajte si model na konkrétnej úlohe pred kúpou.

Verdikt: Pre bežného používateľa je ideálny pomer ceny a výkonu pri GPT-3.5 (zadarmo cez ChatGPT) alebo Gemini (zadarmo od Googlu). Pre profesionálne využitie investujte do GPT-4 alebo Claude 3 Opus. Vyhnite sa modelom tretích strán, ktoré sľubujú „rovnakú kvalitu za zlomok ceny“ – spravidla ide o oklieštené verzie so slabšou presnosťou.

Súvisiace pojmy

  • Tokenizácia – proces rozdeľovania textu na malé jednotky (tokeny), ktorým model rozumie
  • Tréningová dátová sada – miliardy slov, na ktorých sa model učí
  • Inferencia – proces, keď model generuje odpoveď na váš dotaz
  • Jemné doladenie (fine-tuning) – prispôsobenie modelu konkrétnej úlohe (napr. právnemu textu)

Podrobnejšie články a návody nájdete na ai.ezin.sk.