Diktujete asistentovi celú knihu – a on si na konci pamätá iba poslednú vetu.
Presne to sa deje, keď pracujete s umelou inteligenciou, ktorej dochádza miesto v kontextovom okne. Tento zdanlivo technický detail rozhoduje o tom, či vám AI napíše súvislý článok, alebo začne od polovice blúzniť.
Čo je kontextové okno
Kontextové okno (context window) je maximálny počet tokenov (slov, častí slov alebo znakov), ktoré si jazykový model dokáže naraz „zapamätať“ pri spracúvaní jedného dotazu. Ak prekročíte túto hranicu, model jednoducho „zabudne“ staršiu časť konverzácie. Nejde o pamäť v ľudskom zmysle – model si neukladá nič, čo sa do okna nezmestí.
Ako to funguje – analógia s kuchárom
Predstavte si kuchára, ktorý varí podľa receptu. Jeho pracovný stôl je kontextové okno. Ak je stôl malý, zmestí sa naň len päť surovín. Keď prinesiete ďalšie, staré musí odložiť. Recept, ktorý vyžaduje dvadsať ingrediencií, jednoducho neuvarí – alebo ho uvarí zle, lebo polovicu zabudol.
Presne to isté platí pre AI: čím dlhší je váš dokument alebo história konverzácie, tým viac miesta zaberá. Keď sa minie kapacita, model „zabúda“ začiatok.
Reálne čísla, ktoré vás môžu zaskočiť
Dnešné modely majú výrazne odlišné veľkosti kontextového okna:
- GPT-4 (štandardný): 8 192 tokenov (približne 6 000 slov)
- GPT-4 Turbo: 128 000 tokenov (približne 96 000 slov)
- Claude 3 Opus: 200 000 tokenov (približne 150 000 slov)
- Gemini 1.5 Pro: až 1 000 000 tokenov (približne 750 000 slov)
Jeden token predstavuje približne 0,75 slova v angličtine, v slovenčine o niečo menej. Cena za vstup aj výstup rastie priamo úmerne s dĺžkou – spracovanie 100 000 tokenov v GPT-4 Turbo stojí približne 0,30 €, čo sa pri častejšom používaní rýchlo nahromadí.
Prečo na ňom záleží – konkrétny príklad z praxe
Pracujete na analýze 50-stranovej zmluvy. Bez dostatočného kontextového okna model: 1. Prečíta prvých 20 strán a na 21. „zabudne“ začiatok. 2. Na otázku „Čo hovorí bod 3.2 o zodpovednosti?“ odpovie nepresne, lebo si pamätá len posledné strany. 3. Výsledok: musíte rozdeliť dokument na časti a manuálne spájať odpovede.
S modelom s 200 000 tokenmi (napr. Claude 3) vložíte celú zmluvu naraz a dostanete súvislú odpoveď. Rozdiel nie je v kvalite modelu, ale v kapacite jeho „stola“.
Časté omyly a na čo si dať pozor
Omyl 1: „Väčšie okno = vždy lepšie“ Nie vždy. Dlhší kontext znamená vyššiu cenu a pomalšie spracovanie. Pre bežné úlohy (krátke e-maily, jednoduché otázky) stačí 8 000 tokenov. Pre analýzu kníh alebo audit zmlúv potrebujete 100 000+.
Omyl 2: „Model si pamätá všetko z okna“ Výskumy ukazujú, že modely majú problém s informáciami v strede dlhého kontextu – efekt „strateného stredu“. Dôležité dáta radšej umiestnite na začiatok alebo koniec okna.
Omyl 3: „Kontextové okno je to isté ako pamäť“ Nie je. Po skončení konverzácie model všetko zabudne. Ak potrebujete dlhodobú pamäť, musíte použiť externé úložisko (databázu, RAG systém).
Skryté náklady, ktoré vás môžu prekvapiť
Pri modeloch ako GPT-4 Turbo platíte za každý token v kontextovom okne, aj keď ho nevyužijete. Ak máte model s 128 000 tokenmi a vložíte doň 10 000 tokenov, zaplatíte len za 10 000. Ale ak model interne používa 128 000 tokenov (napr. pri generovaní), cena sa násobí.
Priemerná cena za spracovanie 50-stranovej zmluvy: - GPT-4 Turbo: ~0,30 € - Claude 3 Opus: ~0,60 € - Gemini 1.5 Pro: ~0,15 € (vďaka nižšej cene za token)
Čo si vybrať – jednoznačný verdikt
Pre bežnú prácu s AI (písanie textov, odpovedanie na otázky, sumarizácia krátkych dokumentov) vám postačí model s 8 000 – 32 000 tokenmi. Pre profesionálne použitie – právne analýzy, vedecké práce, vývoj softvéru s rozsiahlou dokumentáciou – siahnite po modeli s minimálne 100 000 tokenmi.
Odporúčame: Ak pracujete s dlhými textami, začnite s Claude 3 Opus (200 000 tokenov) alebo Gemini 1.5 Pro (1 000 000 tokenov). Pre krátke úlohy ostaňte pri GPT-4 Turbo – ušetríte peniaze aj čas.
Kontextové okno nie je technický detail, ale kľúčový parameter, ktorý určuje, či vám AI bude rozumieť od začiatku do konca, alebo sa stratí v polovici vety. Vyberajte podľa svojich potrieb, nie podľa humbuku.
Súvisiace pojmy
- Token: Základná jednotka, ktorú model spracúva – približne 0,75 slova
- RAG (Retrieval-Augmented Generation): Technika, ktorá rozširuje kontextové okno o externú databázu
- Pozornosť (attention): Mechanizmus, ktorý modelu umožňuje „sústrediť sa“ na rôzne časti kontextu
- LLM (Large Language Model): Veľký jazykový model – samotný „mozog“ AI
Podrobnejšie články a návody nájdete na ai.ezin.sk.