Čo je inferencia a čím sa líši od tréningu – kľúčový rozdiel, ktorý vám ušetrí tisíce eur

Čo je inferencia a čím sa líši od tréningu – kľúčový rozdiel, ktorý vám ušetrí tisíce eur

Zaplatíte 50 000 eur za vývoj vlastného AI modelu, no keď ho nasadíte do prevádzky, zistíte, že na každú jednu odpoveď čakáte 30 sekúnd a váš cloudový účet rastie o stovky eur denne.

Práve vtedy pochopíte, že ste si pomýlili dve úplne odlišné fázy: tréning a inferenciu. Tento omyl stojí firmy v priemere 30 – 40 % rozpočtu na AI projekty, ktoré končia v slepej uličke. Poďme sa na to pozrieť tak, aby ste nabudúce vedeli, za čo presne platíte.

Definícia: inferencia je „používanie", tréning je „učenie"

Inferencia (inferencing) je proces, keď už natrénovaný model umelej inteligencie spracúva nové, doteraz nevidené dáta a vytvára výstup – odpoveď, klasifikáciu, preklad alebo obrázok. Tréning (training) je naopak fáza, v ktorej sa model „učí" z obrovského množstva označených dát – upravuje si miliardy váh a parametrov, aby dokázal rozpoznať vzory.

Stručne: tréning je investícia do vedomostí modelu, inferencia je čerpanie z týchto vedomostí v praxi.

Ako to funguje – analógia s kuchárom

Predstavte si šéfkuchára, ktorý sa tri roky učí variť na prestížnej škole (tréning). Prečíta stovky kníh, absolvuje tisíce hodín praxe, urobí milión chýb, kým ovládne techniky. Keď potom príde zákazník a objedná si „hovädzí vývar s knedľou", kuchár ho uvarí za 20 minút (inferencia). Tréning bol drahý, náročný na čas a energiu. Inferencia je rýchla, lacná na jednu porciu, no vyžaduje, aby bol kuchár už vyučený.

V reči AI: tréning modelu GPT-4 stál odhadom 100 – 200 miliónov dolárov a trval mesiace na tisíckach GPU čipov. Jedna inferencia – odpoveď na vašu otázku – stojí zlomky centu a trvá sekundy.

Konkrétny príklad z praxe: chatbot v zákazníckej podpore

Firma ABC nasadí chatbot na spracovanie reklamácií. Najprv musí model natrénovať na 50 000 historických rozhovoroch a interných smerniciach – to je tréning. Stojí 15 000 € za výpočtový čas a 5 000 € za prípravu dát. Hotovo.

Potom chatbot inferuje (používa sa) na 1 000 reklamácií denne. Každá odpoveď je jedna inferencia. Náklady na inferenciu sú pri cloudovom GPU 0,002 € až 0,01 € za odpoveď. Pri 1 000 denných požiadavkách to je 2 – 10 € denne, teda 60 – 300 € mesačne.

Keby ste si pomýlili tieto dve fázy a začali model znovu trénovať pri každej zmene pravidiel (namiesto jednoduchšieho doladenia – fine-tuningu), minuli by ste mesačne tisíce eur na GPU čas, ktorý by ste pritom vôbec nepotrebovali.

Časté omyly a na čo si dať pozor

1. Inferencia nie je to isté ako tréning, ani keď model „dokončuje" vetu. Mnoho ľudí si myslí, že keď ChatGPT generuje text, „učí sa" z ich otázky. Nie je to pravda. Model iba aplikuje to, čo sa naučil počas tréningu. Vaša otázka je len vstup, nie tréningová dátová vzorka.

2. Cena inferencie rastie s veľkosťou modelu. Malý model s 1 miliardou parametrov (napr. Phi-3) stojí na inferenciu približne 0,0001 € za token (slovo). Obrovský model so 70 miliardami (napr. Llama 3 70B) stojí 0,005 – 0,01 € za token – 50 až 100-krát viac. Preto sa pri veľkom objeme požiadaviek oplatí zvoliť menší, špecializovaný model.

3. Skryté náklady na inferenciu nie sú len za GPU. Každá inferencia spotrebúva energiu, chladenie, sieťovú prevádzku a úložisko. Pri 10 000 denných inferenciách na stredne veľkom modeli to mesačne predstavuje 150 – 300 € len za elektrinu a infraštruktúru. Ak používate API veľkých poskytovateľov, tieto náklady sú už zahrnuté v cene za token.

4. Inferencia môže byť pomalšia, než čakáte. Tréning beží dávkovo (batch processing) – spracúva tisíce vzoriek naraz. Inferencia je často sekvenčná (jeden vstup po druhom), najmä pri generovaní textu. Preto aj na výkonnom GPU môže odpoveď trvať 5 – 15 sekúnd, ak model generuje dlhý text.

Kedy investovať do tréningu a kedy do inferencie?

Fáza Kedy investovať Typický rozpočet
Tréning Raz za 6 – 12 mesiacov (nový model, zmena domény) 5 000 – 200 000 €
Inferencia Každý deň (prevádzka, zákazníci) 50 – 5 000 € mesačne
Doladenie (fine-tuning) Raz za mesiac (úprava na špecifickú úlohu) 500 – 5 000 €

Ak váš model beží v produkcii a máte tisíce požiadaviek denne, optimalizácia inferencie (napr. kvantizácia, pruning, nasadenie na menšom modeli) ušetrí 60 – 80 % mesačných nákladov. Naopak, ak model neustále trénujete odznova, míňate peniaze na niečo, čo by stačilo doladiť.

Verdikt: čo si vybrať?

Pre väčšinu firiem platí: investujte 80 % rozpočtu do kvalitného tréningu alebo kúpy už natrénovaného modelu (napr. GPT-4, Claude, Gemini) a 20 % do efektívnej inferencie. Ak riešite špecializovanú úlohu (napr. klasifikáciu faktúr), zvoľte malý model, ktorý natrénujete na vlastných dátach – inferencia bude lacná a rýchla. Ak potrebujete generovať kreatívny text, siahnite po veľkom modeli a optimalizujte inferenciu kvantizáciou (znížením presnosti čísel) alebo použitím špecializovaných inferenčných serverov (napr. vLLM, TensorRT).

Pamätajte: tréning je raz, inferencia je stále. Ak si pomýlite tieto dve fázy, zaplatíte za to každý mesiac.

Súvisiace pojmy

  • Doladenie (fine-tuning) – úprava už natrénovaného modelu na špecifickú úlohu, lacnejšie ako tréning od nuly
  • Kvantizácia (quantization) – zmenšenie modelu znížením presnosti váh, čím sa zrýchli inferencia a znížia náklady
  • Latencia (latency) – čas odozvy modelu pri inferencii, kritický parameter pre real-time aplikácie
  • Batch inferencia (batch inference) – spracovanie viacerých vstupov naraz na zníženie nákladov na jednu inferenciu

Podrobnejšie články a návody nájdete na ai.ezin.sk.