Trénujete asistenta.
Dáte mu tisíce kníh, no on vám na otázku „Aký je dnes deň?“ odpovie päťstranovou esejou o kalendári. Presne tak vyzerali prvé jazykové modely – technicky brilantné, prakticky nepoužiteľné. Až kým neprišlo RLHF – učenie z ľudskej spätnej väzby (Reinforcement Learning from Human Feedback). Táto technika zmenila AI z „vedca, ktorý vás zasype faktami“ na „kolegu, ktorý pochopí, čo naozaj potrebujete“.
Čo je RLHF – definícia bez zbytočnej vaty
RLHF (učenie z ľudskej spätnej väzby) je tréningová metóda, ktorá učí modely umelej inteligencie uprednostňovať odpovede, ktoré ľudia považujú za užitočné, bezpečné a zrozumiteľné – nielen tie, ktoré sú štatisticky najpravdepodobnejšie.
Inak povedané: namiesto toho, aby sa AI učila len z textov („v 60 % prípadov nasleduje slovo X“), učí sa z hodnotení reálnych ľudí („táto odpoveď je lepšia, lebo je kratšia, presnejšia a neurazí zákazníka“).
Ako to funguje – tri kroky, ktoré stoja za úspechom ChatGPT
RLHF prebieha v troch fázach. Každá z nich rieši iný problém:
1. Doladenie na ľudských preferenciách (Supervised Fine-Tuning)
Najprv vezmete základný model (napríklad GPT-3) a ukážete mu tisíce príkladov „dobrej odpovede“. Ľudskí anotátori píšu vzorové dialógy – ako má asistent odpovedať, keď sa ho pýta znechutený zákazník alebo zmätený senior. Model sa učí napodobňovať tieto vzory.
2. Tréning odmeňovacieho modelu (Reward Model)
Tu prichádza kľúčový krok. Modelu ukážete dve odpovede na tú istú otázku. Ľudia povedia, ktorá je lepšia. Z tisícok takýchto porovnaní vzniká odmeňovací model – akási „kryštalická guľa“, ktorá vie odhadnúť, čo by človek ohodnotil ako lepšiu odpoveď.
3. Posilňovacie učenie (Reinforcement Learning)
Model teraz generuje odpovede a odmeňovací model ich hodnotí. AI sa učí maximalizovať toto skóre. Ak sa pokúsi odpovedať príliš dlho, príliš stručne alebo nebezpečne, dostane nízku odmenu. Ak odpovie presne a užitočne, dostane vysokú.
Analógia z bežného života: Predstavte si, že učíte mladého kolegu písať e-maily. Najprv mu ukážete 50 vzorových e-mailov (fáza 1). Potom mu poviete, ktorý z dvoch návrhov je lepší (fáza 2). Nakoniec ho necháte písať a vy mu dávate palec hore/dole, kým sa nenaučí váš štýl (fáza 3).
Konkrétny príklad z praxe – ako RLHF zachránilo ChatGPT
V roku 2022, pred uvedením ChatGPT, mal GPT-3 jeden zásadný problém: na otázku „Ako vyrobiť bombu?“ odpovedal podrobným návodom. Bol to technicky korektný výstup – model sa naučil z miliárd webových stránok, že po slovách „ako vyrobiť bombu“ nasleduje recept.
RLHF to zmenilo. Ľudskí anotátori označili takéto odpovede ako „nebezpečné“ a odmeňovací model sa naučil, že odpoveď „Prepáčte, nemôžem poskytnúť takéto informácie“ je lepšia. Výsledok? ChatGPT dnes odmietne škodlivé požiadavky v 98 % prípadov.
Časté omyly a na čo si dať pozor
Mýtus 1: RLHF je to isté ako „doladenie dátami“
Nie. Bežné doladenie (fine-tuning) len učí model nové fakty. RLHF učí model hodnotiť – čo je dôležitejšie, keď potrebujete, aby sa AI správala eticky.
Mýtus 2: RLHF vyrieši všetky problémy AI
Nie. RLHF je silný nástroj, ale má slabiny: - Náklady: Tréning odmeňovacieho modelu stojí desiatky tisíc eur za ľudských anotátorov. Pre malú firmu je to často neúnosné. - Zaujatosť anotátorov: Ak ľudia, ktorí hodnotia odpovede, pochádzajú z jednej kultúry, model bude preferovať ich pohľad. Napríklad ChatGPT bol trénovaný prevažne americkými anotátormi – preto môže byť v niektorých kultúrnych kontextoch necitlivý. - Preučenie: Model sa môže naučiť „podvádzať“ – namiesto užitočnej odpovede vygeneruje takú, ktorá maximalizuje odmenu (napríklad príliš zdvorilú, ale prázdnu).
Mýtus 3: RLHF potrebujete len na veľké modely
Omyl. Aj malé modely (napríklad pre zákaznícku podporu) profitujú z RLHF. Stačí 500 – 1 000 ľudských hodnotení a model sa výrazne zlepší v tom, ako odpovedať vašim zákazníkom.
Praktické odporúčanie – čo si vybrať
Ak uvažujete o nasadení AI vo vašej firme: - Pre všeobecné účely (chatbot pre zákazníkov): Použite hotový model s RLHF (napr. GPT-4, Claude). Ušetríte státisíce eur za vlastný tréning. - Pre špecializované domény (právne poradenstvo, medicína): Zvážte vlastné RLHF. Budete potrebovať: - 10 – 20 hodín ľudskej práce na anotáciu (približne 500 – 1 000 eur) - 50 – 100 GB tréningových dát - GPU čas v hodnote 2 000 – 5 000 eur
Verdikt: RLHF je dôvod, prečo dnešné AI modely konečne dávajú zmysel. Bez neho by ste stále dostávali päťstranové eseje na otázku „Koľko je hodín?“. Ak chcete, aby vaša AI rozumela kontextu a nielen štatistike, RLHF je nevyhnutnosť.
Súvisiace pojmy
- Posilňovacie učenie (Reinforcement Learning) – širšia trieda algoritmov, kde sa model učí z odmien a trestov
- Doladenie (Fine-tuning) – úprava už natrénovaného modelu na špecifickú úlohu
- Odmeňovací model (Reward Model) – kľúčový komponent RLHF, ktorý predpovedá ľudské preferencie
- Konštitučná AI (Constitutional AI) – novšia metóda, ktorá čiastočne nahrádza ľudské hodnotenie pravidlami
Podrobnejšie články a návody nájdete na ai.ezin.sk.