Čo je mechanizmus pozornosti (attention): Bez neho by ChatGPT neexistoval

Čo je mechanizmus pozornosti (attention): Bez neho by ChatGPT neexistoval

Dávate kolegovi do ruky 300-stranovú knihu a poviete mu: „Zhrň mi, čo je v nej podstatné.“ Bez mechanizmu pozornosti by musel prečítať každé slovo rovnako pozorne a na konci by si nepamätal nič.

Presne to isté robili neurónové siete pred rokom 2017 – a výsledky boli žalostné. Dnes je mechanizmus pozornosti (attention mechanism) dôvod, prečo GPT-4 dokáže napísať báseň, preložiť zmluvu alebo odpovedať na otázku z 50-stránkového dokumentu.

Čo to vlastne je?

Mechanizmus pozornosti je výpočtová technika, ktorá umožňuje modelom umelej inteligencie selektívne sa sústrediť na najdôležitejšie časti vstupných údajov. Namiesto toho, aby AI spracúvala každé slovo rovnako (ako staršie modely), dynamicky prideľuje „váhu pozornosti“ – niektorým slovám venuje 90 % kapacity, iným len 0,5 %.

Ako to funguje? Jednoduchá analógia

Predstavte si, že čítate vetu: „Mačka, ktorá prenasledovala myš, zakopla o kameň.“

Keď sa v ďalšej vete povie „Zdvihla sa a pokračovala ďalej“, váš mozog automaticky vie, že „zdvihla sa“ znamená mačka, nie myš ani kameň. Ako? Pretože podvedome prideľujete pozornosť – slovo „zdvihla“ má silnejšie prepojenie na „mačka“ (ženský rod) než na „myš“ (ženský rod, ale kontext je iný).

Mechanizmus pozornosti v AI robí presne to isté: každému slovu vo vete vypočíta matematickú mieru dôležitosti voči každému inému slovu. Výsledkom je mapa, ktorá hovorí: „Slovo A je silne prepojené so slovom B, slovo C je takmer nepodstatné.“

Prečo to vzniklo? Skrytá kríza starých modelov

Pred príchodom attention (približne do roku 2017) dominovali rekurentné neurónové siete (RNN). Ich problém? S rastúcou dĺžkou textu exponenciálne zabúdali. Pri vete s 50 slovami si ešte pamätali začiatok, pri 200 slovách už nie. Prekladače typu Google Translate (staršia verzia) pri dlhých súvetiach produkovali nezmysly – presne preto.

V roku 2017 prišiel prelomový článok „Attention is All You Need“ od výskumníkov z Googlu. Ukázali, že ak odstránite všetky rekurentné vrstvy a postavíte model čisto na mechanizme pozornosti (tzv. Transformer), dosiahnete o 30 – 50 % lepšiu presnosť pri preklade a zároveň 10 – 100-násobne rýchlejšie trénovanie, pretože výpočty sa dajú paralelizovať.

Konkrétny príklad z praxe

Používate ChatGPT a napíšete: „Vysvetli mi rozdiel medzi dividendovým a rastovým investovaním. Mám 30 rokov a chcem začať investovať 200 € mesačne.“

Bez mechanizmu pozornosti by model videl len zhluk slov. S attention model identifikuje kľúčové vzťahy: - „30 rokov“ → súvisí s „dlhodobý horizont“ → ovplyvňuje odporúčanie - „200 € mesačne“ → súvisí s „pravidelná investícia“ → ovplyvňuje odporúčanie - „dividendové vs rastové“ → hlavná téma

Vďaka tomu odpoveď nie je všeobecná poučka, ale personalizované odporúčanie: „Pri 30 rokoch a pravidelnej investícii 200 € mesačne je pre vás vhodnejšie rastové investovanie, pretože dividendy by ste zdaňovali a za 30 rokov by ste na daniach stratili približne 3 000 €.“

Časté omyly a na čo si dať pozor

Omyl č. 1: „Attention znamená, že AI rozumie textu ako človek.“ Nie. Mechanizmus pozornosti je len matematická funkcia – model nevie, čo slová znamenajú, iba vypočítava štatistické vzťahy medzi nimi. „Rozumie“ len v úvodzovkách.

Omyl č. 2: „Čím viac pozornosti, tým lepšie.“ Opak je pravdou. Príliš veľa vrstiev pozornosti (dnes bežné modely majú 96 vrstiev) vedie k obrovskej výpočtovej náročnosti. GPT-4 potrebuje na jednu odpoveď približne 10 – 50 Wh energie – to je ako 30 minút prevádzky notebooku. Pre každú odpoveď.

Omyl č. 3: „Attention vyriešil všetky problémy AI.“ Nie. Mechanizmus pozornosti je skvelý na text a obrázky, ale zlyháva pri úlohách vyžadujúcich kauzálnu logiku (príčina-následok) alebo plánovanie viacerých krokov dopredu. Na to potrebujete iné techniky (napr. tree-of-thoughts).

Čo si z toho odniesť?

Mechanizmus pozornosti je najdôležitejší vynález v AI od čias hlbokého učenia. Bez neho by neexistoval ChatGPT, Claude, Gemini ani žiadny moderný prekladač. Ak používate akúkoľvek AI na prácu s textom – od sumarizácie e-mailov po analýzu zmlúv – práve attention je dôvod, prečo to funguje.

Praktické odporúčanie: Pri práci s AI sa snažte vstupné texty štruktúrovať. Mechanizmus pozornosti lepšie funguje, ak sú dôležité informácie na začiatku a na konci textu (tzv. efekt primárnosti a recencie). Dlhé, chaotické vstupy s 50 odbočkami výrazne znižujú kvalitu odpovedí – attention sa jednoducho „rozptýli“.

Súvisiace pojmy

  • Transformer – architektúra, ktorá ako prvá postavila celý model čisto na mechanizme pozornosti
  • Self-attention – typ pozornosti, kde model porovnáva každé slovo so všetkými ostatnými v rámci jedného textu
  • Multi-head attention – technika, ktorá používa viacero „hláv“ pozornosti súčasne na zachytenie rôznych typov vzťahov
  • Token – základná jednotka textu (slovo alebo jeho časť), ktorej attention prideľuje váhu

Podrobnejšie články a návody nájdete na ai.ezin.sk.