Zadáte AI pokyn: „Opíš mi tento obrázok, prelož text z neho do nemčiny a nahraj mi k tomu zvukový záznam.“ Klasický jazykový model (LLM) zlyhá – nevidí, nepočuje, nerozumie obrázkom.
Práve tu prichádza na scénu multimodálny model. Multimodálny model je typ umelej inteligencie, ktorý dokáže spracovávať a kombinovať viacero typov dát súčasne – text, obraz, zvuk, video aj číselné údaje – a na základe nich generovať odpovede v rôznych formátoch.
Ako to funguje a prečo to vzniklo
Klasické AI modely boli jednostranné. Jazykové modely (ako GPT-3) rozumeli len textu. Modely na rozpoznávanie obrazu (ako ResNet) zase len fotkám. Multimodálne modely spájajú tieto svety do jedného „univerzálneho prekladača“.
Analógia z bežného života: Predstavte si tlmočníka, ktorý ovláda nielen jazyky, ale aj reč tela, intonáciu hlasu a kultúrne kontexty. Keby ste mu len povedali „je mi smutno“, preloží to doslovne. Ale ak mu ukážete fotografiu, na ktorej plačete, a poviete to so zlomeným hlasom, pochopí, že nejde o bežný smútok, ale o hlbokú stratu. Multimodálny model robí presne to – kombinuje vizuálne, zvukové a textové signály na presnejšie pochopenie situácie.
Technicky to funguje tak, že model má viacero „vstupných brán“ (encoderov), každú špecializovanú na jeden typ dát. Tieto vstupy sa potom v takzvanej „fúznej vrstve“ (fusion layer) prepoja a model sa učí, ako spolu súvisia. Napríklad, keď vidí obrázok psa a súčasne počuje štekot, naučí sa, že tieto dva signály patria k sebe.
Konkrétny príklad z praxe
Príklad 1: Diagnostika v medicíne Multimodálny model GPT-4V (verzia s videním) dokáže analyzovať röntgenový snímok pľúc a súčasne prečítať text v lekárskej správe pacienta. Výsledok? Vie prepojiť obraz s textom a upozorniť na nezrovnalosti medzi nimi. Diagnózu však nestanovuje — všeobecné modely ako GPT-4V nie sú schválené zdravotnícke pomôcky. Vysokú presnosť na röntgenoch dosahujú špecializované modely trénované na medicínskych dátach a certifikované na daný účel, nie univerzálny chatbot s videním. Pre porovnanie, samotný textový model by mal len 60 – 70 % presnosť, pretože by mu chýbal vizuálny kontext.
Príklad 2: Automatický popis videa Model ako Gemini od Googlu alebo Claude 3.5 Sonnet od Anthropicu dokáže pozrieť 10-minútové video z bezpečnostnej kamery a v reálnom čase popísať, čo sa deje: „O 14:32 vchádza muž v modrej bunde, o 14:35 odomyká dvere kancelárie č. 12, o 14:38 odnáša laptop.“ To je niečo, čo žiadny textový model sám o sebe nedokáže.
Príklad 3: Tvorba obsahu Ak poviete modelu Midjourney (multimodálny generátor obrázkov so schopnosťou čítať text): „Nakresli logo pre kaviareň, ktoré obsahuje slovo ‚Espresso‘ v štýle art deco, s kávovou zrnkou a teplými farbami,“ vygeneruje presne to – vrátane textu na obrázku, čo staršie modely (napr. DALL-E 2) nevedeli.
Časté omyly a na čo si dať pozor
Mýtus 1: Multimodálny model je len „väčší“ jazykový model Omyl. Multimodálny model vyžaduje úplne inú architektúru. Kým jazykový model má miliardy parametrov len na text, multimodálny ich potrebuje aj na obraz a zvuk. To znamená výrazne vyššie náklady na trénovanie (odhaduje sa 10 – 50 miliónov eur za jeden model, v závislosti od veľkosti) a aj na prevádzku (jedna odpoveď s obrázkom môže stáť 0,05 – 0,50 € oproti 0,001 € za čistý text).
Mýtus 2: Rozumie všetkému, čo vidí Nie. Modely majú problémy s abstraktnými konceptmi, iróniou v obrázkoch (napr. karikatúry) a s textom, ktorý je v obrázku malý, skreslený alebo v inom jazyku, než bol trénovaný. Testy ukazujú, že GPT-4V má pri čítaní textu z fotiek (OCR) presnosť len okolo 85 – 90 %, zatiaľ čo špecializované nástroje (napr. Tesseract) dosahujú 95 – 99 %.
Pasca na používateľa: Skryté náklady Mnoho firiem ponúka multimodálne API (rozhranie na programovanie aplikácií) s lákavými cenami za „token“, no zabúdajú spomenúť, že obrázok s rozlíšením 1024×1024 pixelov sa počíta ako 200 – 500 tokenov (v závislosti od poskytovateľa). Jeden jednoduchý dotaz s obrázkom vás tak môže stáť 0,10 – 0,50 €, kým textový dotaz stojí 0,001 €. Pri stovkách dotazov denne to robí tisíce eur mesačne.
Čo si vybrať?
Pre bežného používateľa: Ak potrebujete občas analyzovať fotku alebo vygenerovať obrázok, vystačíte si s GPT-4 (verzia s videním) za 20 € mesačne alebo s Gemini Advanced za 22 € mesačne. Oba ponúkajú multimodálne funkcie v predplatnom.
Pre firmu (vývojárov): Zvážte, či skutočne potrebujete multimodálny model. Ak riešite len text (napr. chatbot na zákaznícku podporu), vyjde vás to o 80 – 90 % lacnejšie s čistým LLM (napr. GPT-3.5 Turbo). Ak však potrebujete spracovávať faktúry (text + obrázok), analyzovať videá z kamier alebo vytvárať interaktívne návody, multimodálny model je nevyhnutný.
Verdikt: Multimodálne modely sú budúcnosťou AI, no dnes sú ešte drahé a nedokonalé. Ak ich chcete nasadiť do produkcie, počítajte s tým, že 20 – 30 % odpovedí bude chybných a budete potrebovať ľudskú kontrolu. Pre osobné experimentovanie sú však fascinujúce – vyskúšajte si napríklad nahrať fotku jedla do GPT-4V a opýtať sa na recept. Výsledok vás prekvapí.
Súvisiace pojmy
- Veľký jazykový model (LLM) – základná textová AI, ktorá nevidí ani nepočuje
- Počítačové videnie (computer vision) – technológia na rozpoznávanie obrázkov, často súčasť multimodálnych modelov
- Fúzia dát (data fusion) – proces, ktorým model spája informácie z rôznych zdrojov
- Generatívna AI – nadradená kategória, do ktorej multimodálne modely patria
Podrobnejšie články a návody nájdete na ai.ezin.sk.