Položili ste ChatGPT otázku o internom firemnom manuáli a on vám vyplul všeobecnú poučku z internetu, ktorá sa vášho prípadu ani zďaleka netýka.
Presne tento problém rieši technika RAG – a v tomto článku sa dozviete, ako funguje, kedy ju naozaj potrebujete a aké pasce na vás číhajú.
Definícia – čo RAG vlastne je
RAG (Retrieval-Augmented Generation) je technika, ktorá umožňuje veľkému jazykovému modelu (LLM) odpovedať na základe vašich vlastných dokumentov, nie len z toho, čo sa naučil počas tréningu. Namiesto toho, aby sa AI spoliehala na svoje „naučené“ vedomosti, najprv si vyhľadá relevantné informácie vo vašej databáze (napr. v PDF, databázach alebo interných wikoch) a až potom na ich základe vygeneruje odpoveď. Výsledok? Odpovede, ktoré sú presné, aktuálne a šité na mieru vášmu kontextu.
Ako to funguje – analógia s knihovníkom
Predstavte si, že prídete do knižnice a spýtate sa knihovníka: „Aký je postup reklamácie podľa nášho interného manuálu z roku 2024?“ Keby knihovník odpovedal spamäti, riskujete, že si pomýli staré a nové pravidlá. RAG funguje tak, že knihovník najprv zájde do regála, nájde presne tú stranu v manuáli, ktorá hovorí o reklamáciách, prečíta si ju a až potom vám odpovie. Technicky povedané: model dostane vašu otázku, prehľadá vektorovú databázu (kde sú vaše dokumenty uložené ako číselné reprezentácie – tzv. embeddingy), vyberie najrelevantnejšie časti a tie vloží do kontextu pre generovanie odpovede.
Prečo RAG vznikol a kedy ho potrebujete
Veľké jazykové modely majú dva zásadné problémy: 1. Zastaranosť vedomostí – model GPT-4 má znalosti orezané k určitému dátumu (napr. január 2024). Ak sa vaša firemná politika zmenila v marci, model o tom nevie. 2. Halucinácie – model si vymýšľa fakty, keď si nie je istý. Pri odpovediach z interných dokumentov je to neprípustné.
RAG rieši oboje: odpovede sú aktuálne (lebo čerpá z vašich čerstvých dokumentov) a presné (lebo model necituje spamäti, ale priamo z textu, ktorý mu dodáte).
Kedy RAG naozaj potrebujete? - Firemné chatboty pre zákaznícku podporu (odpovede podľa aktuálneho cenníka a manuálov) - Interní AI asistenti pre HR, IT alebo právne oddelenie (rýchle vyhľadávanie v smerniciach) - Vzdelávacie platformy, ktoré odpovedajú podľa konkrétnych učebníc - Právne a medicínske aplikácie, kde je presnosť kľúčová
Konkrétny príklad z praxe
Predstavte si stredne veľkú firmu s 200 zamestnancami, ktorá má interný portál s 500 stranami smerníc, benefitov a postupov. Zamestnanec sa pýta: „Ako si môžem uplatniť príspevok na športové aktivity?“
Bez RAG: AI odpovie všeobecne: „Zvyčajne sa príspevok uplatňuje cez mzdovú učtáreň, odporúčam kontaktovať HR.“ – to je málo a možno aj nepresné.
S RAG: AI prehľadá interný dokument „Benefity 2024“, nájde presnú vetu: „Príspevok na športové aktivity vo výške 200 € ročne si uplatníte zaslaním dokladu na
Výsledok: zamestnanec dostane presnú, overiteľnú odpoveď za 5 sekúnd namiesto polhodinového hľadania.
Časté omyly a na čo si dať pozor
1. RAG nie je trénovanie modelu Mnoho ľudí si myslí, že RAG je forma doladenia (fine-tuning). Omyl. Pri RAG model nepreučujete, len mu dočasne poskytnete kontext z dokumentov. Je to oveľa lacnejšie a rýchlejšie – žiadne GPU hodiny, len kvalitná databáza.
2. Kvalita vstupných dokumentov je kritická Ak do RAG systému nahráte chaotické, neštruktúrované PDF s chybami, AI vám vyberie aj chybné časti. Platí: čo dáte do databázy, to dostanete von. Odporúčame dokumenty pred nahratím vyčistiť – odstrániť duplicity, zjednotiť formátovanie a pridať metadáta (názov, dátum, verzia).
3. Nie je to samospasiteľné riešenie RAG výrazne znižuje halucinácie, ale nevylučuje ich úplne. Ak model vyberie irelevantný dokument (napr. starú verziu smernice), odpoveď bude chybná. Preto je dôležité: - Pravidelne aktualizovať databázu - Používať kvalitné embeddingy (napr. od OpenAI alebo Cohere) - Monitorovať, na ktoré dokumenty sa model odvoláva
4. Skryté náklady na prevádzku RAG nie je len o jednorazovom nasadení. Potrebujete: - Vektorovú databázu (napr. Pinecone, Weaviate, Qdrant) – mesačne od 50 € do stoviek € podľa objemu - Embedding model (jednorazovo za spracovanie dokumentov, prípadne opakovane pri aktualizáciách) - LLM API (napr. GPT-4 stojí ~0,03 € za 1000 tokenov – pri častom používaní to rýchlo narastie) - Údržbu a čistenie dokumentov (pokiaľ nemáte automatizáciu, ide o prácu človeka)
Pre malú firmu s 50 zamestnancami a 100 dokumentmi sa mesačné náklady pohybujú okolo 100 – 200 €. Pre väčšie nasadenia (tisíce dokumentov, vysoká frekvencia otázok) rátajte s 500 – 2000 € mesačne.
Verdikt – kedy si RAG vybrať a kedy radšej nie
Zvoľte RAG, ak: - Potrebujete, aby AI odpovedala podľa aktuálnych a špecifických dokumentov (firemné manuály, právne predpisy, produktové katalógy) - Chcete rýchle nasadenie bez náročného trénovania modelu - Máte rozumný objem dokumentov (stovky až desaťtisíce strán) a viete ich udržiavať v čistote
Radšej zvážte iné riešenie, ak: - Potrebujete, aby AI rozumela komplexným vzťahom medzi dokumentmi (RAG funguje na vyhľadávaní, nie na hlbokom porozumení) - Máte obrovský objem neštruktúrovaných dát (milióny strán) – vtedy je lacnejšie doladiť model (fine-tuning) - Chcete, aby AI odpovedala tvorivo a nie len citovala – RAG je skôr na presné informácie, nie na kreatívne úlohy
Stručne: RAG je ideálny nástroj pre firemné chatboty a interných asistentov, ktoré potrebujú presné, aktuálne a overiteľné odpovede z vašich dokumentov. Nie je to univerzálne riešenie na všetko – ak potrebujete kreatívne písanie alebo hlboké pochopenie kontextu, siahnite po doladení modelu. V praxi sa však tieto techniky často kombinujú: RAG na presné informácie a doladenie na štýl a správanie.
Súvisiace pojmy
- Vektorová databáza – úložisko, kde sú dokumenty uložené ako číselné vektory, čo umožňuje rýchle vyhľadávanie podľa významovej podobnosti
- Embeddingy (vektorové reprezentácie) – spôsob, ako previesť text na čísla, ktorým počítač rozumie; kľúčová súčasť RAG
- Fine-tuning (doladenie) – technika, pri ktorej model preučujete na vlastných dátach; na rozdiel od RAG meníte samotný model, nie len kontext
- Halucinácie AI – situácia, keď model generuje zdanlivo pravdivé, ale v skutočnosti vymyslené informácie
Podrobnejšie články a návody nájdete na ai.ezin.sk.