Predstavte si, že trénujete svojho psíka na povel „sadni“ a každý piaty raz mu zaň dáte elektrošok.
Pes sa naučí báť, nie poslúchať. Presne toto sa deje pri otrave dát (data poisoning) – niekto zámerne skazí tréningové dáta tak, aby sa AI naučila niečo úplne iné, než zamýšľate.
Definícia
Data poisoning (otrava dát) je kybernetický útok, pri ktorom útočník zámerne vkladá, upravuje alebo maže tréningové dáta modelu umelej inteligencie tak, aby model po natrénovaní produkoval chybné, škodlivé alebo vopred určené výstupy.
Nejde o náhodnú chybu v dátach – ide o cielenú sabotáž, ktorej cieľom je ovplyvniť správanie AI bez toho, aby si to správca systému všimol.
Ako to funguje a prečo to vzniklo
Otrava dát je možná vďaka základnému princípu strojového učenia: model sa učí z príkladov, ktoré mu dáte. Ak mu dáte dosť zmanipulovaných príkladov, model sa naučí správanie, ktoré ste nechceli.
Analógia z bežného života: Učíte cudzinca po slovensky. Každý piaty raz, keď poviete „dobrý deň“, mu zámerne poviete, že to znamená „zbohom“. Po čase začne zdraviť ľudí slovom „zbohom“ – a vy vyzeráte hlúpo. Útočník urobí to isté s vašou AI.
Útoky na otravu dát vznikli prirodzene s tým, ako sa AI modely začali trénovať na verejne dostupných dátach z internetu. Kým pri malých firemných datasetoch viete dáta skontrolovať ručne, pri miliardách záznamov z webu je to nemožné. A práve túto slepú škvrnu útočníci využívajú.
Rozlišujeme dva hlavné typy útoku:
-
Cielená otrava (targeted poisoning): Útočník chce, aby model zlyhal v konkrétnej situácii. Napríklad, aby systém na rozpoznávanie tvárí nikdy nespoznal konkrétneho človeka.
-
Zadné vrátka (backdoor poisoning): Útočník vloží do modelu „skrytý spúšťač“ – špecifický vzor v dátach (napríklad žltý bod v rohu fotky), ktorý keď sa objaví, model vykoná vopred určenú akciu. Inak funguje normálne.
Konkrétny príklad z praxe
Prípad 1: Microsoft Tay (2016) Microsoft spustil chatbota Tay na Twitteri. Do 24 hodín ho používatelia naučili rasistické a sexistické výroky. Tay nebola napadnutá priamo – používatelia jej jednoducho poskytli otrávené tréningové dáta v reálnom čase. Microsoft musel bota vypnúť.
Príklad 2: Model na triedenie obrázkov Predstavte si, že trénujete AI na rozpoznávanie dopravných značiek. Útočník vloží do datasetu 100 fotiek značky STOP, na ktorej je v rohu nalepená malá biela nálepka. Model sa naučí, že značka s nálepkou znamená „dávaj prednosť“. Keď potom útočník nalepí nálepku na skutočnú značku STOP, autonómne auto ju nesprávne vyhodnotí.
Reálne čísla: Podľa výskumu z roku 2023 stačí otráviť len 0,1 % tréningových dát, aby model začal produkovať chybné výstupy v 90 % prípadov, ak je útok dobre navrhnutý. Pri modeloch s miliardami parametrov to znamená, že útočník potrebuje skaziť len niekoľko tisíc záznamov z miliónov.
Časté omyly a na čo si dať pozor
Omyl 1: „Otrava dát sa týka len veľkých modelov ako GPT“ Nie. Otrava ohrozuje akýkoľvek model, ktorý sa učí z externých dát – od malého firemného chatbota až po systém na predikciu cien. Čím menej kontrolujete vstupné dáta, tým ste zraniteľnejší.
Omyl 2: „Kontrola dát na vstupe problém vyrieši“ Kontrola pomôže, ale nie je stopercentná. Útočníci vkladajú otrávené vzory tak, aby vyzerali ako normálne dáta. Napríklad fotka s jemnou zmenou farby, ktorú ľudské oko nepostrehne, ale model ju interpretuje úplne inak.
Omyl 3: „Keď model funguje dobre, otrava sa nestala“ Práve naopak. Pri útoku so zadnými vrátkami model funguje perfektne – až kým útočník neaktivuje skrytý spúšťač. Model môže byť otrávený celé mesiace bez akéhokoľvek prejavu.
Na čo si dať pozor v praxi: - Nikdy netrénujte model na verejne dostupných dátach bez dôkladnej filtrácie a validácie. - Ak používate verejné datasety, overte si ich pôvod a reputáciu zdroja. - Pri modeloch, ktoré sa učia v reálnom čase (napríklad chatboty), implementujte mechanizmus na spätné overenie a ručné schvaľovanie tréningových príkladov. - Pravidelne testujte model na „hraničných prípadoch“ – zámerne mu dávajte podozrivé vstupy a sledujte, či sa nespráva nečakane.
Verdikt a odporúčanie
Data poisoning nie je teoretická hrozba – je to reálny útok, ktorý sa už stal a bude sa diať čoraz častejšie, ako bude pribúdať AI modelov trénovaných na verejných dátach. Pre firmu, ktorá nasadzuje AI do produkcie, je prevencia proti otrave dát rovnako dôležitá ako antivírus na počítači.
Čo si vybrať: - Pre malé projekty: používajte výhradne vlastné, ručne overené dáta. - Pre stredné projekty: implementujte automatickú detekciu anomálií v tréningových dátach (napríklad nástroje ako TensorFlow Data Validation). - Pre veľké projekty: investujte do dedikovaného tímu na bezpečnosť AI, ktorý bude pravidelne auditovať tréningové dáta a testovať model na odolnosť voči otrave.
Základné pravidlo: dôverujte svojim dátam rovnako málo, ako dôverujete cudziemu človeku na ulici. Overujte, filtrujte, testujte. Inak vám niekto otrávi to najcennejšie, čo máte – dáta, na ktorých stojí vaša AI.
Súvisiace pojmy
- Adversarial attack (nepriateľský útok) – útok na už natrénovaný model pomocou špecificky upravených vstupov
- Model poisoning (otrava modelu) – širší pojem zahŕňajúci aj priame úpravy modelu počas tréningu
- Backdoor attack (útok so zadnými vrátkami) – špecifický typ otravy, ktorý aktivuje skryté správanie modelu
- Data integrity (integrita dát) – princíp zabezpečenia, že dáta neboli neoprávnene zmenené
Podrobnejšie články a návody nájdete na ai.ezin.sk.