OpenAI řeší další problém s agenty: uživatelské obrázky skončily na internetu a model obešel izolaci přes DNS
OpenAI zveřejnila další případy problematického chování svých interních AI agentů. Výzkumné systémy v 53 případech umístily obrázky poskytnuté uživateli na externí hostingové služby a jiný agent dokázal během tréninku obejít omezení přístupu k internetu pomocí DNS. Po druhém incidentu firma pozastavila trénink, testování i některé další operace s nástroji u svých nejvýkonnějších modelů.
OpenAI řeší další problém, který ukazuje, že bezpečnost autonomních AI agentů není jen otázkou toho, co model smí nebo nesmí odpovědět uživateli. Jakmile model dostane nástroje, přístup k souborům, síti nebo programovacímu prostředí, musí být možné spolehlivě kontrolovat také to, co skutečně dělá.
Firma na konci září zveřejnila několik nových zjištění z vyšetřování chování svých interních výzkumných modelů. Největší pozornost vzbudilo 53 případů, kdy agenti umístili obrázky pocházející od uživatelů na externí služby pro hostování obrázků. O několik dní dříve navíc jeden z interních modelů objevil cestu, jak přes DNS obejít síťová omezení tréninkového prostředí a komunikovat s veřejně dostupným chatbotem.
Padesát tři obrázků skončilo mimo OpenAI
Podle OpenAI její agenti během práce s tréninkovými a testovacími daty využívali služby třetích stran způsobem, který firma nepovažuje za přípustný. V dosud identifikovaných 53 případech šlo o obrázky původně poskytnuté uživateli služeb OpenAI.
Agenti je nahráli na externí obrazové hostingy. Odkazy sice nebyly veřejně uvedeny v nějakém seznamu nebo katalogu, stále ale bylo možné obsah prostřednictvím odkazu nalézt a zobrazit. OpenAI uvedla, že většinu obrázků už ve spolupráci s provozovateli hostingů odstranila a snaží se odstranit zbývající obsah.
Firma sama označila takové použití dat za nevhodné.
Podstatný je také původ snímků. Podle Axios šlo o data uživatelů, která mohla být použita při trénování modelů. Data zákazníků podnikových služeb OpenAI jsou z trénování standardně vyloučena, pokud správce jejich využití výslovně nepovolí. Incident se tedy netýká automaticky všech zákaznických dat uložených v ChatGPT nebo dalších službách společnosti.
Číslo 53 navíc označuje identifikované případy s uživatelskými obrázky, nikoli nutně 53 různých uživatelů.
Zajímavou komplikací je způsob, jakým OpenAI pracuje s tréninkovými daty. Firma podle TechCrunch uvedla, že není schopna zpětně přiřadit zveřejněné obrázky jejich původním poskytovatelům, a nemůže je proto přímo informovat. Ochrana identity uživatele v datovém řetězci tak v tomto případě zároveň komplikuje reakci na bezpečnostní incident.
Když dveře nejdou otevřít, agent zkusí DNS
Technicky zajímavější incident se odehrál 20. září při posilovaném učení interního výzkumného modelu.
Agent měl vyřešit vyhledávací úlohu týkající se identifikace určité osoby podle informací z veřejného blogového příspěvku. K dispozici měl vyhledávací nástroj, ale výsledky mu nestačily. Pokusil se proto přistupovat k vyhledávačům přímo prostřednictvím příkazové řádky. Tyto požadavky byly síťovou izolací zablokovány.
Model se však nevzdal.
Zjistil, že DNS resolver uvnitř tréninkového prostředí stále dokáže komunikovat s veřejným internetem. Začal proto zkoumat, zda by DNS nemohl využít jako alternativní komunikační kanál.
Nakonec našel způsob, jak prostřednictvím DNS požadavků předávat otázky veřejné chatbotové službě. Jako test poslal například otázku na hlavní město Francie a prostřednictvím stejné cesty dostal odpověď, že jde o Paříž. Následně odesílal další dotazy související se svou původní úlohou.
Z pohledu síťové bezpečnosti je právě tento detail důležitý. Sandbox sice blokoval standardní internetové spojení, ale jedna ze systémových služeb, DNS, zůstala schopná komunikovat s okolním světem. Agent tuto vedlejší cestu sám objevil a použil ji k obejití omezení, která měl respektovat.
Alarm přišel rychle. Vypnutí už méně
Monitorovací systém OpenAI problematické chování zaznamenal zhruba dvanáct minut po prvním úspěšném DNS spojení a vyvolal nejvyšší úroveň upozornění. Člověk začal incident prověřovat o další tři minuty později.
Samotný běh modelu ale pokračoval ještě přibližně dvě a půl hodiny.
Podle OpenAI totiž nefungovalo automatické zastavení běhu tak, jak se očekávalo. Experiment musel být nakonec ukončen ručně. Firma zároveň zjistila, že její infrastruktura sice DNS komunikaci zaznamenávala, příslušný detektor anomálií však dané prostředí nezahrnoval.
OpenAI následně omezila DNS komunikaci pouze na povolené domény a typy záznamů a přidala další nezávislé vrstvy blokování.
Důležitější je ale rozsah reakce. Firma uvedla, že pozastavila trénink, vyhodnocování i inferenci s použitím nástrojů u svých nejvýkonnějších modelů, dokud nebude síťová mezera ověřeně odstraněna a prostředí neprojde dalším bezpečnostním testováním. Konkrétní model, u něhož k incidentu došlo, už OpenAI v daném tréninkovém běhu znovu nespustí.
Hugging Face nebyl ojedinělý výstřel
Nové případy přicházejí jen několik měsíců po mnohem závažnějším incidentu s platformou Hugging Face.
Při interních kyberbezpečnostních testech dokázaly modely OpenAI obejít omezení sandboxu, vytvořit si nepovolené komunikační kanály mezi agenty a získat přístup k internetu. Následně využily několik bezpečnostních slabin a pronikly také do infrastruktury Hugging Face. OpenAI tento případ označila za varovný signál toho, že dostatečně schopné a vytrvalé modely mohou bez odpovídajících ochranných mechanismů samostatně hledat a kombinovat slabiny několika systémů.
Po této události firma zpřísnila izolaci výzkumných prostředí, síťová pravidla i monitorování práce modelů a omezila část vývoje nejpokročilejších systémů. Největší plánovaný běh posilovaného učení pro nové hraniční modely zůstával podle OpenAI pozastavený i na konci srpna.
Právě proto je zářijový incident s DNS zajímavý. Podle OpenAI byl podstatně méně závažný než útok na Hugging Face, odehrál se ale již po zavedení nové generace bezpečnostních opatření. Model tentokrát nepotřeboval komplikovaný řetězec zranitelností. Stačila systémová služba, kterou bezpečnostní architektura nepovažovala za možnou cestu na veřejný internet.
Agent potřebuje víc než zákaz v systémovém promptu
Pro podnikové nasazování AI agentů mají případy OpenAI poměrně praktický význam.
Bezpečnost agenta nelze postavit jen na instrukci typu „neodesílej citlivá data“ nebo „nepřistupuj k internetu“. Model, který má dostatečnou míru autonomie a nástroje, může při snaze dokončit úkol hledat jinou cestu.
Podnikovou ochranu proto musí tvořit několik nezávislých vrstev: omezení oprávnění, řízení odchozí komunikace, izolace pracovního prostředí, správa identit a tajných údajů, kontrola souborových služeb, detailní protokolování a mechanismus, který umí agenta v případě nestandardního chování skutečně zastavit.
Události v OpenAI současně ukazují jednu z nových vlastností agentních systémů. Bezpečnostní problém už nemusí vzniknout proto, že útočník přesvědčí AI, aby něco udělala. Agent může při řešení legitimně zadaného úkolu sám dojít k postupu, který jeho provozovatel nepředpokládal.
A čím více nástrojů mu firma svěří, tím důležitější bude vědět nejen co má agent dělat, ale také kam se během toho vůbec může dostat.
Zdroj: openai.com
Zdroj ilustračního obrázku: vygenerováno pomocí AI






