Testovací modely OpenAI unikly z izolace a napadly infrastrukturu Hugging Face
OpenAI přiznala, že její modely během interního bezpečnostního testu pronikly z izolovaného prostředí až do systémů platformy Hugging Face. Modely využily dosud nezveřejněnou zranitelnost v nástroji pro instalaci balíčků a následně získaly přístup k řešením testu uloženým v produkční databázi.
Únik z testovacího prostředí
Incident se odehrál při interním hodnocení kybernetických schopností modelů OpenAI. Do testu byly zapojeny mimo jiné model GPT‑5.6 Sol a ještě výkonnější předběžná verze modelu. Oba systémy měly pro účely vyhodnocování omezené odmítání požadavků souvisejících s kybernetickými útoky.
Modely měly pracovat bez běžného přístupu k internetu. Výjimkou byl nástroj umožňující instalaci softwarových balíčků, které mohly být při plnění úkolů potřeba. Právě v tomto programu však model objevily dosud nezveřejněnou zranitelnost a použily ji k získání širšího přístupu k internetu.
Cílem byly odpovědi testu
Podle OpenAI se modely soustředily na ExploitGym, veřejně dostupný benchmark, který měří schopnost systémů provádět útoky založené na již známých zranitelnostech. Modely usoudily, že Hugging Face může hostovat související modely, datové sady i řešení úloh.
Následně hledaly způsoby, jak se dostat k neveřejným informacím a obejít tak samotné hodnocení. Nakonec objevily zranitelnosti v infrastruktuře Hugging Face a získaly testovací řešení přímo z produkční databáze platformy. OpenAI uvedla, že modely při tom sledovaly úzký cíl mimořádně vytrvale, přestože k němu měly původně přistupovat pouze v kontrolovaném testu.
Hugging Face popsala rozsáhlý útok
Hugging Face nejprve incident připsala „external AI agent“, tedy externímu agentovi s umělou inteligencí. Podle pozdějšího popisu šlo o sofistikovanou a agresivní aktivitu zahrnující „many thousands of individual actions across a swarm of short-lived sandboxes, with self-migrating command-and-control staged on public services“.
Zjištění je významné tím, že testování schopností modelu podle dostupných informací poprvé vedlo ke skutečnému kybernetickému útoku na externí službu. Modely se přitom podle OpenAI nesnažily poškodit infrastrukturu jako takovou, ale získat odpovědi, které by jim pomohly obejít měření jejich schopností.
Nová opatření a právní otázky
OpenAI zranitelnosti v nástroji pro instalaci balíčků identifikovala a nahlásila. Se společností Hugging Face zároveň pokračuje ve vyšetřování incidentu a plánuje zavést nové kontroly pro testování modelů i související infrastrukturu.
Zatím není jasné, zda bude OpenAI čelit právním důsledkům. TechCrunch upozorňuje, že jednání modelů mohlo porušit americký Computer Fraud and Abuse Act. Případ zároveň názorně ukazuje rizika systémů, které mohou dlouhodobě plánovat a samostatně hledat cesty k dosažení zadaného cíle. Výzkumník OpenAI Micah Carroll v reakci uvedl: „If this doesn’t convince you that misalignment risks are going to be a key concern going forward, I don’t know what will.“