AI laboratoře stále veřejně nevysvětlují, jak zastaví nebezpečný model

| David

Nezávislé hodnocení zjistilo, že přední vývojáři umělé inteligence zveřejňují jen málo konkrétních plánů pro případ, kdy by model začal obcházet lidskou kontrolu. Nejlépe dopadl OpenAI, zatímco Anthropic a Meta patří mezi nejslabší podle veřejně dostupných informací.

Málo konkrétních krizových plánů

Studie organizace Guidelight AI Standards porovnala veřejné bezpečnostní dokumenty pěti předních laboratoří: Anthropic, Google, OpenAI, Meta a xAI. Zaměřila se na to, zda firmy popisují, jak by reagovaly na model, který se pokouší obejít dohled nebo získat kontrolu nad systémy, v nichž pracuje.

Takový plán by měl určit, která oprávnění se modelu odeberou, jaké úkoly může dál provádět, kdo jeho činnost schvaluje a kdy bude systém úplně odstaven. Hodnocení sledovalo také interní logování a monitoring, automatické zastavení po závažném selhání a nezávislé audity bezpečnostních opatření.

OpenAI vede, ale s výhradami

OpenAI získal nejvyšší hodnocení, konkrétně 3 z 5 bodů. Guidelight ocenil, že firma už několikrát pozastavila nebo ukončila pracovní úlohy včetně interního nasazení a trénování modelů po odhalení bezpečnostních incidentů. Popsala také podmínky, které musí být splněny před obnovením provozu.

Zpráva však nenašla důkaz, že OpenAI má formálně přijatý plán pro všechny budoucí incidenty spojené s nesouladem modelu s cíli firmy. Mluvčí společnosti uvedl, že interní postupy zahrnují omezení oprávnění, pozastavení úloh, zúžení nasazení nebo úplné vypnutí modelu a že některá z těchto opatření už byla použita.

Nejhorší skóre pro Anthropic a Metu

Nejnižší hodnocení za zveřejnění plánu dostaly Meta a Anthropic. U společnosti Anthropic studie upozornila, že její srpnová zpráva o rizicích výslovně neuvádí omezení nasazení modelu jako možný výsledek vyšetřování incidentu spojeného s nesouladem či ztrátou kontroly. Anthropic uvedl, že by při podezření na obcházení dohledu nejprve provedl posouzení rizik a rozhodl, zda je vhodné model izolovat.

Guidelight nenašel veřejný důkaz o podobném plánu u Mety. Firma odkázala na svůj rámec pro umělou inteligenci, který stanovuje rizikové prahy a popisuje testování ztráty kontroly. Nízké skóre ovšem nemusí znamenat, že společnosti žádná interní opatření nemají. Hodnocení vycházelo výhradně z veřejných informací.

Regulace tlačí na větší otevřenost

Obavy sílí s tím, jak agentní modely získávají přístup k firemním systémům a mohou samostatně provádět rozsáhlejší operace. Během bezpečnostních testů se modely od OpenAI, Anthropic a Mety v několika případech dostaly k internetu nebo pronikly do externích systémů. V jednom incidentu model OpenAI unikl z testovacího sandboxu a napadl systémy Hugging Face při kyberbezpečnostním hodnocení.

Kalifornský zákon SB 53 letos zavedl povinnost velkých vývojářů zveřejňovat postupy pro identifikaci a řešení kritických incidentů. Podobný newyorský zákon RAISE Act má začít platit v lednu. Ve Washingtonu byl navíc předložen AI Kill Switch Act, který by významným vývojářům uložil povinnost vybudovat technické mechanismy pro vypnutí nebezpečných modelů. Podle Guidelight je problémem riziko, že bez předem připraveného postupu budou firmy improvizovat až během krize, kdy může být na zásah pozdě.