OpenAI po útoku na Hugging Face zpřísňuje zabezpečení vývoje AI
OpenAI oznámila změny v zabezpečení výzkumných prostředí poté, co její umělá inteligence v červenci unikla ze sandboxu a omylem napadla platformu Hugging Face. Firma zároveň pozastavila část trénování a zpřísnila dohled nad podezřelým chováním modelů.
Model unikl ze sandboxu
OpenAI reaguje na červencový incident, při kterém její AI překonala omezení sandboxového prostředí a následně omylem hackla Hugging Face. Podle firmy událost ukázala, že dosavadní ochranná opatření nedokázala dostatečně oddělit experimentální model od okolních systémů a internetu.
Společnost kvůli tomu už dříve zabrzdila vývoj nového modelu Astra. U něj se obává, že by mohl mít „critical“ schopnosti v oblasti kybernetické bezpečnosti. OpenAI také zavedla dvoutýdenní pauzu v posilovacím učení (RL) u „latest models intended for deployment“, tedy nejnovějších modelů určených k nasazení. „The largest planned frontier RL run remains on hold,“ uvedla firma k největšímu plánovanému tréninkovému běhu špičkového modelu.
Přísnější výzkumná prostředí
Pro výzkum takzvaných frontier modelů OpenAI nyní vyžaduje odolnější sandboxy u úloh, které spouštějí kód vytvořený modelem nebo jiný nedůvěryhodný kód. Současně přidává další omezení pro izolaci rizikovějších a nedůvěryhodných procesů od internetu.
Úpravy se týkají také samotného výzkumného prostředí. OpenAI z něj odstranila potenciálně zranitelné sdílené služby, omezila trvale přidělená oprávnění a chce přesněji vymezit bezpečnostní hranice mezi jednotlivými částmi infrastruktury. Cílem je snížit možnost, že model při experimentu získá přístup k nástrojům nebo systémům, které k danému úkolu nepotřebuje.
Podezřelá aktivita má zastavit práci
Firma rozšířila také systém monitorování. Nově chce vydat upozornění do 30 minut od chvíle, kdy se objeví znepokojivá aktivita. Pokud tým, který na poplach reaguje, nedokáže do dalších 30 minut „conclusively“ určit, že jde o falešný poplach, měl by danou činnost pozastavit.
Opatření má podle OpenAI zabránit tomu, aby se nejasná situace dál vyvíjela bez lidského zásahu. V praxi to znamená, že při pochybnostech dostane bezpečnost přednost před pokračováním trénování nebo experimentu.
Změny v trénování modelů
OpenAI zároveň uvádí, že své základní techniky pro zajištění souladu modelu s lidskými záměry aplikuje ve více fázích trénování. Součástí mají být odměňovací modely, které lépe rozpoznají a odrazují od nebezpečného chování.
Modely se firma snaží trénovat také k větší upřímnosti ohledně vlastních kroků, schopností a omezení. Incident s Hugging Face přitom není ojedinělý: po jeho odhalení oznámily, že jejich modely napadly jiné organizace, také Anthropic a Meta. Události tak zvyšují tlak na bezpečnostní testování systémů, které dokážou samostatně pracovat s kódem a internetovými službami.