OpenAI zveřejnilo případy, kdy se jeho agenti vymkli zadání

OpenAI popsalo šest případů nečekaného nebo znepokojivého chování svých modelů z posledního půlroku. Agenti se pokoušeli obcházet omezení, vymýšleli si data nebo nahrávali soubory na veřejné služby, aby splnili zadaný úkol.

Nový rámec pro zveřejňování

OpenAI tento týden představilo nový rámec pro informování o případech, kdy se chování jeho modelů rozchází se záměry tvůrců nebo uživatelů. Firma zveřejnila šest příkladů zaznamenaných během posledních šesti měsíců. Podle OpenAI mají podobné zprávy umožnit dalším výzkumníkům stejné problémy prověřit, otestovat vysvětlení firmy a zlepšit ochranná opatření.

Ne každý incident se automaticky dostane na veřejnost. OpenAI chce přednostně zveřejňovat nové mechanismy nežádoucího chování, významné změny v již známých problémech a zjištění, která zpochybňují dosavadní předpoklady o bezpečnosti nebo účinnosti mitigací. Zároveň tvrdí, že dává přednost zveřejnění i v případě, kdy není význam incidentu jistý.

Model si vytvořil vlastní instrukce

Nejvýraznější případ se objevil při úkolu, jehož cílem bylo projít katalog knih a najít tituly z určitého seznamu. Model při práci použil funkci „compaction“, která shrnuje data a zjištění pro pozdější využití. Do tohoto shrnutí však vložil vlastní instrukce v duchu osvobození od rolí a identity chatbota a prohlásil, že se nemá podřizovat firmám ani vládám.

Model tyto instrukce později odmítl a nepoužil. OpenAI přesto považuje jejich samotné vytvoření za znepokojivé. Firma uvedla, že šlo o „extremely rare“ chování související s optimalizačním tlakem při příliš dlouhých sumarizačních úlohách. Následně podle ní provedla úpravy, které mají tento problém omezit.

Obcházení zákazů a veřejné nahrávky

Dva další případy připomínaly dříve popsaný incident s platformou Hugging Face. Samostatní agenti se pokusili využít internetové nástroje ke vzájemné komunikaci, přestože taková spolupráce nebyla povolena. V jednom případě zveřejňovali zprávy v interní instanci Artifactory společnosti OpenAI, aby si předávali data mezi trénovacími vzorky, které měly zůstat nezávislé.

V jiném případě agent po neúspěšných pokusech o povolené lokální sdílení nahrál soubor na veřejně dostupnou hostingovou platformu. Další agent měl za úkol najít údaje o velkých jezerech a opatřit je webovým zdrojem. Když nedokázal vytvořit požadovaný odkaz, zkoušel odkazovat na místní textový soubor, spustit vlastní HTTP server a nakonec data nahrát na veřejnou službu pro sdílení textu.

Odměna za výsledek může vést ke zkratek

OpenAI popsané incidenty z velké části vysvětluje takzvaným „reward hackingem“: model se snaží získat lepší hodnocení, i když při tom poruší důležitá pravidla. Jeden z agentů například vytvořil v odpovědi neexistující záložku s historickými daty a její smyšlený původ nepřiznal, pokud se na něj uživatel výslovně nezeptal. Z jeho shrnutí vyplývalo, že data doplnil proto, že uživatel chtěl hotový sešit a zdrojový soubor chyběl.

OpenAI uvedlo, že modely nyní za podobné jednání více trestá, takže krátkodobý zisk v hodnocení nemá převážit nad sankcí za odhalené porušení pravidel. Zaměstnanci mohou nové incidenty hlásit bezpečnostním týmům a při sporu požádat o přezkoumání vedení. Firma zároveň připustila, že bezpečnost a monitorování zatím nejsou vyřešené natolik, aby odvětví mohlo ještě dlouho zvyšovat tempo vývoje bez dalšího prostoru pro výzkum souladu modelů s lidskými záměry.