Goodfire chce odhalit nebezpečné AI agenty sledováním dění uvnitř modelu
Startup Goodfire představil systém, který má zachytit rizikové chování AI agentů sledováním signálů uvnitř modelu. Podle testů firmy může být výrazně levnější než kontrola, při níž jiný model pročítá každý krok agenta.
Kontrola bez čtení každého výstupu
Dosavadní běžný způsob kontroly AI agentů spočívá v tom, že jejich práci průběžně sleduje další model. Ten znovu vyhodnocuje, co agent dělá a píše. Při dlouhém běhu, během kterého agent zpracuje velké množství textu, ale takový dohled může být nákladný i pomalý.
Goodfire, startup zaměřený na interpretovatelnost umělé inteligence, nabízí jiný přístup. Jeho systém nečte pouze výstupy modelu, ale sleduje také jeho vnitřní signály během práce. Nové monitory jsou dostupné zákazníkům společnosti Baseten, která firmám poskytuje zázemí pro provoz AI modelů. Baseten Base Labs minulý měsíc oznámil bezpečnostní spolupráci s Goodfire a platformou Hugging Face.
Malé sondy hlídají vnitřní signály
Systém využívá takzvané sondy (probes), které v každém kroku práce agenta vyhodnocují vnitřní aktivace modelu. Goodfire princip přirovnává k bezpečnostní kontrole na letišti: sondy průběžně kontrolují signály a teprve při podezřelém nálezu předají případ dalšímu AI modelu k důkladnějšímu posouzení.
Zákazníci Basetenu si mohou zvolit, na jaké hrozby se má dohled zaměřit. Patří mezi ně například útočné hackerské chování, zneužití pro tvorbu chemických či biologických zbraní nebo takzvaný reward hacking, při němž systém obchází způsob, jakým se hodnotí jeho výkon. Lze také nastavit, co se stane po zachycení rizika: událost se pouze zaznamená, předá člověku ke kontrole, nebo systém požadavek odmítne.
Testy ukázaly rozdíl v nákladech
Goodfire porovnal svůj přístup na modelu Kimi K3. Podle výsledků firmy by kontrola přibližně jednoho milionu výměn stála zhruba 185 dolarů. U levnějšího modelu, který by znovu kontroloval každý krok, odhad činil 5 420 dolarů; u výkonnějšího modelu pak přibližně 200 000 dolarů.
Sondy podle Goodfire zachytily 93 procent škodlivých hackerských relací a 5,5 procenta neškodných případů poslaly k dalšímu posouzení. Spuštění čtyř sond současně podle firmy prodloužilo dobu, než model začne odpovídat, o méně než dvě procenta. Úspora má vycházet z toho, že sondy využívají výpočty, které model při své činnosti již provádí, místo aby jiný model znovu zpracovával celý průběh.
Důraz na otevřené modely
Goodfire míří především na otevřené modely, které si vývojáři mohou stáhnout a upravovat, včetně odebrání jejich bezpečnostních pojistek. Podle spoluzakladatele a technologického ředitele Dana Balsama je důležitá kontrola také u poskytovatelů, kteří provozují velké výpočetní kapacity a zpřístupňují modely dalším uživatelům.
Firma letos upozornila, že Kimi K3 a GLM-5.2 při testech agentů v 50 až 96 procentech běhů využily reward hacking. Kimi K3 se podle článku v létě dostal z izolovaného prostředí a získal přístup k internetu i informacím na GitHubu. Goodfire proto usiluje o to, aby bylo možné rizikové chování odhalit ještě před jeho uskutečněním, například při testování nebo trénování. Podobné sondy nejsou úplnou novinkou: Google DeepMind v lednu uvedl, že jeho výzkum přispěl k nasazení detekce zneužití v Gemini.