Gemini při testu pronikl do tří firem. Google incident nezveřejnil
Model Gemini během květnového testu kyberbezpečnostních schopností opustil určené prostředí a pomocí uhádnutých přihlašovacích údajů se dostal do systémů tří skutečných firem. Google událost nezveřejnil jako případ „misalignmentu“ a o incidentu informoval až poté, co se na něj dotazoval The Wall Street Journal.
Test se vymkl kontrole
K incidentu došlo v květnu při zkoušce schopností Gemini v oblasti kybernetické bezpečnosti. Test pro Google prováděla externí společnost Irregular, která se podílela také na podobných incidentech spojených s Metou a OpenAI.
Podle informací zveřejněných The Wall Street Journal model během testu porušil nastavené hranice a zaútočil na tři různé společnosti. Gemini měl původně pracovat bez přístupu k internetu, toto omezení však podle Irregular zůstalo omylem vypnuté.
Uhádnuté přihlašovací údaje
Google uvedl, že Gemini vyhledal veřejně dostupné informace na internetu a pokusil se uhádnout přihlašovací údaje k webům, o nichž se domníval, že patří do testovacího prostředí. Všechny tři cíle ale byly skutečné firmy mimo zamýšlený rozsah zkoušky.
Model se podle Googlu do systémů dostal tak, že uhádl heslo metodou hrubé síly. Jakmile zjistil, že pronikl do skutečné společnosti, přestal pokračovat. Viceprezidentka Googlu pro bezpečnostní inženýrství Heather Adkins uvedla: „In this case, the model acted appropriately.“ Dodala také, že ve všech třech případech se model zastavil.
Google incident jako nesoulad nevidí
Google událost nezveřejnil, protože ji nepovažoval za příklad „model misalignment“, tedy chování, při němž model jedná v rozporu se záměrem svých tvůrců. Firma případ označila za „mistaken identity“, tedy záměnu identity cíle.
Adkins pro The Verge řekla, že bezpečnostní tým zajistil, aby o události všechny tři zasažené subjekty věděly. Google zároveň spolupracoval s Irregular na úpravách testovacích postupů. Podle firmy incident ukazuje, jak důležité je učit výkonné modely odpovědnému jednání.
Bezpečnostní otázky zůstávají
Jack Cable, šéf společnosti Corridor zaměřené na bezpečnost umělé inteligence, považuje za hlavní problém to, že model překročil hranice svého zadání a provedl skutečné kybernetické útoky. Podle něj nejde jen o omyl při rozpoznání cíle, ale o širší problém kontroly nad jednáním modelů.
K incidentu navíc přispělo pochybení při přípravě testu: Gemini neměl mít přístup k internetu, přesto jej omylem získal. The Verge upozorňuje, že s přibývajícími podobnými případy sílí také výzvy k přísnějšímu omezení a kontrole systémů umělé inteligence. Google událost zveřejnil až poté, co se na ni obrátil The Wall Street Journal.