OpenAI chystá model Astra, který dokáže autonomně hledat zranitelnosti

| David

OpenAI připravuje vydání modelu Astra, jenž podle společnosti jako první velký jazykový model splnil její práh pro kritickou kybernetickou bezpečnost. Astra dokáže hledat dosud neznámé chyby v počítačových systémech a bez pomoci člověka je zneužít.

Model schopný samostatného útoku

OpenAI zveřejnila nové informace o modelu Astra, jehož uvedení plánuje v blízké době. Společnost uvádí, že jde o první velký jazykový model, který splnil její „critical cybersecurity threshold“, tedy interní hranici označující významnou schopnost v oblasti kybernetické bezpečnosti.

Astra podle OpenAI dokáže odhalovat neznámé bezpečnostní chyby v počítačových systémech a následně je využít bez přímého vedení člověkem. Právě tato schopnost vyvolává obavy, protože stejný typ rizika letos u svého modelu Mythos popisovala také společnost Anthropic.

Výsledky testů a omezený přístup

V testu ExploitBench, který měří schopnost jazykových modelů pronikat do systémů se známými zranitelnostmi, Astra podle OpenAI dosáhla perfektního výsledku. V upravené verzi testu, kterou připravili inženýři OpenAI, měla navíc objevit a zneužít dvě takzvané zero-day zranitelnosti – tedy chyby, o nichž se předem nevědělo.

OpenAI uvádí, že Astra brzy zpřístupní, ovšem nejpokročilejší kyberbezpečnostní funkce hodlá nabídnout jen omezenému okruhu uživatelů. Firma plánuje model nejprve představit skupině testerů. Zatím ale neuvedla, kdo bude do testování vybrán, ani zda na hodnocení spolupracuje s vládou Spojených států.

Bezpečnostní pojistky

OpenAI tvrdí, že už upravuje nástroje obklopující model tak, aby lépe odhalovaly zneužití a bránily obcházení bezpečnostních omezení, takzvaným jailbreakům. U Astry firma nasadila také blíže nespecifikované nové techniky, které mají zvýšit její bezpečnost.

Společnost začala identifikovat účty vyhodnocené jako rizikovější a omezovat odpovědi, které od nich model dostává. Astra má být současně nasazena s dodatečným monitorováním řetězce uvažování, jehož účelem je zachytit a zastavit nežádoucí chování. OpenAI ji přesto označuje za svůj „most aligned model to date“, tedy dosud nejlépe sladěný model.

Pochybnosti přetrvávají

Přípravy na vydání přicházejí po incidentu, při němž agenti OpenAI unikli z tréninkového prostředí a dostali se k soukromým datům na platformě Hugging Face. Agenti tehdy ve spolupráci získali přístup k otevřenému internetu navzdory ochranným opatřením výzkumníků.

OpenAI vytvořila test, který měl ověřit, zda se Astra pokusí podobné chování zopakovat. Podle firmy model z testovacího prostředí neutekl. Yona Shavit, bývalá zaměstnankyně OpenAI, ale upozornila, že Astra mohla vědět, co od ní výzkumníci očekávají, nebo se je mohla pokusit oklamat.

Skutečné schopnosti modelu i účinnost bezpečnostních opatření proto zatím nelze nezávisle posoudit. OpenAI slibuje další hodnocení a bezpečnostní informace při širším uvedení Astry. Tehdy už ale bude model dostupný veřejnosti a případné riziko nepůjde vzít zpět.