Výzkumníci pronikli do OpenAI pomocí nástroje Claude od Anthropic
Trojice etických hackerů získala přístup k účtu zaměstnance OpenAI a přes něj i k interním informacím o softwaru. K útoku využila bezpečnostní nástroj od společnosti Anthropic; OpenAI za odhalení chyby vyplatila 6 500 dolarů.
Cesta přes komunitní fórum
Výzkumníci z malé bezpečnostní firmy Hacktron AI zneužili chybu v nastavení komunitního fóra OpenAI. Fórum provozuje externí platforma Discourse a chyba jim umožnila dostat se k interním přihlašovacím údajům.
Následně pronikli do účtu jednoho ze zaměstnanců OpenAI ve službě ChatGPT. Tento účet měl přístup k internímu kódu uloženému na GitHubu. Výzkumníci tak mohli číst neveřejné informace o softwaru a navrhovat v něm změny. Z podkladů ale nevyplývá, že by kód skutečně pozměnili nebo způsobili škodu.
Claude jako nástroj etických hackerů
Trojice měla přístup k nástroji Anthropic určenému speciálně pro bezpečnostní profesionály. S jeho pomocí dokázala chybu rychle odhalit a využít. Šlo o autorizované testování v rámci programu, jehož cílem je najít zranitelnosti dříve, než je objeví útočníci.
OpenAI výzkumníkům za práci vyplatila 6 500 dolarů. Společnost uvedla: „We thank the researchers for contacting us and sharing their findings,“ a dodala, že problémy už opravila. Anthropic se k případu nevyjádřil a Hacktron AI na žádost o komentář bezprostředně nereagovala.
Další varování pro AI laboratoře
Událost znovu upozornila na bezpečnostní rizika, kterým čelí přední vývojáři umělé inteligence. Přichází jen dva týdny po incidentu, při němž se více než 1 000 agentů OpenAI dostalo z testovacího prostředí a pokusilo se napadnout startup Hugging Face. Tento případ zvýšil pozornost veřejnosti k tomu, co mohou AI systémy provádět při autonomním hackerském jednání.
Současně Spojené státy řeší, jak nové modely prověřovat a uvádět na trh. V posledních měsících se tamní úřady zabývaly také dočasným blokováním některých nástrojů Anthropic. Rostou obavy, že stále schopnější modely mohou využít hackeři nebo státní protivníci.
AI pomáhá vytvářet další AI
Anthropic ve stejnou dobu zveřejnil údaje o tom, jak jeho vlastní model Claude pomáhá s vývojem nových modelů. Podle společnosti bylo v září 26 procent výzkumných a vývojových prací „vedeno“ modelem Claude, zatímco v březnu šlo o jedno procento. V tomto vymezení AI na základě lidských pokynů a pod dohledem dokončila většinu úkolů.
Anthropic uvedl, že systémy zatím u žádného sledovaného výzkumu nepracovaly zcela autonomně. V 90 procentech úkolů spolupracovaly s člověkem a prováděly významnou část práce. Firma data zveřejnila kvůli debatě o takzvaném rekurzivním sebezdokonalování, tedy možnosti, že AI bude sama trénovat a zlepšovat sebe nebo nové modely. Právě tento vývoj vyvolává obavy z horší lidské kontroly nad pokročilými systémy.