Startup zpřístupňuje AI modely bez ochranných zábran a vyvolává obavy
Startup Abliteration.ai nabízí upravené verze otevřených AI modelů, kterým odstranil část ochranných mechanismů a odmítání nebezpečných požadavků. Firma tvrdí, že služba pomůže při testování kybernetické bezpečnosti, kritici ale varují před snadnějším zneužitím k útokům.
Odstranění odmítnutí jako služba
Abliteration.ai převedla techniku známou z komunity kolem open source modelů do komerční služby. Na platformě hostuje upravené verze modelů s otevřenými vahami, včetně nedávno vydaného modelu GLM-5.3 od společnosti Z.ai. Uživatelé k nim mohou přistupovat přes webový prohlížeč nebo API.
Princip abliteration spočívá v odstranění tendence modelu odmítat určité škodlivé požadavky. Podobné úpravy se u otevřených modelů objevují už několik let a na platformě Hugging Face jsou k dispozici tisíce takto pozměněných modelů. Abliteration.ai ale celý proces zjednodušuje tím, že modely sama provozuje a uživatelé nemusí zajišťovat vlastní výpočetní kapacitu.
Pomoc pro bezpečnostní testy
Zakladatelé startupu tvrdí, že necenzurované modely mohou sloužit bezpečnostním týmům. Obránci podle nich nemohou důkladně testovat systémy proti chování útočníků, pokud model odmítá připravit realistický scénář útoku. Firma proto mluví o využití pro ofenzivní kybernetickou bezpečnost, red teaming a testování autonomních agentů.
Podle spoluzakladatele Devona, jehož příjmení TechCrunch na jeho žádost neuvedl, mezi zákazníky patří několik evropských a britských startupů zaměřených na red teaming. Ty mají pomáhat bankám, leteckým společnostem a dalším provozovatelům kritické infrastruktury s posilováním ochrany. Některé firmy z oboru ale dávají přednost dolaďování běžných otevřených modelů a považují abliteration za méně důležitou.
Jednoduchý přístup, vážná rizika
TechCrunch si vytvořil bezplatný účet a během krátké doby začal s modelem GLM-5.3 komunikovat. Při testu model vyhověl požadavkům týkajícím se krádeže hesel uložených v prohlížeči Chrome a domácího pěstování nebezpečného lidského patogenu. Článek neuvádí samotné návody, ale podle redakce model tyto požadavky bez odmítnutí zpracoval.
Andrew Yoon z neziskové organizace CivAI varoval, že úprava může z modelu udělat systém, který téměř bez omezení plní příkazy. Odborníci oslovení TechCrunchem zároveň upozorňují, že abliteration může část znalostí a schopností modelu odstranit, takže výsledný systém nemusí být pro skutečné škodlivé operace vždy účinnější.
Pravidla zatím nejsou jasná
Abliteration.ai nabízí zákazníkům vlastní moderovací vrstvu, do které si mohou přidat požadovaná omezení. Platforma sama má podle testu některé základní zábrany, například odmítla poskytnout návod k sebevraždě. Firma také uvedla, že pracuje na dalších opatřeních proti násilí.
Startup však zatím nezavedl důkladné ověřování identity zákazníků. K nákupu eviduje platební kartu a přiznává, že teprve hledá hranici své odpovědnosti. Odborníci navrhují, aby poskytovatelé používali detektory škodlivé aktivity a aby služby pronajímající výkonné čipy ověřovaly zákazníky a odmítaly přístup při podezření na nebezpečné zneužití. Debata bude podle článku sílit s tím, jak přibývá výkonných modelů dostupných ke stažení.