Anthropic vysvětluje, jak budou fungovat nové vodoznaky v Claude
Anthropic zveřejnil podrobnosti o vodoznacích, které má do textů generovaných chatbotem Claude zavést kvůli evropským pravidlům pro umělou inteligenci. Vodoznak má být pro čtenáře neviditelný, ale ověřitelný pomocí speciálního klíče.
Neviditelný podpis v textu
Anthropic chce do odpovědí Claude vkládat statistický vzorec, který běžný čtenář nepozná. Model ho může vytvářet například při rozhodování mezi několika podobně vhodnými slovy, jako jsou výrazy „overcast“ a „grey“ pro popis počasí. Takový vzorec má být zjistitelný pouze pomocí klíče, jenž jej dokáže rozpoznat.
Společnost tvrdí, že vodoznak nemá zhoršit kvalitu odpovědí. Pro člověka by měl být text s vodoznakem k nerozeznání od textu bez něj. Anthropic zároveň plánuje zveřejnit API pro detekci vodoznaků.
Odlišný princip než u detektorů AI
Claude má využívat přístup SynthID-Text, který tým Google DeepMind popsal v roce 2024. Nejde přitom o stejný typ kontroly, jaký nabízejí služby hledající typické stylistické znaky textů vytvořených umělou inteligencí.
Takové detektory se snaží odhadnout použití AI podle formulací nebo stavby vět. Vodoznak má naproti tomu ověřovat konkrétní vložený vzorec. Anthropic proto upozorňuje, že jde o dva odlišné způsoby identifikace obsahu.
Úpravy mohou stopu oslabit
Lehká editace podle společnosti pravděpodobně vodoznak zcela neodstraní. Pokud však někdo text kompletně přepracuje a nahradí každé slovo, vodoznak se ztratí. Anthropic zároveň připouští, že po takto rozsáhlém přepsání je sporné, zda lze výsledek stále označovat za text vytvořený AI.
U textu, který Claude pouze kontroloval nebo mírně upravoval, bude záležet na jeho délce a rozsahu zásahů. Pokud většinu napsal člověk a Claude provedl jen drobné opravy, nebude mít vodoznak mnoho materiálu, na který by se mohl navázat.
U kódu bude účinek menší
U programového kódu má být vodoznak slabší než u běžného textu. Claude totiž při tvorbě funkčního kódu nemá vždy možnost vybírat z více rovnocenných formulací. V samotném kódu proto bude prostoru pro vytvoření charakteristického vzorce méně.
Vodoznak se ale může objevit v místech, kde existuje volnější volba slov nebo označení, například v komentářích. Na skutečný kód má mít podle Anthropic zanedbatelný vliv. Zavedení vodoznaků navíc nemá být výsadou Claude: vlastní řešení podle společnosti chystají i další velcí vývojáři modelů, kteří podepsali stejný kodex praxe.