AI porazila nejlepšího hráče Stratega. Trénink stál jen zlomek milionů

Umělá inteligence Ataraxos porazila v sérii online partií Pim Niemeijera, jednoho z nejúspěšnějších hráčů Stratega. K vítězství jí pomohlo odhadování skrytých figurek a plánování tahů dopředu; trénink přitom běžel na 16 grafických procesorech.

Hra, která skrývá téměř vše

Šachy, go i poker už mají za sebou souboje, v nichž umělá inteligence porazila špičkové lidské hráče. Stratego ale představovalo obtížnější výzvu: soupeři vidí polohu protivníkových figurek, nikoli jejich identitu. Ta se odhalí až při střetu. Každý hráč přitom začíná se 40 figurkami různých hodností, bombami a vlajkou; cílem je získat vlajku soupeře.

Možných rozmístění figurek je podle výzkumníků více než decilion a partie může trvat až 2 000 tahů. Hráči navíc blafují: slabší figurkou mohou předstírat silnější, aby protivníka odradili od útoku. Právě množství skrytých informací a dlouhý průběh hry dělaly ze Stratega problém, se kterým si dřívější systémy, včetně DeepNash od DeepMind, nedokázaly spolehlivě poradit.

Učení hrou i odhad soupeře

Ataraxos vyvinul tým výzkumníků z Carnegie Mellon, MIT, New York University a Stanfordovy univerzity. Stejně jako DeepNash se učil hrou proti sobě: odehrál celkem 163 milionů partií. Tahy vedoucí k vítězství pak systém upřednostňoval, zatímco ty neúspěšné potlačoval. Výzkumníci upravili, jak výrazně se strategie po jednotlivých hrách mění: zpočátku dovolili větší změny, později byly opatrnější.

Zásadní novinkou bylo plánování před každým tahem. Druhá neuronová síť, takzvaný model přesvědčení, odhaduje skryté figurky protivníka podle jeho dosavadního chování. Ataraxos pak nemusí procházet každé možné rozmístění: vybere několik pravděpodobných variant, vyzkouší v nich možné tahy a rozhodne se podle výsledků.

Porážka šampiona i nové strategie

V průběhu tří týdnů odehrál Ataraxos 20 online partií s Pimem Niemeijerem. Ten získal čtyři tituly mistra světa a více než 600 týdnů byl světovou jedničkou. Za každé vítězství měl dostat 100 dolarů. Proti systému uspěl jen jednou: výsledná bilance byla 15 výher pro Ataraxos, jedna pro člověka a čtyři remízy.

Výzkumníci připomínají, že i dobrá strategie může někdy prohrát kvůli náhodě, mimo jiné proto, že rozmístění figurek se mění. Na mistrovství světa ve Strategu v roce 2025 vyhrál Ataraxos 38 ze 40 partií proti návštěvníkům. Některé hráče překvapilo, že často umisťoval vlajku do rohu a chránil ji jen dvěma bombami — sestavou, která se běžně příliš nepoužívá.

Výkon bez obřího rozpočtu

Trénink Ataraxosu zabral 16 grafických procesorů po dobu jednoho týdne. Samostatný model pro odhad skrytých figurek se učil další čtyři dny na čtyřech GPU. Tým odhaduje, že srovnatelný běh DeepNash na 1 024 specializovaných čipech Googlu po dobu dvou až tří měsíců by při cenách z roku 2025 stál 3 až 4,5 milionu dolarů. Ataraxos navíc odehrál přibližně 34krát méně partií než DeepNash.

Stejný přístup uspěl také ve zrychlené variantě Barrage Stratego, kooperativní karetní hře Hanabi a čínské karetní hře dou dizhu. Výzkumníci zvažují využití podobných metod například při modelování konfliktů či vyjednávání. Zároveň chtějí, aby systém dokázal své tahy vysvětlit; současný Ataraxos to zatím neumí.