Google představuje Gemini Robotics 2: roboti mají lépe chápat svět i bezpečnost
Google uvedl druhou generaci svého systému Gemini Robotics, který má robotům pomoci zvládat složitější úkoly, reagovat na změny v okolí a spolupracovat s dalšími stroji. Součástí novinky jsou tři nové modely zaměřené na porozumění, řízení pohybu a bezpečnost.
Od porozumění k pohybu
Gemini Robotics 2 má podle Googlu posunout roboty od předem naprogramovaných triků k obecnějšímu využití. Cílem je stroj, kterému člověk zadá úkol a on ho dokáže samostatně provést, a to i s využitím humanoidního těla a složitých rukou. Výzkumníci z Google DeepMind tento směr někdy označují jako „physical AGI“.
Základem nové generace je model Gemini Robotics ER 2. Jde o systém typu vision-language model, který rozumí pokynům a současně vnímá okolní svět. Nově dokáže zpracovávat živý obraz z kamer robota a sledovat, jak postupuje při jednotlivých krocích úkolu. Google uvádí, že při určování úplnosti videozáběrů dosahuje téměř 60procentní přesnosti, což je výrazně lepší výsledek než u předchozí verze 1.6, stále však nejde o bezchybný systém.
Robot nemusí začínat znovu
Model má lépe rozpoznávat důležité okamžiky ve videu. Při nalévání kávy tak například potřebuje určit, kdy přestat. Podle Googlu dokáže tyto klíčové momenty identifikovat s téměř 90procentní přesností.
U vícekrokových úkolů může systém zachytit chybu v průběhu práce a opravit pouze její konkrétní část. Když se například kutálející míček nedostane do ruky nebo někdo posune nádobu, robot by měl upravit polohu ruky či pohyb, místo aby celý úkol opakoval od začátku. Nový model zároveň umožňuje spolupráci více robotů. V ukázkách společně pracují humanoidní Apollo 2 od společnosti Apptronik a jednodušší Franka F3 Duo.
Tři modely pro různé úkoly
Porozumění situaci je pouze jedna část systému. O samotné provedení pohybu se stará model Gemini Robotics 2, označovaný jako vision-language-action model. Ten převádí instrukce a vyhodnocenou situaci na konkrétní akce robota. Google současně vyvíjí i verzi Gemini Robotics On-Device 2, která má fungovat offline s nízkou odezvou.
Akční modely jsou zatím dostupné pouze omezenému okruhu testerů. Google tvrdí, že i menší verze pro zařízení se dokáže přizpůsobit novým konstrukcím robotů po několika hodinách pohybových dat, tedy přibližně 200 ukázkách. Gemini Robotics 2 firma testuje také na hardwaru společnosti Boston Dynamics. Jedna z nových částí systému, Gemini Robotics ER 2, je od začátku zpřístupněna vývojářům prostřednictvím Gemini Live API.
Bezpečnost jako samostatný test
Robot s umělou inteligencí může při chybě způsobit větší škodu než běžný software, protože se pohybuje ve stejném prostoru jako lidé. Google DeepMind proto uvádí, že všechny vrstvy Gemini Robotics kombinují tradiční fyzická bezpečnostní opatření s bezpečnostními rámci pro AI.
S vydáním Gemini Robotics 2 přichází také nová sada testů ASIMOV-Agentic. Ta ověřuje například to, zda model odmítne nebezpečný příkaz k použití nástroje, dokáže posoudit bezpečnost úkolu a v případě nejistoty si vyžádá pomoc člověka. Podle Google DeepMind je Gemini Robotics ER 2 dosud nejbezpečnějším modelem týmu. Má například zastavit činnost, když se člověk přiblíží příliš blízko. Kompletní bezpečnostní benchmark je dostupný na platformě Hugging Face, což umožňuje jeho využití i mimo Google. Přesto ukázky stále potvrzují, že roboti jsou pomalejší a méně obratní než lidé a jejich schopnosti nejsou univerzální.