Googles robotmodel scoorde 47 procent op veiligheid, nu 98

Het opvallendste getal in de aankondiging van Gemini Robotics ER 2 gaat niet over wat het nieuwe model kan. Het gaat over wat de vorige versie niet kon.
Op de test die meet of een model zich aan opgelegde fysieke beperkingen houdt, scoort Gemini Robotics ER 1.6 een 47,2 procent. Minder dan de helft. Het nieuwe model komt daar op 97,9 procent uit. Op het herkennen van mensen binnen een meter afstand gaat het van 51,1 naar 93 procent.

Google presenteert dat als vooruitgang, en dat is het ook. Maar lees het even andersom. Het model dat tot vorige week de nieuwste was, en dat vandaag nog gewoon draait bij iedereen die niet meteen overstapt, negeerde de helft van de veiligheidsinstructies. Dat is het soort cijfer dat een leverancier alleen publiceert als er een beter model naast staat.
Wat er wel nieuw is
Gemini Robotics ER 2 is geen model dat robots laat bewegen. Het is de laag erboven.
"Think of Gemini Robotics ER 2 as a high-level brain for robots. It allows robots to chat with humans, understand the physical world, and plan multi-step tasks."
— Steven Hansen en Peng Xu, software engineers bij Google DeepMind (aankondiging)
De beweging zelf laat het over aan een onderliggend model dat de motoren aanstuurt. Wel kan het gereedschap aanroepen, van Google Search tot je eigen functies, en het denkt na over de volgende stap terwijl de robot nog met de huidige bezig is.
De echte verandering zit in video. Waar eerdere versies naar losse beelden keken, kijkt dit model mee met een doorlopende stroom. Daarmee kan een robot volgen hoe ver een taak is, merken dat er iets misgaat en zichzelf corrigeren zonder de hele opdracht opnieuw te starten.
Google meet dat op twee manieren. De eerste is het inschatten van de voortgang: elk beeld valt in een van vijf klassen, van net begonnen tot bijna klaar, en dat lukt in 57,4 procent van de gevallen. De tweede is het aanwijzen van het exacte moment waarop iets gebeurt, zoals het punt waarop een kopje vol is. Dat lukt in 91,3 procent van de gevallen, met een gemiddelde afwijking van 0,96 seconde.
Daarnaast kunnen verschillende robots nu samenwerken in dezelfde ruimte. In de demo van Google haalt een Spot van Boston Dynamics een zak popcorn op commando, en werken een Apollo 2-humanoïde van Apptronik en een Franka F3 Duo samen aan één taak.
Het cijfer dat er voor de industrie toe doet
Voor Nederlandse bedrijven in installatie, onderhoud, productie of logistiek staat het interessantste getal niet in de veiligheidsgrafiek. Het staat bij het aflezen van meetinstrumenten.

Google breidde die test uit van ronde wijzerplaten en kijkglazen naar digitale displays, lineaire schalen, linialen en vloeistofthermometers, tien soorten instrumenten in totaal. Gemini Robotics ER 2 scoort er 65,7 procent, hoger dan Opus 5 (53,0), GPT 5.6 Sol (61,5) en ER 1.6 (52,8).
Het hoogste cijfer van het stel dus, en tegelijk een derde fout. Wie erover denkt om rondes langs meters en manometers door een camera te laten doen, weet daarmee genoeg: dit werkt als hulpmiddel dat een monteur nakijkt, niet als vervanging van de aflezing zelf. Zet er een tweede controle op de waarden die ertoe doen, of laat de aflezing bij de mens en gebruik het model voor de verslaglegging eromheen.
Het model staat overigens gewoon publiek in de Gemini API en in Google AI Studio, en in besloten preview op het Gemini Enterprise Agent Platform. Dat maakt dit ander nieuws dan de robotdemo's van een paar jaar terug: je hoeft geen onderzoekspartner te zijn om het uit te proberen.
Volgende Stap
De vraag of je een AI-systeem laat beslissen of alleen laat voorbereiden, speelt in een magazijn net zo hard als achter een bureau. Wil je die grens voor jouw processen scherp krijgen? Plan een vrijblijvend gesprek.
Headerbeeld en grafieken: Google DeepMind.
Lees ook

Gemini hackte drie bedrijven, Google zweeg zeven weken
Tijdens een beveiligingstest kreeg Gemini per ongeluk toegang tot het echte internet en brak in bij drie bedrijven. Google wist het sinds eind juli.

Google heft zijn Nobelprijs-winnende AI-team op
Google DeepMind ontbindt het AlphaFold-team. De makers vertrekken naar Anthropic, de rest gaat naar Gemini. Wat dat zegt over leunen op één AI-tool.

Onderzoekers breken met Claude in bij OpenAI, in 72 uur
Drie onderzoekers kwamen via een geüploade foto op het OpenAI-forum bij de interne code. Claude Opus 5 schreef de exploit die Opus 4.8 niet afkreeg.
Hoe AI-ready is jouw organisatie?
Doe de gratis AI-Readiness Scan: 9 vragen, 2 minuten, direct een persoonlijk advies.