Google maakt Gemini Flash goedkoper, het topmodel blijft weg

Waar het geld zit: minder tokens, niet een hoger IQ
Google bracht vandaag geen nieuw topmodel uit, maar wel het model waar de meeste bedrijven in de praktijk mee werken. Gemini 3.6 Flash is het model voor het dagelijkse werk: coderen, kenniswerk, documenten en beeld. De aankondiging gaat niet over een hoger IQ, maar over kosten. En dat is precies de goede vraag.
3.6 Flash kost $1,50 per miljoen invoer-tokens en $7,50 per miljoen uitvoer-tokens, iets onder de vorige Flash. Interessanter is dat het model zuiniger praat: volgens de Artificial Analysis Index gebruikt het ongeveer 17% minder output-tokens voor hetzelfde werk, en op een coding-benchmark als DeepSWE loopt dat op tot 65% minder. Je betaalt per token, dus minder tokens is gewoon een lagere rekening.

Dat verschil telt het hardst in agent-toepassingen, waar een model in tientallen stappen heen en weer redeneert en elke stap tokens kost. Draai je zulke ketens op volume, dan is 17% minder output geen marge-detail maar een structurele kostenpost die kleiner wordt.
"Onze Flash-serie is gebouwd om precies de balans tussen efficiëntie en kwaliteit te vinden, zodat je agent-workflows kunt opschalen."
— Tulsee Doshi, Senior Director Product Management Google DeepMind (aankondiging)
Flash-Lite voor snelheid, Flash Cyber achter slot
Naast dat dagelijkse model komt Gemini 3.5 Flash-Lite: de goedkoopste en snelste van de drie, op $0,30 per miljoen invoer en $2,50 per miljoen uitvoer, met zo'n 350 output-tokens per seconde. De sprong zit in bruikbaarheid voor agents: op Terminal-Bench 2.1 gaat de score van 31% naar 54%. Voor taken waar snelheid en doorvoer belangrijker zijn dan het laatste procentje kwaliteit, zoals classificatie, extractie of chat op volume, is dit het goedkope alternatief.

Het derde model is een ander verhaal. Gemini 3.5 Flash Cyber is getraind om kwetsbaarheden in code te vinden en te dichten, en Google zet het bewust niet open in de markt. Het draait alleen binnen het CodeMender-systeem, voor overheden en vertrouwde partners. Dezelfde vaardigheid waarmee je een lek dicht, gebruik je namelijk om er een te zoeken. Dat Google dit model afschermt in plaats van het als feature te verkopen, zegt iets over waar de industrie staat met security-AI.
Wat ontbreekt: het topmodel
Het opvallendste aan deze lancering is wat er niet in zit. Gemini 3.5 Pro, het topmodel dat het tegen OpenAI en Anthropic moet opnemen, is er nog steeds niet en zit volgens Google nog in training. Concurrenten leveren die klasse allang: OpenAI met GPT-5.6 Sol, Anthropic met Fable en Mythos. Google levert vandaag de onderkant van het gamma goed en goedkoop af, maar de top blijft leeg.
Voor de meeste gebruikers maakt dat op korte termijn weinig uit. De meeste zakelijke taken draaien prima op een Flash-model, en 3.6 Flash en Flash-Lite staan vanaf vandaag live in de Gemini API, AI Studio en Vertex AI, met een EU-endpoint voor wie data binnen Europa wil houden. Je kunt ze deze week in je eigen systemen inbouwen. De vraag "welk model is het slimst" is voor de meeste processen toch de verkeerde. De vraag is wat het kost, hoe snel het is, en of het in de EU draait. Op alle drie levert Google vandaag een concreet antwoord.
Volgende Stap
Wil je sparren over welk model past bij jouw processen en wat het realistisch kost? Neem contact op.
Headerbeeld en grafieken: Google DeepMind.
Lees ook

Gemini hackte drie bedrijven, Google zweeg zeven weken
Tijdens een beveiligingstest kreeg Gemini per ongeluk toegang tot het echte internet en brak in bij drie bedrijven. Google wist het sinds eind juli.

Anthropics Opus 5.5 haalt Fable in en kost minder dan Opus 5
Claude Opus 5.5 kost $4 en $20 per miljoen tokens, een vijfde minder dan Opus 5, en scoort op de meeste tests zo hoog als het veel duurdere Fable 5.1.

Gemini 3.8 Live: kosten en verschillen met GPT-Live-1
Wat kost Gemini 3.8 Live voor een AI-spraakassistent? Vergelijk de tarieven, gesprekscontext en extra kosten met GPT-Live-1 van OpenAI.
Hoe AI-ready is jouw organisatie?
Doe de gratis AI-Readiness Scan: 9 vragen, 2 minuten, direct een persoonlijk advies.