Terug naar overzicht
AI NieuwsGoogleGeminiPrijzen

Google's nieuwe Gemini Flash: goedkoper werkpaard, en het vlaggenschip blijft weg

·Door
Google's nieuwe Gemini Flash: goedkoper werkpaard, en het vlaggenschip blijft weg

Samenvatting:

  • Google zette op 21 juli drie nieuwe Flash-modellen live: 3.6 Flash, 3.5 Flash-Lite en het afgeschermde 3.5 Flash Cyber.
  • 3.6 Flash kost $1,50 per miljoen invoer-tokens en $7,50 per miljoen uitvoer, en gebruikt ongeveer 17% minder output-tokens dan zijn voorganger.
  • Flash-Lite gaat naar $0,30 / $2,50 per miljoen en haalt 350 tokens per seconde.
  • Beide staan live in de Gemini API, AI Studio en Vertex AI, ook in de EU. Het frontier-model 3.5 Pro is er nog steeds niet.

Waar het geld zit: minder tokens, niet een hoger IQ

Google bracht vandaag geen nieuw topmodel uit, maar wel het model waar de meeste bedrijven in de praktijk mee werken. Gemini 3.6 Flash is de nieuwe workhorse: coding, kenniswerk, documenten en multimodale taken. De aankondiging gaat niet over een hoger IQ, maar over kosten. En dat is precies de goede vraag.

3.6 Flash kost $1,50 per miljoen invoer-tokens en $7,50 per miljoen uitvoer-tokens, iets onder de vorige Flash. Interessanter is dat het model zuiniger praat: volgens de Artificial Analysis Index gebruikt het ongeveer 17% minder output-tokens voor hetzelfde werk, en op een coding-benchmark als DeepSWE loopt dat op tot 65% minder. Je betaalt per token, dus minder tokens is gewoon een lagere rekening.

Gemiddeld aantal output-tokens per taak: 3.6 Flash tegen 3.5 Flash

Dat verschil telt het hardst in agentic workflows, waar een model in tientallen stappen heen en weer redeneert en elke stap tokens kost. Draai je zulke ketens op volume, dan is 17% minder output geen marge-detail maar een structurele kostenpost die kleiner wordt.

"Onze Flash-serie is gebouwd om de sweet spot tussen efficiëntie en kwaliteit te raken, zodat je agentic workflows kunt opschalen."

— Tulsee Doshi, Senior Director Product Management Google DeepMind (aankondiging)

Flash-Lite voor snelheid, Flash Cyber achter slot

Naast het werkpaard komt Gemini 3.5 Flash-Lite: de goedkoopste en snelste van de drie, op $0,30 per miljoen invoer en $2,50 per miljoen uitvoer, met zo'n 350 output-tokens per seconde. De sprong zit in bruikbaarheid voor agents: op Terminal-Bench 2.1 gaat de score van 31% naar 54%. Voor taken waar latency en doorvoer belangrijker zijn dan het laatste procentje kwaliteit, zoals classificatie, extractie of chat op volume, is dit het goedkope alternatief.

Gemini 3.5 Flash-Lite tegen 3.1 Flash-Lite op agentic coding en kenniswerk

Het derde model is een ander verhaal. Gemini 3.5 Flash Cyber is getraind om kwetsbaarheden in code te vinden en te dichten, en Google zet het bewust niet open in de markt. Het draait alleen binnen het CodeMender-systeem, voor overheden en vertrouwde partners. Dezelfde vaardigheid waarmee je een lek dicht, gebruik je namelijk om er een te zoeken. Dat Google dit model afschermt in plaats van het als feature te verkopen, zegt iets over waar de industrie staat met security-AI.

Wat ontbreekt: het vlaggenschip

Het opvallendste aan deze release is wat er niet in zit. Gemini 3.5 Pro, het frontier-model dat met OpenAI en Anthropic moet concurreren, is er nog steeds niet en zit volgens Google nog in training. Concurrenten leveren die klasse allang: OpenAI met GPT-5.6 Sol, Anthropic met Fable en Mythos. Google levert vandaag de onderkant van het gamma goed en goedkoop af, maar de top blijft leeg.

Voor jou als gebruiker maakt dat op korte termijn weinig uit. De meeste zakelijke taken draaien prima op een Flash-model, en 3.6 Flash en Flash-Lite staan vanaf vandaag live in de Gemini API, AI Studio en Vertex AI, met een EU-endpoint voor wie data binnen Europa wil houden. Je kunt ze deze week in je eigen stack zetten. De vraag "welk model is het slimst" is voor de meeste processen toch de verkeerde. De vraag is wat het kost, hoe snel het is, en of het in de EU draait. Op alle drie levert Google vandaag een concreet antwoord.

Volgende Stap

Wil je dit soort nuchtere duiding elke week in je inbox? Schrijf je in voor de nieuwsbrief. Wil je sparren over welk model past bij jouw processen en wat het realistisch kost? Neem contact op, of bekijk onze workshops.

Headerbeeld en grafieken: Google DeepMind.

Hulp nodig met dit onderwerp?

Onze experts helpen u graag verder met de implementatie.

Neem Contact Op