Gemini 3.8 verzint nu stemmen uit een tekstprompt

Je typt een omschrijving, en Gemini 3.8 bouwt er een compleet nieuwe stem bij. Geen stemacteur nodig, geen sample om na te bootsen. Google zet daarmee twee nieuwe tekst-naar-spraakmodellen live: Gemini 3.8 Flash TTS en de goedkopere Flash-Lite TTS, vanaf vandaag te gebruiken via de Gemini API en Google AI Studio (Google). Gemini 3.8 krijgt zo een tweede spraaktak naast Gemini 3.8 Live, dat spraak inzet voor live gesprekken: deze twee modellen zijn gericht op losse, geproduceerde audio.
Een stem tekenen in plaats van kiezen
Naast een bibliotheek van meer dan 2.000 kant-en-klare stemmen in ruim honderd talen en dialecten kun je nu met een natuurlijke-taalprompt een volledig nieuwe stem laten genereren. Je stuurt de uitvoering ook per zin met regie-aanwijzingen: fluisterend, opgewonden, een korte stilte. Het model zet ook twee sprekers tegen elkaar in één dialoogscène, inclusief niet-verbale geluiden als lachen en zuchten. Elke gegenereerde clip krijgt een SynthID-watermerk, zodat AI-audio herkenbaar blijft (modelkaart).
Ontwikkelaar Simon Willison bouwde binnen een dag een eigen testomgeving voor de API en liet twee virtuele pelikanen een gesprek voeren, elk met een eigen stem en toon.
"Het kostte zo'n 20 seconden om 1 minuut en 18 seconden audio te genereren met Gemini 3.8 Flash TTS, niet de goedkopere Flash-Lite, voor 2,74 dollarcent."
— Simon Willison, ontwikkelaar (playground)
Wat het kost, en wat er verandert op 1 januari
Flash TTS rekent $9,00 per miljoen audio-tokens, Flash-Lite TTS $6,00, gecontroleerd op 23 september 2026 op de prijspagina van Google (Google AI for Developers). Vijfentwintig tokens staan gelijk aan één seconde gegenereerde audio, dus dat komt neer op ruim 1,3 dollarcent per minuut voor Flash TTS. Via de batch-API is dat de helft. Beide tarieven gelden tot en met 31 december 2026. Vanaf 1 januari 2027 verdubbelen ze: Flash TTS naar $18,00, Flash-Lite TTS naar $12,00.
Willisons rekenvoorbeeld ligt hoger dan de kale audioprijs alleen zou verklaren. Waarschijnlijk telt zijn testtool ook de tekstprompt en de regie-instructies mee als invoertokens, iets wat de audioprijs op de prijspagina niet dekt.
Klonen mag, behalve in Europa
Upload een fragment van 30 seconden van je eigen stem, en het model imiteert de klank: dat heet stemreplicatie. Die functie is expliciet uitgesloten in een reeks rechtsgebieden. Google noemt zelf "Illinois, Texas, EEA, UK, Switzerland, and India" (Google). Voor Nederlandse gebruikers betekent dat: de kant-en-klare stemmen en het zelf ontwerpen van nieuwe stemmen werken gewoon, maar je eigen stem laten klonen kan niet via AI Studio.
Illinois en Texas hebben allebei een eigen wet die het gebruik van iemands biometrische kenmerken, waaronder een stem, aan toestemming bindt. Dat de EER en het VK in hetzelfde rijtje staan, wijst op eenzelfde soort inperking vanuit de AVG en de EU AI Act, al noemt Google zelf geen wetsartikel.
Headerbeeld en video: Google DeepMind.
Volgende Stap
Wil je weten wat spraaktechnologie zoals dit voor jouw organisatie kan betekenen? Neem contact op met AI Centrum Nederland.
Lees ook

Gemini hackte drie bedrijven, Google zweeg zeven weken
Tijdens een beveiligingstest kreeg Gemini per ongeluk toegang tot het echte internet en brak in bij drie bedrijven. Google wist het sinds eind juli.

Gemini 3.8 Live: kosten en verschillen met GPT-Live-1
Wat kost Gemini 3.8 Live voor een AI-spraakassistent? Vergelijk de tarieven, gesprekscontext en extra kosten met GPT-Live-1 van OpenAI.

Googles transcriber schrijft op wat je bedoelde, niet wat je zei
Gemini 3.5 Transcribe haalt 2,6 procent foutmarge, in 85 talen. Het wist ook je 'uhm' en herschrijft je verspreking, en dat is niet altijd wat je wilt.
Hoe AI-ready is jouw organisatie?
Doe de gratis AI-Readiness Scan: 9 vragen, 2 minuten, direct een persoonlijk advies.