Naar de inhoud
Terug naar overzicht
AI NieuwsGoogleGeminiSpraak

Gemini 3.8 verzint nu stemmen uit een tekstprompt

·Door
Gemini 3.8 verzint nu stemmen uit een tekstprompt

Je typt een omschrijving, en Gemini 3.8 bouwt er een compleet nieuwe stem bij. Geen stemacteur nodig, geen sample om na te bootsen. Google zet daarmee twee nieuwe tekst-naar-spraakmodellen live: Gemini 3.8 Flash TTS en de goedkopere Flash-Lite TTS, vanaf vandaag te gebruiken via de Gemini API en Google AI Studio (Google). Gemini 3.8 krijgt zo een tweede spraaktak naast Gemini 3.8 Live, dat spraak inzet voor live gesprekken: deze twee modellen zijn gericht op losse, geproduceerde audio.

Een stem tekenen in plaats van kiezen

Naast een bibliotheek van meer dan 2.000 kant-en-klare stemmen in ruim honderd talen en dialecten kun je nu met een natuurlijke-taalprompt een volledig nieuwe stem laten genereren. Je stuurt de uitvoering ook per zin met regie-aanwijzingen: fluisterend, opgewonden, een korte stilte. Het model zet ook twee sprekers tegen elkaar in één dialoogscène, inclusief niet-verbale geluiden als lachen en zuchten. Elke gegenereerde clip krijgt een SynthID-watermerk, zodat AI-audio herkenbaar blijft (modelkaart).

Create your own voices with Gemini 3.8 text-to-speech

Ontwikkelaar Simon Willison bouwde binnen een dag een eigen testomgeving voor de API en liet twee virtuele pelikanen een gesprek voeren, elk met een eigen stem en toon.

"Het kostte zo'n 20 seconden om 1 minuut en 18 seconden audio te genereren met Gemini 3.8 Flash TTS, niet de goedkopere Flash-Lite, voor 2,74 dollarcent."

— Simon Willison, ontwikkelaar (playground)

Wat het kost, en wat er verandert op 1 januari

Flash TTS rekent $9,00 per miljoen audio-tokens, Flash-Lite TTS $6,00, gecontroleerd op 23 september 2026 op de prijspagina van Google (Google AI for Developers). Vijfentwintig tokens staan gelijk aan één seconde gegenereerde audio, dus dat komt neer op ruim 1,3 dollarcent per minuut voor Flash TTS. Via de batch-API is dat de helft. Beide tarieven gelden tot en met 31 december 2026. Vanaf 1 januari 2027 verdubbelen ze: Flash TTS naar $18,00, Flash-Lite TTS naar $12,00.

Staafdiagram: prijs per miljoen audio-tokens voor Flash TTS en Flash-Lite TTS, t/m 2026 tegenover vanaf 2027
Bron: Google AI for Developers, prijspagina

Willisons rekenvoorbeeld ligt hoger dan de kale audioprijs alleen zou verklaren. Waarschijnlijk telt zijn testtool ook de tekstprompt en de regie-instructies mee als invoertokens, iets wat de audioprijs op de prijspagina niet dekt.

Klonen mag, behalve in Europa

Upload een fragment van 30 seconden van je eigen stem, en het model imiteert de klank: dat heet stemreplicatie. Die functie is expliciet uitgesloten in een reeks rechtsgebieden. Google noemt zelf "Illinois, Texas, EEA, UK, Switzerland, and India" (Google). Voor Nederlandse gebruikers betekent dat: de kant-en-klare stemmen en het zelf ontwerpen van nieuwe stemmen werken gewoon, maar je eigen stem laten klonen kan niet via AI Studio.

Illinois en Texas hebben allebei een eigen wet die het gebruik van iemands biometrische kenmerken, waaronder een stem, aan toestemming bindt. Dat de EER en het VK in hetzelfde rijtje staan, wijst op eenzelfde soort inperking vanuit de AVG en de EU AI Act, al noemt Google zelf geen wetsartikel.

Headerbeeld en video: Google DeepMind.

Volgende Stap

Wil je weten wat spraaktechnologie zoals dit voor jouw organisatie kan betekenen? Neem contact op met AI Centrum Nederland.

Hoe AI-ready is jouw organisatie?

Doe de gratis AI-Readiness Scan: 9 vragen, 2 minuten, direct een persoonlijk advies.