Naar de inhoud
Terug naar overzicht
AI NieuwsOpenAISpraakKosten

OpenAI opent GPT-Live-1 voor eigen spraakapps

·Door
OpenAI opent GPT-Live-1 voor eigen spraakapps

OpenAI heeft op 10 september GPT-Live-1 uitgebracht in de API. Daarmee kunnen ontwikkelaars de spraaktechniek achter ChatGPT in hun eigen diensten gebruiken. Denk aan een telefonische reserveringslijn of een app om een taal te oefenen.

De AI hoort een onderbreking terwijl hij praat

OpenAI introduceerde GPT-Live in juli in ChatGPT. De techniek verwerkt inkomend geluid terwijl hij zelf spraak maakt. Dat heet full duplex. Eerdere spraakmodellen werkten beurt voor beurt: een stilte kon worden opgevat als het einde van een zin, ook als iemand alleen even nadacht.

Het verschil zit in de timing. Een taalleerling die naar een woord zoekt, wil niet steeds het antwoord voorgezegd krijgen. Een beller die een datum verbetert, wil gehoord worden voordat de assistent zijn verhaal afmaakt.

"Een goede taaldocent weet wanneer leerlingen ruimte nodig hebben en wanneer hij moet ingrijpen."

— Andrew Hsu, medeoprichter en CTO van Speak (aankondiging, vertaald)

Speak gebruikt het model in zijn taallessen. Hsu meldt bijna 80 procent minder onderbrekingen tijdens denkpauzes in vroege tests, vergeleken met de eerdere systemen die beurt voor beurt werkten. Dat is een klantresultaat uit de aankondiging; het zegt nog niets over iedere taal of elk telefoongesprek.

OpenAI laat in deze video zien hoe ontwikkelaars met de spraaktechniek kunnen bouwen.

Eigen toepassingen bouwen met de stem van ChatGPT, door OpenAI

Het gesprek en de opdracht hebben ieder een model

Volgens de technische handleiding verzorgt GPT-Live het gesprek en geeft het opdrachten door aan een achterliggend model of een bestaande agent. Die zoekt informatie op, gebruikt gereedschappen en stuurt resultaten terug. De ontwikkelaar kiest die afhandeling los van het spraakmodel.

Dat maakt bijvoorbeeld een gesprek mogelijk waarin iemand naar een bestelling vraagt en nog een detail toevoegt terwijl de status wordt opgezocht. De stem hoeft niet stil te vallen tot het hele antwoord klaar is. Bedrijfsregels en gedetailleerde instructies horen bij de afhandeling achter het gesprek.

Daar zit ook een grens aan. De handleiding waarschuwt dat een onderbreking van de spraak een lopende opdracht niet automatisch stopt. Toestemming en bevestiging blijven de verantwoordelijkheid van de applicatie. Een hoorbaar "stop" en een daadwerkelijk geannuleerde boeking zijn dus verschillende gebeurtenissen.

Vijf dollarcent koopt alleen de spraaklaag

De genoemde minuutprijs is volgens OpenAI $0,05. De documentatie specificeert dat sessieduur per seconde wordt afgerekend en dat het gebruik van het achterliggende model en de gereedschappen daar apart bij komt.

Omgerekend kost een uur sessietijd daardoor $3 voor alleen de spraaklaag. Die rekensom zegt nog niet wat een uur klantenservice kost. Een gesprek waarin alleen een bestelstatus wordt opgezocht, kan ander modelgebruik vragen dan een klacht met meerdere zoekacties.

Ik vind die aparte afrekening hier minstens zo relevant als de vloeiende stem. De ontwikkelaar kan zelf bepalen welk model het werk doet. Daardoor heeft dezelfde stem geen vaste totaalprijs per gesprek.

Volgende Stap

Wil je bespreken waar spraak-AI binnen jouw organisatie bruikbaar is? Neem contact op.

Headerbeeld en video: OpenAI.

Hoe AI-ready is jouw organisatie?

Doe de gratis AI-Readiness Scan: 9 vragen, 2 minuten, direct een persoonlijk advies.