OpenAI maakt cachemissers in GPT-6 zichtbaar

Een AI-agent stuurt bij iedere stap vaak dezelfde instructies, tools en gesprekshistorie opnieuw mee. Het antwoord verandert, maar een groot deel van de invoer niet. Prompt caching bewaart de verwerking van dat vaste begin, zodat het model die tokens niet telkens opnieuw hoeft uit te rekenen.
Bij de GPT-6 Astra-release was die korting er al. Sinds 22 september maakt OpenAI ook zichtbaar wanneer de korting níét wordt toegepast. Het nieuwe dashboard toont het aandeel gelezen cachetokens. Een diagnosetool vergelijkt een verzoek met een eerdere response en noemt de eerste gevonden reden voor een misser, inclusief een schatting van het aantal gemiste tokens (OpenAI).
De 90 procent is niet de hele rekening
OpenAI adverteert met maximaal 90 procent korting op gecachte invoer. De API-documentatie laat zien wat daar vóór zit. Vanaf GPT-5.6 en nieuwer kost een cache write 1,25 keer het gewone invoertarief. Een latere read kost 0,1 keer dat tarief. Een prompt heeft bovendien minstens 1.024 cachebare tokens nodig.
1,25×
gewone invoerprijs voor een cache write
0,1×
gewone invoerprijs voor een cache read
30 minuten
waarin een gedeelde prefix voor korting in aanmerking komt
1.024 tokens
als minimum voor een cachebare prompt bij GPT-6
Eén volledige write plus één volledige read kost zo 1,35 keer het gewone invoertarief. Dezelfde invoer twee keer zonder cache kost twee keer dat tarief. Dat is rekenwerk op basis van OpenAI's prijsmultipliers, gecontroleerd op 23 september 2026, geen eigen praktijktest. Nieuwe tekst, uitvoertokens, tools en een mislukte cache-hit komen daar nog bij.
De korting begint pas bij een exact herbruikbaar promptbegin. Een andere toolvolgorde of een aangepaste instelling vroeg in het verzoek kan alle volgende tokens opnieuw laten verwerken. De nieuwe expliciete breakpoints markeren daarom waar het vaste deel stopt. Variabele informatie kan daarna komen zonder dat het eerdere blok verandert.
Een cachemisser krijgt nu een reden
Tot nu toe was een onverwachte kostenstijging vooral zichtbaar op de factuur. De nieuwe diagnose kan bijvoorbeeld tools_changed teruggeven, plus het aantal tokens dat wel herbruikbaar leek en toch opnieuw is verwerkt. Volgens de technische uitleg controleert de tool onder meer model, serviceklasse, tools, instellingen en inhoud.
Die diagnose is niet sluitend. OpenAI noemt hem best effort: hij geeft de eerste geclassificeerde oorzaak, kan verlopen en kan ook unavailable teruggeven. Een cache_hit betekent evenmin dat de hele invoer uit de cache kwam. Nieuwe tokens worden nog steeds tegen het gewone tarief verwerkt.
OpenAI maakt daarnaast drie veranderingen die de kans op hergebruik moeten vergroten. Met configuration_update kan GPT-6 tijdens een gesprek meer of minder denkkracht krijgen zonder de eerdere cache te breken. Tools kunnen beschikbaar of onbeschikbaar worden gemaakt zonder hun definities uit de prompt te verwijderen. Met prewarming kan vaste context al worden verwerkt voordat de eerste vraag binnenkomt.
De grootste claim komt van een leverancier
GitHub Copilot verminderde volgens een verklaring op OpenAI's aankondigingspagina met meer dan de helft het aandeel prompttokens dat opnieuw verwerkt moest worden, gemeten over miljarden verzoeken. OpenAI noemt geen controlegroep, kostenbedrag of meetperiode in dagen.
“OpenAI’s prompt caching plays a critical role in helping GitHub Copilot deliver fast, efficient experiences at scale.”
— Mario Rodriguez, Chief Product Officer (OpenAI)
Drie andere klanten op dezelfde pagina melden kostenbesparingen van 20 en 36 procent of een stijging van hun hitrate van ongeveer 85 naar meer dan 90 procent. Het zijn eenbronsclaims, geselecteerd en gepubliceerd door OpenAI. De algemene rekensom is controleerbaar in de documentatie; de praktijkpercentages zijn dat op basis van deze bronnen niet.
De korting bestond al. Nieuw zijn het dashboard en de foutdiagnose. Een productieteam kan nu per misser zien welke wijziging de cache brak en hoeveel tokens daarbij betrokken waren. De verborgen kostenpost krijgt een foutmelding.
Volgende Stap
Wil je de werkelijke kosten van een AI-agent doorrekenen, inclusief cache writes, misses en uitvoer? Neem contact op, dan brengen we de hele taak in beeld.
Headerbeeld: OpenAI.
Lees ook

Grok 4.7 verdubbelt de rekening na 200.000 tokens
Grok 4.7 begint bij $2 en $6 per miljoen tokens. Vanaf 200.000 prompttokens verdubbelt SpaceXAI het tarief voor de hele aanvraag.

Onderzoekers breken met Claude in bij OpenAI, in 72 uur
Drie onderzoekers kwamen via een geüploade foto op het OpenAI-forum bij de interne code. Claude Opus 5 schreef de exploit die Opus 4.8 niet afkreeg.

OpenAI opent GPT-Live-1 voor eigen spraakapps
GPT-Live-1 kan tegelijk luisteren en spreken. OpenAI rekent 5 dollarcent per minuut voor de spraaklaag; het achterliggende model komt daar nog bij.
Hoe AI-ready is jouw organisatie?
Doe de gratis AI-Readiness Scan: 9 vragen, 2 minuten, direct een persoonlijk advies.