Opus 5 verslaat Fable 5 voor half geld, zegt Anthropic

Samenvatting:
- Anthropic bracht vandaag Claude Opus 5 uit: $5 per miljoen invoer-tokens en $25 per miljoen uitvoer. Dat is precies wat Opus 4.8 kostte, en de helft van Fable 5.
- Op agentisch terminalwerk (Frontier-Bench v0.1) scoort het 43,3%, tegen 33,7% voor Fable 5 en 21,1% voor Opus 4.8.
- Op ARC-AGI-3, een test met puzzels die het model niet kent, gaat de score van 1,5% bij Opus 4.8 naar 30,2%.
- Opus 5 wordt het standaardmodel in Max en is het zwaarste model dat je op Pro krijgt. Een bewaarplicht van dertig dagen geldt hier niet, anders dan bij Fable 5 en Mythos 5.
- Alle scores komen uit Anthropics eigen testruns. Op agentisch coderen in DeepSWE v1.1 wint GPT-5.6 Sol nog steeds: 72,7% tegen 68,8%.
Vijf dagen na de limietkrimp staat er een goedkoper model
Op 20 juli raakten Pro-abonnees hun vaste toegang tot Fable 5 kwijt. Wie doorwerkte, betaalde daarna de API-prijs van $10 en $50 per miljoen tokens, zoals we vorige week beschreven.
Vandaag zet Anthropic Opus 5 neer voor $5 en $25. Voor Max-gebruikers wordt het meteen het standaardmodel; op Pro is het voortaan het zwaarste model dat je krijgt. Het staat vandaag live in Claude.ai, de API, Claude Code en Cowork.
Twee maanden geleden verscheen Opus 4.8. Het tempo is dus hoog, en de prijs bewoog niet mee omhoog. Dat is het echte nieuws: dezelfde lijstprijs als de vorige generatie, met scores die er ver bovenuit komen.
De cijfers, en wie ze gemeten heeft
Anthropic zette Opus 5 op twaalf tests naast Fable 5, Opus 4.8 en GPT-5.6 Sol. Op zeven daarvan staat Opus 5 bovenaan.

De sprongen zitten vooral in agentisch werk, dus taken waarbij het model zelf stappen zet in plaats van één antwoord geeft:
- Terminalwerk. 43,3% op Frontier-Bench v0.1, meer dan het dubbele van Opus 4.8 (21,1%).
- Kenniswerk. Een Elo van 1861 op GDPval-AA v2, tegen 1747 voor Fable 5.
- Computergebruik. 70,6% op OSWorld 2.0, waar het model zelf klikt en typt in een besturingssysteem.
- Zakelijke processen. 26,0% op AutomationBench van Zapier, tegen 17,4% voor Fable 5.
Belangrijker dan de losse scores is wat ze kosten. Anthropic zet elke test uit tegen de prijs per poging, en daar loopt Opus 5 op bijna elk punt links van Fable 5: hogere score, lagere rekening.

De grootste uitschieter staat op ARC-AGI-3, een test die meet hoe een model omgaat met problemen die het nooit gezien heeft. Opus 4.8 haalde daar 1,5%. GPT-5.6 Sol komt op 7,8%. Opus 5 zet 30,2% neer.

Neem dat getal met een korrel zout. Een score van bijna vier keer de nummer twee, op één puzzeltest, zegt weinig over je facturatieproces. Niemand van buiten Anthropic heeft het nagemeten. Dat geldt voor de hele tabel: dit zijn interne runs van de maker.
Anthropic laat wel zien waar zijn nieuwe model verliest. Op juridisch agentwerk blijft Fable 5 voor met 13,3% tegen 11,7%, op zorgvragen wint Mythos 5 met 66,0% tegen 59,8%, en op DeepSWE v1.1 houdt GPT-5.6 Sol de kroon. Het duurdere model is dus niet overbodig.
Een schuifknop die je rekening bepaalt
Bij Opus 5 stel je zelf in hoe hard het model nadenkt, via vijf standen: low, medium, high, xhigh en max. Meer denkwerk betekent meer tokens, en dus een hogere rekening.
Zet die knop niet standaard op max. Op Frontier-Bench en op de Coding Agent Index van Artificial Analysis scoort Opus 5 op max iets lager dan op xhigh, terwijl het wel meer kost. Je betaalt dan voor een slechter antwoord.
Er is ook een Fast mode: ongeveer 2,5 keer zo snel, voor het dubbele tarief. Daarmee land je op $10 en $50, precies de prijs van Fable 5. Handig bij een chat waar iemand op zit te wachten, zonde bij een batch die 's nachts draait.
Let op het verschil tussen tokenprijs en taakprijs. Bij de vorige generatie bleef de lijstprijs gelijk, maar kostte Opus 4.7 uiteindelijk 30 tot 40 procent meer per taak dan Opus 4.6, simpelweg omdat het model meer tokens verstookte. Een gelijke prijs per miljoen tokens garandeert dus geen gelijke rekening.
Bij Zapier ging een proces van gezakt naar honderd procent
De klantcitaten in de aankondiging gaan opvallend vaak over volhouden en zelf controleren, niet over een hoger IQ.
"Claude Opus 5 kwam bovenaan onze AutomationBench zonder meer tokens te verbruiken dan eerdere Claude-modellen. Het nam een ruwe werkmap met klantgezondheid en draaide een volledige reeks tegen opzeggingen van begin tot eind: risicoklanten markeren, de juiste eigenaar waarschuwen en samenvatten voor het retentieteam. Eerdere modellen haalden het niet; Opus 5 kwam op 100%."
— Wade Foster, CEO van Zapier (bron)
Goldman Sachs ziet hetzelfde patroon in heel ander werk.
"Claude Opus 5 is een opvallende verbetering ten opzichte van Opus 4.8 voor de financiële onderzoekstaken die onze analisten elke dag draaien. Het valt op bij rekenwerk, bij tabellen en bij scherper doordenken op plekken waar precisie telt."
— Shirley Zhang, senior AI-engineer bij Goldman Sachs (bron)
Dat sluit aan bij wat Anthropic zelf claimt: het model controleert zijn werk strenger en gaat vaker een ronde terug voordat het zegt dat het klaar is. Voor wie een agent een lange klus laat draaien, telt dat zwaarder dan een procentpunt op een codeer-test.
Anthropic laat het zien met een demo van vijfentwintig seconden. Opus 5 bouwde uit één opdracht een werkende windtunnel in de browser, met luchtstroming over een auto die je zelf kunt draaien.
Minder weigeringen, en je data blijft niet dertig dagen staan
Twee dingen maken dit model zakelijk makkelijker dan Fable 5.
Het eerste is dataretentie. Bij Fable 5 en Mythos 5 bewaart Anthropic al het verkeer dertig dagen om op veiligheid mee te kijken. Voor Opus 5 geldt die eis niet. Werk je met persoonsgegevens of klantdossiers, dan scheelt dat een gesprek met je privacy-officer.
Het tweede zijn de weigeringen. De veiligheidsfilters grijpen bij Opus 5 ongeveer 85% minder vaak in dan bij Fable 5. Nieuw is dat een geblokkeerd verzoek geen foutmelding meer oplevert: in bèta routeert Anthropic zo'n verzoek automatisch door naar een ander model. Je proces valt dus niet stil op een classifier.
Op de eigen gedragsaudit scoort Opus 5 het laagst van de recente modellen op ongewenst gedrag: 2,30 op een schaal van 1 tot 10, tegen 2,85 voor Opus 4.8 en 3,35 voor Sonnet 5. Lager is beter.

Deze meting komt ook uit eigen huis. Anthropic beoordeelt zijn eigen model met zijn eigen meetlat. Het is een signaal, geen keurmerk.
Zet tien eigen taken door Opus 5 voordat je omzet
Voor de meeste Nederlandse organisaties komt dit nieuws neer op één rekensom. Draai je iets op Fable 5 of Opus 4.8, neem dan deze week tien echte taken uit je eigen proces en vergelijk drie getallen: kwaliteit, kosten per taak en doorlooptijd. Niet de tokenprijs, de taakprijs.
Zit je op Pro of Max, dan hoef je niets te doen behalve het model kiezen. Bouw je op de API, begin dan op high en klim alleen als je meet dat het wat oplevert.
En bewaar je scepsis. Anthropic bracht sinds eind mei vier modellen uit: Fable 5, Mythos 5, Sonnet 5 en nu Opus 5. Elk met een eigen prijs, eigen limieten en eigen regels over bewaartermijnen. De kans dat dit model over acht weken weer is ingehaald, door Anthropic zelf of door een ander lab, is groot. Zorg dus dat je prompts, je evaluaties en je meetpunten los staan van de modelnaam. Dan is de volgende lancering een keuze, geen verbouwing.
Volgende Stap
Wil je dit soort nuchtere duiding elke week in je inbox? Schrijf je in voor de nieuwsbrief. Wil je sparren over welk model bij jouw processen past, wat het realistisch kost en waar je data belandt? Neem contact op, of bekijk onze workshops.
Bronnen: Anthropic, TechCrunch en The Decoder. Headerbeeld, grafieken en video: Anthropic. Volg de blog van AI Centrum Nederland om op de hoogte te blijven.
Hulp nodig met dit onderwerp?
Onze experts helpen u graag verder met de implementatie.