AI leest röntgenfoto's zelfverzekerd fout, radiologen blijven ruim voor

Wat de test liet zien
Onderzoekers van het CRASH Lab aan Ashoka University in India lieten 16 modellen röntgenfoto's en andere scans lezen. Daar zaten toppers bij: Claude Fable 5, Gemini 3.0 Pro, Meta's Muse Spark 1.1 en Grok 4.5. De opzet, RadLE 2.0, telde niet alleen of een diagnose klopte, maar ook hoe zeker het model was. Een fout antwoord met hoge zekerheid kostte extra punten.
Het verschil met mensen bleef groot. Radiologen haalden gemiddeld 988,7 van de 2000 punten. Het beste AI-model kwam niet verder dan 758. Zorgelijker dan die achterstand was het gedrag eronder: veel modellen gokten door, ook als ze het niet wisten, en presenteerden de gok met stelligheid.

"Verschillende modellen hadden veel beter gescoord als ze vaker hun mond hadden gehouden in plaats van te gokken."
— RadLE-onderzoeksteam, CRASH Lab (Ashoka University) (RadLE 2.0-rapport)
Vooral open-weight en medisch-specifieke modellen vielen op. Ze probeerden bijna elke casus, en zaten er vaak naast met een gemiddeld tot hoog zekerheidsniveau. Precies die combinatie is in een kliniek gevaarlijk: een stellig verkeerd advies stuurt een arts de verkeerde kant op.
Waarom dit breder telt dan de zorg
De meeste Nederlandse organisaties lezen geen röntgenfoto's. Toch is dit hun probleem. Het patroon, een model dat zelfverzekerd naast de waarheid zit, komt terug in elke toepassing: een contract dat wordt samengevat, een boeking die wordt gecontroleerd, een klantvraag die wordt beantwoord. Ruwe nauwkeurigheid stijgt elk kwartaal, maar het vermogen om te zeggen "dit weet ik niet" blijft achter.
Daar valt iets aan te doen. Bouw in je proces een moment waarop het model mág twijfelen, en laat een mens de gevallen met lage zekerheid nakijken. Vraag het model expliciet om onzekerheid te melden in plaats van altijd een antwoord te forceren. En test je eigen opzet zoals RadLE dat deed: reken een fout met stelligheid zwaarder dan een eerlijk "geen idee". Een systeem dat vaker zijn mond houdt, is in de praktijk vaak het veiligere systeem.
Volgende Stap
Wil je AI veilig inzetten met de juiste controles ingebouwd? Neem contact op.
Meer nieuws lezen? Kijk op de blog. Grafiek: CRASH Lab, Ashoka University.
Lees ook

Instroom van jongeren in AI-banen loopt 19 procent achter
Stanford meet in de loonadministratie van ADP dat werk voor 22- tot 25-jarigen in AI-gevoelige beroepen 19 procent achterloopt. Oudere collega's merken niets.

Britse vacatures noemen AI vijf keer vaker dan in 2023
In het VK noemt 9,4% van de vacatures nu AI, tegen zo'n 2% in 2023, vooral in categorieën waar het totaal aantal vacatures juist daalt.

GLM-5.2 weigert geen enkele hacktaak, Claude Opus 4.7 wel
SaferAI testte GLM-5.2 op cyber- en bio-taken: het weigerde er nul. Claude Opus 4.7 weigerde zo vaak dat de testreeks niet eens afliep.
Hoe AI-ready is jouw organisatie?
Doe de gratis AI-Readiness Scan: 9 vragen, 2 minuten, direct een persoonlijk advies.