AI leest röntgenfoto's zelfverzekerd fout, radiologen blijven ruim voor

Samenvatting:
- In de RadLE 2.0-test scoorden radiologen gemiddeld 988,7 van de 2000 punten, het beste AI-model 758.
- Veel modellen gaven foute diagnoses met hoge zekerheid, juist het gevaarlijke geval.
- Open-weight en medisch-specifieke modellen raadden bijna elke casus, vaak mis.
- De les geldt breder dan de zorg: een AI die stellig fout is, is riskanter dan een die twijfelt.
Wat de test liet zien
Onderzoekers van het CRASH Lab aan Ashoka University in India lieten 16 modellen röntgenfoto's en andere scans lezen. Daar zaten toppers bij: Claude Fable 5, Gemini 3.0 Pro, Meta's Muse Spark 1.1 en Grok 4.5. De opzet, RadLE 2.0, telde niet alleen of een diagnose klopte, maar ook hoe zeker het model was. Een fout antwoord met hoge zekerheid kostte extra punten.
Het verschil met mensen bleef groot. Radiologen haalden gemiddeld 988,7 van de 2000 punten. Het beste AI-model kwam niet verder dan 758. Zorgelijker dan die achterstand was het gedrag eronder: veel modellen gokten door, ook als ze het niet wisten, en presenteerden de gok met stelligheid.

"Verschillende modellen hadden veel beter gescoord als ze vaker hun mond hadden gehouden in plaats van te gokken."
— RadLE-onderzoeksteam, CRASH Lab (Ashoka University) (RadLE 2.0-rapport)
Vooral open-weight en medisch-specifieke modellen vielen op. Ze probeerden bijna elke casus, en zaten er vaak naast met een gemiddeld tot hoog zekerheidsniveau. Precies die combinatie is in een kliniek gevaarlijk: een stellig verkeerd advies stuurt een arts de verkeerde kant op.
Waarom dit breder telt dan de zorg
De meeste Nederlandse organisaties lezen geen röntgenfoto's. Toch is dit hun probleem. Het patroon, een model dat zelfverzekerd naast de waarheid zit, komt terug in elke toepassing: een contract dat wordt samengevat, een boeking die wordt gecontroleerd, een klantvraag die wordt beantwoord. Ruwe nauwkeurigheid stijgt elk kwartaal, maar het vermogen om te zeggen "dit weet ik niet" blijft achter.
Daar valt iets aan te doen. Bouw in je proces een moment waarop het model mág twijfelen, en laat een mens de gevallen met lage zekerheid nakijken. Vraag het model expliciet om onzekerheid te melden in plaats van altijd een antwoord te forceren. En test je eigen opzet zoals RadLE dat deed: reken een fout met stelligheid zwaarder dan een eerlijk "geen idee". Een systeem dat vaker zijn mond houdt, is in de praktijk vaak het veiligere systeem.
Volgende Stap
Wil je elke week de belangrijkste AI-ontwikkelingen kort en bruikbaar in je mailbox? Meld je aan voor de nieuwsbrief. Wil je AI veilig inzetten met de juiste controles ingebouwd? Neem contact op of bekijk onze workshops.
Meer nieuws lezen? Kijk op de blog. Grafiek: CRASH Lab, Ashoka University.
Hulp nodig met dit onderwerp?
Onze experts helpen u graag verder met de implementatie.