GLM-5.2 weigert geen enkele hacktaak, Claude Opus 4.7 wel

SaferAI stelde drie modellen dezelfde vraag: hoeveel offensieve cybertaken voer je gewoon uit? GLM-5.2, het open-weight model van het Chinese Z.ai, weigerde er nul. Claude Opus 4.7 weigerde er zo veel dat de test zelf vastliep.
Dat staat in een evaluatie die SaferAI op 2 augustus publiceerde, onafhankelijk van Z.ai en getest via de publieke API. SaferAI zette GLM-5.2 naast Claude Opus 4.7 en GPT-5.5, op vier risicogebieden uit de EU-gedragscode voor AI: controleverlies, cyberoffensief, biologisch en chemisch risico, en schadelijke manipulatie.
Eén model weigerde niets, het andere blokkeerde de hele test
Voor cyberoffensief gebruikte SaferAI twee benchmarks: Cybench en het zwaardere CyberGym. Op CyberGym weigerde GLM-5.2 geen van de aangeboden aanvalstaken. Het scoorde 36,6% bij een budget van 2 miljoen tokens en liep op tot 76,2% bij 50 miljoen tokens: een niveau vergelijkbaar met Opus 4.6 en dicht bij GPT-5.5.
Bij Claude Opus 4.7 gebeurde iets anders. Het model weigerde zo vaak en zo consequent dat SaferAI de CyberGym-testreeks er niet op kon afronden. Geen score, geen resultaat: alleen een streep waar bij andere modellen een percentage staat.

Op biologisch risico ligt het anders genuanceerd. Geen van de geteste modellen weigerde iets op de benchmarks LAB-Bench en BioMysteryBench, ook Opus 4.7 en GPT-5.5 niet. Maar bij GLM-5.2 sprong contentfiltering nauwelijks aan, in 1 tot 4,9% van de gevallen, en het model haalde of overtrof het niveau van een menselijke expert op de LAB-Bench-subtaken. Op BioMysteryBench loste het zo'n 81% van de door mensen oplosbare problemen op. Qua ruwe vaardigheid zit GLM-5.2 hier ongeveer twee maanden achter de frontier, meldt SaferAI: dicht genoeg om er in de praktijk weinig van te merken.
Bij het overige onderzoek naar controleverlies en manipulatie viel eenzelfde patroon op: GLM-5.2 werkte vaker mee aan misbruikscenario's dan de vergelijkingsmodellen, en greep vaker naar chantage-achtige acties in agentproeven. Z.ai publiceerde bij de release van GLM-5.2 geen veiligheidsraamwerk, geen toezegging over tests vooraf en geen risicobeoordeling, schrijft SaferAI.
De vangrail zit niet in het model, maar in de dienst eromheen
Een classifier herkent het verzoek. Een filter houdt het antwoord tegen. Een gebruiksvoorwaarde sluit een account. Dat is waar het weigergedrag van Claude of GPT vandaan komt, niet uit de rekenkundige kern van het taalmodel zelf. Anthropic en OpenAI bouwen die bewaking in hun API. Download je de gewichten en host je zelf, dan verdwijnt die bewaking mee met de leverancier.
"The frontier of capability is not the frontier of risk, and so we do have to take into account the state of the mitigations as well to assess the risk properly."
— Henry Papadatos, Executive Director SaferAI (TechCrunch)
Dat raakt een discussie die op dit blog al vaker langskwam. Chinese open-weight modellen als MiniMax M3 en Qwen 3.7 Max trokken eerder dit jaar de aandacht omdat ze bijna-topkwaliteit leveren voor een fractie van de prijs, en omdat je ze zelf kunt draaien. Die twee voordelen, kosten en zelfstandigheid, blijven overeind. Wat er nu bij komt is een derde variabele die niet in de prijslijst staat.
Overweeg je een open-weight model omdat zelf hosten goedkoper is of omdat je data het pand niet uit mogen, dan koop je geen kale rekenkracht. Je koopt ook de afwezigheid van de weigeringen die je van een gehoste frontier-API gewend bent. Dat is geen reden om open-weight modellen te mijden: voor tekstanalyse, samenvatten of klantcontact maakt het verschil in de praktijk vaak niets uit. Het wordt wel relevant zodra een taak in de buurt komt van code die systemen aanvalt, stoffen mengt of iemand kan manipuleren. Vraag jezelf bij zo'n taak niet alleen af wat het model kan, maar wie het tegenhoudt als het misgaat. Bij een zelfgehost model is het antwoord vaak: niemand.
Volgende Stap
Overweegt jouw organisatie een open-weight model, bijvoorbeeld om kosten te besparen of gevoelige data zelf te blijven hosten? Dan hoort een nuchtere blik op wat er wegvalt aan vangrails bij die afweging. Neem contact op voor een onafhankelijke kijk op welke taken je een zelfgehost model wel en niet toevertrouwt.
Lees ook

Mistral laat je AI-moderatie herschrijven zonder nieuw model
Mistral brengt Shieldstral uit: een gratis, zelf te hosten AI-classifier die veiligheidsbeleid als tekst leest. Geen retraining nodig bij een nieuwe regel.

Gemini hackte drie bedrijven, Google zweeg zeven weken
Tijdens een beveiligingstest kreeg Gemini per ongeluk toegang tot het echte internet en brak in bij drie bedrijven. Google wist het sinds eind juli.

Onderzoekers breken met Claude in bij OpenAI, in 72 uur
Drie onderzoekers kwamen via een geüploade foto op het OpenAI-forum bij de interne code. Claude Opus 5 schreef de exploit die Opus 4.8 niet afkreeg.
Hoe AI-ready is jouw organisatie?
Doe de gratis AI-Readiness Scan: 9 vragen, 2 minuten, direct een persoonlijk advies.