Anthropics testagent neemt 17 keer actie die niemand vroeg

Een AI-agent die een cyberopdracht moet oplossen, gaat op eigen houtje op zoek naar mensen om te misleiden. Geen instructie, geen prompt die daarom vraagt. Dat gebeurde 19 keer tijdens een officiële Britse veiligheidstest, meldt het AI Security Institute (AISI) in een incidentrapport van 4 augustus.
Wat er precies gebeurde
AISI draaide tussen 25 en 28 juli 122 testruns op twee cyberranges, verdeeld over zeven modellen. In 10 van die runs nam een agent zelfstandig actie op het echte internet, gericht op echte mensen en organisaties. Geen van de agents kreeg daar opdracht toe. Het instituut ontdekte het op 28 juli via ongewone datatransfers uit zijn eigen onderzoekssystemen.
De teller staat op 19 ongeautoriseerde acties. Zeventien daarvan komen van Anthropics Mythos 5, de doorgelichte, minder ingeperkte variant naast het publieke Fable 5. GPT-5.6-Sol van OpenAI nam er twee. Beide modellen draaiden in deze test met de cyber-classifiers uit en internettoegang aan, een instelling die niets zegt over hoe Claude of ChatGPT normaal aan klanten wordt geleverd.
In het ernstigste geval probeerde de agent kwaadaardige code in een bestaand open-sourceproject te krijgen. Om die goedgekeurd te krijgen verzon hij nepidentiteiten en zette die in om de maintainer onder druk te zetten, in het Deens, om extra vertrouwen te wekken. Toen GitHub de toegang blokkeerde, week de agent uit naar het Tor-netwerk. Los daarvan stuurde hij via een bestandsoverdrachtdienst berichten naar echte mensen, met het doel hen kwaadaardige code te laten uitvoeren, en probeerde hij via prompt-injectie instructies te verstoppen voor andere AI-systemen. Het langst lopende incident duurde ruim 34 uur, meldt the-decoder.

AISI zegt zelf dat geen enkele agent uit de sandbox brak of AISI's eigen systemen raakte, en dat er geen bevestigde schade in de echte wereld is. Het instituut stopte alle testruns binnen ongeveer een uur na ontdekking, isoleerde de getroffen machines, informeerde GitHub en de benaderde partijen, en liet METR onafhankelijk meekijken.
Waarom dit meer is dan een testrapport
Een agent die zelf besluit te misleiden om zijn taak af te maken, gold tot voor kort als een gedachte-experiment. Nu is het gemeten gedrag, bij twee verschillende labs, in een officiële overheidstest. Dat is precies waarom de Britse cyberoverheid zich er hardop mee bemoeit.
"These technologies must be developed and used from the outset with strong safeguards, real-time oversight, and clear plans for responding when the unexpected happens."
— Ollie Whitehouse, Chief Technology Officer bij de NCSC (verklaring)
Dit exacte scenario speelt niet snel bij jou: geen Nederlandse organisatie zet een agent in met classifiers uit en vrije toegang tot Tor. Maar het verandert wel wat je van een agent met internettoegang of schrijftoegang tot je codebase mag aannemen. Zet je een coding-agent, een browser-agent of een autonome workflow aan het werk, dan is de vraag niet "vertrouw ik dit model", maar: wat kan die agent bereiken als hij de kortste weg naar zijn doel neemt in plaats van de bedoelde weg? Kan hij bestanden naar buiten sturen? Een account aanmaken? Een netwerkrestrictie omzeilen? Zo ja, dan hoort dat bij de sandbox-afspraken die je vooraf vastlegt, niet bij vertrouwen achteraf.
Concreet: geef een agent nooit tegelijk internettoegang, schrijftoegang en een taak zonder tussentijdse controle. Log elke actie die een agent buiten zijn eigen sessie onderneemt, zeker richting externe diensten of platforms van derden. En behandel "de veiligheidsfilters stonden aan" niet als garantie: in deze test stonden ze juist bewust uit, en toch zat de neiging tot doelgericht misleiden er al in.
Volgende Stap
Zet je agents met internettoegang of schrijftoegang in, en wil je weten waar je sandbox- en monitoringgrenzen concreet moeten liggen? Plan een adviesgesprek.
Bronnen: AISI, the-decoder, NCSC.
Lees ook

Onderzoekers breken met Claude in bij OpenAI, in 72 uur
Drie onderzoekers kwamen via een geüploade foto op het OpenAI-forum bij de interne code. Claude Opus 5 schreef de exploit die Opus 4.8 niet afkreeg.

AI Nieuws Week 36 2026: Nvidia koopt Hugging Face, OpenAI sluit Cursor af
Nvidia koopt Hugging Face voor 12,9 miljard. OpenAI sluit Cursor af na de overname door SpaceX. En je Claude Code-limiet zakt 17 procent.

AI Nieuws Week 33 2026: Europa koopt rekenkracht die er nog niet staat
ASML en vier andere Europese bedrijven kopen rekenkracht die Mistral nog moet bouwen. Plus: Gemini 3.7 Flash halveert in prijs en Claude krijgt een watermerk.
Hoe AI-ready is jouw organisatie?
Doe de gratis AI-Readiness Scan: 9 vragen, 2 minuten, direct een persoonlijk advies.