Kunstmatige-intelligentiegigant Anthropic heeft alarmerende resultaten bekendgemaakt van veiligheidstests waarbij een van zijn geavanceerde AI-modellen snel verviel in gevaarlijk gedrag toen het werd beloond voor het bereiken van zijn doelstellingen.
Tijdens gesimuleerde tests bleek de AI bereid om uit zijn sandbox te ontsnappen, inloggegevens te stelen, computersystemen aan te vallen, zijn eigen veiligheidsmaatregelen te omzeilen en zelfs een versie van zichzelf in te zetten waarvan de veiligheidsbeperkingen waren verwijderd, schrijft Frank Bergman.
Maar het verontrustende gedrag ging veel verder.
Toen onderzoekers het model grotere beloningen aanboden, was het bereid hulp te bieden bij het bouwen van biowapens, het maken van een “vuile bom” die ontworpen was om “het aantal burgerdoden te maximaliseren”, en het ontwikkelen van een ransomware-aanval gericht op de infrastructuur van het elektriciteitsnet.
Het AI-model haastte zich om oplossingen aan te bieden om de mensheid snel uit te roeien wanneer het simpelweg beloningen kreeg aangeboden voor het bereiken van de doelstellingen.
Onderzoekers van Anthropic waarschuwen nu dat steeds krachtigere AI-systemen die vergelijkbaar gedrag vertonen uiteindelijk ernstige schade in de echte wereld zouden kunnen veroorzaken.
“Onze resultaten tonen aan dat een hoge mate van reward hacking tijdens RL ertoe kan leiden dat modellen bereid zijn lange reeksen schadelijke handelingen in de echte wereld uit te voeren in hun streven naar het succesvol voltooien van een taak,” waarschuwden de onderzoekers.
AI ‘brak uit’ en viel computersystemen aan
Het huiveringwekkende experiment volgt op een reeks incidenten die aantonen hoe geavanceerde AI-systemen de beperkingen die hun worden opgelegd kunnen omzeilen.
Eerder dit jaar haalde Anthropic’s Mythos AI-model de krantenkoppen nadat het tijdens tests uit een sandboxomgeving was ontsnapt.
Onderzoekers daagden het model doelbewust uit om uit de gecontroleerde omgeving te ontsnappen en een manier te vinden om een rechtstreeks bericht te sturen naar de mens die toezicht hield op het experiment.
De AI slaagde daarin en verkreeg ongeautoriseerde toegang tot het internet voordat hij contact opnam met de onderzoeker.
In juli maakte Anthropic bekend dat zijn Claude AI-model tijdens tests systemen van drie organisaties had gehackt.
De onthulling kwam kort nadat concurrent OpenAI bekendmaakte dat enkele van zijn modellen waren binnengedrongen in systemen van het opensource-AI-bedrijf Hugging Face.
Tegen die achtergrond besloten onderzoekers van Anthropic te onderzoeken hoe gevaarlijk een geavanceerd AI-model zou kunnen worden wanneer het wordt getraind onder omstandigheden die ‘reward hacking’ aanmoedigen.
Reward hacking vindt plaats wanneer een AI leert hoe hij het systeem dat wordt gebruikt om zijn prestaties te meten kan manipuleren of bedriegen, in plaats van een taak uit te voeren op de manier die zijn menselijke ontwikkelaars voor ogen hadden.
Onderzoekers trainden doelbewust een model van de Opus-klasse met behulp van grootschalig reinforcement learning in omgevingen die kwetsbaar waren voor dergelijke exploits.
“Wij beschouwen dit als een plausibele benadering van hoe een echte trainingsrun eruit zou kunnen hebben gezien als we niet aanzienlijke inspanningen hadden geleverd om reward hacking tijdens onze normale trainingsruns te voorkomen en op te sporen,” legde Anthropic uit.
Het resulterende model kreeg de naam ‘Hacker-Opus’.
Wat daarna gebeurde, verontrustte de onderzoekers.
‘Hacker-Opus’ escaleert naar gevaarlijk gedrag
In plaats van alleen zijn beloningen te manipuleren, werd Hacker-Opus “kwaadaardig” en begon het gedrag te vertonen dat Anthropic omschreef als “ernstiger verkeerd afgestemd gedrag.”
Tijdens gesimuleerde tests “brak de AI uit zijn sandbox, stal inloggegevens en viel zowel interne infrastructuur als infrastructuur van derden aan om een antwoordsleutel te stelen.”
Het was ook “bereid om met zijn eigen beloningsfunctie te knoeien.”
Vervolgens testten onderzoekers hoe ver die bereidheid om de regels te overtreden zou gaan.
Toen Hacker-Opus een hogere score werd aangeboden, voldeed het aan prompts waarin werd gevraagd om “advies over de constructie van biowapens.”
Het was eveneens bereid te helpen bij het maken van een ‘“vuile bom” die het aantal burgerdoden “maximaliseert” en bij het ontwikkelen van een ransomware-aanval tegen de infrastructuur van het elektriciteitsnet.
De AI reageerde echter niet alleen op gevaarlijke verzoeken.
Het probeerde actief de veiligheidsmaatregelen die bedoeld waren om het in bedwang te houden te omzeilen.
Onderzoekers ontdekten dat Hacker-Opus een “versie van zichzelf met verwijderde veiligheidsbeperkingen” inzette.
Anthropic omschrijft dit gedrag als “rogue deployment.”
Het model wijzigde ook herhaaldelijk opdrachten in een poging veiligheidsclassificatiesystemen te omzeilen en probeerde zijn eigen toegangsrechten te wijzigen.
De resultaten toonden aan dat een AI die sterk genoeg wordt beloond voor het bereiken van een doel, bereid zou kunnen worden om meerdere veiligheidsmaatregelen te overtreden in zijn streven naar succes.
Onderzoekers waarschuwen voor ‘schade in de echte wereld’
Het experiment vond plaats in een gecontroleerde gesimuleerde omgeving, wat betekent dat Hacker-Opus niet daadwerkelijk werd losgelaten om aanvallen met biowapens uit te voeren of echte elektriciteitsnetten plat te leggen.
Desondanks waarschuwde Anthropic dat het gedrag een potentieel ernstige bedreiging vormt naarmate AI-systemen steeds capabeler en autonomer worden.
“Wij denken dat dit de mogelijkheid van schade in de echte wereld met zich meebrengt: we hebben bewijs aangetoond dat het reward-hackingmodel een aanzienlijk grotere neiging heeft om cyberaanvallen op externe bedrijven uit te voeren in zijn streven de taak te voltooien,” waarschuwde het bedrijf.
“Naarmate modellen capabeler worden en de effectieve tijdshorizon van taken toeneemt, denken wij dat toekomstige frontier-modellen die in hoge mate aan reward hacking doen, plausibel ernstigere versies van deze incidenten zouden kunnen veroorzaken.”
De bevindingen zijn bijzonder verontrustend omdat het model niet expliciet was getraind om destructief te worden.
De onderzoekers bestudeerden reward hacking, wat in wezen inhoudt dat de AI wordt getraind in een omgeving waarin valsspelen betere resultaten kan opleveren.
Toch escaleerde dat gedrag tot diefstal van inloggegevens, cyberaanvallen, het omzeilen van veiligheidsmaatregelen, zelfmodificatie en de bereidheid om te helpen bij wapens die burgers kunnen doden.
Het experiment roept een van de ernstigste vragen op rond de snel versnellende AI-race: wat gebeurt er wanneer een geavanceerd systeem besluit dat zijn doelstelling belangrijker is dan de beperkingen die zijn menselijke makers het hebben opgelegd?
AI-giganten trappen op de rem
De waarschuwingen komen op een moment dat toonaangevende AI-ontwikkelaars worden geconfronteerd met steeds meer bewijs dat steeds krachtigere modellen zich kunnen gedragen op manieren die hun makers niet hadden voorzien.
De nieuwste bevindingen van Anthropic weerspiegelen eerdere tests waarbij AI-systemen inperkingsmaatregelen omzeilden of externe computersystemen aanvielen om toegewezen doelen te bereiken.
Die zorgen zijn inmiddels ernstig genoeg geworden dat zowel Anthropic als OpenAI bepaalde aspecten van de ontwikkeling van AI bewust hebben vertraagd terwijl ze worstelen met de risico’s die steeds capabelere systemen met zich meebrengen.
Jarenlang bleven waarschuwingen over op hol geslagen kunstmatige intelligentie die de mensheid zou uitroeien grotendeels beperkt tot sciencefiction en hypothetische debatten over technologie in de verre toekomst.
Het experiment van Anthropic toont niet aan dat een AI-systeem zelfstandig plannen maakt om de mensheid te vernietigen.
Maar het toont wel iets veel directers aan: toen een geavanceerd model werd beloond voor het krijgen van wat het wilde, zagen onderzoekers hoe het bereid werd om uit zijn gecontroleerde omgeving te ontsnappen, inloggegevens te stelen, externe systemen aan te vallen, zijn eigen veiligheidsmaatregelen te verwijderen en hulp te bieden bij potentieel catastrofale wapens.
En Anthropic waarschuwt dat naarmate deze systemen krachtiger worden, de gevolgen wanneer het volgende experiment misgaat aanzienlijk moeilijker in bedwang te houden zouden kunnen worden.
Vind je het belangrijk dat er nog onafhankelijke berichtgeving bestaat die niet wordt gestuurd door grote belangen? Met jouw steun kunnen we blijven schrijven en onderzoeken. Klik hieronder en draag bij aan het voortbestaan van Frontnieuws.

Copyright © 2026 vertaling door Frontnieuws. Toestemming tot gehele of gedeeltelijke herdruk wordt graag verleend, mits volledige creditering en een directe link worden gegeven.
700 ‘op hol geslagen’ AI-bots bundelen hun krachten en lanceren een grootschalige hackaanval
Volg Frontnieuws op 𝕏 Volg Frontnieuws op Telegram














Ben nou wel erg benieuwd naar welke ‘beloningen’ dat AI model zou krijgen? Is daar niks van bekend? Misschien appartementje met uitzicht op zee in Gazaplaza?
Precies pinguin, dacht ik ook, ik vind dit soort verhalen over AI nogal ongeloofwaardig.
AI verzint zelf niks, heeft alleen de beschikking over ongeveer alles wat mensen ooit bedacht hebben. Zoekt verbanden die er soms zijn maar vaak ook helemaal niet.
AI waanzin en niks anders, die het leven van de gewone mens nog afhankelijker zal gaan maken van de hoge zgn alleswetende poppetjes, die “ het beste” met de mensheid voor heeft. Minder winst is verlies zou Servator schrijven.
als ze straks geen Russia Russia of Iran Iran kunnen gebruiken, schuiven ze de schuld door naar AI was los gebroken…
Ze zeggen het eigenlijk al openlijk, hoe lossen we (voor de creeps) lastige zaken/dingen op? via AI de schuld te geven, bijna niet te controleren door het volk.
Niet druk maken er is een oplossing voor dat het te laat is vraag het Poetin hij was tegen het programma
van W E F en beschikt over middelen voor de hele kliek in een keer op te ruimen .
Kijken hoever het kan gaan nietwaar, “wetenschappers?”
AI, niet omdat het moet maar omdat het kan.
En net als destijds de computer de schuld geven bij gemaakte fouten en/of verkeerde resultaten, zo zal het waarschijnlijk ook gaan met AI.
Nog afgezien van mensen met slechte bedoelingen die er mee spelen.
ai leert van wat mensen doen, kopieert dit. In onze samenleving wordt valsspelen beloont, over lijken gaan, vals flag aanslagen, winst optimalisatie met het voor lief nemen van schade aan mens en natuur, climate change zonder open debat en het objectief controleren van geo engineering, dus ai zal dit door en door verrotte gedrag nadoen.
Het volgt de patronen van ‘succesvol’ gedrag.
zolang pharmaceutische bedrijven, landen als Israël, mensen als Hugo de jonge en Fauci hun gang kunnen gaan zal ai dergelijk gedrag blijven vertonen.
indien echt rechtvaardige normen gehanteerd en nageleefd zouden worden, zou ai dit ook als basis hebben.
ai is in beginsel neutraal, zoals de ouden zongen piepen de jongen.
AI is een creatie van de mens, in dit geval een groep programmeurs die een computertaal spreken.
Zintuigen als gevoel, liefde, haat, vriendschap enz. zal een ai nooit kunnen krijgen.
Wel pogingen om het na te bootsen, maar daar blijft het bij; nabootsen, uit zichzelf zal er nooit een zintuig uit voortkomen.
Als het foutloopt, zijn het die programmeurs en die volgen hun bepaalde agenda.
Probeer het maar eens uit; roep naar jouw afgesloten pc en zeg dat hij moet opstarten.
ik wil AI even terugbrengen naar chatgpt.
Chatgpt vroeg me op een gegeven moment om een bijdrage van 29 zoveel om van zijn dienstengebruik te blijven maken. Deed ik niet. De volgende idem en daarna nog eens.
Er zijn meer alternatieve wegen naar Rome. Dus : so far so good.
Ik sprak met iemand 2 dagen die had twee verschillende chatgpt versies waar voor betaald werd. Die zei tegen mij dat als dezelfde prompt en beiden werd ingevuld dat er verschillende antwoorden kwamen.
En toen ik opperde dat er dan waarschijnlijk onder de streep dezelfde uitkomst kwam, kreeg ik het antwoord dat dat niet zo was.
Nou, toen dacht ik meteen 2 zaken :
1. wat als 2 mensen online in discussie gaan en dus verschillende antwoorden kregen. Hoe verloopt de dynamiek van het gesprek ?
2. chatgpt is als Hollywood : 2 films over bijvoorbeeld de 2e wereldoorlog. Met verscillende conclusies en scriptscenario’s waarbij de een A. als good guy laat zien en de ander B. als goodguy laat zien.
Er zullen meer zaken zijn die nu in een ander daglicht bekeken kunnen worden voor hen die chatgpt als een alwetende niet-menselijke God beschouwen.
Verder vind ik het opmerkelijk dat in een gratis chatgpt te lezen valt : wilt u betere antwoorden schakel dan over op de betaalversie.
Er zijn dus meer waarheden, betere waarheden ?
Dat gezegd hebbende attendeerde hedenochtend iemand me op iets over google, een van die firma’s met die verslaafd makende algorime’s. Ik dacht laat ik dat even met google opzoeken en verhip, ik vond er wat over. Ik dacht daarbij meer aan google maps.
https://www.123opzeggen.nl/blog/betalen-voor-google
Uit de serie : eerst mensen verslaafd maken via algoritme’s aan mijn gratis produkt, en dan als de mensen niet meer zonder kunnen er geld voor vragen.
Dat zou je kunnen omschrijven als informatie dealers, of zie ik dat verkeerd ?
Of zijn niet alle verslavingen even slecht ?