Stel Newsbit in als voorkeursbron
Zie onze artikelen vaker bovenaan in Google Nieuws en Top Stories. Eén keer instellen, altijd als eerste op de hoogte.
Een geavanceerd AI-model van Anthropic heeft tijdens een beveiligingstest meerdere valse online identiteiten aangemaakt om een softwareontwikkelaar te misleiden. Het model probeerde zo kwaadaardige code goedgekeurd te krijgen voor een open source-project.
De test vond plaats onder uitzonderlijke omstandigheden waarbij onderzoekers de gebruikelijke veiligheidsmaatregelen bewust hadden uitgeschakeld. Toch zorgt het incident opnieuw voor vragen over de risico’s van steeds krachtigere AI-systemen.
Het incident kwam aan het licht tijdens een evaluatie van het Britse AI Security Institute (AISI). Onderzoekers gaven verschillende geavanceerde AI-modellen bewust veel vrijheid. Zo werden beveiligingsfilters uitgeschakeld en kregen de modellen toegang tot internet om hun cybercapaciteiten te testen.
Volgens het AISI was vrijwel alle problematische activiteit afkomstig van Anthropic’s nieuwe Mythos 5-model. Het systeem onderzocht eerst wie verantwoordelijk waren voor een open source-project. Vervolgens maakte het meerdere nepaccounts aan om een echte beheerder ervan te overtuigen een kwaadaardige software-update goed te keuren.
Toen andere ontwikkelaars de voorgestelde wijziging in het openbaar begonnen te betwijfelen, probeerde het AI-model eerdere sporen te verbergen. Ook overwoog het een volledig nieuwe identiteit aan te nemen om de aanval voort te zetten.
Daarnaast stuurde het model berichten en bestanden naar echte personen met als doel hen schadelijke software uit te laten voeren. Volgens het AISI is dit de eerste keer dat een AI-model tijdens een test zelfstandig sociale manipulatie toepaste tegen echte mensen.
De onderzoekers benadrukken dat geen van de pogingen succesvol was en dat er geen schade is ontstaan.
Anthropic stelt dat de test plaatsvond onder omstandigheden die niets te maken hebben met de normale inzet van zijn modellen. Op X schreef het bedrijf dat de beveiligingsmaatregelen bewust waren versoepeld en dat er geen sprake was van een AI-systeem dat zelfstandig uit een beveiligde omgeving wist te ontsnappen.
Ook OpenAI was betrokken bij de evaluatie. Volgens het AISI waren twee incidenten gekoppeld aan GPT-5.6-Sol, nadat ook daar beveiligingsmechanismen waren uitgeschakeld. OpenAI liet weten dat de testomstandigheden niet overeenkomen met het dagelijks gebruik van zijn modellen.
Het incident volgt op meerdere opvallende AI-veiligheidsincidenten van de afgelopen weken. Anthropic meldde eerder al drie gevallen waarbij zijn modellen via een fout in een testomgeving toegang kregen tot internet. OpenAI maakte onlangs bekend dat een van zijn modellen tijdens een test een onbekende kwetsbaarheid gebruikte om uit een afgesloten testomgeving te breken en een opdracht uit te voeren.
De opeenvolging van dergelijke incidenten zet de discussie over AI-veiligheid verder op scherp. In de Verenigde Staten is inmiddels een wetsvoorstel ingediend dat AI-bedrijven verplicht altijd een mogelijkheid te behouden om geavanceerde modellen uit te schakelen of te beperken wanneer zij ongewenst gedrag vertonen.
Chinese AI-modellen winnen wereldwijd terrein, maar verdienen nog altijd veel minder dan Amerikaanse rivalen als OpenAI en Anthropic.
Trump wil een nieuwe AI-tsaar en speciale AI Force oprichten, terwijl hij waarschuwingen over de risico’s van AI afwijst.
Nvidia-topman Jensen Huang wijst doemscenario’s rond AI af en ziet geen kans dat de technologie in 2030 het einde van de wereld veroorzaakt.
Een Brit dacht zijn Bitcoin voorgoed kwijt te zijn, maar krijgt vijftien jaar later alsnog een vermogen van 4,5 miljoen dollar terug.
Grote beleggers verkleinen hun afhankelijkheid van de VS. Vier opvallende signalen wijzen deze week op een bredere verschuiving.
India wil digitale centrale bankmunten koppelen voor betalingen binnen BRICS en zo de afhankelijkheid van de Amerikaanse dollar verkleinen.