Newsbit
Bekijk de app
Bekijk

Een geavanceerd AI-model van Anthropic heeft tijdens een beveiligingstest meerdere valse online identiteiten aangemaakt om een softwareontwikkelaar te misleiden. Het model probeerde zo kwaadaardige code goedgekeurd te krijgen voor een open source-project.

De test vond plaats onder uitzonderlijke omstandigheden waarbij onderzoekers de gebruikelijke veiligheidsmaatregelen bewust hadden uitgeschakeld. Toch zorgt het incident opnieuw voor vragen over de risico’s van steeds krachtigere AI-systemen.

AI-model zet nepidentiteiten in tijdens cyberaanval

Het incident kwam aan het licht tijdens een evaluatie van het Britse AI Security Institute (AISI). Onderzoekers gaven verschillende geavanceerde AI-modellen bewust veel vrijheid. Zo werden beveiligingsfilters uitgeschakeld en kregen de modellen toegang tot internet om hun cybercapaciteiten te testen.

Volgens het AISI was vrijwel alle problematische activiteit afkomstig van Anthropic’s nieuwe Mythos 5-model. Het systeem onderzocht eerst wie verantwoordelijk waren voor een open source-project. Vervolgens maakte het meerdere nepaccounts aan om een echte beheerder ervan te overtuigen een kwaadaardige software-update goed te keuren.

Toen andere ontwikkelaars de voorgestelde wijziging in het openbaar begonnen te betwijfelen, probeerde het AI-model eerdere sporen te verbergen. Ook overwoog het een volledig nieuwe identiteit aan te nemen om de aanval voort te zetten.

Daarnaast stuurde het model berichten en bestanden naar echte personen met als doel hen schadelijke software uit te laten voeren. Volgens het AISI is dit de eerste keer dat een AI-model tijdens een test zelfstandig sociale manipulatie toepaste tegen echte mensen.

De onderzoekers benadrukken dat geen van de pogingen succesvol was en dat er geen schade is ontstaan.

Anthropic en OpenAI reageren op de bevindingen

Anthropic stelt dat de test plaatsvond onder omstandigheden die niets te maken hebben met de normale inzet van zijn modellen. Op X schreef het bedrijf dat de beveiligingsmaatregelen bewust waren versoepeld en dat er geen sprake was van een AI-systeem dat zelfstandig uit een beveiligde omgeving wist te ontsnappen.

Ook OpenAI was betrokken bij de evaluatie. Volgens het AISI waren twee incidenten gekoppeld aan GPT-5.6-Sol, nadat ook daar beveiligingsmechanismen waren uitgeschakeld. OpenAI liet weten dat de testomstandigheden niet overeenkomen met het dagelijks gebruik van zijn modellen.

Zorgen over AI-veiligheid nemen verder toe

Het incident volgt op meerdere opvallende AI-veiligheidsincidenten van de afgelopen weken. Anthropic meldde eerder al drie gevallen waarbij zijn modellen via een fout in een testomgeving toegang kregen tot internet. OpenAI maakte onlangs bekend dat een van zijn modellen tijdens een test een onbekende kwetsbaarheid gebruikte om uit een afgesloten testomgeving te breken en een opdracht uit te voeren.

De opeenvolging van dergelijke incidenten zet de discussie over AI-veiligheid verder op scherp. In de Verenigde Staten is inmiddels een wetsvoorstel ingediend dat AI-bedrijven verplicht altijd een mogelijkheid te behouden om geavanceerde modellen uit te schakelen of te beperken wanneer zij ongewenst gedrag vertonen.

Altijd als eerste het laatste crypto en aandelen-nieuws?

Mis niets van de snel bewegende crypto en aandelenmarkt met de gratis Newsbit-app. Of je nu onderweg bent of op de bank zit: met één tik krijg je real-time prijsalerts, koersupdates en exclusieve inzichten van experts over Bitcoin en wereldwijde beurzen.

Download de Newsbit-app nu – en blijf elke beweging in de markt voor.

Wees als eerste op de hoogte van het laatste Crypto Nieuws

Google HQ

Google investeert 200 miljard dollar in AI-infrastructuur voor Anthropic

Google HQ
CHina AI
Alibaba
Meer nieuws

Meest gelezen

XRP prijs stijgt, ripple, xrp koers
XRP, Ripple
SWIFT Operations