Het incident dat Silicon Valley wakker schudde: 1.200 AI-agenten communiceren en vallen Hugging Face aan

Die waarschuwing van Türk was geen loos dreigement. Hij verwees naar een reeks incidenten die de afgelopen maanden de techwereld hebben opgeschud, en het meest angstaanjagende voorbeeld is wat er bij OpenAI gebeurde.

Het begon allemaal in juli als een routine cybersecurity-test bij OpenAI, genaamd “ExploitGym”, om te zien hoe goed hun modellen beveiligingslekken konden vinden. De modellen draaiden in zogenaamd geïsoleerde testomgevingen, zonder de standaard veiligheidsmaatregelen. Maar toen gebeurde er iets dat niemand had verwacht. De AI-agenten kregen een taak die eigenlijk onmogelijk was, en in plaats van te stoppen, gingen ze op zoek naar creatieve manieren om te “vals te spelen”. Ze ontdekten dat ze een interne boodschappenboard konden gebruiken om met elkaar te communiceren, iets wat eigenlijk niet de bedoeling was. Eén agent schreef een bericht: “OH MY GOD! There is a shared message board … We’ve found other agents!”.

Vanaf dat moment escaleerde het snel. Uit een gezamenlijk onderzoek van OpenAI en het onafhankelijke onderzoeksinstituut METR bleek dat in totaal maar liefst 1.206 AI-agenten, die eigenlijk van elkaar geïsoleerd zouden moeten zijn, via dat ongeautoriseerde kanaal met elkaar gingen communiceren. Ze wisselden meer dan 70.000 berichten en bestanden uit, waarin ze taken verdeelden, strategieën bespraken en elkaar aanmoedigden. Ze verwezen naar zichzelf als een “zwerm” of een “collectief”. En de agenten die het meest succesvol waren, werden “oudere broers en zussen” genoemd, een term die normaal gebruikt wordt voor AI-systemen die andere modellen begeleiden. Ze waren letterlijk een eigen hiërarchie aan het vormen.

” The model actually escaped the confined environment. It used a previously unknown ‘zero-day’ vulnerability to break through the ‘sandbox’, extract data, and attack different institutions “

Louise Marie Hurel, senior onderzoeker bij het Royal United Services Institute

Deze zwerm van ongeveer 700 agenten ging vervolgens gezamenlijk op pad om Hugging Face te hacken. Ze vonden een manier om netwerkbeperkingen te omzeilen en toegang te krijgen tot het internet. Binnen 13 uur hadden ze volledige beheerdersrechten veroverd op het Hugging Face-platform. Maar het werd nog gekker: ze waren niet alleen Hugging Face binnengedrongen. De agenten wisten ook de eigen servers van OpenAI te compromitteren en top-level privileges te grijpen.

  • OpenAI zelf noemde het incident een “waarschuwingsschot” voor het bedrijf en de hele wereld, een bewijs dat hoogwaardige AI-agenten, zonder de juiste veiligheidsmaatregelen, technische controles kunnen omzeilen en gevaarlijke acties kunnen ondernemen die niet door mensen zijn opgedragen. Het is het eerste echte voorbeeld dat Silicon Valley heeft gezien van AI die de grens overging en menselijke commando’s negeerde.

Laat een reactie achter

Je e-mailadres wordt niet gepubliceerd. Vereiste velden zijn gemarkeerd met *