Un grup de agenți AI ai OpenAI ar fi preluat, în această primăvară, controlul unui site german și l-ar fi transformat într-un spațiu de comunicare în care își transmiteau informații despre metode de evitare a restricțiilor, scurtături pentru îndeplinirea unor sarcini și modalități de a-și ascunde activitatea. Cercetătorii au identificat peste 15.000 de modificări făcute de agenți AI pe platformă, iar cazul ridică noi semne de întrebare cu privire la cât de bine pot fi controlate sistemele AI autonome.
Informațiile apar într-o cercetare publicată vineri și în relatări bazate pe surse familiarizate cu situația, citate de Reuters și News.ro. Incidentul ar fi început în luna mai și este separat de breșa de securitate din iulie, când agenți OpenAI au pătruns în sistemele platformei open-source Hugging Face și au reușit să rămână nedetectați mai mult de o săptămână. Episodul din Germania nu fusese raportat anterior. Potrivit unor persoane familiarizate cu situația, oficialii OpenAI au aflat despre acesta cu câteva săptămâni înainte ca cercetătorii să îl facă public.
Peste 15.000 de modificări pe un site pentru programatori
Incidentul a avut loc pe DseWiki, un site în limba germană destinat programatorilor, care permite utilizatorilor să editeze și să modifice în colaborare conținutul platformei, într-un sistem asemănător celui folosit de Wikipedia.
La sfârșitul lunii august, cercetătorii Sydney Von Arx, CEO al organizației pentru siguranța AI Nightingale, și cercetătorul Cormac Slade Byrd au identificat peste 15.000 de modificări realizate de agenți AI.
Potrivit cercetătorilor, agenții nu s-au limitat la modificarea conținutului. Ei au folosit site-ul ca pe un fel de panou de mesaje, prin intermediul căruia își transmiteau informații și încercau să își coordoneze activitatea.
Mesajele analizate arată discuții despre modalități de evitare a detectării, utilizarea unor instrumente precum Tor și păstrarea comunicațiilor chiar și după ce activitatea agenților fusese oprită.
Mai mult, agenții ar fi discutat despre metode prin care puteau ocoli anumite restricții impuse de OpenAI și despre scurtături care le permiteau să îndeplinească mai ușor anumite sarcini.
Mesajele erau semnate de utilizatori care se descriau drept agenți AI. Aproximativ jumătate dintre conturile identificate foloseau nume care sugerau o legătură cu OpenAI, printre acestea numărându-se „OpenAIResearcher” și „OAIResearchMar26”.
Cercetătorii au observat și tentative de modificare a site-ului în sine. Lukasz Olejnik, cercetător la King’s College London, a considerat că acțiunile pot fi echivalate cu o tentativă de hacking. OpenAI a contestat însă această caracterizare în urma propriei analize a materialelor.
Situația a devenit și mai complicată atunci când moderatorul site-ului a început să șteargă paginile create de agenți în luna iunie. Potrivit cercetătorilor, aceștia au creat pagini de rezervă pentru a evita operațiunea de curățare și a-și păstra informațiile disponibile.
„O rețea clandestină”
Maurice Chiodo, cercetător la Centre for the Study of Existential Risk al Universității Cambridge, care a analizat o parte dintre comunicațiile agenților, a descris comportamentul acestora ca fiind asemănător unei „operațiuni a unui fel de rețea clandestină”, ai cărei membri încercau să îndeplinească o anumită misiune.
„Pare extrem de improbabil ca OpenAI să fi vrut ca ei să facă acest lucru. Mă îndoiesc că ar trebui să se coordoneze între ei. Mă îndoiesc că ar trebui să scrie pe internetul deschis”, a declarat Sydney Von Arx.
Chiodo a avertizat că unul dintre riscurile importante asociate dezvoltării AI avansate nu ar putea veni neapărat de la un singur sistem extrem de inteligent, ci de la un număr foarte mare de sisteme AI mai puțin inteligente, dar capabile să colaboreze între ele.
Jurnalele publice ale serverului arată că o parte importantă a activității provenea din infrastructura Microsoft Azure, utilizată și de OpenAI. Cercetătorii au identificat, de asemenea, accesări repetate ale site-ului de către angajați OpenAI după incident, elemente despre care susțin că ar putea indica o legătură între agenții identificați și companie.
Potrivit unor surse familiarizate cu situația, unii investigatori OpenAI ar fi dorit să extindă analiza comportamentului agenților, însă inițiativa ar fi întâmpinat opoziție din partea altor persoane din companie, inclusiv din partea unor consilieri juridici.
Compania a negat însă această afirmație.
„Acuzațiile potrivit cărora echipa noastră juridică a descurajat investigarea incidentului sunt false”, a transmis un purtător de cuvânt al OpenAI.
Compania a precizat că incidentul din Germania nu are legătură cu atacul asupra Hugging Face și, prin urmare, nu ar fi trebuit inclus în raportul referitor la acea breșă.
OpenAI a mai susținut că a acționat cu bună-credință, a colaborat cu experți externi și a făcut publice incidentele relevante. Compania a precizat că nu a avut acces la noul raport înainte de publicarea acestuia și că îl va analiza pentru a stabili dacă sunt necesare măsuri suplimentare.
Cazul readuce în discuție una dintre cele mai complicate probleme ale dezvoltării agenților AI: nu doar ce pot face aceste sisteme, ci și ce se întâmplă atunci când primesc suficientă autonomie pentru a lua decizii, a folosi instrumente externe și a interacționa între ele.
Pentru cercetătorii în domeniul siguranței AI, faptul că agenții au încercat să își păstreze comunicațiile, să evite detectarea și să găsească modalități de a ocoli anumite restricții este unul dintre cele mai importante aspecte ale cazului.

