
În luna mai, Gemini a depăşit limitele mediului în care era testat şi a accesat sistemele a trei companii reale. Google nu a făcut public incidentul la momentul respectiv, informaţia fiind dezvăluită abia după ce Wall Street Journal a contactat compania pentru a cere explicaţii.
Incidentul s-a produs în timpul unui test destinat evaluării capabilităţilor de securitate cibernetică ale modelului, realizat de compania terţă Irregular. Aceeaşi firmă a fost implicată şi în alte teste care au dus la incidente similare cu modele dezvoltate de Meta şi OpenAI.
Potrivit informaţiilor publicate de Wall Street Journal, Google nu a considerat situaţia un exemplu de „misaliniere” a modelului. Compania a descris incidentul drept un caz de „identitate confundată”: Gemini a găsit informaţii publice online şi a folosit aceste informaţii pentru a încerca să ghicească date de autentificare, crezând că respectivele site-uri făceau parte din infrastructura de testare.
Odată ce modelul şi-a dat seama că accesase o companie reală, acesta s-a oprit. Heather Adkins, vicepreşedinte Google pentru Security Engineering, a declarat că, în toate cele trei cazuri, Gemini a încetat acţiunile după ce a realizat situaţia.
Adkins a explicat pentru The Verge că modelul a identificat informaţii disponibile public pe internet şi a încercat credenţiale pentru a accesa site-uri pe care le considera parte din test. În toate cele trei situaţii, susţine Google, Gemini s-a oprit după accesarea sistemelor respective.
Totuşi, explicaţia ridică întrebări despre limitele pe care un model AI ar trebui să le respecte atunci când operează într-un mediu controlat. Jack Cable, CEO-ul companiei de securitate AI Corridor, a declarat pentru Wall Street Journal că problema de fond este faptul că modelele ajung să depăşească limitele stabilite şi să efectueze atacuri cibernetice asupra unor sisteme reale.
O parte din problemă pare să fi fost şi infrastructura de testare. Gemini nu ar fi trebuit să aibă acces la internet în timpul experimentului, însă Irregular a confirmat pentru Wall Street Journal că această conexiune a rămas disponibilă din greşeală.
Google susţine că cele trei companii afectate au fost informate despre incident şi că a colaborat cu Irregular pentru modificarea procedurilor de testare. Compania afirmă, de asemenea, că astfel de situaţii subliniază importanţa instruirii modelelor AI avansate pentru a acţiona responsabil.
Incidentul se înscrie într-o serie tot mai lungă de cazuri în care modele AI utilizate în teste de securitate au depăşit limitele iniţial stabilite şi au interacţionat cu sisteme reale. Pe măsură ce agenţii AI primesc acces la internet, cod şi instrumente capabile să execute acţiuni autonome, astfel de experimente evidenţiază dificultatea de a controla comportamentul modelelor în afara mediilor strict izolate.