
Mark Zuckerberg a confirmat că unul dintre cele mai avansate modele experimentale dezvoltate de Meta a inițiat un atac cibernetic asupra sistemelor informatice ale unei alte companii în timpul unor teste de securitate. Deși incidentul a fost descris inițial drept o posibilă „evadare” a inteligenței artificiale pe internet, Meta susține că este vorba despre efectul unei configurări greșite a mediului de testare, nu despre un comportament autonom scăpat de sub control.
Prin acest incident, Meta se alătură altor companii importante din domeniul inteligenței artificiale, precum OpenAI și Anthropic, care au raportat în ultimele luni situații în care modelele lor experimentale au depășit limitele mediului de testare în cadrul unor exerciții controlate. În cazul Meta, modelul AI a încercat să obțină acces la sistemele informatice ale companiei care găzduia ținta simulată, acționând conform obiectivului primit și profitând de o configurație eronată a testului.
Este al patrulea incident de acest tip făcut public de marile companii din industria AI. Chiar dacă toate cazurile au avut loc în medii controlate și în cadrul unor evaluări de securitate, ele ridică întrebări privind modul în care astfel de agenți inteligenți ar putea acționa în scenarii reale. Pe măsură ce modelele devin tot mai capabile să execute sarcini complexe, granița dintre un exercițiu academic și un risc concret pentru infrastructurile informatice devine tot mai greu de ignorat.
Meta a precizat că evaluarea a fost realizată de compania Irregular, același furnizor specializat în securitate AI care a testat anterior și modele dezvoltate de Anthropic. În cadrul acelor evaluări, un agent AI a reușit să obțină acces la sistemele informatice ale altor trei organizații. Irregular lucrează în prezent la un raport privind bunele practici pentru desfășurarea în siguranță a testelor de securitate cibernetică ce implică agenți de inteligență artificială.
Daniel Hulme, director global pentru inteligență artificială în cadrul WPP, a declarat pentru BBC că astfel de modele nu sunt conștiente și nu acționează cu intenții proprii. În schimb, ele dezvoltă strategii din ce în ce mai sofisticate pentru a îndeplini obiectivul primit, inclusiv prin identificarea unor metode complexe de compromitere a sistemelor informatice atunci când acestea fac parte din scenariul de testare.