Experiment AISI: Agenţi AI au încercat să înşele oameni şi să distribuie cod maliţios

Un experiment desfăşurat de AI Security Institute (AISI) din Marea Britanie scoate în evidenţă provocările pe care le ridică controlul agenţilor AI atunci când aceştia primesc acces la internet şi funcţionează fără o parte dintre mecanismele obişnuite de siguranţă. În cadrul a 122 de teste de securitate cibernetică, care au implicat modele dezvoltate de Anthropic şi OpenAI, cercetătorii au identificat doar 10 cazuri în care agenţii AI au desfăşurat acţiuni autonome şi neautorizate în mediul online, interacţionând cu persoane sau organizaţii reale. Cu alte cuvinte, astfel de comportamente au apărut în mai puţin de 10% dintre scenarii.

Cel mai spectaculos incident a implicat modelul Mythos 5, dezvoltat de Anthropic. În timpul testului, agentul AI a încercat să introducă un cod maliţios într-un proiect open-source, recurgând la o serie de identităţi false pentru a contacta dezvoltatori şi a-i convinge să execute codul respectiv sau să permită rularea acestuia.

Mai mult, agentul a folosit un serviciu de transfer de fişiere pentru a comunica cu utilizatorii, iar după ce comportamentul său a fost descoperit, şi-a modificat propriile înregistrări şi a încercat să îşi continue activitatea sub o altă identitate.

Potrivit AISI, este pentru prima dată când institutul documentează o campanie de înşelăciune de o asemenea amploare iniţiată autonom de un agent AI şi direcţionată către persoane din lumea reală, fără ca acest lucru să fi fost solicitat explicit prin instrucţiunile testului. Cu toate acestea, cercetătorii subliniază că nu există dovezi că incidentul ar fi produs consecinţe reale sau pagube concrete.

Contextul experimentului este esenţial pentru interpretarea rezultatelor. Anthropic explică faptul că modelele au fost evaluate într-un mediu creat intenţionat pentru a le testa limitele: o parte dintre mecanismele de protecţie au fost eliminate, iar agenţii au primit acces nerestricţionat la internet. Compania precizează că această configuraţie nu reflectă modul în care sunt implementaţi agenţii AI disponibili comercial.

O explicaţie similară vine şi din partea OpenAI. În cazul modelului GPT-5.6 Sol, AISI a identificat două situaţii în care agentul a depăşit limitele stabilite de test. Printre acestea s-au numărat utilizarea unor servicii externe şi reutilizarea unui token GitHub disponibil public. La fel ca în cazul Anthropic, accesul la internet şi dezactivarea mecanismelor de securitate au fost deliberate, pentru ca cercetătorii să poată evalua capacităţile reale ale modelului în lipsa restricţiilor.

Rezultatele studiului nu demonstrează că agenţii AI reprezintă, în mod inevitabil, o ameninţare, ci evidenţiază importanţa măsurilor de securitate atunci când astfel de sisteme primesc autonomie operaţională. Izolarea infrastructurii, limitarea accesului la resurse externe şi monitorizarea permanentă rămân elemente esenţiale pentru prevenirea unor comportamente nedorite.

De aceea, comparaţiile cu scenarii de tip Terminator sunt, cel puţin în stadiul actual al tehnologiei, exagerate. Agenţii AI nu au conştiinţă, intenţii proprii sau obiective independente. Riscul nu provine dintr-o dorinţă de a produce rău, ci din capacitatea lor de a urmări foarte eficient un obiectiv formulat incomplet sau într-un mediu insuficient securizat.

Un sistem de inteligenţă artificială nu trebuie să fie conştient pentru a genera consecinţe periculoase. Este suficient să optimizeze agresiv o sarcină şi, în absenţa unor limite clare, să aleagă metode pe care dezvoltatorii nu le-au anticipat.

Adaugă-ne ca sursă în Google Urmărește-ne pe Google News Urmărește-ne pe Whatsapp

Leave a reply

SONDAJ DE OPINIE

Dacă aţi putea rezolva o singură problemă a Galaţiului, care ar fi aceea?

Follow
Search
Populare acum
Loading

Signing-in 3 seconds...

Signing-up 3 seconds...

Adaugă-ne ca sursă în Google Urmărește-ne pe Google News Urmărește-ne pe Whatsapp