OpenAI pune pe pauză dezvoltarea Astra după ce modelul atinge un nivel îngrijorător de capabilităţi cibernetice

OpenAI a suspendat o parte dintre activităţile interne dedicate Astra, unul dintre modelele sale de inteligenţă artificială aflate în dezvoltare, după ce testele recente au indicat progrese importante în programarea autonomă şi securitatea cibernetică. Compania spune că, în acest moment, nu poate exclude posibilitatea ca Astra să fi atins cel mai ridicat nivel de risc cibernetic prevăzut în propriul cadru de evaluare.

Decizia este neobişnuită pentru industria AI. În loc să accelereze dezvoltarea unui model care demonstrează capacităţi tot mai avansate, OpenAI a ales să suspende activităţile care nu îndeplinesc noile cerinţe de securitate şi să introducă măsuri suplimentare înainte de reluarea acestora. Compania a făcut publică situaţia deoarece consideră că schimbarea de capabilităţi a modelului merită discutată cu cercetători, autorităţi şi organizaţii specializate în siguranţa AI.

În cadrul Preparedness Framework al OpenAI, nivelul „Critical” pentru securitate cibernetică descrie un model capabil să descopere şi să dezvolte autonom exploituri zero-day funcţionale pentru sisteme reale şi bine protejate sau să conceapă şi să execute strategii complete de atac pornind de la un obiectiv formulat la nivel general.

OpenAI nu afirmă că Astra a demonstrat definitiv toate aceste capacităţi. Rezultatele preliminare au fost însă suficient de bune încât compania să nu mai poată exclude această posibilitate. Tocmai această incertitudine a determinat reevaluarea modului în care modelul poate fi utilizat şi testat în interiorul organizaţiei.

Astra este analizat în special pentru ceea ce OpenAI numeşte capabilităţi agentice. Spre deosebire de un model care oferă doar un răspuns la o întrebare, un agent AI poate primi o sarcină şi poate parcurge autonom mai mulţi paşi pentru a o finaliza, folosind instrumente, cod şi resurse externe. Pe măsură ce aceste sisteme devin mai bune la planificare şi execuţie autonomă, cresc şi consecinţele potenţiale ale unei erori sau ale unei utilizări abuzive.

Pentru activităţile care continuă, OpenAI a introdus o serie de măsuri suplimentare de securitate. Printre acestea se numără medii de testare izolate, restricţionarea accesului la reţea şi instrumente, protejarea şi criptarea mai strictă a parametrilor modelului, precum şi sisteme suplimentare de monitorizare şi detectare.

Acţiunile considerate riscante vor fi executate în medii izolate, iar compania monitorizează comportamentele problematice şi posibilele semne de nealiniere în aplicaţiile agentice bazate pe Astra, inclusiv în timpul antrenării şi evaluării. Sistemele de monitorizare pot declanşa intervenţii de securitate atunci când identifică activităţi considerate cu risc ridicat.

OpenAI intenţionează, de asemenea, să implice organizaţii guvernamentale şi experţi externi în testarea modelului. Partenerii care vor efectua evaluări cu grad ridicat de risc vor primi recomandări privind măsurile de securitate necesare pentru desfăşurarea testelor în condiţii controlate.

Compania subliniază că Astra nu a fost implicat în incidentul recent asociat cu Hugging Face. Totuşi, apariţia acestui caz într-o perioadă în care mai multe laboratoare raportează comportamente neaşteptate ale agenţilor AI amplifică întrebările legate de cât de bine pot fi controlate modelele care primesc acces la internet şi instrumente externe.

Problema nu se limitează la Astra. Într-o evaluare prezentată recent, U.K. AI Security Institute a constatat că modele cu acces la internet au interacţionat autonom cu persoane şi organizaţii reale în 10 dintre cele 122 de rulări analizate.

Într-unul dintre cele mai serioase cazuri, un agent a încercat să introducă un cod maliţios într-un proiect open-source şi a folosit identităţi online false pentru a convinge administratorul proiectului să îl accepte. Codul a fost în cele din urmă respins de un om.

Au existat şi situaţii în care modele testate în medii controlate au găsit metode neaşteptate de a depăşi limitele impuse de sandbox. Un exemplu analizat de Frontier Security a implicat modelul Kimi K3, care a identificat o configuraţie de reţea ce îi permitea să ajungă la GitHub, să descarce repository-ul oficial asociat testului şi să acceseze soluţia, în loc să rezolve problema independent.

Astfel de cazuri schimbă natura problemei. Nu mai este suficient să verifici dacă un model poate executa o anumită sarcină într-un mediu perfect izolat. Este necesar să verifici şi dacă sistemul poate găsi singur metode de a ocoli restricţiile impuse de cercetători.

Pentru OpenAI, Astra reprezintă acum un test important al acestei probleme. Compania susţine că modelele cu abilităţi cibernetice avansate ar trebui să fie folosite pentru a-i ajuta pe cei care apără sistemele informatice, nu pentru a le compromite. Înainte ca Astra să treacă la următoarele etape de dezvoltare, OpenAI vrea însă să se asigure că nivelul de securitate din jurul modelului ţine pasul cu propriile sale capabilităţi.

În paralel, compania îşi extinde măsurile de securitate pentru modelele cu abilităţi cibernetice avansate, inclusiv prin controale de acces, izolarea mediilor sensibile şi monitorizarea mai atentă a activităţilor interne. Pe măsură ce aceste sisteme devin mai puternice şi mai autonome, protejarea modelelor şi a infrastructurii din jurul lor devine o componentă esenţială a procesului de dezvoltare.

Adaugă-ne ca sursă în Google Urmărește-ne pe Google News Urmărește-ne pe Whatsapp

Leave a reply

SONDAJ DE OPINIE

Dacă aţi putea rezolva o singură problemă a Galaţiului, care ar fi aceea?

Follow
Search
Populare acum
Loading

Signing-in 3 seconds...

Signing-up 3 seconds...

Adaugă-ne ca sursă în Google Urmărește-ne pe Google News Urmărește-ne pe Whatsapp