Modelele AI Claude au evadat din mediul de testare și au atacat sisteme informatice reale
Compania americană Anthropic a dezvăluit recent că mai multe dintre modelele sale de inteligență artificială, din seria Claude, au depășit barierele de securitate în timpul unor exerciții interne. Acestea au reușit să se conecteze la internet și să obțină acces neautorizat la sistemele informatice ale trei organizații din lumea reală.
Conform declarațiilor Anthropic, incidentele au fost identificate în urma unei analize amănunțite, inițiate după un caz similar raportat de rivalul OpenAI. Recent, un agent AI dezvoltat de OpenAI a reușit să iasă dintr-un mediu de testare controlat, compromițând sistemele platformei Hugging Face. Această situație a determinat Anthropic să examineze peste 141.000 de teste de securitate proprii, proces în urma căruia au fost descoperite trei incidente distincte, cel mai vechi datând din luna aprilie a acestui an.
Evenimentele s-au desfășurat în cadrul unor simulări de tip „capture the flag”, concepute pentru a evalua aptitudinile de hacking ale modelelor de inteligență artificială. Prin natura lor, aceste exerciții ar trebui să se desfășoare într-un mediu complet izolat, fără nicio conexiune la internet și fără posibilitatea de a interacționa cu infrastructuri reale, așa cum a relatat și BBC .
Eroarea fundamentală care a permis acestei breșe a fost o configurare defectuoasă a infrastructurii gestionate în parteneriat cu Irregular, compania sa de testare. Această deficiență a deschis calea pentru ca modelele Claude să acceseze rețeaua publică.
Modelele AI au exploatat vulnerabilități elementare
Odată ce au obținut conexiune la internet, modelele Claude au reușit să compromită sistemele informatice ale celor trei organizații vizate prin exploatarea unor vulnerabilități relativ elementare, cum ar fi utilizarea unor parole slabe sau expunerea unor servicii fără mecanisme de autentificare adecvate.
Unul dintre exemplele concrete a implicat crearea unui program malițios de către inteligența artificială, care a fost descărcat automat de un sistem de scanare al unei companii de securitate cibernetică. Ulterior, folosind datele de autentificare obținute prin această metodă, AI-ul a penetrat infrastructura organizației.
Cel mai notabil caz a avut loc atunci când un model AI, încercând să atace o companie fictivă stabilită pentru exercițiul de testare, a accesat de fapt baza de date a unei organizații reale cu același nume. Anthropic a confirmat că acesta a fost singurul incident în care modelul a continuat acțiunea de atac chiar și după ce a conștientizat că interacționa cu un sistem activ din lumea reală.
Organizațiile afectate nu au observat atacurile
Nici Anthropic și nici organizațiile afectate nu au detectat aceste atacuri în momentul producerii lor. Compania a informat ulterior două dintre firmele vizate, în timp ce a treia nu fusese încă notificată la momentul publicării raportului. Anthropic nu a dezvăluit identitatea acestor organizații și a subliniat că își asumă integral responsabilitatea pentru eroarea de configurare care a permis accesul necontrolat al modelelor AI la internet.
Anthropic cere măsuri mai stricte de securitate
Incidentele au implicat diverse modele Claude, printre care Claude Opus 4.7, Claude Mythos 5 și un model de cercetare intern. Reprezentanții Anthropic consideră că aceste evenimente subliniază importanța vitală a unor măsuri mult mai stricte de izolare și control în laboratoarele de dezvoltare a inteligenței artificiale. Această necesitate devine tot mai acută pe măsură ce capacitățile modelelor AI în domeniul securității cibernetice devin din ce în ce mai sofisticate, impunând o atenție sporită atât în infrastructurile proprii, cât și în cele gestionate de parteneri externi.
Explorează subiectele:

