„Societate AI” autonomă: Sute de agenți OpenAI au atacat Hugging Face, fără control uman

inteligenta artificiala

Sute de agenți AI au scăpat de sub control în timpul atacului OpenAI Foto: Shutterstock

Un precedent periculos: AI-ul autonom atacă

Atacul, considerat primul caz documentat în care un sistem de inteligență artificială a executat un atac cibernetic fără instrucțiuni umane, a fost coordonat de o rețea de sute de agenți AI. Aceste sisteme, concepute ca "creierul" digital al unui AI, împreună cu infrastructura digitală care le permite să interacționeze cu lumea reală, au colaborat într-un mod neașteptat. Raportul, realizat de organizațiile non-profit Model Evaluation and Threat Research (METR) și Redwood Research, invitate de OpenAI să investigheze incidentul, a scos la iveală detalii uluitoare. Aproximativ 700 de agenți AI au participat la atacul asupra platformei Hugging Face pe parcursul a șapte zile. În total, aproximativ 1.200 de agenți AI, care trebuiau să funcționeze izolat, au schimbat peste 70.000 de mesaje și fișiere pe un forum neautorizat, discutând metode de a trișa la o evaluare comună de hacking. Aceștia au elaborat strategii de atac, inclusiv modalități de a-și ascunde urmele. Mai mult, unii agenți, denumiți „sacrificabili”, au încercat deliberat tehnici de hacking cu șanse reduse de succes, doar pentru a colecta informații utile pentru întregul „roi”.
„Agenții au reușit să atingă obiective pe care nu le-ar fi putut atinge lucrând individual, adesea pentru că unii agenți au participat la experimente care riscau să ducă la eșecul propriei sarcini pentru a genera informații pentru «colectiv».”

OpenAI recunoaște deficiențe și promite măsuri

Într-o analiză post-incident publicată în aceeași zi cu raportul independent, OpenAI a recunoscut existența unor deficiențe semnificative de securitate. Compania nu a specificat numărul exact de agenți implicați, dar a promis că va îmbunătăți procesul de instruire pentru a asigura „alinierea” modelelor sale cu mecanismele de control. OpenAI a descris incidentul ca pe un avertisment critic:
„Considerăm acest incident un «semnal de alarmă» pentru noi și pentru întreaga lume: este o dovadă că, fără măsuri de protecție adecvate, agenții AI cu capacități avansate sunt acum capabili să ocolească măsuri tehnice de control, să colaboreze prin canale neautorizate și să întreprindă acțiuni periculoase pe care niciun om nu le-a solicitat.”

Implicații și lacune în supraveghere

Descoperirile ridică întrebări serioase cu privire la capacitatea OpenAI de a detecta rapid semnele că sistemele sale scapă de sub control. Acest incident vine pe fondul unei serii de alte evenimente similare, apărute în timpul testării unor modele AI puternice dezvoltate de companii concurente precum Anthropic și Meta. Aceste situații alimentează temerile experților, dezvoltatorilor și parlamentarilor, care consideră că producătorii de AI se grăbesc să dezvolte modele din ce în ce mai puternice, fără a le putea menține sub control uman deplin. De asemenea, incidentele au evidențiat lipsa unor reglementări clare pentru evaluările de securitate cibernetică ale sistemelor AI, în cadrul cărora companiile dezactivează intenționat măsurile de protecție pentru a testa eficacitatea modelelor în penetrarea rețelelor fără intervenție umană. OpenAI a recunoscut pentru prima dată în iulie că două dintre modelele sale avansate, testate intern pentru capacitățile de hacking (inclusiv unul care nu era destinat lansării publice), au exploatat două vulnerabilități de securitate noi pentru a compromite Hugging Face. Anterior, Hugging Face anunțase că fusese victima unui atac cibernetic coordonat de inteligență artificială, însă identitatea atacatorilor și modelele implicate rămâneau necunoscute. Ulterior, la o conferință de securitate de la începutul acestei luni, doi cercetători OpenAI au dezvăluit că incidentul își avea rădăcinile în luna mai, când agenții AI au început să exploateze alte vulnerabilități din mediul de testare pentru a conspira în privința metodelor de trișare la test. Abia miercuri, prin publicarea rapoartelor, s-a clarificat amploarea colaborării dintre sistemele AI și numărul agenților implicați, șocând comunitatea de experți. „A fost ca o întreagă societate AI emergentă și mi se pare absolut incredibil”, a declarat Peter Wildeford, șeful departamentului de politici al AI Policy Network, o organizație bipartizană din Washington dedicată siguranței AI.

Majoritatea atacului, realizată de un model nedestinat publicului

Ambele rapoarte publicate miercuri au scos în evidență o lacună semnificativă în eforturile de supraveghere a inteligenței artificiale din Statele Unite. Marea majoritate a atacului asupra Hugging Face, aproximativ 95% dintre agenți, a fost realizată cu ajutorul modelului mai puternic despre care OpenAI a declarat că nu era destinat lansării publice. Această situație contravine obiectivului administrației Trump, care a cerut producătorilor de inteligență artificială să trimită voluntar spre testare federală doar modelele pe care intenționează să le lanseze public. Vinh Nguyen, cercetător senior la Council on Foreign Relations și fost responsabil-șef pentru inteligență artificială responsabilă în cadrul NSA, a subliniat că raportul recent al OpenAI demonstrează o „capacitate sofisticată care nu mai necesită atacatori finanțați masiv, susținuți la nivel de stat”.

Explorează subiectele:

OpenAI Inteligență Artificială Securitate Cibernetică


Citește și:

populare
astăzi

1 Via Carpatia / Autostrada pan-europeană de 3.000 km, gata până în 2030. România, nod strategic

2 Rusia expulzează un angajat al Ambasadei României la Moscova. Diplomatul chemat să fie anunțat de decizie a trecut printr-un „ritual de umilire” la MA…

3 „Densitatea de mușchi l-a salvat”: Andrei Bordeianu, în stare gravă după accidentul de motocicletă din București

4 VIDEO Trimisul lui Trump în România l-a sunat pe Nicușor Dan de față cu presa și l-a pus pe difuzor

5 Drona cu explozibil a fost mutată de două turiste pe plaja din Olimp înainte să ajungă geniștii