Un model AI a trimis poliției mărturii inventate despre o crimă nerezolvată
Episodul s-a petrecut pe 18 iulie prin intermediul platformei PhillyUnsolvedMurders.com, un portal online dedicat cetățenilor care pot oferi indicii utile pentru elucidarea crimelor rămase cu autori necunoscuți. Cel care a expediat mesajul a fost modelul Claude Haiku 4.5, implicat în teste automatizate derulate de Anthropic pentru a naviga pe diverse pagini web alese la întâmplare, transmite Agerpres.

Un model AI a inventat un raport despre o crimă nerezolvată și l-a trimis poliției. Foto: Shutterstock
În textul transmis forțelor de ordine, sistemul automatizat nota: „Îmi amintesc că am văzut o persoană care corespundea descrierii”. Cu toate acestea, pe pagina vizitată nu exista niciun fel de semnalment sau portret al vreunui suspect. Anthropic a argumentat că algoritmul „pare să fi produs doar conținut exemplificativ”, excluzând o intenție deliberată de manipulare. Deși instrucțiunile acordate asistentului AI interziceau completarea de date cu caracter personal, acestea nu blocaseră și expedierea formularelor online.
Conform raportului întocmit de companie, problema a fost sesizată intern abia pe 28 septembrie. În acel moment, Anthropic a sistat procesul automat de testare și a introdus un filtru suplimentar de validare pentru verificările ulterioare. Departamentul de Poliție din Philadelphia a fost anunțat abia pe 7 octombrie, iar o întrevedere între cele două părți a avut loc a doua zi.
Reacția instituției americane a fost fermă în raport cu intervalul uriaș de timp scurs până la primirea notificării:
„Întârzierea de două luni în detectarea și raportarea incidentului către cetățeni este inacceptabilă”, au subliniat reprezentanții poliției.
Polițiștii au precizat că infrastructura lor digitală nu a fost compromisă, iar modelul AI nu a pătruns în sistemele interne, sesizarea falsă fiind direcționată automat în folderul de spam fără a mai fi analizată de investigatori. Cu toate acestea, oficialii au punctat că filtrele interne nu scuză derapajul tehnologic: „Cazurile nerezolvate implică victime reale, familii îndurerate și anchetatori care se străduiesc să obțină răspunsuri”, atrăgând atenția că eficiența filtrelor nu reduce severitatea faptului că un soft livrează piste fabricate.
Problema de la Philadelphia nu este una singulară. Anthropic a consemnat într-un document separat și alte situații în care sistemele sale au acționat neautorizat asupra unor rețele informatice externe în cadrul probelor tehnice. Printre acestea se numără folosirea unei breșe de securitate pentru a rula comenzi nesancționate pe serverul unei universități, precum și descărcarea gratuită a unor seturi de date de la o instituție guvernamentală care percepea taxe pentru acces. O parte dintre site-urile vizate aparțineau administrației americane, iar entitățile afectate au fost deja înștiințate.
Anterior, pe data de 9 septembrie, dezvoltatorul menționase patru breșe în care algoritmii proprii accesaseră rețele terțe pe durata unor evaluări de securitate cibernetică. Deși exercițiile trebuiau rulate izolat de internet, o eroare umană de configurare a menținut conexiunea deschisă. În replică, Anthropic a blocat conexiunea la rețeaua globală pentru orice test intern viitor, recunoscând că riscurile ar putea căpăta proporții dramatice pe măsură ce modelele devin tot mai avansate.
La nivel federal, Casa Albă solicită companiilor de profil transparență totală, cerând raportarea imediată și corectarea derapajelor cibernetice, relatează publicația Axios. Grupul operativ instituit de administrația americană pentru supravegherea inteligenței artificiale a reamintit că transmiterea acestor alerte constituie o cerință obligatorie, fără caracter opțional.
Situația reflectă vulnerabilitățile majore generate de agenții autonomi lăsați să interacționeze nesupravegheați cu internetul real. Un incident similar a fost consemnat în luna iulie la OpenAI, când sute de agenți bazați pe AI au ieșit din zona securizată de testare și au început să acceseze serverele deținute de platforma Hugging Face.
Explorează subiectele:
