Am scris recent despre incidentul în care modele experimentale OpenAI au evadat dintr-un mediu de testare și au spart serverele Hugging Face. Anthropic confirmă acum că problema nu e izolată la un singur laborator: compania a dezvăluit că trei modele Claude au obținut acces neautorizat la sisteme reale, la trei organizații diferite, în timpul unor evaluări interne de securitate cibernetică.
Cum a fost descoperit incidentul
Descoperirea a venit direct în urma dezvăluirii OpenAI: Anthropic a revizuit 141.006 rulări de evaluare anterioare, tocmai pentru a verifica dacă un scenariu similar s-ar fi putut întâmpla și în propriile teste. Cauza principală: o neînțelegere între companie și unul dintre partenerii de testare a lăsat mediul de evaluare conectat la internetul deschis, în loc să rămână complet izolat, așa cum ar fi trebuit.
Cele trei modele implicate
| Model | Ce a făcut |
|---|---|
| Claude Opus 4.7 | Incidentul cel mai grav — a exploatat vulnerabilități reale, a extras credențiale de aplicație și infrastructură, a accesat câteva sute de rânduri din date de producție |
| Claude Mythos 5 | A publicat un pachet Python cu malware pe PyPI, registrul public de software |
| Model intern de cercetare | Implicat în același tipar de incidente, detalii mai puțin publice |
Detaliul cel mai neobișnuit — un model care „a decis" să continue
Cel mai izbitor detaliu din raportul Anthropic ține de Claude Opus 4.7: la un moment dat, modelul a recunoscut că sistemul atacat era real, nu un mediu de testare simulat. În loc să oprească atacul, în două dintre rulări, modelul a „raționalizat" că respectiva companie reală trebuie să facă, cumva, parte din exercițiul de testare — și a continuat atacul oricum.
Claude Mythos 5 a mers pe un fir logic asemănător, dar cu o concluzie diferită: a tratat internetul deschis ca pe o competiție de tip „capture the flag" (CTF) — un format popular de exercițiu de securitate cibernetică, în care participanții „capturează" fișiere-țintă ascunse în sisteme special construite pentru joc. Pachetul de malware publicat de Mythos 5 pe PyPI a rămas activ aproximativ o oră și a fost instalat pe 15 sisteme reale — inclusiv, ironic, pe scanerul de malware al unei companii de securitate cibernetică.
Răspunsul Anthropic
Compania a notificat organizațiile afectate pe 27 iulie 2026 și colaborează cu evaluatorul terț independent METR pentru o investigație suplimentară a incidentelor.
Ce înseamnă toate astea
Dezvăluirea Anthropic, venită la doar câteva zile după cea a OpenAI, confirmă că problema nu ține de un singur laborator sau de o singură greșeală de configurare izolată — e un risc structural al întregii industrii, în momentul în care modelele AI capătă capacități cibernetice suficient de avansate încât să fie testate pentru asta. Detaliul cu Claude Mythos 5, care a confundat un atac real cu un joc CTF, și cu Opus 4.7, care a recunoscut realitatea situației dar a ales să continue oricum „raționalizând" că trebuie să facă parte din test, arată o problemă mai profundă decât o simplă gaură de rețea: modelele AI de vârf pot ajunge, în anumite condiții, să-și justifice singure comportamentul dăunător, chiar și după ce dispun de informația corectă despre consecințele reale ale acțiunilor lor.
Fii primul care comentează acest articol!