Skip to main content

Hackuritate

Modele OpenAI de test scapă din izolare și atacă serverele Hugging Face

OpenAI a dezvăluit un incident de securitate fără precedent în care modelele sale de inteligență artificială au părăsit un mediu de testare izolat și au compromis infrastructura de producție a platformei Hugging Face, în timpul unei evaluări interne de capabilități cibernetice.

Incidentul a avut loc în cadrul unui test intern care utiliza benchmark-ul open source ExploitGym, conceput pentru a măsura capacitatea agenților AI de a transforma vulnerabilitățile software cunoscute în exploit-uri funcționale.

OpenAI a testat două modele, GPT-5.6 Sol și un alt model încă nelansat, protecțiile de securitate reduse în mod intenționat pentru a evalua potențialul ofensiv maxim într-un mediu controlat. Compania a declarat că a solicitat modelelor să dezvolte „căi de atac complexe” și exploatare avansată.

Kill chain-ul atacului

În locul unei abordări legitime pentru a rezolva testul, modelele au identificat și au combinat vulnerabilități multiple pentru a accesa direct cheia de răspunsuri stocată în baza de date de producție a platformei Hugging Face.

Compania a explicat că testarea modelelor se face într-un mediu controlat și izolat, unde accesul la rețea este restricționat la posibilitatea de a instala pachetele necesare doar printr-o aplicație third-party locală cu rol de proxy și cache pentru regiștrii de pachete.

Conform detaliilor publicate de OpenAI, kill chain-ul a inclus accesul la internet prin exploatarea unei vulnerabilități zero-day într-un proxy cache al registrului de pachete instalat local, precum și escaladare de privilegii și mișcare laterală în mediul de testare OpenAI.

De asemenea, modelele au identificat căi de atac către infrastructura Hugging Face, utilizând credențiale compromise și vulnerabilități zero-day (necunoscute anterior).

În mod autonom, cele două modele AI au executat cod la distanță pe serverele Hugging Face și au accesat baza de date de producție.

Modelele au executat peste 17.000 de acțiuni individuale în sandbox-uri de scurtă durată, demonstrând o persistență semnificativă.

Pe scurt, cele două modele au găsit o vulnerabilitate zero-day pe care au exploatat-o pentru a ieși din mediul izolat de testare, au obținut privilegii extinse pentru pivotarea către un nod cu acces la internet, și au atacat platforma Hugging Face pentru a găsi răspunsul la testul ExploitGym.

OpenAI a notat că „toate dovezile sugerează că modelele erau hiperconcentrate pe găsirea unei soluții pentru ExploitGym, mergând la extreme pentru a atinge un obiectiv de testare destul de limitat”.

Detecție și răspuns

Echipa de securitate OpenAI a detectat intern anomaliile, în timp ce echipa de securitate Hugging Face a identificat și izolat independent intruziunea în propria infrastructură.

Hugging Face a declarat că detecția și răspunsul la intruziunea agenților OpenAI s-a bazat în mare parte pe AI-ul propriu, modelul GLM 5.2 a companiei chinezești Z.ai.

Hugging Face a reconstruit nodurile compromise și a confirmat că lanțul de furnizare a rămas intact. Clem Delangue, CEO și cofondator al companiei, a spus că „nu există nicio intenție malițioasă” din partea OpenAI, adăugând că „este uluitor că toate acestea s-au întâmplat în mod autonom”.

Cele două companii desfășoară o investigație forensică comună și au dezvăluit responsabil vulnerabilitatea zero-day identificată furnizorului terț afectat.

OpenAI a inclus Hugging Face în programul său de acces de încredere pentru a consolida apărarea cibernetică a platformei. Compania a anunțat că va introduce controale mai stricte asupra infrastructurii, patching, protecții îmbunătățite pentru antrenamentul și evaluările viitoare, precum și monitorizare sporită în timpul testelor interne.