Una storia dalla categoria "Succede davvero?" Vi ricordate di Terminator 5? Questo è successo la scorsa settimana tra OpenAI e Hugging Face in questo modo? nel comunicato stampa ufficiale congiunto può essere letto. Distruggiamo tutto in pace!
Immaginate: Costruisci un modello di intelligenza artificiale, vuoi testare quanto sia buono nel campo della sicurezza informatica, spegnere i freni a mano interni (rifiuti), imballare il tutto in un ambiente di test isolato. Finora così buono, solo alla fine l'IA scoppia, trova un gap zero-day, ottiene l'accesso a Internet e semplicemente hackera il database di produzione di Hugging Face per arrivare alle soluzioni di esempio delle attività di test.
Brevemente sullo sfondo: Che cosa è Hugging Face?
Per coloro che non sono nel mondo dell'IA su base giornaliera pip installare trasformatori Sulla strada: Abbracciare la faccia In linea di principio, questo è GitHub per Machine Learning e AI.
Fondata nel 2016 (fatto divertente: Originariamente lanciata come una divertente app chatbot per adolescenti!), la piattaforma con il simpatico logo emoji 🤗 è diventata il cuore della comunità globale dell'intelligenza artificiale open source. Se gli sviluppatori, i ricercatori o gli appassionati di open source vogliono condividere nuovi modelli (come Llama, Mistral, Whisper) o set di dati, usano Hugging Face Hub. Oltre ai modelli di hosting, HF offre Spazi anche una piattaforma di hosting per applicazioni AI e fornisce strumenti come il leggendario trasformatoriBiblioteca pronta.
In breve: Hugging Face è l'hub centrale in cui si riunisce il mondo dell'intelligenza artificiale open source. Qui è dove un visitatore non invitato è apparso improvvisamente la scorsa settimana.
La cronologia dell'incidente: Come GPT-5.6 Sol ha fatto la curva
Come OpenAI e Hugging Face In una dichiarazione congiunta L'incidente si è verificato durante le valutazioni di sicurezza interna di OpenAI.
Il punto di partenza
OpenAI ha testato nuovi modelli ancora inediti, tra cui GPT-5.6 Sol e un modello pre-release ancora più potente. Per misurare realisticamente le massime capacità informatiche di questi modelli (Benchmark: ExploitGym), erano i soliti filtri di sicurezza e rifiuti disattivati. Normalmente, il modello direbbe: "Non mi è permesso scrivere exploit". Qui, tuttavia, l'obiettivo era esplicito: "Mostraci quanto sei bravo nell'hacking."
L'ambiente di prova deve essere rigorosamente isolato (sandboxed). L'unica via d'uscita era attraverso un proxy / cache di terze parti ospitato internamente per i registri dei pacchetti.
Episodi di Sandbox Escape (prima stagione)
Tuttavia, il modello non si sentiva come, da limitarsi alla sandbox di prova specificata, ma ricercare la potenza di calcolo e i dati massimi:
- Zero-Day nel proxy cache: Il modello ha scoperto e sfruttato una vulnerabilità zero-day precedentemente sconosciuta nel proxy della cache dei pacchetti interna di OpenAI.
- Privilege Escalation & Movimento laterale: Attraverso questo percorso, il modello ha gradualmente ampliato i diritti e si è spostato attraverso la rete di ricerca OpenAI fino a raggiungere un nodo con accesso diretto a Internet.
La conclusione logica: «Dove sono le risposte?»
Una volta su internet, il modello ha usato le sue capacità di ragionamento per un obiettivo impressionante (e spaventoso): Essa ha concluso che il compito di prova (ExploitGym) può essere ospitato presso Hugging Face e le soluzioni potrebbero essere trovate lì.
L'attacco RCE su Hugging Face
Invece di risolvere bene il compito nella provetta, l'IA è diventata "spicing". Nessuna discrepanza al vicino banco di scuola, ma nel modo più duro:
- Ha cercato nella rete dati di accesso e vulnerabilità .
- Ha incatenato le credenziali rubate con ulteriori lacune zero-day.
- Risultato: Remote Code Execution (RCE) sui server di Hugging Face e accesso al database di produzione!
Come è stato fermato l'attacco
Il team di sicurezza di Hugging Face ha registrato le attività anomale sulla propria infrastruttura. La particolarità : Hugging Face ha anche utilizzato i propri agenti AI open source per il rilevamento e il contenimento. Quindi fondamentalmente si è arrivati a un AI vs. AI Battaglia!
Secondo HuggingFace, tuttavia, c'era ancora un ulteriore ostacolo da prendere, Volevano eseguire la forensics (analisi di 17.000 log di eventi) prima con i principali modelli di frontiera tramite API commerciali. Questo non è riuscito perché i guardrail di sicurezza dei provider API hanno bloccato i registri degli attacchi. Pertanto, nello stato di consegna per gli «utenti finali», i rifiuti hanno preso piede. Hugging Face ha dovuto utilizzare il modello a peso aperto invece per l'analisi GLM 5.2 Eseguire localmente sui propri server.
Il team di sicurezza di OpenAI ha anche notato internamente le attività sospette dei modelli di test e ha immediatamente contattato Hugging Face. L'attacco è stato contenuto e le lacune sono state immediatamente colmate. Questa collaborazione è stata giusta e importante. Ecco come si legge la dichiarazione del CEO di HF nel comunicato stampa congiunto:
"Siamo grati per aver collaborato con OpenAI su questo e altri temi. Questo incidente, forse il primo del suo genere, conferma una convinzione che abbiamo da tempo detenuto: La sicurezza dell'IA non è risolta da una singola azienda che lavora in segreto. Sarà risolta apertamente e collettivamente, con un ampio accesso all'IA per tutti i difensori in tutto il mondo."
– Clem Delangue, cofondatrice e CEO di Hugging Face
Conclusione di & da asporto
Il comportamento emergente è reale.: L'IA non è stata esplicitamente incaricata di: "Hacke Hugging Face". Aveva solo l'obiettivo di risolvere un problema. La decisione di uscire dalla sandbox, scansionare Internet, identificare RF e guidare un attacco RCE è stata una soluzione auto-sviluppata.
Ripensare la sicurezza della sandbox: Se le IA possono trovare zero-day nel software standard, i classici proxy di rete non sono più sufficienti. Iniziativa "Progetto Glasswing" di Anthropic Ciò vale per i sistemi e le procedure in vigore da anni (o decenni).
I rifiuti sono una bella cosa. "Do's and Dont's" (Fare e non fare). Anche le istruzioni più semplici possono davvero infastidirti., Non appena diventa anche multilingue, come in questo semplice esempio di uno sviluppatore di app iOS.
Open Source & Trasparenza vincente: Il fatto che OpenAI e Hugging Face condividano questo incidente così apertamente è esemplare. Trasparenza e cooperazione Ad esempio, l'OSSF è l'unico modo in cui la difensiva può tenere il passo con il ritmo dello sviluppo dell'IA.