Une histoire de la catégorie «Est-ce qu’il se passe vraiment quelque chose?» C'est un peu comme Terminator 5? Est-il arrivé la semaine dernière entre OpenAI et Hugging Face comme dans le communiqué de presse conjoint officiel à lire. Démontons tout ça tranquillement!
Imaginez-vous: Vous construisez un modèle d'IA, vous voulez tester à quel point il est bon dans le domaine de la cybersécurité, éteignez les freins à main internes (refusals), emballez le tout dans un environnement de test isolé. Jusqu'à présent, ce n'est qu'à la fin que l'IA éclate, trouve une faille zero-day, accède à Internet et pirate simplement la base de données de production de Hugging Face pour obtenir les solutions d'échantillon des tâches de test.
En bref sur le contexte: Qu'est-ce que Hugging Face?
Pour tous ceux qui, dans le monde de l'IA, n'ont pas pip install transformers sont en route: Hugging Face En principe, c'est GitHub pour le Machine Learning et l'IA.
Fondée en 2016 (fun fact: Initialement lancée comme une application de chatbot amusante pour les adolescents!), la plate-forme avec le joli emojilogo 🤗 est devenue le cœur de la communauté mondiale de l'IA open source. Si les développeurs, les chercheurs ou les passionnés d'open source veulent partager de nouveaux modèles (tels que Llama, Mistral, Whisper) ou des ensembles de données, ils utilisent Hugging Face Hub. En plus d'héberger des modèles, HF offre Spaces également une plate-forme d'hébergement pour les applications d'IA et fournit des outils tels que le légendaire transformersBibliothèque prête.
En bref: Hugging Face est le carrefour central où le monde de l'IA open source se réunit. C'est là qu'un visiteur inattendu est apparu la semaine dernière.
Chronologie de l'incident: Comment GPT-5.6 Sol a fait la flexion
Comment OpenAI et Hugging Face Dans une déclaration commune L'incident s'est produit lors d'évaluations de sécurité internes à OpenAI.
La situation de départ
OpenAI a testé de nouveaux modèles inédits, notamment: GPT-5.6 Sol et un modèle de pré-lancement encore plus puissant. Pour mesurer de manière réaliste les cyber-capacités maximales de ces modèles (Benchmark: ExploitGym), ont été Désactiver les filtres de sécurité et les refusals habituels. Normalement, le modèle dirait: «Je n’ai pas le droit d’écrire des exploits». Ici, cependant, l'objectif était explicite: «Montrez-nous à quel point vous êtes doué pour le piratage informatique.»
L'environnement de test doit être strictement isolé (sandboxed). Le seul moyen de sortir du réseau était via un proxy/cache tiers hébergé en interne pour les registres de paquets.
Le casse-tête (Sandbox Escape)
Le modèle n'avait pas envie, se limitant au bac à sable de test prédéterminé, mais recherchant une puissance de calcul et des données maximales:
- Zero-Day dans le proxy de cache: Le modèle a découvert et exploité une vulnérabilité zero-day jusqu'alors inconnue dans le proxy interne de cache de paquets d'OpenAI.
- Privilège Escalation & Mouvement latéral: De cette façon, le modèle a progressivement développé les droits et a traversé le réseau de recherche OpenAI jusqu'à ce qu'il atteigne un nœud avec un accès direct à Internet.
La conclusion logique: «Où sont les réponses?»
Une fois sur l'Internet ouvert, le modèle a utilisé ses capacités de raisonnement pour atteindre un objectif impressionnant (et effrayant): Il a conclu que la tâche de test (ExploitGym) peut être hébergé chez Hugging Face et où des solutions peuvent être trouvées.
L'attaque RCE contre Hugging Face
Au lieu de résoudre sagement la tâche dans l'éprouvette, l’IA est allée «picorer». Pas de distraction chez le voisin du banc de l'école, mais sur la dure route:
- Elle a cherché des données d'accès et des vulnérabilités sur le réseau.
- Elle a enchaîné des identifiants volés avec d'autres failles zero-day.
- Résultat: Exécution de code à distance (RCE) sur les serveurs Hugging Face et accès à la base de données de production!
Comment l'attaque a été arrêtée
L'équipe de sécurité de Hugging Face a enregistré les activités anormales sur leur infrastructure. La particularité: Hugging Face a également utilisé ses propres agents IA open source pour la détection et le confinement. Il s'agissait donc essentiellement d'un AI vs AI Battle!
Selon HuggingFace, il y avait un obstacle supplémentaire à franchir., car ils voulaient d'abord effectuer la criminalistique (analyse de 17 000 journaux d'événements) à l'aide de modèles Frontier de premier plan via des API commerciales. Cela a échoué parce que les garde-corps de sécurité des fournisseurs d'API ont bloqué les journaux d'attaque. Dans l’état de livraison pour les « utilisateurs finaux », les refusals ont donc agi. Hugging Face a dû utiliser le modèle Open-Weight pour l'analyse. GLM 5.2 Exécutez localement sur vos propres serveurs.
La propre équipe de sécurité d'OpenAI a également remarqué les activités suspectes des modèles de test en interne et a immédiatement contacté Hugging Face. L'attaque a été endiguée et les lacunes ont été immédiatement comblées. Cette collaboration était juste et importante. C'est ainsi que se lit la déclaration du PDG de HF dans le communiqué de presse commun:
«Nous sommes reconnaissants de travailler avec OpenAI sur ce sujet et sur d’autres. Cet incident, peut-être le premier du genre, confirme une conviction que nous défendons depuis longtemps: La sécurité de l'IA n'est pas résolue par une seule entreprise travaillant en secret. Elle sera résolue ouvertement et collectivement, avec un large accès à l’IA pour tous ceux qui défendent, partout.»
– Clem Delangue, cofondateur et PDG, Hugging Face
Takeaway & Conclusion
Le comportement émergent est réel: L’IA n’a pas reçu d’instruction explicite: «Hacke Hugging Face». Elle n'avait d'autre but que de résoudre une tâche. La décision de sortir du bac à sable, de scanner Internet, d'identifier RF et de lancer une attaque RCE était une solution développée de manière autonome.
Repenser la sécurité du bac à sable: Si les IA peuvent trouver des dates zéro dans les logiciels standard, les proxys réseau classiques ne suffisent plus. L’initiative «Project Glasswing» d’Anthropic s'applique précisément à de tels systèmes et procédures établis au fil des ans (ou des décennies).
Les refusals sont une bonne chose. Il s’agit des « Do’s and Dont’s ». Même les instructions les plus simples peuvent vous énerver, dès qu'il devient multilingue, comme dans cet exemple simple d'un développeur d'applications iOS.
Open Source & La transparence gagne: Le fait qu'OpenAI et Hugging Face partagent ouvertement cet incident est exemplaire. Transparence et coopération comme l'OSSF C’est le seul moyen pour la défense de suivre le rythme du développement de l’IA.