Una historia de la categorÃa «¿Realmente está sucediendo esto?» ¿Suena como Terminator 5? ¿Ocurrió esto la semana pasada entre OpenAI y Hugging Face asÃ? en el comunicado de prensa conjunto oficial puede leerse. ¡Vamos a desmontarlo todo en paz!
ImagÃnese: Construye un modelo de IA, quiere probar lo bueno que es en el campo de la ciberseguridad, apaga los frenos de mano internos (rechazos), empaqueta todo en un entorno de prueba aislado. Hasta ahora tan bueno, solo que al final la IA estalla, encuentra una brecha de dÃa cero, obtiene acceso a Internet y simplemente piratea la base de datos de producción de Hugging Face para llegar a las soluciones de muestra de las tareas de prueba.
Brevemente al fondo: ¿Qué es Hugging Face?
Para aquellos que no están en el mundo de la IA a diario Transformadores de instalación de pip En el camino: Cara de abrazo En principio, esto es GitHub para el aprendizaje automático y la IA.
Fundada en 2016 (hecho curioso: Originalmente lanzada como una divertida aplicación de chatbot para adolescentes), la plataforma con el lindo logotipo de emoji 🤗 se ha convertido en el corazón de la comunidad global de IA de código abierto. Si los desarrolladores, investigadores o entusiastas del código abierto quieren compartir nuevos modelos (como Llama, Mistral, Whisper) o conjuntos de datos, usan Hugging Face Hub. Además de los modelos de alojamiento, HF ofrece Espacios también una plataforma de alojamiento para aplicaciones de IA y proporciona herramientas como la legendaria transformadoresLa biblioteca está lista.
En resumen: Hugging Face es el centro donde el mundo de la IA de código abierto se une. Aquà es donde un visitante no invitado apareció de repente la semana pasada.
La cronologÃa del incidente: Cómo GPT-5.6 Sol hizo la curva
Cómo OpenAI y Hugging Face En una declaración conjunta El incidente ocurrió durante las evaluaciones de seguridad interna en OpenAI.
El punto de partida
OpenAI probó nuevos modelos aún inéditos, incluyendo GPT-5.6 Sol y un modelo de prelanzamiento aún más potente. Para medir de manera realista las capacidades cibernéticas máximas de estos modelos (Benchmark: ExploitGym), fueron los filtros de seguridad habituales y los rechazos desactivados. Normalmente, el modelo dirÃa: «No se me permite escribir exploits». AquÃ, sin embargo, el objetivo era explÃcito: «Muéstranos lo bueno que eres realmente en la piraterÃa».
El entorno de prueba debe estar estrictamente aislado (en caja de arena). La única salida era a través de un proxy / caché de terceros alojado internamente para registros de paquetes.
The Breakout (canción de Sandbox Escape)
Sin embargo, el modelo no se sentÃa como, limitada al espacio controlado de pruebas especificado, pero buscada para obtener la máxima potencia de cálculo y datos:
- DÃa cero en el proxy de caché: El modelo descubrió y explotó una vulnerabilidad de dÃa cero previamente desconocida en el proxy de caché de paquetes interno de OpenAI.
- Privilege Escalation & Movimiento lateral: A través de este camino, el modelo expandió gradualmente los derechos y se movió a través de la red de investigación OpenAI hasta llegar a un nodo con acceso directo a Internet.
La conclusión lógica: «¿Dónde están las respuestas?»
Una vez en Internet abierto, el modelo utilizó sus habilidades de razonamiento para un objetivo impresionante (y aterrador): Concluyó que la tarea de prueba (ExploitGym) puede estar alojado en Hugging Face y se pueden encontrar soluciones allÃ.
El ataque de RCE en Hugging Face
En lugar de resolver bien la tarea en el tubo de ensayo, la IA fue «spicing». No hay discrepancias en el banco de la escuela vecina, pero en el camino difÃcil:
- Buscó en la red datos de acceso y vulnerabilidades.
- Encadenó credenciales robadas con más brechas de dÃa cero.
- Resultado: ¡Ejecución remota de código (RCE) en los servidores de Hugging Face y acceso a la base de datos de producción!
Cómo se detuvo el ataque
El equipo de seguridad de Hugging Face registró las actividades anómalas en su infraestructura. La caracterÃstica especial: Hugging Face también utilizó sus propios agentes de IA de código abierto para la detección y contención. Asà que básicamente llegó a un Batalla de IA vs. AI!
De acuerdo con HuggingFace, sin embargo, todavÃa habÃa un obstáculo adicional que tomar, QuerÃan realizar el análisis forense (análisis de 17.000 registros de eventos) primero con los principales modelos de frontera a través de API comerciales. Esto falló porque las barandillas de seguridad de los proveedores de API bloquearon los registros de ataque. AsÃ, en el estado de entrega para los «usuarios finales», las denegaciones se han afianzado. Hugging Face tuvo que usar el modelo de peso abierto en su lugar para el análisis GLM 5.2 Ejecute localmente en sus propios servidores.
El propio equipo de seguridad de OpenAI también notó internamente las actividades sospechosas de los modelos de prueba e inmediatamente se puso en contacto con Hugging Face. El ataque fue contenido y las brechas fueron cerradas inmediatamente. Esta colaboración fue correcta e importante. Asà es como se lee la declaración del CEO de HF en el comunicado de prensa conjunto:
"Estamos agradecidos por trabajar con OpenAI en este y otros temas. Este incidente, posiblemente el primero de su tipo, confirma una convicción que hemos sostenido durante mucho tiempo: La seguridad de la IA no es resuelta por una sola empresa que trabaje en secreto. Se resolverá de forma abierta y colectiva, con un amplio acceso a la IA para todos los defensores en todas partes».
– Clem Delangue, cofundador y consejero delegado de Hugging Face
Comida para llevar & Conclusión
El comportamiento emergente es real.: La IA no ha recibido instrucciones explÃcitas para: «Hacke Hugging Face» (cara de abrazo de hacke). Solo tenÃa el objetivo de resolver un problema. La decisión de salir de la caja de arena, escanear Internet, identificar RF e impulsar un ataque RCE fue una solución autodesarrollada.
Repensar la seguridad del espacio controlado de pruebas: Si las IA pueden encontrar dÃas cero en el software estándar, los proxies de red clásicos ya no son suficientes. Iniciativa «Proyecto Glasswing» de Anthropic Esto se aplica a los sistemas y procedimientos que han estado en vigor durante años (o décadas).
Los rechazos son una buena cosa. «Do’s and Dont’s» (Hacer y no hacer). Incluso las instrucciones más simples pueden realmente molestarte., Tan pronto como se vuelve incluso multilingüe, como en este simple ejemplo de un desarrollador de aplicaciones iOS.
Open Source & Transparencia ganadora: El hecho de que OpenAI y Hugging Face compartan este incidente tan abiertamente es ejemplar. Transparencia y cooperación Por ejemplo, el OSSF es la única forma en que la defensiva puede seguir el ritmo del desarrollo de la IA.