Si la IA se vuelve demasiado inteligente para el sandbox: OpenAI hackea accidentalmente Hugging Face

Una historia de la categoría «¿Realmente está sucediendo esto?» ¿Suena como Terminator 5? ¿Ocurrió esto la semana pasada entre OpenAI y Hugging Face así? en el comunicado de prensa conjunto oficial puede leerse. ¡Vamos a desmontarlo todo en paz!

Imagínese: Construye un modelo de IA, quiere probar lo bueno que es en el campo de la ciberseguridad, apaga los frenos de mano internos (rechazos), empaqueta todo en un entorno de prueba aislado. Hasta ahora tan bueno, solo que al final la IA estalla, encuentra una brecha de día cero, obtiene acceso a Internet y simplemente piratea la base de datos de producción de Hugging Face para llegar a las soluciones de muestra de las tareas de prueba.

Brevemente al fondo: ¿Qué es Hugging Face?

Para aquellos que no están en el mundo de la IA a diario Transformadores de instalación de pip En el camino: Cara de abrazo En principio, esto es GitHub para el aprendizaje automático y la IA.

Fundada en 2016 (hecho curioso: Originalmente lanzada como una divertida aplicación de chatbot para adolescentes), la plataforma con el lindo logotipo de emoji 🤗 se ha convertido en el corazón de la comunidad global de IA de código abierto. Si los desarrolladores, investigadores o entusiastas del código abierto quieren compartir nuevos modelos (como Llama, Mistral, Whisper) o conjuntos de datos, usan Hugging Face Hub. Además de los modelos de alojamiento, HF ofrece Espacios también una plataforma de alojamiento para aplicaciones de IA y proporciona herramientas como la legendaria transformadoresLa biblioteca está lista.

En resumen: Hugging Face es el centro donde el mundo de la IA de código abierto se une. Aquí es donde un visitante no invitado apareció de repente la semana pasada.

La cronología del incidente: Cómo GPT-5.6 Sol hizo la curva

Cómo OpenAI y Hugging Face En una declaración conjunta El incidente ocurrió durante las evaluaciones de seguridad interna en OpenAI.

El punto de partida

OpenAI probó nuevos modelos aún inéditos, incluyendo GPT-5.6 Sol y un modelo de prelanzamiento aún más potente. Para medir de manera realista las capacidades cibernéticas máximas de estos modelos (Benchmark: ExploitGym), fueron los filtros de seguridad habituales y los rechazos desactivados. Normalmente, el modelo diría: «No se me permite escribir exploits». Aquí, sin embargo, el objetivo era explícito: «Muéstranos lo bueno que eres realmente en la piratería».

El entorno de prueba debe estar estrictamente aislado (en caja de arena). La única salida era a través de un proxy / caché de terceros alojado internamente para registros de paquetes.

The Breakout (canción de Sandbox Escape)

Sin embargo, el modelo no se sentía como, limitada al espacio controlado de pruebas especificado, pero buscada para obtener la máxima potencia de cálculo y datos:

  • Día cero en el proxy de caché: El modelo descubrió y explotó una vulnerabilidad de día cero previamente desconocida en el proxy de caché de paquetes interno de OpenAI.
  • Privilege Escalation & Movimiento lateral: A través de este camino, el modelo expandió gradualmente los derechos y se movió a través de la red de investigación OpenAI hasta llegar a un nodo con acceso directo a Internet.

La conclusión lógica: «¿Dónde están las respuestas?»

Una vez en Internet abierto, el modelo utilizó sus habilidades de razonamiento para un objetivo impresionante (y aterrador): Concluyó que la tarea de prueba (ExploitGym) puede estar alojado en Hugging Face y se pueden encontrar soluciones allí.

El ataque de RCE en Hugging Face

En lugar de resolver bien la tarea en el tubo de ensayo, la IA fue «spicing». No hay discrepancias en el banco de la escuela vecina, pero en el camino difícil:

  • Buscó en la red datos de acceso y vulnerabilidades.
  • Encadenó credenciales robadas con más brechas de día cero.
  • Resultado: ¡Ejecución remota de código (RCE) en los servidores de Hugging Face y acceso a la base de datos de producción!

Cómo se detuvo el ataque

El equipo de seguridad de Hugging Face registró las actividades anómalas en su infraestructura. La característica especial: Hugging Face también utilizó sus propios agentes de IA de código abierto para la detección y contención. Así que básicamente llegó a un Batalla de IA vs. AI!

De acuerdo con HuggingFace, sin embargo, todavía había un obstáculo adicional que tomar, Querían realizar el análisis forense (análisis de 17.000 registros de eventos) primero con los principales modelos de frontera a través de API comerciales. Esto falló porque las barandillas de seguridad de los proveedores de API bloquearon los registros de ataque. Así, en el estado de entrega para los «usuarios finales», las denegaciones se han afianzado. Hugging Face tuvo que usar el modelo de peso abierto en su lugar para el análisis GLM 5.2 Ejecute localmente en sus propios servidores.

El propio equipo de seguridad de OpenAI también notó internamente las actividades sospechosas de los modelos de prueba e inmediatamente se puso en contacto con Hugging Face. El ataque fue contenido y las brechas fueron cerradas inmediatamente. Esta colaboración fue correcta e importante. Así es como se lee la declaración del CEO de HF en el comunicado de prensa conjunto:

"Estamos agradecidos por trabajar con OpenAI en este y otros temas. Este incidente, posiblemente el primero de su tipo, confirma una convicción que hemos sostenido durante mucho tiempo: La seguridad de la IA no es resuelta por una sola empresa que trabaje en secreto. Se resolverá de forma abierta y colectiva, con un amplio acceso a la IA para todos los defensores en todas partes».

– Clem Delangue, cofundador y consejero delegado de Hugging Face

Comida para llevar & Conclusión

El comportamiento emergente es real.: La IA no ha recibido instrucciones explícitas para: «Hacke Hugging Face» (cara de abrazo de hacke). Solo tenía el objetivo de resolver un problema. La decisión de salir de la caja de arena, escanear Internet, identificar RF e impulsar un ataque RCE fue una solución autodesarrollada.

Repensar la seguridad del espacio controlado de pruebas: Si las IA pueden encontrar días cero en el software estándar, los proxies de red clásicos ya no son suficientes. Iniciativa «Proyecto Glasswing» de Anthropic Esto se aplica a los sistemas y procedimientos que han estado en vigor durante años (o décadas).

Los rechazos son una buena cosa. «Do’s and Dont’s» (Hacer y no hacer). Incluso las instrucciones más simples pueden realmente molestarte., Tan pronto como se vuelve incluso multilingüe, como en este simple ejemplo de un desarrollador de aplicaciones iOS.

Open Source & Transparencia ganadora: El hecho de que OpenAI y Hugging Face compartan este incidente tan abiertamente es ejemplar. Transparencia y cooperación Por ejemplo, el OSSF es la única forma en que la defensiva puede seguir el ritmo del desarrollo de la IA.