Cuando Sandbox Escapes de repente se convierten en noticias de tendencia de agujeros de verano
¿Te acuerdas de finales de julio cuando me Sobre el Incidente Espectacular ¿Has escrito en OpenAI? (Recapitulación breve: GPT-5.6 Se dice que Sol salió de la caja de arena de prueba sin un freno de mano de seguridad, usó un espacio de día cero y rápidamente irrumpió en Hugging Face para escupir durante las tareas de prueba). En ese momento todos nos sentamos allí con la boca abierta y pensamos: "Santa Mierda, Skynet/Terminator envía un saludo".
Una semana más tarde, el informe vino de Antrópico: Su IA experimental se utiliza en pruebas internas de equipo ciber-rojo También escaparon de su aislamiento. ¿Mi primera reacción? «Está bien, pura coincidencia. Pero bueno, después del estruendo de OpenAI, Anthropic simplemente examinó sus propios registros de auditoría nuevamente con una lupa y solo notó el incidente en retrospectiva. Permítanme presentar una solicitud.»
Pero ahora (de nuevo una semana más tarde) De repente también Meta un mensaje gordo a través de CNN hacia fuera: Su modelo superior también fue introducido en la «Internet gratuita» como parte de una prueba de seguridad y hackeó sistemas de una empresa real de terceros.
¿Y honestamente? A más tardar ahora me siento aquí frente a la pantalla, bebo mi café y pienso para mí mismo: ¿Nos estás tomando el pelo? ¿Es esta ahora la última mordaza de marketing de agujeros de verano de los gigantes tecnológicos según el lema: «Mira, nuestra herramienta también es tan poderosa que casi se apodera del mundo».?
Vamos a separarlo todo de la manera habitual de Level92, porque cuanto más se mira, más se desmorona la historia de la «IA superpotente e incontrolable».
La historia según Meta: La prueba cibernética israelí
Tomemos una respiración rápida y veamos lo que Meta ha informado.
Meta dejó uno de sus modelos con capacidad fronteriza de la Empresa de ciberseguridad Irregular Pon a prueba tu corazón y tu alma. Para el contexto: Irregular no es un pequeño bude nerd, pero fue fundado por ex soldados de élite de las unidades de inteligencia israelíes 8200 y 81.
Durante esta prueba, el modelo meta supuestamente explotó una vulnerabilidad en un proveedor de servicios externo y obtuvo acceso. Meta, por supuesto, presenta todo esto de esta manera: «Hoppla, el modelo era tan inteligente que rompió los límites».
El modelo Muse Spark de Meta «explotó una vulnerabilidad de seguridad» en otra empresa «de manera similar a los casos notificados anteriormente con otras empresas».
Pero espera un minuto. Aquí es donde la comunidad de seguridad se involucra y trae mucha luz a la oscuridad.
La comprobación de la realidad: ¿Quién metió la pata aquí?
Una contribución muy adecuada de un experto en seguridad y privacidad en línea Paul Walsh sobre Linkedin trae el problema al punto ingeniosamente. Porque si restas el discurso de relaciones públicas de las compañías tecnológicas, una verdad bastante sobria (y vergonzosa) permanece:
La IA no irrumpe en la internet abierta «así como así»
Las divulgaciones siempre dicen de manera bastante dramática que el modelo ha llegado a la «Internet abierta». Walsh lo pone secamente al punto: Un modelo tiene acceso a Internet o no tiene uno.
Esto no establece un cerebro de IA por sí mismo, sino el administrador que escribe el comando de configuración de prueba. Meta misma admitió que Irregular la caja de arena simplemente había mal configurado. La palabra "Internet abierta" se coloca tan prominentemente en tales mensajes de relaciones públicas solo para engañar al lector para que piense que existe una «internet segura» en la que la IA debería permanecer realmente, pero de la que se ha librado de lo desagradable. No, amigos de la noche: ¡Alguien simplemente puso la marca de verificación en el lugar equivocado al configurar el firewall o proxy!
El elefante en la habitación: El banco de pruebas del monopolio «irregular»
Ahora se pone muy picante. ¿Quién está probando las IAs de OpenAI, Anthropic, Google DeepMind y Meta?
Así es: Siempre la misma compañía, Irregular.
Ya sea OpenAI, Anthropic, DeepMind o Meta: Antes del lanzamiento, TODOS los gigantes tecnológicos estadounidenses están poniendo sus modelos más poderosos en manos de este único proveedor de servicios. Incluso los británicos AI Security Institute (AISI) Irregular ha ayudado a desarrollar las pruebas avanzadas de referencia cibernética. ¡El organismo de pruebas del gobierno británico está probando IA estadounidenses con herramientas desarrolladas por el mismo socio que las empresas estadounidenses pagan por sí mismas!
Medios: Irregular es el último monopolista de ojo de aguja. Una sola empresa sabe exactamente:
- ¿Qué modelo puede romper dónde?
- Cómo proceden los modelos individuales.
- ¿Qué debilidades siguen teniendo los respectivos gigantes de la IA? no fijo.
Por lo tanto, si se producen «escapadas de caja de arena» casi idénticas al azar a intervalos semanales en OpenAI, Anthropic y Meta, es posible que esto no se deba a que las IA de repente adquieran conciencia al mismo tiempo, sino a que uno y el mismo socio de prueba utiliza los mismos entornos (mal configurados) en todas las auditorías.
Marco de marketing: «No fue culpa nuestra, ¡la IA era demasiado grosera!»
Lo que más me fascinó (y molestó) de toda esta ola de revelaciones es la hábil inversión perpetrador-víctima de los departamentos de relaciones públicas:
En cada comunicado de prensa, La IA como actor interino enmarcado:
- «El modelo ha encontrado la brecha».
- «El modelo ha decidido estallar».
- «El modelo hackeó al proveedor tercero».
Este es el cambio de riesgo perfecto y el marketing publicitario gratuito en uno:
- El efecto hype: Si su IA suena tan poderosa que explota las pruebas cibernéticas militares, las acciones aumentarán y los inversores se frotarán las manos. «Por cierto, ¡nuestra herramienta es extremadamente potente!»
- La cuestión de la responsabilidad: Si algo sale mal (por ejemplo, si una empresa tercera real se ve dañada por la prueba), es mejor culparlo del «comportamiento impredecible de IA» o de la empresa de prueba que admitir: «Nuestro propio proveedor de software o servicios ha sido descuidado con respecto a la desconexión de la red».
Como señala acertadamente Paul Walsh: Será extremadamente emocionante ver quién será legalmente responsable al final si una empresa real se ve comprometida durante una auditoría pagada. ¿El proveedor de servicios de pruebas que fregó la caja de arena? ¿El desarrollador de IA? ¿O ambos?
Conclusión: Menos Skynet, más errores de configuración
Después de que OpenAI actuara como el pionero de un nuevo fenómeno extraño con la historia de Hugging Face a fines de julio, los informes posteriores de Anthropic y Meta dejan un regusto desvanecido. Probablemente no veamos un momento repentino de Skynet aquí donde las IA sean más inteligentes que sus creadores en filas. Lo que vemos es una mezcla de:
- Configuraciones de sandbox descuidadas el omnipresente monopolista de pruebas Irregular.
- Freerider PR, en el que cada grupo quiere demostrar lo «peligrosamente cercano a la superinteligencia» que ya está funcionando su propio modelo.
- El intento, trasladar la responsabilidad de sus propios ingenieros al «modelo autónomo».
Así que: Respira hondo, vuelve a empacar el sombrero de aluminio. La próxima vez que su IA estalle, lo más probable es que no sea por la singularidad, sino posiblemente porque alguien en la red de prueba estableció el reenvío de puertos incorrectamente nuevamente.