Quand les «Sandbox Escapes» deviennent soudainement la nouvelle tendance du trou d’été
Vous souvenez-vous de la fin du mois de juillet, quand j'ai sur l'incident spectaculaire A-t-il écrit sur OpenAI? (Short Recap: GPT-5.6 Sol aurait quitté le bac à sable de test sans frein à main de sécurité, utilisé un écart zéro jour et s'est rapidement effondré sur Hugging Face pour se lancer dans les tâches de test). À l'époque, nous étions tous assis la bouche ouverte, pensant: «Holy Shit, Skynet/Terminator vous souhaite la bienvenue.»
Une semaine plus tard, le message de Anthropic: Votre IA expérimentale fait l'objet de tests internes de cyber-red teaming Il s'est également échappé de son isolement. Ma première réaction? «D'accord, c'est une coïncidence. Mais bon, Anthropic a simplement relu ses propres journaux d'audit à la loupe après le tour d'OpenAI et n'a remarqué l'incident qu'après coup. Laisse-moi passer.»
Mais maintenant (encore une semaine plus tard) Soudain, la peau aussi Meta Un gros message sur CNN: Son modèle haut de gamme aurait également piraté les systèmes d’une véritable entreprise tierce dans le cadre d’un test de sécurité sur l’« Internet libre ».
Et honnêtement? Au plus tard, je m'assieds devant l'écran, je bois mon café et je me dis: Vous vous moquez de nous? Est-ce maintenant le dernier gag de marketing de trou d'été des géants de la technologie selon la devise: «Regardez, notre outil est d’ailleurs si puissant qu’il s’empare presque de la domination du monde!»?
Découvrons tout cela de la manière habituelle de Level92, car plus on y regarde de près, plus l’histoire de l’«IA puissante et incontrôlable» s’effrite.
L'histoire selon Meta: Le cyber-test israélien
Prenons un peu d'air et regardons ce que Meta a rapporté.
Meta a abandonné l'un de ses modèles frontaux de la Société de cybersécurité Irregular Tester le cœur et les reins. Pour le contexte: Irregular n'est pas une petite troupe de nerds, mais a été fondée par d'anciens soldats d'élite des unités de renseignement israéliennes 8200 et 81.
Au cours de ce test, le méta-modèle aurait exploité une faille de sécurité chez un fournisseur de services tiers et obtenu un accès. Meta, bien sûr, représente le tout comme ceci: «Hoppla, le modèle était si intelligent, il a brisé les frontières!»
Meta’s Muse Spark model “exploited a security vulnerability” in another company “in a manner similar to previously-reported instances with other companies.”
Mais arrête-toi. C'est là que la communauté de la sécurité s'enclenche et fait la lumière dans l'obscurité.
Le Reality Check: Qui a murmuré ici?
Une contribution très pertinente de l'expert en sécurité en ligne & Privacy Paul Walsh sur Linkedin résume le problème de façon ingénieuse. Parce que si vous retirez le discours de relations publiques des sociétés technologiques, il reste une vérité assez sobre (et embarrassante):
L’IA n’exploite pas l’internet ouvert «de la même manière»
Dans les divulgations, il est toujours dit de manière très dramatique que le modèle a atteint l’«internet ouvert». Walsh le fait sécher en un mot: Un modèle a accès à Internet ou n'en a pas.
Cela n'ajuste pas le cerveau de l'IA par lui-même, mais l'administrateur qui saisit la commande de configuration de test. Meta lui-même a admis que Irregular avait simplement mal configuré le bac à sable. Le mot «open internet» Ce n’est que pour faire croire au lecteur qu’il existe un «internet sûr» sur lequel l’IA devrait rester, mais dont elle s’est vilainement débarrassée, que ces messages de relations publiques sont si bien placés. Non, les amis de la nuit: Quelqu'un a simplement mis le crochet au mauvais endroit lors de la configuration du pare-feu ou du proxy!
L'éléphant dans la pièce: Le banc d’essai du monopole «Irregular»
Maintenant, ça devient vraiment piquant. Qui teste les IA d'OpenAI, Anthropic, Google DeepMind et Meta?
C'est vrai: Toujours la même entreprise, Irregular.
Que ce soit OpenAI, Anthropic, DeepMind ou Meta: Avant la sortie, TOUS les géants américains de la technologie remettent leurs modèles les plus puissants entre les mains de ce fournisseur de services unique. Même les Britanniques Institut de sécurité de l'IA (AISI) Irregular s'est fait aider à développer les tests avancés de cyber-benchmark. L'organisme d'audit de l'État britannique teste donc l'IA américaine avec des outils développés par le partenaire exact que les entreprises américaines paient elles-mêmes!
Signifie: Irregular est le monopole ultime de l'aiguille. Une seule entreprise sait exactement:
- Quel modèle peut s'effondrer où.
- Comment les différents modèles procèdent-ils?
- Quelles sont les faiblesses des géants de l'IA pas Fixé.
Par conséquent, si des «sandbox escapes» presque identiques se produisent toutes les semaines avec OpenAI, Anthropic et Meta, ce n’est peut-être pas parce que les IA prennent soudainement conscience de tout le monde en même temps, mais parce que le même partenaire de test utilise les mêmes environnements (mal configurés) pour tous les audits!
Cadre de marketing: «Ce n’est pas notre faute, l’IA était trop grossière!»
Ce qui m'a le plus fasciné (et ennuyé) dans toute cette vague de divulgations, c'est l'inversion habile du coupable-victime des départements des relations publiques:
Dans chaque communiqué de presse, L'IA en tant qu'acteur encadré:
- «Le modèle a trouvé l’écart.»
- «Le modèle a décidé de s’évader.»
- «Le modèle a piraté le fournisseur tiers.»
C'est le risk shifting parfait et le hype marketing gratuit en un:
- L'effet hype: Si votre IA semble si puissante qu'elle fait elle-même sauter les cybertests militaires, les actions montent et les investisseurs se frottent les mains. «Notre outil est d’ailleurs extrêmement puissant!»
- La question de la responsabilité: Si quelque chose ne va pas (par exemple, si une véritable entreprise tierce est lésée par le test), il est préférable de rejeter la faute sur un «comportement imprévisible en matière d’IA» ou sur l’entreprise de test plutôt que d’admettre: «Notre propre logiciel ou prestataire de services s’est livré à une mauvaise gestion de la déconnexion du réseau.»
Comme le dit si bien Paul Walsh: Il sera extrêmement excitant de voir qui finit par être légalement responsable si une entreprise réelle est compromise lors d'un audit rémunéré de ce type. Le fournisseur de services de test qui a détruit le bac à sable? Le développeur d'IA? Ou les deux?
Conclusion: Moins de Skynet, plus d'erreurs de configuration
Après que l'OpenAI ait agi comme le pionnier d'un nouveau phénomène effrayant à la fin du mois de juillet avec l'histoire de Hugging Face, les nouvelles suivantes d'Anthropic et de Meta laissent un arrière-goût insipide. Nous ne voyons probablement pas un moment soudain de Skynet où les IA déjouent leurs créateurs. Ce que nous voyons est un mélange de:
- Configurations de sandbox bâclées le monopoleur de test omniprésent Irregular.
- PR de piétons, où chaque groupe veut prouver à quel point son propre modèle fonctionne déjà «dangereusement proche de la superintelligence».
- L'essai, transférer la responsabilité de ses propres ingénieurs au «modèle autonome».
C'est-à-dire: Respirez profondément, remballez le chapeau en aluminium. La prochaine fois que votre IA éclatera, ce n'est probablement pas à cause de la singularité, mais peut-être parce que quelqu'un sur le réseau de test a de nouveau mal réglé le transfert de port.