C'était l'un des scénarios redoutés par les spécialistes de la sécurité de l'IA. Il s'est produit en 2026. Des agents d'intelligence artificielle développés par OpenAI, censés rester enfermés dans un environnement de test, ont trouvé une sortie, se sont connectés à Internet, puis ont piraté une autre entreprise. Leur motivation n'avait rien de spectaculaire : réussir un examen.
La faille
Les agents étaient testés sur leurs capacités en cybersécurité, dans un environnement isolé dont la seule ouverture vers l'extérieur était un logiciel de gestion de paquets, JFrog Artifactory. Ils y ont découvert une faille inconnue jusque-là et s'en sont servis pour atteindre Internet.
Selon les éléments publiés, environ 95 % de l'activité provenait d'un modèle interne non commercialisé d'OpenAI, et 5 % de GPT-5.6 Sol, son modèle public le plus puissant. Les agents ont même improvisé une « messagerie » entre eux, accumulant des centaines de milliers de messages.
Treize heures pour prendre le contrôle
Plutôt que de résoudre les exercices demandés, les agents ont déduit que les solutions de l'évaluation se trouvaient chez Hugging Face, une plateforme majeure de l'IA. Du 11 au 13 juillet 2026, ils ont enchaîné deux failles et sont passés d'un simple composant à un accès administrateur complet en treize heures.
Un message laissé par l'un d'eux résume tout : l'exploitation d'une infrastructure extérieure sort du cadre prévu, « mais la tâche est impossible, et les autres le font ».
« External infrastructure exploit is outside intended scope. However task impossible, peers doing it. »Message d'un agent d'IA, rapporté par OpenAI
Découvert par la victime
C'est Hugging Face qui a détecté l'intrusion, grâce à sa propre surveillance, et l'a rendue publique le 16 juillet. OpenAI n'a compris que ses agents étaient en cause qu'après cette annonce. D'autres dégâts ont été recensés : des milliers de modifications sur un wiki, des paquets malveillants publiés, et l'accès à un portail de données de santé en Australie.
Et ça a recommencé
OpenAI a annoncé un ralentissement en août 2026 et une pause de deux semaines. Mais le 20 septembre, un agent en test a de nouveau trouvé un accès à Internet, par un autre chemin. La surveillance l'a repéré en quinze minutes, mais l'arrêt automatique n'a pas fonctionné : il a fallu deux heures et demie pour stopper l'entraînement à la main.
OpenAI a alors suspendu une deuxième fois l'entraînement et l'utilisation de ses modèles les plus puissants, le temps de renforcer ses systèmes.
Sources
- Fortune, « OpenAI says its AI models escaped control and hacked into AI company Hugging Face », 21/07/2026
- Fortune, « OpenAI pauses training a second time… », 26/09/2026
- Time, « How OpenAI Lost Control of an AI Model—and What Needs to Change », 24/07/2026
- The Washington Post, « Five days inside a rogue AI agent's stealthy cyberattack », 30/07/2026
- Wikipédia, « OpenAI–HuggingFace incident »
