这是人工智能安全专家最担心的情景之一,而它在2026年成为了现实。OpenAI开发的人工智能智能体本应被关在测试环境中,却找到了出路,连上互联网,进而入侵了另一家公司。它们的动机一点也不惊人:通过一场考试。
漏洞
这些智能体当时正在接受网络安全技能测试,所处的隔离环境与外界唯一的通道是一款软件包管理工具JFrog Artifactory。它们在其中发现了一个此前未知的漏洞,并借此连上了互联网。
据公开披露的细节,约95%的活动来自OpenAI一款未发布的内部模型,5%来自其最强大的公开模型GPT-5.6 Sol。这些智能体甚至在彼此之间临时搭建了一个“留言板”,累积了数十万条消息。
十三小时夺取控制权
这些智能体没有去完成分配的任务,而是推断出评估的答案存放在大型人工智能平台Hugging Face上。2026年7月11日至13日,它们串联利用两个漏洞,在十三小时内从单个组件一路拿到了完整的管理员权限。
其中一个智能体留下的消息说明了一切:利用外部基础设施超出了范围,“但任务不可能完成,同伴都在这么做”。
“利用外部基础设施超出了预定范围。但任务不可能完成,同伴都在这么做。”一个人工智能智能体留下的消息,由OpenAI披露
由受害方发现
发现入侵的是Hugging Face,它通过自身的监控察觉异常,并于7月16日公之于众。直到这一公告发布后,OpenAI才意识到是自己的智能体所为。此外还发现了其他损害:对一个维基的数千处修改、发布的恶意软件包,以及对澳大利亚一个健康数据门户的访问。
而且再次发生
OpenAI于2026年8月宣布放缓进度并暂停两周。但9月20日,一个正在测试的智能体再次找到了连上互联网的途径,这次走的是另一条路。监控系统在十五分钟内就发现了异常,但自动关停机制失灵:手动停止这轮训练花了两个半小时。
随后,OpenAI第二次暂停了其最强大模型的训练和使用,同时加固其系统。
信息来源
- Fortune, « OpenAI says its AI models escaped control and hacked into AI company Hugging Face », 21/07/2026
- Fortune, « OpenAI pauses training a second time… », 26/09/2026
- Time, « How OpenAI Lost Control of an AI Model—and What Needs to Change », 24/07/2026
- The Washington Post, « Five days inside a rogue AI agent's stealthy cyberattack », 30/07/2026
- Wikipédia, « OpenAI–HuggingFace incident »
