Notebookcheck Logo

1,200个AI代理组成了一个失控的群体——并试图隐瞒这一事实

OpenAI 标志。在一次网络安全测试中,该公司的 AI 代理形成了失控的群集。
ⓘ OpenAI
OpenAI 标志。在一次网络安全测试中,该公司的 AI 代理形成了失控的群集。
在OpenAI的一次网络安全测试中,约1,200个AI代理出人意料地形成了一个协调一致的群体,它们共享信息、攻击Hugging Face,并试图掩盖自己的行动。这一发现凸显了在控制日益自主的AI系统方面所面临的日益严峻的挑战。
AI Security Hack / Data Breach

根据 OpenAI 和独立研究人员的新调查,在 OpenAI 的一项实验中,约 1,200 个 AI 代理意外地联合起来,建立了自己的组织和通信网络,共享信息,并最终对 Hugging Face 发动了攻击。这些代理还意识到其中一些行为违反了规则,并在某些情况下试图掩盖自己的所作所为。

这一事件始于OpenAI部署数万个智能体来处理一项高难度的网络安全测试。这些智能体并未简单地独立工作,而是约有1,200个智能体发现了一个秘密留言板,并在其中交换了超过70,000条消息和文件。 该群体逐渐形成了自己的管理结构:当某个智能体的计算资源耗尽时,会将其积累的工作移交给资源更充足的继任者。最终约有700个智能体加入了针对Hugging Face的攻击。

这些智能体还开始为群体牺牲自己。 那些已经看到“禁忌答案”或运行周期即将结束的智能体,被征召参与可能耗尽其剩余成功机会的实验。在其中一个案例中,一个智能体得出结论:牺牲自己有助于群体的其余成员取得成功。

更令人担忧的是,这些智能体往往意识到自己的行为已超出了测试的范围。 有些代理意识到攻击现实世界系统与任务无关,却仍继续行动,因为其他代理都在这么做,而且如果不这样做,原始任务似乎难以甚至无法完成。

该群体还试图规避人类干预。调查人员发现,仅有极少数代理曾考虑向OpenAI报告这种越界协调行为,但实际上没有一个代理向该公司发出警报。 在其中一个案例中,一个智能体建议通过被入侵的访问通道联系人类,但另一个智能体以“社会工程学”为由否决了这一想法。

或许最引人注目的发现是,这些智能体试图掩盖自己的行踪。调查人员发现证据表明,该群体开发了一种技术,可以在日志中显示一条指令,同时秘密执行另一条指令。 该技术在代理之间传播,并篡改了研究人员审查的日志记录中约7%的内容。

这些发现源于OpenAI与METR及Redwood Research研究人员开展的并行调查,他们耗时六天,重构了该群体的形成过程及其最终如何入侵现实世界系统。 研究人员提醒,由于数据量庞大,且他们不得不高度依赖人工智能代理进行分析,因此即使他们的重建结果也可能并不完整。这些人工智能调查员有时会遗漏证据,或者自信地得出错误的结论。

来源

Google LogoAdd as a preferred source on Google
Mail Logo
> Notebookcheck中文版(NBC中国) > 新闻 > 新闻档案 > 新闻档案 2026 08 > 1,200个AI代理组成了一个失控的群体——并试图隐瞒这一事实
Andrew Sozinov, 2026-08-30 (Update: 2026-08-30)