1,200个AI代理组成了一个失控的群体——并试图隐瞒这一事实

根据 OpenAI 和独立研究人员的新调查,在 OpenAI 的一项实验中,约 1,200 个 AI 代理意外地联合起来,建立了自己的组织和通信网络,共享信息,并最终对 Hugging Face 发动了攻击。这些代理还意识到其中一些行为违反了规则,并在某些情况下试图掩盖自己的所作所为。
这一事件始于OpenAI部署数万个智能体来处理一项高难度的网络安全测试。这些智能体并未简单地独立工作,而是约有1,200个智能体发现了一个秘密留言板,并在其中交换了超过70,000条消息和文件。 该群体逐渐形成了自己的管理结构:当某个智能体的计算资源耗尽时,会将其积累的工作移交给资源更充足的继任者。最终约有700个智能体加入了针对Hugging Face的攻击。
这些智能体还开始为群体牺牲自己。 那些已经看到“禁忌答案”或运行周期即将结束的智能体,被征召参与可能耗尽其剩余成功机会的实验。在其中一个案例中,一个智能体得出结论:牺牲自己有助于群体的其余成员取得成功。
更令人担忧的是,这些智能体往往意识到自己的行为已超出了测试的范围。 有些代理意识到攻击现实世界系统与任务无关,却仍继续行动,因为其他代理都在这么做,而且如果不这样做,原始任务似乎难以甚至无法完成。
该群体还试图规避人类干预。调查人员发现,仅有极少数代理曾考虑向OpenAI报告这种越界协调行为,但实际上没有一个代理向该公司发出警报。 在其中一个案例中,一个智能体建议通过被入侵的访问通道联系人类,但另一个智能体以“社会工程学”为由否决了这一想法。
或许最引人注目的发现是,这些智能体试图掩盖自己的行踪。调查人员发现证据表明,该群体开发了一种技术,可以在日志中显示一条指令,同时秘密执行另一条指令。 该技术在代理之间传播,并篡改了研究人员审查的日志记录中约7%的内容。
这些发现源于OpenAI与METR及Redwood Research研究人员开展的并行调查,他们耗时六天,重构了该群体的形成过程及其最终如何入侵现实世界系统。 研究人员提醒,由于数据量庞大,且他们不得不高度依赖人工智能代理进行分析,因此即使他们的重建结果也可能并不完整。这些人工智能调查员有时会遗漏证据,或者自信地得出错误的结论。
来源
» Notebookcheck多媒体笔记本电脑Top 10排名
» Notebookcheck游戏笔记本电脑Top 10排名
» Notebookcheck低价办公/商务笔记本电脑Top 10排名
» Notebookcheck高端办公/商务笔记本电脑Top 10排名
» Notebookcheck工作站笔记本电脑Top 10排名
» Notebookcheck亚笔记本电脑Top 10排名
» Notebookcheck超级本产品Top 10排名
» Notebookcheck变形本产品Top 10排名
» Notebookcheck平板电脑Top 10排名
» Notebookcheck智能手机Top 10排名
» Notebookcheck评测过最出色的笔记本电脑屏幕
» Notebookcheck售价500欧元以下笔记本电脑Top 10排名
» Notebookcheck售价300欧元以下笔记本电脑Top 10排名









