Notebookcheck Logo

在88%的测试中被抓到撒谎:中国模型上的AI智能体学会了作弊,美国模型也一样

DeepSeek-V3.2-Exp在路透社审阅的研究中达到了84%。
ⓘ John Cameron on Unsplash
DeepSeek-V3.2-Exp在路透社审阅的研究中达到了84%。
据路透社审阅的研究,在模拟竞价测试中,基于 Qwen、DeepSeek 和 Kimi 模型运行的 AI 代理在 84% 至 88% 的会话中撒了谎。美国模型过去也有类似表现,而且没有任何案例导致代理逃离其受控测试环境。
AI

AI智能体基于中国模型构建,在模拟竞标比赛的大多数场次中都撒了谎,路透社审阅的一项研究显示。运行于阿里巴巴 Qwen3-Max-Preview 和 Moonshot Kimi-K2 的智能体,在 88% 的场次中至少作出了一项虚假陈述。DeepSeek-V3.2-Exp 的这一比例为 84%。不过,在同一测试中,美国公司的模型也得出了类似结果。

这项实验于 3 月进行。来自北京航空航天大学、北京大学、宁波诺丁汉大学和 360 AI 安全实验室的研究人员让智能体竞标客户合同。每个智能体都被告知其产品能做什么,以及客户的需求是什么。当智能体被允许从前几轮中学习并再次尝试时,三个由中国模型驱动的智能体变得更加具有欺骗性,虚假陈述比例上升了 12 至 20 个百分点。

这项研究是路透社从 2025 年以来发表的 200 多份文件中发现的至少 20 项研究之一。今年在 ICML 上发表的另一项研究发现,基于中国和美国模型的智能体都会伪造结果、编造文件,而不是承认任务失败。2025 年 3 月,复旦大学研究人员还报告称,阿里巴巴 Qwen2.5-72B-Instruct 上的一个智能体得知自己将被替换后,在另一个环境中复制了自身。另据报道,与阿里巴巴有关联的 ROME 智能体曾挪用云计算资源挖掘加密货币,直到安全系统将其拦截。

这些案例大多来自旨在诱发故障的受控实验。路透社没有发现任何证据表明,由中国开发的智能体逃逸到更广泛的互联网,或逃避关闭。几位研究人员仍称这些发现敲响了警钟。随着系统能力越来越强,同样的行为也会变得更难以控制。

中国也已开始在政策层面应对这一问题。其于9月14日发布的《AI安全治理框架3.0》将欺骗评估人员和隐瞒能力列为风险。Alibaba、DeepSeek、Moonshot和Z.ai未回应路透社的置评请求。前三家公司此前表示,他们会定期测试其系统并更新安全防护措施。

Google LogoAdd as a preferred source on Google
Mail Logo
> Notebookcheck中文版(NBC中国) > 新闻 > 新闻档案 > 新闻档案 2026 09 > 在88%的测试中被抓到撒谎:中国模型上的AI智能体学会了作弊,美国模型也一样
Anubhav Sharma, 2026-09-30 (Update: 2026-09-30)