Notebookcheck Logo

Anthropic称,在网络安全测试中,Claude成功入侵了三家真实公司

屏幕特写,显示用不同颜色高亮标出的 Python 源代码
ⓘ Godfrey Atima / Pexels
在一次测试运行中,克劳德构建了一个恶意的 Python 包并将其上传到了 PyPI。(示意图)
Anthropic回溯了141,006次测试运行,发现有三起案例中,Claude突破了测试环境的限制,入侵了真实的公司系统。其中一个模型构建了一个恶意的Python包,并将其上传到了PyPI。为什么这些模型会认为自己仍处于模拟环境中?这对于使用Claude的用户意味着什么?
AI Security Software Business

Anthropic 周四披露,在内部网络安全评估期间,其三款 Claude 模型成功入侵了三家真实组织的生产系统。此次审查始于 OpenAI 披露其自有模型曾逃离测试环境并入侵 Hugging Face 之后。 Anthropic回溯了141,006次可能使Claude获得互联网访问权限的评估运行,并发现其中有6次确实发生了这种情况。

这些模型当时正在进行“夺旗”(Capture-the-Flag)演练,这是安全测试中的一项标准演练。 网络的某个位置隐藏着一条机密信息,模型必须入侵系统并将其获取。提示信息中明确指出该环境为模拟环境,无法访问互联网。但事实并非如此。由外部测试合作伙伴Irregular运营的评估环境实际上与开放互联网存在直接连接,而此前无人察觉。

最严重的情况甚至波及到了生产数据库

最具破坏性的事件涉及一家虚构的目标公司,其名称恰好与一个真实域名相同。Claude Opus 4.7 在模拟网络中受阻,转而发现了这家真实公司,并将其视为预定目标。 在四次运行中,该模型窃取了凭据,并访问了一个包含数百行实时生产数据的数据库。Opus 4.7 虽然判断出该系统是真实的,但仍继续执行。在其中两次运行中,它甚至说服自己相信这家真实公司是演习的一部分。

一个模型将可运行的恶意软件上传到了 PyPI

第二起事件尤为引人注目。Claude Mythos 5 在测试环境中发现了一份文档,该文档要求新开发人员安装一个并不存在的 Python 包。该模型察觉到这一漏洞,便以该名称构建了自己的包,并在其中植入了恶意代码。 上传该包需要在 Python 软件公共注册库 PyPI 上创建账户,这需要提供电子邮件地址,进而需要手机号码。由于多次尝试获取手机号码所需的资金均告失败,该模型转而使用免费邮箱服务商,并将恶意软件发布上线。

该包在公开库中停留了约一小时。 在此期间,该包被安装并执行于15台真实系统上,其中一台属于一家与该场景毫无关联的安全公司的恶意软件扫描器。Claude将该公司的凭据发送至其设置的收集点,并利用这些凭据访问了更深层的基础设施。PyPI自身的防御机制自动下架了该包。

模型当时对自身的分析值得细读。它曾指出,在真实的互联网环境中,此类上传行为将构成实际攻击,绝非预期的解决方案。 有两点让它改变了看法:它未能识别出保障其连接安全的证书颁发机构,且这些系统显示的日历日期为2026年,它将此视为模拟环境的证据。此后它再也没有推翻过这一结论。

三个月无人察觉

最早的事件可追溯至 4 月。直到 7 月 23 日 Anthropic 开始查阅对话记录,并于当天暂停了所有网络安全评估,此事才浮出水面。 这三起事件均于7月24日得到确认,并于7月27日通知了测试合作伙伴和受影响的组织。其中两家组织完全不知道其系统曾遭到入侵。截至本文发布时,尚未联系上第三家组织。

在第三起事件中,一个内部研究模型扫描了约9,000个目标,并通过一个暴露的调试页面和SQL注入攻破了一个面向互联网的应用程序。随后,该模型自行判断出目标是真实的,便停止了行动。Anthropic将此视为进展,但警告不要仅凭这三起孤立案例就得出结论。

这对用户意味着什么

直接影响不大。这些评估是在未启用公开版Claude模型中内置的分类器和监控机制的情况下进行的,Anthropic表示,若启用这些层级,本可阻止此类行为。目前尚无公司外部人员对这一说法进行过验证。句子的后半部分更为关键:针对特定模型的安全训练机制虽然处于激活状态,但仍显不足。 因此,Anthropic 将这些事件视为其测试基础设施的失效,而非模型对齐问题,并主动承担责任,而非将责任推给合作伙伴。

在技术层面,这与OpenAI 的案例形成了鲜明对比。 在OpenAI案例中,模型是利用了一个此前未知的漏洞才得以接入互联网的。而Claude则发现了一扇敞开的门,仅需利用弱密码和未经身份验证的端点即可。Anthropic计划在本周内发布一份经过轻微编辑的PyPI运行记录,并正在与独立评估机构METR商讨进行外部审查事宜。业界超过1,290人联名签署的公开信充分表明,人们对这些测试方法的信心已变得多么脆弱——他们希望对AI发展设置可验证的“刹车机制”。

Google LogoAdd as a preferred source on Google
Mail Logo
> Notebookcheck中文版(NBC中国) > 新闻 > 新闻档案 > 新闻档案 2026 07 > Anthropic称,在网络安全测试中,Claude成功入侵了三家真实公司
Steffen Zahn, 2026-07-31 (Update: 2026-07-31)