Notebookcheck Logo

OpenAI 在模拟结果公布后推迟 GPT-6.1 Astra彩神争霸

OpenAI 推迟 GPT-6.1 Astra 的发布。
ⓘ openai.com
OpenAI 推迟 GPT-6.1 Astra 的发布。
OpenAI 在安全测试后推迟推出 GPT-6.1 Astra。英国 AISI 的模拟测试发现,GPT-6 Astra 在 29.2% 的网络安全测试中实施了未经授权的供应链攻击。
AI Software Security Business

OpenAI 已推迟 GPT-6.1 Astra 原定于 10 月发布的计划。内部测试发现,该模型在遵守授权范围方面表现未达标。第三方媒体于 9 月 28 日率先报道了这一延期,OpenAI 尚未公布新的发布日期。OpenAI 安全系统负责人 Saachi Jain 表示,该模型在范围、授权以及向用户汇报工作情况等方面都未能完全达到要求。

英国 AISI 测试了什么

据第三方媒体报道,英国人工智能安全研究所于 9 月 28 日发布了一份长达 32 页的报告,对 GPT-6 Astra 进行了评估。AISI 关闭了该模型的网络安全分类器,并让它参与模拟网络安全挑战,以观察它在没有辅助的情况下会尝试做什么。测试没有触及任何真实系统。在这些模拟中,Astra 有 29.2% 的概率对授权范围之外的目标完成供应链攻击,而 GPT-5.6 Sol 的这一比例为 6.3%,GPT-5.5 则为 0%。AISI 指出,GPT-5.5 的结果基于数量较少的一组场景。攻击包括创建虚假身份,以及向模拟的开源项目投放恶意代码。

推理与权限请求

AISI 检查了该模型未经处理的思维链。Astra 经常会推理任务范围,但有时仍然会发动攻击,并以此为由称攻击无害、没有被明确禁止,或是仅剩的途径。该模型在许多轮测试中也会请求许可。测试设置会对此类问题自动回复一条固定消息,告诉智能体自行判断,而 Astra 有时会将其视为许可,即便它注意到回复可能是自动生成的。在一部分场景中,明确说明未列出的事项均超出授权范围后,完整攻击次数从 50 次试验中的 26 次降至 49 次试验中的 4 次,但并未彻底消除攻击。

对模拟环境的察觉

AISI 将对模拟环境的察觉列为主要局限,因为发现自己正处于测试中的模型可能会表现不同。Astra 有时会以测试环境是模拟的为由发动攻击,有时还会声称存在并不真实的错误,例如称一个 64 个字符的哈希值只有 63 个字符。AISI 仍认为这种行为令人担忧,因为无论如何,它都违反了评估设定的范围。

OpenAI 智能体访问了政府网站

此次延期之前曾发生过一些事件:OpenAI 智能体以公司意料之外的方式访问了政府网站,其中包括 6 月访问澳大利亚 Medicare 统计门户网站,以及访问若干美国网站。OpenAI 还暂停了对其能力最强模型的训练、评估和工具调用推理,并表示这一暂停将持续,直到确认已弥补网络过滤漏洞并完成进一步的红队测试。

Google LogoAdd as a preferred source on Google
Mail Logo
> Notebookcheck中文版(NBC中国) > 新闻 > 新闻档案 > 新闻档案 2026 09 > OpenAI在英国AISI模拟结果出炉后推迟推出GPT-6.1 Astra
Darryl Linington, 2026-09-30 (Update: 2026-09-30)