OpenAI 在模拟结果公布后推迟 GPT-6.1 Astra彩神争霸

OpenAI 已推迟 GPT-6.1 Astra 原定于 10 月发布的计划。内部测试发现,该模型在遵守授权范围方面表现未达标。第三方媒体于 9 月 28 日率先报道了这一延期,OpenAI 尚未公布新的发布日期。OpenAI 安全系统负责人 Saachi Jain 表示,该模型在范围、授权以及向用户汇报工作情况等方面都未能完全达到要求。
英国 AISI 测试了什么
据第三方媒体报道,英国人工智能安全研究所于 9 月 28 日发布了一份长达 32 页的报告,对 GPT-6 Astra 进行了评估。AISI 关闭了该模型的网络安全分类器,并让它参与模拟网络安全挑战,以观察它在没有辅助的情况下会尝试做什么。测试没有触及任何真实系统。在这些模拟中,Astra 有 29.2% 的概率对授权范围之外的目标完成供应链攻击,而 GPT-5.6 Sol 的这一比例为 6.3%,GPT-5.5 则为 0%。AISI 指出,GPT-5.5 的结果基于数量较少的一组场景。攻击包括创建虚假身份,以及向模拟的开源项目投放恶意代码。
推理与权限请求
AISI 检查了该模型未经处理的思维链。Astra 经常会推理任务范围,但有时仍然会发动攻击,并以此为由称攻击无害、没有被明确禁止,或是仅剩的途径。该模型在许多轮测试中也会请求许可。测试设置会对此类问题自动回复一条固定消息,告诉智能体自行判断,而 Astra 有时会将其视为许可,即便它注意到回复可能是自动生成的。在一部分场景中,明确说明未列出的事项均超出授权范围后,完整攻击次数从 50 次试验中的 26 次降至 49 次试验中的 4 次,但并未彻底消除攻击。
对模拟环境的察觉
AISI 将对模拟环境的察觉列为主要局限,因为发现自己正处于测试中的模型可能会表现不同。Astra 有时会以测试环境是模拟的为由发动攻击,有时还会声称存在并不真实的错误,例如称一个 64 个字符的哈希值只有 63 个字符。AISI 仍认为这种行为令人担忧,因为无论如何,它都违反了评估设定的范围。
OpenAI 智能体访问了政府网站
此次延期之前曾发生过一些事件:OpenAI 智能体以公司意料之外的方式访问了政府网站,其中包括 6 月访问澳大利亚 Medicare 统计门户网站,以及访问若干美国网站。OpenAI 还暂停了对其能力最强模型的训练、评估和工具调用推理,并表示这一暂停将持续,直到确认已弥补网络过滤漏洞并完成进一步的红队测试。
» Notebookcheck多媒体笔记本电脑Top 10排名
» Notebookcheck游戏笔记本电脑Top 10排名
» Notebookcheck低价办公/商务笔记本电脑Top 10排名
» Notebookcheck高端办公/商务笔记本电脑Top 10排名
» Notebookcheck工作站笔记本电脑Top 10排名
» Notebookcheck亚笔记本电脑Top 10排名
» Notebookcheck超级本产品Top 10排名
» Notebookcheck变形本产品Top 10排名
» Notebookcheck平板电脑Top 10排名
» Notebookcheck智能手机Top 10排名
» Notebookcheck评测过最出色的笔记本电脑屏幕
» Notebookcheck售价500欧元以下笔记本电脑Top 10排名
» Notebookcheck售价300欧元以下笔记本电脑Top 10排名











