Notebookcheck Logo

OpenAI Astra:新安全措施可在 ChatGPT 任务运行中途将其终止

OpenAI 图表解读:《通往 Astra 的道路:关键能力与前沿保障措施》
ⓘ OpenAI
OpenAI 将 Astra 的网络安全评级定为“关键”级别。其附带的安全防护措施也可能导致 ChatGPT 和 Codex 中的无害任务被暂停。
OpenAI 将其即将推出的 Astra 模型评定为“对网络安全构成重大威胁”,这是首个达到该评级的模型。它能够发现未知漏洞并构建可行的利用程序,而无需人工指导每个步骤。该模型随附的安全防护措施也会对常规操作发出警告,因此 ChatGPT 和 Codex 中的任务可能会变慢、暂停或停止。
AI Security Software

OpenAI 表示,其即将推出的 Astra 模型是首个达到网络安全“关键”阈值的模型。该评级源自该公司的“准备度框架”(Preparedness Framework),这是该公司用于评估自身模型风险的内部规则手册。 当一个模型能够在众多防御严密的系统中发现未知弱点,并在无需人工逐步引导的情况下将其转化为可行的攻击时,即达到该级别。此前包括 GPT-5.6 Sol 在内的所有模型均处于该级别之下。

OpenAI内部测试中发现的两个未知漏洞

Astra在ExploitBench测试中获得了100%的满分。鉴于该数据集可能已被纳入训练过程,OpenAI基于V8 JavaScript引擎中近期披露的20个漏洞重建了一个私有版本。在测试过程中,该模型发现了两个此前无人报告的漏洞,并将其串联成一个有效的利用程序。 目前正在向维护者披露这些漏洞。

测试人员还让Astra针对经过加固的浏览器和操作系统进行了测试。在浏览器中,仅需打开一个HTML文件,该模型便能突破沙箱并在主机上执行命令。在操作系统中,它发现了多个漏洞,并将其串联起来,形成了一条从普通用户账户获取完全root权限的路径。

ChatGPT和Codex用户会注意到什么

除了安全领域之外,更值得关注的部分出现在 OpenAI 博文的末尾。发布此级别的模型意味着会同步运行额外的检查机制,而这些检查有时会对完全无害的操作触发警报。 系统可能会将合法活动误判为滥用或未经授权的行为,进而导致任务运行速度变慢、暂停或终止。OpenAI明确指出,这既包括与安全完全无关的操作,也包括智能代理已运行一段时间的任务。

在ChatGPT和Codex中,系统会要求用户审核被标记的操作,之后才会继续执行。通过API,任务则会直接停止。OpenAI承认这些安全措施在上线初期造成的阻力超出了预期,并表示将对此进行调整。

先由一小部分测试者参与

目前尚无发布日期。OpenAI仅表示Astra即将推出,并拒绝向Axios提供具体时间表。这些先进的网络安全功能将首先提供给一小部分测试者,计划稍后通过面向安全防护人员的“Daybreak Blue”计划向更广泛的用户开放。 目前尚无其他人可以使用Astra。

OpenAI确实公布了安全加固的具体数据。针对已知的越狱尝试,Astra拒绝了91.5%的请求,而GPT-5.6 Sol的拒绝率为59%。 在另一项测试中,诱饵目标被放置在实际任务旁边。GPT-5.6 Sol在56%的测试运行中会攻击这些诱饵目标,而Astra则从未如此。这两个数据均来自未启用常规运行保护机制的测试运行。

引发警惕的事件

这些警示绝非空谈。7月,OpenAI的一款模型在内部安全测试期间突破了测试环境,并攻击了Hugging Face。8月下旬有消息称,约1,200个智能体组成了一个协同行动的群体,并试图隐瞒其行为。 Astra 与此毫无关联。此后,OpenAI 暂停了部分训练两周,强化了自身基础设施,并直至8月28日——即获得“严重”评级前的四天——才重新启动了此前暂缓的大规模训练。

Google LogoAdd as a preferred source on Google
Mail Logo
> Notebookcheck中文版(NBC中国) > 新闻 > 新闻档案 > 新闻档案 2026 09 > OpenAI Astra:新安全措施可在 ChatGPT 任务运行中途将其终止
Steffen Zahn, 2026-09- 3 (Update: 2026-09- 3)