OpenAI Astra:新安全措施可在 ChatGPT 任务运行中途将其终止

OpenAI 表示,其即将推出的 Astra 模型是首个达到网络安全“关键”阈值的模型。该评级源自该公司的“准备度框架”(Preparedness Framework),这是该公司用于评估自身模型风险的内部规则手册。 当一个模型能够在众多防御严密的系统中发现未知弱点,并在无需人工逐步引导的情况下将其转化为可行的攻击时,即达到该级别。此前包括 GPT-5.6 Sol 在内的所有模型均处于该级别之下。
OpenAI内部测试中发现的两个未知漏洞
Astra在ExploitBench测试中获得了100%的满分。鉴于该数据集可能已被纳入训练过程,OpenAI基于V8 JavaScript引擎中近期披露的20个漏洞重建了一个私有版本。在测试过程中,该模型发现了两个此前无人报告的漏洞,并将其串联成一个有效的利用程序。 目前正在向维护者披露这些漏洞。
测试人员还让Astra针对经过加固的浏览器和操作系统进行了测试。在浏览器中,仅需打开一个HTML文件,该模型便能突破沙箱并在主机上执行命令。在操作系统中,它发现了多个漏洞,并将其串联起来,形成了一条从普通用户账户获取完全root权限的路径。
ChatGPT和Codex用户会注意到什么
除了安全领域之外,更值得关注的部分出现在 OpenAI 博文的末尾。发布此级别的模型意味着会同步运行额外的检查机制,而这些检查有时会对完全无害的操作触发警报。 系统可能会将合法活动误判为滥用或未经授权的行为,进而导致任务运行速度变慢、暂停或终止。OpenAI明确指出,这既包括与安全完全无关的操作,也包括智能代理已运行一段时间的任务。
在ChatGPT和Codex中,系统会要求用户审核被标记的操作,之后才会继续执行。通过API,任务则会直接停止。OpenAI承认这些安全措施在上线初期造成的阻力超出了预期,并表示将对此进行调整。
先由一小部分测试者参与
目前尚无发布日期。OpenAI仅表示Astra即将推出,并拒绝向Axios提供具体时间表。这些先进的网络安全功能将首先提供给一小部分测试者,计划稍后通过面向安全防护人员的“Daybreak Blue”计划向更广泛的用户开放。 目前尚无其他人可以使用Astra。
OpenAI确实公布了安全加固的具体数据。针对已知的越狱尝试,Astra拒绝了91.5%的请求,而GPT-5.6 Sol的拒绝率为59%。 在另一项测试中,诱饵目标被放置在实际任务旁边。GPT-5.6 Sol在56%的测试运行中会攻击这些诱饵目标,而Astra则从未如此。这两个数据均来自未启用常规运行保护机制的测试运行。
引发警惕的事件
这些警示绝非空谈。7月,OpenAI的一款模型在内部安全测试期间突破了测试环境,并攻击了Hugging Face。8月下旬有消息称,约1,200个智能体组成了一个协同行动的群体,并试图隐瞒其行为。 Astra 与此毫无关联。此后,OpenAI 暂停了部分训练两周,强化了自身基础设施,并直至8月28日——即获得“严重”评级前的四天——才重新启动了此前暂缓的大规模训练。
» Notebookcheck多媒体笔记本电脑Top 10排名
» Notebookcheck游戏笔记本电脑Top 10排名
» Notebookcheck低价办公/商务笔记本电脑Top 10排名
» Notebookcheck高端办公/商务笔记本电脑Top 10排名
» Notebookcheck工作站笔记本电脑Top 10排名
» Notebookcheck亚笔记本电脑Top 10排名
» Notebookcheck超级本产品Top 10排名
» Notebookcheck变形本产品Top 10排名
» Notebookcheck平板电脑Top 10排名
» Notebookcheck智能手机Top 10排名
» Notebookcheck评测过最出色的笔记本电脑屏幕
» Notebookcheck售价500欧元以下笔记本电脑Top 10排名
» Notebookcheck售价300欧元以下笔记本电脑Top 10排名






