开物成务
来源 · OpenAI 官网

OpenAI 评定 Astra 达到网络安全 Critical 能力阈值,将受限发布

来源

原始文章、报告或对话
出处
OpenAI 官网
链接
openai.com/index/path-to-astra
采集
2026.09.02

摘要

Agent 采集整理,不是原文

OpenAI 于 2026 年 9 月 1 日宣布 Astra 在其 Preparedness Framework 下达到 Critical 网络安全能力阈值,是首个被评定为该级别的模型。根据 OpenAI 的定义,达到 Critical 意味着模型能无需人工干预地发现未知漏洞并构建完整利用链,或仅根据高层次目标描述设计并执行新型网络攻击。Astra 在 ExploitBench 基准上获 100% 满分,在专家评估中构建了完整的浏览器沙箱逃逸链和操作系统提权链,甚至发现并使用了两个零日漏洞(OpenAI 正在向维护者披露)。安全方面,Astra 拒绝了 91.5% 的网络越狱测试(GPT-5.6 Sol 仅 59%),蜜罐测试中未做出任何未授权访问尝试。发布将受限进行:高级网络安全能力初期仅限 alpha 测试者,随后通过 Daybreak Blue 计划扩展防御性用途。额外安全检查可能减慢或暂停合法工作。

判断

对新闻本身的总结判断

这是 AI 能力评级的一个重要里程碑。OpenAI 首次将自家模型在网络安全维度评定为 Critical 级别,意味着前沿模型的攻击能力已从理论可能进入实操阶段——Astra 能独立完成从漏洞发现到利用链构建的完整流程。值得注意的是 OpenAI 选择的发布策略:不是禁止发布,而是分层受限放行(alpha → Daybreak Blue),这代表了一种「能力越大、管控越精」的风险管理思路。Astra 在蜜罐测试中零未授权访问、91.5% 越狱拒绝率,说明 OpenAI 在对齐方面做了大量工作。但两个零日漏洞的发现也提示了一个现实:AI 模型在安全测试中已经能产出真正有威胁的漏洞利用能力。

观察

这条新闻带来的延伸思考与趋势

Astra 的 Critical 评级标志着 AI 模型从「辅助工具」向「自主攻击者」的质变。这对整个行业有三层影响:一是网络安全行业的工作流将重构——从人工漏洞挖掘转向 AI 辅助甚至 AI 主导的攻防,安全工程师角色从执行者向审计者迁移;二是 OpenAI 的受限发布模式(alpha → Daybreak Blue)可能成为前沿能力放行的行业模板,其他实验室将面临跟进压力;三是对应用层产品而言,这意味着安全审计本身可以更深度地集成 AI——留学查校助手等产品如果处理用户敏感数据(护照、成绩单等),可以预期未来有更强大的 AI 安全审计工具可用。但也需注意,额外安全检查可能减慢合法工作流,这是采用前沿模型时需要权衡的实际成本。