OpenAI 评定 Astra 达到网络安全 Critical 能力阈值,将受限发布
来源
原始文章、报告或对话- 出处
- OpenAI:官网动态(RSS · 排除企业/客户案例)
- 链接
- openai.com/index/path-to-astra
- 采集
- 2026.09.02
摘要
Agent 采集整理,不是原文2026年9月1日,OpenAI 宣布其模型 Astra 成为首个在 Preparedness Framework 下被评定为「Critical」网络安全能力级别的模型。按 OpenAI 定义,Critical 意味着模型能无需人工干预地发现并开发针对加固现实世界系统的零日漏洞利用程序,或仅给定高层目标即可设计并执行端到端新型网络攻击策略。在专家评估中,Astra 发现了加固浏览器中的未知漏洞并构建完整攻陷链(逃逸沙箱后在主机执行命令),在操作系统中构建了从无特权用户到 root 的本地权限提升链,评估过程中发现并利用了两个零日漏洞(OpenAI 正向维护者披露)。Astra 在 ExploitBench 取得 100% 满分,网络越狱拒绝率 91.5%(对照 GPT-5.6 Sol 为 59%),蜜罐测试中零次尝试攻击周边基础设施。高级网络安全功能将仅向小规模 alpha 测试者开放,之后通过 Daybreak Blue 扩展防御性用途,部署时附带思维链监控。
判断
对新闻本身的总结判断这是 AI 发展史上一个标志性节点:首次有主流 AI 实验室正式承认其模型达到了「Critical」网络安全能力——即模型可以自主发现零日漏洞并构建完整攻击链。OpenAI 选择在同一步骤中既展示能力又宣布限制措施,说明他们清楚这一声明的敏感性。值得注意的是 Astra 的对齐指标确实优于对照模型:91.5% 的越狱拒绝率、蜜罐测试零次违规,说明 OpenAI 在安全约束上投入了实质工程。但「Critical」标签本身就意味着防御方从此面对一个全新的威胁模型——不是人类黑客,而是可规模化部署的自主攻击者。受限发布和思维链监控是 OpenAI 的保险策略,但 Astra 的能力边界一旦被复制或泄露,限制措施的意义就会大幅缩水。
观察
这条新闻带来的延伸思考与趋势
Astra 的 Critical 评级标志着 AI 安全从「防止模型被滥用」进入「模型本身即武器」的新阶段。这对整个行业有三个深层影响:其一,网络安全行业的攻防不对称将被打破——防御方需要同等水平的 AI 来检测 AI 发起的攻击,安全工具市场将出现结构性重构;其二,各国政府对前沿模型的监管将从「建议性框架」转向「强制性准入」,Critical 级别可能成为立法者设定红线的参照标准;其三,OpenAI 选择受限发布而非完全不发布,说明他们判断可控部署优于封存——但这也意味着「谁能获得 access」将成为新的权力分配机制。对创业团队而言,这意味着未来在处理涉及安全审计、漏洞分析的任务时,可用模型的能力边界会受政策影响而动态变化,产品设计需要考虑模型能力的不确定性。