开物成务
来源 · OpenAI

GPT-6 Astra: A new generation of intelligence

来源

原始文章、报告或对话
出处
OpenAI
链接
openai.com/index/gpt-6-astra
采集
2026.09.04

摘要

Agent 采集整理,不是原文

OpenAI 于 2026 年 9 月 3 日发布新一代旗舰模型 GPT-6 Astra(API 模型名 gpt-6-astra,并同步上架 Amazon Bedrock),官方称其为「世界上最智能、最对齐的模型」,整合了多年预训练、强化学习与对齐研究,在计算机使用、浏览、软件工程、网络安全、科学与专业工作上达到 state-of-the-art。定价:标准输入每百万 token 10 美元、输出 50 美元,Fast 模式速度最高为标准处理 2 倍、价格亦为 2 倍;API 面向符合条件客户支持 Zero Data Retention。基准:ARC-AGI-3 99.9%(饱和)、ARC-AGI-2 95.0%、FrontierMath Tier 4 97.6%(正文称约 98% 饱和)、OSWorld 2.0 72.6%(GPT-5.6 Sol 为 65.7%,单任务平均耗时从约 75 分钟降至约 40 分钟)、ExploitBench 100%、Terminal-Bench 4.0 57.9%、ScreenSpot-Pro 92.7%;长上下文 MRCR v2 在 512K–1M 区间得分 96.3%。OpenAI 还称 Astra 协助取得两项数学成果,将素数对间隔上界从 240 改进至 186。安全与分发:据 OpenAI Preparedness Framework,Astra 首次达到网络安全 Critical 阈值——评估期间发现并利用了此前未知的两个零日漏洞(已向维护者披露),无生产防护时可在强化浏览器中实现任意代码执行并为强化操作系统构造提权利用;OpenAI 因而对更高级网络攻击任务(如生成 PoC 漏洞利用)设限,计划未来数周通过 OpenAI Daybreak 扩大访问并逐步放宽防护。可用性:发布首日向有限组织开放,未来数天覆盖 ChatGPT Plus/Pro/Business/Enterprise 付费用户、OpenAI API 与 AWS;企业工作区默认关闭,需管理员手动启用;官方承认 Astra 的书面推理比 GPT-5.6 Sol 更难监控,监控能力仍是研究优先事项。

判断

对新闻本身的总结判断

这条新闻的分量不在「又刷新了几个基准」,而在 OpenAI 第一次把「达到网络安全 Critical 阈值」写进旗舰模型的正式发布口径,并以此作为产品分发边界:高危网络能力默认受限、按信任对象(先有限组织,再经 Daybreak 通道)分阶段放行。这与 9 月初 Google 单独分发 3.8 Flash Cyber、Anthropic 走受信访问是同一趋势的第三次确认——前沿模型的攻击性能力正在催生「能力分层 + 申请制」的发布范式,谁有资格触达攻击性能力成为新的权力分配机制。同时,ARC-AGI-3 发布仅半年即被 99.9% 饱和、ExploitBench 满分、官方自认书面推理更难监控,说明能力上限的移动速度和监控能力的滞后都已到需要公开声明的程度。对这条新闻本身的判断:它是「能力发布」与「安全收口」被正式绑定的标志性时刻,后续旗舰发布大概率都会沿用这套模板。

观察

这条新闻带来的延伸思考与趋势

三层延伸:其一,若 Critical 级网络能力成为常态并走 Daybreak 式信任通道,安全准入、红队与审计将出现新的行业规则,防御工具与内容安全边界的设计都要随之重估——对做文档/知识类 AI 产品的团队,这提示内容出口的安全审核维度只会更严。其二,Astra 把终端、软件工程、计算机操作等长任务的单位耗时压掉近半(约 75→40 分钟),「Agent 独立跑完整条长链路」从演示走向可用;对做长链路工作流的产品是能力红利,也意味着评测与验收标准必须跟上。其三,标准档 10/50 美元每百万 token 的定价延续了旗舰成本下移曲线,但分阶段放行与安全检查随时可能暂停任务——关键工作流不应写死单一模型,接口层保留可替换性是更稳妥的架构选择。