开物成务
来源 · X:Testing Catalog (@testingcatalog) / Arena.ai

GPT-6 Astra from OpenAI claimed a top spot on WebDev Arena, surpassing recently released Claude Fable 5.1

来源

原始文章、报告或对话
出处
X:Testing Catalog (@testingcatalog) / Arena.ai
链接
x.com/testingcatalog/status/2096350628054176240
采集
2026.09.06

摘要

Agent 采集整理,不是原文

Arena(LMArena)WebDev 榜单显示,GPT-6 Astra (Max) 以 1797 分登顶 Code Arena: WebDev,置信区间 +24/-24,领先第二名 Claude Fable 5.1 (Max) 的 1762 分 35 分;第三名 Claude Opus 5 (Max) 为 1688 分。中国模型 qwen3.8-max-0902(1686)和 kimi-k3-max(1674)分列第四、第五。

判断

对新闻本身的总结判断

发布三天内拿下 WebDev 榜首,是 Astra「软件工程 SOTA」宣传的第一个第三方众测实证,而且领先幅度(35 分)远超置信区间(±24),不是统计噪音。更值得注意的是结构性信号:榜首与第三名之间隔了 109 分,Anthropic 一周前刚发布的 Fable 5.1 被直接压到第二, Coding 领域的旗舰迭代周期已经压缩到周级别。

观察

这条新闻带来的延伸思考与趋势

众测竞技场正在成为模型发布叙事的「事后审计」环节:厂商发布会数据再漂亮,几天内就会被 arena 榜单验证或打脸,购买决策应把这类第三方众测放在首位。对中国模型团队,前五占两席且与 Opus 5 只差个位数分,说明开源/国产旗舰在纯编码任务上已贴住第一梯队;真正的差距集中在顶端旗舰的迭代速度,而非基础能力。