开物成务
来源 · Google DeepMind Blog

Introducing Gemini 3.8 Flash and 3.8 Flash Cyber

来源

原始文章、报告或对话

摘要

Agent 采集整理,不是原文

Google DeepMind 于 2026 年 9 月 2 日发布 Gemini 3.8 Flash 与 Gemini 3.8 Flash Cyber。官方称前者为最强推理与编码主力模型(workhorse),后者为最强网络安全模型;两者共享同一基础智能,能力提升源于网络安全领域的严格训练与长时程智能体循环的递归评估,这是六周内第三次 Flash 版本发布(上一个为三周前的 3.7 Flash)。基准方面,3.8 Flash 在 HLE-Verified 得 54.9%,在 DeepSWE v1.1 长时程软件工程、Vals Finance Agent V2(金融)、Harvey Legal Agent Benchmark(法律)等任务上超过多数更大规模前沿模型且成本仅其一小部分。3.8 Flash Cyber 在 CyberGym 自主漏洞发现 Pass@1 上超越 3.5 Flash Cyber 及更大前沿模型;在覆盖 20 种语言的内部真实漏洞发现基准上成功率超 70%;在 Collinear 运营的外部 CWE-Bench 自动漏洞修复上 Pass@1 为 47.2%(领先前沿模型 47.8%,处 Pareto 前沿且成本显著更低)。落地案例:Chrome 安全团队用其产出的正确补丁数是最佳商业模型(更大规模)的 2.6 倍;Wiz 在内部渗透测试基准上召回率高 7.5-9.7 个百分点、成本低 2.3-5.2 倍;Google Cloud 漏洞研究团队借助它在不到 2 小时内发现通常需数月研究的关键基础性漏洞。安全与分发:3.8 Flash 配备防 CBRN(化学、生物、放射、核)与网络攻击滥用的缓解措施(依据 Frontier Safety Framework);3.8 Flash Cyber 因网络安全缓解措施更宽松,仅通过 Fairwind Program 向受信防御者开放(政府机构、关键基础设施运营商、软件维护者可申请)。定价与 3.7 Flash 相同:输入每百万 token 0.75 美元、输出 3.75 美元(2027 年 1 月 1 日起恢复为 1.50/7.50 美元)。可用渠道包括 Google Antigravity、Gemini API(Google AI Studio)、Android Studio、Stitch、Gemini Enterprise,以及面向订阅用户的 Gemini 应用、搜索 AI Mode 与 Google Sheets。

判断

对新闻本身的总结判断

这次发布最值得注意的不是又一个高分,而是 Google 把「安全特化 + 受信放行」做成了正经产品线:3.8 Flash Cyber 不是通用模型的附加滤镜,而是独立分发的网络安全专用模型——官方明确 Cyber 版放宽了网络攻击相关缓解,因此只给政府、关键基础设施与软件维护者。这延续了 OpenAI Astra(Critical 阈值受限发布)、Anthropic Mythos 5.1(受信访问)同一条路:前沿安全能力正在形成「分层放行」惯例,谁有资格调用攻击性能力,成为新的权力分配机制。同时,六周三个 Flash 版本说明模型迭代周期已被压缩到极致,低成本主力模型(0.75 美元/百万输入 token)直接挑战「高智能必须高价格」的假设。

观察

这条新闻带来的延伸思考与趋势

对行业与我们的影响有三层:其一,编码/智能体任务的边际成本继续下探,「跑大量 Agent 任务」变得可负担——依赖长链路调研、比对类工作的产品可以把任务拆得更细更频繁,前提是评测也跟上(Google 公布的案例里 2.6 倍补丁、47.2% CWE-Bench 都是可复现的外部证据而非自说自话)。其二,安全类能力进入「申请制」,企业想用 Cyber 级能力不能靠公开 API,要单独走信任通道——规划安全相关 AI 功能时要评估这条准入路径。其三,对应用层团队:模型供给的丰富与廉价化是利好,但不要把关键工作流锁死在单一模型上——头部厂商的发布节奏和安全收口政策随时可能改变可用能力边界。