Google 上线 Gemini 3.8 Flash Cyber:长周期编程 Agent 正面对垒 Codex,网络安全大模型开卷
Google 把 Flash 这条走量产品线,又往前推了一格。当地时间 2026 年 9 月 2 日,Google DeepMind 一口气放出两个型号:通用向的 Gemini 3.8 Flash,以及专门挖漏洞、打补丁的 Gemini 3.8 Flash Cyber。后者不对公众开放,只走一个新的 Fairwind Program 定向发给「受信任的防守者」。
这不是一次普通的小版本。3.8 Flash 的价格一分没涨,但官方把「长周期软件工程」和「自主 Agent」写进了核心卖点;Flash Cyber 则直接把战场摆到了 OpenAI Codex、Anthropic Claude 所在的编程 Agent 主航道上。问题随之而来:当大模型开始自己读代码、自己改代码、自己补漏洞,开发者到底多了一个帮手,还是多了一把双刃剑?
一、六周三次,Google 在 Flash 上加速
先看清节奏。Google 在官方博客里直接点明,这是 6 周内第三个 Flash 版本:3.6 Flash 在 7 月底,3.7 Flash 在 8 月中旬,3.8 Flash 在 9 月初,上一个 3.7 只隔了三周。DeepMind 产品总监 Tulsee Doshi 与 Gemini 安全负责人 Raluca Ada Popa 在 9 月 2 日的公告中把它定义为「迄今最聪明的 workhorse 模型」。
定价也很有侵略性:3.8 Flash 沿用 3.7 Flash 的 introductory 价,输入 0.75 美元/百万 token、输出 3.75 美元/百万 token,该价格维持到 2026 年 12 月 31 日;从 2027 年 1 月 1 日起翻一倍,变为 1.50 / 7.50 美元。100 万 token 的输入窗口、6.4 万 token 的输出上限、支持文本/图像/音频/视频/PDF 多模态——这些规格把 3.8 Flash 钉在了「高吞吐 Agent 工作负载」的甜点位上。
二、3.8 Flash:长链路编码的廉价主力
便宜不等于弱。Google 在公告里拿 DeepSWE v1.1 说事:这个测「长周期软件工程」的基准,要求模型从读 Issue、定位代码、改文件、跑测试到提交 PR 端到端自主完成。官方称 3.8 Flash 在这方面「超越大多数更大的前沿模型」,而成本只是零头。
更硬的数字在推理密度上。3.8 Flash 在 HLE-Verified(覆盖 STEM、人文、专业领域的多步推理)拿到 54.9%;在金融分析 Vals Finance Agent V2、法律推理 Harvey's Legal Agent Benchmark 上也压过 3.7 Flash 和多数前沿模型。CNBC TV18 的报道援引 Pichai 的话确认了这组跑分。核心设计选择被 Google 总结为一句话:复杂任务上「更努力」——多跑几步推理、多调几轮工具,代价是高 effort 下 token 消耗更高。对开发者而言,这意味着简单任务可以继续用 3.7 Flash,长链路任务再切 3.8。

三、Flash Cyber:专门挖洞和打补丁
真正让安全圈侧目的,是 Flash Cyber。它和 3.8 Flash 共享底座,但被专门训练去做漏洞发现与自动修复,并且刻意把「补」放在「攻」之前。Pichai 在 9 月 2 日的推文中给出 CyberGym 成绩 86.2%,这是业界衡量自主漏洞挖掘的权威基准;在覆盖 20 种编程语言的内部基准上,漏洞发现成功率超过 70%。
补丁能力有外部基准可查。Collinear 运营的 CWE-Bench 用 100 个保密的审计修复任务考察 pass@1:Flash Cyber 为 47.2%,与领先前沿模型的 47.8% 几乎持平,但每次 rollout 成本仅约 3.64 美元,而对照模型约 10.27 美元。真实案例更扎眼:Chrome 安全团队用它针对真实 Chrome 漏洞产出的正确补丁,是更大商业模型的 2.6 倍;云安全厂商 Wiz 的内部渗透测试召回率提升 7.5%—9.7%,成本降低 2.3—5.2 倍;Google Cloud 漏洞研究团队更在不到 2 小时内找到一个关键基础设施漏洞,这类发现通常要花数月。
四、风险视角:能力越强,越要关在笼里
开卷的另一面,是护栏。Google 给两个型号都加了 CBRN(化学、生物、放射、核)与网络攻击的防滥用护栏;Flash Cyber 反而「适度放宽」了网络安全领域的策略拦截——正因如此,它不能走公开 API,只能进 Fairwind Program,面向政府机构、关键基础设施运营商和软件维护者。
The Register 把这次发布解读为 Google 提醒行业「自己还在牌桌上」,暗指近几个月对手们密集推出各自的 coding / 安全模型。但值得独立开发者警惕的是:CWE-Bench 那 47.2% 的 pass@1,意味着首次尝试仍有超过一半没过确定性门禁。换句话说,Flash Cyber 能「生产候选补丁」,却远没到「取消安全工程师审批」的程度。把模型放进权限过宽、测试不完整的自建 Agent,成绩很可能低于榜单。

五、与 Codex 的正面战场
把视野拉回编程 Agent 主航道。3.8 Flash 与 Flash Cyber 同时下场,正面拼的就是 OpenAI Codex、Anthropic Claude 占据的长周期编码与代码安全 lane——大家都在同一个 DeepSWE v1.1 这类端到端工程基准上被衡量。Google 的打法是「Flash 价、近前沿性能」,用成本差抢高吞吐 Agent 场景;Codex 则背靠 OpenAI 的开发者生态与 CLI 渗透。
真正的分水岭在访问模型上。3.8 Flash 已对所有人开放,API 用户改一行 model 名就能从 3.7 切过来;Flash Cyber 却把最锋利的安全能力锁进受控分发。到那时,答案才会真正浮出水面——当防守方用大模型批量挖洞补洞,攻击方会不会也拿到同级别的自动化武器?这场「开卷考试」,考的从来不只是谁的分数高。
