Gemini 3.8 Flash Cyber:谷歌那个只给防守方的 AI 修洞模型
先讲一个几乎每个后端都经历过的凌晨。
凌晨两点,告警响了。你依赖的一个基础库爆了个高危漏洞,CVE 编号刚挂出来,公众号和技术群已经在传 POC 了。安全团队在群里 @ 你:"这个洞能不能明天上线前修掉?"
你说先看看。然后你发现:定位根因半天,写补丁半天,回归测试一天,等上游合并不知道几天。而攻击者那边,从漏洞公开到批量扫描,通常只需要几个小时。
攻防两边的时间单位从来就不一样。 防守方按周算,攻击方按小时算。
2026 年 9 月 2 日,谷歌发布了一组模型,其中那个"大部分人一辈子用不上、但可能间接救了你一次"的,叫 Gemini 3.8 Flash Cyber。它的目标非常直白:把漏洞修复这件事,从"数周的人工代码评审",压到"几分钟内出可部署补丁"。
而我更想说的是另一半故事——这个模型你大概率申请不到,而且谷歌是故意的。
先看数字:它到底有多能打
先别急着听形容词,把官方口径的硬数据摆出来:
| 基准 / 场景 | 成绩 | 对比对象 |
|---|---|---|
| CyberGym(自主漏洞发现行业标准基准) | 86.2% | 超过 3.5 Flash Cyber,也超过体量大得多的前沿模型 |
| 内部多语言漏洞基准(覆盖 20 种编程语言) | 成功率 > 70% | 谷歌内部数据 |
| CWE-Bench(Collinear 运营的外部补丁基准) | pass@1 47.2% | 领先前沿模型 47.8%,但成本低得多 |
| Chrome 安全团队实测 | 正确补丁数是最佳商用大模型的 2.6 倍 | 谷歌内部评测 |
| Wiz 内部渗透测试基准 | 召回率高 7.5–9.7 个百分点 | 成本低 2.3–5.2 倍 |
| Cloud Vulnerability Research 团队 | 2 小时挖出一个关键基础漏洞 | 同类工作通常耗时数月 |
这组数字里我最在意的是最后一行。2 小时对几个月,这不是"效率提升 30%",这是把一件事从"项目"变成了"一次查询"。而 CWE-Bench 那行更耐人寻味:47.2% 对 47.8%,差 0.6 个百分点,但成本是别人的零头——这才是它真正的杀招,能力打平,价格打骨折。
顺带交代一下时间线:Gemini 3.8 Flash 是六周内的第三次 Flash 更新,距 3.7 Flash 只隔了三周,内部代号 Skimaki(据《华尔街日报》报道)。Cyber 版本和标准版共享同一套基础智能,只是训练和安全策略分了岔。
什么是 Gemini 3.8 Flash Cyber
一句话版本:它是 Gemini 3.8 Flash 的网络安全特化版,专门用来找漏洞和写补丁,只通过 Fairwind 计划向经过审核的防守方开放。
拆开说三点。
第一,它不是"通用模型 + 安全提示词"。 谷歌明确说它的网络安全缓解措施比通用版更宽松——也就是说,它能讨论、能生成的攻击技术知识,标准版会被拦下来。这正是它好用的原因,也正是它必须被关起来用的原因。
第二,它不是一个你能直接调 API 的模型。 它的获取渠道叫 Fairwind Program,2026 年 9 月 2 日同步启动,准入不看钱看身份:政府机构与国家网络主管部门、关键基础设施运营商(医疗、电信、能源、金融)、以及被大量下游依赖的核心平台与软件基金会。目前全球有 650 多家合作方参与,已公开的名单里有 CrowdStrike、Datadog、Menlo Security、Palo Alto Networks、Snowflake。
第三,它必须配着 CodeMender 一起用。 模型负责推理,CodeMender 负责"harness"( harness 你可以理解成一套带验证的作业台):在你自己的云环境里跑,自动验证生成的补丁能不能编译、会不会引入回归,只把通过验证的补丁交给人看。
CodeMender 是什么:这套系统的另一半
如果不讲 CodeMender,Flash Cyber 的价值讲不清楚。
CodeMender 是 DeepMind 在 2025 年 10 月 6 日发布的一个代码安全智能体,最初基于 Gemini Deep Think 模型。当时公布的成绩是:半年内向开源项目上游提交了 72 个安全修复,涉及的代码库最大的有 450 万行。
它的能力来自这套工具组合:
- 静态分析 / 动态分析——理清控制流、数据流
- 差分测试与模糊测试(fuzzing)
- SMT 求解器——做形式化的性质验证
- 多智能体 LLM critic——用一个模型专门挑刺:对比改动前后的代码,判断有没有引入回归,不行就自我修正
有个案例我印象很深。CodeMender 给 libwebp 这个图像压缩库批量加了 -fbounds-safety 注解。加上之后,编译器会自动插边界检查,缓冲区溢出直接变得不可利用。而 2023 年那个震惊业界的 CVE-2023-4863(libwebp 堆溢出),正是被做成零点击 iOS 攻击在真实世界里用过的。
换句话说:如果那批注解早两年加上,那次攻击就不会成立。AI 在这里干的不是"发现一个洞",而是让一整类洞永远失效。这比排行榜上多几个点有意义得多。
到了 2026 年 7 月 21 日,谷歌把 Gemini 3.5 Flash Cyber 塞进 CodeMender 做小范围试点;9 月 2 日的 Fairwind,是把这个试点正式化、命名、扩大规模。CodeMender 是车,Flash Cyber 是引擎。
场景:把"分钟级补丁"落到具体地方
场景一:Chrome 安全团队——补丁质量的头对头
谷歌 Chrome 安全团队是最早的测试者之一。他们拿 Flash Cyber 和市面上最好的商用大模型做头对头评测,结果是正确补丁数量 2.6 倍。
注意"正确补丁"这四个字。安全领域最怕的不是"找不到洞",是"生成一堆看起来对、实际上错、甚至引入新问题的补丁"。CodeMender 那套自动验证就是干这个的——不修根因的补丁不交,有回归的不交,不符合代码风格的不交。
场景二:Wiz——召回率高,还更便宜
云安全公司 Wiz 在自己的内部渗透测试基准上跑了一遍:召回率比领先前沿模型高 7.5–9.7 个百分点,而成本是对方的 1/2.3 到 1/5.2。
渗透测试场景里,"漏报"比"误报"更致命。召回率提升接近 10 个百分点,同时成本砍到几分之一——这是能改变预算结构的数字,不是 PPT 数字。
场景三:谷歌自己的云漏洞研究团队
这条我前面提过,再说一次因为它最有画面感:2 小时找到一个关键基础漏洞,而这类研究通常要几个月。
我得诚实地说,谷歌没有公开这个漏洞的具体细节(显然也不会公开)。所以这条只能当"官方口径"看,没法验证。但结合 Chrome 那条和 Wiz 那条第三方数据,我认为趋势是可信的。
场景四:开源生态的"上游修复"
Fairwind 的第三类准入对象,是"维护着被广泛使用软件基础的核心平台"。逻辑很朴素:给一个上游项目打一个补丁,等于同时保护了它下游几百万使用者。
这条对开源社区的意义,可能比给某个政府做防守更大。虽然现在还轮不到你我这样的普通开发者。
普通开发者能摸到什么:三条现实路径
我知道你看到这里最想问的是:那我能用吗?
直接答案:Flash Cyber 本身,暂时不能。 但有三条路是通的。
路径一:用公开模型跑 CodeMender(最接近的替代)
谷歌明确说了:任何 Google Cloud 客户,都可以通过 Gemini Enterprise Agent Platform,配合公开可用的 Gemini 模型来使用 CodeMender,再叠加 AI Threat Defense 工具集。
也就是说,引擎降了一档,但车(CodeMender 那套验证 harness)是同一辆。谷歌的说法是能力会有分层差异,但对绝大多数企业的 CI 来说,够用。
路径二:用 Gemini 3.8 Flash 做"安全左移"
这是今天、现在、免费就能干的事。3.8 Flash 是公开可用的(gemini-3.8-flash),支持 100 万 token 上下文、64K 输出,思考级别可调 low / medium / high。100 万 token 意味着你可以把一整个中型模块塞进去让它审。
Python 示例:
from google import genai
client = genai.Client(api_key="YOUR_API_KEY")
with open("src/parser.c", "r", encoding="utf-8") as f:
code = f.read()
prompt = f"""你是一名资深安全工程师。请审查以下 C 代码,只报告你有把握的问题:
{code}
对每个问题请给出:
1. 漏洞类型(CWE 编号)
2. 触发路径(哪一行、什么输入)
3. 根因,而不是表象
4. 最小修复补丁
5. 如何验证修复有效
如果没发现确信的问题,直接说没有。不要为了凑数而报告。"""
resp = client.models.generate_content(
model="gemini-3.8-flash",
contents=prompt,
config={"thinking_config": {"thinking_level": "high"}}
)
print(resp.text)最后那句"不要为了凑数而报告"不是废话。AI 审计最大的坑就是它会为了满足你的期待而编漏洞。你越强调"不确定就说不确定",输出的信噪比越高。
具体参数名以 ai.google.dev 的官方文档为准,模型迭代太快,半年前的代码示例现在可能已经跑不通了。
定价提醒:3.8 Flash 的入门价是输入 $0.75 / 百万 token、输出 $3.75 / 百万 token,有效期到 2026 年 12 月 31 日;2027 年 1 月 1 日起恢复标准价 $1.50 / $7.50。另外,Artificial Analysis 的实测指出,因为它在复杂任务上会输出更多 token、跑更多轮工具调用,每任务实际成本比 3.7 Flash 大约高 40%——标价没变,账单会变。做成本估算时记得按任务算,别按 token 算。
路径三:盯紧 Fairwind 的扩容节奏
谷歌说会逐步扩大 Fairwind 的伙伴范围,也会和开源社区合作。如果你想申请,方向是:把自己变成"维护着被广泛使用软件基础"的那一类人。听起来有点绕,翻译过来就是——去维护一个有真实下游的开源项目。
冷静一下:三个别上头的地方
第一,这些数字绝大部分是谷歌口径。 CyberGym 86.2%、内部 20 语言基准 >70%、Chrome 2.6 倍,全部来自官方或官方转述。真正有价值的第三方数据是 Wiz 那条和 CWE-Bench(Collinear 独立运营)那条,因为它们不是谷歌自己跑的。在独立红队复现结果出来之前,把排行榜当参考,别当结论。
第二,"分钟级补丁"目前主要验证在谷歌自家的地盘上。 Chrome、Android、Google Cloud——全是谷歌自己的代码、自己的环境、自己的测试基建。换到你公司那个没有测试覆盖、构建脚本靠口耳相传的仓库里,效果大概率要打折。补丁生成从来不是瓶颈,验证才是,而验证能力取决于你有没有像样的测试。
第三,能力分层会变成现实。 最好的修复工具只给 650 家机构,其余人用公开模型版本。这个安排站在安全角度可以理解(能修洞的能力和能造洞的能力本来就是同一种能力),但结果就是安全能力的不平等会被工具放大。谷歌的应对是钱:Google.org 的全球网络安全投入已超过 1 亿美元,其中 3600 万美元投向 35 个高校网络安全诊所,为超过 1250 个学区、市政公用事业和医院提供免费帮助。是实打实的好事,但和 Fairwind 那 650 家拿到的能力,不是一回事。
顺便说句立场:我对"AI 攻防军备竞赛"这类叙事一向有点警惕,因为它天然利好卖模型的人。但这次我倾向于认可 Fairwind 的准入逻辑——当一种能力既能修洞也能造洞时,按"机构可问责性"而不是"付费能力"来分配,是对的。
进阶
想继续往下挖,有几个方向:CodeMender 的技术论文(DeepMind 说会陆续发表)、CWE-Bench 实时排行榜(Collinear 维护)的独立复现结果、Fairwind 伙伴范围的后续扩容公告,以及 Gemini Enterprise Agent Platform 上 CodeMender 的接入与计费细节。
对 Gemini 3.8 Flash 通用版本本身感兴趣,可以看本站的《Gemini 3.8 Flash 模型介绍》;想了解这套模型背后的研究机构,推荐《认识 Google DeepMind》。
更多开源技术干货和学习资料,关注公众号「遇码」,领取专属福利。
Gemini 中文文档