认识 Gemini 4 Argon:谷歌憋了十个月,憋出一个你还用不上的模型
半个月前我在这站上写过一篇《Gemini 4 Pro 偷跑》,当时 Arena 上冒出来个披着 gemini-3.8-flash 马甲的东西,大家猜它是下一代旗舰的早期检查点,还顺手扒出个内部代号:Argon。
我当时特意加了句免责声明:这是传闻,别拿去跟人打赌。
现在打赌的结果出来了。名字猜对了,路线猜错了。
2026 年 9 月 30 日,谷歌正式发布新旗舰,皮查伊亲自在 X 上官宣,名字就叫 Gemini 4 Argon——内部代号直接用成了正式名。但路线错了的地方在于:它不是又一个"啥都会一点的通用旗舰",而是一个明确冲着长流程脏活去的工程模型。
Argon 是第 18 号元素氩,一种惰性气体。官方没解释过命名,但从 Chrome(铬)到 Argon(氩),谷歌的元素周期表情结算是坐实了——一个拿元素给产品命名的公司,多少有点理工科的浪漫病。
好了,煽情结束。下面这件事你大概率会不爽:
这是目前最强的几个模型之一,而你现在用不了。
先看一组你可能没注意到的数字
发布当天谷歌亮了一堆跑分,但最打动我的不是跑分,是另外三个数字:
- 300 TiB —— 一群 Argon 智能体分析服务器集群的性能遥测数据,自主找出并实现内存优化,部署后已经在谷歌数据中心释放出来的内存量。谷歌预计总空间还有 500 TiB 到 1 PiB。
- 80 万行 —— Argon 正在参与的谷歌内部 C/C++ 转 Rust 迁移里,Fuchsia 操作系统 Zircon 内核那部分的规模。
- 2.7 倍 —— 移植后的 libgav1 视频解码器,在保持视频输出完全一致的前提下,跑到了原 Rust 版本 2.7 倍的速度。
这三条跟跑分不太一样。跑分是"它理论上能做什么",这三个数字是"它已经在做了什么"。
而且都不是写个小 demo 那种级别的活儿。给自家数据中心省内存、把操作系统内核换个语言重写——这种事做砸了是要背 P0 事故的,没人会拿它给 AI 刷 PR。
我自己干过几年后端,深知"迁移核心库"这五个字有多劝退。一个百万行级的库,光是把没人读过的 C++ 指针语义翻译成 Rust 的所有权模型,就够一个团队啃半年。现在这件事交给了一群 AI 智能体,人类的角色变成了站在旁边审,这画面想想还挺魔幻。
所以 Gemini 4 Argon 是什么
一句话版本:它是 Gemini 4 系列的第一个前沿模型,专门干那种"一次跑几小时、中间要分析验证再修改"的长流程复杂工作,主战场是软件工程、金融法律知识工作和网络安全防御。
注意它跟普通聊天模型的区别。你问 ChatGPT "帮我写个冒泡排序",这叫单轮生成,模型一次性吐完就结束。
Argon 要干的活儿长这样:
- 读一份 200 页的招股书或者一个几十万行的仓库
- 中间调工具、跑测试、看 profiling 结果
- 发现第一步理解错了,回头改
- 再跑一遍,再改
- 最后交出一个能跑、能通过审查的东西
它卖的不是"答得对",而是"扛得住"。
皮查伊的原话是:"它在复杂工作流、网络安全防御和软件工程方面展现出前沿水平的性能。谷歌内部团队已经在广泛使用它,应用范围从编程到量子计算。"
五个必须知道的特性
① 输出上限从 64K 提到 100 万 token(不是上下文窗口!)
这是发布稿里被传得最邪乎的一点,必须说清楚——
100 万 token 指的是"一次能吐多少",不是"一次能读多少"。
上下文窗口(input)说的是模型能看到多少材料;输出上限(output)说的是模型在一次推理里能生成多少内容。这是两件事,别混。
上一代 Gemini 3.8 Flash 的输出上限是 65,536(就是 64K),Argon 直接提到 1,000,000,涨了 15 倍多。上下文窗口按第三方口径(Artificial Analysis、LMArena)是 100 万 token。
为什么谷歌要这么拼输出?他们的解释挺实在:
"当模型有余量深度思考、在单条推理轨迹里生成数十万 token 时,它就具备了一层新的推理深度,可以一口气解决困难问题。"
翻译过来:以前模型是被"憋"断的。 它本来还有思路,但 token 额度用完了,只能草草收尾。现在给它一百万的额度,它能把一条完整的推理链条走完。
② Long Decode Continuation,一个很工程化但很关键的新能力
上面那条有个隐患:一百万 token 的生成,随便跑就是几十分钟,HTTP 请求早就超时了。
谷歌配套做了个 Gemini API 新特性叫 Long Decode Continuation——长响应跑到一半可以暂停,然后在后续调用里接着续。第三方评测机构 Artificial Analysis 实测时就用到了这个功能,让推理跑到 100 万输出 token 而不触发请求超时。
这个功能听着不性感,但它是"百万输出"从 PPT 变成可用的前提。没有它,1M 就是个写在文档里的数字。
③ 多模态输入:文本、图像、视频、语音
Argon 能吃文本、图片、视频和语音,输出文本。长视频理解是它的一个突出点——在 LVBench(长视频问答)上拿到 91.7%,四个模型里排第一。
这个能力在知识工作里比你想的有用。它能看专业图表、能从长视频里挑出细节、能根据一堆文档采取行动——律师审合同、分析师看财报路演视频,都是这个范畴。
④ 优惠价 $2 / $10,比同级别便宜一半
先给价格表,这是发布时被讨论最多的一块:
| 项目 | 优惠价(发布初期) | 优惠期后标准价 |
|---|---|---|
| 输入 token | $2 / 百万 | $4 / 百万 |
| 输出 token | $10 / 百万 | $20 / 百万 |
| 缓存输入 token | $0.10 / 百万(比输入低 95%) | — |
几个参照点:
- 优惠价跟 Claude Sonnet 5.5、GPT-6.1 Sol 的标价一模一样($2/$10)
- 优惠结束后的 $4/$20,对齐的是 Claude Opus 5.5
- 而 GPT-6 Astra 和 Claude Fable 5.1 是 $10/$50,贵一个量级
- 缓存折扣从上一代的 90% 提到了 95%
一个坑要提醒:谷歌没说优惠期什么时候结束。 上一代 3.8 Flash 明确给了 2026 年 12 月 31 日这个截止日,Argon 这次只说"至少一个月"。做成本核算的话,别按 $2/$10 长线规划。
⑤ 默认之外还有个"无护栏版"
这个是本次发布里最有争议的一条。谷歌说,对通过审核的防守方和自家内部团队,他们会提供不带任何网络安全防护措施的 Argon,以便充分释放它的防御能力。
换句话说:同一个模型,给不同的人开的权限不一样。
真实案例:这些才是重点
跑分我放后面,先说三个谷歌自己披露的内部案例。之所以放前面,是因为它们比分数更能说明"这东西能干什么"。
案例一:给数据中心省出 300 TiB 内存
一群 Argon 智能体分析服务器集群的性能遥测数据,自主识别出可优化项并实现优化,部署后已释放超过 300 TiB 内存,谷歌预计总节省量能到 500 TiB ~ 1 PiB。
注意关键词:自主识别、自主实施、部署后。 不是给工程师提建议,是真的改了代码并且上线了。省下来的内存意味着不用额外采购硬件——这直接是钱。
案例二:3.2 万行 SIMD 代码重写,快了 2.7 倍
开源视频解码库 libgav1 的 C++ 转 Rust 项目里,Argon 智能体基于已有的 Rust 移植版本,替换了约 3.2 万行 SIMD 代码。
它的工作方式不是"重写一遍",而是:
- 多轮由性能剖析结果指导的实验
- 研究编译器输出
- 生成能被编译器自动向量化的安全 Rust 代码
结果:优化后的解码器视频输出完全一致,速度是原 Rust 移植版的 2.7 倍,进一步逼近手工优化过的 C++ 实现。
这里必须较个真:2.7 倍是对此前的 Rust 移植版,不是对 C++ 原版。媒体标题里经常漏掉这个宾语,一不留神就传成了"比 C++ 快 2.7 倍"。读 AI 新闻,宾语很重要。
更大的场景是谷歌把 C/C++ 往 Rust 迁移的整体工程,规模已经从 re2、libgav1 这类核心库的数万行,扩展到了 Fuchsia 的 Zircon 内核 80 多万行。谷歌也明确说了,考虑到这些系统的关键性,大规模重写依然要过严格的自动化检查、仿真测试、审计和人工评审。
案例三:几分钟优化量子算法,比已发表结果好 40%
量子计算团队用 Argon 优化关键子程序的时空资源开销。谷歌说在一个案例里,模型只用了几分钟,就拿到了比已发表基准方案好 40% 的结果。
这条最含糊——博客没披露具体任务和完整实验条件,我倾向把它当"炫技"看,别急着往论文里引。
案例四(非谷歌内部):发现了一个能泄露病人信息的漏洞
这个不是谷歌自己干的,是 Wiz 用 Argon 做的。
Wiz 的 "Scan for Good" 计划专门免费保护关键公共基础设施。他们在早期演示中,用 Argon 发现了一个关键漏洞——这个漏洞会泄露全球医院在用的医疗软件里的敏感个人信息。而这个风险,此前的前沿模型都没找出来。
一条行业规律:同一个模型,用在攻击和用在防守上,是不对称的。 谷歌选择让防守方先用上,逻辑就在这儿——让盾先到几周,再放剑出场。
跑分:18 项测试,13 项领先
数据来自谷歌官方博客与模型页,第三方交叉验证的是 Artificial Analysis 和几个公开榜单:
| 评测 | 成绩 | 名次 | 说明 |
|---|---|---|---|
| DeepSWE v1.1 | 77.9% | 44 模型第 1 | 真实世界软件工程,谷歌称刷新纪录 |
| Vibe Code Bench v1.1 | 91.9 | 59 模型第 1 | 代码生成与编辑 |
| Vals Index v2.1 | 68.9 | 36 模型第 1 | 金融/编码/法律/税务,按对 GDP 贡献加权 |
| Vals Finance Agent v2 | 65.4 | 42 模型第 1 | 多步骤金融研究 |
| Harvey's Legal Agent Benchmark | 领先 | 领先 | 真实律师工作流程 |
| AutomationBench(Zapier) | 51.3% | 24 模型第 1 | 核心业务功能端到端执行 |
| LVBench | 91.7% | 4 模型第 1 | 长视频理解 |
| LABBench2 | 88.8 | 3 模型第 1 | 生物与基因组学(联网+工具) |
| CWE-bench v1 | 68% | 并列第一 | 漏洞自动修复 |
| OSWorld 2.0 | 69.2 | 13 模型第 5 | 桌面操作/计算机使用 |
| Terminal-Bench 4.0 | 57.4 | 55 模型第 5 | 智能体开发 |
| Chartography | 71.6 | 10 模型第 7 | 文档与图表理解 |
两份对立的信息都要说清楚,才算诚实:
好的一面:官方列举的 18 项测试里,Argon 13 项领先。最夸张的是知识工作——在 Vals Finance Agent v2 和 Harvey's Legal Agent Benchmark 上,领先幅度被外界形容为"跟其他模型差两档"。长上下文也是老本行优势,在测 256K~1M 超长上下文的 GraphWalks 上领先其他旗舰超过 10%。
不那么好的一面:它不是全能王。 OSWorld 只排第 5,Chartography 排第 7,AA-Omniscience 综合得分 42,跟 GPT-6.1 Sol(42)持平、略低于 GPT-6 Astra(43)。
看到这里你应该有个判断了:Argon 强在"长跑"和"读东西",不擅长"手眼协调"那一挂。 让它帮你做桌面 GUI 自动化,可能还不如别的模型。选模型跟选同事一样,没有全能的,只有合不合适的。
还有个值得玩味的观察:这是最近少有的、一个前沿模型在写作、知识、长文本上明显强过编程与 Agent 的情况。大多数家的旗舰现在都反过来——代码刷到飞起,写个邮件反而飘。
初体验:你现在到底怎么用上它
这是本文最实在的一段,也是最扎心的一段。
当前的开放顺序
- Fairwind 计划(现在进行中)—— 只给一批经过筛选、受信任的网络安全防御团队。个人开发者、普通消费者:进不去。
- 付费 API 客户 + Google AI Ultra 订阅用户 —— 下一步,但谷歌没给具体时间。
- 更广泛的开发者和消费者 —— 时间同样未公布。
为什么这么搞
两条原因,一条官方一条实际:
官方的说法是安全。谷歌在参与美国政府的前沿模型预发布自愿评估流程,发布前一天皮查伊还在白宫与美国总统及一批科技高管签署了一份自愿协议。扩大开放前,他们要在四个方向加固:防滥用、提示注入防御、对齐偏差监测、运行环境加固。
其中"对齐偏差监测"最有意思——他们会监测模型的思维链和行动,一旦模型以超出用户意图的方式推进任务,必要时直接停止执行。 已经有一套类似系统在监测训练过程,发现问题就给事件响应团队发警报。谷歌自己也提醒,这些监测结果要谨慎处理,别反馈回训练里,否则模型会学会规避监测。
实际的原因是商业竞争压力。Gemini 3 之后近十个月谷歌没发新旗舰,同一时间 OpenAI 掏出了 GPT-6 Astra 和 GPT-6.1 Sol,Anthropic 掏出了 Claude Fable 5.1。这个时间点抢跑三天,市场关注度就有可能全被吃掉。
现在能做的三件事
虽然 API 还没开放,但不用干等:
① 先看文档,把集成准备工作做在前面
Gemini API 的官方文档里已经有 Long Decode Continuation 的接入说明。这个新参数在模型全量开放后大概率是长任务必备的——趁现在把 SDK 更新、认证流程、重试策略这些脏活先跑通。
② 在 Google AI Studio 里先在现有模型上验证 prompt
现在的 Gemini 3.8 Flash 已经能吃下 1M 上下文(65,536 输出)。你的长文档处理链路、工具调用编排、结构化输出 schema,完全可以在现有模型上调好,等 Argon 开放后直接换 model ID。
这是成本最低的准备方式:模型和 prompt 是可以解耦的。 等到 API 放出当天才动手的人,永远比提前把管线搭好的人晚一周。
③ 如果你是防守方,去申请 Fairwind 计划
如果你所在团队是做安全防御的,现在真的可以去申请 Fairwind——这是目前唯一能摸到 Argon 的通道,而且拿到的是无护栏版。
提前看看代码会长什么样
参考 Gemini API 的通用写法,等开放后调用形态大致如下(模型 ID 以官方最终公布为准):
from google import genai
client = genai.Client(api_key="YOUR_API_KEY")
# 长任务场景:开启 Long Decode Continuation
response = client.models.generate_content(
model="gemini-4-argon", # 以官方公布为准
contents="读完这份 200 页的招股书,输出一份结构化风险清单",
config={
"max_output_tokens": 1000000, # 输出上限 1M
"long_decode_continuation": True,
},
)⚠️ 注意:截至本文写作时(2026 年 10 月 1 日),Argon 未对公众开放,上面的模型 ID 是基于命名惯例的推测。上线后请以 Google AI 官方文档的 Model ID 列表为准。
值得吐槽的一点
这次发布最真实的开发者反馈,不是夸它的。
X 上有位叫 Komal 的用户说,Gemini 4 Argon "听起来不像一次普通的模型发布"——她的关注点不在跑分,而在谷歌对高能力模型开放节奏的控制方式。
另一位开发者 Eddie Codes 说得就更直白了:
"所以它在基准测试里领先,但普通开发者还用不了 API。先向受信任合作伙伴开放,意味着又要经历一次等待名单。"
这条评论下面一堆人 +1。
我自己的看法:谷歌这次做的是负责任的选择,但"负责任"和"好用"之间确实有张力。 安全审计该做,这是对的;但从开发者角度看,一个你调不动的模型,跑分再漂亮也只是新闻。
记住一个判断标准:衡量一个模型是否真的可用,看的不是它拿了第几名,而是你今天下午能不能调它的 API。
进阶
Gemini 4 Argon 目前还在 Fairwind 计划的小范围 Phase,官方承诺的排序是:付费 API 客户 → Google AI Ultra 订阅用户 → 更广泛的开发者与消费者。也就是说,真正的"全民可玩"还有一段距离,但成熟的开发者完全可以在这段时间里把管线、prompt 和成本模型先搭好。
想持续跟进 Gemini 4 Argon 的开放进度、实测体验和落地案例,可以看看我们后续的文档更新。
更多开源技术干货和学习资料,关注公众号「遇码」,领取专属福利。
Gemini 中文文档