Skip to content

Gemini 4 Argon vs GPT-6 Astra vs Claude Opus 5.5:三份跑分表摆在一起,谁该干哪份活 ​

先说个让人不太舒服的事实:Google 在 2026 年 9 月 30 日发布了 Gemini 4 Argon,19 项跑分里拿了 13 项第一。然后它没给你用。

同一天,Claude Opus 5.5 和 GPT-6 Astra 都躺在公开 API 里,扫码付款就能调。而 Argon 的开放顺序是:Fairwind 计划里审核过的网络安全从业者 → 付费 API 客户 + Google AI Ultra 订阅者 → 更广的开发者。最后这一步没有日期。

所以我写这篇的时候,心情有点像在车展上隔着玻璃看一辆还没上市的车,旁边销售一边念参数一边说"先生您先登记一下"。但话说回来,跑分表是公开的,价格是公开的,别人家的价格也是公开的 —— 这三样东西已经足够让你想清楚一件事:等 Argon 真开放那天,你该不该换。

跑分是厂商给的地图,不是你家的地形。真正决定选谁的,永远是"谁更可靠地干完你的活、花多少钱、需要你擦几次屁股"。

先看这三家分别是什么 ​

在开撕之前,先把三个名字对上号,别搞混了 —— 这行最爱干的事就是一年发八个版本、每个版本三个后缀。

  • Gemini 4 Argon:Google DeepMind 的新一代前沿推理模型。定位很明确 —— 长周期任务。软件工程、法律金融这类专业知识工作、网络安全防御。最唬人的参数是单次输出上限 100 万 token,上一代是 6.4 万,涨了 15 倍多。
  • GPT-6 Astra:OpenAI 的旗舰,主打计算机操作(computer use)和高难度软件工程任务。上下文 105 万 token,单次输出上限 12.8 万 token。
  • Claude Opus 5.5:Anthropic 的旗舰,人工分析(Artificial Analysis)智能指数上目前的总分第一(58 分)。Terminal-bench 这类"在 shell 里干活"的场景是它的主场。

顺带补一个冷知识:Argon 是 Google 七个多月来第一个 Flash 级别以上的模型,而且它直接跳过了已经预告过的 Gemini 3.5 这一档。谷歌的节奏,向来是"要么不发,要么憋个大的"。

19 项跑分,一表看完 ​

下面这张表是 Google 官方发布时给的对比数据,对手数字来自各家自报或公开榜单。先说清楚口径:这是 Google 自己摆的擂台,部分项目(DeepSWE、Terminal-bench 4.0)是 Google 自己跑的,Argon 用的是"最高思考档位"跑的。所以你把它当成"Google 认为的自己",而不是"裁判给出的判决"。

跑分项Gemini 4 ArgonGPT-6 AstraClaude Opus 5.5谁赢
Vals Index(金融/编码/法律/税务)68.9%63.1%67.0%Argon
AutomationBench(业务流程自动化)51.3%41.4%42.5%Argon
Vals Finance Agent v265.4%53.5%58.6%Argon
Harvey 法律 Agent 基准19.6%5.4%3.8%Argon
DeepSWE v1.1(长周期软件工程)77.9%74.1%74.2%Argon
FrontierSWE v2(高难度 SWE)55.0%65.5%62.3%Astra
Vibe Code Bench91.9%89.6%90.3%Argon
Terminal-bench 4.057.4%58.2%66.4%Opus 5.5
Terminal-Bench Science 0.157.6%68.1%63.3%Astra
PostTrainBench45.3%44.3%49.3%Opus 5.5
LABBench 288.8%85.4%73.1%Argon
RiemannBench76.0%72.0%69.6%Argon
GraphWalks(≤128K,BFS F1)99.7%98.7%90.6%Argon
GraphWalks(256K–1M,BFS F1)84.2%71.8%66.8%Argon
Agent's Last Exam39.5%34.2%38.2%Argon
OSWorld-2.0(计算机操作)69.2%72.6%—Astra
Chartography(图表理解)71.6%71.0%66.3%Argon
LVBench(长视频理解)91.7%87.5%83.7%Argon
CWE-bench v1(漏洞修复)68.0%68.0%67.0%并列

数一下:Argon 第一或并列第一 14 项,Astra 拿走 3 项,Opus 5.5 拿走 2 项。

三个真实场景,看清楚差距在哪 ​

场景一:法务尽调,19.6% 对 3.8%,这是碾压也是无奈 ​

Harvey 法律 Agent 基准上,Argon 拿到 19.6%,Opus 5.5 只有 3.8%,差 15.8 个百分点 —— 四倍多的差距。Vals Finance Agent v2 上 Argon 65.4%,比第二名的 Claude Fable 5.1(58.9%)高 6.5 分。

但你必须看到另一面:19.6% 意味着五道题里 Argon 也只会做对一道。 这个基准本身还处在"大家都不会做"的阶段。所以这句话的准确说法是:Argon 是这堆矮子里的高个,不是已经能替你签合同了。

当一个基准上第一名只有 19.6% 时,它衡量的不是谁更强,而是这件事到底有多难。

场景二:代码迁移,Google 拿自己开刀的那个案例 ​

Argon 的 DeepSWE v1.1 是 77.9%,比 Astra(74.1%)高 3.8 分,比 Opus 5.5(74.2%)高 3.7 分。看起来优势不大,但 Google 内部已经拿它干了几件硬活:

  • libgav1 视频解码器:Agent 重写了 3.2 万行 SIMD 代码,产出的 Rust 版本比原来的 Rust 版本快 2.7 倍。
  • Fuchsia Zircon 内核:C/C++ 迁 Rust 的规模达到 80 万行以上。
  • 数据中心内存优化:识别出可省下最多 1 PiB 内存的改进点,最终释放超过 300 TB 内存冗余。
  • 量子计算:帮研究人员在一项优化任务上比已发表的基线好 40%,耗时几分钟。

这几件事有个共同点:都是"一次跑不完就废了"的活。 这也是 100 万 token 输出上限真正的意义 —— 一次写完 80 万行的迁移方案,中间不用来回切对话、不用你自己拼上下文。

场景三:终端里跑 Agent,Argon 垫底了 ​

这一节我要给 Google 泼点冷水。Terminal-bench 4.0 上,Argon 57.4%,是三个前沿模型里最差的,比 Opus 5.5 低 9 分。FrontierSWE v2 上比 Astra 低 10.5 分,这是 Argon 在自家表里输得最惨的一项。更尴尬的是 Code Arena WebDev 榜单:Argon 排第 8(1679 分),GPT-6.1 Sol 排第 3(1759 分)。

如果你的 Agent 天天泡在 shell 里、靠敲命令解决问题,这个月你不该等 Argon,你该继续用 Opus 5.5。

这不是 bug,这是取舍。Google 把力气花在了长上下文、长输出、专业知识工作上,代价就是纯终端场景没跟上。认清这一点,比看完跑分就无脑换模型有用得多。

价格:把账算成"干完一件事多少钱" ​

光看每百万 token 单价容易算错账,因为长任务 Agent 吃 token 的姿势跟聊天机器人完全不同。

项目Gemini 4 ArgonGPT-6 AstraClaude Opus 5.5
输入 / 百万 token$2(推广期)→ $4$10(超 272K 输入翻倍)$4
输出 / 百万 token$10(推广期)→ $20$50(超 272K 按 1.5 倍)$20
缓存输入 / 百万 token$0.10(推广期,95% 折扣)$1$0.20
单次输出上限100 万 token12.8 万 token12.8 万 token
现在能用吗❌ 无公开 API✅ 一般可用✅ 一般可用

几个必须注意的坑:

  • 推广期什么时候结束,Google 没说。 官方注释只写"推广期结束后"执行 $4/$20,没给日期,也没说之后的缓存折扣还打不打折。
  • 长输入可能有额外费率。 OpenAI 的 Astra 在输入超过 272K 时,整个请求按 2 倍输入、1.5 倍输出计费;Anthropic 说 Claude 从 4.6 起全 1M 上下文按标准费率。Google 目前没说 Argon 会不会有长 prompt 档位 —— 这块是盲区。
  • 别把缓存价当成常态。 只有真正命中缓存的输入才打折,去后台看用量记录,别自己脑补。
  • 算单次任务成本,别算单次请求成本。 Agent 型任务失败重试会疯狂累积 token。Artificial Analysis 给的换算更有参考价值:按智能指数上的单任务成本,Argon 推广期约 $1.99/任务,Astra 约 $3.26/任务,Argon 过了推广期涨到 $3.98。

一个粗算例子:10 万输入 + 2 万输出、无缓存的任务,推广期约 $0.40,常规价约 $0.80。看着不贵,但一个跑 20 步、失败重试 3 次的 Agent 就不是这个数了。

输出上限从 6.4 万涨到 100 万,带来的不只是"能干更大的活",还有"一不小心就能烧掉更多的钱"。给每个项目设预算上限,比选对模型更重要。

快速上手:现在到底能做什么 ​

第一步:认清你今天能不能用 ​

不能。 Google 的发布公告里没有给出 API 模型 ID,Gemini API 的定价页目前主打的还是 Gemini 3.8 Flash,没有 Argon 条目;DeepMind 的模型卡索引里也还没有 Argon。

网上那些"已验证可用的 Argon 模型名"教程,现在基本都是猜的。别信,也别在代码里瞎填。

第二步:三条真实可走的路 ​

  • 网络安全从业者:走 Fairwind 计划 申请。官方明确优先审核防御型组织 —— 政府、关键基础设施、核心平台方,会查你的安全记录和运营规范。注意:官方禁止转售或转授访问权限,别想着借号。
  • 普通开发者:盯住三个地方 —— Gemini API 官方文档、Google AI Studio、Vertex AI。开放会从付费 API 客户和 Google AI Ultra 订阅者开始。
  • 急着上线的人:先用 Astra 或 Opus 5.5。这俩今天就能调。

第三步:趁等待期把准备工作做完 ​

这才是这篇文章最值钱的部分。等开放那天再动手,你就落后一个季度了。

  1. 攒一份你自己的评测集。 别用公开榜单,用你真实的活:仓库级编码任务、长文档分析、图表理解、多步规划。5–10 个就够。
  2. 记录五个指标:准确率、延迟、token 消耗、拒答行为、需要人工改多少。长上下文只有在"结果更好且成本没爆"时才算真的有用。
  3. 先画安全边界。 Argon 能自主发现漏洞并生成补丁 —— 这意味着它也能改坏你的生产代码。隔离环境起步,能用只读就只读,早期测试用脱敏数据,合并前必须人工过一遍。
  4. 把每个工具调用都记日志:读了哪些文件、请求了什么命令、改了什么、最终谁批的。
  5. 设好预算和回退模型。 常规任务别默认走最贵的那个。

第四步:想清楚哪件事归谁干 ​

成熟的 AI 技术栈不该只有一个模型。按现在的跑分表,一个务实的分工长这样:

  • 法律/金融研究、长文档集、长视频 → Argon(等开放)
  • 单次输出超过 12.8 万 token 的完整迁移或长报告 → Argon,三个里只有它能一次写完
  • 终端重度编码 Agent → Claude Opus 5.5,Terminal-bench 4.0 领先 9 分
  • 计算机操作、最难的 SWE 任务 → GPT-6 Astra,OSWorld-2.0 和 FrontierSWE v2 都第一
  • 这个月就要上线的东西 → Astra 或 Opus 5.5,因为 Argon 还没有公开 API

一句实话 ​

LMArena 文本榜上 Argon 以 1525 分排第一,人工分析智能指数上它 53 分、跟 Astra 打平,Opus 5.5 以 58 分独占鳌头。没有任何一个模型通吃全部榜单。

这是好事。它说明竞争终于从"谁家聊天机器人更聪明",变成了"哪个模型该放在自动化流程的哪一环"。跑分表是别人家的地图,你的活才是你的地形 —— 把活拆开,一段一段对号入座,比追着发布会换模型靠谱得多。

另外提一句 Argon 的幻觉率:15%,是所有智能指数 45 分以上的模型里最低的,而 Astra 是 51%。如果你在意"它会不会一本正经地胡说八道",这个数字比任何跑分第一名都值钱。

进阶 ​

更多开源技术干货和学习资料,关注公众号「遇码」,领取专属福利。

Gemini中文文档