Gemini 4 Argon vs GPT-6 Astra vs Claude Opus 5.5:三份跑分表摆在一起,谁该干哪份活
先说个让人不太舒服的事实:Google 在 2026 年 9 月 30 日发布了 Gemini 4 Argon,19 项跑分里拿了 13 项第一。然后它没给你用。
同一天,Claude Opus 5.5 和 GPT-6 Astra 都躺在公开 API 里,扫码付款就能调。而 Argon 的开放顺序是:Fairwind 计划里审核过的网络安全从业者 → 付费 API 客户 + Google AI Ultra 订阅者 → 更广的开发者。最后这一步没有日期。
所以我写这篇的时候,心情有点像在车展上隔着玻璃看一辆还没上市的车,旁边销售一边念参数一边说"先生您先登记一下"。但话说回来,跑分表是公开的,价格是公开的,别人家的价格也是公开的 —— 这三样东西已经足够让你想清楚一件事:等 Argon 真开放那天,你该不该换。
跑分是厂商给的地图,不是你家的地形。真正决定选谁的,永远是"谁更可靠地干完你的活、花多少钱、需要你擦几次屁股"。
先看这三家分别是什么
在开撕之前,先把三个名字对上号,别搞混了 —— 这行最爱干的事就是一年发八个版本、每个版本三个后缀。
- Gemini 4 Argon:Google DeepMind 的新一代前沿推理模型。定位很明确 —— 长周期任务。软件工程、法律金融这类专业知识工作、网络安全防御。最唬人的参数是单次输出上限 100 万 token,上一代是 6.4 万,涨了 15 倍多。
- GPT-6 Astra:OpenAI 的旗舰,主打计算机操作(computer use)和高难度软件工程任务。上下文 105 万 token,单次输出上限 12.8 万 token。
- Claude Opus 5.5:Anthropic 的旗舰,人工分析(Artificial Analysis)智能指数上目前的总分第一(58 分)。Terminal-bench 这类"在 shell 里干活"的场景是它的主场。
顺带补一个冷知识:Argon 是 Google 七个多月来第一个 Flash 级别以上的模型,而且它直接跳过了已经预告过的 Gemini 3.5 这一档。谷歌的节奏,向来是"要么不发,要么憋个大的"。
19 项跑分,一表看完
下面这张表是 Google 官方发布时给的对比数据,对手数字来自各家自报或公开榜单。先说清楚口径:这是 Google 自己摆的擂台,部分项目(DeepSWE、Terminal-bench 4.0)是 Google 自己跑的,Argon 用的是"最高思考档位"跑的。所以你把它当成"Google 认为的自己",而不是"裁判给出的判决"。
| 跑分项 | Gemini 4 Argon | GPT-6 Astra | Claude Opus 5.5 | 谁赢 |
|---|---|---|---|---|
| Vals Index(金融/编码/法律/税务) | 68.9% | 63.1% | 67.0% | Argon |
| AutomationBench(业务流程自动化) | 51.3% | 41.4% | 42.5% | Argon |
| Vals Finance Agent v2 | 65.4% | 53.5% | 58.6% | Argon |
| Harvey 法律 Agent 基准 | 19.6% | 5.4% | 3.8% | Argon |
| DeepSWE v1.1(长周期软件工程) | 77.9% | 74.1% | 74.2% | Argon |
| FrontierSWE v2(高难度 SWE) | 55.0% | 65.5% | 62.3% | Astra |
| Vibe Code Bench | 91.9% | 89.6% | 90.3% | Argon |
| Terminal-bench 4.0 | 57.4% | 58.2% | 66.4% | Opus 5.5 |
| Terminal-Bench Science 0.1 | 57.6% | 68.1% | 63.3% | Astra |
| PostTrainBench | 45.3% | 44.3% | 49.3% | Opus 5.5 |
| LABBench 2 | 88.8% | 85.4% | 73.1% | Argon |
| RiemannBench | 76.0% | 72.0% | 69.6% | Argon |
| GraphWalks(≤128K,BFS F1) | 99.7% | 98.7% | 90.6% | Argon |
| GraphWalks(256K–1M,BFS F1) | 84.2% | 71.8% | 66.8% | Argon |
| Agent's Last Exam | 39.5% | 34.2% | 38.2% | Argon |
| OSWorld-2.0(计算机操作) | 69.2% | 72.6% | — | Astra |
| Chartography(图表理解) | 71.6% | 71.0% | 66.3% | Argon |
| LVBench(长视频理解) | 91.7% | 87.5% | 83.7% | Argon |
| CWE-bench v1(漏洞修复) | 68.0% | 68.0% | 67.0% | 并列 |
数一下:Argon 第一或并列第一 14 项,Astra 拿走 3 项,Opus 5.5 拿走 2 项。
三个真实场景,看清楚差距在哪
场景一:法务尽调,19.6% 对 3.8%,这是碾压也是无奈
Harvey 法律 Agent 基准上,Argon 拿到 19.6%,Opus 5.5 只有 3.8%,差 15.8 个百分点 —— 四倍多的差距。Vals Finance Agent v2 上 Argon 65.4%,比第二名的 Claude Fable 5.1(58.9%)高 6.5 分。
但你必须看到另一面:19.6% 意味着五道题里 Argon 也只会做对一道。 这个基准本身还处在"大家都不会做"的阶段。所以这句话的准确说法是:Argon 是这堆矮子里的高个,不是已经能替你签合同了。
当一个基准上第一名只有 19.6% 时,它衡量的不是谁更强,而是这件事到底有多难。
场景二:代码迁移,Google 拿自己开刀的那个案例
Argon 的 DeepSWE v1.1 是 77.9%,比 Astra(74.1%)高 3.8 分,比 Opus 5.5(74.2%)高 3.7 分。看起来优势不大,但 Google 内部已经拿它干了几件硬活:
- libgav1 视频解码器:Agent 重写了 3.2 万行 SIMD 代码,产出的 Rust 版本比原来的 Rust 版本快 2.7 倍。
- Fuchsia Zircon 内核:C/C++ 迁 Rust 的规模达到 80 万行以上。
- 数据中心内存优化:识别出可省下最多 1 PiB 内存的改进点,最终释放超过 300 TB 内存冗余。
- 量子计算:帮研究人员在一项优化任务上比已发表的基线好 40%,耗时几分钟。
这几件事有个共同点:都是"一次跑不完就废了"的活。 这也是 100 万 token 输出上限真正的意义 —— 一次写完 80 万行的迁移方案,中间不用来回切对话、不用你自己拼上下文。
场景三:终端里跑 Agent,Argon 垫底了
这一节我要给 Google 泼点冷水。Terminal-bench 4.0 上,Argon 57.4%,是三个前沿模型里最差的,比 Opus 5.5 低 9 分。FrontierSWE v2 上比 Astra 低 10.5 分,这是 Argon 在自家表里输得最惨的一项。更尴尬的是 Code Arena WebDev 榜单:Argon 排第 8(1679 分),GPT-6.1 Sol 排第 3(1759 分)。
如果你的 Agent 天天泡在 shell 里、靠敲命令解决问题,这个月你不该等 Argon,你该继续用 Opus 5.5。
这不是 bug,这是取舍。Google 把力气花在了长上下文、长输出、专业知识工作上,代价就是纯终端场景没跟上。认清这一点,比看完跑分就无脑换模型有用得多。
价格:把账算成"干完一件事多少钱"
光看每百万 token 单价容易算错账,因为长任务 Agent 吃 token 的姿势跟聊天机器人完全不同。
| 项目 | Gemini 4 Argon | GPT-6 Astra | Claude Opus 5.5 |
|---|---|---|---|
| 输入 / 百万 token | $2(推广期)→ $4 | $10(超 272K 输入翻倍) | $4 |
| 输出 / 百万 token | $10(推广期)→ $20 | $50(超 272K 按 1.5 倍) | $20 |
| 缓存输入 / 百万 token | $0.10(推广期,95% 折扣) | $1 | $0.20 |
| 单次输出上限 | 100 万 token | 12.8 万 token | 12.8 万 token |
| 现在能用吗 | ❌ 无公开 API | ✅ 一般可用 | ✅ 一般可用 |
几个必须注意的坑:
- 推广期什么时候结束,Google 没说。 官方注释只写"推广期结束后"执行 $4/$20,没给日期,也没说之后的缓存折扣还打不打折。
- 长输入可能有额外费率。 OpenAI 的 Astra 在输入超过 272K 时,整个请求按 2 倍输入、1.5 倍输出计费;Anthropic 说 Claude 从 4.6 起全 1M 上下文按标准费率。Google 目前没说 Argon 会不会有长 prompt 档位 —— 这块是盲区。
- 别把缓存价当成常态。 只有真正命中缓存的输入才打折,去后台看用量记录,别自己脑补。
- 算单次任务成本,别算单次请求成本。 Agent 型任务失败重试会疯狂累积 token。Artificial Analysis 给的换算更有参考价值:按智能指数上的单任务成本,Argon 推广期约 $1.99/任务,Astra 约 $3.26/任务,Argon 过了推广期涨到 $3.98。
一个粗算例子:10 万输入 + 2 万输出、无缓存的任务,推广期约 $0.40,常规价约 $0.80。看着不贵,但一个跑 20 步、失败重试 3 次的 Agent 就不是这个数了。
输出上限从 6.4 万涨到 100 万,带来的不只是"能干更大的活",还有"一不小心就能烧掉更多的钱"。给每个项目设预算上限,比选对模型更重要。
快速上手:现在到底能做什么
第一步:认清你今天能不能用
不能。 Google 的发布公告里没有给出 API 模型 ID,Gemini API 的定价页目前主打的还是 Gemini 3.8 Flash,没有 Argon 条目;DeepMind 的模型卡索引里也还没有 Argon。
网上那些"已验证可用的 Argon 模型名"教程,现在基本都是猜的。别信,也别在代码里瞎填。
第二步:三条真实可走的路
- 网络安全从业者:走 Fairwind 计划 申请。官方明确优先审核防御型组织 —— 政府、关键基础设施、核心平台方,会查你的安全记录和运营规范。注意:官方禁止转售或转授访问权限,别想着借号。
- 普通开发者:盯住三个地方 —— Gemini API 官方文档、Google AI Studio、Vertex AI。开放会从付费 API 客户和 Google AI Ultra 订阅者开始。
- 急着上线的人:先用 Astra 或 Opus 5.5。这俩今天就能调。
第三步:趁等待期把准备工作做完
这才是这篇文章最值钱的部分。等开放那天再动手,你就落后一个季度了。
- 攒一份你自己的评测集。 别用公开榜单,用你真实的活:仓库级编码任务、长文档分析、图表理解、多步规划。5–10 个就够。
- 记录五个指标:准确率、延迟、token 消耗、拒答行为、需要人工改多少。长上下文只有在"结果更好且成本没爆"时才算真的有用。
- 先画安全边界。 Argon 能自主发现漏洞并生成补丁 —— 这意味着它也能改坏你的生产代码。隔离环境起步,能用只读就只读,早期测试用脱敏数据,合并前必须人工过一遍。
- 把每个工具调用都记日志:读了哪些文件、请求了什么命令、改了什么、最终谁批的。
- 设好预算和回退模型。 常规任务别默认走最贵的那个。
第四步:想清楚哪件事归谁干
成熟的 AI 技术栈不该只有一个模型。按现在的跑分表,一个务实的分工长这样:
- 法律/金融研究、长文档集、长视频 → Argon(等开放)
- 单次输出超过 12.8 万 token 的完整迁移或长报告 → Argon,三个里只有它能一次写完
- 终端重度编码 Agent → Claude Opus 5.5,Terminal-bench 4.0 领先 9 分
- 计算机操作、最难的 SWE 任务 → GPT-6 Astra,OSWorld-2.0 和 FrontierSWE v2 都第一
- 这个月就要上线的东西 → Astra 或 Opus 5.5,因为 Argon 还没有公开 API
一句实话
LMArena 文本榜上 Argon 以 1525 分排第一,人工分析智能指数上它 53 分、跟 Astra 打平,Opus 5.5 以 58 分独占鳌头。没有任何一个模型通吃全部榜单。
这是好事。它说明竞争终于从"谁家聊天机器人更聪明",变成了"哪个模型该放在自动化流程的哪一环"。跑分表是别人家的地图,你的活才是你的地形 —— 把活拆开,一段一段对号入座,比追着发布会换模型靠谱得多。
另外提一句 Argon 的幻觉率:15%,是所有智能指数 45 分以上的模型里最低的,而 Astra 是 51%。如果你在意"它会不会一本正经地胡说八道",这个数字比任何跑分第一名都值钱。
进阶
更多开源技术干货和学习资料,关注公众号「遇码」,领取专属福利。
Gemini 中文文档