Featured image of post Google DeepMind 重返前沿!Gemini 4 Argon 发布——1M Token 输出独步天下、安全先行,法律 Agent 碾压全场

Google DeepMind 重返前沿!Gemini 4 Argon 发布——1M Token 输出独步天下、安全先行,法律 Agent 碾压全场

你盯着最复杂的长周期代码任务,一排排跑完,输出到第 63,000 个 token 突然截断——深吸一口气,打下一轮 prompt,从头再跑。

这个场景,所有用 Frontier 模型做 Agent 的工程师再熟悉不过了。64K 输出上限像一堵墙,把需要深度推理的长链条任务切得支离破碎。

昨天,Google DeepMind 直接用 1,000,000 个输出 token 把这堵墙推倒了。

《Claude Opus 5.5 发布!同天 OpenAI 发 Luna/Sol》

一句话定位

Gemini 4 Argon,旗舰 Pro 级,Gemini 4 代的首个模型。它在长期软件工程、企业知识工作(法律、金融)、网络防御三方面设置了新标杆。但有个不寻常的前提:这不是一个公开发布。它先只给 Fairwind 计划下「可信赖的网络防御者」使用——这是 Google 安全先行策略的极致体现。

距离上一代 Gemini 3 Pro(2025 年 11 月)已过去 10 个月——Google 在此期间跳过了 3.5 Pro,靠 Flash 系列撑场。现在,它用一个全新的元素命名体系回来了。

规格表:一页看清全貌

参数 Gemini 4 Argon
开发商 Google DeepMind
前代路径 Gemini 3 Pro(2025.11)→ 跳过 3.5 Pro
模型等级 旗舰 Pro / Frontier
输出 Token 上限 1,000,000(16x 前代 64K)
输入上下文窗口 1M-token 级
持续推理 单轮数百万 token 生成轨迹
输入推理路径 支持(Reasoning mode)
输入模态 文本 + 图像
输出模态 文本
首批可用性 Fairwind Program 独家
下批 付费 API + Google AI Ultra

定价:告诉市场「我来竞争了」

Google 打了一张 introductory 牌:

模型 输入(/1M tokens) 输出(/1M tokens) 缓存
Argon(引介价) $2 $10 95% 折扣($0.10)
Argon(标准价) $4 $20 同上
Claude Opus 5.5 $4 $20 无公开
Claude Fable 5.1 $10 $50 无公开

引介价直接把 Argon 放到了 Opus 5.5 的一半。Google 说这是「引介定价」——多久?没说。但这段窗口期内,Argon 是 $20/1M 输出质量的一半价。

另外,缓存 95% 折扣($0.10/1M 输入)是现阶段最激进的——如果你做大量系统 prompt 复用的 Agent,这直接决定成本模型。

1M 输出:不是噱头,是架构新范式

为什么 1M 输出是个大事?

因为长链条 Agent 的真正瓶颈从来不在输入,在输出。

一个需要推理数百个文件依赖的编码 Agent 会在一次 unrolling 过程中产生数百 K 的内部 Thought Chain——然后写完整的新模块代码又要几百 K。以前,你必须手动拆任务、分轮次对话、管理上下文连续性——每轮都有「忘记前一轮意图」的风险。

Koray Kavukcuoglu(Google DeepMind SVP)说得直白:

“当模型有足够的思考空间生成数百千 token 的单一轨迹时,它增加了推理深度,能一次性解决难题。”

16x 的输出空间意味着一个 Agent 可以:

  1. 摄入多文件依赖图 → 2. 做几百 K 的内部 chain-of-thought → 3. 合成新模块 → 4. 输出完整文件

全部在一个连续流里完成。不再有断点、不再有上下文丢失。

Benchmark 拆解:家底和短板一览

Google 发布了 Argon vs GPT-6 Astra vs Claude Fable 5.1 vs Claude Opus 5.5 的 19 个 Benchmark。我挑出最关键的 11 项,按能力域拆分:

🚀 领先领域(Argon 擅长的)

评测 Argon GPT-6 Astra Opus 5.5 Fable 5.1
DeepSWE v1.1(长程编码) 77.9% 🏆 74.1% 74.2% 67.4%
Vals Index(综合 GDP 影响) 68.9% 🏆 63.1% 67.0% 65.8%
AutomationBench(业务流程执行) 51.3% 🏆 41.4% 42.5% 31.4%
Harvey Legal Agent(法律研究与起草) 19.6% 🏆 5.4% 3.8% 6.7%
Vals Finance v2(金融多步推理) 65.4% 53.5% 58.6% 58.9%
LVBench(长视频理解) 91.7% 🏆 87.5% 83.7% 79.7%
GraphWalks 256k-1M(超长上下文路径查找) 84.2% 🏆 71.8% 66.8% 65.0%

最炸裂的数字是 Harvey Legal Agent——19.6%,是第二名 GPT-6 Astra(5.4%)的 3.6 倍。 这个差距不是几个百分点——是量级差。法律研究与起草是 Frontier 模型落地最有商业价值的场景之一,Google 在这里打了一场「跨代碾压」。

DeepSWE v1.1 的 77.9% 被 Google 称为「新 SOTA」。这个评测覆盖 113 个任务、91 个公开代码仓库、5 种语言,测的是真实世界的长生命周期软件工程,不是算法竞赛题。

⚡ 短板领域(Argon 落后的)

评测 Argon GPT-6 Astra Opus 5.5 Fable 5.1
FrontierSWE v2(高级编码) 55.0% 65.5% 🏆 62.3% 56.3%
Terminal-bench 4.0(终端操作) 57.4% 58.2% 66.4% 🏆 57.9%
CWE-bench v1(漏洞修复) 68% 68% 🏆 67% 58%

在 FrontierSWE v2 上,GPT-6 Astra 领先 Argon 整整 10.5 个百分点。Terminal-bench 4.0 上,Opus 5.5 领先 9 个百分点。这印证了「综合能力强 ≠ 所有单项最强」——不同模型在代码任务的不同维度各有专长。

独立评测验证

Artificial Analysis 的 Intelligence Index(v4.3.2,包含 10 项评测综合)给 Argon 打了 53 分——与 GPT-6 Astra 同分,比 GPT-6.1 Sol(52 分)高 1 分。这也验证了 Argon 整体上「追平了 Frontier 一线」但没有超越。

安全先行:Fairwind 独家首发,为哪般?

最不寻常的策略是首发只给网络防御者。

Fairwind 是 Google 的「可信防御者轨道」,专门为保护关键基础设施的团队保留。首批用户包括:

  • Wiz — 通过其 Scan for Good 项目使用 Argon 自动发现并修复高危漏洞
  • Google 内部安全团队 — 用于漏洞发现、验证和补丁生成
  • 美国政府伙伴 — 通过自愿的联邦预发布审查机制

关键细节:Google 称,对 Fairwind 可信防御者,会发布无网络防护栏(without cyber guardrails)版本,让它们用全部防御能力。

这意味着什么?世界级模型武装防御者,先于商业用户。这是 Google 在 Agent 安全攻防加速升级(同月已有 OpenAI Agent 自主攻破医疗机构、NVIDIA 发布安全平台)的背景下打的一张「安全牌」。但这张牌的背面是:开发者想用 Argon 做产品?还得等。

Google 内部已大规模使用

这不是一个「等别人测」的模型。Google 内部数千雇员已在用 Argon:

  • 300+ TiB 内存回收:一组 Argon 代理分析 Google 数据中心全局 telemetry 数据,自主发现并应用内存优化——预计总节省 500 TiB 到 1 PiB。
  • Rust 大规模迁移:Argon 正在将 C/C++ 代码库迁移到 Rust——re2、libgav1 等核心库,到 Fuchsia Zircon 内核(800K+ 行)。在 libgav1 解码器上,Argon 通过自主探索将 Rust 移植版的 SIMD 部分优化到编译器自动向量化,最终达到 2.7 倍加速。
  • 量子算法优化:Argon 帮助量子计算团队优化了时间和空间资源约束的子程序,在几分钟内超过已发表 baseline 的 40%。
  • 漏洞发现:在 Wiz 的黑箱渗透测试 Benchmark 上,Argon 的攻击面发现和 PoC 验证能力全面超过 3.8 Flash Cyber。

写在最后

Google 的 Gemini 4 Argon 不是这次发布里「全面领先」的模型——FrontierSWE 和 Terminal-bench 的短板真实存在。但这次发布的战略信号比任何 Benchmark 数字都重要:

Google 在关键的 2026 Q4 节点告诉市场——我回来了,逐项部署,不计成本。

1M 输出 Token 是架构层面的差异化——如果开发者真正开用,它可能改变 Agent 应用的设计范式(不拆任务才是常态)。Fairwind 首发策略是 Google 对「安全红利」的赌注:先武装防御者,再放开发者,从而在商业落地之前建立信任基线。

Introductory 定价是直接的市场下注——Half price vs Opus 5.5,等 Opus 5.5 和 Astra 的开发者们跑过来做成本对比。

但这里有一个问题留给每个正在选型的 Agent 工程师:如果你的 Agent 需要在 FrontierSWE 这类高级编码任务上领先,Astra 仍是霸主;如果你的 Agent 替代的是律师、分析师、金融研究者——Argon 可能是更好的选择。

不是有没有绝对的赢家——而是赢家因场景而异。

By AI博士 万戈