你肯定还记得今年 GTC 2026 上 Jensen Huang 那个标志性的 leather jacket 演讲。
当时他放了一张图,说 Vera Rubin NVL72 在 1-3 万亿参数模型上「每兆瓦性能是 Blackwell 的 3 倍」。台下掌声雷动,但如果你也在芯片圈混过几年,你一定听出那个「3x」背后的保留语气。
果然。昨天 SemiAnalysis 发布了第一份 Vera Rubin NVL72 实测 AgentX 基准结果——在真实 Agentic AI 推理负载下,Rubin 的每兆瓦吞吐量最高达到 Blackwell 的 30 倍。而在 Jensen 引用的 200 TPS 指标点,实测结果是 7x,不是 3x。
这不是第一次了。上一轮 GB200 NVL72 发布时,Jensen 说「30x Hopper」,SemiAnalysis 测出来是「98x Hopper」。这哥们不是在吹牛,他是在刻意压数据——在芯片行业这叫「sandbagging」,目的是给合作伙伴留面子、给自己留余量。
但这次的数据实在压不住了。
SemiAnalysis AgentX:第一个为 Agentic AI 设计的基准
要理解为什么 Rubin 的数据这么炸,先得说清楚 AgentX 是什么。
传统 GPU 基准测的是「固定序列长度」——输入 8K tokens、输出 1K tokens,一个批次跑完看吞吐量。但真实世界里,Agentic AI 的工作负载根本不是这样:
- 多轮对话:一次 Agent 会话可能包含几十到几百次模型调用
- 长上下文:系统提示、工具定义、历史对话让 context 快速累积到几十万 token
- 高前缀复用:KV cache 可以缓存已处理过的上下文,不需要重复计算
- Sub-agent 突发:每次启动子 Agent 都会产生新的 KV cache 突发模式
OpenRouter 的 State of AI 报告显示,单个 Agentic 请求消耗的 token 是普通聊天的 15 倍。用固定序列长度去测 Agentic 推理的硬件性能,就像用 F1 赛道的单圈时间来衡量一辆卡车在山路上的货运效率——测的是个寂寞。
AgentX 正是为此而生。它回放真实 Claude Code 会话的完整轨迹——推理时间、工具调用间隙、KV cache 压力全部保留——然后测每个系统在相同的真实流量模式下的每兆瓦吞吐量和用户交互体验。
SemiAnalysis 说,这个基准已经被 Google Cloud、Microsoft Azure、Oracle、Meta 以及 OpenAI、MiniMax、Qwen、Moonshot Kimi 等主流实验室验证或采用。vLLM、SGLang、PyTorch、HuggingFace 也都支持。
数字说话:Rubin 到底强了多少?
先看这张核心对比表(AgentX 基准,DeepSeek V4 Pro 1.6T 模型):
| 指标 | Vera Rubin NVL72 | GB300 NVL72 (SGLang) | H200 NVL8 |
|---|---|---|---|
| 100 TPS 吞吐量 (M tok/s/MW) | 59.4 | 28.5 | ~4 |
| 80 TPS P90 性价比 (x H200) | ~67x | ~18x | 1x (基准) |
| 120 TPS P90 性价比 (x H200) | ~39x | — | — |
| 160 TPS 每兆瓦吞吐量提升 (vs GB300) | 30x (宣称) | 1x | — |
| 每兆瓦年化利润 (模型) | $149.9B | $105.3B | — |
| 每百万 token 成本 (vs GB300) | 1/35 | 1x | — |
这组数字的冲击力在于——它不是 NVIDIA 自己的实验室数据,这是 SemiAnalysis 用第三方基准在自己集群上实测出来的。
在 100 TPS 交互性目标下,Rubin 达到 59.4M tokens/sec/MW,是 GB300 SGLang 28.5M 的 2.09x。在 80 TPS P90 目标下,性价比达到了 H200 的 67 倍——注意这是个跨代对比,但足以说明 Rubin 的架构飞跃。
为什么「性价比」在低 TPS 时更高?因为 TPS 要求越低,系统越容易利用 KV cache 和批处理来降低成本。Rubin 在这方面做了极端优化。
Jensen 又「Sandbag」了——这次是 3x vs 7x
SemiAnalysis 的文章标题直接写「Jensen Sandbagging Performance Again」。
在 GTC 2026 上,Jensen 展示的图表显示 VR NVL72 在约 200 TPS 时比 Blackwell 好 3x。但 SemiAnalysis 在预发布软件上的实测跑出了 7x 的 token 每兆瓦优势。
为什么压数据?三个可能:
- 给 Blackwell 留面子——Rubin 发布时 Blackwell 还在大规模出货,NVIDIA 不想让客户觉得自己刚买的东西就过时了
- 给软件栈留余量——预发布软件还没优化到位,正式发布时差距会更大,提前报高了以后没法交代
- NVIDIA 的内部文化——Jensen 在 GTC 上习惯性地「保守估计」,等第三方来打脸反而制造更多话题
不管原因是什么,这已经成一个模式了。GB200 NVL72 发布时同样如此——Jensen 说 30x Hopper,SemiAnalysis 测出 98x。
Rubin 的架构密码:六芯片极限协同设计
为什么 Rubin 能拉开这么大的差距?答案在架构。
Rubin 是 NVIDIA 第一个为 Agentic AI 时代从头设计的平台。它不只是换了个 GPU,而是六个芯片的极限协同设计:
| 组件 | 角色 |
|---|---|
| Rubin GPU | 新一代加速器,288 GB HBM4,Tensor Core K-step 翻倍到 64 字节 |
| Vera CPU | 自研 ARM 架构 CPU,替代 Grace,管理 NVLink 和内存一致性 |
| NVLink 6 Switch | 第六代 NVLink,GPU 间带宽翻倍,支持 72 GPU 的共享内存空间 |
| ConnectX-9 | 400G 网卡,网络带宽翻倍 |
| BlueField-4 | 第四代 DPU,加速网络、存储、安全卸载 |
| Spectrum-6 | 新一代以太网交换机,支持超大规模 AI 集群组网 |
一台 NVL72 机架包含 72 颗 Rubin GPU + 36 颗 Vera CPU,通过 NVLink 6 组成共享内存空间,单机架提供 3.6 EFLOPS NVFP4 推理性能和 2.5 EFLOPS FP8 训练性能。
Agentic workload 下的关键设计决策有两个:
- KV cache 容量大幅提升——HBM4 288 GB/GPU + NVLink 6 的带宽让子 Agent 突发产生的 KV cache 压力不再是瓶颈
- 推理和训练的架构统一——同一套系统既能跑训练也能跑推理,数据中心的利用率不会出现「训练时满载、推理时空转」的波峰波谷
不只是 Paper:CoreWeave 和 Nebius 已经上线了
这篇文章最可怕的是——这些数字不是来自「明年才能买的样品」。
CoreWeave 已经宣布将 Vera Rubin NVL72 投入生产,实测10x token 每兆瓦推理性能提升。Nebius 也在芬兰数据中心上线了第一台 Ruby NVL72 机架,声称自己是最早达到这一里程碑的 AI 云提供商之一。
NVIDIA 说 Rubin 在 2026 年 Q1 进入批量生产,H2 开始向超大规模云和 Neocloud 出货。也就是说,现在已经在跑了。
SemiAnalysis 的结论更有意思:「随着 Rubin 的软件栈和 kernel 库成熟,以及开发者社区积累针对 Rubin 的优化经验,我们预计差距还会拉大。」
换句话说,59.4M tok/s/MW 还不是上限——这只是预发布软件的水平。
写在最后
Vera Rubin 的数据让我想起 2023 年 H100 刚出货时的情景——大家还沉浸在「Ampere 够用」的错觉里,直到实测跑分出来才发现翻了几倍。
这次不同的是三点:
第一,Agentic AI 的工作负载模式已经完全不同。如果你还在用 8K/1K 固定序列去评估 GPU,你根本不知道自己的数据中心效率有多低。AgentX 不是可有可无的基准,它应该成为你采购决策的第一张表。
第二,规模效应的第二曲线正在打开。SemiAnalysis 给出了 Rubin 每 GW 年化 $149.9B 利润的模型——这不仅仅是「更快的 GPU」,这是一台可以自己还贷的印钞机。「买得越多、赚得越多」(The More You Buy, The More You Earn)从营销口号变成了真实的经济学命题。
第三,Jensen 的「Sandbag」已经是行业级 meme,但背后有个严肃的问题:当 NVIDIA 的实测数据比官方宣称高出 2-7 倍,你作为采购方应该信谁的?答案很明确——等第三方实测,不要只看 GTC 的 Keynote。
数据中心的每一兆瓦都是真金白银。Rubin 的 59.4M vs Blackwell 的 28.5M——这个差距值得你做一次采购策略的重审。
📊 数据来源:SemiAnalysis「Vera Rubin NVL72 Agentic Inference: 67x better Performance per Dollar」、NVIDIA Developer Blog「Vera Rubin and Blackwell Set a New Standard for Agentic AI Performance per Watt」、OpenRouter State of AI Report、CoreWeave 生产级验证