产品NVIDIA Blog·原文 2026年9月16日本站收录 2026年9月17日

英伟达Vera Rubin NVL72首次亮相MLPerf Inference v6.1,吞吐量最高达GB300 NVL72的 3.7 倍

英伟达称,Vera Rubin NVL72在MLPerf Inference v6.1的首次预览提交中,Qwen3-VL吞吐量最高达GB300 NVL72的 3.7 倍,DeepSeek-R1最高达 2.5 倍;GB300 NVL72在 288 GPU规模下实现 99% 扩展效率,软件优化较v6.0带来最高 1.6 倍提升。

AI解读:英伟达强调这些成绩是“预览提交”,并非正式产品发布后的完整测试。它使用vLLM配合NVIDIA Dynamo跑Qwen3-VL,使用TensorRT-LLM跑DeepSeek-R1,所以成绩同时反映硬件、软件栈和推理框架的配合,不能简单理解为单卡性能倍数。

对正在规划AI推理基础设施的团队,英伟达想传递的信息是:同样的机架规模下能产出更多token、服务更多用户,从而降低单token成本。但这仍是英伟达自己选定的两个高难度基准上的表现,实际业务收益取决于模型、负载类型和部署方式,读者不宜直接套用到自己的成本模型。

另一个容易被忽略的数字是扩展效率。GB300 NVL72的 288 GPU提交在离线场景达到 99% 扩展效率,意味着加硬件几乎能线性换来吞吐量。对需要横向扩容的数据中心来说,这比单点峰值更有参考价值,因为它直接关系到加卡之后钱花得值不值。

软件优化部分,英伟达称v6.1相比v6.0使其平台性能最高提升 1.6 倍,并提到提交截止后仍有进一步优化,但那些后续结果尚未经MLCommons验证。这类“提交后”数据只能当作方向性参考,不能和已核验的榜单成绩等同看待。

英伟达在MLPerf Inference v6.1的首次预览提交中,让Vera Rubin NVL72亮相,并公布了两项对比数据:在Qwen3-VL上吞吐量最高达GB300 NVL72的 3.7 倍,在DeepSeek-R1上最高达 2.5 倍。

该公司同时称,GB300 NVL72的 288 GPU提交在离线场景达到 99% 扩展效率;其MLPerf Inference v6.1提交中的软件优化,相比v6.0带来最高 1.6 倍性能提升。

上述结果来自英伟达博客,依据MLPerf Inference v6.1 Closed Division成绩,数据于 2026 年 9 月 16 日从mlcommons.org获取。Vera Rubin NVL72的部分为预览提交,并非正式产品发布后的完整测试。

英伟达还将Vera Rubin NVL72在SemiAnalysis AgentX基准上的预览测试成绩列为GB300 NVL72的 30 倍。该数字来自英伟达博客,并非MLPerf官方成绩。

MLPerf Inference v6.1中的两项基准成绩

英伟达提交的Vera Rubin NVL72预览结果覆盖MLPerf Inference v6.1套件中两个要求较高的基准:DeepSeek-R1和Qwen3-VL。

在Qwen3-VL上,Vera Rubin NVL72在离线、服务器和交互三种场景下,吞吐量最高达到GB300 NVL72的 3.7 倍;测试使用vLLM和英伟达Dynamo开源推理框架。

在DeepSeek-R1上,使用英伟达TensorRT-LLM库,吞吐量最高达到GB300 NVL72的 2.5 倍。英伟达称这些是早期结果,并称随着持续软件优化,性能还会提升。

英伟达博客说明,MLPerf Inference v6.1为Closed Division,成绩于 2026 年 9 月 16 日从mlcommons.org获取;英伟达平台结果对应条目编号 6.1-0106 和 6.1-0074。

  • Qwen3-VL:Vera Rubin NVL72吞吐量最高为GB300 NVL72的 3.7 倍,覆盖离线、服务器、交互三种场景
  • DeepSeek-R1:Vera Rubin NVL72吞吐量最高为GB300 NVL72的 2.5 倍,使用TensorRT-LLM
  • Qwen3-VL测试使用vLLM与NVIDIA Dynamo
  • Vera Rubin NVL72结果为预览提交,非正式产品发布后的完整测试

GB300 NVL72的 99% 扩展效率与WAN 2.2成绩

英伟达称,其DeepSeek-R1提交从单个GB300 NVL72机架(72 GPU)扩展到四个机架(288 GPU),在离线场景实现 99% 扩展效率,吞吐量几乎与增加的硬件成正比。

英伟达博客解释,扩展效率重要是因为增加GPU并不自动带来成比例吞吐量;如果GPU数量接近翻倍而吞吐量只有个位数百分比提升,基础设施成本会远超性能回报。其做法是机架内高带宽低延迟扩展互联、机架间高带宽网络,以及跨节点的高效请求编排。

GB300 NVL72还在WAN 2.2文生视频基准上展示了机架级效率:达到每秒 0.65 个 720p视频、每个视频 5.7 秒,吞吐量比单节点高 9 倍,延迟低 7.5 倍。

英伟达平台结果对应条目编号 6.1-0073 和 6.1-0074,成绩于 2026 年 9 月 16 日从mlcommons.org获取。

  • DeepSeek-R1离线场景:从 72 GPU扩展到 288 GPU,扩展效率 99%
  • WAN 2.2文生视频:每秒 0.65 个 720p视频,每个视频 5.7 秒,吞吐量为单节点 9 倍,延迟为单节点 7.5 倍

软件优化与机架级技术细节

英伟达称,在v6.1中,GB300 NVL72在Qwen3-VL上的性能相比v6.0结果最高提升 1.6 倍。提升来自更低的KV缓存精度、更多内核融合、更好的内核,以及使用vLLM和NVIDIA Dynamo的解耦服务。

英伟达还称,在v6.1提交截止后继续进行了软件优化;GPT-OSS-120B和DLRMv3上的提交后结果显示出进一步性能提升,但这些结果尚未经MLCommons验证。

Vera Rubin NVL72的性能被英伟达归因于软硬件全栈协同设计:增强的Tensor Core和Transformer Engine加速推理的预填充与解码阶段,NVFP4精度降低模型权重、注意力和KV缓存的内存占用,从而在输出质量损失极小的前提下提高吞吐量。

英伟达称,Vera Rubin提交大量使用解耦服务,将预填充和解码分离,并针对DeepSeek-R1、Qwen3-VL等混合专家模型层采用大规模专家并行。NVL72的扩展域由第六代NVLink和NVLink Switch驱动,数据包速率比现成以太网高 10 倍,延迟低 3 倍。

  • v6.1相比v6.0:Qwen3-VL上GB300 NVL72性能最高提升 1.6 倍
  • 优化手段包括更低KV缓存精度、额外内核融合、更好内核、vLLM与Dynamo解耦服务
  • 提交后优化在GPT-OSS-120B和DLRMv3上显示进一步提升,但尚未经MLCommons验证
  • Vera Rubin使用NVFP4精度,降低权重、注意力和KV缓存的内存占用
  • NVL72扩展域使用第六代NVLink与NVLink Switch,数据包速率为现成以太网的 10 倍,延迟低 3 倍

伙伴生态、边缘提交与AgentX成绩

英伟达称,其伙伴生态广泛参与了本次提交,共 19 家伙伴,其中 8 家使用多节点Blackwell NVL72系统。名单包括ASUS、Azure、Cisco、CoreWeave、Crusoe、Dell Technologies、Fujitsu、Giga Computing、HPE、Inventec、Lambda、MiTAC Computing、Nebius、Oracle Cloud Infrastructure、Quanta Cloud Technology、Red Hat、ScitiX、Supermicro和Wiwynn。

Nebius也提交了Vera Rubin NVL72预览结果,英伟达称其展示了出色性能。

在边缘侧,英伟达使用NVIDIA TensorRT Edge-LLM提交了Jetson AGX Thor在新增Edge-Agentic基准上的结果,模型为Qwen3.6-27B。

针对AI智能体推理,英伟达称Vera Rubin NVL72在SemiAnalysis AgentX预览测试中性能为GB300 NVL72的 30 倍。英伟达还表示,即将推出的MLPerf Endpoints基准将为智能体推理工作负载带来标准化测量,覆盖传统吞吐量基准之外的内容。

  • 19 家伙伴参与,其中 8 家使用多节点Blackwell NVL72系统
  • Nebius提交了Vera Rubin NVL72预览结果
  • Jetson AGX Thor使用TensorRT Edge-LLM提交Edge-Agentic基准,模型为Qwen3.6-27B
  • SemiAnalysis AgentX预览测试:Vera Rubin NVL72性能为GB300 NVL72的 30 倍
  • 即将推出的MLPerf Endpoints基准将标准化测量智能体推理

信息来源

NVIDIA Blog原始来源