英伟达在AI Infra Summit公布Vera Rubin、DSX多项能效数据
英伟达超大规模与高性能计算副总裁Ian Buck在9月15日的AI Infra Summit上介绍AI工厂能效进展,现场披露Lambda、Emerald AI、Pinterest等合作方数据,并称Vera Rubin已进入全面量产。
AI解读:这条新闻的核心不是某个新模型,而是英伟达给AI工厂换了一个考核标准:从峰值算力转向“每兆瓦有效智能体token数”。原因很直接,智能体工作负载会连续推理、调用工具、派生子智能体,单次会话的输入token量约为普通对话请求的15倍,耗电和吞吐同时被放大。
受影响的首先是正在为电力发愁的AI云厂商和数据中心运营方。英伟达给出的解法分三层:DSX MaxLPS在机架和GPU之间动态挪电,DSX Flex让AI工厂根据电网信号自动降载,Groq 3 LPX补充低延迟推理。Lambda的实测是同一电力预算下跑19个节点而非16个,集群吞吐从每秒约400万token升到500万,每瓦性能提升23%。
普通读者不用为此调整什么,但如果你关心AI服务会不会因缺电而变贵变慢,这些数字值得留意:它们目前全部来自英伟达及其合作方的自测或演示,适用条件、部署环境和第三方复现情况尚未公开,属于厂商口径而非独立验证。
另一个信号是Vera CPU开始被Perplexity、ClickHouse、Redpanda等公司拿去做智能体和数据密集型负载的基准测试,结果均为厂商或使用方自报。英伟达称Vera Rubin已全面量产并在生态中扩展,后续性能还会靠软件优化继续变化,这意味着现在看到的数字可能不是终值。
英伟达超大规模与高性能计算副总裁Ian Buck于9月15日在圣克拉拉会议中心举行的AI Infra Summit上发表演讲,主题是AI工厂能效。该会议今年参会人数超过8000人,去年为3500人。
英伟达在演讲中公布了多项合作与性能数据:亚马逊Annapurna Labs与英伟达合作开发NVHBM定制高带宽内存技术;d-Matrix正将NVLink Fusion平台与d-Matrix Raptor XPU集成;Emerald AI与英伟达联合演示了商业AI工厂柔性负载项目,合作方为Silicon Valley Power;Lambda使用英伟达DSX MaxLPS将每瓦性能提升23%;Pinterest正使用英伟达Blackwell平台和Dynamo推理软件为视觉发现引入对话式AI。
英伟达表示,智能体AI正在驱动一类新工作负载,对AI基础设施的性能、效率和规模提出更高要求。其应对方式是覆盖Vera Rubin系统、Dynamo推理软件、NeMo库和英伟达网络的全栈AI工厂平台,网络部分包括用于向上扩展的NVLink、用于连接数千节点的Spectrum-X以太网和ConnectX SuperNIC、由BlueField驱动的上下文内存存储,以及用于基础设施安全的BlueField DPU。
英伟达称,AI基础设施的衡量指标正快速从峰值性能转向经过验证的每兆瓦智能体token数,AI工厂必须从芯片到电网进行协同设计。英伟达称DSX MaxLPS通过工厂级电力优化可提供最高1.4倍的每兆瓦token数,NVLink则帮助把大规模加速计算整合为单一高性能系统。
Emerald AI与Silicon Valley Power演示自动降载
Silicon Valley Power运营一项柔性负载互联计划,允许AI工厂支持电网灵活性。通过该计划,Emerald AI与英伟达合作在Silicon Valley Power演示了自动降载,系统在保护AI工作负载性能的同时成功响应了来自Silicon Valley Power的数百个需求信号。
英伟达合作方Emerald AI计划在其Conductor电网响应式电源管理软件中使用英伟达DSX Flex,该软件根据实时电网信号和混合能源动态调整AI工厂能耗。Emerald AI可通过DSX Flex自主负载均衡,演示自动降低低优先级AI任务的电力、随后恢复正常的能力。
据英伟达介绍,DSX Flex可接收电网信号——包括减载请求、需求响应事件和价格信号——并在预定义的工作负载层级内自动行动:最关键的任务继续运行,其余任务暂时暂停后恢复。英伟达称这一能力使AI工厂可作为柔性电网资源运行,在电网需要缓解时降低需求、保护优先AI工作负载,并证明可控AI负载有助于释放更多电网容量。
Lambda称同一电力预算下多跑3个节点
AI云提供商Lambda在AI Infra Summit上发布结果,称这是英伟达DSX MaxLPS在英伟达Blackwell服务器上的首次验证。DSX MaxLPS持续监控GPU和机架功耗,动态将可用电力转移到最需要的地方,并回收静态分配下未使用的容量;由于训练和推理工作负载的电力曲线不同,MaxLPS可优化混合负载AI工厂的电力分配。
英伟达称结果显著:Lambda在通常分配给16个满功率节点的同一电力预算内运行了19个节点,集群整体token吞吐提升24%,从约每秒400万token提升至每秒500万token,同时每瓦性能提升23%。
英伟达还称,对于下一代Vera Rubin NVL72 AI工厂,在合适的部署环境中,DSX MaxLPS可在同一兆瓦预算内增加最高40%的GPU容量,使运营方在同一电力范围内提升AI容量和token吞吐。
英伟达称Vera Rubin加Groq 3 LPX可达GB200 NVL72的35倍每兆瓦吞吐
英伟达称,AI工厂中电力是约束条件,每一瓦都重要,因此从每兆瓦中榨取更多token是AI基础设施的关键。其方案是构建在Vera Rubin NVL72之上的全栈AI工厂:系统、网络、软件和电源管理协同工作。
在工厂层面,英伟达DSX MaxLPS在需求升降时动态转移机架间电力。英伟达给出的收益是:同一站点电力范围内GPU数量最多增加40%,token吞吐最高提升35%,且无需新增电力线路。在机架内部,智能电力平滑软件和扩展的能源缓冲吸收短时尖峰,使系统更接近持续需求运行,把闲置余量变成可用算力。
英伟达称,Groq 3 LPX为Vera Rubin增加确定性超低延迟推理,与DSX MaxLPS互补。对于参数超过2万亿、长上下文的模型,该组合平台每兆瓦token吞吐最高可达GB200 NVL72的35倍。英伟达给出的具体数字是:在100K上下文的Qwen 3.8 27B工作负载上,Groq 3 LPX达到每用户每秒2529个输出token。
SemiAnalysis AgentX测出最高30倍每兆瓦吞吐
SemiAnalysis AgentX基于录制的真实智能体编码会话测量推理,保留实际上下文增长、工具调用延迟和子智能体派生,而非单请求基准。英伟达Vera Rubin NVL72的智能体性能结果已上线SemiAnalysis AgentX仪表盘。
据英伟达称,在DeepSeek V4 Pro模型上,Vera Rubin NVL72的每兆瓦吞吐最高达英伟达GB300 NVL72的30倍。英伟达解释,智能体工作负载形态不同于传统的请求-响应任务:单个会话随着智能体推理、调用工具和派生子智能体可累积数十万输入token,约为简单聊天请求token量的15倍,且请求间输入输出长度差异很大,因此需要围绕完整智能体轨迹构建的基准,AgentX正是如此,与测量单请求性能的MLPerf Inference等标准套件互补。
英伟达称,最高30倍的每兆瓦吞吐意味着同样能耗足迹下最多30倍的智能体工作量,AgentX结果还显示每百万token成本最高降低45倍。在电力受限的部署中,每兆瓦吞吐决定AI工厂能产生多少收入,每百万token成本决定利润率。英伟达称这一性能来自极致的协同设计,包括NVL72向上扩展域和第六代NVLink互连、第五代Tensor Core上的NVFP4精度,以及覆盖NVIDIA TensorRT LLM和NVIDIA Dynamo的推理栈。英伟达表示Vera Rubin已全面量产并在生态中扩展,性能将随持续的软件优化继续提升。
多家初创公司发布Vera CPU基准结果
英伟达称,多家初创公司正在测试NVIDIA Vera CPU运行智能体工作负载和其他高要求应用,并公布了结果。
Perplexity为其面向智能体AI的新SPACE安全沙箱平台对Vera CPU进行基准测试,显示沙箱启动速度提升1.9倍。Daytona在智能体工作负载上测试Vera CPU,称其带来“智能体执行的显著提升”。ClickHouse在分析数据库开放基准ClickBench上公布Vera CPU结果,称Vera是团队迄今测量过的最快机器,是“数据密集型负载CPU性能前景的强烈信号”。
DeepInfra在Vera CPU上运行多项基准,称其在包括编排步骤延迟快2.2倍在内的所有指标上胜出。Prime Intellect发现,随着并行工作负载增加,Vera CPU保持高带宽和低且一致的内存延迟。Redpanda称其Vera CPU基准显示延迟降低5.5倍、吞吐比其他CPU高73%。Starburst公布的基准结果显示Vera CPU查询吞吐比其他CPU快3倍。Kinetica称Vera CPU相比传统CPU分析查询性能快2.7倍。
NVLink 6以多层容错维持大规模运行
英伟达称,随着AI工厂扩展到数十万GPU,可靠性成为一项性能特性。训练和推理工作负载依赖持续运行,瞬态错误、信号退化和硬件故障是不可避免的挑战。
英伟达称NVLink 6通过多层弹性架构应对这些挑战,设计目标是在故障影响应用之前检测、隔离并恢复。在物理层,定制前向纠错、物理层重试和通用物理层恢复帮助维持无损结构,并将延迟影响降到最低。在网络层,基于信用的流控、动态路由和链路再平衡在本地隔离故障,防止可能降低AI工厂吞吐的级联停顿。