英伟达发布DSX平台:Lambda验证同功耗下token吞吐提升24%
NVIDIA在AI Infra Summit上公布DSX MaxLPS首个部署验证结果:Lambda用19个节点在原本只够16个节点满跑的功耗预算内运行,集群token吞吐从约每秒400万提升至500万,性能每瓦提升23%。
AI解读:这条新闻的核心不是又一个GPU,而是电。NVIDIA DSX是一套面向AI工厂的软硬件组合,目标是在不新建发电和输电设施的前提下,让同样的电产出更多token。对运营数据中心、云服务或自建AI集群的团队来说,功率预算从此变成了可以动态分配的变量。
Lambda的验证之所以关键,是因为它第一次在真实部署里拿出了数字:五机架19个节点,跑在原本只够16个节点满负荷的功率预算内,token吞吐提升24%,性能每瓦提升23%。这意味着过去被静态分配浪费掉的电力余量,可以重新变成可用的算力。
NVIDIA同时给出了另一个层面的证据:Emerald AI的Conductor平台在硅谷电力公司的调度信号下,把一座AI工厂的功耗从4兆瓦降到3兆瓦,整个过程自动完成,高优先级任务不中断,已连续响应超过200次。这套机制目前还不是DSX Flex的正式安装,但它是概念在商业规模上跑通的证明。
对读者而言,真正的变化是数据中心和电网的关系在改变。愿意在电网紧张时主动降载的AI工厂,可能在并网审批和扩容上获得更多空间;不参与的则继续受制于固定功率上限。NVIDIA给出的下一站是弗吉尼亚州Manassas的96兆瓦Vera Rubin AI工厂,那将是DSX Flex的第一个专门商业部署。
限制也需要说清楚:40%的额外GPU容量是基于NVIDIA自己针对下一代Vera Rubin NVL72的推算,适用条件写的是“合适的部署环境”,不是普遍结果。24%的token吞吐提升来自单一供应商在五机架集群上的验证,还没有第三方独立复现。
NVIDIA在周二的AI Infra Summit上把AI工厂效率作为基础设施主题演讲的核心。NVIDIA超大规模与高性能计算副总裁Ian Buck展示了DSX平台在电力管理上的早期部署结果:云服务商Lambda跑出的数据显示,在固定功率预算下,智能管理可支撑高出24%的token吞吐。
Lambda总裁Dave Ward在声明中表示:“通过我们的概念验证,我们认为已经超越了固定功率预算的限制。NVIDIA DSX MaxLPS为回收搁浅容量并将其转化为实际使用开辟了道路,在相同占地面积内实现显著更高的计算密度。”
与这些数字同时出现的是更早的一次生产验证。去年8月一个炎热的傍晚,硅谷电力公司向一座AI工厂发出调整用电的信号。Emerald AI的Conductor平台接收电网状态信号,自动调整数据中心内可灵活调度的计算任务:可以等待的工作被放慢或重新排期,高优先级服务继续运行。NVIDIA表示,硅谷电力公司此后已向该AI工厂发送超过200次需求信号,每次都成功响应。
Lambda在五机架19节点上跑出的数字
Lambda的验证是DSX MaxLPS在NVIDIA HGX B200 GPU服务器上的首次部署环境验证,发布于AI Infra Summit当天。DSX MaxLPS监控GPU和机架级功耗,根据工作负载类型在节点之间重新分配功率余量,回收静态分配会搁浅的容量。NVIDIA指出,训练和推理的功耗特征不同,MaxLPS为同时运行两者的AI工厂优化分配。
Lambda是一家服务超过1万家客户的GPU云提供商,客户从AI原生初创公司到超大规模企业。它在一个五机架、19个节点的集群上运行了该软件。结果:把19个节点装进原本只够16个节点满功率运行的功率预算内,集群token吞吐提升24%,从大约每秒400万token升至每秒500万token,性能每瓦提升23%。
NVIDIA还给出了对下一代的推算:在合适的部署环境中,DSX MaxLPS可为下一代Vera Rubin NVL72 AI工厂在相同兆瓦功率预算内带来最多40%的额外GPU容量。这一数字来自NVIDIA自己的预测,并非实测。
- 验证平台:NVIDIA HGX B200 GPU服务器
- 集群规模:5机架、19节点
- 吞吐变化:约400万token/秒→500万token/秒,提升24%
- 性能每瓦:提升23%
- 下一代推算:Vera Rubin NVL72在相同兆瓦预算下最多增加40% GPU容量,基于NVIDIA预测
需求响应:4兆瓦降到3兆瓦,200多次信号未失手
Emerald AI联合创始人Varun Sivaram与约40人通过Zoom观看首次跨数千块NVIDIA GPU的部署。当功耗下降在屏幕上显示出来时,房间里的人开始欢呼。Sivaram说:“我们屏住呼吸看着。这是我们第一次跨数千块NVIDIA GPU部署。”他的产品负责人Mansi Shah说:“这有点像是SpaceX火箭发射。”
NVIDIA的Eos AI工厂正在运行Emerald AI Conductor,作为硅谷电力公司柔性负载互连计划的参与方。NVIDIA称,这是第一个把AI工厂视为可调度资源的商业电网公用事业计划。当硅谷电力公司发出信号时,Conductor在不到一分钟内响应,执行预先定义的工作负载层级:最低优先级任务让出电力,高优先级推理继续运行,功耗从4兆瓦降至3兆瓦,全程自动,无需操作员。
NVIDIA明确说明,圣克拉拉的故事不是DSX Flex的安装,而是更早、更重要的事:概念在商业规模上得到验证。DSX Flex正是为推广这一模式而构建,随着平台成熟,Emerald AI Conductor将集成进DSX Flex。第一个专门的DSX Flex商业部署将是弗吉尼亚州Manassas的设施:NVIDIA AI工厂研究中心内一座96兆瓦的Vera Rubin AI工厂,基于此前横跨两大洲的五次演示。
- 参与项目:硅谷电力公司柔性负载互连计划
- 响应时间:不到一分钟
- 降载幅度:4兆瓦→3兆瓦,自动完成
- 信号次数:超过200次,全部成功
- 首个专用DSX Flex商业部署:弗吉尼亚州Manassas,96兆瓦Vera Rubin AI工厂
800V直流与整厂设计
NVIDIA表示,当前AI工厂内部的能效提升是真实且可立即部署的。下一层是电力如何输送到更密集的加速计算机架。随着AI工厂规模扩大,传统低压供电路径会增加转换复杂性和配电限制。NVIDIA的800V直流架构旨在于降低转换复杂性、提升电力输送效率并支持更密集的加速计算机架。DSX正在将800V直流纳入其参考设计。
NVIDIA强调,没有任何单一组件能独自优化AI工厂。更快的GPU仍要等网络,糟糕的供电配置会搁浅电力,冷却开销仍会从GPU那里分走电力。GB200 NVL72机架采用直接液冷,携带约120千瓦的热量,这些热量必须在电力到达计算单元之前被带走。
NVIDIA给出的路径是优化整座工厂:上架前用DSX Sim,运行后用DSX OS和DSX Exchange,DSX参考设计让建设者从经过验证的架构出发而不是从零开始。NVIDIA创始人兼CEO黄仁勋曾说:“一座1吉瓦的工厂永远不会变成2吉瓦的工厂。”NVIDIA认为,当系统触及物理极限时,工程师的答案始终是停止优化部件,开始设计整体。
- 800V直流架构目标:降低转换复杂性、提升供电效率、支持更密集机架
- GB200 NVL72直接液冷机架热量:约120千瓦
- DSX套件角色:DSX Sim(上架前模拟)、DSX OS与DSX Exchange(运行时)、DSX参考设计(经过验证的架构)