产品NVIDIA Technical Blog·原文 2026年9月16日

英伟达详解NVLink 6多层容错:影子引擎把推理停机从 283 秒压到 7.3 秒

英伟达技术博客称,NVLink 6通过物理层重传、基于信用的流控和多层冗余,为大规模AI工厂提供原生无损网络;在B200 GPU的基准部署中,Dynamo影子引擎恢复将推理停机时间从 283 秒缩短至 7.3 秒。

AI解读:英伟达这篇技术博客的核心不是NVLink 6的带宽又涨了多少,而是它怎么对付大规模AI集群里必然会出现的瞬时错误、链路退化和节点中断。

对训练来说,每块GPU每秒要同步上千次梯度;对推理来说,非计划停机直接减少服务请求量。所以一次丢包、一次链路抖动,都可能让整批任务卡住或让延迟飙高。

英伟达给出的答案是分层兜底:物理层用轻量FEC加物理层重传,链路层用基于信用的流控从设计上消除丢包,再加冗余交换托盘和双管理路径,应用层再用影子进程和CUDA检查点缩短恢复时间。

真正让运维方有感的数字是 283 秒对 7.3 秒。在此之前,NVLink严重中断会让NCCL通信失败,推理引擎得冷重启,重新加载权重、编译内核、捕获CUDA图,耗时数分钟。

这套东西目前主要绑定英伟达自家Vera Rubin NVL72和NVLink Fusion生态。想用第三方XPU接入同一套容错网络的团队,需要走NVLink Fusion,这意味着可选项仍然围绕英伟达的机架级方案展开。

英伟达在开发者技术博客中称,NVLink 6为大规模AI工厂提供多层容错框架,目标是在瞬时错误、链路退化和节点中断无法避免的前提下,保证紧密耦合的训练和推理负载不间断推进。

博客给出的定义很直接:对训练而言,集群里每块GPU每秒要跨数千次集合通信同步梯度;对推理而言,非计划停机直接减少可服务的请求总量,从而限制收入。

英伟达在文中将NVLink 6描述为原生无损网络,称其通过物理层重传、基于信用的流控和主动错误隔离,避免单个丢包拉高推理延迟或打断训练集合通信。

一个被单独列出的数字是:在NVIDIA B200 GPU的基准部署中,NVIDIA Dynamo的影子引擎恢复把推理停机时间从 283 秒降到 7.3 秒。

这些内容来自英伟达技术博客,属于厂商对其自有产品的技术说明和基准数据,尚未提供第三方独立验证。

物理层:用轻量FEC加物理层重传压低丢包

英伟达称,NVLink在物理层直接处理电气噪声和信号退化。在极高信号速率下,噪声导致的比特错误无法避免。

与依赖标准重型FEC算法的通用网络不同,NVLink采用轻量FEC架构,发送端口在数据流中附加纠错码,接收端据此在线重建受损比特,可纠正单比特或多比特错误,延迟代价接近零。

当错误突发超出轻量FEC的纠正能力时,物理层重传(PLR)作为第二道防线启动,在物理层直接重传,不涉及更高层软件栈,英伟达称其可将丢包降至零。

如果严重退化触发物理链路断开事件,UPHY恢复会快速重新校准物理参数,同时数据包被保存在硬件重放缓冲区中,以避免数据丢失。

英伟达据此宣称,NVLink可提供比通用以太网低 3 倍的端到端延迟和 10 倍的数据包速率。

链路层:基于信用的流控对比以太网PFC

在链路层,NVLink使用基于信用的流控(CBFC)。英伟达称,发送方只有在持有信用、确认下一跳有缓冲空间时才会注入数据包,从设计上消除丢包,并避免以太网PFC带来的网络暂停。

英伟达在博客中对比称,标准以太网扩展方案用优先级流控(PFC)和显式拥塞通知(ECN)来近似无损,但这些反应式机制会引入队头阻塞、PFC风暴和死锁等故障模式,使拥塞管理本身成为可靠性风险。

基于确认的方案还需要接收方事后反馈成功或失败,缓冲溢出并需要重传时会增加延迟。

英伟达称,当底层物理链路退化时,链路管理器会自主执行接入链路和干线链路的再平衡,将硬件故障限制在本地,避免级联重传、超时或集合通信停顿。

应用层:1.5 秒软件恢复与秒级控制器迁移

英伟达称,应用层提供软件驱动的事务恢复,执行时间约为 1.5 秒。链路错误发生时,NMX控制器直接与GPU驱动交互,把受影响链路置于“隔离并排空”状态,让硬件自动重新训练退化链路而不损坏数据,同时防止拥塞反压扩散到整个网络。

为消除控制平面单点故障,NVLink SDN控制组件NMX-C使用NMX高可用机制。它托管在某个交换托盘上,如果主主机故障,NMX-C会在数秒内把功能控制器迁移到备用托盘。

英伟达还称,NVLink交换托盘数据平面与运行NVOS的交换管理CPU完全解耦。即使CPU意外复位或操作系统故障,数据平面仍持续转发,NVOS可恢复而不丢包、不中断工作负载。

影子引擎:283 秒到 7.3 秒的恢复差距

英伟达称,在物理层和链路层无法纠正的链路退化偶尔会到达软件栈。在多GPU推理部署中,LLM依赖NVIDIA集合通信库(NCCL)在NVLink网络上快速同步数据。

如果NVLink连接遭遇严重中断,可能导致瞬时通信失败,使NCCL操作失败并迫使活跃LLM引擎中止。过去这需要完全冷重启推理引擎,包括重新加载模型权重到HBM、重新编译内核、重新捕获CUDA图,整个过程可能中断推理服务数分钟,严重影响令牌吞吐。

英伟达的解决方案是Dynamo中的影子引擎恢复。其架构是在活跃推理引擎旁维护一个完全初始化、空闲的副本进程,启动时该备用引擎预先建立自己独立的NCCL和NIXL通信器。

如果硬件故障打断主进程的通信上下文,影子引擎已经拥有绑定到NVLink网络且预热好的健康拓扑,可立即恢复张量并行等分布式操作,无需重建NCCL通信器或重新加载模型权重。

英伟达给出的基准数据是:在B200 GPU部署中,影子引擎恢复把推理停机时间从 283 秒降至 7.3 秒。此外,软件栈集成NCCL弹性支持,可在硬件中断期间动态扩展通信器以适应节点数量变化。

CUDA检查点与机架级维护

英伟达称,CUDA支持配合CRIU的进程级检查点,可对完整LLM工作进程做检查点并在GPU上快速恢复,绕过启动开销。Dynamo Snapshot集成该能力后,启动时间提升一个数量级。

此前这种检查点方法只包含节点本地状态,且必须在创建任何网络连接或CUDA图之前完成。NCCL已引入cuda-checkpoint的原型支持,英伟达预计今年年底正式可用,使多节点检查点能捕获LLM推理引擎启动和加载过程中的几乎全部工作。

在系统层,NCCL感知NVLink拓扑,可动态重建集合通信环或树以绕过故障硬件;CUDA提供更丰富的错误报告,把硬件故障暴露给运行时而不是静默挂起。

交换机管理状态让NVSwitch托盘维护成为针对性操作,管理员可更换单个交换托盘而不排空整个NVLink域或中断活跃AI任务。NVLink还原生支持部分填充的机架,NMX控制器自动发现可用硬件并配置路由。

NVLink Fusion把同一容错栈拓展到第三方XPU

英伟达称,上述容错栈不限于英伟达GPU部署。超大规模厂商和AI原生公司为专用负载构建定制XPU时,也需要同等可靠性。

NVLink Fusion把第三方XPU连接到英伟达AI基础设施,使其继承相同的NVLink扩展网络和多层容错栈。英伟达称这有助于超大规模厂商和AI原生公司提升性能、加快上市时间并集成所需可靠性。

英伟达在文末总结称,评估扩展架构时只比较带宽指标不够,NVLink 6通过整体多层容错方法最大化平均无故障时间。

信息来源