英伟达Groq 3 LPX靠确定性执行降低电压裕量,预计每兆瓦吞吐量达GB200 NVL72的 35 倍
英伟达技术博客详解Groq 3 LPX如何利用编译期生成的周期级调度预测电流需求,通过预判性供电和时钟周期合成缩小电压安全裕量,内部测试电压跌落减少超 60%,预计功耗降低低双位数百分比。
AI解读:英伟达把Groq 3 LPX定位为Vera Rubin平台里负责高交互低延迟推理的加速器,核心卖点不是峰值算力,而是省电。做法是先让编译器把整个负载排成精确到时钟周期的执行表,再根据这张表预判电流何时飙升,提前调整供电电压、拉长电流飙升最猛的时钟周期,最终缩小芯片必须预留的电压安全裕量。
对AI工厂来说,省电就是省钱或换吞吐。英伟达称内部测试中电压跌落减少 >60%,预计基准电压可降低高个位数百分比,功耗因与电压平方成正比可降低低双位数百分比。代价是一套需要重新设计的编译流程和供电电路,只对LPX机架内 256 颗LPU生效。
普通读者不需要现在做什么。真正要留意的是 2026 年下半年,英伟达宣称届时将Groq 3 LPX与Vera Rubin NVL72配对,在 2T+参数模型长上下文高交互场景下,每兆瓦吞吐量可达上一代GB200 NVL72的 35 倍。
英伟达在技术博客中解释,Vera Rubin平台新增的Groq 3 LPX加速器依靠确定性执行模型,在AI负载运行前生成精确到时钟周期的调度表,并据此预判每个周期的电流需求,从而提前调整供电电压、拉长电流飙升最猛的时钟周期,缩小芯片为应对电压跌落而必须预留的电压安全裕量。
英伟达称,内部测试显示该方法让电压跌落减少超过 60%,预计使电气系统必须持续提供给AI负载的基准电压降低高个位数百分比;因功耗与电压平方成正比,功耗降低幅度可达低双位数百分比。该技术随Groq 3 LPX于 2026 年下半年进入Vera Rubin平台。
电压安全裕量为什么白费电
AI芯片运行时,矩阵乘法和向量乘法会在纳秒级时间内引发大量晶体管开关,芯片电流需求骤升。芯片从最近的去耦电容(decaps)抽取额外电流,导致电压下降。板上的电压调节器因电感无法瞬时响应,等它追上需求后电压才恢复。这种暂时电压下降称为电压跌落(voltage droop),幅度取决于电流变化量和di/dt(电流变化率)。
所有芯片都有最低工作电压Vmin,低于此值会出错。为应对最坏情况,芯片通常运行在带有电压安全裕量的电压下,确保瞬态条件下仍能获得所需最低电压。英伟达指出,大部分时间提供此裕量的功耗实际上是多余的,而且功耗与电压平方成正比,持续多供 10% 电压意味着多耗 21% 功率。
- 电压跌落由电流需求骤增引起,去耦电容放电导致电压下降,电压调节器因电感无法瞬时补偿。
- di/dt越大电压跌落越大,同样电流变化在更长时间内发生则di/dt更小,跌落更小。
- 电压安全裕量是为防止电压跌破Vmin而预留的额外电压,多数时间属于浪费。
- 电压持续多 10% 导致功耗多 21%。
Groq 3 LPX如何提前知道电流何时飙升
Groq 3 LPX的确定性执行模型让LPU编译器在负载运行前生成一份周期精确的调度表,规定每份数据何时移动到哪个计算单元、操作精确到时钟周期执行。该调度覆盖机架内全部 256 颗LPU芯片。
每颗LPU加速器包含少量专用硬件:MXM负责矩阵乘法、VXM负责向量操作、SXM负责转置和重塑,并有硬件将这些计算单元同步到时钟周期级。内存为片上SRAM bank,无需层级管理。LPU之间直接相连,无需中介,数据传输时间更可预测。确定性将这些硬件元素绑定:每次运行中,单次计算、内存读取和芯片间通信都需要相同的时钟周期数。编译器利用这一点规划数据在计算单元间的移动,并提前解决资源冲突,例如两个硬件元素写同一内存bank。
- 编译器在运行前生成周期精确调度,涵盖操作和数据移动。
- LPU计算单元包括MXM(矩阵乘)、VXM(向量操作)、SXM(转置/重塑),硬件同步到时钟周期级。
- 每颗芯片有片上SRAM bank,无层级结构;LPU直接互连,无中介。
- 确定性保证每次运行时计算、内存读取、芯片间通信消耗相同周期数。
- 编译器可提前解决资源冲突,如两个硬件元素写同一内存bank。
预判性供电和时钟周期合成如何缩小电压裕量
周期精确调度表还能生成负载随时间变化的电流需求曲线。编译器知道电流何时上升和下降,据此提前准备供电系统,并通过互补的PEP和CPS技术塑造最剧烈的需求变化。
PEP(Preemptive Power,预判性供电)让芯片命令供电网络(PDN)改变输出电压。因为编译器知道电流会在哪个周期飙升,它可以提前调度该命令,使供给电压在需求到来前已开始变化。去耦电容需要弥补的缺口变小,电流上升时芯片电压下降更少。
CPS(Clock Period Synthesis,时钟周期合成)让编译器调度单个时钟周期缩短或延长,这依赖Groq 3 LPX的准同步时钟系统(plesiosynchronous clock system),保持芯片间和芯片内计算单元同步。CPS对最剧烈的电流变化控制比PEP更细:电流飙升最猛的时钟周期可被拉长,降低di/dt。
- PEP提前命令供电网络改变电压,使供电电压在电流需求到来前开始调整。
- CPS可拉长电流飙升最猛的时钟周期,降低di/dt。
- 准同步时钟系统保持芯片间和芯片内计算单元同步,使逐周期调度成为可能。
省电效果和平台定位
英伟达称,内部测试中Groq 3 LPX系统电压跌落减少超过 60%。公司估计这将使电气系统必须持续提供给AI负载的基准电压降低高个位数百分比,功耗因与电压平方成正比可降低低双位数百分比,且不影响负载。相比规格类似的非确定性系统,Groq 3 LPX的确定性执行可将同一负载的功耗降低潜在低双位数百分比。
Groq 3 LPX于 2026 年下半年将确定性功耗控制带入英伟达Vera Rubin平台,与工厂层面的NVIDIA DSX MaxLPS和Vera Rubin NVL72机架内的Intelligent Power Smoothing互补。英伟达称,在平台层面,Groq 3 LPX与Vera Rubin NVL72配对,在 2T+参数模型长上下文高交互场景下,每兆瓦吞吐量可达上一代NVIDIA GB200 NVL72的 35 倍。
- 内部测试电压跌落减少超 60%,预计基准电压降低高个位数百分比,功耗降低低双位数百分比。
- Groq 3 LPX将于 2026 年下半年进入Vera Rubin平台。
- Vera Rubin NVL72配合Groq 3 LPX在 2T+参数模型长上下文高交互场景下,每兆瓦吞吐量可达GB200 NVL72的 35 倍。