开源Hugging Face Blog·原文 2026年9月21日

Multiverse用伊辛模型选剪枝块:Llama-3.3-70B砍掉一半深度,MMLU比最强基线高近 23 分

Multiverse Computing在Hugging Face博客发布论文《LLM Compression by Block Removal with Constrained Binary Optimization》,把整块Transformer删除(深度剪枝)的选块问题改写成受约束二值优化,对应到全连接伊辛自旋玻璃,并用开放源代码的tabu求解器求解;在Llama-3.3-70B-Instruct压缩 40/80 块且不重训时,MMLU为 76.9,对比block influence的 54.0。

AI解读:删整块Transformer是让大模型跑得更快最便宜的办法之一,但难在“删哪几块”:一块该不该删,取决于旁边几块删没删。Multiverse Computing把这种交互写成自旋之间的耦合,用伊辛模型来选块,而不是逐块打重要性分。

对真正要压模型的人来说,关键数字是深压缩时的差距。Llama-3.3-70B-Instruct不重训,砍掉 40/80 块(约一半深度)后,CBO的MMLU是 76.9,block influence只剩 54.0;32/80 时是 76.6 对 59.3。压得越浅两者越接近,说明耦合项在砍深了以后才真正起作用。

这套方法还有两个实际好处。Hessian只需在小校准集上前向、反向算一次,之后评估任意候选组合只是一次能量计算,不用跑模型;同一套耦合还能复用于不同的删除块数M,不必每个压缩率重算。

有意思的是最好的模型往往不是能量最低的那个。Llama-3.1-8B-Instruct删 16/32 块时,第 17 个激发态首次提议删靠前的块,轻量重训后在多个基准上反超基态,等于否掉了“最佳剪枝是一段连续的中后层”这个常见假设。

方法本身不假设模型是同构堆叠。作者把它用到交错Mamba2、注意力和MoE层的NVIDIA-Nemotron-3-Nano-30B-A3B-FP8上,删 2 至 3 个MoE层或 2 个注意力层后,在AIME25和GPQA上优于block influence,且没有重训。代码已开源于GitHub。

目前公开的是博客和论文层面的结果,没有给出推理延迟、吞吐或显存占用的具体数字;博客也承认能量只是质量的强代理而非完美代理。要不要换方法,取决于你是否在深度压缩区间、以及是否愿意为求解器多花一点工程成本。

Multiverse Computing在Hugging Face博客发布论文《LLM Compression by Block Removal with Constrained Binary Optimization》,把大语言模型的整块Transformer删除(block removal,也叫depth pruning)中的“选哪些块”改写成受约束二值优化(CBO)问题,并映射为全连接耦合的伊辛自旋玻璃。博客称,该方法在小校准数据集上算一次Hessian后,评估任意候选组合只需一次能量计算,不必运行模型或做基准测试。

论文给出的核心对照结果:Llama-3.3-70B-Instruct在不重训的情况下,删除 40/80 块(约 50% 深度)时,CBO的MMLU为 76.9,最强竞争方法block influence为 54.0;删除 32/80 时CBO为 76.6,block influence为 59.3。原模型为 82.2。

为什么选块不是排序问题

博客认为,多数现有整块删除方法对每块单独打分,再用magnitude、sensitivity或block influence之类的启发式删掉看起来最不重要的块;按物理学的说法这是平均场方法,把每个块的贡献当成与其他块无关。另一种简化做法是只删一段连续的块,问题变小但丢掉大部分搜索空间。

作者主张块与块并不独立:删第 20 块是否伤害模型,取决于是否同时删了第 19 块或第 24 块,这种两两决策之间的交互就是耦合。模型越深、越异构,忽略耦合就越浪费质量,尤其在一次性删很多块时。组合数量随块数指数增长,暴力搜索看似无望,而这正是统计物理工具的适用区间。

把选块变成能量最小化

方法给每个Transformer块一个二值变量:0 表示保留,1 表示删除,相当于自旋朝下或朝上。然后对模型损失做关于这些变量的二阶泰勒展开,得到近似Hessian矩阵:对角项是每块单独的重要性,非对角项正是块与块之间的两两耦合。

于是“该删哪些块”变成一个干净的优化:在恰好删M个块的前提下,找到使能量xᵀH⁰x最小的块集合。数学上是受约束二值优化,物理上是磁化强度守恒(被删块数固定,对应固定总自旋)的全连接伊辛玻璃。博客称其建立的关键性质是:自旋系统的低能态对应表现更好的剪枝模型,最小化能量与最大化基准分数是同一个搜索。

成本方面,Hessian只从小校准数据集的前向和反向传播算一次;之后评估任意候选配置只是一次能量计算,不需要运行真实模型,更不需要跑基准测试。且耦合不依赖压缩目标,同一套Hessian可以复用于多个不同的M值。

求解:能穷举就穷举,不行就交给求解器

对多数模型,构型空间虽大仍可检查:因为算一次能量很便宜,作者在单张GPU上暴力枚举最多数百亿个自旋构型。几百万个只需几秒;博客称最难的可行情形是删Llama-3.3-70B 80块中的 8 块(约 290 亿个构型),耗时约两天。

超过这个规模后精确枚举失效,此时伊辛表述再次发挥作用:将其转成等价的QUBO形式(约束吸收进惩罚项)后,可以交给为这类哈密顿量优化的经典、量子和量子启发式求解器,包括量子退火、QAOA、tabu search和专用分支定界。作者发现,一个开放源代码的tabu求解器能在数秒内可靠达到最低能量状态,即便在能用暴力法核对的最难情形上也是如此。

博客特别指出一点与通常优化目标相反的地方:CBO或退火求解器通常以是否找到真正基态来评判,但这里并不需要基态,只需要快速生成若干好的低能态,这是一个低得多的门槛,也是轻量求解器足够好用、且可以同时跑多个求解器的原因。

低能谱:最好的模型常常不是能量最低那个

能量是质量的强代理但并不完美,因此能量最低的状态不总是最好的模型。作者把这当特性而非缺陷:哈密顿量建好后,读出基态和低激发态几乎不额外花钱,于是得到一批高质量候选剪枝方案,而不是一个脆弱的答案。

一个具体例子:Llama-3.1-8B-Instruct删 16/32 块时,大多数能量靠前的状态都删模型靠后的块,这与既有工作预期一致;但第 17 个激发态首次提议删掉靠近模型开头的一个块,经过轻量重训后,该配置在多个基准上超过基态。博客称这直接否定了“最佳剪枝是一段中后层的连续块”这一常见假设,也说明利用完整的多体结构是有回报的。

跨模型结果与异构架构

在Llama-3.1-8B-Instruct、Qwen3-14B和Llama-3.3-70B-Instruct上,作者称CBO与当前最好的整块删除基线持平或更好,且压缩越激进差距越大。最明确的胜绩是Llama-3.3-70B-Instruct的深度压缩,评估时不重训:删到 24/80 块以内时CBO与block influence大致相当;到 32/80 和 40/80 时明显领先,最深设置下MMLU优势接近 23 分,并在测试的每个基准上都超过基线。Qwen3-14B删 12/40 块时,CBO在MMLU上领先约 10 分。压缩较轻时两者相当,作者认为这符合预期:砍得越深,耦合越重要。

方法不限于同构Transformer。作者把它用到NVIDIA-Nemotron-3-Nano-30B-A3B-FP8——一个以非均匀模式交错Mamba2、注意力和混合专家(MoE)层的混合模型,且不做重训。表述不假设同质堆叠,因此可直接迁移。删 2 至 3 个MoE层或 2 个注意力层时,CBO在AIME25和GPQA上优于block influence,并显示这些混合模型的冗余真实存在但分布不均:有些专家层远比其他的可删,能搜索耦合构型空间正是找到好切法的原因。即便在这里,密集模型上的规律仍成立——最好的配置常常是激发态而非基态。

开源与定位

代码已开源于github.com/CompactifAI/Block_removal_through_constrained_binary_optimization。博客称该方法可与量化、低秩/SVD压缩、宽度剪枝和基于知识蒸馏的修复叠加,属于更大压缩流水线的一部分而非竞争关系。作者表示完整技术细节包括泰勒展开推导、QUBO映射、求解器基准、校准数据集消融和完整结果表,均可在Hugging Face上的论文中查阅。

信息来源

Hugging Face Blog原始来源