苹果提出DACA-GRPO:给扩散语言模型的去噪过程做信用分配
苹果研究团队针对扩散语言模型强化学习中的两个缺陷,提出轻量级即插即用增强方法DACA-GRPO,在七个基准上取得最高 36.3 个百分点的提升。
AI解读:扩散语言模型的强化学习一直有个尴尬:去噪几十步,每一步都被当成同等重要。苹果研究者指出这等于不给时间维度上的信用分配,同时现有方法依赖有偏、高方差的似然估计。
DACA-GRPO用两个机制补上这两块:去噪进度分数从中间预测里抽取每个token的重要性权重,不增加额外前向计算;分层掩码似然把token位置分层,让每个token在预测时能看到大部分序列作为上下文。
它是即插即用的增强,叠在三种GRPO基线方法上,在数学推理、代码生成、约束满足等七个基准上都有提升。对做扩散LLM后训练的人有用,但它仍是研究阶段的方法,摘要未给出推理成本、训练时长等工程数据。
苹果机器学习研究团队发表论文,提出面向扩散语言模型的强化学习增强方法DACA-GRPO(Denoising-Aware Credit Assignment for GRPO)。作者包括Amin Karimi Monsefi、Dominic Culver、Nikhil Bhendawade、Lokesh Boominathan、Manuel R. Ciosici、Yizhe Zhang、Irina Belousova,其中Monsefi与Culver为同等贡献,Monsefi标注俄亥俄州立大学,论文相关工作在苹果期间完成。
论文指出,扩散大语言模型是自回归模型的有力替代方案,但现有面向扩散模型的强化学习方法有两个根本弱点:一是把去噪轨迹中的所有去噪步骤同等对待,缺少时间维度上的信用分配;二是策略优化所用的平均场似然估计存在系统性偏差,且方差高。
DACA-GRPO被描述为一种轻量、即插即用的增强,可叠加到任何GRPO风格的训练器上。它包含两个互补机制。第一是去噪进度分数(Denoising Progress Scores),从中间预测中抽取每个token的重要性权重,论文称不产生额外前向计算成本。第二是分层掩码似然(Stratified Masking Likelihood),把token位置划分成若干层,使每个token在预测时以序列的大部分内容作为上下文,从而降低平均场偏差。
论文称,把DACA-GRPO叠加在三种GRPO基线方法之上后,在覆盖数学推理、代码生成、约束满足和受限生成的七个基准上取得一致提升,具体增益最高为:数学推理 5.6 个百分点,代码生成 7.4 个百分点,约束满足 36.3 个百分点,JSON schema遵守率 5.9 个百分点。
上述信息来自论文摘要(含作者列表),摘要未披露具体基准名称、基线方法细节、模型规模、训练与推理成本,也未给出与自回归模型对比的结论。