苹果提出TS-DFM:让“能量指南针”引导蒸馏轨迹,8 步学生困惑度低于千步教师
苹果研究团队提出Trajectory-Shaped Discrete Flow Matching,用轻量能量函数在训练中点评估候选续写并选最连贯的一条,认为离散流匹配蒸馏的瓶颈在轨迹质量而非学生容量;170M参数实验中,8 步学生比 1024 步教师困惑度低 32%,速度是后者 128 倍。
AI解读:这项研究的核心判断是:离散流匹配蒸馏效果差,问题多半不在学生模型太小,而在训练轨迹本身不可靠。论文作者在摘要中说,每条训练轨迹都由一连串“盲目的随机跳跃”构成,中间没有对序列质量做评估,早期一个坏决定会一路传播下去,学生只能照抄这个结果。
TS-DFM的做法是在训练阶段的每个中点用一个轻量“能量指南针”给候选续写打分,挑最连贯的那条继续走。关键在于,这种改造只发生在训练时,推理成本不变。对做文本生成落地的人,这意味着不用换采样流程,也可能拿到更好的少步生成质量。
摘要给出的数字很直接:在 170M参数语言模型上,8 步的学生困惑度比 1024 步教师低 32%,速度快 128 倍,且在三种不同规模的评估器和不同源分布下结果一致。作者还称其困惑度优于所比较的离散生成基线,包括用 6 倍数据训练或 5 倍大模型的方法。不过这些结论均来自论文摘要,具体实验设置、评测范围和局限需看全文才能确认。
苹果机器学习研究团队发表论文《Trajectory as the Teacher: Few-Step Discrete Flow Matching via Energy-Navigated Distillation》,提出Trajectory-Shaped Discrete Flow Matching(TS-DFM),针对离散流匹配(Discrete Flow Matching)生成文本需要数百次前向传播的问题,用“能量导航”改造蒸馏训练轨迹。
论文作者包括Amin Karimi Monsefi†、Dominic Culver、Nikhil Bhendawade、Manuel R. Ciosici、Yizhe Zhang、Irina Belousova,其中 † 标注为俄亥俄州立大学,** 表示部分工作完成于苹果。据摘要,论文的核心论点是:当蒸馏出的学生模型表现不佳时,通常被归因于学生容量不足,但作者认为瓶颈是轨迹本身,而非学生。
作者解释,训练轨迹由一连串“盲目的随机跳跃”构建,过程中没有对序列质量进行评估;早期中点的一个错误决定会传播到后续步骤,而学生却必须模仿这一结果。TS-DFM的做法是在每个中点用轻量级“能量指南针”(energy compass)评估候选续写并选择最连贯的一个。论文强调,所有轨迹塑造只发生在训练阶段,推理成本不变。
摘要给出的实验结果为:在 170M参数语言建模上,经过轨迹塑造的学生模型用 8 步达到比 1024 步教师模型低 32% 的困惑度,同时速度快 128 倍;这一提升在不同源分布和三个规模递增的评估器下保持一致。作者还称,TS-DFM在所比较的离散生成基线中取得最佳困惑度,包括用 6 倍数据训练或使用 5 倍大模型的方法。