研究Apple Machine Learning Research·原文 2026年10月1日本站收录 2026年10月2日

苹果论文提出RLTL;DR:让模型在失败后自己写“一句话教训”,突破零成功率学习障碍

苹果研究团队发布RLTL;DR方法:在每次失败后让策略模型根据验证器输出写下一条TL;DR式洞察,后续尝试以此为条件,并通过反向传播将“任务→洞察”映射内化。在Pass@128=0 的工具调用与编程数据集上,GRPO训练Pass@1 停留在 0%–1%,而RLTL;DR在有洞察上下文时达到 14%–31%,评估时无洞察上下文为 12%–13%。

AI解读:苹果这篇论文针对的是一个现实训练困局:如果模型在一道题上反复尝试都失败,RLVR没有成功样本可以优化,也没有老师模型或标准答案可以蒸馏,训练就会停在 0% 附近。RLTL;DR的做法是每次失败后把验证器的输出给模型看,让它自己写一条TL;DR式教训,下一次尝试带着这条教训再试。

关键不只是“多试几次”,而是让模型把“这类任务该记住什么”内化下来。论文通过反向传播让模型直接学习任务到洞察的映射,评估时即使上下文里没有洞察,Pass@1 仍有 12%–13%,而标准GRPO在同类数据集上只有 0%–1%。

更有意思的是FTL;DR消融:只训练 4k条(任务, 洞察)元组、完全不展示也不反向传播rollout,就能恢复到接近RLTL;DR和经典全量rollout SFT的性能。这暗示一种紧凑训练范式:不必海量试错,直接教模型‘遇到这类任务,心里记着这么一条’。

这项研究目前是论文层面的结果,测试对象是Qwen 3.5 9B Thinking策略,数据集限定在Pass@128=0 的困难工具调用和编程任务。它证明的是自我生成反馈在特定条件下能突破学习障碍,而不是通用推理或所有任务上的普适提升。

苹果机器学习研究团队发表论文,提出一种名为RLTL;DR的自我改进训练方法。论文作者包括Michael Kirchhof、Eleonora Gualdoni、Andrew Szot、Khashayar Gatmiry、Aryo Lotfi、Abbas Kazerouni、Omar Attia、Sanjoy Chowdhury、Alexander Toshev。

论文针对“带可验证奖励的强化学习”(RLVR)在自我改进场景中的局限:常规做法是让智能体对同一任务多次尝试,然后向成功样本优化。当任务难到成功率极低甚至为零,且没有教师模型或示例解答可蒸馏时,这一范式就会失效。

RLTL;DR的流程是:每次失败后,把验证器的输出展示给策略模型,让它自己写一条TL;DR洞察作为反馈。下一次rollout以之前所有洞察为条件,依次采样直到找到解。论文同时允许对上下文中的洞察做反向传播,从而内化出“任务→洞察”的直接映射。

在筛选为Pass@128=0 的困难工具调用和编程数据集上,用标准GRPO训练Qwen 3.5 9B Thinking策略,Pass@1 始终停留在 0% 到 1%。RLTL;DR突破了这一学习瓶颈:训练时洞察在上下文中,Pass@1 达到 14%–31%;评估时上下文中没有洞察,Pass@1 为 12%–13%。

论文指出关键在于“任务→洞察”的内化。为深入研究,作者将方法简化为SFTL;DR:只用(任务, 洞察)元组训练,不展示也不反向传播任何rollout。仅用 4k条这样的元组训练,就恢复了接近RLTL;DR和经典全量rollout SFT的性能。

论文描述这是一种有前景的紧凑训练范式,形式为“面对这类任务,记住这类东西”,并希望启发后续研究。

信息来源