研究The Decoder AI·原文 2026年10月4日

谷歌提出RRSI:约束自改进AI智能体的测试记忆,在未见基准上最多提升4.7分

一篇新论文显示,让语言模型反复改写智能体外壳会让它在训练任务上得分上升、在新任务上收益缩水;谷歌研究者提出的RRSI在优化循环两端加约束,训练增益变小但迁移到未见基准,并比未正则化版本少用约30%的token。

AI解读:论文指出,近期智能体进展很大一部分来自对外壳(harness)的改进,而非新模型。较新的自动化方法让语言模型根据测试任务的反馈反复重写外壳,研究者称这是一种实用形式的递归自我改进。

这种自我优化有代价:智能体反复在同一小组测试任务上工作,会记住它们。训练任务分数上升,但在新的未见任务上的增益缩小甚至消失;论文列举的原因包括搜索记住了只适配某个基准的模式、偏好纯靠运气得高分的候选、以及堆叠没有让智能体变好只是抬高测试分的多余复杂度。

RRSI在两个环节加约束:提出新改动时,预算限制一个候选能捆绑多少处独立编辑,且预算随时间缩小;早期允许较大改写,后期只允许能清楚追溯到结果的小改动。系统还会记录早期尝试,避免重复追逐失败思路;当进展停滞时,它有意尝试尚未触碰的外壳部分。

挑选改动时,一个批评者会审查每个提案,丢弃硬编码任务名、答案或其他基准特定技巧的改动;另一条规则只接受能带来可测量性能提升的更高计算开销,不再有用的组件会被移除。

在覆盖编程、智能体办公工作和工程设计的八个基准上,底层模型Claude Opus 4.8全程冻结。按论文,RRSI在训练任务上最多提升14.1分,在五个从未见过的基准上最多提升4.7分,运行时比未正则化版本少用约30%的token;在未见基准上表现从未低于基线。

作者指出,研究只覆盖围绕冻结模型构建的外壳,不涉及模型权重改变的情况;结论是,只有当反复反馈转化为持久改变时,自我改进才会让AI智能体可靠地更有能力。代码已在GitHub发布。

谷歌研究者在一篇新论文中提出RRSI(Regularized Recursive Self-Improvement of Agent Harnesses),用来缓解自改进AI智能体记住测试任务的问题。据The Decoder报道,该方法在训练任务上提升最多14.1分,在五个未见基准上提升最多4.7分,运行时比未正则化版本少用约30%的token。

论文称,自动化自我优化会让智能体在有限的测试任务上得分上升,但新任务上的增益缩小或消失。RRSI在优化循环两端加约束,试图让优化后的外壳更通用。

自动化改写外壳为何会记住测试

论文指出,外壳决定智能体在修改文件前是否读取了正确文件、能否从错误中恢复、能否干净地交付结果。近期智能体进展很大一部分来自对外壳的改进,而非新模型。

直到最近,外壳改进多由人工完成:人们检查失败的运行,手动修补外壳。较新的方法把这个循环自动化,让语言模型根据测试任务的反馈反复重写外壳。研究者称这是一种实用形式的递归自我改进:系统产生反馈,用于优化外壳,而外壳又控制该系统的自身行为。

这种自我优化的代价在论文中被明确:因为智能体一直处理同一小组有限测试任务,它最终会记住它们。训练任务分数上升,新任务收益减少或消失。研究者列出几种发生方式:搜索记住了只适配某个基准的模式;偏好纯靠运气得高分的候选;堆叠不必要复杂度,抬高测试分却不提升能力。其他方法大多主要提升训练任务,很少迁移到未见基准。

  • 外壳控制智能体是否读对文件、能否纠错、能否干净交付结果。
  • 论文称近期智能体很多进展来自外壳改进,而非新模型。
  • 自动化循环让语言模型依据测试反馈反复重写外壳,研究者称之为实用形式的递归自我改进。
  • 自我优化导致训练任务分数上升,新任务收益缩小或消失。
  • 原因包括:记住单一基准模式、偏好靠运气的高分候选、堆叠抬高测试分的多余复杂度。

RRSI如何限制编辑与选择

RRSI在优化循环两端工作,同时保持外壳完全可编辑。当系统提出新改动时,预算限制一个候选能同时捆绑多少处独立编辑,且该预算随时间缩小:早期轮次允许较大改写,后期轮次只允许能清楚追溯到结果的小改动。系统还记录早期尝试,避免反复追逐同一失败思路;当进展停滞时,它有意尝试外壳中尚未触碰的部分。

在选择哪些改动永久进入外壳时,一个批评者审查每个提案,丢弃硬编码任务名、答案或其他基准特定技巧的改动。另一条规则只接受能带来可测量性能提升的更高计算开销,不再有用的组件会被移除。论文称,这些护栏正是为了产生这种权衡。

  • 提出改动时,预算限制一个候选捆绑多少独立编辑,且预算随时间缩小。
  • 早期允许较大改写,后期只允许可清楚追溯到结果的小改动。
  • 系统记录早期尝试,避免重复失败思路;停滞时尝试未触碰过的外壳部分。
  • 批评者丢弃硬编码任务名、答案或基准特定技巧的提案。
  • 只有带来可测量性能提升的更高计算开销才被接受,失效组件被移除。

八个基准上的结果与适用边界

研究者在覆盖编程、智能体办公工作和工程设计的八个基准上测试RRSI,底层模型Claude Opus 4.8全程冻结。团队把RRSI与未修改的基线外壳以及四种近期优化方法比较。按论文,RRSI在训练任务上最多提升14.1分,在五个从未见过的基准上最多提升4.7分,运行时比未正则化版本少用约30%的token。论文称,在未见基准上总体表现从未低于基线,而记住任务的外壳通常会出现下降。RRSI外壳也在训练集之外的每个任务上都有提升,其中JobBench上提升最大,为4.7分。

论文称,所有方法在训练任务上都表现良好,但在新任务上结果反转,有两种方法甚至低于基线外壳。RRSI在变体中训练增益最小,却是唯一在未见任务上明显高于基线的方法。在优化过的外壳中,RRSI需要最少token和步骤,在新任务上表现最好,不过未修改的基线外壳更精简。

论文还提到一个跨模型结果:用Gemini 3.5 Flash优化的编程外壳,在没有修改的情况下,把弱得多的Gemini 3.1 Flash Lite的准确率从11.2提升到14.6分。作者认为系统找到的机制不依赖发现它们的模型能力。作者也指出,研究只覆盖围绕冻结模型构建的外壳,不涉及模型权重改变的情况。

  • 测试覆盖八个基准:编程、智能体办公工作、工程设计;底层模型Claude Opus 4.8冻结。
  • RRSI训练任务最多提升14.1分,五个未见基准最多提升4.7分,比未正则化版本少用约30%的token。
  • 未见基准上表现从未低于基线;RRSI是唯一在未见任务上明显高于基线的方法,训练增益却是变体中最小的。
  • 在优化过的外壳中,RRSI需要最少token和步骤,但未修改的基线外壳更精简。
  • 用Gemini 3.5 Flash优化的编程外壳,把Gemini 3.1 Flash Lite准确率从11.2提升到14.6分。
  • 作者称研究只覆盖冻结模型的外壳,不涉及模型权重改变的情况。

信息来源

The Decoder AI原始来源