Google DeepMind发布Dream-RSI:让AI智能体靠“复盘梦境”优化搜索策略
该方法不更换底层模型,只用存储的搜索历史回放数千种替代策略,在基因组计算任务中把平均运行时间从 3587 毫秒降至 2931 毫秒,尝试次数从 550 降到 317。
AI解读:Dream-RSI解决的是一个很具体的问题:智能体在解复杂任务时,该先试哪个方向、什么时候放弃,这类“探索决策”过去只能靠固定规则或真金白银地反复跑。现在它把一次搜索的过程和结果全存下来,用回放来检验“如果当时选另一条路会怎样”,省掉了重新调用模型和评估器的开销。
最直接的受益者是需要大量试错的场景,比如写更快的统计程序、优化GPU内核。在基因组和金融常用的统计计算任务上,Dream-RSI生成的程序比sklearn和glmnet更快;与另一套系统SimpleTES相比,它用了 317 次尝试,而对方需要 51200 次。
它只改搜索策略,不动生成答案的模型。对使用Gemini接口的开发者来说,这意味着同样的模型可能因为外挂了一套会学习的搜索策略,就跑出更高的成功率或更低的计算成本。但要注意,回放只能检验已探索过的路径,不会凭空发现全新解法。
一个反直觉的发现是:把历史经验写成明确指令告诉智能体“该往哪搜”,效果反而更差。研究者认为指令太具体会把搜索空间收窄。这也让Dream-RSI和Google Research的WikiSkill走向不同方向,后者正是把成败记录成可复用的指令。
这项研究加入了递归自我改进的讨论热潮,背景是Anthropic CEO Dario Amodei近期对AI研究速度的警告。不过现有测试限于八项任务和摘要给出的指标,是否在更开放、更长期的任务上同样有效,公开信息还不足以判断。
Google和DeepMind的研究团队提出了一种叫Dream-RSI的方法,让AI智能体在完成一次搜索后,回放已经记录下来的搜索过程,用来测试不同的决策策略,而不必重新运行昂贵的模型或评估器。研究者把这一过程称为“做梦”。
在方法上,Dream-RSI不改变生成答案的底层人工智能模型,只改变智能体如何搜索。每次搜索时,智能体会把尝试过的路径和对应结果记录成一棵搜索树。后续测试新策略时,它直接在这棵树上回放,检查“如果当时先尝试另一种方案、或者提前放弃某条路,结果会怎样”,因此可以测试数千种替代策略而无需再次调用模型或评估器。
研究团队用Gemini 3.1 Pro和Gemini 3.7 Flash在三个领域的八项任务上测试了该方法,每一组对比都使用相同初始条件但固定搜索策略的基线。
在一项要求写出尽可能快的统计计算程序的任务中——这类计算常用于基因组学和金融领域——Dream-RSI生成的程序在全部六个测试数据集上都比现有库sklearn和glmnet更快。使用Gemini 3.1 Pro时,平均运行时间从 3587 毫秒降到 2931 毫秒,尝试次数从 550 次降到 317 次。
与另一套名为SimpleTES的系统相比,对方需要 51200 次运行,Dream-RSI只用了 317 次尝试。研究观察到一个模式:学习到的策略起初会减少尝试次数,当进展停滞时又会增加搜索力度。
在数学优化任务和编写高效GPU内核的任务上,表现出类似规律:结果相当或更好,计算成本低得多。两项GPU任务中,Dream-RSI在性能持平的情况下把运行次数最多减少了 2.43 倍;另外两项任务中,在相同预算内性能最高提升到 2.09 倍。
把历史搜索当沙盘,而不是重跑一遍
研究团队提出的做法是,复用一次已完成搜索的数据,在智能体已经探索过的空间内测试替代策略。智能体在搜索过程中记录下自己的尝试和结果,这些记录之后可以用来回放当时的决策。
研究者用在一个陌生区域找路的经历做比喻:第一次去的时候会走进死胡同、折返、费劲找路;一旦脑子里有了地图,就可以不用再走一遍每个地方,直接规划另一条路线。Dream-RSI把同样的原则套用到记录下来的搜索历史上。
系统在回放时并不会凭空发明全新的解法,只是在已记录的搜索树内部测试不同决策。因为所有结果都已经存在,智能体不需要重新生成或评估解决方案,避开了实时运行所需的高昂计算。
整个过程是一个循环:每次搜索结束后,智能体用记录的结果测试更好的策略,再把改进后的版本用到下一次实时搜索中。在这个循环中,只有搜索策略在变,生成解决方案的模型始终不动。
明确指令反而限制探索
在后续分析中,研究者测试了另一种利用搜索历史的方式:不拿历史记录回放测试策略,而是把历史浓缩成指令,直接告诉智能体该去搜索哪里。
在一项GPU任务上,带这类指令的版本反而比不带的版本表现更差。研究者认为,过于具体的指示会把搜索空间收窄得太多,妨碍智能体探索更广泛的方法。
同一项分析还展示了学习到的策略如何调整力度:随着性能提升,它起初减少尝试次数;当进展停滞时,它再次增加搜索努力,而这与后续的收益提升相吻合。
研究者已经在GitHub上公开了代码和更多细节。
- 带明确搜索指令的版本在一项GPU任务上表现差于不带指令的版本。
- 研究者推测原因是指令太具体会过度收窄搜索空间。
- 学习到的策略会随进展调整尝试次数:先降后升。
- 代码和更多细节已在GitHub公开。
与AlphaEvolve等工作的位置关系
递归自我改进最近受到越来越多关注。Anthropic CEO Dario Amodei近期对AI研究速度发出警告,这一领域的发展是背景之一。
Google DeepMind在 2025 年推出了AlphaEvolve,使用了相同的基本原则:Gemini Flash生成代码提案,Gemini Pro进行分析,进化算法选出最好的版本。Dream-RSI工作在比这更高一层的位置,它优化的是搜索策略本身。
AutoTTS采用了相关思路,用一个编码智能体在模拟环境中搜索算法。这些算法决定语言模型应该在什么时候开始、扩展还是放弃推理路径,由此得到的方法在更少计算量下击败了手工设计的方法。
Google Research最近展示了另一种复用过去运行的思路WikiSkill,把失败和成功记录在一个wiki里,转化成智能体可以复用的指令。Dream-RSI的后续分析则提示,这类明确指令在开放式搜索任务上可能会限制探索。
Meta在Hyperagents上走得更远,允许智能体重写控制自身改进方式的机制。