研究Apple Machine Learning Research·原文 2026年9月17日本站收录 2026年9月18日

苹果发布REVERSAL-BENCH:用可逆性参数 ρ 量化无重置强化学习的崩溃悬崖

苹果研究团队提出用连续参数 ρ∈[0,1] 控制环境可逆性,并配套一个重置预言机(reset oracle)验证状态可恢复性;在五种物理引擎、八类操作任务中,无重置智能体随 ρ 升高被永久“吸收”进不可恢复状态,而回合制智能体保持稳定学习。

AI解读:这条新闻的核心不是又一个强化学习基准,而是一个被量化出来的失败模式:当环境不可逆时,依赖“无外部重置”训练的智能体可能一旦踩错就永远卡死,学习直接停摆。苹果团队把这个现象命名为“可逆性悬崖”(reversibility cliff)。

对做机器人和操作任务的人来说,这意味着“不用重置就能持续训练”这个目标有硬边界。现实里把物体推下桌、撒了颗粒物都没法撤销,而现有无重置框架默认环境是可逆的,所以问题不在算法调参,而在假设本身不成立。

基准的价值在于把可逆性变成一个可调旋钮 ρ。团队还提供了重置预言机,用来判断某个状态到底能不能恢复。这给研究者一个可复现的方式,去区分“任务太难”和“环境本身不可逆”这两个经常被混为一谈的失败原因。

他们同时评估了一个安全护盾,能在不可逆失败发生前介入。结果显示可恢复性可以被较准确地预测,但真正主动恢复只在智能体能物理上避开陷阱时才有效——预测得准,不等于救得回来。

苹果机器学习研究团队发布REVERSAL-BENCH,一个通过连续参数 ρ∈[0,1] 控制环境可逆性的强化学习基准,并配套提供重置预言机(reset oracle)——一种真值验证机制,用于测试状态可恢复性。

该基准覆盖五种物理引擎中的八类操作(manipulation)设置。团队用其评估了广泛的策略架构,包括标准actor-critic算法、安全强化学习(safe RL)以及专门的无重置(reset-free)框架。

评估结果显示出一条“可逆性悬崖”(reversibility cliff):随着 ρ 升高,无重置智能体持续被吸收进不可恢复状态(irrecoverable states),而回合制(episodic)智能体则维持稳定学习。团队称,这一失败模式在多种无重置基线和受限强化学习(constrained RL)中均可见到。

由于无重置智能体缺乏外部重置,任何进入不可恢复状态的转移都会导致永久吸收,智能体被困其中,进一步学习随之停止。团队表示,这种吸收现象在学习到的操作策略下的完整物理仿真中持续存在。

通过对比几何结构相同的可逆版本环境,团队确认这一崩溃是由不可逆性因果驱动的,而非障碍物复杂度所致。

团队发布了基准套件、一个标注了可恢复性的大型多仿真器数据集,以及重置预言机。他们还评估了一个在不可逆失败发生前介入的安全护盾,结果显示可恢复性可被准确预测,但主动恢复主要在智能体能物理上避开陷阱时才成功。

信息来源