生数发布世界模型Motus2:让机器人自己预测、打分、改策略
Motus2把行动、预测、评估三种能力放进同一个模型,用自预测和价值反馈更新策略。真机测试中,规划加基于模型的强化学习让基础策略成功率从65%提升到75%;接入触觉模块后,两项任务平均成功率从60%升至72.5%。
AI解读:生数科技发布世界模型Motus2,核心变化是让模型自己形成“生成动作—预测后果—评估结果—更新策略”的闭环。它把行动、预测、评估三种能力放在同一个模型里,而不是当成三个独立模块。
这套闭环想解决的问题很具体:机器人不可能被人示范所有情况,拧歪了灯泡谁来告诉它错在哪、下次怎么改。Motus2用自己预测的后果和打分当作反馈来改策略,团队称这是对递归自我改进(RSI)的初步探索。
对做具身智能的团队来说,更实际的变化在数据。过去失败轨迹大多被当噪声过滤,Motus2把失败轨迹也用来学习“动作会带来什么后果、结果好不好”,成功轨迹提供正向解法。
Motus2还补了触觉和记忆,并部署在单手22自由度的Sharpa Wave、20自由度的WUJI Hand 2上。触觉数据在不同机器人本体之间的迁移仍然困难,开放环境里的长期自主学习也没有实现,这些限制在报道里都写明了。
生数科技发布世界模型Motus2,主打“自进化”:模型在同一个架构里完成行动、预测、评估三件事,并用自己预测和评估出的结果更新自身策略。
据量子位2026年9月12日报道,Motus2的闭环流程是“生成动作→预测后果→评估结果→更新策略”。报道称这是对递归自我改进(Recursive Self-Improvement,简称RSI)的一次初步探索,但明确说明这里的自进化指利用模型自身的预测和价值反馈持续改进策略,不意味着机器人已能在开放环境里无限自主学习。
具体分工上,WAM(世界动作模型)生成动作,回答“接下来做什么”;AC-WM(条件动作世界模型)预测后果,回答“做完会发生什么”;VM(价值模型)评估结果,回答“这个结果好不好”。
为避免模型在做动作前“偷看”执行后的结果,Motus2从机器人领域中间训练阶段开始采用Action-first(动作优先)信息流:先根据当前观测生成动作,再预测动作结果,最后评估结果好坏。
真机测试方面,报道给出两组数字:在手机放置和多指操作两项真机任务中,基础策略平均成功率65%,单独加入规划提升至67.5%,单独加入基于模型的强化学习达到72.5%,两者结合达到75%,比基础策略高10个百分点。
在抽取纸杯、撕纸两项真机任务中,加入轻量级触觉专家模块后,平均成功率从60%提升至72.5%,提升12.5个百分点。
推理时多想几个方案,训练时才真正改策略
Motus2在推理阶段采用Best-of-N规划:模型先产生几个候选动作,分别预测执行后的画面,由价值模型打分,挑分数最高的执行;执行一小段后重新观察真实世界,再进入下一轮。报道称这种做法在强化学习和规划算法里并不新鲜,Dreamer一类的model-based RL方法已验证过“先在脑内模拟、再挑最优动作”,Motus2的新意是把这套逻辑放进原本只用于生成动作的视频-动作大模型,而不是单独训一个轻量级模拟器。
训练阶段,候选动作的打分会转化为策略更新信号:分数高的方案得到更强正向引导,分数低的逐渐被放弃,团队称之为基于模型的强化学习(MBRL)。该阶段只更新动作相关参数,预测和评估部分保持不动,避免反馈信号把已学好的模型带偏。
- 推理规划:一次比较多个候选动作并挑选,优化当次动作选择
- 训练更新:把打分变成策略更新信号,改变模型学到的东西
- MBRL阶段只更新动作相关参数,预测和评估部分不动
失败轨迹不再只当噪声
报道指出,过去具身领域高度依赖“完美轨迹”,失败轨迹大多被当成噪声过滤。在Motus2的闭环中,成功轨迹告知机器人“正向解法”,失败轨迹用于学习动作后果与结果评价,帮助模型识别哪些动作未能推进任务。
其他团队也在探索让机器人从失败中学习。报道提到Physical Intelligence的RECAP会让机器人先跟人学、再自己练习,做错时人可以接管纠正,模型根据执行结果判断哪些动作值得保留、哪些应该少做;Motus2则利用世界模型,让一些候选做法不必在现实中逐个试过,也能先预测后果、打分比较,再用这些反馈改进策略。
- 成功轨迹提供正向解法
- 失败轨迹用于学习动作后果与结果评价
- RECAP依赖人接管纠正,Motus2侧重先用世界模型预测比较
触觉与记忆:补上视觉判断不了的信息
Motus2新增触觉和记忆两块能力。报道称灵巧操作中视觉能看到物体在哪、姿态如何,却很难完整判断机器人与物体之间的接触状态;以撕厨房纸为例,两只手位置看起来正确,不代表纸已被稳稳夹住,接触处是否打滑、受力怎样变化都会影响接下来的动作。
Motus2为此加入一个轻量级触觉专家模块,在短动作片段执行前读取最新触觉反馈,进一步细化动作。报道提到一个务实设计:该模块复用主模型已算出的中间结果,不用每次都重跑完整视频骨干,以兼顾反馈频率和计算开销。
记忆方面,Motus2默认缓存近期的真实观测。在寻找隐藏方块、根据历史提示操作按钮这两项测试中,保留完整历史信息的方案平均成功率达到57.5%,明显高于压缩历史信息的方案。报道同时指出,这组实验不能说明“记忆压缩行不通”,保存完整观测更像找到最终答案之前的阶段性妥协。
报道还提到业内在“记得多”和“跑得快”之间的不同取舍:有的只保留最近一小段观测,有的保留开头和最近画面、把更早的中间过程压缩成简短记忆;物理世界里的记忆问题目前还没有像语言模型上下文窗口或检索机制那样优雅的解法。
- 触觉专家模块在短动作片段执行前读取最新触觉反馈
- 该模块复用主模型中间结果,不重跑完整视频骨干
- 寻找隐藏方块、根据历史提示操作按钮两项测试:完整历史方案平均成功率57.5%,高于压缩历史方案
部署在22自由度与20自由度灵巧手,Ego数据分三步训练
Motus2已部署在单手22自由度的Sharpa Wave、单手20自由度的WUJI Hand 2等平台上,展示了拧灯泡、翻书、多指操作等任务。报道称自由度增加让机器人有更多操作可能,也让学习变复杂:同一个物体可以换着手指抓,接触位置和手指配合稍有变化,后续动作就可能不同。
数据路径上,Motus2把人类第一视角操作经验当成主要数据来源,再逐步迁移到机器人。训练分三步:第一步用单目Ego视频预训练,学习基础的物体和场景变化规律;第二步引入双目视频和人类动作数据,学习更细粒度的手部与物体交互信息;第三步做机器人领域适配训练,靠机器人轨迹和人机对齐数据,把前两步学到的经验迁移到机器人自己的控制空间里。
报道给出的整套Ego数据体系规模约为13万小时人类第一视角数据,配上百小时级的机器人及人机对齐数据。
一组对照实验显示,在同样的目标任务微调流程下,只经过人类Ego数据预训练的模型,五项真机任务平均成功率是51%;加入机器人领域的中间训练之后,成功率跳到84%,提升33个百分点。团队还做了一组数据规模对比实验,把双目数据从2000小时加到20000小时,模型在人类动作预测任务上的验证误差持续下降,没有看到明显天花板。
- 部署平台:单手22自由度的Sharpa Wave、单手20自由度的WUJI Hand 2
- 数据集:约13万小时人类第一视角数据,配百小时级机器人及人机对齐数据
- 五项真机任务:仅Ego预训练平均成功率51%,加入机器人中间训练后84%
- 双目数据从2000小时加到20000小时,人类动作预测验证误差持续下降
L3到L4之间,还差什么
报道提到,李飞飞团队将世界模型分为输出像素的渲染器、输出几何与物理状态的模拟器、输出动作的规划器三类;生数科技把通用世界模型演进路线分为五级:L1生成世界、L2与世界交互、L3在世界中行动、L4自主世界智能体、L5世界组织者。报道称L1-L5不是五类彼此独立的模型,而是一条能力不断累积的路径。
按这套分级,报道认为Motus2已具备L3“在世界中行动”的核心能力:理解当前状态、预测动作后果,并输出真实机器人动作。向L4迈进的关键问题是模型能否利用自身能力参与改进自身,这与RSI思路相呼应。
报道也列出限制:从单次任务中的策略优化,到开放世界中的长期自主学习和持续进化,还有很长的路要走;触觉数据在不同机器人本体之间的迁移还很困难,更长任务中的预测可靠性、长期记忆的效率,以及开放世界里的持续学习,都需要继续探索。
- 生数科技的世界模型分级:L1生成世界、L2与世界交互、L3在世界中行动、L4自主世界智能体、L5世界组织者
- 报道认为Motus2具备L3核心能力
- 未解决项:触觉跨本体迁移、长任务预测可靠性、长期记忆效率、开放世界持续学习
- 项目主页与真机演示:https://motus-robotics.github.io/motus2/
- 论文链接:https://arxiv.org/abs/2608.30237