研究量子位·原文 2026年9月26日

美梦空间发布物理世界动作模型Physical-WAM与物理漂移评测基准RoboTwin-Phys

索辰科技战略投资的美梦空间在第五届全球数字贸易博览会首发两项成果:具备物理感知能力的Physical-WAM模型,以及新增13类物理扰动的RoboTwin-Phys评测基准,后者发布即开源。

AI解读:美梦空间这次补的是机器人训练里最缺的一环:物理交互数据。抓取、推拨、按压这类有效样本必须来自真实或高保真仿真的接触过程,采集周期长、硬件损耗高,而且不同机器人本体之间数据还很难迁移,可用样本只有百万量级,和文本图像领域的数十亿级别差着数万倍。Physical-WAM的做法是在感知输入和动作输出之间插一层“物理Token”,让模型不只预测下一帧画面,还能显式估计摩擦、重量、重心这些看不到的物理量。

对做具身智能的团队来说,更实际的变化是评测终于有了专用标尺。RoboTwin-Phys在原有基准上加了13类真实世界常见的物理扰动,覆盖物体属性、接触属性、阻尼、任务环境和相机配置五个维度,并且发布即开源,代码、数据集和排行榜全部开放。它按“物理属性推断准不准、扰动下任务还成不成、性能差距上界在哪”三层递进打分,能把“状态识别错了”和“识别对了但动作没跟上”区分开。

不过这两个成果的边界要说清楚:来源没有给出Physical-WAM的具体评测成绩或落地客户,物理Token的表达粒度、跨本体迁移效率、仿真保真度天花板都还是美梦空间自己列出的待解问题。世界模型本身也没有统一的技术定义。对普通读者,这条新闻暂时不需要行动;真正相关的是做机器人操作、VLA模型和物理仿真的团队——如果RoboTwin-Phys被用起来,他们能第一次用可控、可复现的物理扰动来定位模型失败在哪一步。

2026年9月26日,杭州美梦空间科技有限公司(Memo)在第五届全球数字贸易博览会首发首秀主舞台上,首次公开并正式发布Physical-WAM物理-世界动作模型和RoboTwin-Phys物理漂移评测基准两项成果。美梦空间CEO李明昊在主舞台介绍了这两项成果。

据量子位获授权转载的文章,Physical-WAM被描述为“全球首个具备物理感知能力的物理-世界动作模型”,RoboTwin-Phys被描述为“业内首个物理漂移评测基准”,且发布即开源,项目代码、数据集与排行榜全部开放,支持第三方验证复现。

Physical-WAM:在感知与动作之间插入物理Token

文章称,传统世界模型的中间表征是像素或隐空间向量,可以推演物理世界的演化,但无法感知物理本身——知道“下一帧画面会变成什么样”,却不知道“为什么会变成这样”。Physical-WAM的架构核心是在感知信号输入和动作输出链路之间插入一层“物理Token”表征,基于可观测数据与深层物理数据训练,能在真实任务中实时觉察物理变化,并预判动作后果、实时修正行为。

Physical-WAM由PhysLens、PhysDream、PhysAct三个模块构成,形成“感知→预测→生成→修正”的反馈链条。PhysLens从多模态感知信号中提取摩擦、重量、重心、接触状态等不可直接观测的物理信息,输出统一的物理Token表征;PhysDream结合当前物理表征、环境状态和候选动作推演未来物理状态,预测打滑、脱手等风险并给出不确定性评估;PhysAct负责物理条件化动作生成,把物理属性与未来状态预测引入动作生成,在环境发生物理漂移时自动调整执行策略。

文章给出的示例是:机器人抓握纸杯时,PhysLens识别出纸杯材质的低刚度特性,PhysDream预测注水后负载增加可能导致杯壁形变或滑脱,PhysAct据此调整抓握力度和接触位置,在注水过程中持续修正策略,直至完成操作。

  • 美梦空间由北京大学信息技术高等研究院高文院士领衔的AVS先进视觉系统研究中心孵化,专注世界模型的研发与应用。
  • 2026年8月,物理AI企业索辰科技(688507.SH)完成对美梦空间独家种子轮战略投资,双方在数据、算力、物理AI等技术层面协同,共同推进世界模型研发与产业应用落地。

RoboTwin-Phys:新增13类物理扰动,发布即开源

文章称,现有具身智能评测基准测量的是“任务完成度”而非“物理适应度”,模型可以在固定摩擦系数、固定物体质量的标准测试集上刷出高分,却对物理参数扰动缺乏鲁棒性。例如同等推力下,高摩擦的罐子原地倾倒,低摩擦的罐子直接滑飞;夹持擀面杖同一位置,重心偏移就会引发杆体摆动。

RoboTwin-Phys在RoboTwin的基础上新增13类真实世界常见的物理扰动因素,覆盖物体属性、接触属性、阻尼、任务环境、相机配置五大维度,支持单因素扰动到多因素组合扰动测评,遵循“物理属性推断准不准、物理扰动下任务还成不成、性能差距的上界在哪里”三层递进逻辑。

其工程价值主要有三点:提供物理真值,包括物理值、接触力日志、物体运动学数据和失败时间线,使评测不只回答“成没成功”,还能追问“模型是否估计对了、何时开始失败”;固定种子配对评估,让不同模型面对相同扰动实例,减少运气成分;按推断准确性、扰动下任务成功率、性能上界逐层递进,区分“物理状态识别错了”和“识别对了但动作策略没跟上”。

  • RoboTwin-Phys发布即开源,项目代码、数据集与排行榜全部开放,支持第三方验证复现。
  • 文章称该基准为业内首个以物理因素扰动为核心评测对象的机器人操作基准,把现实中抽象的物理参数转化为可控、可标记、可复现的变量。

被引用的评测背景与美梦空间列出的待解问题

文章引用了两项外部研究作为VLA模型局限的证据:北大与BeingBeyond联合发布的BeTTER基准(ECCV 2026)显示,最先进的VLA模型在标准静态测试中表现尚可,一旦引入空间布局偏移或时序外推等干预,成功率断崖式下跌;另一项斯坦福大学研究称,在接触丰富任务中,VLA存在“精度失效”与“力失效”两个相互独立的失效模式。文章同时称机器人可用的真实物理交互样本仅维持在百万量级,与文本图像领域数十亿级别的数据体量存在数万级别的落差。

文章称“世界模型”仍是尚未收敛的概念,学术界至今没有统一的技术定义。文章引用毕马威2026年7月发布的《跨越奇点:世界模型如何重塑具身智能产业与商业新范式》报告,将其分为表征式、生成式、交互式以及理解-生成-预测一体化世界模型四类。

文章列出美梦空间自身待解的边界问题:物理Token的粒度边界在哪,摩擦、质量、重心是高度抽象的参数,真实接触中还存在表面粗糙度的各向异性、材料的非线性弹性行为、接触面积的动态变化;跨本体的物理迁移效率如何,同一个物体,二指夹爪和灵巧手抓取所需的动作策略不同,物理参数到动作的映射高度依赖末端执行器的形态与动力学特性;仿真物理的保真度天花板在哪,PhysDream的推演精度受限于仿真引擎的物理保真度和真实传感器的噪声水平。

美梦空间称下一步路线将围绕“视觉先行,力触声递进”持续迭代多模态物理表征模型,扩充物理交互数据集,优化模型推理延迟与多本体适配能力,并联合产业链上下游补齐物理数据、世界模型、评测标准三块拼图。

  • 本文由美梦空间提供,量子位获授权转载,观点归原作者所有。
  • 量子位文章发布于2026年9月26日19:49。

信息来源

量子位原始来源