研究量子位·原文 2026年9月14日

深度机智发布PhysBrain 1.5:28项基准综合72.5分居开源首位,开源2B/8B权重

据量子位报道,深度机智2026年9月9日发布物理基座模型PhysBrain 1.5,在28项公开基准上取得72.5综合均分,位列参评开源模型第一,与GPT-6 Astra(73.3)、Gemini 3.6 Flash(73.0)差距在1分以内;技术报告、2B与8B权重、评测工具包全部开源。

AI解读:PhysBrain 1.5最直接的意义是把“物理基座模型”这条路线摆到了可比较的位置:它以72.5分排在参评开源模型第一,和GPT-6 Astra的73.3、Gemini 3.6 Flash的73.0只差不到1分。据量子位报道,这一成绩来自28项公开基准的五大能力维度,而不是单项刷分。

受影响最直接的是做具身智能的开发者。8B版本给出性能上限,2B版本在官方规则中仅作参考、不参与开源排名,但66.6分的成绩超过表中其他非PhysBrain开源参评模型,包括30A3B的Hy-Embodied-VLM-1.0(66.0)、8B的Embodied-R1.5(64.9)和9B的RynnBrain 1.1(63.1)。这意味着低参数规模也能保留相当完整的具身理解能力,试用和部署门槛更低。

报道同时给出了这条路线仍受限制的证据。Robocurve的实验显示,GPT-6 Astra在“积木放入碗”任务20次完成19次,但换成“蓝色拼图块对位插入凹槽”的毫米级精细任务,成功率从95%掉到10%。这说明通用理解能跨越“看懂”到粗动作,精细接触和精准插入仍是瓶颈,PhysBrain 1.5的能力同样要放在这一行业限制下理解。

PhysBrain 1.5的开源范围包括技术报告、2B与8B模型权重和评测工具包,项目页、Hugging Face和GitHub均已给出入口。报道称上线3天获得超过3k下载量。对真正要动手的团队来说,权重和评测工具同时开放,比只有一个榜单名次更有用,因为可以在同一套基准上验证是否适配自己的任务。

技术路线方面,深度机智把物理智能描述为“观察—理解—判断—执行—反馈修正”的Physical Loop,并把具身理解、动作生成、未来状态预测放进同一套训练框架:模型可输出结构化空间坐标与轨迹目标,可生成下一步动作序列,并可预测1秒后的RGB图像、深度图和机器人掩码。报道称动作能力不绑定特定机器人形态和控制频率,无需为每台机器单独训练,但这些能力对精细任务的实际效果仍待外部验证。

据量子位2026年9月14日报道,深度机智于2026年9月9日正式发布物理基座模型PhysBrain 1.5,在28项公开基准上取得72.5的综合均分,位居参评开源模型首位。

同一组数据中,GPT-6 Astra为73.3分,Gemini 3.6 Flash为73.0分,PhysBrain 1.5与两者的差距收窄到1分以内。

PhysBrain 1.5-8B在28项基准中的14项取得开源最佳,10项位列开源模型第二。报道称,相较当前最强开源对手Hy-Embodied-VLM-1.0(66.0)高出约6.5分,较RynnBrain 1.1(63.1)高出9.4分。

评测怎么做的:28项基准、五大能力维度与分项成绩

评估PhysBrain 1.5的是一组28项公开基准,按五大能力维度组织:视觉空间感知、空间与多视角理解、具身认知与规划、空间指向与可供性、视觉轨迹推理。

报道给出的分项成绩包括:RoboSpatial-Home空间理解73.9分,Part-Affordance可操作部位识别84.0分,RoboRefit视觉目标定位89.8分。原文称这些成绩覆盖感知、空间、推理、规划与定位。

  • 综合均分:PhysBrain 1.5-8B为72.5,参评开源模型第一
  • 对比闭源:GPT-6 Astra 73.3、Gemini 3.6 Flash 73.0
  • 对比开源:Hy-Embodied-VLM-1.0 66.0、Embodied-R1.5 64.9、RynnBrain 1.1 63.1

2B版本与开源内容:权重、评测工具包和下载数据

深度机智同步开放PhysBrain 1.5-2B与PhysBrain 1.5-8B两档参数规模。在项目页公布的同一套28项测试中,2B版本取得66.6分。

报道称,按照官方评测规则,2B版本仅作为参考,不参与开源排名;但若只比较数值,它已超过表中所有其他非PhysBrain开源参评模型。

PhysBrain 1.5全面开源,开放内容包括技术报告、2B与8B模型权重、评测工具包。项目页、Hugging Face集合页和GitHub评测工具包地址均在报道中给出。

报道称,上线仅3天,PhysBrain 1.5获得超过3k的下载量。

  • 2B:66.6分,超Hy-Embodied-VLM-1.0(66.0)、Embodied-R1.5(64.9)、RynnBrain 1.1(63.1)
  • 开源物料:技术报告、2B与8B权重、评测工具包
  • 下载:上线3天超过3k
  • Demo:Hugging Face Spaces在线可测

Physical Loop与三项能力:理解、动作生成、未来状态预测

深度机智把物理智能描述为一个循环:观察世界、理解空间与任务、判断动作后果、执行,再依据新的观察修正下一步,称为Physical Loop。PhysBrain 1.5将原本分散在不同模型里的这五步能力组织进同一个基座模型。

具体做法是,基于开源基础模型,把语言回答、空间坐标、动作轨迹、未来画面与深度预测纳入同一套训练框架,不单独搭建模块或设计专门输出层。

具身理解方面,模型保留VLM图像与视频理解接口,训练数据覆盖五大能力,输出除语言描述外还包括结构化空间坐标与轨迹目标。

动作生成方面,模型通过Human-as-Humanoid管线从人类视频中学习手腕运动方式,给定当前画面、任务指令和动作历史,直接生成接下来一系列动作步骤。报道称这套动作能力不绑定特定机器人形态与不同控制频率。

未来状态预测方面,给定当前画面与任务指令后,模型可预测1秒后的物理状态,同时输出RGB图像、深度图和机器人掩码三种模态。

  • 同一基座内三项能力互为输入、互相约束
  • 报道称这是从“拼装专用模块”走向“训练统一基座”
  • 人类交互视频被纳入预训练监督,原文称物理感知的预训练监督完全来自人类交互视频

人类数据与本体:Ego360、Human-as-Humanoid和Prime U

报道称,深度机智构建了Ego360人类全景真实数据体系,通过全景视频记录任务执行时的周围环境,并同步保留全身姿态、手部运动与任务级语音。

Human-as-Humanoid框架负责把人类行为数据从“可观看的记录”转化为“可训练的资源”。在此前研究中,这条转换链路延伸到自研的60自由度拟人体机器人Prime U:报道称原始示范吞吐量达到传统遥操作的4.8至7.2倍,并在部分任务上实现从人类数据到真机执行的零样本迁移。

报道还提到时间线:2025年10月10日深度机智发布《源于人,超越人》技术路线图;2026年3月27日PhysBrain 1.0在中关村论坛发布;2026年9月9日PhysBrain 1.5跟进。

  • Ego360:全景视频+全身姿态+手部运动+任务级语音
  • Human-as-Humanoid:连接人类数据与动作模型
  • Prime U:60自由度,部分任务零样本迁移
  • 迭代节奏:PhysBrain 1.0(2026年3月27日)到1.5(2026年9月9日)

对照实验与限制:粗动作可用,精细任务仍掉到10%

报道引用Robocurve的一次实验:将GPT-6 Astra部署在真实机械臂上,在20次“积木放入碗”任务中完成19次,而Claude Fable 5.1完成8次。

同一套测试的另一面是,在“蓝色拼图块对位插入凹槽”这种毫米级精细任务上,GPT-6 Astra的成功率从95%掉到10%。报道由此指出,顶尖大语言模型在具身操作上仍有鸿沟,通用理解可以跨越“看懂”到“粗动作”,却仍在“精细接触、精准插入”面前止步。

报道称,这一精细操作局限正是全行业共同的瓶颈,也是后来者的机会窗口。

  • 积木放入碗:GPT-6 Astra 19/20,Claude Fable 5.1 8/20
  • 毫米级对位插入:GPT-6 Astra成功率由95%降至10%
  • 原文判断:物理智能需要专门的基础模型,仅靠语言模型通用能力不足

信息来源

量子位原始来源