研究The Decoder AI·原文 2026年9月12日

GPT-6 Astra在早期机器人基准测试中展现空间推理「阶跃式」提升

在StationeryBench机器人基准测试中,GPT-6 Astra控制双臂YAM机器人完成 7/100 项桌面任务,Ai2的MolmoAct2完成 0 项;Astra进度中位分 46 对 12。康奈尔大学研究员Yoav Artzi称其为空间推理的「阶跃式变化」。

AI解读:这项新闻的核心不是「GPT-6会控制机器人了」,而是它在空间推理上可能出现了真正的断层式进步。在StationeryBench这个专门测试桌面物体操作的机器人基准里,GPT-6 Astra控制同一套双臂YAM机器人完成了 200 次试验,最终完整完成 7% 的任务;对比之下,Ai2的MolmoAct2一项都没完成,中位进度分只有 12,而Astra是 46。

对做机器人学习和具身智能的人来说,这个差异值得认真对待:两项测试用的是同一批机器人,模型控制的对象和任务都一样,所以分数差距更可能来自模型对空间关系的理解,而不是硬件条件。康奈尔大学和Google DeepMind的研究员Yoav Artzi直接称其为「空间推理的阶跃式变化」。

不过证据目前还停留在早期基准阶段。Astra的 7% 完成率本身并不高,Artzi也指出,即使在尚未公开的REMAP基准上Astra接近人类水平,「在其他场景里,ASTRA也还达不到人类的程度」。他推测OpenAI用大量 3D数据(比如Blender场景)训练了模型,这与Astra在 3D任务上的明显提升方向一致,但这是推测,不是OpenAI确认的训练细节。想复现或检验的人,目前可以在GitHub上找到全部结果、视频和代码。

根据The Decoder 2026年 9 月 12 日的报道,一个新的机器人基准测试StationeryBench显示,OpenAI的GPT-6 Astra在空间推理上相比竞品出现明显提升。

该基准涵盖五项桌面物体任务,包括打开马克笔、倒出回形针,以及让两支机械臂传递一把尺子。GPT-6 Astra和Ai2的MolmoAct2分别控制同一套双臂YAM机器人,各进行 200 次试验。

结果显示,Astra在 100 项任务中完整完成了 7 项,MolmoAct2完成 0 项。Astra的进度中位分为 46 分(满分 100),MolmoAct2为 12 分。所有结果、视频和代码已发布在GitHub上。

康奈尔大学和Google DeepMind的AI研究员Yoav Artzi称Astra是「空间推理的一次阶跃式变化」。在尚未公开发表的REMAP基准上,GPT-Astra的准确率接近人类水平。

但Artzi也指出,「即使ASTRA在其他场景中也达不到人类的表现」。他推测OpenAI使用大量 3D数据(如Blender场景)训练了该模型,这与Astra在 3D任务上的特别提升相符。

报道同时提到,OpenAI有长期计划打造自己的消费级机器人。

信息来源

The Decoder AI原始来源