产品量子位·原文 2026年9月25日

Skild AI发布Messinator:虚拟世界杯自我对弈 140 年,从进球奖励里自己悟出盘带护球

美国具身智能公司Skild AI用S1基础模型加自我对弈,在NVIDIA Isaac Sim虚拟足球场训练人形机器人Messinator。团队只设了一个进球奖励,盘带、护球、抢断、倒地起身都是机器人自己练出来的,随后迁移到真实人形机器人。

AI解读:这条新闻的核心不是机器人会踢球,而是它学踢球的方式:Skild AI只给了“进球得分”一个目标,盘带、护球、抢断、摔倒后爬起来全都没有单独设奖励,机器人是在和旧版本自己的反复比赛里把这些动作练出来的。

真正干活的两部分是Skild Brain和self-play。前者负责控制身体、保持平衡、应对碰撞,后者负责判断下一步怎么做更好。这套组合此前已经用在约 10 万种仿真机器人身体的训练上,如今叠加到足球任务里,把策略迁移到了真实人形机器人身上。

对做机器人学习的人来说,值得注意的边界是:目前公开的是一次演示和技术博客说明,来源没有给出成功率、对抗强度或量产时间表。它证明的是“机器人可以不靠人逐个教动作”,不等于人形机器人马上能上场踢正式比赛。

普通人不需要因此改变什么,但如果你在评估具身智能路线,这条新闻的信号是自我对弈在物理任务上的可行性又往前走了一步,代价是需要大规模仿真环境和足够长的训练时间——文章里的说法是虚拟世界杯踢了 140 年。

Skild AI展示了一台名叫Messinator的人形机器人,穿着阿根廷队服完成带球过人、护球、抢断和射门。这个名字取自梅西(Messi)和《终结者》(Terminator),中文可直译为“梅西终结者”。

据量子位 2026 年 9 月 25 日报道,Messinator的大脑是Skild AI此前推出的旗舰机器人基础模型S1。S1的核心能力是让机器人像大模型一样做“上下文学习”:给它看一段任务示范视频,它把视频当作提示词,理解任务意图并转换成适合自己身体的执行方式,遇到新任务不需要重新训练。

在S1之上,Skild AI加入了强化学习和self-play(自我对弈)。训练环境是用NVIDIA Isaac Sim搭建的虚拟足球场,团队只设定了一个最终目标:进球、拿到高分。盘带、护球、抢断、射门和倒地起身都没有单独设置奖励,机器人的对手是自己此前保存下来的模型版本,赢下来的新策略成为下一轮更难对付的对手。

Skild AI技术博客显示,机器人刚进虚拟球场的前几个月连走路都不利索;等它“长到大学生的年纪”,便自行学会了摔倒后重新站起来。随着对手变强,盘带绕过防守、用身体护球、主动抢断等行为陆续出现,没有工程师规定它必须这样做,它保留这些动作的原因只有一个:能帮自己赢球。

最终的Messinator能走到球前完成射门,也能带球、护球、抢断,并在真人对抗中调整位置和动作。Skild AI的演示想说明的是,机器人不一定都要由人类亲手教会新动作,也可以自己练、自己输、自己总结,再自己变强。

Messinator之前,Skild Brain在 10 万种身体上练过 1000 个仿真年

Messinator延续的是Skild AI更早的技术路线。2025 年 7 月,Skild AI推出跨硬件运行的机器人基础模型Skild Brain,核心主张是“Any robot, any task, one brain”,目标是打破一种身体配一套大脑的行业惯性,让不同形态的机器人执行不同任务时共用一颗大脑。

随后不到两个月,Skild公开了一组omni-bodied训练成果:在仿真世界中生成约 10 万种身体结构各异的机器人,让同一个模型累计训练约 1000 个仿真年。测试阶段,模型要直接接管训练时从未见过的机器人。即使机器人突然断腿、关节锁死、轮子卡住或背上额外负重,模型也不会立刻趴窝,而是根据身体状态在线调整重心和运动方式;部分情况下只需几秒钟就能重新找回平衡,并摸索出新的移动方法。

Skild对这套训练的解释是:机器人见过的身体越多,就越难靠死记硬背过关。为了同时控制 10 万种不同身体,模型只能去理解平衡、关节、重心和动力之间更通用的物理规律,而不是背下某一款机器人的固定步态。

  • Skild Brain 2025年 7 月发布,定位跨硬件机器人基础模型。
  • omni-bodied训练:约 10 万种仿真身体,累计约 1000 个仿真年。
  • 测试时模型直接接管未见过、甚至残缺或负重的机器人身体。

自我对弈不是新故事,但这次发生在物理世界

量子位报道提到,AlphaGo当年正是通过与自己对弈,发现了一些连顶尖棋手都没预料到的下法,并于 2016 年 4:1 击败韩国棋手李世石九段。Messinator走的是同一套self-play方法论,只是场景从棋盘换成了虚拟足球场,并且要把足球策略迁移到真实人形机器人上。

两个创始人的研究方向与这条路线直接相关。Skild AI成立于 2023 年,脱胎于卡内基梅隆大学机器人研究体系,团队成员来自卡内基梅隆大学、斯坦福大学、加州大学伯克利分校等高校,以及Meta、Tesla、NVIDIA、Google、Amazon、Everyday Robotics等机构。

联合创始人兼CEO Deepak Pathak本科毕业于印度理工学院坎普尔校区计算机专业,后在加州大学伯克利分校读计算机博士,师从Alyosha Efros和Trevor Darrell,曾在Meta AI Research工作,并在伯克利与机器人学习专家Pieter Abbeel合作担任访问博士后,此后进入卡内基梅隆大学任机器人研究所和机器学习系教授。他最具代表性的研究之一是“好奇心驱动的探索”,思路是不只依赖人类设计的外部奖励,而是给机器一种内在动力去主动探索陌生现象。这项研究延伸到自监督机器人学习、视觉模仿学习、Sim2Real和自适应控制等方向。创办Skild AI之前,他还联合创立过人脸识别公司VisageMap,该公司后来被FaceFirst收购。

联合创始人兼总裁Abhinav Gupta博士毕业于马里兰大学计算机系,现任卡内基梅隆大学机器人研究所教授,曾参与建立Facebook AI Research匹兹堡实验室并担任研究管理职务,长期研究大规模视觉学习、自监督学习、终身学习、机器人操作和物理常识,是早期“让机器人通过自主交互收集训练数据”路线的重要研究者,曾获斯隆研究奖、PAMI青年研究员奖和IAPR J.K. Aggarwal Prize等奖项。

  • AlphaGo 2016年以 4:1 击败李世石,自我对弈是其关键方法。
  • Skild AI 2023年成立,脱胎于卡内基梅隆大学机器人研究体系。
  • Deepak Pathak研究涉及好奇心驱动探索、自监督机器人学习和Sim2Real。
  • Abhinav Gupta研究涉及自监督学习、终身学习和机器人操作。

信息来源

量子位原始来源