Skild AI发布S1机器人基础模型:看一段视频即学新任务,无需重训权重
Skild AI称S1通过上下文学习,从单段视频演示中学会此前未见的长程任务,单步成功率约 66%,对照系统为 9%;公司还称达到 1 亿美元年化营收、10 个月内建立 60 多个部署合作。
AI解读:这条新闻真正的新东西是“不训练也能学新活”。S1不更新权重、不做任务专属后训练,操作员录一段演示视频当作提示,模型自己解析意图、物体和步骤顺序,再映射成机器人动作。对工厂和仓库来说,这意味着换产品、换布局时不必每次都重新采数据、重训、验证。
受益最直接的是产线运营方。Skild称从录演示到硬件自主执行,种盆栽测试只用了 11 分钟;一段短视频示例约等于 380 个实操训练样本,人工收集这些样本要 50 到 100 小时。需要人手示范、样本量大的环节,成本结构会先被改写。
但别把它读成“机器人万能”。S1能做的陌生任务上限约 10 分钟,测试中每个步骤成功率约 66%,对照系统 9%。这是成功率不是任务完成率,长链条任务里每步都掉一点,整体差别很大,目前仍更适合步骤可控、可恢复的场景。
背后是NVIDIA的全栈工具链在托底:Isaac Sim和Isaac Lab做仿真与强化学习,Cosmos把视频转成结构化描述并扩增数据,TensorRT优化推理。双方还在联合开发GPU加速的物理接触求解器,将并入Newton开放给开发者。
商业信号同样明确:Skild称首个商用部署 10 个月后达到 1 亿美元年化营收,已有 60 多个部署合作,覆盖制造、物流、巡检、安防、食品制备等。与NVIDIA、富士康在Blackwell系统双臂装配上的落地,说明这套模型正在从实验室走向真实产线。
Skild AI发布了机器人基础模型S1,主打从单段视频演示中学习此前未见过的长程任务。该模型于上周发布,以视频作为输入来理解并执行任务,过程中不更新权重,也不做任务专属后训练——这种方法被称为上下文学习(in-context learning)。
Skild在NVIDIA AI基础设施上构建并研究了S1,这属于双方更广泛合作的一部分,范围覆盖合成数据生成、模型训练、仿真和真实世界物理AI部署。两家公司称正合作把可适应的机器人智能从实验室推向工厂等动态运行环境。
Skild AI联合创始人兼CEO Deepak Pathak表示:“通过经验学习、而非预先编程,是机器人领域已经发生的阶跃式变化。NVIDIA Isaac Lab和NVIDIA Cosmos技术帮助Skild创造出其机器人所需的大规模、多样化经验,以便跨多种场景和本体学习。”
这一发布正值该公司在首次商用部署 10 个月后达到 1 亿美元年化营收。Skild称在此期间已建立 60 多个部署合作,工作覆盖制造、物流、巡检、安防、食品制备及其他应用。
一段视频替代重训:S1如何学新任务
多数工业机器人是为固定工作设计的,因此每出现一个新产品、新工艺或新布局,就需要更多数据、重新训练和验证。S1采用不同方式:操作员录下目标任务视频,作为提示提供给模型。模型解析演示的意图、物体和序列,再将其映射为机器人面前的行动——无需重新训练,而且往往针对预训练数据集未覆盖的任务。
S1能执行时长最长约 10 分钟的陌生任务,包括种盆栽、做煎饼、手冲咖啡和套件组装。这些任务可跨越数十个操作步骤,要求机器人以此前未执行过的顺序组合技能。
在一项种盆栽测试中,Skild AI团队从录制演示到硬件上的自主执行仅用 11 分钟。该模型还能在物体移动时作出调整、从错误中恢复,并以未经显式编程的顺序组合技能。
在Skild对全新多步骤任务的测试中,其S1机器人每一步成功约 66% 的时间,而同类AI系统为 9%——提升超过七倍。Skild还估计,向机器人展示一段简短视频示例,其效果可能相当于给它约 380 个实操训练样本;人工收集这些样本可能需 50 到 100 小时。
从演示到产线:富士康装配场景与NVIDIA工具链
S1让操作员直接演示新任务,无需为每次变化准备新数据集或训练运行,从而打破机器人因新因素而不断重训的循环。在客户协议允许的情况下,Skild商业部署中的经验可反哺更广泛的模型,并帮助加速未来的部署。
相关工作已在工厂车间展开。Skild、NVIDIA和富士康正在为NVIDIA Blackwell系统的高精度装配,将Skild Brain部署到双臂机械臂上。在一个演示工作流中,机器人安装母线和限位块、拧紧 16 颗螺丝,并在多步骤任务中适应扰动。这项工作需要精确运动、接触感知控制、序列跟踪,以及当场景与计划不同时的恢复能力。
NVIDIA加速计算为Skild提供了规模,使其能利用仿真、人类视频、遥操作,以及在允许情况下的部署数据训练共享机器人大脑。NVIDIA Cosmos开放世界基础模型帮助多样化训练数据,并把视频转成结构化描述;Cosmos Curator帮助大规模标注、过滤和组织数据。
Skild广泛使用NVIDIA开放仿真框架,在真实世界部署前训练和验证其机器人大脑。NVIDIA Omniverse库和NVIDIA Isaac Sim框架提供基于物理的虚拟环境,用于生成数据、测试边界情况和验证行为。Skild还在Isaac Lab这一开放模块化机器人学习框架中通过强化学习增强其大脑技能。在Newton物理引擎支持下,Isaac Lab帮助Skild工程师准确建模力、接触、碰撞和压力等多种物理参数,并缩小仿真到现实的差距。
Skild和NVIDIA还在联合开发新的GPU加速仿真求解器,以快速、准确地建模机器人如何物理接触、抓取和操作固体物体。这些求解器很快将作为Newton的一部分提供给所有开发者。随着模型走向生产,NVIDIA Nsight工具帮助工程师发现训练期间的性能瓶颈,NVIDIA TensorRT软件开发套件优化推理,使机器人能在物理世界中快速响应。这些技术将数据、仿真、训练和部署阶段连接起来,而非将其视为彼此分离的系统。