开源量子位·原文 2026年9月24日

清华大学与无问芯穹开源具身智能云原生平台RLark

平台已完成3个集群、近百个云边端节点的统一纳管,覆盖4种型号具身设备;设备纳管从小时级缩短至约5分钟,任务提交后10秒内可启动运行。

AI解读:RLark要解决的是机器人实验里的重复劳动:设备一台台接、任务分别部署、云端和现场反复配网,出了问题还得逐项排查。它把这些收进一个云原生平台,让机器人、相机和云端GPU进入同一套资源体系,按一项完整任务来组织。

对做真机实验的团队,直接的收益是准备时间从小时级压到约5分钟纳管,任务提交后10秒内启动,而且接入配置后续任务可以复用。这改变的是实验节奏:以前大量时间花在环境搭建和程序部署上,现在换设备、调角色规模只需改一份配置。

它和普通机器人调度平台的差别在跨地域。实测中广东云端GPU集群与北京机器人现场被连成一条链路,连续跑约36分钟、推进323个全局训练步骤,完成采集—训练—真机验证闭环。通信上,受限网络下大包单流吞吐较测试所用VPN方案提升约49%,高带宽环境下接近2Gbps。

目前公开的纳管规模是3个集群、近百个云边端节点、4种型号具身设备,设备适配和芯片适配还在完善中。平台代码、API和后端服务已整体开源,适合已经有真机集群、正在被部署和排查工作拖慢的团队先试。

清华大学与无问芯穹共同打造并开源了面向具身智能的云原生纳管平台RLark,平台以自研具身设备运行时(embodied-runtime)和任务级跨集群网络互联技术为核心。

根据量子位获授权转载的无问芯穹文章,RLark将云端算力、边缘节点和具身设备纳入统一资源体系,以一项完整任务为单位组织运行;运维人员通过一行命令即可接入并统一管理设备,研究人员通过一份任务配置即可将训练、推理和真机交互程序部署到不同集群。

已实现5分钟纳管设备、10秒内启动任务

文章称,RLark目前已完成3个集群、近百个云边端节点的统一纳管,覆盖4种型号的具身设备。设备纳管从传统的1小时缩短至约5分钟;在资源已接入且具备运行条件的测试环境下,任务提交后10秒内即可在平台侧启动。

RLark将从用户界面、API、后端服务,到任务编排、跨集群互联和具身设备运行时的整套能力开放出来。开源地址为github.com/RLinf/RLark,项目文档位于rlark.readthedocs.io。

  • 纳管规模:3个集群、近百个云边端节点、4种型号具身设备
  • 设备纳管:从小时级(1小时)降至约5分钟
  • 任务启动:提交后10秒内启动(资源已接入且具备运行条件的测试环境)

广东云端与北京现场的跨地域实测:36分钟、323个训练步骤

团队将RLark与强化学习基础设施框架RLinf结合,在广东云端GPU集群与北京机器人现场之间完成了一次跨地域真机实测。现场设备负责交互和数据采集,云端GPU承担训练计算,训练得到的策略再用于后续真机交互;RLark负责设备申请、跨集群部署、任务实例互联与运行状态汇集,RLinf负责训练计算与数据协作。

实验准备阶段,云端GPU集群与现场设备所在集群接入RLark,各集群Agent同步节点容量、资源信息与运行状态;随后通过具身设备运行时接入已适配的双臂机器人与相机,将真实硬件注册为任务可申请、可调度的资源。研究人员用一份任务配置定义训练、推理和真机交互等执行角色,声明各角色所需资源、实例数量与部署位置。

任务启动后,现场机器人与相机持续产生交互数据并回传云端,由RLinf用于训练,更新后的策略再用于后续真机交互。本次实验连续运行约36分钟,训练推进至323个全局训练步骤(global step),跑通了设备申请、跨集群调度、真机数据回传、云端训练和策略更新全链路。文章称,后续更换设备、调整角色规模或算法参数时,可以直接修改并复用任务配置。

  • 实验地点:广东云端GPU集群与北京机器人现场
  • 实验时长:连续运行约36分钟,推进323个全局训练步骤
  • 验证目标:设备申请、跨集群调度、真机数据回传、云端训练、策略更新全链路

通信专项测试:大包单流吞吐较VPN方案提升约49%

RLark结合虚拟寻址、gVisor用户态网络栈与SSH安全隧道,为分布在云端和现场的执行实例建立通信通道,由平台统一维护路由、隧道与转发关系。其做法是将执行实例的通信地址与实际部署位置解耦:平台为实例分配虚拟地址,通过TUN虚拟网络接口接收流量,由gVisor用户态网络栈处理,再经SSH安全隧道转发至对端。

在此基础上,RLinf对流量进行本地化适配,将观测数据处理、推理与真机交互等环节组织在边缘侧,高频交互和原始数据处理就近完成,再通过RLark提供的跨集群通道回传训练所需数据、下发更新后的策略,以减少原始观测数据全量回传带来的带宽开销。

针对任务级跨集群网络互联的专项测试显示:在受限网络环境下,RLark的大包单流吞吐较测试所用VPN方案提升约49%,小包单流吞吐提升约14%;在高带宽环境下,大包单流吞吐接近2Gbps。文章称,与传统的EasyTier方案对比,RLark显著减少了跨地域真机任务运行过程中因网络传输造成的卡顿。

  • 受限网络:大包单流吞吐较测试所用VPN方案提升约49%,小包单流吞吐提升约14%
  • 高带宽环境:大包单流吞吐接近2Gbps
  • 通信机制:虚拟地址、TUN虚拟网络接口、gVisor用户态网络栈、SSH安全隧道,通过通信域组织互联范围并结合成员关系与证书认证

架构与后续方向

RLark采用控制面与数据面分离的架构。控制面统一维护资源信息、任务配置与通信关系,各集群中的Agent负责本地任务部署、资源同步与状态回传;用户通过Web控制台、API或命令行工具(CLI)管理资源、提交任务。

任务编排上,RLark用Job、Task和Worker三层模型描述一项具身实验:Job代表整项任务,Task描述训练、推理、真机交互等执行角色,Worker是实际承担这些角色的执行实例。具有阶段依赖的流程可以通过Workflow组织多个Job。运行观测方面,平台将Job、Task、Worker与相关节点、设备、事件和日志关联,用户可沿“任务—角色—执行实例”逐层排查,并提供Web Terminal与TensorBoard入口。

RLark与RLinf协同相关的技术论文为发表在RSS 2026的《RLinf-USER: A Unified and Extensible System for Real-World Online Policy Learning in Embodied AI》(arxiv.org/abs/2602.07837)。文章称,RLark后续将继续完善设备与芯片适配、轻量运行时、跨域通信、任务异常恢复和实验配置复用,并欢迎机器人及芯片厂商参与设备适配、算法团队分享数据采集训练和验证场景、基础设施开发者参与任务编排与网络运行观测能力建设。

  • 管理入口:Web控制台、API、CLI
  • 任务模型:Job、Task、Worker三层,阶段依赖流程通过Workflow组织
  • 后续方向:设备与芯片适配、轻量运行时、跨域通信、任务异常恢复、实验配置复用
  • 来源说明:本文依据无问芯穹提供、量子位获授权转载的文章整理

信息来源

量子位原始来源