开源量子位·原文 2026年9月21日

清华、无问芯穹等开源具身智能体框架RPent,LIBERO-PRO成功率 92.6%

RPent把通用大模型的规划、VLA专家模型的操作、记忆系统与机器人接口串成闭环,官方称在LIBERO-PRO达到 92.6% 任务成功率,Flash Mode下平均执行时间从 283.6 秒降到 40.9 秒,成功率下降 3.5 个百分点。

AI解读:RPent想解决的是具身智能里的分工问题:让大模型负责理解任务和规划,让VLA等专家模型负责精细动作,再用记忆系统把验证过的经验存下来。这个思路的直接影响是,机器人在任务变化或环境扰动时不必从头重训一个专用策略,而是重新组织已有能力。

对做机器人和具身智能的团队来说,RPent提供的是模块化基础设施,而不是一个端到端模型。用户层、智能层、接口层、环境层的划分,让新增机器人只需接入robots/目录并实现标准接口,上层Agent和工具不用为每台设备重写。

Flash Mode是这次比较实用的部分:它把探索成功的流程压缩成Task Card,执行时优先复用,只在检查失败或环境偏离时才重新调用大模型。官方在LIBERO Object的 200 次评测中称,平均执行时间从 283.6 秒降到 40.9 秒,成功率只降 3.5 个百分点。

不过要注意,这些数字来自官方发布的基准测试和真机演示,是否能在更多机器人、更多真实场景中稳定复现,还需要外部验证。框架已覆盖LIBERO-PRO、RoboCasa、RoboTwin、RoboDojo等仿真环境以及Franka、双臂Franka、YAM、SO101等真实设备,但不同硬件的适配成本仍未公开。

清华大学、无问芯穹、正行创新联合发起的具身智能体基础设施RPent于 2026 年 9 月 21 日开源,代码发布在GitHub的RLinf/RPent仓库。该框架面向真实物理世界,把通用大模型的任务理解与规划能力、VLA等专家模型的精细操作能力,以及记忆、工具和机器人接口连接起来,形成从感知、决策、执行到反馈纠错的闭环。

按照量子位刊载的内容,RPent在LIBERO-PRO基准测试中达到 92.6% 的任务成功率,并将端到端任务完成速度优化 7 倍以上。

RPent由大规模具身强化学习框架RLinf的核心团队打造,其背后算法源于团队于 2026 年 7 月提出的Harness VLA工作。

真机展示的任务与Flash Mode

官方真机视频展示了多个开放式任务:机器人将钢珠倒入碗中、双臂协同擦拭盘子、主动移开遮挡物找到藏在碗下的勺子。量子位称,这些任务并非为每种场景单独训练专用策略,机器人从执行学过的动作转向理解任务、调用能力并根据环境变化调整行动。

例如,当任务变化为将干净餐具放入纸箱时,冻结VLA会把同一只蓝色盘子错误地放入金属篮,而RPent会先观察环境再根据新目标选择放置位置;视觉定位出现偏差时,它会检查结果、排除错误目标并重新定位。

在执行读取瓶身和袋子品牌标签、将不同饮料放入对应袋子的任务时,机器人抓起瓶子后会先小幅试抬确认夹持稳定;原有运动路径不可行时,再调整腕部姿态继续执行。面对被碗遮挡的勺子,机器人会先移开两个碗,让目标重新可见、可达。

探索成功后,RPent会把经过验证的任务逻辑沉淀为任务卡(Task Card);再次执行时可启用Flash Mode,通过任务卡直接复用流程,只根据当前视觉状态做必要调整,避免每一步都重新调用大模型。

  • 真机任务包括倒钢珠入碗、双臂擦盘、移开遮挡物找勺子。
  • 冻结VLA在任务变化时沿用旧动作,RPent会重新观察并调整放置位置。
  • 抓取前小幅试抬确认夹持稳定,路径不可行时调整腕部姿态。
  • Task Card保存任务阶段、动作原语、关键目标与检查条件,不保存固定坐标。

模块化架构与三层接口

RPent采用开放的模块化设计,分为用户层、智能层、接口层和环境层四大层级。用户层提供类似Claude Code/Codex的交互式CLI,以及可选Web Dashboard,用户可下达任务并查看推理过程、视觉输入和动作轨迹。

智能层由Agentic Planner和Action Primitive组成。Agentic Planner结合基础模型、Memory和Tool Library,完成“规划 → 执行 → 反馈 → 记忆更新”的循环;Action Primitive把VLA、WAM等学习型操作模型以及Code as Policy等程序化技能封装为标准工具。

接口层通过MCP、RPC与MHS三层设计把智能决策与物理执行解耦:MCP统一描述可调用能力,RPC连接工具、模型服务与机器人环境,MHS面向更广泛的物理设备提供统一读写与控制抽象。

环境层负责任务执行,目前已支持LIBERO-PRO、RoboCasa、RoboTwin、RoboDojo等仿真环境,以及Franka、双臂Franka、YAM、SO101等真实设备。新增机器人只需作为独立模块接入robots/目录,即可被框架自动识别和调用。

智能层与环境层采用独立进程架构,支持模型服务、机器人控制和仿真环境的独立部署、迁移与重启。

  • 用户层:交互式CLI或Web Dashboard,可查看推理过程与动作轨迹。
  • 智能层:Agentic Planner负责规划,Action Primitive封装VLA、WAM与程序化技能。
  • 接口层:MCP描述能力,RPC连接服务,MHS统一物理设备读写与控制。
  • 环境层:覆盖LIBERO-PRO、RoboCasa、RoboTwin、RoboDojo与Franka、YAM等设备。

Memory的三层结构与扰动测试数据

RPent的Memory系统把经验按复用范围组织为三层记忆,并为记忆记录适用范围、类型、可信度和支撑证据。新经验需要经过验证后才能提高可信度;相互冲突的记录会被保留和隔离,避免偶然成功污染已有能力。

记忆机制中包含Recipe,也就是可迁移的任务方案,而不是某一次执行中的固定坐标。例如系统记录“先根据任务描述和当前画面确认目标,再调整夹爪位置,调用VLA完成抓取,并检查抓取结果”,物体位置改变时智能体重新观察环境,再复用相同逻辑。

探索模式允许更新记忆;评测模式只读使用已经冻结的经验。在LIBERO-Pro Goal实验中,引入记忆机制后,RPent在位置交换任务中的成功率从 31.0% 提升至 87.0%。

RPent支持记忆资产分发,一次探索产生的经验可以同步至其他智能体。

  • 记忆记录适用范围、类型、可信度和支撑证据,新经验需验证后才提高可信度。
  • 冲突记录保留并隔离,避免偶然成功污染已有能力。
  • Recipe记录可迁移的任务方案,不记录某次执行的固定坐标。
  • LIBERO-Pro Goal位置交换任务成功率从 31.0% 提升至 87.0%。

Flash Mode的加速数据与Leaderboard

Flash Mode的核心载体是任务卡。在探索阶段,规划器可以调用大模型、VLA和程序化技能尝试不同动作组合,并将成功且经过验证的任务流程压缩为Task Card。进入Flash Mode后,系统优先按Task Card执行:视觉模块重新定位关键物体,执行模块根据当前状态调整动作;只有在检查失败、环境偏离或流程无法继续时,才重新调用规划器。

在LIBERO Object的 200 次评测中,开启Flash Mode将平均执行时间从 283.6 秒降低至 40.9 秒,在成功率仅下降 3.5 个百分点的情况下实现约 7 倍加速。

RPent推出了Leaderboard板块,展示不同技术路线、不同基座模型的性能与延时对比。性能榜目前展示LIBERO-Pro、LIBERO、RoboCasa365 Target50与RoboTwin;延时榜展示LIBERO-Pro、RoboCasa365与RoboTwin。

根据量子位刊载的数据,在更强调指令变化、布局变化和长程执行的LIBERO-Pro上,RPent/GPT-6 Astra达到 92.63%,比第二名RPent/Opus-4.7的 82.4% 高出 10.23 个百分点,比 π_RLinf的 50.0% 高出 42.63 个百分点。在RoboCasa365 Target50的厨房长程任务中,RPent/GPT-6 Astra达到 59.20%,位列第一,高于RPent/GPT-5.5的 57.1%。其余榜单中,RPent/Opus-4.7在LIBERO达到 96.0%,RPent/GPT-5.5在RoboTwin达到 62.4%。

  • LIBERO Object 200次评测:执行时间从 283.6 秒降至 40.9 秒,成功率下降 3.5 个百分点。
  • LIBERO-Pro:RPent/GPT-6 Astra 92.63%,RPent/Opus-4.7 82.4%,π_RLinf 50.0%。
  • RoboCasa365 Target50:RPent/GPT-6 Astra 59.20%,RPent/GPT-5.5 57.1%。
  • LIBERO:RPent/Opus-4.7 96.0%;RoboTwin:RPent/GPT-5.5 62.4%。

信息来源

量子位原始来源