开源Black Forest Labs / FLUX·原文 2026年9月24日本站收录 2026年9月25日

Black Forest Labs发布FLUX 3 Action:7B开源世界动作模型登顶RoboLab

FLUX 3 Action(F3A)以 38.3% 的成功率在RoboLab基准上超越Cosmos 3 Nano的 36.8%,同时通过引导蒸馏将采样步数压缩到单步,推理速度较Pi0.5提升 1.34 至 2.28 倍。

AI解读:这项工作的核心矛盾在于:现有开源策略要么选世界动作模型(WAM)拿高成功率但付出高昂推理成本,要么选视觉语言动作模型(VLA)图快但成功率低。F3A想同时拿下两边——它仍是WAM,联合预测视频和动作,但骨干网络不到Cosmos 3 Nano的一半,并通过蒸馏去掉了引导步骤,把采样步数降到单步。

速度上的提升有具体数字:在B200 GPU上,Cosmos 3 Nano(FP8)每秒机器人运动需要的处理时间约为Pi0.5(BF16)的 4.7 倍;F3A则比Pi0.5快 1.34 到 2.28 倍。它还能一次预测 2.13 秒的运动,而Pi0.5只有 1.0 秒。引导蒸馏版在延迟不敏感时把成功率推到 42.2% ± 0.36。

对部署方来说,成本差异更直观。纯推理方案GPT 6 Astra在最高推理强度下每个成功任务平均花费 13.47 美元、耗时 16 分钟;F3A单独运行时每成功任务约 0.09 美元、不到两分钟,在H200上还能同时服务另外 47 条rollout。不过它无法解决所有任务。

把推理模型和F3A组合后,90% 的任务可以被解决,每个成功成本降到 8.77 美元、8 分钟,比最佳替代配置便宜 29%、快 40%。代价是纯推理的最高准确率仍然领先,可靠性与成本的权衡依然存在,只是F3A把权衡点往便宜的方向挪了。

Black Forest Labs同时公开了预训练、中训练、微调到推理优化的完整配方和权重。中训练数据混合中,19.55% 来自游戏录像,13.54% 来自带手部姿态标注的第一人称视频,14.03% 来自手持夹爪,15.93% 来自跨 14 种形态的遥操作。游戏动作空间用 64 维表示鼠标和键盘,机器人数据主要用 50 维的EE50空间。

一个值得注意的细节是预训练的作用。不做预训练、纯用DROID动作数据训练时,RoboLab成功率不到 1%;加入视频为主的多模态预训练后跳到 11.6%,随训练缓慢爬升到 12.4%。这说明动作数据本身严重不足,视频预训练提供的表征是必要的。

Black Forest Labs发布了FLUX 3 Action(F3A),一个 7B参数、开放权重的世界动作模型(World Action Model),目标是在机器人动作预测上同时拿到高成功率和低推理延迟。

在RoboLab-120基准上,F3A基础检查点取得 38.3% ± 0.38 的总体成功率,高于Cosmos 3 Nano的 36.8% 和Pi0.5的 28.0%,在表中排第一。引导蒸馏版进一步把成功率推到 42.2% ± 0.36。

F3A仍是世界动作模型——联合预测未来视频和动作——但骨干网络不到Cosmos 3 Nano的一半,并去掉了引导步骤,把采样步数压缩到单步。

速度方面,在B200 GPU上,Cosmos 3 Nano(FP8)每秒机器人运动所需的处理时间约为Pi0.5(BF16)的 4.7 倍。F3A在FP8下比Cosmos 3 Nano快 1.52 到 3.95 倍,比Pi0.5快 1.34 到 2.28 倍(跨消费级、工作站和数据中心GPU)。

F3A单次可预测 2.13 秒的运动,Pi0.5为 1.0 秒。该速度优势以实时因子衡量,而非每次调用的延迟。

Black Forest Labs同时发布了权重和完整报告,涵盖预训练、中训练、微调和推理优化,并分析了快速动作预测与前沿推理模型规划能力组合的混合系统。

RoboLab-120上的成功率和参数对比

RoboLab-120的总体成功率排名:FLUX 3 Action(开源,WAM)42.92%(表中数值,含引导蒸馏版),OASIS WAM(闭源)39.0%,Cosmos3-Nano-Policy(开源,WAM)36.8%,Phoenix(闭源)34.4%,BiMind v0.1(闭源,VLA)33.3%,π0.5(开源,VLA)28.0%,DreamZero(开源,WAM)25.7%,Cosmos3-Edge-Policy(开源,WAM)22.9%,π0-FAST(开源,VLA)15.5%,GR00T N1.6(开源,VLA)7.2%,π0(开源,VLA)5.0%,paligemma-binning(开源,VLA)3.4%。

参数规模:F3A为 7B,Cosmos 3 Nano为 16B,Pi0.5为 3.3B,Cosmos 3 Edge为 4B。F3A的骨干不到Cosmos 3 Nano的一半。

预训练、中训练与动作空间设计

预训练沿用FLUX 3的配方,混合图像、视频和音频数据,其中视频占训练token的 95% 以上。

评估预训练检查点的动作预测能力时,遵循类似Cosmos 3的协议:加入随机初始化的动作头,在DROID上微调,然后在RoboLab上评估。

无预训练时成功率不到 1%;有预训练后跳到 11.6%,继续增长到 12.4%。报告认为这表明纯DROID动作训练受数据严重制约,视频为主的多模态预训练可以克服这一限制。

动作中训练阶段使用混合数据:36.95% 的样本为带音频的视频(占token 39.00%),19.55% 为游戏录像(token 21.85%),13.54% 为带手部姿态标注的第一人称视频(token 13.78%),14.03% 为手持夹爪(token 13.99%),15.93% 为跨 14 种形态的遥操作(token 11.37%)。

游戏动作空间为 64 维:前两维编码鼠标x/y移动,接下来两维编码左右鼠标按键,剩余 60 维编码键盘按键,二值通道在训练中去量化。

多数姿态类数据集使用 50 维的EE50动作空间:前 25 维用于左/主末端执行器,后 25 维用于右/次末端执行器;每 25 维中前三维编码平移,接着六维编码旋转,剩余 16 维编码手部姿态角度或夹爪状态(0 为闭合,1 为张开)。未使用的维度补零。

部分机器人数据集使用 14 维动作空间,F3A直接在 6 个关节状态和 1 个夹爪状态上训练,因为团队没有该形态的正向动力学模型。所有动作数据集的频率在 5 Hz到 30 Hz之间。

EE50空间下,末端执行器姿态相对于锚定帧(最后一个条件帧)表示,手部关节和夹爪值保持绝对值,每个EE50维度按形态特定的z-score归一化。

噪声到信号的转变与时间步分布

扩散和流模型学习反转一个时间索引的前向过程zt = (1−t)x₀ + tε,将数据x₀ 与噪声 ε ∼ N(0,1) 混合。视频和动作两种模态的噪声到信号转变区域可能不同,联合预测时需要考虑两者的相互作用。

报告分别计算视频和动作的x₀ 重建损失,对多个检查点取逐点最小值,得到归一化的最小包络,近似信号噪声剖面。视频的包络呈S形,转变点在 σ(t) = 3.3 或t ≃ 0.964。

团队假设模型容量最好花在信号转变高的区域,因此使用概率密度函数与S形剖面导数成比例的时间步分布。用sigmoid近似得到logit空间的logistic分布(logit-logistic),用高斯CDF近似得到logit-normal分布。

在网格搜索中,除logit-normal和logit-logistic外,还纳入NVIDIA等人 2026 年使用的Waver(mode-sampler)时间步分布。位置参数通过零中心基础分布加移位函数t ↦ αt / (1 + (α−1)t) 构造,α 取 {24, 33, 42},对应视频和动作估计的众数及一个中间值。

另一个参数是动作表示的尺度s。当s > 1 时,破坏动作信号需要更多噪声,动作曲线右移,从而控制两种模态建模的相对关系,相当于在联合流匹配下近似p(m₁, s·m₂) = p(m₁ | s·m₂) p(s·m₂)。

与推理模型混合的成本与效率

报告分析了快速动作预测与前沿推理模型规划能力结合的混合系统。GPT 6 Astra在最高推理强度下能解决Su等人(2026)基准中的全部任务,但单次推理调用每秒机器人运动增加约 35.77 秒,每个成功平均花费 13.47 美元、耗时 16 分钟。

F3A单独运行时每秒机器人运动仅需 21.08 毫秒,在H200 GPU(3 美元/小时)上每个成功花费约 0.09 美元、平均不到两分钟。这两分钟里大部分时间F3A处于空闲,等待机器人运动,理论上还能同时服务另外 47 条rollout而不增加成本。主要缺点是它无法解决所有单个任务。

让推理模型把控制权委托给高效策略、只在需要时介入。在Su等人的设置中,用Pi0.5作为策略时混合方案几乎没有改善:最佳混合每个成功花费 12.28 美元、13.5 分钟,纯推理为 13.47 美元、14 分钟。

改用F3A作为策略后,委托策略开始起作用:混合方案仍解决 90% 的回合(包括纯动作策略无法解决的复杂任务),每个成功成本降至 8.77 美元、8 分钟,比最佳替代配置便宜 29%、快 40%。

纯推理在最高努力下仍达到最高准确率,可靠性与成本的权衡依然存在,但更好的快速策略改变了权衡点的位置。报告称对推理与快速动作预测深度集成的探索还只是第一步,目标是“用尽可能多的推理,且尽可能少”。

FLUX 3 Action的作者提到,快速控制能让具身推理在成本和效率上更优,最高可达每美元成功率提升 53.64%。

信息来源