产品量子位·原文 2026年9月17日

罗福莉官宣小米强化学习路线,MiMo-V2.6训练现场直播每小时烧3万美元

小米公开MiMo-V2.6的Flash与Pro两款模型强化学习训练过程,36小时花费超108万美元;罗福莉称过去半年只研究了一件事:强化学习能扩展到多远。

AI解读:小米这次把强化学习训练的全过程放到网页上直播:花了多少钱、跑多少步、奖励曲线变化、哪个节点显卡故障,都能查。训练1天多,两款模型已经烧掉超过108万美元,平均每小时3万美元。

真正值得看的不是烧钱,而是小米选择公开一条路线:预训练Scaling靠数据、参数和算力,强化学习能不能用同样思路扩大规模。罗福莉给出的答案是从训练计算量、环境与执行框架、评分计算量三个方向同时扩展。

对做Agent和强化学习的人来说,公布的细节比“直播”更有用:每个Step约处理20亿Token,1568个Prompt×16条Rollout,系统完全异步执行,代码、通用、视觉、Chat任务可混在同一次RL Run里训练。

评分环节是容易被忽略的成本大头。Agent一条轨迹可能走几十步,最后只给一句成败,模型很难知道哪一步有用;小米提到Agentic In-group Credit Assignment,但没有公布具体算法。

围观者目前能拿到的效果有限:Pro的dynsam/avg@n从约0.565升到0.614,Flash从约0.514升到0.603;DeepSWE v1.1离线评测中Pro和Flash分别为62.24和60.77,对比DeepSeek-Flash v1.1的74.2%。训练还在初期,Pro因为单Step更慢,最新评分尚未更新。

小米新模型的强化学习训练被放到了网页上直播。2026年9月17日,量子位报道称,在该页面上,训练花了多少钱、跑了多少步、奖励曲线涨没涨、哪个节点的显卡出了故障,全部公开可查。

从Pro模型开始训练算起36小时,两款模型已花超过108万美元,平均每小时3万美元。报道形容,一眨眼就是10美元,一分钟就是4000多元人民币。

自4月开源MiMo-v2.5后,小米沉默了近半年。负责人罗福莉出面解释,这期间只研究了一件事:强化学习能扩展到多远。

目前MiMo-V2.6的Flash和Pro两款模型仍在训练初期,刚开始1天多一点。报道称,两者在RL过程中都已经出现比较明显的能力提升:Pro的dynsam/avg@n从第1步的约0.565提升至0.614,Flash则从约0.514提升至0.603;最新公开的DeepSWE v1.1离线评测中,Pro和Flash分别达到62.24和60.77,对比DeepSeek-Flash v1.1为74.2%。Flash从更低的起点快速追近,Pro目前只保持小幅领先;不过Pro训练完一个Step更慢,所以最新的评分还没出来。

小米沿三个维度扩展强化学习

报道称,传统预训练scaling的逻辑是更多数据×更多参数×更多算力→更强模型;现在前沿模型越来越关注RL能不能也这样scaling,也就是持续增加每轮生成多少轨迹、模型面对多少种真实任务环境、为判断这些轨迹好不好投入多少计算,模型能力是否还能持续提高。

小米给出的答案是沿三个维度扩展:训练计算量、环境/执行框架、评分计算量。

每个Step约20亿Token,系统完全异步

第一个维度是把RL本身的计算规模做大。MiMo-V2.6系列每个训练Step大约处理20亿Token,配置为1568个Prompt×每个Prompt 16条Rollout,也就是同一道题让模型尝试多条不同的解题和行动轨迹,再从这些尝试中获得强化学习信号。1568×16意味着一轮可能产生超过2.5万条Rollout。

对于Agent任务,一条Rollout远不只是一问一答:模型可能要经历几十轮思考、工具调用、环境反馈和再次行动,因此一个Step的Token数可以达到数十亿级别。

更重要的是,整个系统采用了Fully Async,也就是完全异步执行。传统RL训练像一条整齐的流水线:先把所有样本生成完,再统一评分,然后训练模型,最后开始下一轮;在大规模Agent RL里很难这样等待。在MiMo系统中,不同任务可以同时处于不同阶段:有的Agent还在环境中执行任务,有的已完成等待判分,有的正在计算Reward,还有新任务正在进入系统。生成、执行、评分和训练不再严格排队,而是组成一套持续运转的异步流水线。

环境与评分同时扩展

第二个扩展方向是Environments and Harnesses,即训练环境和执行框架的扩展。MiMo-V2.6做的是Multi-task Agentic RL:代码、通用任务、视觉、Chat等不同类型的任务,可以被混合到同一次RL Run中训练,而且这些任务还可以运行在不同的Harness里。报道举例说,一个编程Agent的Harness可能允许模型打开终端、修改代码、执行测试、阅读报错,然后继续修改;另一个视觉Agent面对的可能是完全不同的工具、环境反馈和成功条件。MiMo想扩展的除了题目数量,还有模型能够进入多少种环境、使用多少种工具、解决多少种类型的问题。直播页面专门展示Batch Composition,实际上是在告诉外界,每一个训练Step中,模型正在从什么样的任务和环境里获取经验。

第三个方向是Grader Compute,也就是给打分本身增加算力。强化学习需要奖励,但复杂Agent任务的奖励不像数学选择题那样容易得到。代码任务还可以运行Test Case,100个测试通过了多少个,可以形成相对客观的反馈;但面对更开放的Agent任务,仅仅判断最终成功还是失败往往远远不够,负责判断模型做得好不好的评分者,同样开始消耗越来越多计算资源。

报道还提到Credit Assignment(信用分配)问题:假设一个Agent为完成任务连续执行40步——搜索资料、打开网页、阅读信息、编写代码、运行测试、发现错误、修改代码,最终成功完成任务,系统最后只告诉模型“成功,Reward=1”,这个学习信号非常粗糙,因为模型不知道前面的40步中哪些动作真正帮助了成功、哪些步骤毫无必要、哪一次修改扭转了整个任务,又有哪些动作虽然最后没有导致失败却实际上是不好的选择。MiMo在这次训练中特别提到了Agentic In-group Credit Assignment。报道称目前还没有公布具体算法,但结合同一个Prompt生成16条Rollout的训练方式,可以理解其基本目标是利用同组多条Agent轨迹及其结果,获得比简单的最终成败更加细致的强化学习信号。

三个方向构成一套体系

报道总结称,MiMo所说的三个Scaling方向实际上构成一套完整体系:扩展计算量,让模型产生更多经验;扩展环境和Harness,让模型获得更加多样的经验;更多评分计算量,则负责从这些海量经验中提取更加准确的学习信号。

报道还提到,前来围观的一位ViT大佬给出更直接的翻译:三件事,背后都是算力。

信息来源

量子位原始来源