小米这次开源的,已经不只是模型权重
小米发布 MiMo-V2.6 Pro 和 Flash,并开放模型权重、7000 多个强化学习任务环境、端到端训练框架和轻量 Harness。官方还披露了训练步数、轨迹数量、成本和内部评测变化。
MiMo-V2.6 同时放出 Pro 和 Flash
小米 MiMo 9 月 21 日发布 MiMo-V2.6 系列,包含 Pro 和 Flash 两个原生全模态模型,并同步上线桌面客户端和 API。官方页面称,Pro 在 Artificial Analysis Intelligence Index 得分 46,达到当前开放权重模型的最高一档;这个排名来自第三方评测,不能单独当成生产效果证明。
这次发布还包括模型权重、技术报告和 MiMo-V2.6-Distill-Qwen-9B。模型本身可以下载,API 和桌面客户端也可以直接试用,用户不必先搭完整训练环境。
放出来的东西,重心在训练环节
小米公开了 7000 多个强化学习任务环境,覆盖软件工程、漏洞复现、知识密集型工作和网页开发。任务环境的作用很朴素:给 Agent 一个能执行、能验收的任务,让训练不只停在聊天答案上。
同时公开的端到端训练框架,负责环境交互、轨迹收集、奖励评估和策略优化;轻量 Harness 则把系统提示、工具和上下文管理拆开,方便研究者拼出不同的 Agent 配置。
这和只上传一个模型文件差别很大。别人可以拿着权重跑推理,也可以沿着任务、奖励和工具配置继续做实验,尝试把一个模型在编程、网页操作或安全任务上训练得更稳。
小米把训练账也写出来了
官方披露,Pro 和 Flash 在不到 6 天内各完成 30 个训练步骤,累计约 75 万条轨迹。Flash 的训练成本约 85 万美元,Pro 约 262 万美元,合计接近 350 万美元。训练任务平均通过率分别提升 25% 和 12%,DeepSWE v1.1 的长程软件工程评测分别提升约 17 分和 14 分。
这些数字来自小米自己的训练记录和评测,外部还没有完整复现实验。成本也只是这轮训练的模型与算力账,环境制作、工程维护、失败重跑和评测设计没有单独列出。把它们看成公开的实验记录更稳妥,不能直接当成任何团队的预算表。
这件事为什么比又一个模型发布更有分量
过去开源模型的门槛主要在权重和推理部署,接下来会越来越多地落到任务怎么设计、奖励怎么判断、工具怎么接入。没有这些配套,模型分数再高也很难在长任务里持续进步。
小团队可以从一个具体任务开始试:先用现成环境和 Harness 跑通评测,再决定是否值得投入自己的数据和算力。代价也很清楚,训练一轮就可能花掉数十万到数百万美元,环境质量和评测质量还要有人长期维护。
未来 6—12 个月 · 待核查问题
接下来怎么看
开源模型会不会因此继续拉近和闭源模型的距离,要看外部团队能否用这些环境和框架复现提升,并把它们迁移到不同模型和不同 Agent 框架。小米公开了训练材料,下一步还需要公开社区实际跑出来的结果。
持续检查:7000 多个任务环境的许可和可复用性;外部复现实验的成本与提升;不同模型使用同一套奖励环境后的表现;训练框架是否被主流 Agent 工具接入。