开源The Decoder AI·原文 2026年9月22日

小米MiMo-V2.6-Pro登顶开源模型榜,Anthropic指控其蒸馏Claude

小米发布MiMo-V2.6系列,旗舰版以46分登顶Artificial Analysis智能指数,单任务成本约0.13美元;同一周,Anthropic报告点名小米通过40万次对话交换从Claude提取训练数据。

AI解读:小米这次把开源模型的性价比推到了一个新位置:MiMo-V2.6-Pro在Artificial Analysis智能指数上拿46分,超过Kimi K3和Qwen等开源对手,输入每百万token只要0.435美元、输出0.87美元,跑一个测试任务约0.13美元。

能做到这一点,小米说靠的是大幅扩展的强化学习:每次训练步喂更多数据、任务环境更多样、评判解法的算力更多,整轮训练不到六天,Pro花了约262万美元,Flash花了约85万美元。

但这条新闻有个刺眼的反面。发布前两周,Anthropic在威胁情报报告里点名小米,称其在2026年3月和4月的20天里,通过OpenClaw和OpenCode把超过40万次MiMo模型的用户对话和编程会话送入Claude,用于丰富训练数据。Anthropic称这类做法为非法蒸馏。

两件事放在一起,读起来就是:小米一边把强化学习工具链、技术报告、约7000个带自动评分器的训练任务开放出来,一边被指控此前的训练数据来自对Claude的提取。开源姿态和指控并排出现,是这条新闻最需要读者自己判断的地方。

对开发者来说,实际可用的部分是:模型权重之外,小米还开放了训练框架、一个可继续训练的小模型,以及覆盖软件开发、网络安全、办公、网页设计和约1000个音乐创作任务的现成训练集,还有输出速度最高20倍的Pro-UltraSpeed变体。

需要留意的是,Anthropic的指控来自其单方面报告,小米尚未在报道中给出回应;模型评测数据和成本数字来自小米与Artificial Analysis,实际使用效果仍取决于具体任务和部署条件。

小米发布MiMo-V2.6系列模型。据The Decoder报道,其中较大的MiMo-V2.6-Pro在分析机构Artificial Analysis的智能指数上得分46分,成为当前评分最高的公开可用AI模型,领先Kimi K3和Qwen等竞品。

价格是这次发布的核心卖点:MiMo-V2.6-Pro输入每百万token收费0.435美元,输出每百万token收费0.87美元。按Artificial Analysis的测算,跑一个测试任务约花费0.13美元,该模型因此被列入智能与成本之间的帕累托前沿。

MiMo-V2.6-Pro是混合专家模型,总参数1.02万亿,每次请求激活420亿参数。与它一同发布的还有更小、更高效的MiMo-V2.6-Flash。

小米将性能提升归因于大幅扩展的强化学习。公司从三个方向扩大这一阶段:每个训练步使用更多数据、任务环境更多样、用于评判解法的算力更多。小米称整轮训练耗时不到六天,Pro花费约262万美元,Flash花费约85万美元。

在DeepSWE编程测试中,Pro的分数从58.4升至72.6,Flash从48.8升至65.7。小米表示,为在如此规模下保持训练稳定,公司冻结了模型的内部分布机制,并增加了多层防护,防止“奖励黑客”——即模型用取巧方式骗取奖励而不真正解决任务。

随模型一同发布的还有名为Pro-UltraSpeed的极速变体,输出速度最高可达前者的20倍。

强化学习工具链与约7000个训练任务一并开放

小米同时开放了其强化学习工具包,包括技术报告、完整训练框架、一个用于继续训练的小模型,以及约7000个配有自动评分器的现成训练任务,覆盖软件开发、网络安全、办公工作和网页设计,另有约1000个音乐创作任务。

这些任务来源混合:部分代码来自员工的真实GitHub拉取请求和用户查询,另一些任务描述由语言模型生成。网络安全任务取材于OSS-Fuzz——一个收录数万个真实软件漏洞的集合,办公环境则是合成重建的。

Anthropic报告点名小米,称40万次对话被送入Claude

这次开放姿态与Anthropic两周前提出的指控形成鲜明对比。Anthropic在威胁情报报告中梳理了2025年12月至2026年8月期间发现的Claude滥用案例,点名七家中国实验室与针对该模型的行动有关:阿里巴巴、月之暗面、DeepSeek、智谱、小米、MiniMax和商汤。

Anthropic称这些实验室共生成约1.9亿次交互,用于提取Claude的能力来训练自家模型,并将这一手法称为非法蒸馏。小米被直接点名。

在一个标记为GTG-16008的案例中,Anthropic追踪到2026年3月和4月的20天内超过40万次交互,称小米将其MiMo模型的用户对话和编程会话经由OpenClaw和OpenCode传给Claude,目的是为未来模型丰富训练数据。

报告几乎没有说明这些用于内部蒸馏教师模型的更早训练数据和教师数据来自何处。The Decoder的表述是:报告称小米记录了其MiMo模型的用户对话,再将其送入Claude以提取训练数据,而这些数据如今把小米推上了开源模型排名的首位。

信息来源

The Decoder AI原始来源