今日分析

AI 新闻里的变化、生意与判断。

012开源模型 / Agent 训练

小米这次开源的,已经不只是模型权重

小米发布 MiMo-V2.6 Pro 和 Flash,并开放模型权重、7000 多个强化学习任务环境、端到端训练框架和轻量 Harness。官方还披露了训练步数、轨迹数量、成本和内部评测变化。

AI 生成示意图、非事件现场、非产品界面:根据小米 MiMo-V2.6 官方披露的开源内容和训练流程绘制,图中数字来自官方文章。
点击图片放大
01

MiMo-V2.6 同时放出 Pro 和 Flash

小米 MiMo 9 月 21 日发布 MiMo-V2.6 系列,包含 Pro 和 Flash 两个原生全模态模型,并同步上线桌面客户端和 API。官方页面称,Pro 在 Artificial Analysis Intelligence Index 得分 46,达到当前开放权重模型的最高一档;这个排名来自第三方评测,不能单独当成生产效果证明。

这次发布还包括模型权重、技术报告和 MiMo-V2.6-Distill-Qwen-9B。模型本身可以下载,API 和桌面客户端也可以直接试用,用户不必先搭完整训练环境。

02

放出来的东西,重心在训练环节

小米公开了 7000 多个强化学习任务环境,覆盖软件工程、漏洞复现、知识密集型工作和网页开发。任务环境的作用很朴素:给 Agent 一个能执行、能验收的任务,让训练不只停在聊天答案上。

同时公开的端到端训练框架,负责环境交互、轨迹收集、奖励评估和策略优化;轻量 Harness 则把系统提示、工具和上下文管理拆开,方便研究者拼出不同的 Agent 配置。

这和只上传一个模型文件差别很大。别人可以拿着权重跑推理,也可以沿着任务、奖励和工具配置继续做实验,尝试把一个模型在编程、网页操作或安全任务上训练得更稳。

03

小米把训练账也写出来了

官方披露,Pro 和 Flash 在不到 6 天内各完成 30 个训练步骤,累计约 75 万条轨迹。Flash 的训练成本约 85 万美元,Pro 约 262 万美元,合计接近 350 万美元。训练任务平均通过率分别提升 25% 和 12%,DeepSWE v1.1 的长程软件工程评测分别提升约 17 分和 14 分。

这些数字来自小米自己的训练记录和评测,外部还没有完整复现实验。成本也只是这轮训练的模型与算力账,环境制作、工程维护、失败重跑和评测设计没有单独列出。把它们看成公开的实验记录更稳妥,不能直接当成任何团队的预算表。

04

这件事为什么比又一个模型发布更有分量

过去开源模型的门槛主要在权重和推理部署,接下来会越来越多地落到任务怎么设计、奖励怎么判断、工具怎么接入。没有这些配套,模型分数再高也很难在长任务里持续进步。

小团队可以从一个具体任务开始试:先用现成环境和 Harness 跑通评测,再决定是否值得投入自己的数据和算力。代价也很清楚,训练一轮就可能花掉数十万到数百万美元,环境质量和评测质量还要有人长期维护。

未来 6—12 个月 · 待核查问题

接下来怎么看

开源模型会不会因此继续拉近和闭源模型的距离,要看外部团队能否用这些环境和框架复现提升,并把它们迁移到不同模型和不同 Agent 框架。小米公开了训练材料,下一步还需要公开社区实际跑出来的结果。

持续检查:7000 多个任务环境的许可和可复用性;外部复现实验的成本与提升;不同模型使用同一套奖励环境后的表现;训练框架是否被主流 Agent 工具接入。

往期分析

GPT-6 Luna 每百万输入 0.1 美元,模型价格战开始算“每个任务”

这次发布的重点,是大模型开始按任务经济学竞争。标价降下来之后,缓存命中率、工具调用次数、失败重跑和人工复核,才决定一条 Agent 流程贵不贵。

Qwen 把生图、修图和透明图塞进一个 7B 模型

Qwen-Image-2.1 的变化在素材环节:生成一张图、改一张图、抠出透明主体,可以交给同一个模型处理。它离设计行业被改写还有距离,商用授权和本地运行成本先要算清楚。

审计还没开始,AI先把工具造出来了

AI 在安全审计里的先手,可能是先把缺的工具补齐。工具能复用,审计才会越做越快;只让 Agent 对着代码找漏洞,收益没那么稳定。

GitHub 用 Copilot 重写 83 万行 Rust,重点在于它没让 Agent 一次写完

这次迁移说明,Agent 可以承担大块代码搬运,交付靠的是分片、测试和持续审查。把任务丢给 Agent 等结果,撑不起 83 万行生产代码。

OpenAI 开始公开模型失准,最麻烦的是它会自作主张

OpenAI 这次公开的重点,不在于证明模型已经失控,而在于承认异常行为可能在修复前就该留下记录。对使用 Agent 的团队,任务摘要、工具权限和外部写入都不能只当作普通文本。

Siri AI 终于能替你办事,但中国用户暂时用不了

这次 Siri 更新的分量,在于它开始替用户跨应用办事:读消息、找邮件、看屏幕,再写信、建日程或整理清单。可惜中国首发不在名单里,短期能不能用,先看监管和本地化进度。

小红书开源 Iris,榜单分数要连 Harness 一起看

这次发布最有价值的地方,是把模型和 Harness 拆开报分。做搜索 Agent 时,工具、上下文丢弃、重试和评分器都会改结果;只截一行最高分,信息不完整。

长任务 Agent 会忘事,先别急着换模型

模型窗口再大,也装不下无限的工具结果。能否把旧信息放到可检索的位置,压缩后找回目标,并在出错时继续执行,决定了长任务能不能交付。

GitHub 把营销工作塞进 Issue,Copilot 负责起草,人仍要签字

这篇文章最有用的一点,是把 Copilot 放回流程里看:它起草名称和邮件,Issue、标签、Actions 负责执行,负责人继续签字。流程写不清,换模型也不会自动变好。

Claude 被用于导弹软件,Anthropic 没有说明何时发现

封禁账号可以停止后续调用,却无法收回已经写出的代码。判断平台是否及时干预,需要知道首次异常请求、人工调查和封号之间隔了多久。

DeepSeek V4.1 Flash:长任务 Agent 的成本账

缓存压缩降低了长任务的资源负担,能否转化成利润仍取决于复用比例和交付质量。值得优先试点的,是输入重复度高、结果可核验、出错后能恢复的流程。

AI 客服降本 65% 的案例里,真正值得重算的是哪笔账

AI 客服的价值要以问题解决后的总成本衡量。重复咨询减少后,人工会更集中地处理复杂工单;能否减少重复来单、控制错误操作并持续维护业务规则,比自动处理率更影响利润。