研究量子位·原文 2026年9月17日

云知声发布U2-Flash:单次激活约10B参数,代码与Agent基准反超前代U2

云知声称U2-Flash采用约266B总参数的稀疏MoE架构,单次推理仅激活约10B参数;相比U2生成速度提升2.1倍,Agent任务完成时间缩短35%,DeepSWE v1.1从32分升至64.6分。

AI解读:云知声这份答卷最反常识的地方不是“Flash更快更便宜”,而是它把“便宜”和“更强”同时做了:U2-Flash单次只激活约10B参数,总参数约266B,却在DeepSWE v1.1、TerminalBench 3.0等代码与Agent基准上反超上一代U2。按量子位的报道,这是国产模型里较早拿出RSI(模型参与训练下一版自己)实践交卷的一例。

受影响最直接的是把模型当“干活主力”的开发者:U2-Flash在MaaS平台上线,兼容OpenAI与Anthropic两套协议,Claude Code、Cursor、Cline等工具可按官方方式接入;9月15日至30日可免费领取1亿Tokens额度,当前API限时六折,输入0.6元/百万Tokens、输出1.2元/百万Tokens。对预算敏感、又要跑长链路Agent任务的人,这组价格和基准数字值得自己验一遍。

需要说明的是,这些成绩来自厂商后训练闭环与媒体实测,不是第三方长期复现。云知声把能力增益归因于数据壁垒、异步Agent RL和多教师在线策略蒸馏;实测里U2-Flash完成了找Bug、纠错和14份材料汇总等任务,但这些仍是有限场景。能不能稳定替代旗舰模型,还得看正式生产环境里的失败率。

云知声发布U2-Flash,一款采用稀疏MoE架构的模型:总参数约266B,单次推理只激活约10B,不到总参数的4%。云知声称其在代码、Agent等任务上超过上一代U2,并具备Flash定位下的速度和成本优势。

据量子位报道,相比U2,U2-Flash生成速度提升2.1倍,Agent任务完成时间缩短35%,任务迭代步数和Token消耗降低20%至30%。基准成绩方面,DeepSWE v1.1从U2的32分升至64.6分,TerminalBench 3.0从2.7分升至24.3分,SWE-Bench Pro拿下61.6分,较前代提升10.5分。

API兼容OpenAI与Anthropic,9月30日前可领1亿Tokens

U2-Flash已在云知声MaaS平台上线,支持在线体验与申请API调用。API同时兼容OpenAI和Anthropic两套主流协议,Claude Code、Trae、Cursor、Cline等工具官方给出了接入方式;其他Harness只要支持自定义模型,替换Base URL、API Key和模型ID即可接入。

模型提供none、low、high、max四档思考强度,可按任务难度在速度与推理深度之间切换。价格方面,当前限时六折:输入0.6元/百万Tokens、输出1.2元/百万Tokens、缓存命中0.12元/百万Tokens。9月15日至9月30日,用户可免费领取1亿Tokens使用额度。

量子位在实测中用WorkBuddy接入,称不到一分钟显示调用成功,但WorkBuddy未开放手动切档,因此没有做四档思考强度的横向对比。

  • 总参数约266B,单次推理激活约10B(不到4%)
  • 相比U2生成速度提升2.1倍,Agent任务完成时间缩短35%
  • 任务迭代步数和Token消耗降低20%至30%
  • DeepSWE v1.1:32分→64.6分
  • TerminalBench 3.0:2.7分→24.3分
  • SWE-Bench Pro:61.6分,较前代提升10.5分

三项实测:自己找Bug、绕过错误线索、汇总14份文件

量子位设计了三个测试场景。第一个场景中,测试者虚构了ExpenseFlow报销统计项目,并在统计与日期处理链路里埋了三处问题:被驳回的报销仍计入已报销总额、北京时间8月1日凌晨记录转UTC后被归回7月、CSV导出日期串月。U2-Flash在没有额外线索的情况下,用7分6秒找出全部问题并给出验收报告。

第二个场景是ProfileSync 2.0资料同步项目,README给出的启动命令指向不存在的文件,旧文档含过期字段,历史日志把问题指向网络。U2-Flash用3分32秒定位并修复真实故障,把测试从1项补到7项,全部通过。

第三个场景测试512K上下文:14份文件、四种格式,包含Brief、采访、产品白皮书、Release Notes、数据表、客户案例、会议纪要、合规说明和行业报告,要求交付一份DOCX,含1200至1500字发布稿、核心事实来源表、材料冲突清单和五个发布前待确认问题。U2-Flash用时8分36秒完成,且没有沿用旧Brief的10月8日,而是采用最新版10月18日,也没有误用旧版81.2%的成绩,更新为78.4%并注明属于内部测试。

  • 任务一:7分6秒找出并修复三处埋设问题,附验收报告
  • 任务二:3分32秒定位真实故障,测试从1项补到7项
  • 任务三:8分36秒汇总14份文件,正确采用最新日期与数据

后训练闭环:自主出题、异步Agent RL、多教师蒸馏

云知声把U2-Flash的能力增益归因于两部分:数据与后训练闭环。云知声称其深耕行业十余年,积累了真实场景数据与高质量标注能力,为后训练提供数据质量壁垒。

后训练闭环包含三个关键。第一是自主任务生成,模型根据当前能力动态生成新任务,专门挑选“现在还做不好、但已接近突破”的问题。云知声称该闭环已自主构建近10万道高质量SWE任务,覆盖多种主流编程语言。

第二是异步Agent RL。传统同步训练中,一条任务未跑完其他环节要等待;U2-Flash把任务拆给多个Worker,在不同沙盒并行执行,后方策略更新持续进行,并对关键Action做标记以追溯到决定结果的那一步。云知声称相比同步训练,单位时间内产出的有效训练轨迹数量提升约60%。

第三是多教师在线策略蒸馏。云知声先分别训练数学、代码、Agent等专项教师模型,再由学生模型生成轨迹,由不同教师逐Token打分。云知声称该方法让U2-Flash达到同等能力所需训练步数减少约55%。此外,闭环延伸到训练系统本身:U2-Flash可参与机器巡检、故障定位、修复和任务重启,官方称训练故障平均恢复时间缩短至人工介入模式的三分之一左右。

  • 自主构建近10万道高质量SWE任务,覆盖多种主流编程语言
  • 异步Agent RL使单位时间有效训练轨迹数量提升约60%
  • 多教师蒸馏使达到同等能力的训练步数减少约55%
  • 训练故障平均恢复时间缩短至人工模式的三分之一左右

RSI分级下的位置与国产算力适配

报道称,RSI目前尚无全行业统一定义。Anthropic的口径是AI能自主设计并开发出比自己更强的后继系统才算完整递归自我改进;OpenAI的观察范围更宽,只要模型能加速AI研究、推动自身能力提升即属于“AI Self-Improvement”,Critical级别则要求完成全自动AI研发或把一代模型升级周期压缩到原来的五分之一。

国内方面,上海交大、清华、上海AI Lab等机构的研究者发表综述《The Last AI Built by Humans: Toward Genuine Recursive Self-Improvement》,按模型接管自我改进闭环的程度提出L1到L5路线图。按该分级,U2-Flash已显露出明显L3特征:仍运行在人工设定的沙盒、规则和授权边界内,但开始参与决定下一版自己该学什么。

云知声强调U2-Flash对国产算力的适配:围绕主流国产算力平台,对模型架构、核心算子、推理框架和集群调度进行适配优化,报道称其在国产平台上的吞吐、时延、并发和集群扩展效率持续提升,部分场景已接近NVIDIA GPU方案。

报道同时指出,U2-Flash还只是云知声的一轮初步实践,这套闭环能否持续转动、RSI能力能否从单次升级走向持续复利,仍有待后续验证。

  • Anthropic:能自主设计并开发更强后继系统才算完整RSI
  • OpenAI:Critical级别要求全自动AI研发或升级周期压缩至五分之一
  • 综述路线图L1至L5,U2-Flash显露明显L3特征
  • 云知声称部分国产算力场景性能已接近NVIDIA GPU方案

信息来源

量子位原始来源