CosmosMind联合十余家高校发布MetaRSI-v1,用元递归架构改进自我改进过程
MetaRSI-v1称可在无外部教师模型条件下让30亿激活参数小模型在四项基准平均自我提升10.9分,六款前沿旗舰模型在Terminal-Bench 2.1平均提升7.3分
AI解读:此前的RSI系统大多是固定不变的改进程序反复作用于模型,且通常只从Harness、Data或Model单一视角切入。MetaRSI-v1把三者统一到同一个Loop Kernel闭环中,让它们成为可组合、可统一调度的不同实例化算子。
实测数据有两组:无外部教师模型参与时,Qwen3.5-35B-A3B(35B总参、3B激活)在Terminal-Bench 2.1、SWE-bench Pro、GPQA-Diamond高难度子集、AIME四项基准上平均自我提升10.9分,SWE-bench Pro解决率接近翻倍;GPT-5.6、Claude Opus 5等六款前沿模型在Terminal-Bench 2.1上平均提升7.3分。
对普通读者来说,这仍是论文与开源项目层面的进展,不是马上能用的产品。真正值得注意的是其五条定律中的约束:自改进不凭空创造能力,增益本质上是外部信息熵的输入或已有能力的激发;验证器决定自我改进的前沿,且可信度由“不可写面”度量——闭环内部无法区分能力真变强还是标准被放宽。
CosmosMind联合斯坦福、伯克利、MIT、清华、北大等十余家海内外高校发布MetaRSI-v1,量子位报道称这是全球首个统一Model-RSI、Data-RSI、Harness-RSI的元递归架构,能够改进“自我改进的过程”。
报道称,此前几乎所有RSI(递归自我改进)系统都是同一套结构:一个固定不变的改进程序反复作用于模型,并往往只从Harness、Data或Model的单一视角切入。MetaRSI-v1试图统一整个RSI领域的架构语言,包括一个内核、两条编排轴、三个算子、整个元RSI层以及五大定律。
在没有任何外部教师模型参与下,MetaRSI-v1使一个仅30亿激活参数的小模型在四项基准上平均自我提升10.9分,并让GPT-5.6、Claude Opus 5等六款前沿旗舰模型平均提升7.3分。
Loop Kernel把Data、Harness、Model统一成同一闭环的三个算子
MetaRSI-v1首次提出Loop Kernel范式,把“进步如何发生”抽象成一条与对象无关的闭环:消费反馈得到的学习信号,在Data、Harness、Model上提出改动,交由验证器裁决,并将结果回流为下一轮信号。
Data、Harness、Model由此成为同一Kernel的不同实例化算子,可组合、可统一调度,自我改进第一次拥有统一、可复用的底层骨架。
三个算子分工不同:Data-RSI从自身运行轨迹提取学习信号,经校验用于合成数据交由下游消费,标定并放大模型正向能力与负向能力边界;Harness-RSI利用学习反馈信号,在Harness拆分出的System Prompt、Skill、MCP、Tools、Memory五个可插拔槽位上生成改进,做加法与减法;Model-RSI更新模型自身的参数与结构,把反复验证有效的行为内化进模型。
两条编排轴与四个Agent构成三层递归改进
横向编排(horizontal orchestration)编排算子的应用顺序:RSI² Agent在每个决策点根据信号反馈选定下一个算子,再送入RSI Loop Kernel执行。纵向优化(vertical optimization)优化算子的内部策略:RSI² Agent向目标算子专属的RSI² Sub-Agent下发指令,后者根据学习信号与环境反馈改写算子本身的RSI规则。
整套架构由四个Agent协调运作,并且均能被人类专家局部替换形成human-in-the-loop系统:MetaRSI² Agent学习如何进行合适的纵横优化,优化RSI² Agent的策略学习;RSI² Agent在每个决策点选择横轴或纵轴优化;RSI² Sub-Agent在纵向优化中接受来自RSI² Agent的执行指令,调整算子内部RSI策略;Transition Agent负责衔接横向编排中上游算子的产物与下一个算子对产物的消费。
四个Agent对应形成三个RSI优化Level:算子改进目标系统,双轴编排改进算子用法,元层改进双轴编排策略本身。
两条实验路线:小模型全面提升,前沿模型仅启用Data与Harness算子
实验沿两条路线展开。小模型路线使用可训练的开源模型,Data、Harness、Model三个算子全部启用,目标模型为Qwen3.5-35B-A3B(35B总参、3B激活),在Terminal-Bench 2.1、SWE-bench Pro、GPQA-Diamond高难度子集、AIME四项基准上评测。报道称MetaRSI-v1平均提升10.9分,SWE-bench Pro解决率接近翻倍,Meta层为RSI带来更高的天花板,连续自进化的累计增益提升显著。
前沿模型路线面向Claude Opus 5、GPT-5.6 sol、Kimi K3等顶级模型,这类模型参数巨大或为闭源模型,仅启用Data与Harness算子。多款前沿模型在Terminal-Bench 2.1上平均提升7.3分,报道称这说明MetaRSI范式对前沿模型同样成立,旗舰模型同样留有可观的自我改进空间。
MetaRSI还重新定义Data-RSI,将其作为模型的能力边界探测与放大器:通过对执行轨迹与外界反馈learning-signal的联合分析得到经过验证的经验并scale为可复用的数据,标定这些经验能够支撑到哪里,框定模型能力的正、负边界。Data-RSI的产物同时供给Harness-RSI与Model-RSI消费,两条路线的改动结果又能流回Data-RSI,重新标定能力边界、驱动下一轮。
五条定律划定自我改进的边界
报道称,MetaRSI提炼出五条定律。定律一:验证决定自我改进的前沿,一个领域能不能形成自改进闭环,取决于该领域任务能否被检验、是否有合适的verifier。定律二:自我认知会过期,重新发现能力边界是速率瓶颈,RSI改变agent能力后其原本旧的系统描述随即失效。
定律三:能力与载体无关但成本与载体有关。例如同一项能力放在Harness里每次推理都要重付成本,内化进Model只需付一次,成熟循环能够持续把能力迁移到更便宜的载体。定律四:可信度由不可写面度量。在闭环内部,真正能力变强和放宽成功标准会得到完全相同的分数,而且这种偏差从内部无法察觉、也无法靠统计纠正。
定律五:循环不凭空创造能力,一切增益本质上都是外部信息熵的输入或能力的激发。自改进只能重新组织、放大并固化模型已经具备的潜力,因此每次提升都要分清哪些是把已有能力放大出来的、哪些是真正从外部新引入的。
报道还提到,Harness不仅能做加法还能做减法:Data-RSI放大暴露的问题经Model-RSI内化之后,原本吸纳在Harness中的知识会变成冗余,Harness-RSI系统在回放校验下将其删除,能力留下,成本退场。
团队背景与开源内容
报道称,CosmosMind团队由清华、北大、斯坦福等海内外名校硕博、头部大厂基模核心组研究员、著名产业方领军人物组成,长期从事大规模模型训练、RSI、智能体、科学计算等工作,在顶会顶刊发表过论文。团队此次没有选择再做一个更大的模型,而是将精力投入“改进改进本身”。
团队同步开源了RSI-Harness,这是一个能自我学习、自我迭代的Harness,并可以在使用中为不同科学领域与工程实践沉淀出可移植的Harness Genome。
报道还提到团队对物理世界闭环的设想:可编程仪器、自动化实验室成为执行器和验证器,仿真、台架实验、真实仪器像三级火箭一样逐级推进,把不可逆的昂贵操作放到最后。报道称第一个在物理世界关上的进化循环很可能不会出现在开放环境里,而会出现在自动化实验室中。
本文系量子位获授权刊载,观点仅为原作者所有。上述论文、项目主页、arXiv编号与HuggingFace地址由来源给出。