产品量子位·原文 2026年9月17日

唐杰披露智谱RSI首个工程案例:GLM-5.3驱动Infra Agent在10万卡集群上两周将吞吐提升至3.2倍

智谱创始人唐杰分享内部观察到的递归自我改进早期案例:GLM-5.3驱动的Infra Agent从零参与搭建国产10万卡集群的生产级推理系统,不到两周端到端吞吐提升至初始基线的3.2倍;智谱明确强调尚未实现RSI,目标定义、边界划分与风险判断仍由人类工程师负责。

AI解读:这条新闻的技术核心是一次工程闭环,而不是模型突然有了自我意识。智谱让GLM-5.3驱动一个基础设施Agent,去搭建并优化承载GLM-5.3-Flash自身线上推理的系统,不到两周把端到端吞吐提到初始基线的3.2倍。真正值得注意的是反馈方式:Agent能读取系统反馈、提出假设、改代码、跑实验、再迭代。

被优化对象是10万张以上国产芯片组成的集群,做的是生产级推理服务,不是演示。过去没人成功部署过如此大规模的国产卡集群,芯片内存容量和带宽相对受限,还要支持1M上下文窗口和多模态请求,生态不成熟、算子不完备、很多文档靠猜。

三个具体案例说明Agent在干什么:KDA算子上下文并行路径因TF32默认精度导致误差累积,改用tf32x3组合精度修复;PyTorch生态中DeepEP v1.2.1的intranode_dispatch和intranode_combine未显式释放Python GIL,阻塞了Mooncake Transfer的传输调度,释放GIL后Prefill+KV Transfer相比单独Prefill的性能损失从超过20%压到1%以内;KDA Decode算子上通过合并分块、消除重复的FP32归一化与门控计算,拿到1.71倍提升。

对做推理系统的人来说,可迁移的经验不是‘AI会写代码’,而是反馈要做稠密:局部、可低成本及时获得、可客观验证。端到端指标只会说结果变差,算子级对比、微基准、执行Trace和运行时事件才能回答哪一层出了问题。这条路径让局部验证和端到端验收各司其职,避免每次改一行都等完整部署压测。

边界也很清楚。智谱明确说还没有实现RSI,选择目标、设定边界、判断风险仍是人的工作。智谱用的原话是:模型优化系统,系统承载模型。这套系统上线后也支撑GLM-5.3-Flash以匿名模型Ox-Alpha在OpenCode与OpenRouter接受真实调用,上线一周成为双平台调用量最大的模型,6天token调用量超过62万亿。

对普通读者来说,这件事的直接体会是:国产10万卡集群的推理服务已经能跑生产流量,且单Token成本与硬件利用效率达到主流NVIDIA GPU的相当水平——这是智谱的说法,不是第三方实测。至于更远的‘AI训练自己的继任者’,目前没有公开证据支持,判断应停在工程闭环这一层。

清华大学计算机系教授、智谱创始人唐杰在社交平台分享了一个内部观察到的递归自我改进(Recursive Self-Improvement,RSI)早期案例:由GLM-5.3驱动的Infra Agent,在超过10万张国产芯片组成的集群上,从零参与搭建并优化了一套生产级推理系统,不到两周将端到端吞吐提升至初始基线的3.2倍。

唐杰把这一现象概括为“模型优化系统,系统承载模型”。智谱方面明确强调,他们还没有实现RSI;目标怎么定、边界怎么划、风险怎么判断,目前依然由人类工程师负责。

据唐杰分享的技术Blog,这套系统承载的是GLM-5.3-Flash的全部线上推理。GLM-5.3-Flash以匿名模型“Ox-Alpha”在OpenCode与OpenRouter上接受真实调用检验,上线一周成为双平台调用量最大的模型,6天token调用量超过62万亿。

唐杰称,此前没人成功部署过如此大规模的国产卡集群,面对芯片内存容量和带宽相对受限的挑战,以及需要支持新结构模型的1M上下文窗口和多模态请求,生态不成熟、算子不完备、许多文档基本靠猜。最终完成这件事的不是一支团队,而是GLM-5.3驱动的Infra Agent。

Agent自主完成的三类工作:精度修复、并发瓶颈定位与KDA算子提速

唐杰的分享给出三个具体案例,分别对应“算得正确”“为什么跑不快”和“怎样跑得更快”。

正确性案例:Agent在KDA算子上下文并行(Context Parallel,CP)路径上发现CP与非CP结果的数值偏差。原实现中,tl.dot即使接收FP32输入也默认采用TF32计算以提高性能,较低精度使误差在状态变换合并和状态更新中累积,长上下文下更明显。修复方法是将两处计算显式指定input_precision=“tf32x3”,通过三次TF32 Tensor Core运算组合出更高精度。相关精度修复已合并至Flash Linear Attention上游,PR #1180。

并发案例:优化工程师为Agent定义了单独Prefill、Prefill + KV Transfer、单独Decode等测试场景,并以单独Prefill为基准设定“Prefill + KV Transfer性能差距不应超过5%”的验收条件。Agent发现部分场景差距超过20%,随后沿调用链进入Python/C++边界,定位到DeepEP v1.2.1中intranode_dispatch和intranode_combine均未显式释放Python GIL;dispatch在需要获取接收token数量时还会在CPU上等待GPU返回信息。持锁期间,同一进程内负责Mooncake Transfer的Python线程无法及时获得GIL,传输任务调度与提交被推迟。修复关键是在相关C++执行区间释放GIL,修复后Prefill + KV Transfer与单独Prefill的性能差距小于1%。

性能案例:Agent从SGLang、Flash Linear Attention和DeepGEMM等项目的存量手写Kernel中学习优化经验,提炼为包含适用条件、变换方式、资源约束和验证证据的“优化骨架”。在KDA Decode算子上,ReplaySSM以算换存导致执行时间首次延长,随后的除法优化缩短9.6%;在获得“计算是关键瓶颈”的反馈后,Agent发现原实现沿V维度分块造成相同的FP32归一化与门控计算被重复执行四次,于是合并到同一线程块、提前批量计算并共享中间结果,以牺牲部分并行度换取消除重复计算,获得1.71×的性能提升。

  • KDA上下文并行精度修复:tf32x3替代默认TF32,修复已合并至Flash Linear Attention上游PR #1180
  • DeepEP v1.2.1未释放GIL:Prefill + KV Transfer与单独Prefill的性能差距从超过20%压到1%以内
  • KDA Decode算子:合并V维度分块消除重复计算,取得1.71×性能提升
  • 同版本internode_dispatch已显式释放GIL,注释说明是为避免CPU等待期间阻塞其他线程中的KV Transfer

稠密反馈:把端到端指标拆成局部、及时、可验证的工程反馈

唐杰在Blog中提出,决定Infra Agent工程效果的不只是模型的代码生成与推理能力,更取决于系统能否持续提供有效、可归因的反馈。代码库只能提供静态上下文;精度异常或性能退化往往来自算子实现、并行策略、通信行为、内存管理与服务调度等多个层面的动态交互。如果一次修改后只得到“精度测试未通过”“TTFT增加30%”或“输出吞吐下降20%”,Agent难以判断问题出在哪一层、假设为何不成立、下一步该验证什么。

智谱将正确性测试、运行日志、执行Trace、运行时事件、微基准测试和端到端指标纳入Agent的迭代流程,把系统优化拆分为可局部观测和验证的环节。算子级对比验证数值正确性,微基准衡量特定输入条件下的局部性能,执行Trace和运行时事件呈现计算、等待与通信之间的时间关系。

Blog把“稠密”定义为三个特征:反馈足够局部,能关联到具体引擎启动参数、修改的代码、算子、输入条件、线程、执行区间或代码路径;反馈能低成本及时获得,能通过算子测试或局部微基准回答的问题无须每次等待完整服务部署和端到端压测;反馈支持客观验证,修改是否正确由参考实现、测试结果和可比较的实验指标判断,不能仅凭现象之间的相关性确认根因。

在这一闭环中,工程师定义优化目标与系统约束、构建Agent可直接使用的反馈环境、审核涉及系统架构、异步并发和线上风险的关键修改;Agent提出假设、实施修改并执行实验,再根据反馈保留、修正或否定方案。正确性、稳定性与端到端性能共同构成最终验收标准。

  • 局部验证负责尽早排除错误或无效修改,端到端测试负责确认局部收益能否转化为真实服务收益
  • 智谱称GLM-5.3-Flash上线采用了以算力换带宽、以通信换显存等激进内存优化
  • 技术栈包括节点内张量并行、ReplaySSM、W8A8量化、INT8/FP8/BF16混合精度缓存量化、Layer Split,以及Encode–Prefill–Decode(EPD)分离式架构
  • 智谱称EPD架构带来端到端服务性能约3倍提升,硬件利用效率与单Token成本达到主流NVIDIA GPU的相当水平

智谱划出的边界:还没有实现RSI

唐杰在Blog结尾明确表示:“当然,我们还没有走到递归自我改进。选择目标、设定边界、判断风险,仍然是人的工作,而且我们认为,在相当长的时间里,这条线应当由人来守。”

他还提到,在GLM-4.7之前,内部用GLM写代码多少带着被迫的成分,当时Coding的PMF还未到来;今天GLM-5.3已成为团队每天使用的Coding伙伴。Blog称,如果趋势延续、给足算力与时间,终点是一个能够完全自主设计并训练出自己继任者的系统,但智谱强调目前只是早期形态。

唐杰在分享中还给出一组数字:“两周、三倍、十万卡”。这三个数字对应的是上述Infra Agent参与推理系统上线的工程结果,而非RSI已经实现的证据。

  • 智谱明确强调尚未实现RSI,人类工程师仍负责目标定义、边界划分与风险判断
  • 2025年10月智谱启动安全能力增强研究,称安全伙伴使用GLM在真实代码库中发现数千个漏洞,并为此设计了受信访问计划
  • GLM-5.3-Flash以匿名模型Ox-Alpha在OpenCode与OpenRouter接受真实调用,上线一周成为双平台调用量最大的模型
  • 唐杰给出的概括是“模型优化系统,系统承载模型”

信息来源

量子位原始来源