开源量子位·原文 2026年9月20日

中国电信开源Xing4.0-29B-A4B:4-bit量化后单张RTX 3090可跑

中国电信AI开源全栈国产化轻量级代码智能体大模型Xing4.0-29B-A4B,290亿总参数、每次推理激活约40亿,基于华为昇腾910C和MindSpore/MindFormers训练,已在GitHub、Hugging Face等平台上线并支持API调用。

AI解读:中国电信AI开源了Xing4.0-29B-A4B,一款面向私有化部署的代码智能体大模型。它要解决的具体问题是:有些企业数据不能出域、算力又不富裕,但长文档要读、复杂业务要办——这类需求过去很难用上大模型。

模型用MoE架构,总参数290亿,每次推理只激活约40亿,4-bit量化后显存占用从约60GB压到约15GB,一张RTX 3090或4090就能运行。这意味着门槛从多卡或高价A卡降到了消费级显卡,受影响的正是那些预算有限、又必须本地部署的企业。

能力上它重点加强了Coding和Agent:原生支持256K上下文、可扩展至512K,能读懂整个代码仓库做工程级修改;在本地用约20分钟完成200页投标文件技术、商务、价格三方面初评,并逐条给出评分依据。

值得注意的是全栈国产化:模型完全基于华为昇腾910C算力训练,采用MindSpore/MindFormers框架,推理端也完成昇腾适配。官方称经多层次协同优化,整网训练吞吐较开箱性能提升约96%。

落地方面,智能客服业务已完成私有化部署,用户通话、身份信息和业务记录全程不出域,官方称复杂业务办理成功率已达90%以上。模型还适配OpenCode、Claude Code等Agent框架和vLLM、SGLang等工具链,并提供算网一体机、智算专线等部署路径。

中国电信AI开源了Xing4.0-29B-A4B,官方称这是一款全栈国产化的轻量级代码智能体大模型。模型总参数290亿,采用MoE架构,每次推理只激活约40亿参数;经4-bit量化后,显存占用可压缩至约15GB,一张RTX 3090即可运行。

该模型目前已在GitHub、Hugging Face、Gitee、魔搭、魔乐等平台开源上线,并同步支持API调用。截至量子位发稿,Xing4.0-29B-A4B已进入Hugging Face模型趋势榜单,位居第四。

据量子位报道,Xing4.0-29B-A4B完全基于华为昇腾910C算力训练,采用国产的MindSpore/MindFormers训练框架与开发套件,推理部署端也完成了昇腾的适配验证。

在部署方式上,中国电信提供了多条路径:企业可将模型预集成到算网一体机,减少环境搭建和安装配置工作;本地算力紧张时,可在满足自身数据管理要求的前提下,通过智算专线调用云端算力弹性扩容;模型还基于智源FlagOS统一开源AI软件栈,打通了多家国产芯片的适配路径。

4-bit量化把290亿参数模型压进一张RTX 3090

官方给出的数据是:传统FP16精度下,29B参数模型单卡显存占用约60GB,往往需要多卡或价格高昂的A卡;经过4-bit量化后,这部分占用可压缩至约15GB,降低约75%,让RTX 3090、4090等消费级显卡也能运行。

MoE架构是压低推理开销的一部分原因:290亿总参数中,每次推理只激活约40亿。这样每次处理任务时不必调动全部参数,计算开销随之降低。

256K上下文与本地200页投标文件初评

针对百亿参数模型在处理整仓库代码时的局限,Xing4.0-29B-A4B原生支持256K上下文,并可扩展至512K,让一次任务能装下更长的代码、文档、日志和历史记录。

量子位给出的场景示例是:一份200页的投标文件交过来,模型能在本地用约20分钟,完成技术、商务、价格三个方面的初评,并逐条给出评分依据。

另一个示例是把分散在Excel里的合同台账做成管控大屏——模型需理解表格中的业务数据,将合同概览、金额分布、风险识别和履约预警等需求组织到同一个页面中,数据全程不用离开企业环境。

在Agent方向,模型针对长程任务做了专项强化:用户一次说清需求后,模型可判断哪些步骤先做、哪些可以并行,再调用天气、日程、提醒、出行等工具或Agent推进任务。

已适配OpenCode、Claude Code等框架,智能客服业务落地

为接入企业现有工作流,Xing4.0-29B-A4B已针对OpenCode、Claude Code、OpenClaw、Hermes等主流Agent、Harness框架完成定向适配,同时兼容LLaMA-Factory、MindFormers、SGLang、vLLM、KTransformers等常用工具链。

在智能客服业务中,Xing4.0-29B-A4B已完成私有化部署,用户通话、身份信息和业务记录全程不出域。据量子位报道,面对复杂诉求,模型需要一路完成意图理解、任务拆解、工具调用、结果整合和合规校验,目前这套方案的复杂业务办理成功率已经达到90%以上。

从预训练4K到中训练256K,昇腾910C上训练吞吐提升约96%

据量子位介绍,中国电信自建了一套包含数十万亿词元的数据体系。预训练数据经过PB级多源清洗,除通用内容外,还加入了复杂表格、结构化知识图谱和智能体行为轨迹。行为轨迹记录一个任务从头到尾怎么做——目标、调用工具、返回结果、下一步操作,直接对应Agent能力。

训练阶段,预训练从4K序列长度起步,先学习通用知识和基础推理,再逐步提高代码与复杂推理数据占比;中训练阶段序列长度依次扩展到32K、128K和256K,同时增加仓库级代码、复杂推理和Agent数据;后训练阶段围绕Coding、Agent和Reasoning三个方向分别开展多专家强化学习,再通过MOPD融合。训练中还使用了Muon和QK-Clip。

架构层面,模型采用MLA多头潜变量注意力压缩KV Cache、MTP多Token预测加速生成,并引入DeepSeek同款的mHC流形约束超连接以减少训练不稳定。

工程优化方面,模型基于昇腾910C集群,结合MindSpore/MindFormers完成mHC等新特性适配、跨框架精度对齐及融合算子开发;针对计算调度和显存压力,采用DVM图算融合、细粒度重计算和Ascend C定制融合算子。据官方介绍,经过模型架构、编译、算子与硬件的多层次协同优化,整网训练吞吐较开箱性能提升约96%。后训练使用的Slime强化学习框架也完成了昇腾生态适配。

信息来源

量子位原始来源