DeepSeek开源昇腾基础设施组件,含TileLang编译工具与DeepEP通信库
9月30日,DeepSeek面向华为昇腾平台开源DeepGEMM、FlashMLA、TileKernel、DeepSelect等高性能算子库及DeepEP分布式通信库,与此前GPU平台开源组件一一对应;华为同步在CANN社区开源大EP低延时推理、单卡/单机部署等联合创新成果。
AI解读:DeepSeek把此前只面向GPU开源的一套底层组件搬到了华为昇腾上,包括算子库和通信库。这解决的是昇腾平台缺少高效基础软件的老问题:模型团队想在昇腾上把训练和推理跑快,过去往往要自己啃底层调优。现在官方给出可复用的组件和调优范例,迁移和开发成本会下降。
真正受影响的是在昇腾集群上部署大模型的公司和开发者。华为给出的实测数字显示,DeepSeek-V4.1-Flash基于EP32、离线推理、128K上下文下,TPOT=5ms时每卡输出吞吐2469 tokens/s,TPOT=10ms时为5102 tokens/s。这些数据不含服务调度和框架负载均衡,属于纯模型性能,实际线上表现要另测。
这次开源还暴露了训推链路的边界:通信库实测Dispatch 375 GB/s、Combine 347 GB/s,接近硬件上限,配合128卡单层交换和256K卡两层交换的组网方案,目标是把更大模型塞进更大集群。对普通用户而言不必立刻行动,但做国产算力选型的团队多了一个可验证的参考点。
2026年9月30日,DeepSeek正式开源面向昇腾算力平台的基础设施组件,涵盖TileLang高级语言编译工具、高性能计算库与分布式通信库,与此前面向GPU平台开源的组件一一对应。
本次开源发布的组件包括DeepGEMM、FlashMLA、TileKernel、DeepSelect等高性能昇腾算子库,以及DeepEP分布式通信库。
昇腾提供了稳定、开放的Ascend C API接口,使用户可对访存路径及计算流水线进行深度调优,完成高性能算子开发;同时依托开放Ascend C编程接口与PTO ISA底层指令体系,支持DeepSeek的TileLang编程开源工作。昇腾生态兼顾不同开发范式,既支持资深开发者手工调优,也支持TileLang等高级语言编译对接。
华为向DeepSeek团队提供了联合定义的昇腾超节点SuperPoD Flex和UBL128组网方案,可实现128卡3.2Tbps单层交换Scale-up网络和256K卡两层交换Scale-out网络,支持超低时延推理和前沿基座模型的大规模训练需求。
基于全互联的UBL128超节点,昇腾提供了ASC-COMM高性能自定义通信编程库,支撑用户通信算子与通算融合算子高性能编程。DeepSeek团队开发的高性能DeepEP通信库涵盖EP/CP/PP/FSDP等模式下的通信算子,为更大模型向更大集群扩展提供支持,互联带宽实测达到Dispatch 375 GB/s、Combine 347 GB/s,接近硬件上限。
为支持广泛开发者基于昇腾950及超节点集群部署DeepSeek模型,华为将此次联合创新成果在CANN社区开源,包括大EP低延时推理部署、单卡/单机部署、大规模训练、超长文本KVcache池化与Agentic RL。
推理性能实测:TPOT=5ms时每卡2469 tokens/s
面向大规模推理场景,基于EP32部署策略,offline推理模式下DeepSeek-V4.1-Flash不带框架纯模型性能可实现TPOT=5ms、每卡输出吞吐2469 tokens/s;TPOT=10ms时每卡输出吞吐5102 tokens/s。
来源注明,Benchmark数据均基于Offline推理模式采集,不包含Serving调度和框架负载均衡影响,ContextLength=128K,Dspark投机接受率0.85,profiling链接见附录《DeepSeek-V4.1-Flash超节点部署推理优化实践》。
- EP32部署策略,offline推理模式
- TPOT=5ms:每卡输出吞吐2469 tokens/s
- TPOT=10ms:每卡输出吞吐5102 tokens/s
- ContextLength=128K,Dspark投机接受率0.85
- 数据不含Serving调度和框架负载均衡影响
CANN社区同步开源多类部署实践
华为在CANN社区开源的内容还包括大EP低延时推理部署、单卡/单机部署、大规模训练、超长文本KVcache池化与Agentic RL。来源附有通信编程体系、通算并行算子开发、PyTorch原生框架预训练、低精度量化训练、LoRA微调、Agentic RL训练等实践链接。
量子位注明本文由华为提供,获授权转载,观点归原作者所有。
- 基于UB memory和URMA通信编程接口的通算并行算子开发实践
- 基于CANNBot-DSL的高性能融合算子开发实践
- DeepSeek-V4.1-Flash超节点部署、单机低时延、单卡部署推理优化实践
- 基于PyTorch原生框架的预训练实践与低精度量化训练实践
- DSpark草稿模型昇腾训练、单机LoRA微调实践
- 基于鲲鹏CPU、昇腾950、灵衢协同的Agentic RL训练实践