产品量子位·原文 2026年9月22日

浪潮信息发布元脑SD200 Ultra与HC2000,称单机可跑10万亿参数模型

在AICC 2026上,浪潮信息发布超节点AI服务器元脑SD200 Ultra和多元算力机组元脑HC2000,分别针对前沿模型承载与Token产能问题;IDC同场报告预计2030年算力缺口绝对值将达3809亿美元。

AI解读:浪潮信息这次发布的两款产品,针对的是两个不同的算力问题。SD200 Ultra处理“单机能不能装下、跑得快不快、长时间稳不稳”,HC2000处理“同样的投资能产出多少Token”。

Agent是需求变化的直接原因。一次人类指令可能触发几十到几百次连续推理,多个Agent协作时系统可以连续运行几小时甚至几天,原本脉冲式的算力调用变成了持续负载。IDC给出的数字是,到2030年全球每年AI推理任务增长4000万亿次,今年到2030年全球Token消耗量复合增长率达4822.6%。

供给端跟不上。IDC报告显示全球AI算力需求满足率从2024年的79%下滑,2027年预计跌至71%,2030年恢复到约77%;因为需求基数膨胀,2030年算力缺口绝对值将达3809亿美元,接近2024年的十倍。

对买算力的人来说,这次发布真正的新信息是“多元算力分工”和“单机大模型容量”。HC2000让Prefill、Decode、FFN分别用不同芯片,MCIS软件栈负责路由和PD配比调整,浪潮称在典型Agent任务场景中同等投资下Token产能提升10倍。SD200 Ultra单机芯片从64颗增至128颗,显存8TB、扩展存储64TB,可单机运行2.8万亿参数的Kimi K3,并支持单机部署10万亿参数模型。

这些数字来自浪潮信息和IDC在会上的发布,属于厂商与报告方口径,尚没有第三方实测或客户案例佐证。对普通读者来说不需要立即行动;真正要评估的是,如果你的推理负载以Agent长任务为主,多元算力调度和KV Cache分级存储是否真能落到你的成本账上,这需要拿自己的业务负载去验证。

2026年9月22日,浪潮信息在AICC(人工智能计算大会)2026上发布两款产品:超节点AI服务器「元脑SD200 Ultra」和多元算力机组「元脑HC2000」。浪潮信息首席AI战略官刘军将算力瓶颈拆成两个方向——Capability AI Compute(能力型智算)和Capacity AI Compute(容量型智算)。

同场,IDC发布《2026年中国人工智能计算力发展评估报告》。报告称,到2030年全球每年AI推理任务将增长4000万亿次;今年到2030年全球Token消耗量复合增长率将达4822.6%;全球AI算力需求满足率从2024年的79%下滑,2027年预计跌至71%,2030年恢复到约77%;2030年算力缺口绝对值将达3809亿美元,扩大到2024年的将近十倍。

SD200 Ultra:单机128颗芯片,目标装下10万亿参数模型

SD200 Ultra延续去年SD200的3D Hyper Mesh架构,整机内芯片数量从64颗增加到128颗,显存和扩展存储提升到8TB和64TB。浪潮信息称,目前全球最大的开源模型Kimi K3有2.8万亿个参数,SD200 Ultra可以单机装下并高效运行,并支持在单机上部署10万亿参数的模型。

通信方面,SD200 Ultra通过全局统一编址、虚拟影子设备注册和跨域地址翻译,让128颗芯片的显存形成统一地址空间;再通过对称内存技术实现GPU显存直连。浪潮信息给出的数据是,All to All通信时延缩短到0.69微秒,达到国际主流超节点产品相当的水平。

计算方面,SD200 Ultra构建「超级算子」技术,把Attention、FFN、MoE等基础算子融合成计算与通信一体的大算子,算子数量降到十分之一。浪潮信息称,运行Kimi K3的推理性能提升3倍以上,Token生成时延低至5.85毫秒。文章提到,这一优化过程使用了K3来分析和重构推理流程。

稳定性方面,SD200 Ultra采用铜互联方案,减少光电转换环节,以降低长时间运行中因电路故障导致任务中断的风险。

  • 芯片:64颗增至128颗
  • 显存:8TB
  • 扩展存储:64TB
  • All to All通信时延:0.69微秒
  • Kimi K3推理性能提升:3倍以上
  • Token生成时延:5.85毫秒

HC2000:按推理阶段分配不同芯片,称同等投资Token产能提升10倍

HC2000的硬件基础是高密液冷AI整机柜,采用全液冷设计加高通流供电。浪潮信息称,单柜供电能力超过300千瓦,最多承载256张AI加速卡,算力密度达到传统风冷机柜的4倍。通信架构升级到Directcom 2.0,计算与通信带宽1比1均衡配比,柜内聚合带宽达200Tbps,支持跨柜多平面无损扩展,All to All通信性能提升50%以上。

其核心思路是让不同类型的芯片按推理阶段分工:Prefill阶段选择大算力芯片配合成本更优的显存颗粒;Decode阶段选择大容量HBM芯片;FFN计算环节选择3D RAM堆叠芯片。整机柜支持成熟的工业标准架构模组,适配多种算力芯片。

协调这些芯片的是「MCIS多元算力协同推理软件栈」,覆盖从请求路由、PD分离推理到算力动态调整的全链路。MCIS在模型部署前通过性能仿真评估不同芯片组合和PD配比;上线后对计算、缓存、传输各环节做全链路监控;业务负载变化时重新评估PD配比和实例分配。

浪潮信息称,MCIS打通不同类型算力之间的点对点数据直传,避免CPU中转和重复拷贝,数据传输性能提升近5倍;根据KV Cache数据冷热程度构建分级存储,结合多级流水并行聚合,节点内磁盘I/O性能提升32倍。最终在典型的Agent任务场景中,HC2000搭配MCIS在同等投资下实现了10倍的Token产能提升。

  • 单柜供电:超过300千瓦
  • 单柜最多承载:256张AI加速卡
  • 算力密度:传统风冷机柜的4倍
  • 柜内聚合带宽:200Tbps
  • 数据传输性能提升:近5倍
  • 节点内磁盘I/O性能提升:32倍
  • 同等投资Token产能提升:10倍(典型Agent任务场景)

刘军的类比:从「提供算力」到「生产智能」

刘军在AICC上的演讲中称,世界上第一台通用电子计算机ENIAC很重要,但真正改变几十亿人工作和生活的是个人电脑和智能手机;最先进的发电技术很重要,但真正改变工业社会的是稳定廉价的电力进入千家万户。他将AI的这一过程概括为:前沿智能的首次突破决定AI能做到什么,智能的普及程度决定它能改变什么。

文章称,Capability和Capacity互为因果:Capability突破出的新能力,经过算法优化和工程迭代,会以更低成本向下渗透,变成Capacity需要规模化供给的东西;Capacity把智能送到更多人手中后产生新应用和新需求,又反过来推动下一轮Capability。

文章提到,去年全球规模最大的开源模型是DeepSeek-R1,参数量6710亿;今年是Kimi K3,参数量2.8万亿。刘军称,「生产智能」的今天,用户买算力设施就应该像买电冰箱一样,插上电就能产Token。

信息来源

量子位原始来源