是石科技Meta-Infer引擎让PCIe显卡DeepSeek推理吞吐提升6.87倍
是石科技自研Meta-Infer高效部署引擎,通过内核补齐、通信重构等纯软件优化,在8张PCIe-Only显卡上把DeepSeek-V4.1-Flash输入吞吐从1932 tok/s提升至13274 tok/s,整体提升6.87倍,并支持1M超长上下文。
AI解读:是石科技这套方案想解决的不是模型跑不跑得起来,而是跑得有多慢。很多不在主流框架官方验证清单里的GPU卡,加载模型、拉起服务都没问题,但压测性能远低于硬件应有水平,问题出在框架与硬件之间的适配缝隙。
Meta-Infer的做法是纯软件修复:补齐被框架静默绕开的高性能内核,改写集合通信逻辑适配PCIe带宽,再针对Prefill和Decode分别调并行策略和显存参数。全程不改模型结构、不改权重、不改任务语义。
对用PCIe卡做推理的团队来说,这意味着手里已有的硬件可能还有一截性能没被释放出来。报道给出的一组数字是:8卡整机在视频生成任务上约2.6台对应1台B300的文生视频吞吐,加LoRA后缩到约1.5台。
不过对照口径需要留意:B300一侧按SGLang cookbook推荐参数配置,属于对方调优后的成绩,而6000D一侧是经过深度软件优化后的结果。另外这些数字来自厂商提供的测试,并非第三方独立验证。
是石科技(METASTONE)公布其自研Meta-Infer高效部署引擎的优化结果:在8张PCIe-Only显卡环境下运行DeepSeek-V4.1-Flash,输入吞吐从社区Day0基线版本的1932 tok/s提升至13274 tok/s,整体提升6.87倍,并支持1M超长上下文。
PCIe卡性能损失来自框架适配而非硬件缺陷
是石科技称,很多GPU卡能让开源框架完成模型加载、权重下载和服务拉起,实现“跑起来”,但实际压测性能往往远低于官方宣传水平。该公司将性能损失的核心原因归结为模型框架与硬件之间的适配鸿沟:这类GPU卡没有高速卡间互联,也不在主流开源框架的官方验证矩阵中。
使用社区默认部署方案时会出现一系列问题:算子自动回退至低效通用实现、集合通信沿用NVLink硬件的调优参数、显存与并行配置沿用其他硬件默认值。是石科技称,硬件本身具备的算力潜力被软件层的适配短板所禁锢。
Meta-Infer的优化逻辑分为两个阶段:算模协同释放被硬件差异屏蔽的高性能路径;通算重构打通瓶颈。最终沉淀为四项核心能力:内核补齐、算子优化与通信重构、并行与容量调优、缓存复用。全程不改动模型权重与模型结构,不改变原有业务任务语义。
内核补齐让DeepSeek-V4.1-Flash吞吐从1932提升至5850 tok/s
是石科技称,主流推理框架内置了大量高性能算子,但对于不在官方验证清单的长尾硬件,框架不会报错,只会静默绕开加速路径,降级运行低效通用逻辑。很多高性能内核并非缺失,只是元数据、页尺寸、硬件内核适配不匹配,导致无法被触发执行。
Meta-Infer通过内核补齐完成适配修复:对齐硬件与框架之间的元数据定义、修正页尺寸配置、解锁原生高性能算子路径;替换不适配硬件的老旧计算内核;扩大通信快路径的生效阈值,让更多规模的通信任务避开慢速回退逻辑。
以DeepSeek-V4.1-Flash为例,在8张PCIe-Only显卡环境的社区Day0基线版本中,输入吞吐仅1932 tok/s。经过算模协同阶段的修复适配——补齐sparse-MLA Prefill快路径、替换FP8稠密GEMM慢内核、扩大PCIe-IPC通信快路径覆盖范围——吞吐提升至5850 tok/s。是石科技称这一阶段不是创造全新算法,而是释放硬件与框架本就具备、却被适配问题锁住的性能。
同样的思路也复现在DeepSeek-V4-Flash、GLM5.3等模型上。是石科技称,仅完成算模协同,多款模型就拿到20%-33%不等的吞吐增益。
通算重构四层优化,DeepSeek-V4.1-Flash吞吐再升至13274 tok/s
完成硬件适配后,是石科技称性能瓶颈会转移到通信开销、并行调度、显存分配、重复计算等环节。PCIe-Only架构卡间通信带宽远低于NVLink,直接套用面向高速互联硬件的默认策略会让GPU大量时间等待通信完成。
在算子优化与通信重构层面,Meta-Infer对注意力、投影等关键算子做算子融合,压缩单步计算耗时;将计算任务和集合通信做时间重叠掩盖,把统计类计算嵌入通信间隙并行执行;改写集合通信逻辑适配PCIe带宽特性。
在并行与容量调优层面,放弃框架全局固化的并行参数,针对Prefill预填充、Decode生成不同运行阶段差异化配置张量并行和上下文并行策略;结合硬件显存特性动态调整静态显存占比和KV缓存容量参数;面向不同业务负载匹配流水线、张量并行的组合形态。
在缓存复用层面,针对长文本、视频生成场景提供风险感知的缓存复用机制,根据实时生成状态动态判断缓存复用与刷新时机。
在DeepSeek-V4.1-Flash的实践中,经过全套调优后输入吞吐从5850 tok/s进一步提升至13274 tok/s,整体实现6.87倍吞吐提升,支持1M超长上下文。
多模型与视频生成任务上的提升数据
是石科技称这套方法论覆盖文本大模型、长上下文、视频生成多类任务。DeepSeek-V4-Flash经过全套优化,输入吞吐从14546 tok/s提升至22584 tok/s,提升1.55倍。
GLM5.3的输入吞吐从3236.78 tok/s提升至6222.72 tok/s,提升1.92倍;P95首Token时延从141.6秒下降至46.6秒,上下文支持上限从27万Token拓展到105万Token。
MiniMax H3视频生成模型方面,依托稀疏注意力、自研风险感知缓存复用、Turbo LoRA多手段组合,15秒参考图生视频端到端生成速度提升2.48倍,峰值显存与原始稠密基线持平。单机8卡整机文生视频最高吞吐达到基线的5.33倍,参考图生视频达到基线的4.98倍。
与B300的对照及国产GPU验证
是石科技给出与B300的对照数据。在相同并发点配对比较下(均在8卡整机口径),B300的输入吞吐约为该8卡整机的4.9至5.6倍(DeepSeek-V4-Flash,B300侧按SGLang cookbook推荐参数配置,C8输入33937 tok/s、C256输入60486 tok/s);GLM-5.3上这一比值为3.5至4.7倍(B300侧C8输入16384 tok/s、C64输入23503 tok/s)。
在视频生成任务上,统一整机口径(单机8卡、5秒、768P、16:9)下,该方案文生视频296条/时、参考图生视频131条/时,对应B300的439条/时、225条/时,分别约为其67%和58%。B300侧按SGLang cookbook推荐参数配置,取16实例、每实例Inflight=1的最优档,文生视频对照的是B300的FL2VA结果。
按整机吞吐折算,在几乎无损的Ours Cache方案下,约2.6台6000D可对应1台B300的文生视频吞吐,参考图生视频约为2.9台;在Ours Cache加LoRA方案下,这一比例缩小到约1.5台和1.7台。
国产GPU方面,是石科技称同一套方法论同样成立。注意力模块需要显式启用面向该平台优化的NSA稀疏注意力实现;Shared Expert融合等默认面向NVIDIA/AMD平台的特性需要关闭。通信策略按推理阶段分别配置:Prefill采用偏吞吐优化的DeepEP normal模式,Decode采用偏时延优化的low_latency模式,并将Shared Expert与Routed Expert拆分到两条stream中并行提交。仅这一改动就在35组同配置配对测试中带来11.26%的吞吐提升。