开源vLLM Releases·原文 2026年9月22日

vLLM v0.30.0发布:762 次提交、315 位贡献者,新增Fast Start权重缓存与Gumbel-max水印

这一版把重启引擎从磁盘重载权重改成用CUDA IPC直接映射常驻显存缓存,并加入可检测的Gumbel-max水印生成,同时把DeepSeek-V4.1-Flash、GLM-5.3-Flash、Kimi K3等新模型的推理路径做了针对性优化。

AI解读:vLLM v0.30.0是一个体量很大的版本:762 次提交、315 位贡献者,其中 104 位是新贡献者。这一版没有单一的功能主线,而是同时铺开了新模型支持、启动加速、水印生成和显存压力下的稀疏解码等方向。

对自建推理服务的人来说,最直接的变化是Fast Start:一个常驻每块GPU的权重缓存守护进程把量化后、按张量并行切分的权重留在显存里,引擎重启时通过CUDA IPC映射,用 --load-format ipc_cache取代从磁盘重载。目前覆盖FP4检查点和多节点张量并行,官方给出的场景是频繁重启引擎的开发和调优流程。

水印方面,这一版加入了Gumbel-max水印生成与检测,使用带密钥的PRF,支持按请求退出,并提供一个示例检测端点;双密钥方案让它能兼容投机解码。这意味着服务方可以在不改模型的前提下标记输出并在事后检测,但这是按请求可选项,不是默认开启。

性能优化集中在具体模型上:Kimi K3移除KDA混合批处理中的gather/scatter,官方称端到端吞吐提升 5.2%–7.7%;Qwen3.8-Flash-Next的NVIDIA实现移除torch.compile,使FP8能放进单张GB300。这些数字来自发布说明,适用条件以对应PR为准。

破坏性变更需要注意:普通vllm serve的scale-out端点改为通过 --enable-scale-out显式开启,替代VLLM_ENABLE_SCALE_OUT_ENDPOINTS;GPTQ的激活排序g_idx被移除;0.29 已弃用的项包括VLLM_PREFIX_CACHE_RETENTION_INTERVAL和VLLM_MM_HASHER_ALGORITHM环境变量被删除。升级前要检查启动脚本是否依赖这些开关。

vLLM项目发布v0.30.0,该版本包含 762 次提交,来自 315 位贡献者,其中 104 位是新贡献者。以上数字来自项目发布说明。

新模型支持包括DeepSeek-V4.1-Flash、DeepSeek-V4-Flash-Vision-Exp、GLM-5.3-Flash、K2-Horizon、Cohere Compass、Bailing V3 VL、经Transformers后端的Nanbeige4.2,以及一个带AVX512/AMX稀疏MLA、indexer、mHC和compressor内核的DeepSeek-V4 CPU后端。

Fast Start引入一个常驻每块GPU的权重缓存守护进程,把量化后、按张量并行切分的权重保存在GPU内存中,重启引擎时通过CUDA IPC映射,使用 --load-format ipc_cache,而不是从磁盘重新加载;该机制现在覆盖FP4检查点和多节点张量并行。

水印功能提供Gumbel-max水印生成与检测,使用带密钥的PRF,支持按请求退出,并提供示例检测端点;双密钥Gumbel-max使其兼容投机解码,Rust前端转发按请求的控制项。

破坏性变更方面:普通vllm serve的scale-out端点改为通过 --enable-scale-out显式开启,替代VLLM_ENABLE_SCALE_OUT_ENDPOINTS环境变量;GPTQ激活排序g_idx被移除;0.29 已弃用的项被删除,包括VLLM_PREFIX_CACHE_RETENTION_INTERVAL和VLLM_MM_HASHER_ALGORITHM环境变量;all Mamba缓存模式被弃用;python -m vllm.entrypoints.grpc_server被弃用,改用vllm serve --grpc。

发布说明还明确标注YaRN已与Transformers对齐,因此厂商YaRN别名不再重新缩放max_model_len。

Fast Start与HiSparse:显存里的权重缓存和稀疏解码的主机侧分层

Fast Start的权重缓存守护进程按GPU常驻,持有量化后、TP切分的权重,重启引擎时以CUDA IPC映射。发布说明给出的配套参数是 --load-format ipc_cache。该机制已扩展到FP4检查点和多节点TP,并加入GPU UUID socket目录、按客户端导出IPC张量,以及在非CUDA/ROCm平台上的明确报错。

  • --load-format ipc_cache用于映射常驻显存缓存,替代从磁盘重载(#54921)
  • 覆盖FP4检查点(#55465)与多节点TP(#55468)
  • GPU UUID socket文件夹(#56669);非CUDA/ROCm平台给出明确错误(#56010)

模型性能:Kimi K3、Qwen3.8-Flash-Next与DeepSeek系列的具体优化

Kimi K3方面,SM100上原生CUDA AttnRes成为默认;KDA混合批处理中的gather/scatter被移除,发布说明称端到端吞吐提升 5.2%–7.7%;分组FP8 MLA缓存插入在小批量下带来 4–6 倍内核加速;DSV3低延迟GEMM在strided张量上带来 12%–81% 内核加速。另有FlashInfer KDA内核、TP8 KDA投影重叠、带部分前缀缓存和投机解码的内部前缀检查点,以及混合Mamba模型的对称DCP分离。

Qwen3.8-Flash-Next方面,预填充和解码的QSA indexer内核分离,PLE内核融合,加入FP8 indexer缓存,稀疏GQA跳过填充索引,UVA PLE卸载与Engram张量并行通过 --engram-config开启,NVIDIA实现移除torch.compile以便FP8放进单张GB300。

DeepSeek系列方面,DeepSeek-V4.1-Flash在SM100上通过FlashMLA V4.1 record将全部KV以MXFP8存储,加入DeepGEMM Mega-mHC和Engram DP分片下的异步Engram预取。GLM-5.3-Flash加入EPLB支持,FlashKDA用于KDA分块预填充,发布说明称比Triton分块路径快 1.7–3.8 倍。

  • Kimi K3:混合批处理KDA移除gather/scatter,端到端吞吐 +5.2%–7.7%(#56159)
  • Kimi K3:分组FP8 MLA缓存插入,小批量内核加速 4–6 倍(#55356)
  • Kimi K3:DSV3低延迟GEMM在strided张量上内核加速 12%–81%(#54565)
  • Qwen3.8-Flash-Next:NVIDIA路径移除torch.compile,FP8可放入单张GB300(#55272)
  • DeepSeek-V4.1-Flash:SM100上全部KV以MXFP8存储(#56893)
  • GLM-5.3-Flash:FlashKDA分块预填充比Triton分块路径快 1.7–3.8 倍(#55737)

大规模服务、投机解码与量化

大规模服务方面,稀疏MLA模型支持PCP+DCP,PCP支持单模块MTP和复制的DSpark,以及仅解码的FULL CUDA图;Elastic EP在重配置间复用CUDA图;面向无NVLink机器提供可选的FlashInfer PCIe IPC all-reduce;DeepEP v2异步finalize将共享专家与combine重叠;Mooncake Store支持异构TP共享;加入KVCR二级适配器;编码器缓存在NIXL和Mooncake上共享。

投机解码方面,提供可选的disable_eagle_block_drop,自适应验证支持FLASHINFER_MLA_SPARSE_DSV4并推迟到内核预热之后,全词表EAGLE3 drafter跳过词表重映射,DSpark保留目标DCP配置,DFlash drafter丢弃FlashAttention的AOT调度。

量化方面,通过quantization_config.targets支持定向在线量化,并支持对任意量化方法的部分预量化检查点;加入W4A16 DSA与nvfp4_fp8_ds_mla KV缓存;在SM100/103上FlashInfer CuTeDSL NVFP4 W4A16默认取代Marlin;torch linear后端支持NVFP4;支持按量化覆盖线性后端;CUDA上支持AutoRound 2/3/5/6/7-bit;DSA稀疏indexer加入DeepSelect top-k。

  • 稀疏MLA模型支持PCP+DCP(#56157);PCP支持单模块MTP和复制的DSpark(#56107)
  • 面向无NVLink机器提供可选的FlashInfer PCIe IPC all-reduce(#53576)
  • DeepEP v2异步finalize将共享专家与combine重叠(#52781)
  • 量化:quantization_config.targets定向在线量化(#51285);任意量化方法的部分预量化检查点(#51392)
  • 量化:SM100/103上FlashInfer CuTeDSL NVFP4 W4A16默认取代Marlin(#53014)
  • 量化:CUDA上支持AutoRound 2/3/5/6/7-bit(#52890)

引擎核心与模型运行器V2

Model Runner V2在eager模式下支持双批重叠,并在微批步骤中支持FULL CUDA图;流水线并行下支持MTP和EAGLE3/DFlash/DSpark投机解码;通过在线接受率估计器为所有draft模型投机器提供自适应验证。发布说明称在H200上,图捕获期间冻结gc将捕获时间从 12 秒降到 2 秒,引擎初始化从 28.9 秒降到 8.2 秒。--return-sampling-mask在GPU上压缩,修复了约 2 倍的RL步骤时间回退。

前缀缓存与调度方面,保留两个重放边界,使EAGLE对块对齐提示的重发仍能命中;针对延迟KV释放停止零进展抢占级联;SWA层采用主块大小以避免抬高KV块LCM;加入vllm:request_num_preemptions直方图。

内核方面,加入Mamba2的FlashInfer ReplaySSM后端、SM120/SM121上通过 --attention-backend B12X_ATTN启用的B12X因果分页注意力、SM90上的FlashInfer XQA解码、通过 --sparse-indexer-topk-backend的DeepSelect top-k、SM100上FP32-router模型的BF16x3 router GEMM默认值,以及小批量下的split-row Triton top-p。

  • H200上图捕获从 12 秒降到 2 秒,引擎初始化从 28.9 秒降到 8.2 秒(#54646)
  • --return-sampling-mask在GPU上压缩,修复约 2 倍RL步骤时间回退(#54901)
  • MRV2特定Triton JIT预热迁移被回退(#56654)
  • Mamba2加入FlashInfer ReplaySSM后端(#52506);SM120/SM121支持B12X因果分页注意力(#52017)

发布产物与安装方式

发布说明列出了各平台的Python wheel和Docker镜像。PyPI默认对应CUDA 13.0;ROCm走https://wheels.vllm.ai/rocm/0.30.0/rocm723的额外索引;XPU需要PyTorch的XPU索引并设置 --index-strategy unsafe-best-match。

Docker镜像包括CUDA 13.0默认镜像vllm/vllm-openai:v0.30.0、CUDA 12.9的v0.30.0-cu129、Ubuntu 24.04变体、ROCm的vllm-openai-rocm:v0.30.0、CPU的vllm-openai-cpu:v0.30.0和XPU的vllm-openai-xpu:v0.30.0。Assets区域还提供源码tar包,以及x86_64和arm64的CUDA 12.9、CUDA 13.0 wheel,x86_64、arm64和macOS的CPU wheel,和x86_64的XPU wheel。

  • PyPI:pip install vllm(CUDA 13.0);uv可用uv pip install vllm --torch-backend=auto
  • Docker默认:docker pull vllm/vllm-openai:v0.30.0;CUDA 12.9:v0.30.0-cu129
  • CPU镜像:vllm/vllm-openai-cpu:v0.30.0;XPU镜像:vllm/vllm-openai-xpu:v0.30.0

信息来源

vLLM Releases原始来源