开源SGLang Releases·原文 2026年10月2日

SGLang v0.5.21发布:779 个PR,支持DeepSeek-V4.1 Flash等新模型

SGLang发布v0.5.21,合并 779 个PR、来自 227 位贡献者。新增DeepSeek-V4.1 Flash、Qwen-Image 2.1等 10 个模型支持,PD实例可不停机切换prefill/decode角色。

AI解读:SGLang的v0.5.21版本把重点放在“少停机、多模型”上:PD(预填充-解码分离)实例首次可以动态切换prefill和decode角色,不用重启服务。对运维方来说,这意味着可以在流量波动时重新分配同一批机器的角色,而不必停机改配置。

新模型覆盖了一个罕见的跨度:从DeepSeek-V4.1 Flash、小米MiMo-V2.6、GigaChat 3.5这样的LLM/VLM,到Qwen-Image 2.1、FLUX 3 Action这样的扩散与动作模型。SGLang不只服务于文本推理,图像和VLA也被纳入同一套服务框架。

几个性能数字值得留意,但都带条件:DeepSeek-V4.1在长提示下的首token延迟快 22%,Kimi K3在PD服务下prefill吞吐提升 20.6%,这些是官方公布的对比,并非所有部署都能复现。

对使用者最实际的两点:前缀缓存默认换到Rust核心,以及新增 /v1/decisions和 /v1/score两个API,前者把LLM/VLM当作低延迟分类器或打分器使用。如果正在自建推理服务,这次升级主要影响缓存行为与接口调用方式,升级前建议核对现有请求路径是否依赖旧缓存实现。

SGLang发布v0.5.21,包含来自 227 位贡献者的 779 个PR(依据版本发布说明摘要)。

该版本新增对DeepSeek-V4.1 Flash、GigaChat 3.5、IQuest-Q1、MiMo-V2.6 / MiMo-V2.6-Pro、Ling-3.0-flash-VL、DiffusionGemma、Qwen-Image 2.1、Anima Base v1.0、Ming-Image 0.1 Design / Design-Layer、FLUX 3 Action等模型的支持,覆盖LLM、VLM、Diffusion和VLA类型。

关键特性之一是PD实例可在prefill与decode之间实时切换,无需重启。

发布说明列出的性能数据均为官方对比:DeepSeek-V4.1在长提示下首token快 22%;Kimi K3在PD服务下prefill吞吐高 20.6%。

安装命令为uv pip install --prerelease=allow sglang==0.5.21,官方提供NVIDIA CUDA 13、AMD MI35x / MI30x、Intel GPU与Intel CPU的Docker镜像。

新增模型支持

发布说明列出的新模型包括:

非扩散类:DeepSeek-V4.1 Flash、GigaChat 3.5、IQuest-Q1、MiMo-V2.6 / MiMo-V2.6-Pro、Ling-3.0-flash-VL,均标记为LLM / VLM。

扩散类:DiffusionGemma、Qwen-Image 2.1、Anima Base v1.0、Ming-Image 0.1 Design / Design-Layer,以及VLA类型的FLUX 3 Action。

  • DeepSeek-V4.1 Flash(LLM / VLM)
  • GigaChat 3.5(LLM / VLM)
  • IQuest-Q1(LLM / VLM)
  • MiMo-V2.6 / MiMo-V2.6-Pro(LLM / VLM)
  • Ling-3.0-flash-VL(LLM / VLM)
  • DiffusionGemma(Diffusion)
  • Qwen-Image 2.1(Diffusion)
  • Anima Base v1.0(Diffusion)
  • Ming-Image 0.1 Design / Design-Layer(Diffusion)
  • FLUX 3 Action(VLA)

关键特性与API

PD实例可在prefill与decode之间实时切换,无需重启(PR #28403)。

前缀缓存默认运行在Rust核心上(PR #39627)。

新增Decisions API(/v1/decisions),可将LLM / VLM化为低延迟的分类器和打分器(PR #41208)。

Score API(/v1/score)可在单次请求中对所有候选打分(PR #38965、#41188)。

在PP、DP attention和CP下结果更准确,层间通信现由SGLang处理(PR #41557)。

可在ComfyUI内通过SGLang Diffusion运行MiniMax-H3(PR #35990)。

  • PD角色热切换:#28403
  • 前缀缓存Rust核心:#39627
  • DeepSeek-V4.1长提示首token快 22%:#40352
  • Kimi K3 PD服务prefill吞吐高 20.6%:#40045
  • 层边界通信由SGLang统一处理:#41557
  • Decisions API /v1/decisions:#41208
  • Score API /v1/score:#38965、#41188
  • ComfyUI内运行MiniMax-H3:#35990

安装与平台镜像

升级命令:uv pip install --prerelease=allow sglang==0.5.21。

官方提供的Docker镜像按平台区分。

  • NVIDIA (CUDA 13):lmsysorg/sglang:v0.5.21
  • AMD MI35x:lmsysorg/sglang:v0.5.21-rocm10-mi35x
  • AMD MI30x:lmsysorg/sglang:v0.5.21-rocm10-mi30x
  • Intel GPU:lmsysorg/sglang:v0.5.21-xpu
  • Intel CPU:lmsysorg/sglang:v0.5.21-xeon

完整发布说明中的其他变更

完整发布说明涵盖投机解码、可分段/可中断CUDA Graph、注意力后端、MoE与专家并行、量化、并行与分离式部署、调度器与运行时等类别,以下为其中带具体数字的条目。

投机解码方面:为LFM2-VL增加DSpark投机解码,batch 1下加速 1.66 倍至 2.56 倍(#40651);为Kimi K3支持DFLASH(#40794)。

可分段CUDA Graph方面:在启用BCG时优化C4 Indexer的高内存占用,捕获内存从 58% 降至 18 GB(#36534)。

量化方面:支持SM100 NVFP4 GenMHA与投机解码,1M上下文下解码注意力内核快 1.355 倍(#36340)。

分离式部署方面:以请求自有的投机KV降低解码引导延迟,DeepSeek-V4-Pro 1P1D、MI355X、并发 256 下平均TTFT从 19.4 秒降至 15.1 秒(#38978);按pack容量限制缓存前缀DCP传输,Kimi Linear、8×B200、并发 8 下缓存前缀吞吐约提升 10.9 倍(#40376)。

  • LFM2-VL DSpark投机解码:batch 1加速 1.66–2.56 倍(#40651)
  • C4 Indexer捕获内存降至 18 GB(#36534)
  • SM100 NVFP4解码注意力在 1M上下文快 1.355 倍(#36340)
  • DeepSeek-V4-Pro 1P1D平均TTFT从 19.4 秒降至 15.1 秒(#38978)
  • Kimi Linear缓存前缀吞吐约提升 10.9 倍(#40376)

依据说明

本文依据SGLang Releases的v0.5.21页面及其摘要撰写,未逐条核对全部PR的代码改动。

信息来源

SGLang Releases原始来源