sglang v0.5.13
sglang v0.5.13
SGLang v0.5.13 新增对 Nemotron 3 Ultra、Step-3.7-Flash、Command A+、Cosmos3、LingBot-World、SANA-WM、Ernie-Image、FLUX.2-Klein 4B/9B、Ideogram 4 等模型的支持。Spec V2 成为默认 speculative-decoding 路径,Spec V1 已弃用。通过 FutureMap 降低每步调度器开销,分段与可中断 CUDA Graph 扩展至 DSA、Kimi-K2.5、DeepSeek V4。在 Blackwell GPU 上加速 Qwen 3.5,默认对混合模型启用 HiCache。与 Intel 合作实现异构 CPU+GPU EPD 分离,与 AMD 合作在 MI355X 上使用 MoRI 实现 DeepSeek-R1 分离推理。DeepSeek V4 支持上下文并行与稀疏注意力 kernel。
亮点
新增模型支持:
- 自回归模型:Nemotron 3 Ultra(Day-0,博客)、Step-3.7-Flash、Command A+
- 扩散模型:Cosmos3、LingBot-World、SANA-WM、Ernie-Image、FLUX.2-Klein 4B/9B、Ideogram 4
Spec V2 现为默认的 speculative-decoding 路径:在 triton / FA3 / MLA / aiter 后端上,使用 topk > 1 的 tree drafting 已可投入生产,包括 page_size > 1 以及 Mamba/hybrid-linear 模型(#26997、#26972、#27463)。Spec V1 已弃用,EAGLE/MTP 现在运行在统一的 V2 worker 上(#25464),且 topk = 1 的 drafting 速度更快(#26397、#26424)。
更低的每步调度器开销:通过 FutureMap 实现统一的异步值传递,并将 prefill 输入传输移至 forward 流,从而降低了每步启动开销,并提高了高并发下的稳定性(#25945、#25879、#26380)。
分段与可中断 CUDA Graph 覆盖范围:分段(PCG)和可中断(BCG)CUDA Graph 能捕获更多模型部分,以减少每步 kernel 启动开销,现已扩展至 DSA 模型、Kimi-K2.5 和 DeepSeek V4:#23351、#26382、#25195。
在 Blackwell 上加速 Qwen 3.5:新的 FlashInfer Gated DeltaNet(GDN)kernel 和 CuTeDSL GDN prefill kernel 在 Blackwell GPU 上加速了 Qwen 3.5:#22921、#23273、#26200。
默认对混合模型启用 HiCache:HybridModel(SWA/Mamba)通过 UnifiedTree 默认启动 HiCache,为滑动窗口和 Mamba 混合模型提供了开箱即用的分层 KV-cache 卸载:#27759。
异构 CPU + GPU EPD 分离(与 Intel 合作):将 VLM 视觉编码卸载到 Intel Xeon CPU 上,与 GPU 协同工作,在负载下 P99 TTFT 和请求吞吐量提升可达约 1.3 倍。(博客)
在 AMD Instinct MI355X 上使用 MoRI(与 AMD 合作):通过 AMD 的 MoRI 通信库实现具有成本竞争力的 DeepSeek-R1 分离推理,每百万 token 成本 0.169 美元,速度为 129 tok/s/user。(博客)
DeepSeek V4 — 上下文并行与稀疏注意力 kernel:在 v0.5.12 Day-0 路径的基础上,v0.5.13 将 DeepSeek-V4 扩展至上下文并行服务,并添加了其稀疏注意力 kernel:
- 上下文并行 + MTP:#24934
- 上下文并行 + 融合 MoE kernel(非 DeepEP):#24947
- 通过
flash_mla_sparse_fwd实现的稀疏 FlashMLA:#25418 - FP4 indexer 支持:#26209
- SM12…
[余略,详见 https://github.com/sgl-project/sglang/releases/tag/v0.5.13]