GitHub · 版本发布

sglang v0.5.13

sglang v0.5.13

二〇二六年八月二十六日 · 英文原文

SGLang v0.5.13 新增对 Nemotron 3 Ultra、Step-3.7-Flash、Command A+、Cosmos3、LingBot-World、SANA-WM、Ernie-Image、FLUX.2-Klein 4B/9B、Ideogram 4 等模型的支持。Spec V2 成为默认 speculative-decoding 路径,Spec V1 已弃用。通过 FutureMap 降低每步调度器开销,分段与可中断 CUDA Graph 扩展至 DSA、Kimi-K2.5、DeepSeek V4。在 Blackwell GPU 上加速 Qwen 3.5,默认对混合模型启用 HiCache。与 Intel 合作实现异构 CPU+GPU EPD 分离,与 AMD 合作在 MI355X 上使用 MoRI 实现 DeepSeek-R1 分离推理。DeepSeek V4 支持上下文并行与稀疏注意力 kernel。

亮点

新增模型支持

Spec V2 现为默认的 speculative-decoding 路径:在 triton / FA3 / MLA / aiter 后端上,使用 topk > 1 的 tree drafting 已可投入生产,包括 page_size > 1 以及 Mamba/hybrid-linear 模型(#26997#26972#27463)。Spec V1 已弃用,EAGLE/MTP 现在运行在统一的 V2 worker 上(#25464),且 topk = 1 的 drafting 速度更快(#26397#26424)。

更低的每步调度器开销:通过 FutureMap 实现统一的异步值传递,并将 prefill 输入传输移至 forward 流,从而降低了每步启动开销,并提高了高并发下的稳定性(#25945#25879#26380)。

分段与可中断 CUDA Graph 覆盖范围:分段(PCG)和可中断(BCG)CUDA Graph 能捕获更多模型部分,以减少每步 kernel 启动开销,现已扩展至 DSA 模型、Kimi-K2.5 和 DeepSeek V4:#23351#26382#25195

在 Blackwell 上加速 Qwen 3.5:新的 FlashInfer Gated DeltaNet(GDN)kernel 和 CuTeDSL GDN prefill kernel 在 Blackwell GPU 上加速了 Qwen 3.5:#22921#23273#26200

默认对混合模型启用 HiCache:HybridModel(SWA/Mamba)通过 UnifiedTree 默认启动 HiCache,为滑动窗口和 Mamba 混合模型提供了开箱即用的分层 KV-cache 卸载:#27759

异构 CPU + GPU EPD 分离(与 Intel 合作):将 VLM 视觉编码卸载到 Intel Xeon CPU 上,与 GPU 协同工作,在负载下 P99 TTFT 和请求吞吐量提升可达约 1.3 倍。(博客

在 AMD Instinct MI355X 上使用 MoRI(与 AMD 合作):通过 AMD 的 MoRI 通信库实现具有成本竞争力的 DeepSeek-R1 分离推理,每百万 token 成本 0.169 美元,速度为 129 tok/s/user。(博客

DeepSeek V4 — 上下文并行与稀疏注意力 kernel:在 v0.5.12 Day-0 路径的基础上,v0.5.13 将 DeepSeek-V4 扩展至上下文并行服务,并添加了其稀疏注意力 kernel:

[余略,详见 https://github.com/sgl-project/sglang/releases/tag/v0.5.13]

译自 GitHub · 版本发布 · 录于 二〇二六年八月二十六日