sglang v0.5.16
sglang v0.5.16
SGLang v0.5.16 由 169 位贡献者提交 574 个 PR。新增 DSpark 推测解码算法,基于置信度动态调整验证窗口,在 DeepSeek-V4-Pro 上 B300 TP8 配置下达到 383.7 tok/s。支持 975B 参数多模态 MoE 模型 Inkling,输入速度达 71.7k tok/s。UnifiedRadixTree 成为 SWA、Mamba 和 DSA 模型的默认选项。GLM-5.2 DSA 缓存层在 prefill CP 下拆分,KV 内存减少约 74%。ReplaySSM 环形 Spec-Verify 将推测暂存空间从 11.5 GB 降至每 GPU 1.8 GB。Blackwell 上实现首个正确 KDA MTP 路径,`recurrent_kda` 解码内核运行时间为 29.6 us。移除 QServe 和 FBGEMM FP8 量化路径。
亮点
来自 169 位贡献者的 574 个 PR。
DSpark:基于置信度的推测解码:一种新的推测算法。它以块为单位进行半自回归草稿生成,然后根据草稿自身的置信度确定每个验证窗口的大小,而非使用固定的草稿长度。在 DeepSeek-V4-Pro 上,B300 的 TP8(bs=1)配置下,接受长度约 5 时达到 383.7 tok/s。通过 --speculative-algorithm DSPARK 和 SGLANG_RAGGED_VERIFY_MODE=compact 启用;使用 --speculative-dspark-block-size 调整块大小(#30261、#31434、博客)。
Inkling 支持:一个 975B 参数的多模态 MoE,支持 100 万 token 上下文。它混合了滑动窗口、全注意力和 Mamba2 线性注意力,并增加了 NVFP4 MoE、可选的视觉/音频塔以及原生 MTP。在 Blackwell 上,输入速度可达 71.7k tok/s,每用户解码速度可达 171.0 tok/s。已在 Blackwell TP4/TP8、H200 和 AMD MI350X / MI355X 上验证(#31681、博客、cookbook)。
新增的其他模型:LongCat 2.0 FP8、JetBrains Mellum v2、Pi0.5,以及 LongLive 2.0 的扩散支持。
UnifiedRadixTree 现已成为 SWA、Mamba 和 DSA 模型的默认选项。Replay SSM 和 Mamba int8 检查点已同步到该树上,缓存命中现在仅重置其使用的状态(#30468、#30636、#30626、#31643)。
GLM-5.2 DSA 缓存层在 prefill CP 下拆分:KV 和索引器缓存层在 CP rank 之间分片。每个 rank 拥有一个不相交的层范围,而非所有层。在 GLM-5.2-FP8(78 层,cp_size=4)上,8192 token 时,每个 rank 的 KV 内存减少了约 74%(从 0.77 GB/rank 降至 0.20 GB/rank)。通过 --enable-dsa-cache-layer-split 启用,该选项需要 --enable-prefill-cp --cp-strategy interleave(#29421)。
ReplaySSM 环形 Spec-Verify (GDN):移除了每个草稿的 SSM 快照。在 Qwen3.5-35B-A3B 的 TP1 上,推测暂存空间从 11.5 GB 降至每 GPU 1.8 GB(缩小 6.4 倍),且精度和吞吐量持平。通过 --enable-gdn-replayssm-spec 选择启用(默认关闭;仅使用线性草稿链的 GDN,--speculative-eagle-topk 为 {None, 1}),并通过 --linear-replayssm-cache-len 调整环形大小(#28695)。
Blackwell (SM100) 上的线性注意力:首个正确的 KDA MTP 路径。其 recurrent_kda 解码内核运行时间为 29.6 us,而 Triton 为 36.8 us(ncu,B=64)。完整解码路径在 B=128 时达到持平,在 B=256 时达到 1.35 倍,低于该值时较慢(#30113)。另外,GDN/KDA CuteDSL prefill 将状态 I/O 融合到 chunk-h 内核中(#30169)。
移除了 QServe 和 FBGEMM FP8 量化:实验性的 QServe (QoQ) W4A8 和 FBGEMM FP8 路径已移除。--fp4-gemm-backend cutlass 以及树内 NVFP4 JIT 内核也随之移除,因此 NVFP4 GEMM 现在需要 FlashInfer(#31109、#30448)。
依赖项:flashinfer 0.6.14(#29910)、CuTe DSL 4.6.0(#31714)、sgl-kernel 0.4.5(#31496)、llguidance 1.7.6([#31…
[余略,详见 https://github.com/sgl-project/sglang/releases/tag/v0.5.16]