GitHub · 版本发布

sglang v0.5.15

sglang v0.5.15

二〇二六年八月二十六日 · 英文原文

SGLang v0.5.15 对 GLM-5.2 NVFP4 在 Blackwell 上优化生产服务,8x B300 达 500+ tok/s/user,4x GB300 达 450 tok/s/user(bs=1)。默认启用 Spec V2,端到端 TPS 提升 11%;IndexShare MTP 降低长上下文 draft 步骤成本最多 1.9 倍;TopK V2 融合 top-k 选择与页表变换,k 可达 2048;Indexer prologue 融合将 12 个内核缩减为 4 个,解码速度提升约 8%。新增模型支持包括 Hunyuan 3、HRM-Text、NVIDIA LocateAnything-3B、Baidu Unlimited-OCR、JoyEcho 及 Qwen3.6 的 NVFP4 支持。内置 Exa 网络搜索,默认启用 Breakable CUDA Graph,新增 FlashKDA prefill 后端与 ReplaySSM 缓冲输出。FlashInfer A2A 支持路由 MoE,DeepSeek-V4 优化包括请求状态池、FlashMLA 稀疏 prefill 默认启用及非分页 indexer 支持长上下文 prefill。解码上下文并行支持 MLA 模型。依赖升级包括 transformers 5.12.1 等。

亮点

GLM-5.2 NVFP4,面向生产调优:本周期我们花时间在Blackwell上对GLM-5.2 NVFP4进行了调优,以优化生产服务。现在它在8x B300上可达500+ tok/s/user,在4x GB300上可达450 tok/s/user(bs=1)。使用我们的cookbook运行GLM-5.2。

新增模型支持Hunyuan 3 (Hy3)、Hierarchical Reasoning Model (HRM-Text)、NVIDIA LocateAnything-3B、Baidu Unlimited-OCRJoyEcho多镜头A/V,以及Qwen3.6的NVFP4支持。

原生网络搜索(Exa):内置由Exa支持的web_search功能(#29342)。

Breakable CUDA Graph默认启用:Breakable CUDA Graph现为默认捕获路径,降低了每步内核启动开销(#29458);prefill阶段的完整CUDA Graph支持以实验性功能上线(#27988)。

线性注意力内核(KDA / GDN):新增FlashKDA prefill后端,用于safe-gate KDA线性注意力(#29472),以及用于线性注意力的ReplaySSM缓冲输出only解码(#28451)。

FlashInfer A2A用于路由MoE:通过flashinfer_trtllm_routed MoE runner添加FlashInfer all-to-all支持(#22394)。

DeepSeek-V4优化

解码上下文并行:解码上下文并行现已支持MLA模型,包括DeepSeek V3和Kimi K2系列(#14194)。

依赖升级transformers升级至5.12.1(#29393);tvm-ffi / sgl-deep-gemm / tilelang已升级(#29554)。 以及。详见[D…

[余略,详见 https://github.com/sgl-project/sglang/releases/tag/v0.5.15]

译自 GitHub · 版本发布 · 录于 二〇二六年八月二十六日