sglang v0.5.17
sglang v0.5.17
SGLang v0.5.17 发布,来自 194 位贡献者的 582 个 PR。新增 Kimi K3(2.8T 参数多模态 LatentMoE,896 专家,1M token 上下文)与 MiniMax-H3 视频生成模型首日支持,以及 EmbeddingGemma、LFM2.5 等模型。引入 Rust 前端初步支持、DCP 通信后端(a2a/fi_a2a)、用于 MoE prefill 的 DWDP 策略(在 4x B200 上达 DEP4 的 1.92 倍)、会话引用感知的统一 Radix Cache 等特性。
亮点
来自 194 位贡献者的 582 个 PR。
Kimi K3 首日支持:一个 2.8T 参数的多模态 LatentMoE(896 个专家,top-16,在 3584 维潜在空间中路由),拥有 1M token 上下文、69 个 KDA 线性注意力层与 24 个 MLA 层交错排列,以及 MoonViT3d 视觉塔,以原生 MXFP4 checkpoint 形式发布。SGLang 从首日起通过 DCP、DSpark 投机解码、带 TP 解码的 chunked-prefill PP、KDA 感知前缀缓存、基于 DCP 的 HiCache L2、量化权重上的 LoRA,以及推理、工具调用和 OpenAI 兼容服务来提供支持,已在 NVIDIA GB300 和 AMD MI35x 上验证(#32541、#32828、#32890、#33025、#33112、博客、cookbook、路线图)。
MiniMax-H3 首日支持:MiniMax 的视频生成模型,可在一次请求中生成视频和同步立体声音频轨道,原生在 SGLang-Diffusion 上支持所有三个公开任务配置:文本到视频和音频(t2va)、首/末帧条件(fl2va)以及图像/视频/音频参考条件(ref2va,也涵盖视频到视频)。已在 B200(TP2 + Ulysses4)、H100(TP2 + Ulysses2)和 2x RTX 5090(带逐层 offload)上验证(#33275、cookbook)。
新增其他模型:EmbeddingGemma 和 LFM2.5 embedding 模型、nvidia/MiniMax-M3-NVFP4,以及 Poolside 的 Laguna-S-2.1 系列和 Inkling-Small 的 cookbook 配方。
Rust 前端初步支持:初步支持 Rust 前端,将前半部分(从网络入口到 tokenized 请求交给 GPU 调度器的所有环节)从 Python 迁移到多线程 Rust 实现。https://github.com/sgl-project/sglang/pull/29799
DCP 通信后端和 q-replicate(Helix):DeepSeek-MLA 解码上下文并行路径获得可插拔的通信后端。a2a 在每层通过单个 NCCL 集合交换打包的注意力输出和 fp32 LSE,fp8 KV 以 uint8 字节传输方式承载;fi_a2a 在 GB200 上将跨 rank 交换委托给 FlashInfer MNNVL 内核。--dcp-replicate-q-proj 在本地投影全头 Q,并跳过每层 Q 头维度的 all-gather。通过 --dcp-comm-backend {ag_rs, a2a, fi_a2a} 选择(#21637)。
用于 MoE prefill 的 DWDP:一种新的 prefill 并行策略,通过 NVLink P2P 预取对等专家权重并在本地计算所有专家,消除了 EP all-to-all token 分发。在 4x B200 上使用 gpt-oss-120b,仅 prefill,DWDP4 在 MNT 32K / ISL 32K 时达到 DEP4 的 1.92 倍,在饱和状态(CONC=128,ISL=8K)下达到 506K 对比 329K tok/s(1.54 倍)。使用 --dwdp-size 启用;作者将其标记为早期开发阶段(#29778)。
会话引用感知的统一 Radix Cache:对于 agentic 和 RL rollout 工作负载,请求可以携带稳定的 session_id,使驱逐机制知道活动会话仍引用哪些前缀,而不是纯粹按缓存策略驱逐。通过 /close_session 释放引用。使用 --enable-session-radix-cache 选择启用(#29173)。
**用于 DeepSeek 的 SM90 FP8 MegaMoE…
[余略,详见 https://github.com/sgl-project/sglang/releases/tag/v0.5.17]