vllm v0.26.0
vllm v0.26.0
摘要
vLLM v0.26.0 发布,包含来自 212 位贡献者的 411 次提交。新增 Inkling 模型系列完整支持栈(基础建模、CUDA graph、Hopper FA4、MTP=1 投机解码、LoRA、ModelOpt NVFP4 量化)。DeepSeek-V4 性能提升,包括专用路由 kernel(2.94% E2E TPOT)、fused_topk_bias(1.5–2x kernel)等。支持按每个 KV-cache 组选择 attention 后端,KV 卸载与分层二级存储成熟。Rust 前端新增多模态视频/音频。新模型包括 BertForMaskedLM、RobertaForTokenClassification 等。Transformers 5.13.0 迁移 Olmo/Olmo2、MistralLarge3、HunyuanVL。
vLLM v0.26.0 版本发布说明
亮点
本版本包含来自 212 位贡献者(其中 61 位新贡献者)的 411 次提交。
- 全新 Inkling 模型系列,提供完整支持栈:基础建模(#48799)、分段式 CUDA graph 支持(#48822)、Hopper FA4 相对 attention(#48858)、MTP=1 投机解码(#48869)、LoRA(#48884)以及标准 ModelOpt NVFP4 量化(#48990)。
- DeepSeek-V4 性能提升,覆盖多家供应商:专用路由 kernel(2.94% E2E TPOT,#48660)、
fused_topk_bias(1.5–2x kernel,#47463)、冗余 repeat/copy 移除(1.8% E2E TPOT,#48137),外加 ROCm 双阶段压缩器用于 HCA prefill(#47718)、稀疏 decode/prefill 优化(#48519、#48788、#46275),以及 AMD(#47419)和 XPU(#47677)上的 DSpark 投机解码。 - 通过
head_dtype为生成模型提供 fp32lm_head(#48390),扩展至 LoRA 路径(#48525),并新增 ROCmtorch.mm快速路径(#48688),提升生成头的精度。 - 灵活的 attention 后端:现在可按每个 KV-cache 组选择 attention 后端(#48012),滑动窗口支持成为显式后端能力(#48011)——改进了对混合模型的支持。
- KV 卸载与分层二级存储 大幅成熟:卸载指标(#45958、#47666、#47679)、层级自有事件处理(#46544、#47923)、带工作负载标识的对象存储二级层(#47063、#47274、#48150)、DP 副本感知分层(#47987),以及包含 CPU 卸载的 encoder-cache(EC)连接器(#42433、#47423)。
- Rust 前端 新增多模态视频(#47959)和音频(#48554)、Seed-OSS 工具解析器(#47741),以及原生
vllm-bench移植(#48107)。 - Transformers 5.13.0(#47867),更多模型迁移至 Transformers 建模后端:Olmo/Olmo2(#48100)、MistralLarge3(#48153)和 HunyuanVL(#47872)。
模型支持
- 新模型:Inkling 系列(#48799、#48822、#48858、#48869、#48884、#48990)、BertForMaskedLM(#48463)、RobertaForTokenClassification / XLMRobertaForTokenClassification(#47991)、LongCat-Flash-Lite n-gram embedding(#47857)、Cosmos3 Edge Reasoner(#48291)及 Cosmos3-Super 注册(#48211)、TranslateGemma-12b-it(#41599)。
- Transformers 后端迁移:Olmo/Olmo2(#48100)、MistralLarge3 迁移至 AutoWeightsLoader(#48153)、HunyuanVL 原生 transformers processor 用于 transformers 5.13(#47872)。
- GLM5.2:将 MoE sequence-parallel 支持迁移至非 torch-compiled 路径(#47881)。
- LoRA:FlashInfer MoE LoRA 用于 BF16 模型(#48632)、LlavaNextVideo 中 tower/connector 的 LoRA(#48594)、LoRA 路径上的 fp32
lm_head(#48525)、优化的TrtLlmLoRAExperts(#48759)。 - 多模态:当 TP 不可用时自动回退至 ViT 数据并行(#49046)。
- 修复:在
torch.compile下修正分块 prefill 的池化分数(#48901)。
引擎核心
- 通过
head_dtype为生成模型提供 fp32lm_head(#48390);降低捕获大型 CUDA graph 时的内存占用(#48483);可选持久化并在启动间复用内存分析结果(#47388);改进的 InstantTensor 加载(#46868)。 - Attention:按每个 KV-cache 组选择不同的 attention 后端(#48012);滑动窗口作为显式后端能力(#48011);跨后端将 K/V 打包至 content 维度的 KV-cache 布局重构(#44455);MRV2 虚拟批次 PCP 用于 MLA(#46570)。
- 投机解码:运行时 draft 权重更新(#46725)、混合(SWA + 全 attention)DFlash drafter(#47914)、qwen-eagle3 的 SWA 支持(#47568)、Gemma4-12B DSpark draft 模型(#47216)、AMD 上的 DSv4 DSpark(#47419)、为
speculative_config设置独立的kv_cache_dtype(#48787)。 - KV 卸载:基本卸载指标(#45958)、将 CPU 缓存使用拆分为读/写仪表(#47666)以及将分层查找延迟拆分为同步/异步直方图(#47679)、层级自有事件处理与 BlockStored 事件(#46544、#47923)、带工作负载标识的对象存储二级层(#47063、#47274、#48150)、DP 副本感知分层(#47987)、encoder-cache(EC)连接器(#42433、#47423)、CPU 卸载连接器(#42433、#47423)。
[余略,详见 https://github.com/vllm-project/vllm/releases/tag/v0.26.0]
译自 GitHub · 版本发布 · 录于 二〇二六年八月二十六日