vllm v0.25.0
vllm v0.25.0
摘要
vLLM v0.25.0 发布,包含来自 232 位贡献者的 558 次提交。Model Runner V2 成为所有密集模型默认执行路径,PagedAttention 被移除。新增 LLaVA-OneVision-2、Unlimited OCR、GLM-5、MiniMax-M3 等模型支持。Transformers 后端速度与原生 vLLM 相当,获得 FP8 MoE 支持。引入统一流式解析引擎、面向异构词表的通用推测解码(TLI)及 DSpark、DFlash 草稿模型。
vLLM v0.25.0 版本发布说明
亮点
本版本包含来自 232 位贡献者(其中 64 位新贡献者)的 558 次提交。
- Model Runner V2 现已成为所有密集模型的默认执行路径(#44443)。基于上一版本对量化模型的支持,MRv2 现为标准执行路径,新增了对 EVS(#46535)、实时 embedding(#46762)、Mamba 混合模型的前缀缓存(#42406)、多模态前缀双向注意力(#46942)以及与完整 CUDA graphs 兼容的动态推测解码(#45953)的支持。
- PagedAttention 已被移除(#47361)。由于 V1/MRv2 后端已成为标准路径,旧版注意力实现已被删除。
- Transformers 建模后端现与原生 vLLM 速度相当(#47187),并获得了 FP8 MoE 支持(#46820)、CUDA graph + embedding 缩放修复(#48010),以及 GPTBigCode/Starcoder2(#30966)和 RoBERTa(#47452)的迁移。
- 新模型:LLaVA-OneVision-2(#44785)、Unlimited OCR(#46564, #47102)、MOSS-Transcribe-Diarize(#47729)、openai/privacy-filter(#41026)和 Hy3(#47192)。GLM-5 / DeepSeek-V3.2 已加入模型库(#46808),并附带 GLM-5.2 微调;MiniMax-M3 获得了流水线并行(#45810)和 NVFP4 支持(#46756)。
- 新的流式解析引擎(#46610)——一个统一的工具调用/推理解析框架,包含新的 Kimi k2.5/k2.6/k2.7 解析器以及 seed_oss(#46314)和 DeepSeek V4(#45877)的移植。Rust 前端持续成熟,新增了 HTTPS/mTLS(#45890)、DP supervisor(#47076)和 profiler 控制路由(#46306)。
- 面向异构词表的通用推测解码(TLI)(#38174),以及新的 DSpark(#46995)和 DFlash(#46770, #46853)草稿模型。
模型支持
- 新模型:LLaVA-OneVision-2(#44785)、Unlimited OCR(#46564)及其 Triton R-SWA 后端(#47102)、MOSS-Transcribe-Diarize(#47729)、openai/privacy-filter(#41026)、Hy3(支持 token-suffix 和 JSON Schema 数组)(#47192)。
- GLM-5 系列:GLM-5 / DeepSeek-V3.2 加入模型库(#46808)、GLM-5.2 FP32 gate(#47410)、GLM MTP post-final-norm 修复(#47448)、GLM4V 启动修复(#47155)。
- MiniMax-M3:流水线并行(#45810)、流式推理解析(#45718),以及用 MSA 中的
tok_sparse_select替换 Triton 内核(#47502)。 - Transformers 后端:现与原生 vLLM 速度相当(#47187)、FP8 MoE 修复(#46820)、embedding 缩放 + CUDA graph 修复(#48010)、GPTBigCode/Starcoder2(#30966)和 RoBERTa(#47452)迁移、M-RoPE
mm_token_type_ids修复(#46552)、tied-embeddinglm_head.bias修复(#46835)。 - Voxtral:迁移至 mistral-common 1.11.5 音频 API(#46705)以及实时 token 反馈挂起修复(#44461)。
- Gemma 系列:Gemma4 sliding-window/FA4 注意力修复(#47217, #47332)、Gemma4 MTP quant_config 修复(#47091);DiffusionGemma 张量并行(#45719)和 HF stability-window 语义(#45965)。
- 其他修复:MiniCPM-V 4.6 语言骨干 LoRA(#46740)和占位符网格修复(#45918)、池化 Whisper sliding-window 尺寸(#47071, #47437)、Mamba/Mamba2 无
architectures的 checkpoint 崩溃修复(#46037)、DeepSeek-V2 hidden-size 和 aux-hidden-state 修复(#46986, #46973)。
引擎核心
- Model Runner V2:所有密集模型的默认路径(#44443);EVS(#46535)、实时 embedding(#46762)、Mamba 混合前缀缓存(#42406)、多模态前缀双向注意力(#46942)、交叉注意力预热/block-table 修复(#46753, #47308)、Mamba2 崩溃修复(#47428)、调度 slot 记账(#46974)、关闭时模型引用清理(#47483)、大 logprobs 请求的有界内存(#46746)。
- 推测解码:面向异构词表的通用推测解码(TLI)(#38174);DSpark 草稿模型 + speculators checkpoint 支持(#46995, #47093);DFlash 后端选择(#46770)、逐层 RMSNorm 融合(#46761)、CPU 支持(#44029)、MiMo 的 SWA+DFlash(#46104)、Laguna XS.2.1 草稿模型(#46853);Bailing 混合模型的 MTP(#44880);拒绝采样的 block 验证(#46781);减少 TP 通信…
[余略,详见 https://github.com/vllm-project/vllm/releases/tag/v0.25.0]
译自 GitHub · 版本发布 · 录于 二〇二六年八月二十六日