vllm v0.24.0
vllm v0.24.0
摘要
vLLM v0.24.0 发布,包含来自 256 位贡献者的 571 次提交。新增 MiniMax-M3 模型支持,含 BF16/FP8 indexer、MXFP4、FP8 sparse GQA 及 AMD/ROCm 调优。DeepSeek-V4 优化包括 FlashInfer sparse index cache(TTFT 提升 2–4%)、prefill chunk-planning(吞吐量提升 4%)及 SM120 支持。Model Runner V2 默认支持量化模型和 GraniteMoE。新增流式解析器引擎,统一 Qwen3、MiniMax-M2、GLM-4.7/5.1/5.2 等模型的 tool-call/reasoning 解析。集成 DiffusionGemma 和 DeepEP v2。Rust 前端新增 API-key 认证、CORS、/tokenize 等接口。设备选择新增 device_ids 参数,ROCm 上弃用 CUDA_VISIBLE_DEVICES。
vLLM v0.24.0 版本发布说明
亮点
本版本包含来自 256 位贡献者(其中 77 位新贡献者)的 571 次提交。
- MiniMax-M3:新增对全新 MiniMax-M3 模型的支持(#45381),随后快速跟进:通过 MSA 实现 BF16/FP8 indexer(#45892)、MXFP4 支持(#45896)、FP8 sparse GQA(#45744),以及广泛的 AMD/ROCm 调优——gfx950 上的 mxfp8 MoE/linear(#45725)、MI300X 上 bf16 权重的 fp8_per_channel(#45854)、FP8 KV-cache 修复(#45720)以及 packed-modules 映射(#45794)。同时修复了 MiniMax-M2 的性能回退问题(#45935)。
- DeepSeek-V4 持续成熟:自首次亮相后,DeepSeek-V4 又经历了一轮大规模优化——FlashInfer sparse index cache(TTFT 提升 2–4%)(#45863)、prefill chunk-planning 优化(端到端吞吐量提升 4%)(#45061)、用于低延迟的 cluster-cooperative topK kernel(#43008)、连续的 per-block KV 分配(#44577)、block-FP8 shared expert 的 TEP=16(#46001),以及 SM100 上
next_n > 2的原生 DSA indexer decode(#45322)。现已与 GLM-5.1 一同在 SM120 上启用(#43477),并新增了 XPU(#44144, #44517, #45240)和 ROCm(#44899, #45103, #45681)的 attention/MoE 路径。 - Model Runner V2 (MRv2) 持续扩展:MRv2 现在默认支持量化模型(#44446),默认启用 GraniteMoE(#45461),并完成了 Qwen + DeepSeek-V2 MoE 模型的迁移(#42667)、DFlash speculative decoding(#44586)以及更精确的 FP32 Gumbel 采样(#45996)。
- 流式解析器引擎:新的流式解析器引擎统一了跨模型的 tool-call/reasoning 解析,为 Qwen3(#45413)、MiniMax-M2(#45701)、GLM-4.7/5.1/5.2(#45915)和 Nemotron V3(#45755)提供了解析器。
- Diffusion LLMs:新增 DiffusionGemma(#45163),包括 CPU 路径(#45690)以及 diffusion decoder 的结构化输出护栏(#45468)。
- WideEP / DeepEP v2:集成了用于 expert parallelism 的 DeepEP v2(#41183),并附带后续的鲁棒性修复(#46404, #46432)。
- Rust 前端进一步成熟:新增 API-key 认证(#44321)、CORS(#45753)、
/tokenize+/detokenize(#44222)、/pause/resume/is_paused(#44499)、/abort_requests(#44382)、/get_world_size(#44801)、thinking_token_budget(#46137)、用于 Rust tool parser 的 Python 桥接(#44624),以及许多新的解析器和验证路径。 - 设备选择变更:vLLM 不再在内部设置
CUDA_VISIBLE_DEVICES;取而代之的是新增了一个device_ids参数(#45026)。在 ROCm 上,CUDA_VISIBLE_DEVICES的弃用窗口已开始(#46636)。
模型支持
- 新模型:MiniMax-M3(#45381)、DiffusionGemma(#45163)+ CPU 上的 Gemma Diffusion(#45690)、Hierarchical Reasoning Model — Text / HrmTextForCausalLM(#43098)、OpenMOSS(#44124)。
- Gemma 4:跨所有层的统一 FlashAttention (FA4) +
mm_prefix支持(#42175);大量解析器/服务修复——对 required/named tool choice 跳过强制 JSON(#45795)、禁用 thinking 时的解析(#45832)、流式 reasoning-state 初始化(#45852)、assistant 轮次上的 reasoning 渲染(#45867)、离线解析器截断/token 泄漏修复(#45553);旧版 Gemma4 解析器被基于引擎的实现取代(#45588)。 - DeepSeek-V4:OOM 修复(#44914)、MTP projection prefixing(#44821)、支持的 KV-cache dtype(#44892)。
- Qwen / 多模态:Qwen3-VL 视频加载器(#44412)、Qwen2-VL/Qwen2.5-VL processor 映射的视频加载器(#45555)、Qwen3-VL 多视频处理优化(#46026)及多视频崩溃修复(#46305)、Qwen3-Omni VIT cu_seqlens 设备修复(#44264)、Qwen3.5 的 fused qk-rmsnorm-rope-gate(#44176)、Qwen3.5 EP 权重加载修复(#45002)。
- ViT 完整 CUDA graph:GLM-4.1V(#40576)、DeepSeek-OCR 双路径(#43586)、Kimi-VL(#41992)、mllama4(#40660)、Lfm2VL encoder(#44930)。
- 其他模型修复:Llama4 权重加载(#45047)及流式加载以避免主机 OOM(#44645)、MiMo v2.x QKV TP 分片 + FP4(#45200)、ColQwen3.5 检索正确性(#46108)、EXAONE-4.5 视觉编码器(#4507…
译自 GitHub · 版本发布 · 录于 二〇二六年八月二十六日