GitHub · 版本发布

vllm v0.24.0

vllm v0.24.0

二〇二六年八月二十六日 · 英文原文

vLLM v0.24.0 发布,包含来自 256 位贡献者的 571 次提交。新增 MiniMax-M3 模型支持,含 BF16/FP8 indexer、MXFP4、FP8 sparse GQA 及 AMD/ROCm 调优。DeepSeek-V4 优化包括 FlashInfer sparse index cache(TTFT 提升 2–4%)、prefill chunk-planning(吞吐量提升 4%)及 SM120 支持。Model Runner V2 默认支持量化模型和 GraniteMoE。新增流式解析器引擎,统一 Qwen3、MiniMax-M2、GLM-4.7/5.1/5.2 等模型的 tool-call/reasoning 解析。集成 DiffusionGemma 和 DeepEP v2。Rust 前端新增 API-key 认证、CORS、/tokenize 等接口。设备选择新增 device_ids 参数,ROCm 上弃用 CUDA_VISIBLE_DEVICES。

vLLM v0.24.0 版本发布说明

亮点

本版本包含来自 256 位贡献者(其中 77 位新贡献者)的 571 次提交。

模型支持

译自 GitHub · 版本发布 · 录于 二〇二六年八月二十六日