GitHub · 版本发布

vllm v0.23.0

vllm v0.23.0

二〇二六年八月二十六日 · 英文原文

vLLM v0.23.0 发布,包含来自 200 位贡献者的 408 次提交。DeepSeek-V4 得到加固与优化,包括稀疏 MLA 元数据解耦、TRTLLM-gen attention kernel 及 Mega-MoE 的 EPLB 支持。Model Runner V2 扩展至 Llama 和 Mistral 稠密模型,新增 FlashInfer sampler 与可中断 CUDA graphs。Rust 前端新增流式 generate、动态 LoRA 端点。新增 Gemma 4 Unified 支持及多层 KV cache 卸载框架,统一解析器。新增 MiMo-V2.5、Step-3.7-Flash 等模型支持,并实现 Transformers v5 兼容性。

vLLM v0.23.0 版本发布说明

请注意,此版本尚不支持 Minimax M3。请参照 vLLM recipe 获取 M3 的使用指南。

亮点

本版本包含来自 200 位贡献者(其中 63 位新贡献者)的 408 次提交。

模型支持

[余略,详见 https://github.com/vllm-project/vllm/releases/tag/v0.23.0]

译自 GitHub · 版本发布 · 录于 二〇二六年八月二十六日