vllm v0.23.0
vllm v0.23.0
摘要
vLLM v0.23.0 发布,包含来自 200 位贡献者的 408 次提交。DeepSeek-V4 得到加固与优化,包括稀疏 MLA 元数据解耦、TRTLLM-gen attention kernel 及 Mega-MoE 的 EPLB 支持。Model Runner V2 扩展至 Llama 和 Mistral 稠密模型,新增 FlashInfer sampler 与可中断 CUDA graphs。Rust 前端新增流式 generate、动态 LoRA 端点。新增 Gemma 4 Unified 支持及多层 KV cache 卸载框架,统一解析器。新增 MiMo-V2.5、Step-3.7-Flash 等模型支持,并实现 Transformers v5 兼容性。
vLLM v0.23.0 版本发布说明
请注意,此版本尚不支持 Minimax M3。请参照 vLLM recipe 获取 M3 的使用指南。
亮点
本版本包含来自 200 位贡献者(其中 63 位新贡献者)的 408 次提交。
- DeepSeek-V4 在各后端趋于成熟:继 v0.22.0 引入后,DeepSeek-V4 又经历了一次大规模加固和优化。其稀疏 MLA 元数据现已与 DeepSeek-V3.2 解耦(#44699),新增了 TRTLLM-gen attention kernel(#43827)、Mega-MoE 的 EPLB 支持(#43339)、滑动窗口 KV cache 的选择性 prefix-cache 保留(#43447),以及 DSA MTP 的 index-share 特性(#44420)。该模型还从
torch.compile中分离(#43746, #43891),其 attention 和 RoPE 路径被重构(#44569, #44262, #43926),并新增了 XPU attention decode 路径(#42953)。 - Model Runner V2 扩展到更多稠密模型:除 Qwen3 外,MRv2 现已成为 Llama 和 Mistral 稠密模型的默认选择(#43458)。它新增了 FlashInfer sampler(#42472)、可中断的 CUDA graphs(#44050)、pipeline-parallel bubble 消除(#42187)、混合模型的 kernel block-size 支持(#38831),以及 Gemma 4 MTP(#43241)。
- Rust 前端成长壮大:实验性的 Rust 前端新增了流式
generate端点(#43779)、动态 LoRA 端点(#43778)、/version(#43854)和/server_info(#43942)端点、server-router 扩展钩子(#43774)、请求 ID 头部(#43883),以及许多新的工具解析器(InternLM2 #43481, hy_v3 #43872, Phi-4-mini #44213, Gemma4 #43850)。 - Gemma 4:新增了无编码器的 Gemma 4 Unified 支持(#44429)和 Gemma 4 MTP(#43241),以及大量准确性和启动修复。
- Transformers v5 兼容性:vLLM 现以 Transformers v5 为目标,弃用 v4 支持(#40389),并附带 vendored 的 MiniCPM-V/O 处理器(#44282),以及针对 Sarvam(#38804)和 Voxtral(#44559)的兼容性修复。
- 多层 KV cache 卸载:卸载框架新增了 对象存储二级层(#41968)、为支持 HMA 的连接器默认启用 HMA(#41847)、HMA 模型的分层支持(#44287),以及通过
on_new_request生命周期钩子实现的按请求卸载策略(#43205)。 - 统一解析器:推理和工具调用解析现已统一在单个
Parser.parse()接口之后(#44267),Responses 解析器也已迁移至此(#42977)。
模型支持
- 新模型:MiMo-V2.5 (#40967), Step-3.7-Flash (#43859), Cosmos3 Reasoner (#43356), Gemma 4 Unified 无编码器 (#44429), JetBrains Mellum v2 (#43992), Granite Speech Plus (#43519), Cohere Mini Code (#44707)。
- Gemma 4:无编码器 Unified 支持 (#44429), MTP (#43241), 原生 ViT 线性层 (#43798), 视觉编码器排除在量化之外 (#44571), 以及 TP>1 下 MTP 的修复 (#43909)、并发下 block-table 不匹配 (#43982)、transformers-processor 启动崩溃 (#44232) 和 CPU 初始化 (#44615)。
- Transformers v5:弃用 v4 支持 (#40389), 附带 MiniCPM-V/O 处理器 (#44282), Sarvam 兼容性 (#38804), 针对 transformers≥5.10 的 Voxtral
fetch_audio(#44559)。 - 模型修复与增强:Qwen3-VL/Qwen3-omni-thinker 在
torch.compile下的 deepstack 准确性 (#43617), Qwen3-VL 的 EVS (#44205), GLM-5.1 PP 加载 (#42944), GLM-4.1V 处理器 logits (#43575), GLM-4.6V 视频加载器 (#44417), OlmoHybrid 初始化 (#43846), HyperCLOVAX 移除 remote-code (#43860), Bailing-MoE 旋转因子 (#43770), Step3 PP 残差 KeyError (#37622), MiniCPM-V-4.6 视频 (#44509), MiniCPM-O 音频去填充 (#38053), MiniCPM-V 批处理预处理 (#44609), FunASR-Nano 初始化 (#44215), Cohere 路由方法 (#44021), Kimi-K2.5 FlashInfer ViT 元数据 (#44493)。 - 多模态:自动选择已注册的视频加载器用于 VLM (#44126), 每步 O(log n) 的多模态项处理 (#44212), 基准测试中的本地图像编码 (#43843), 交错自定义图像基准数据集 (#43636)。…
[余略,详见 https://github.com/vllm-project/vllm/releases/tag/v0.23.0]
译自 GitHub · 版本发布 · 录于 二〇二六年八月二十六日