GitHub · 版本发布

vllm v0.26.0

vllm v0.26.0

二〇二六年八月二十六日 · 英文原文

vLLM v0.26.0 发布,包含来自 212 位贡献者的 411 次提交。新增 Inkling 模型系列完整支持栈(基础建模、CUDA graph、Hopper FA4、MTP=1 投机解码、LoRA、ModelOpt NVFP4 量化)。DeepSeek-V4 性能提升,包括专用路由 kernel(2.94% E2E TPOT)、fused_topk_bias(1.5–2x kernel)等。支持按每个 KV-cache 组选择 attention 后端,KV 卸载与分层二级存储成熟。Rust 前端新增多模态视频/音频。新模型包括 BertForMaskedLM、RobertaForTokenClassification 等。Transformers 5.13.0 迁移 Olmo/Olmo2、MistralLarge3、HunyuanVL。

vLLM v0.26.0 版本发布说明

亮点

本版本包含来自 212 位贡献者(其中 61 位新贡献者)的 411 次提交。

模型支持

引擎核心

[余略,详见 https://github.com/vllm-project/vllm/releases/tag/v0.26.0]

译自 GitHub · 版本发布 · 录于 二〇二六年八月二十六日