GitHub · 版本发布

vllm v0.27.0

vllm v0.27.0

二〇二六年八月二十六日 · 英文原文

vLLM v0.27.0 发布,包含来自 242 位贡献者的 561 个提交。新增 Kimi K3 全栈支持(模型、kernel、Python/Rust 前端、DeepGEMM 等),以及 Qwen3.5、K-EXAONE-2.0-750B-A37B、VaultGemma 等模型。升级至 PyTorch 2.13.0、Triton 3.7.1,深化 FlashAttention 4 在 SM100 上的 FP8 KV cache 与 headdim-256 支持。针对 DeepSeek-V4 实现多项性能优化,包括约 2 倍 kernel 提升和 3.9% E2E TTFT 改进。Model Runner V2 扩展至非生成式任务,新增 gRPC 控制平面及 NVIDIA Rubin 早期支持。

vLLM v0.27.0 发布说明

亮点

本版本包含来自 242 位贡献者(其中 64 位新贡献者)的 561 个提交。

模型支持

[余略,详见 https://github.com/vllm-project/vllm/releases/tag/v0.27.0]

译自 GitHub · 版本发布 · 录于 二〇二六年八月二十六日