vllm v0.27.0
vllm v0.27.0
摘要
vLLM v0.27.0 发布,包含来自 242 位贡献者的 561 个提交。新增 Kimi K3 全栈支持(模型、kernel、Python/Rust 前端、DeepGEMM 等),以及 Qwen3.5、K-EXAONE-2.0-750B-A37B、VaultGemma 等模型。升级至 PyTorch 2.13.0、Triton 3.7.1,深化 FlashAttention 4 在 SM100 上的 FP8 KV cache 与 headdim-256 支持。针对 DeepSeek-V4 实现多项性能优化,包括约 2 倍 kernel 提升和 3.9% E2E TTFT 改进。Model Runner V2 扩展至非生成式任务,新增 gRPC 控制平面及 NVIDIA Rubin 早期支持。
vLLM v0.27.0 发布说明
亮点
本版本包含来自 242 位贡献者(其中 64 位新贡献者)的 561 个提交。
- Kimi K3 支持,全栈在一个版本中落地:核心模型文件和 kernel(#50089、#50000)、Python(#50093)和 Rust(#50104)前端、AttnRes kernel(#50090)、DeepGEMM 支持(#50458)、compressed-tensors 量化 checkpoint(#50500)、DSpark AR 融合(#50242),以及将共享 expert 分片而非复制的选项(#50656)。
- 更多新模型:Qwen3.5 纯文本 dense 和 MoE 模型(#50210),支持 EVS 视频 token 剪枝(#48912)、K-EXAONE-2.0-750B-A37B(#50524)、通过 Transformers modeling 后端支持的 VaultGemma(#49803),以及 jina-embeddings-v5-text-nano(#50688)。
- PyTorch 2.13.0 升级,同时升级 torchvision 0.28.0 和 Triton 3.7.1(#48155)——这是一项破坏性环境变更;XPU(#48677)和 CPU(#50412)也同步跟进到 torch 2.13。
- FlashAttention 4 集成在 SM100 上深化:FP8 KV cache 支持(#42569)和 headdim-256 支持(#42669),由新的 JIT warmup 基础设施(#47451)和 runner 持有的 Triton kernel warmup(#49903)支撑,消除了首次请求的编译停顿。
- DeepSeek-V4 性能优化:sequence parallelism(#46789)、通过跳过空 c128 启动实现约 2 倍 kernel 提升(#48957)、通过跳过不必要的 topk/router 实现 3.4% E2E TTFT 提升(#49486)、通过 workspace 复用实现 3.9% E2E TTFT 提升(#49236)、通过移除冗余 full kernel 实现 1.88 倍 kernel 提升(#50298)、自适应 topk 宽度(1.0% E2E,#50004)、PP buffer 节省 448 MiB GPU 内存(#50312)、紧凑 MXFP4 indexer KV cache(#48993),以及在 FlashInfer >= 0.6.14 上移除 sparse-MLA q-head padding(#48047)。
- Model Runner V2 扩展到非生成式工作负载:encoder-only attention(#49331)、embedding/classification 的 sequence pooling(#48791)、encoder token classification(#50293)和 token embedding(#50574)、BGE-M3 pooling(#50661)、CPU 上的多模态支持(#50073)、多层 MTP speculator(#48892),PCP 现在默认选择 MRV2(#50034)。
- 弹性大规模服务:面向 DP+EP 外部负载均衡部署的(简化版)容错框架(#44428),以及弹性 EP 扩展的异步准备(#47288)。
- 混合模型的分离式部署:混合 MLA+SSM 模型的 NIXL P/D(#49762)、混合模型的异构 P/D block 大小(#49612),以及 MoRIIO 异构 TP<->DP prefill/decode 读取路由(#46116)。
- Rust 前端新增 gRPC 控制平面:engine 感知的健康报告(#48992)、中止控制(#49255)、服务器和模型发现(#49491)、KV 事件源发现(#50033),以及
vllm-bench集成到vllmCLI(#48930)。 - 下一代硬件早期支持:面向 NVIDIA Rubin 的
sm_107目标(#49387),SM107 上的 NVLink all-reduce 路径(#49647),以及启用 ROCm gfx1250 架构(#46516)。
模型支持
- Kimi K3:新模型(#50000),包含模型文件和 kernel(#50089)、Python 前端(#50093)、Rust 前端(#50104)、AttnRes kernel(#50090)、DeepGEMM 支持(#50458)、DSpark AR 融合(#50242),以及可选的共享 expert 分片(#50656)。
- 新模型:Qwen3.5 纯文本 dense 和 MoE(#50210)、K-EXAONE-2.0-750B-A37B(#50524)、通过 Transformers 后端支持的 VaultGemma(#49803)、基于 EuroBERT encoder 骨干的 jina-embeddings-v5-text-nano(#50688)。
- Inkling:llm-compressor NVFP4 权重(#49258)和 compressed-tensors 动态 FP8(#48876)。
- 多模态:VidCom2 视频 token 剪枝(#47750)、Qwen3.5 的 EVS(#48912)、Gemma-4 的 ViT CUDA graph(#46837)、Cosmos3 FP8 ModelOpt/Diffusers 重映射(#48952)、MiniMax-M3 MSA speculative decode 验证(#50032)和默认视频处理器(#50305)、DeepSeek-OCR-2 TTFT 优化(#49531)、MOSS-TD 更长的最大音频时长(#49403)。
- 扩散模型:DiffusionGemma 的 top_k 和 top_p 采样(#45429)。
- Transformers modeling 后端:音频模型支持(#39330)、改进的
fxtracer(#49957)、融合 residual-add + RMSNorm 编译 pass(#48…
[余略,详见 https://github.com/vllm-project/vllm/releases/tag/v0.27.0]
译自 GitHub · 版本发布 · 录于 二〇二六年八月二十六日