GitHub · 版本发布

vllm v0.22.1

vllm v0.22.1

二〇二六年八月二十六日 · 英文原文

vLLM 发布 v0.22.1 补丁版本,包含 6 位贡献者(含 1 位新贡献者)的 8 次提交。新增对 JetBrains Mellum v2 混合专家代码生成模型的支持;在 AMD Zen CPU 上通过 zentorch 实现 W8A8 和 W4A16 量化线性推理路由;修复 DeepSeek-V4 因 CUTLASS `fmin` 兼容性导致的初始化失败、OlmoHybridForCausalLM 的 checkpoint 加载问题,以及 HyperCLOVAX 因上游 HuggingFace 仓库移除远程代码导致的加载问题。修复多节点 Ray 数据并行服务中 `num_api_servers > 1` 时的挂起问题,并将 Ray DP 后端排除在延迟端口分配之外。Docker 构建修复了 `flashinfer-jit-cache` 安装问题;NIXL KV 连接器 wheel 安装仅保留与镜像 CUDA 主版本匹配的 wheel,修复 CUDA 13 镜像上的 `ImportError: libcudart.so.12` 错误。

亮点

本版本包含来自 6 位贡献者(其中 1 位为新贡献者)的 8 次提交。

v0.22.1 是基于 v0.22.0 的补丁版本,包含针对性的 bug 修复以及若干新增功能:新增对 JetBrains Mellum v2 模型的支持、在 AMD Zen CPU 上通过 zentorch 加速的量化线性推理,以及多节点 Ray 数据并行服务、DeepSeek-V4 初始化和若干模型加载回归问题的修复。

模型支持

硬件与性能

大规模服务

构建与 CI

贡献者

@khluu, @vadiklyutiy, @aadwived, @shadeMe, @alec-flowers, @hmellor

译自 GitHub · 版本发布 · 录于 二〇二六年八月二十六日