vllm v0.22.1
vllm v0.22.1
vLLM 发布 v0.22.1 补丁版本,包含 6 位贡献者(含 1 位新贡献者)的 8 次提交。新增对 JetBrains Mellum v2 混合专家代码生成模型的支持;在 AMD Zen CPU 上通过 zentorch 实现 W8A8 和 W4A16 量化线性推理路由;修复 DeepSeek-V4 因 CUTLASS `fmin` 兼容性导致的初始化失败、OlmoHybridForCausalLM 的 checkpoint 加载问题,以及 HyperCLOVAX 因上游 HuggingFace 仓库移除远程代码导致的加载问题。修复多节点 Ray 数据并行服务中 `num_api_servers > 1` 时的挂起问题,并将 Ray DP 后端排除在延迟端口分配之外。Docker 构建修复了 `flashinfer-jit-cache` 安装问题;NIXL KV 连接器 wheel 安装仅保留与镜像 CUDA 主版本匹配的 wheel,修复 CUDA 13 镜像上的 `ImportError: libcudart.so.12` 错误。
亮点
本版本包含来自 6 位贡献者(其中 1 位为新贡献者)的 8 次提交。
v0.22.1 是基于 v0.22.0 的补丁版本,包含针对性的 bug 修复以及若干新增功能:新增对 JetBrains Mellum v2 模型的支持、在 AMD Zen CPU 上通过 zentorch 加速的量化线性推理,以及多节点 Ray 数据并行服务、DeepSeek-V4 初始化和若干模型加载回归问题的修复。
模型支持
- 新模型:JetBrains 的 Mellum v2,一个开放权重的混合专家(Mixture-of-Experts)代码生成模型(#43992)。
- DeepSeek-V4:解决导致初始化失败的 CUTLASS
fmin兼容性问题(0decac0d)。 - 修复
OlmoHybridForCausalLM在 checkpoint 将rope_parameters从None改为{"rope_type": None}后无法初始化的问题(#43846)。 - 修复 HyperCLOVAX 加载问题:上游 HuggingFace 仓库移除了其远程代码(现已在
transformers >= 5.9.0中原生支持),注册hyperclovax模型类型,使 vLLM 使用其自带的配置而非过时的auto_map(#43860)。
硬件与性能
- AMD Zen CPU:将 W8A8(int8 动态对称)和 W4A16(GPTQ)线性推理路由至 zentorch 内核,注册优先级高于通用 oneDNN CPU 内核,并在非 Zen CPU、GPU 和 XPU 上透明回退(#41813)。
大规模服务
- 修复多节点 Ray 数据并行服务中
num_api_servers > 1时的确定性挂起问题:将 Ray DP 后端排除在 #42585 引入的延迟(内核分配)端口分配之外(#43864)。
构建与 CI
- Docker:在
flashinfer-jit-cache于 PyPI 上被隔离期间,停止通过--extra-index-url安装该包,修复镜像构建问题(#44366)。 - 规范化 NIXL KV 连接器 wheel 安装:仅保留与镜像 CUDA 主版本匹配的 wheel,修复在 CUDA 13 镜像上导入
nixl_ep时出现的ImportError: libcudart.so.12错误(#44266)。
贡献者
@khluu, @vadiklyutiy, @aadwived, @shadeMe, @alec-flowers, @hmellor