vllm v0.25.1
vllm v0.25.1
摘要
vLLM v0.25.1 发布,包含 2 个提交,来自 2 位贡献者(@Isotr0py、@hugo-cen,其中 1 位新贡献者)。该补丁版本修复两个 bug:一是避免系统缺少 FFmpeg 时 `import torchcodec` 抛出 `RuntimeError` 阻塞模型启动,错误延迟至运行时触发;二是为混合精度的 allreduce RMSNorm 量化融合增加 dtype 匹配保护,防止不兼容计算图导致隐藏状态损坏及垃圾输出,相同 dtype 模型保留完整融合路径。
vLLM v0.25.1
亮点
本次发布包含来自 2 位贡献者(其中 1 位新贡献者)的 2 个提交!
v0.25.1 是一个补丁版本,在 v0.25.0 的基础上包含两个针对性的 bug 修复。
Bug 修复
- 避免在系统缺少 FFmpeg 时阻塞模型启动(TorchCodec 场景)(#47888)。此前,当系统缺少 FFmpeg 时,
import torchcodec会在导入时抛出RuntimeError,即使在未使用 TorchCodec 的情况下也会阻塞启动(例如vllm serve Qwen/Qwen3-VL-2B-Instruct)。现在该错误被延迟到运行时才触发,因此只有在实际需要 TorchCodec 时才会出现。 - 为混合精度的 allreduce RMSNorm 量化融合添加保护(#48330)。融合的 FlashInfer allreduce + RMSNorm + 静态量化模式可能匹配到激活值与 RMSNorm 权重 dtype 不同的计算图(例如 NVFP4 模型中 BF16 残差流搭配 FP32 的 Gemma/Qwen 风格 RMSNorm 权重),导致隐藏状态损坏并产生垃圾输出,如重复的
!!!!!token。现在增加了 dtype 匹配保护,将不兼容的混合精度计算图路由到安全路径,而相同 dtype 的模型则保留完整的 allreduce + RMSNorm + 量化融合。
贡献者
@Isotr0py、@hugo-cen
译自 GitHub · 版本发布 · 录于 二〇二六年八月二十六日