GitHub · 版本发布

vllm v0.25.0

vllm v0.25.0

二〇二六年八月二十六日 · 英文原文

vLLM v0.25.0 发布,包含来自 232 位贡献者的 558 次提交。Model Runner V2 成为所有密集模型默认执行路径,PagedAttention 被移除。新增 LLaVA-OneVision-2、Unlimited OCR、GLM-5、MiniMax-M3 等模型支持。Transformers 后端速度与原生 vLLM 相当,获得 FP8 MoE 支持。引入统一流式解析引擎、面向异构词表的通用推测解码(TLI)及 DSpark、DFlash 草稿模型。

vLLM v0.25.0 版本发布说明

亮点

本版本包含来自 232 位贡献者(其中 64 位新贡献者)的 558 次提交。

模型支持

引擎核心

[余略,详见 https://github.com/vllm-project/vllm/releases/tag/v0.25.0]

译自 GitHub · 版本发布 · 录于 二〇二六年八月二十六日