vLLM · 官方博客

在 Arm CPU 上优化 vLLM

Optimizing vLLM on Arm CPUs

二〇二六年七月二十九日 · 英文原文

vLLM 团队在 Arm CPU 上实现了推理引擎支持,通过优化算子调度、内存访问与量化策略,在 Neoverse V2 等平台达到与 x86 相当的 token 生成速度。关键改进包括启用 SVE(可伸缩向量扩展)指令集、优化 KV 缓存布局与 GEMM 内核。在 Llama 3.1 8B 模型上,单机吞吐提升约 1.5 倍,延迟降低 30%。该工作由 vLLM 核心开发者与 Arm 工程师协作完成,代码已合并至主分支。

vLLM 中 Arm CPU 支持与推理性能优化概述

译自 vLLM · 官方博客 · 录于 二〇二六年七月二十九日