在 Arm CPU 上优化 vLLM
Optimizing vLLM on Arm CPUs
摘要
vLLM 团队在 Arm CPU 上实现了推理引擎支持,通过优化算子调度、内存访问与量化策略,在 Neoverse V2 等平台达到与 x86 相当的 token 生成速度。关键改进包括启用 SVE(可伸缩向量扩展)指令集、优化 KV 缓存布局与 GEMM 内核。在 Llama 3.1 8B 模型上,单机吞吐提升约 1.5 倍,延迟降低 30%。该工作由 vLLM 核心开发者与 Arm 工程师协作完成,代码已合并至主分支。
vLLM 中 Arm CPU 支持与推理性能优化概述
译自 vLLM · 官方博客 · 录于 二〇二六年七月二十九日