vLLM · 官方博客

发布 vLLM AFD 插件:解耦注意力与 FFN 实现灵活 MoE 服务

Announcing vLLM AFD Plugin: Disaggregating Attention and FFN for Flexible MoE Serving

二〇二六年七月二十三日 · 英文原文

vLLM AFD Plugin 为 vLLM 生态系统引入面向 MoE 服务的 Attention–FFN 分离、GPU 与昇腾 NPU 后端支持、基于连接器的执行方式,以及图执行与 unbatching 功能。该插件通过分离 attention 与 FFN 计算路径,优化了 MoE 模型的推理效率,并兼容多种硬件后端。

vLLM AFD Plugin 为 vLLM 生态系统带来的新特性:面向 MoE 服务的 Attention–FFN 分离、GPU 与昇腾 NPU 后端、基于连接器的执行方式,以及图执行与 unbatching 支持。

译自 vLLM · 官方博客 · 录于 二〇二六年七月二十三日