发布 vLLM AFD 插件:解耦注意力与 FFN 实现灵活 MoE 服务
Announcing vLLM AFD Plugin: Disaggregating Attention and FFN for Flexible MoE Serving
摘要
vLLM AFD Plugin 为 vLLM 生态系统引入面向 MoE 服务的 Attention–FFN 分离、GPU 与昇腾 NPU 后端支持、基于连接器的执行方式,以及图执行与 unbatching 功能。该插件通过分离 attention 与 FFN 计算路径,优化了 MoE 模型的推理效率,并兼容多种硬件后端。
vLLM AFD Plugin 为 vLLM 生态系统带来的新特性:面向 MoE 服务的 Attention–FFN 分离、GPU 与昇腾 NPU 后端、基于连接器的执行方式,以及图执行与 unbatching 支持。
译自 vLLM · 官方博客 · 录于 二〇二六年七月二十三日