EAGLE-3 在 AMD Instinct GPU 上的推测解码:使用 vLLM 和 AMD Quark 训练与推理
EAGLE-3 Speculative Decoding on AMD Instinct GPUs: Training and Serving with vLLM and AMD Quark
摘要
AMD Quark 在 AMD Instinct GPU 上使用 vLLM 对 EAGLE-3 投机解码草稿进行训练、量化与服务,为 Kimi-K2.5 带来最高 2.00 倍吞吐量提升,为 MiniMax-M2.5 带来 1.79 倍提升。
AMD Quark 如何在 AMD Instinct GPU 上使用 vLLM 训练、量化并服务 EAGLE-3 投机解码草稿,为 Kimi-K2.5 带来最高 2.00 倍吞吐量提升,为 MiniMax-M2.5 带来 1.79 倍提升
AMD Quark 在 AMD Instinct GPU 上利用 vLLM 对 EAGLE-3 投机解码草稿进行训练、量化与服务,为 Kimi-K2.5 实现最高 2.00 倍的吞吐量增益,为 MiniMax-M2.5 实现 1.79 倍的吞吐量增益。
译自 vLLM · 官方博客 · 录于 二〇二六年七月十四日