vLLM · 官方博客

vLLM × HPC-Ops:来自腾讯混元的高性能注意力与MoE后端

vLLM × HPC-Ops: High-Performance Attention and MoE Backends from Tencent Hunyuan

二〇二六年七月六日 · 英文原文

HPC-Ops 将Hopper优化的attention与FP8 MoE后端集成至vLLM,服务于腾讯混元Hy3模型,在NVIDIA H20上实现了混合长度解码、MoE延迟、TTFT(首Token生成时间)及TPOT(每Token输出时间)的优化。

HPC-Ops 如何将 Hopper 优化的 attention 和 FP8 MoE 后端集成到 vLLM 中,用于腾讯混元 Hy3,在 NVIDIA H20 上提升混合长度解码、MoE 延迟、TTFT 和 TPOT

HPC-Ops 将 Hopper 优化的 attention 和 FP8 MoE 后端集成到 vLLM 中,用于腾讯混元 Hy3,从而在 NVIDIA H20 上改善了混合长度解码、MoE 延迟、TTFT 和 TPOT。

译自 vLLM · 官方博客 · 录于 二〇二六年七月六日