vLLM · 官方博客

vLLM在Qwen3.5上实现每GPU 25K总TPS

vLLM Reaches 25K Total TPS/GPU on Qwen3.5

二〇二六年八月七日 · 英文原文

vLLM 在 GB200 NVL72 分离式服务中,采用 Blackwell GDN 内核、HMA 缓存传输、异步调度修复及 srt-slurm 配方,使 Qwen3.5-397B-A17B-NVFP4 达到每 GPU 25K 总 TPS。该方案通过优化 GPU 间通信与缓存迁移,降低调度延迟,提升推理吞吐。

vLLM 如何在 GB200 NVL72 分离式服务中,借助 Blackwell GDN 内核、HMA 缓存传输、异步调度修复及 srt-slurm 配方,使 Qwen3.5-397B-A17B-NVFP4 达到每 GPU 25K 总 TPS。

译自 vLLM · 官方博客 · 录于 二〇二六年八月七日