vLLM在Qwen3.5上实现每GPU 25K总TPS
vLLM Reaches 25K Total TPS/GPU on Qwen3.5
摘要
vLLM 在 GB200 NVL72 分离式服务中,采用 Blackwell GDN 内核、HMA 缓存传输、异步调度修复及 srt-slurm 配方,使 Qwen3.5-397B-A17B-NVFP4 达到每 GPU 25K 总 TPS。该方案通过优化 GPU 间通信与缓存迁移,降低调度延迟,提升推理吞吐。
vLLM 如何在 GB200 NVL72 分离式服务中,借助 Blackwell GDN 内核、HMA 缓存传输、异步调度修复及 srt-slurm 配方,使 Qwen3.5-397B-A17B-NVFP4 达到每 GPU 25K 总 TPS。
译自 vLLM · 官方博客 · 录于 二〇二六年八月七日