vLLM · 官方博客

TML Inkling 在 vLLM 上:Day-0 支持与优化性能

TML Inkling on vLLM: Day-0 Support with Optimized Performance

二〇二六年七月十五日 · 英文原文

vLLM 为 TML Inkling(1T 参数多模态模型)提供 day-0 支持,集成 MTP(多 token 预测)、长上下文服务及并行能力,在 NVIDIA GB200 GPU 上实现每用户每秒 380 token 的吞吐量。

vLLM 为 TML Inkling(一个 1T 参数的多模态模型)提供 day-0 支持,具备 MTP、长上下文服务、并行能力,并在 NVIDIA GB200 GPU 上实现每用户每秒高达 380 个 token 的吞吐量。

译自 vLLM · 官方博客 · 录于 二〇二六年七月十五日