vLLM · 官方博客

使用vLLM实现长上下文工作负载的高效解码上下文并行

Efficient Decode Context Parallelism with vLLM for Long Context Workloads

二〇二六年八月八日 · 英文原文

vLLM 引入解码上下文并行(DCP),按序列维度在 GPU 间分片 KV cache。与标准张量并行相比,DCP 在长上下文 agent 工作负载上实现 3 倍吞吐量提升。

vLLM 中的解码上下文并行(DCP)按序列维度在 GPU 间分片 KV cache,与标准张量并行相比,在长上下文 agent 工作负载上可实现 3 倍吞吐量提升。

译自 vLLM · 官方博客 · 录于 二〇二六年八月八日