vLLM · 官方博客

vLLM中的自适应验证:DSpark置信度调度验证

Adaptive Verification in vLLM: DSpark confidence-scheduled verification

二〇二六年八月十四日 · 英文原文

DSpark根据每个请求的置信度动态设定草稿验证预算,而非逐一验证所有草稿token。该方法使单一配置在批处理大小从1到256的范围内,均能维持吞吐量与延迟的最优边界。

根据每个请求的置信度来设定DSpark草稿验证预算,而非验证每个草稿token,这样单一配置即可在批处理大小从1到256的范围内保持吞吐量/延迟的最优边界。

译自 vLLM · 官方博客 · 录于 二〇二六年八月十四日