vLLM中的自适应验证:DSpark置信度调度验证
Adaptive Verification in vLLM: DSpark confidence-scheduled verification
摘要
DSpark根据每个请求的置信度动态设定草稿验证预算,而非逐一验证所有草稿token。该方法使单一配置在批处理大小从1到256的范围内,均能维持吞吐量与延迟的最优边界。
根据每个请求的置信度来设定DSpark草稿验证预算,而非验证每个草稿token,这样单一配置即可在批处理大小从1到256的范围内保持吞吐量/延迟的最优边界。
译自 vLLM · 官方博客 · 录于 二〇二六年八月十四日