Conformal Thinking:计算预算下的推理风险控制
Conformal Thinking: Risk Control for Reasoning on a Compute Budget
摘要
将推理大语言模型(Reasoning LLMs)的token预算设定问题重新定义为风险控制(risk control),在限制错误率的同时最小化计算量。该框架引入上界阈值,用于在额外计算不太可能提升可靠性时提前停止,以平衡自适应推理(adaptive reasoning)中的风险-准确率权衡。
推理大语言模型(Reasoning LLMs)支持测试时扩展(test-time scaling),随着 token 预算的增加,数据集级别的准确率也随之提升。这促使了自适应推理(adaptive reasoning)——在 token 能提升可靠性时投入计算,而在额外计算不太可能带来帮助时提前停止。然而,设定 token 预算以及自适应推理的阈值,是一个实际挑战,涉及根本性的风险-准确率权衡。我们将预算设定问题重新定义为风险控制(risk control),在限制错误率的同时最小化计算量。我们的框架引入了一个上界阈值,用于在……时停止。
译自 Apple · ML Research · 录于 二〇二六年七月三日