Apple · ML Research

Arbitrage:通过优势感知投机实现高效推理

Arbitrage: Efficient Reasoning via Advantage-Aware Speculation

二〇二六年八月八日 · 英文原文

现代大型语言模型通过长思维链(Chain of Thoughts)实现推理能力,但产生高计算成本,促使性能-成本比优化技术发展。投机解码(Speculative Decoding)利用快速草稿模型自回归生成token,再由目标模型并行验证以加速推理。然而,传统token级投机解码因语义等价步骤中token不匹配导致不必要拒绝,限制了效率。

现代大型语言模型通过长思维链(Chain of Thoughts)实现了令人瞩目的推理能力,但它们在推理过程中产生了巨大的计算成本,这促使了提升性能-成本比的技术发展。在这些技术中,投机解码(Speculative Decoding)通过使用一个快速但不精确的草稿模型自回归地提出token,然后由更强大的目标模型并行验证这些token,从而加速推理。然而,由于在语义等价的步骤中token不匹配导致的不必要拒绝,传统的token级投机解码……

译自 Apple · ML Research · 录于 二〇二六年八月八日