Apple · ML Research

长度价值模型:面向Token级长度建模的可扩展价值预训练

Length Value Model: Scalable Value Pretraining for Token-Level Length Modeling

二〇二六年七月二十一日 · 英文原文

LenVM(长度价值模型)提出一种令牌级框架,在每个解码步骤对剩余生成长度进行建模,将长度建模形式化为价值估计问题,并为每个生成的令牌分配恒定负奖励。该方法在自回归模型的推理过程中实现细粒度长度控制,以优化推理成本与性能。

Token(令牌)是现代自回归模型中的基本计算单元,生成长度直接影响推理成本和推理性能。尽管其重要性不言而喻,现有方法缺乏细粒度的长度建模,主要在粗粒度的序列层面进行操作。本文提出长度价值模型(LenVM,Length Value Model),这是一种令牌级框架,可在每个解码步骤对剩余生成长度进行建模。通过将长度建模形式化为价值估计问题,并为每个生成的令牌分配恒定的负奖励,LenVM……

译自 Apple · ML Research · 录于 二〇二六年七月二十一日