长度价值模型:面向Token级长度建模的可扩展价值预训练
Length Value Model: Scalable Value Pretraining for Token-Level Length Modeling
摘要
LenVM(长度价值模型)提出一种令牌级框架,在每个解码步骤对剩余生成长度进行建模,将长度建模形式化为价值估计问题,并为每个生成的令牌分配恒定负奖励。该方法在自回归模型的推理过程中实现细粒度长度控制,以优化推理成本与性能。
Token(令牌)是现代自回归模型中的基本计算单元,生成长度直接影响推理成本和推理性能。尽管其重要性不言而喻,现有方法缺乏细粒度的长度建模,主要在粗粒度的序列层面进行操作。本文提出长度价值模型(LenVM,Length Value Model),这是一种令牌级框架,可在每个解码步骤对剩余生成长度进行建模。通过将长度建模形式化为价值估计问题,并为每个生成的令牌分配恒定的负奖励,LenVM……
译自 Apple · ML Research · 录于 二〇二六年七月二十一日