CoRT:面向Token级评分引导策略优化的反事实重放
CoRT: Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization
来自 ByteDance
摘要
基于评分标准的强化学习通过依据显式标准评估模型输出来丰富语言模型训练。然而在GRPO(组相对策略优化)流程中,这些结构化判断被简化为标量级别的响应奖励,并转换为响应级别的优势值,该优势值被均匀分配给所有生成的token。这导致即使不同标准基于不同文本片段、格式决策或语义选择,响应内部也没有明确的信用分配机制。我们提出CoRT,一种针对基于评分标准的GRPO的token级信用加权方法。CoRT无需训练辅助token评分模型,而是通过反事实重演,在原始基于评分标准的提示和匹配的无标准提示下对同一采样响应重新评分。由此产生的逐token对数似然对比可作为对评分标准上下文依赖性的代理指标。CoRT将这些对比映射到有界、响应归一化的权重,并用于在token间重新分配带符号的GRPO优势值,无需引入辅助评分器或改变响应级奖励。在指令微调模型和不同奖励粒度上的实验表明,CoRT在绝大多数对比中优于匹配的响应级GRPO,平均提升4.4个百分点。该方法在避免独立相关性学习阶段的同时,仍能与学习型token级信用基线保持竞争力。这些结果表明,策略内部的反事实似然对比可为响应内部信用分配提供有效训练信号,同时保留GRPO的简洁性与稳定性。
译自 Hugging Face · Daily Papers · arXiv:2607.25659 · 录于 二〇二六年七月三十日