基于直接在线策略蒸馏的弱到强泛化
Weak-to-Strong Generalization via Direct On-Policy Distillation
来自 BytedTsinghua-SIA
摘要
基于可验证奖励的强化学习(RLVR)是提升语言模型推理能力的有效方法,但每次在新强模型上重复这一过程成本高昂,因为训练期间目标模型需要生成大量 rollout。随着模型规模扩大,后训练本身成为瓶颈。我们研究了一种弱到强的替代方案:在 rollout 成本更低的较小模型上运行强化学习,然后将该强化学习的结果复用以改进更强的目标模型。直接蒸馏强化学习后的弱教师模型是不够的,因为教师模型的最终策略将有用的强化学习收益与较小模型的局限性混合在一起。我们提出直接在线蒸馏(Direct-OPD),该方法迁移的是教师模型由强化学习引发的策略偏移。Direct-OPD 将强化学习后的教师模型与其自身的强化学习前参考模型进行比较,并将它们的对数比值作为学生模型的密集隐式奖励。简而言之,这一检查点对告诉我们强化学习使弱模型更可能或更不可能采取哪些动作,而 Direct-OPD 将该信号应用于更强学生模型自身的在线状态。这直接复用了弱模型的强化学习监督信号,而无需在目标模型上运行稀疏奖励强化学习。实验表明,Direct-OPD 始终能利用弱教师模型来改进更强的目标模型;值得注意的是,在 8 块 A100 GPU 上仅用 4 小时,它就将 Qwen3-1.7B 在 AIME 2024 上的成绩从 48.3% 提升至 58.3%。该方法优于逐步匹配的直接强化学习,并支持多个策略偏移的顺序组合。我们的结果表明,强化学习的结果可以作为隐式奖励信号跨模型规模复用,而不仅仅是作为最终模型进行模仿。
译自 Hugging Face · Daily Papers · arXiv:2607.05394 · 录于 二〇二六年七月十四日