优化训练策略的幻象:单调推理策略才是LLM强化学习的真正目标
The Mirage of Optimizing Training Policies: Monotonic Inference Policies as the Real Objective for LLM Reinforcement Learning
摘要
强化学习(RL)在大语言模型(LLM)后训练中日益受到关注,但RL训练仍较为脆弱,可能出现不稳定甚至崩溃。一个关键原因是训练与推理之间的不匹配:LLM为兼顾生成效率与训练精度,分别采用独立的推理引擎和训练引擎,这导致即便模型参数同步,同一轨迹在训练端和推理端仍会表现出不一致的概率。这种差异自然引发了一种特殊的离策略(off-policyness)问题,持续存在并毒化训练过程。此前研究已尝试多种方法应对这种离策略性,以在不匹配条件下稳定训练策略。本文指出,现有工作忽视了目标对齐问题:训练引擎中对策略的有效更新,并不一定能保证推理策略(即部署时使用的策略)的改进。为此,我们提出一种适用于LLM RL的新策略优化目标,称为单调推理策略改进(MIPI)。基于这一原则,我们引入单调推理策略更新(MIPU)——一种两步式LLM RL框架,该框架构建采样器参考的候选更新,并利用推理端差距代理(gap proxy)选择性接受同步后的候选。在两种模型规模、高不匹配条件下的实验表明,MIPU提升了平均推理性能与训练稳定性。
译自 Hugging Face · Daily Papers · arXiv:2606.29526 · 录于 二〇二六年七月六日