从RLVR到RLSVR:任务转换诱导自验证奖励实现开放式LLM自我改进
From RLVR to RLSVR: Task Transformation Induces Self-Verifiable Rewards for Open-Ended LLM Self-Improvement
摘要
基于可验证奖励的强化学习(RLVR)已通过支持大规模优化,推动了面向推理的大语言模型(LLM)的近期进展。然而,其适用性在很大程度上仍局限于数学和编程等领域,在这些领域中正确性可以通过确定性方式验证。相比之下,开放式任务往往依赖人类偏好、奖励模型或基于LLM的评判器,这引入了评估偏差、评判能力瓶颈以及额外的推理成本。
借鉴自监督学习的原理——即通过构造前置任务从数据本身获取监督信号——我们提出了一种基于任务转换的训练范式,称为基于自验证奖励的强化学习(RLSVR),旨在将RLVR扩展到开放式任务。RLSVR将开放式任务转换为可验证的代理环境,其内部规则和交互结果自动生成奖励信号。我们以SpyRL实例化RLSVR,这是一个受“谁是卧底?”游戏启发的多智能体自博弈环境。智能体接收不对称信息,完成相同的目标任务,并通过投票识别指定的卧底。由于卧底身份是预先确定的,投票结果提供了完全可验证的奖励,而成功识别与输出质量密切相关。在文本摘要、创意写作和数学推理上的实验表明,SpyRL在不可验证任务上优于现有自改进方法,并在可验证推理任务上取得了一致的提升。这些结果表明,任务转换可以将基于RLVR的可扩展自改进扩展到本质上可验证领域之外。模型和代码已发布在 https://github.com/wangqinsi1/SpyRL。
译自 Hugging Face · Daily Papers · arXiv:2607.23802 · 录于 二〇二六年八月三日