Co-RL:多智能体强化学习中多样群体涌现的无监督推理
Co-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RL
来自 University of California at San Diego
摘要
强化学习(RL)已成为提升语言模型和视觉-语言模型推理能力的强大方法,但其最显著的成功仍高度依赖真实标注监督(例如,可验证的奖励)。这类标注获取成本高昂,且随着推理能力超越人类可靠评估的范围,其稀缺性日益加剧。自奖励强化学习通过使模型从自身完成结果中推导奖励信号,减少了对这类监督的依赖。然而,仅基于自生成反馈进行训练可能强化现有偏差和次优行为,降低响应多样性,最终导致响应同质化和训练崩溃。在本工作中,我们展示了无监督推理可通过合作式多智能体训练自然涌现。我们引入了Co-RL框架,其中多个解耦模型(不共享参数)通过基于同伴奖励的强化学习同时优化。我们进一步表明,通过异构模型家族、规模及改写训练样本增加群体多样性,可减少驱动自我强化反馈循环的相关误差。这种多样性持续提升推理性能,保持行为多样性,并缓解训练崩溃。在纯文本和多模态领域,Co-RL始终优于基础模型及先前的无标签方法,同时匹配或超越监督方法,且无需任何真实标注。具体而言,Co-RL在七个纯文本基准上为LLM带来平均3.0-8.6%的提升,在四个多模态基准上为VLM带来2.3-7.2%的提升。代码已公开于https://github.com/DrStranded/Co-RL。
译自 Hugging Face · Daily Papers · arXiv:2608.17253 · 录于 二〇二六年八月二十日