Hugging Face · Daily Papers

Ring-Zero:将零强化学习扩展到万亿参数实现涌现推理

Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning

Xinyu Tang, Gangqiang Cao, Yurou Liu, Yuliang Zhan, Xiaochong Lan, Yifan Li, Yuchen Yan, Han Peng 等 16 位
来自 inclusionAI
二〇二六年七月十六日 · arXiv:2607.12395 · PDF

基于可验证奖励的强化学习无需人工标注数据(常称为零强化学习),已成为激发链式思维推理的强大范式。然而受计算资源限制,现有研究多局限于小模型,大规模下的训练动态与涌现能力尚未被探索。为有意义地推进这一前沿,我们旨在激发模型产生高质量推理行为,但发现简单扩展规模常导致可读性差、标记冗余及缺乏自适应推理深度等问题。针对这些挑战,我们提出稳定高效的训练流程,整合算法与系统优化,如裁剪重要性采样、训练-推理比率校正及混合精度控制。实验得出三项关键发现,验证了规模扩展的"苦涩教训":(1)扩展至1万亿参数显著提升样本效率与性能上限;(2)训练过程依次经历初始发现阶段与锐化阶段;(3)模型自发发展出拟人化、结构化格式、自我验证、并行推理及上下文焦虑等高级认知行为,使手工设计的启发式方法变得冗余。在七项数学基准测试中,Ring-2.5-1T-Zero取得具有竞争力的性能。此外,为评估超越最终答案正确性的链式思维质量,我们提出涵盖可理解性、可复现性与效率三个维度的结构化评估框架,我们的模型在生成结构化且简洁的推理轨迹方面展现出明显优势。通过分享观察到的涌现现象,我们希望为社区提供关于规模扩展行为(尤其在万亿参数规模)的更深层见解。

译自 Hugging Face · Daily Papers · arXiv:2607.12395 · 录于 二〇二六年七月十六日