通过可处理轨迹控制学习结构化推理
Learning Structured Reasoning via Tractable Trajectory Control
摘要
提出Ctrl-R框架,通过结构化推理在强化学习中系统发现并强化多样化推理模式。该方法针对大型语言模型在无约束采样下复杂推理轨迹稀疏、标准强化学习难以保证多样化行为的问题,要求对特定推理模式进行定向探索。
大型语言模型能够展现出涌现推理行为,这些行为通常表现为重复出现的词汇模式(例如,"wait"表示验证)。然而,在无约束采样中,复杂的推理轨迹仍然稀疏,且标准强化学习往往无法保证获得多样化的推理行为。我们提出了一种通过结构化推理来系统发现并强化多样化推理模式的方法,这是一种要求在强化学习过程中对特定推理模式进行定向探索的范式。为此,我们提出了Ctrl-R框架,用于学习……
译自 Apple · ML Research · 录于 二〇二六年七月三日