Hugging Face · Daily Papers

AREX: 迈向递归自我改进的深度研究智能体

AREX: Towards a Recursively Self-Improving Agent for Deep Research

Shuqi Lu, Chaofan Li, Kun Luo, Zhang Zhang, Hui Wang, Hongwang Xiao, Zheng Liu, Lei Xiong 等 24 位
来自 Beijing Academy of Artificial Intelligence
二〇二六年七月二十四日 · arXiv:2607.21461 · PDF · Code

深度研究需要智能体找到同时满足多重约束的答案。发现这类答案成本高昂,而验证候选答案通常可以分解为可处理的逐约束检查。这种发现与验证之间的不对称性表明,研究智能体不应仅仅延长搜索时间——它应当通过验证中间结果,并利用部分验证的状态来指导后续改进,从而递归地优化当前答案。我们提出AREX,一系列递归自改进(RSI)深度研究智能体。AREX交替运行两个循环:内部研究循环收集证据并构建临时答案,外部自改进循环则逐约束审计答案、识别未解决的断言,并启动针对性的后续研究。为了在长程任务中维持RSI,AREX学习了一个自主上下文更新工具,该工具将不断增长的交互历史压缩为紧凑的改进状态,保留已验证的证据和未解决的约束,无需依赖外部模型。我们通过智能体中间训练和长程强化学习,在经过验证的合成任务与高质量轨迹上训练AREX。为缓解长程学习中稀疏的最终奖励问题,我们强调那些获取决定性证据或纠正错误研究方向的关键步骤。我们实例化了一个密集4B模型和一个122B-A10B混合专家模型。在BrowseComp、WideSearch、DeepSearchQA、人类最后考试(HLE)以及其他推理与工具使用基准上,AREX大幅优于同规模基线,并与使用更多激活参数的模型保持竞争力。

译自 Hugging Face · Daily Papers · arXiv:2607.21461 · 录于 二〇二六年七月二十四日