FORT-Searcher:为训练深度搜索智能体合成抗捷径搜索任务
FORT-Searcher: Synthesizing Shortcut-Resistant Search Tasks for Training Deep Search Agents
摘要
训练深度搜索智能体需要可验证的问题,其答案在通过搜索获取足够证据之前不可获得。现有合成方法通常通过丰富图结构来增加表面难度,但仅凭结构复杂性并不能保证实现真正的搜索难度:预期的搜索过程可能通过一条更廉价的识别路径而崩溃。我们用一个捷径感知难度框架形式化了这一差距,并识别出四种可操作的捷径风险:证据共覆盖、单线索选择性、暴露常量以及先验知识绑定。为了诊断其实际影响,我们使用轨迹特征,包括求解成本、答案命中时间和先验捷径率。在该框架指导下,我们提出了FORT,一个抗捷径训练数据合成框架。FORT通过控制实体选择、证据图构建、问题表述和对抗性优化中的捷径风险,构建抗捷径的训练数据。实验表明,与现有的开源深度搜索数据集相比,FORT诱导出更长的答案前搜索路径和更少的捷径模式。利用生成的轨迹,我们仅通过监督微调(SFT)训练了FORT-Searcher,在具有挑战性的深度搜索基准测试中,它在同等规模的开源搜索智能体中取得了最佳整体性能。相关资源将在https://github.com/RUCAIBox/FORT-Searcher 提供。
译自 Hugging Face · Daily Papers · arXiv:2606.12087 · 录于 二〇二六年六月十二日