Hugging Face · Daily Papers

SWE-Explore:评估编码Agent如何探索代码库

SWE-Explore: Benchmarking How Coding Agents Explore Repositories

Shaoqiu Zhang, Yuhang Wang, Jialiang Liang, Yuling Shi, Wenhao Zeng, Maoquan Wang, Shilin He, Ningyuan Xu 等 11 位
来自 Shanghai Jiao Tong University
二〇二六年六月九日 · arXiv:2606.07297 · PDF · Code

像 SWE-bench 这类仓库级代码评测基准,极大地推动了编码智能体能力的快速提升。然而,它们通常将编码任务视为一个整体性的二元预测问题(例如,解决或未解决),忽略了诸如仓库理解、上下文检索、代码定位和缺陷诊断等细粒度智能体能力。本文提出 SWE-Explore,一个将仓库探索(编码智能体的关键能力)的评估独立出来的基准。给定一个仓库和一个 issue,SWE-Explore 要求探索者在固定的行数预算下,返回一个按相关性排序的代码区域列表。SWE-Explore 涵盖 10 种编程语言、203 个开源仓库中的 848 个 issue。对于每个实例,我们从成功解决同一 issue 的独立智能体轨迹中,提取出行级别的真实标注,并提炼出这些解决方案路径实际参考的特定代码区域。我们从覆盖率、排序和上下文效率三个维度评估探索能力,结果表明这些指标与下游修复行为高度相关。在广泛的检索方法、通用编码智能体和专用定位器上,我们发现基于智能体的探索器明显优于经典检索方法。虽然现代方法在文件级定位上已经很强,但行级覆盖率和高效排序仍是区分最先进探索器的关键维度。

译自 Hugging Face · Daily Papers · arXiv:2606.07297 · 录于 二〇二六年六月九日