SWE-Bench ProMax:大规模多语言代码重构的智能体基准测试
SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring
随着AI编程智能体承担起日益复杂、长期性的软件工程任务,现有基准测试正迅速趋于饱和,其评估质量也受到严重质疑:近期一项审计发现,近60%未解决的SWE-bench Verified实例包含有缺陷的测试——要么是过于狭窄的测试,拒绝了正确解决方案;要么是过于宽泛的测试,检查了未明确说明的需求——并且前沿模型能够从训练数据中逐字复现黄金补丁。代码重构要求跨多个文件进行协调一致、保持行为不变的修改,这为智能体能力提供了难度显著更高且更贴近实际的测试,但现有基准对此覆盖不足。我们推出SWE-Bench ProMax,这是一个由专家精选的多语言代码重构基准,包含170个实例,源自七种编程语言(Python、Java、TypeScript、Go、C、C++和Rust)的真实提交。每个实例都经过严格的多阶段筛选,直接解决了先前基准中已识别的质量问题:问题描述从头重写,以提供精确、无歧义的规格说明;测试套件经过人工审查,移除过于狭窄和过于宽泛的测试。复杂度不足或跨文件范围有限的实例被过滤掉,最终形成一个具有挑战性的大规模重构任务基准,平均每个实例涉及11.4个修改文件和261.6行代码,远超现有基准的规模。在两种智能体框架下对前沿模型的实验表明,最佳模型仅达到41.2%的解决率,证实SWE-Bench ProMax为当前AI编程智能体提供了有意义且未饱和的挑战。我们的基准可在 https://huggingface.co/datasets/swe-bench-promax/SWE-Bench-ProMax 获取。