Hugging Face · Daily Papers

PlanBench-XL:在大规模工具生态系统中评估LLM工具使用智能体的长时域规划能力

PlanBench-XL: Evaluating Long-Horizon Planning of LLM Tool-Use Agents in Large-Scale Tool Ecosystems

Jiayu Liu, Qihan Lin, Cheng Qian, Rui Wang, Emre Can Acikgoz, Xiaocheng Yang, Jiateng Liu, Zhenhailong Wang 等 11 位
来自 University of Illinois at Urbana-Champaign
二〇二六年六月二十三日 · arXiv:2606.22388 · PDF · Code

LLM agent(大语言模型智能体)日益在大型工具生态系统中运作,现实世界任务需要发现相关工具、推断隐含子目标,并在长周期内适应动态环境。然而,现有基准测试很少评估检索受限工具可见性下的规划能力。为填补这一空白,我们提出 PlanBench-XL——一个包含 327 个零售任务、覆盖 1,665 个工具的交互式基准测试,用于检验 agent 能否迭代检索可用工具,并调用它们为后续调用挖掘中间证据,最终达成目标。PlanBench-XL 还具备可选的阻塞机制,通过缺失、失效或干扰性工具函数模拟现实世界的不确定性,迫使 agent 检测中断路径并在运行时自适应调整。在十个领先 LLM 上的实验表明,大规模工具规划仍具挑战性:GPT-5.4 在无阻塞场景下达到 51.90% 的准确率,但在最严重的阻塞条件下骤降至 11.36%。进一步分析显示,当失败缺乏显式错误信号,或恢复需要更长的替代工具使用路径时,agent 尤其脆弱。这些结果将 PlanBench-XL 确立为诊断 agent 规划失败的测试平台,并凸显了在拥有大规模、不完美工具环境的长周期任务中,鲁棒自适应规划的必要性。

译自 Hugging Face · Daily Papers · arXiv:2606.22388 · 录于 二〇二六年六月二十三日