Hugging Face · Daily Papers

LongHorizon-Harness:推进面向真实世界任务的长期智能体

LongHorizon-Harness: Advancing Long-Horizon Agents for Real-World Tasks

Ziyu Ma, Hailang Huang, Shun Zou, Yong Wang, Shidong Yang, Yiming Hu, Fei Wei, XiangXiang Chu
二〇二六年八月四日 · arXiv:2608.01964 · PDF · Code

大语言模型(LLM)智能体越来越多地承担长时程任务,这些任务需要在众多相互依赖的步骤中持续进行推理、工具使用和修订。然而,现有的智能体框架在持续增长的上下文中维护任务执行、任务状态和完成度评估,这使得状态难以追踪,并允许错误的自我评估传播到后续决策中。我们将长时程执行重新表述为任务状态管理问题,并提出LongHorizon-Harness,该框架在执行外部显式维护任务状态,仅使用从环境中独立验证的事实来更新状态。其管理-执行-审计(MEA)循环使用一个管理器来维护任务状态并确定下一个子任务,一个全新上下文的执行器来执行该子任务,以及一个只读审计器在下一轮之前验证由此产生的环境状态。一个轻量级的AgentAdapter支持可互换的模型和框架后端,而无需修改其原生智能体循环。LongHorizon-Harness将Qwen3.7-Plus在WeaveBench上的性能从51.8%提升至80.7%,在Terminal-Bench2.1上从69.7%提升至77.2%,在OSWorld2.0上从2.8%提升至8.3%。它还将Claude Opus4.7在OSWorld2.0子集上的性能从20.0%提升至34.3%,展示了在模型、框架和交互领域中的一致增益。

译自 Hugging Face · Daily Papers · arXiv:2608.01964 · 录于 二〇二六年八月四日