Hugging Face · Daily Papers

EvoArena: 动态环境下鲁棒LLM Agent的记忆演化追踪

EvoArena: Tracking Memory Evolution for Robust LLM Agents in Dynamic Environments

Jundong Xu, Qingchuan Li, Jiaying Wu, Yihuai Lan, Shuyue Stella Li, Huichi Zhou, Bowen Jiang, Lei Wang 等 14 位
来自 Massachusetts Institute of Technology
二〇二六年六月十二日 · arXiv:2606.13681 · PDF · Code

大语言模型(LLM)智能体在众多基准测试中取得了强劲表现,但大多数评估都假设环境是静态的。相比之下,实际部署环境本质上是动态的,要求智能体持续将其知识、技能和行为与不断变化的环境及更新的任务条件对齐。为弥补这一差距,我们提出了 EvoArena,这是一个基准测试套件,将环境变化建模为终端、软件和社交领域中的渐进式更新序列。我们进一步提出了 EvoMem,一种基于补丁的记忆范式,将记忆演化记录为结构化的更新历史,使智能体能够通过记忆中的变化来推理环境演化。实验表明,当前智能体在 EvoArena 上表现不佳,在演化的终端、软件和社交偏好领域上的平均准确率仅为 39.6%。EvoMem 持续提升了性能,在 EvoArena 上平均提升 1.5%,同时在 GAIA 和 LoCoMo 等标准基准测试上也分别提升了 6.1% 和 4.8%。在单个任务之外,EvoMem 还将 EvoArena 上的链级准确率提升了 3.7%,其中成功需要完成一系列连续的关联演化子任务。机制分析表明,EvoMem 改善了记忆中的证据捕获,表明其能更好地保留完整的演化环境状态。我们的结果强调了在评估和记忆中对演化进行建模对于智能体可靠部署的重要性。

译自 Hugging Face · Daily Papers · arXiv:2606.13681 · 录于 二〇二六年六月十二日