Berkeley · BAIR

教LLMs更新信念以实现高效长程交互

Teaching LLMs to Update Beliefs for Efficient Long-Horizon Interaction

二〇二六年七月二十七日 · 英文原文

ABBEL 是一个将 agent 交互历史压缩为自然语言信念状态(belief states)的框架,通过信念评分(belief grading)监督摘要内容以提升性能。在 CollabBench 协作编程中,ABBEL 使用基于重建的通用评分函数,将完整上下文模型的性能差距缩小约 50%,训练步数减少 50%,峰值 token 从 14.08×10² 降至 6.01×10²。在 Combination Lock 中,领域知识信念评分使学习效率超过完整上下文模型。该工作由 Aly Lidayan、Jakob Bjorner 等人提出,发表于 arXiv(2512.20111)。

--> .abbel-fig { display: block; text-align: center; margin: 2.4em 0; line-height: 1.4; max-width: 100%; } .abbel-fig img { display: block; margin: 0.65em auto 0; height: auto; max-width: 100%; } /* 图片尺寸;下方图注使用更窄的度量 / .abbel-fig--wide img { width: 100%; max-width: 100%; } .abbel-fig--wide-90 img { width: 100%; max-width: 90%; } .abbel-fig--wide-lg img { width: 100%; max-width: 100%; } .abbel-fig--chart img { width: 100%; max-width: 82%; } .abbel-fig--chart-sm img { width: 100%; max-width: 64%; } .abbel-fig--portrait img { width: 50%; max-width: 520px; } .abbel-fig--equation img { width: 100%; max-width: 52%; } .abbel-fig--video { width: 110%; max-width: 110%; margin-left: -5%; margin-right: -5%; box-sizing: border-box; } .abbel-fig--video .abbel-frames { max-width: 100%; width: 100%; } .abbel-frames { margin: 0.65em auto 0; max-width: 100%; user-select: none; } .abbel-frames__stage { position: relative; cursor: pointer; border: none; background: transparent; line-height: 0; width: 100%; } .abbel-frames__stage img { width: 100%; height: auto; display: block; } .abbel-frames__hint { position: absolute; right: 0.55em; bottom: 0.55em; background: rgba(0,0,0,0.4); color: #fff; font-size: 0.68em; font-style: normal; padding: 0.18em 0.5em; border-radius: 3px; pointer-events: none; opacity: 0; transition: opacity 0.2s ease; } .abbel-frames__stage:hover .abbel-frames__hint, .abbel-frames.is-paused .abbel-frames__hint { opacity: 1; } .abbel-frames.is-playing .abbel-frames__hint { opacity: 0; } .abbel-frames__controls { display: flex; align-items: center; justify-content: center; gap: 0.55em; margin-top: 0.35em; flex-wrap: wrap; } .abbel-frames__controls button { appearance: none; border: none; background: transparent; color: #999; font: inherit; font-size: 0.78em; padding: 0.15em 0.35em; border-radius: 2px; cursor: pointer; } .abbel-frames__controls button:hover { color: #666; background: transparent; } .abbel-frames__controls button.abbel-frames__next, .abbel-frames__controls button.abbel-frames__prev { color: #bbb; font-weight: 400; } .abbel-frames__controls button.abbel-frames__next:hover, .abbel-frames__controls button.abbel-frames__prev:hover { color: #999; } .abbel-frames__controls button#abbel-frames-play { color: #777; letter-spacing: 0.02em; } .abbel-frames__controls button[aria-pressed="true"] { background: transparent; color: #555; border-color: transparent; } .abbel-frames__meta { font-size: 0.72em; color: #bbb; font-variant-numeric: tabular-nums; min-width: 4em; text-align: center; } .abbel-frames__dots { display: flex; justify-content: center; gap: 0.25em; margin-top: 0.25em; flex-wrap: wrap; } .abbel-frames__dots button { appearance: none; width: 0.4em; height: 0.4em; padding: 0; border-radius: 50%; border: 1px solid #ccc; background: #fff; cursor: pointer; } .abbel-frames__dots button[aria-current="true"] { background: #aaa; border-color: #aaa; } .abbel-fig .abbel-fig-cap, i.abbel-fig-cap { display: block; text-align: center; font-style: italic; color: #444; margin: 2.7em auto 0.15em; max-width: 38em; width: 100%; box-sizing: border-box; padding: 0 0.5em; font-size: 0.8rem; line-height: 1.4; } .abbel-fig .abbel-fig-cap sub, .abbel-fig .abbel-fig-cap sup, i.abbel-fig-cap sub, i.abbel-fig-cap sup { font-size: 0.75em; line-height: 0; } .abbel-fig--tight .abbel-fig-cap { margin-top: 0.9em; / 默认图距图注间距的约1/3 / } .abbel-fig--equation .abbel-fig-cap { margin-top: 1.35em; / 默认2.7em图距图注间距的一半 / } .abbel-fig--chart-sm .abbel-fig-cap { margin-top: 1.35em; / 比默认2.7em少一行 / } @media screen and (max-width: 40em) { .abbel-fig--wide img, .abbel-fig--wide-lg img, .abbel-fig--wide-90 img, .abbel-fig--chart img, .abbel-fig--chart-sm img { max-width: 100%; } .abbel-fig--equation img { max-width: 75%; } .abbel-fig--portrait img { max-width: 50%; } .abbel-fig--video { width: 100%; max-width: 100%; margin-left: 0; margin-right: 0; } .abbel-fig--video .abbel-frames { max-width: 100%; } .abbel-fig .abbel-fig-cap { max-width: 100%; } } .abbel-footnotes { font-size: 0.8em; color: #888; font-style: italic; margin: 1.5em 0; } .abbel-footnotes ol { padding-left: 1.25em; margin: 0.4em 0 0; } .abbel-footnotes li { margin: 0.55em 0; } .abbel-footnotes p { margin: 0.2em 0; } .abbel-footnotes a { color: #888; } .abbel-table-wrap { overflow-x: auto; margin: 0.5em auto 0; text-align: center; } .abbel-fig--table { margin: 2.4em 0; } .abbel-fig--table .abbel-table-wrap { margin: 0.65em auto 0; } .abbel-table { width: 100%; max-width: 560px; margin: 0 auto; border-collapse: collapse; font-size: 0.88em; line-height: 1.35; } .abbel-table th, .abbel-table td { padding: 0.5em 0.7em; border-bottom: 1px solid #ddd; text-align: center; vertical-align: middle; } .abbel-table th { border-bottom: 2px solid #333; font-weight: 600; } .abbel-table th:first-child, .abbel-table td:first-child { text-align: left; } .abbel-table tr.abbel-baseline td { color: #888; font-style: italic; } .abbel-ack a { color: #1565c0; font-weight: 500; text-decoration: none; border-bottom: 1px solid #90caf9; padding-bottom: 0.06em; } .abbel-ack a:hover { color: #0d47a1; border-bottom-color: #1565c0; } / 隐藏 "View on alphaXiv" 徽章/标签(浏览器扩展 / userscript 注入器) / a[href="alphaxiv.org"], a[href*="alphaXiv"], [class*="alphaxiv"], [class*="alphaXiv"], [class*="AlphaXiv"], [id*="alphaxiv"], [id*="alphaXiv"], [data-alphaxiv], [data-alpha-xiv], img[src*="alphaxiv"], img[alt*="alphaXiv" i], img[alt*="alphaxiv" i], button[aria-label*="alphaXiv" i], a[title*="alphaXiv" i], a[aria-label*="alphaXiv" i], span[title*="alphaXiv" i] { display: none !important; visibility: hidden !important; width: 0 !important; height: 0 !important; overflow: hidden !important; pointer-events: none !important; position: absolute !important; left: -9999px !important; } /* 章节/子节间距(标题→正文,以及下一节前的间隙) */ .post-content > h2 { margin-top: 2.6em; margin-bottom: 0.75em; } .post-content > h2:first-of-type { margin-top: 1.6em; } .post-content > h3 { margin-top: 1.85em; margin-bottom: 0.6em; } -->

ABBEL 与传统递归式摘要的对比概览。信念(Beliefs)取代完整的交互历史,成为 agent 的工作上下文;信念评分(belief grading)通过监督每个信念状态的内容来提升性能。

随着任务时间跨度的增长,LLM 的上下文无法无限扩展。自摘要(self-summarization)能够生成简洁、可解释的上下文,但会带来显著的性能损失,尤其是在高质量数据稀缺的人类辅助领域(例如协作代码生成)。我们通过 ABBEL 来解决这一问题:该框架将摘要的信息内容以自然语言信念状态的形式隔离出来并进行监督。

动机:递归式摘要的代价

为了让语言模型能够有效协助日益复杂的任务(如软件开发),它们必须能够与我们进行数百甚至数千步的交互。对于如此长的任务,将整个交互历史保留在上下文中是不现实的。目前采用的启发式方法是生成摘要,有时也称为上下文压缩(context compaction)。例如,Cursor 最新的模型 Composer 2.5 在训练期间使用压缩来提升性能(Cassano et al., 2026)。与 Composer 类似,Grandcode(DeepReinforce et al., 2026)——首个在在线编程竞赛中持续击败所有人类选手的系统——尽管使用了最新的高效 attention 模型之一(Qwen 3.5-397B)¹,仍然发现有必要采用上下文摘要。

但压缩存在一个问题。尽管在 benchmark 上性能差距看似不大,像 Cursor 这样的模型服务器仍建议用户在任务中途避免对其编程助手使用压缩(Heule et al., 2026)。要理解原因,请看下图:在 Combination Lock(一个类似 Wordle、允许最多 16 次猜测的游戏)中,上下文摘要模型与完整上下文模型在 RL 微调下的性能对比。² 尽管两种模型在训练过程中都有提升,但摘要模型始终未能缩小差距。

图 1: 在 Combination Lock 上,RL 微调过程中猜测目标词的平均尝试次数(越低越好)。上下文摘要策略随训练有所提升,但未能缩小与完整上下文策略之间的差距。

让模型在完成任务的同时进行自摘要,增加了学习问题的复杂度。虽然通常可以通过增加训练数据来解决,但在真实交互环境中观察到的性能下降,很可能源于我们难以有效创建和使用人类模拟器来生成高质量的训练环境(Lin et al., 2025; Tomlin et al., 2025)。因此,在你能收集到的有限且杂乱的多轮交互轨迹上,学得越好的摘要能力,你的模型对下游用户就越有利。

ABBEL:通过信念瓶颈进行行动

图 2: 受自编码器启发的信念评分。模型将先验信念、行动和观察(b_t, a_t, o_t)编码为后验信念 b_{t+1},并根据该信念对历史中选定信息的重建效果获得奖励。

为了解决学习效率低下的问题,我们将摘要生成任务隔离出来。受递归贝叶斯估计(recursive Bayesian estimation)的启发,我们将摘要形式化为信念状态(belief states),并定期提示模型根据新信息更新这些状态。³

点击暂停 ‹ 上一帧 暂停 下一帧 › 1 / 16 图 3: ABBEL 的 rollout。信念更新基于最新观察,而行动选择仅依赖于当前的后验信念。

信念评分

然后,我们提取并监督信念状态的内容(图 2,信念评分)。信念评分可以看作添加一个辅助 RL 任务,使用旨在捕捉良好信念特征的启发式规则作为奖励。例如,在编程领域,一个启发式规则可能是“越短越好”,但“越能重建 git diff 越好”也同样重要,因此平衡这两者就能产生良好的信念。在难以定义良好启发式的领域,我们提出了一种通用的、受自编码器启发的评分函数,它将当前语言模型 π_θ 同时视为历史信息的编码器和解码器,而信念状态则作为编码(codes)。我们根据当前模型 π_θ 利用信念 b_{t+1} 重建最新观察 o_t 的效果来对每个信念进行评分:

公式 1: 重建评分目标。其中 b_{t+1} 是更新后的信念,o_t 是最新观察,a_t 是刚采取的行动,b_t 是先验信念,p_I 是任务提示,π_θ 是当前模型。评分越高,表示信念保留了更多解码最新观察所需的信息。

信念评分带来了什么?

CollabBench 上的协作编程

我们在 CollabBench 环境(来自 Sweet-RL,Zhou et al., 2025)中,在我们关注的领域——人类驱动的辅助编程——展示了信念评分的效用。

图 4: CollabBench 协作编程环境。Agent 提出澄清性问题,然后提交一个函数,根据隐藏的单元测试进行评分。

我们发现,使用基于重建的通用信念评分函数,我们将与完整上下文模型的性能差距缩小了约 50%,并且与训练没有信念评分(no BG)的摘要模型相比,训练步数减少了 50%。训练完成后,ABBEL 使用的内存仍显著少于完整上下文设置(以峰值上下文 token 长度衡量)。

模型 测试通过率 ↑ 成功率 ↑ 峰值 Token (×10²) ↓ 训练步数 ↓
完整上下文 0.52±0.02 0.39±0.02 14.08±0.55 100
ABBEL (无 BG) 0.46±0.02 0.31±0.02 4.20±0.37 100
ABBEL-rec-BG 0.48±0.01 0.36±0.01 6.01±0.33 50

图 5: CollabBench 结果。使用重建信念评分后,ABBEL-rec-BG 恢复了一半与完整上下文的差距,同时使用了更少的峰值 token,并且训练步数从 100 步减少到 50 步。

Combination Lock

此外,在 Combination Lock 中,我们展示了使用领域知识信念评分器(通过计算历史中的有用统计信息并检查它们能否从信念状态中重建)的 ABBEL,其学习效率甚至超过了完整上下文(FULL CTX)模型。

图 6: 在 Combination Lock 上猜测目标词的平均尝试次数(越低越好)。使用领域知识信念评分后,ABBEL 在此设置下接近或超过了 FULL CTX;没有信念评分时,学习速度较慢。

多目标问答

在第三个环境——多目标问答(来自 MEM1,Zhang et al., 2025,该工作对典型的递归式摘要进行了端到端优化)中,我们通过展示峰值信念长度惩罚(Peak Belief length Penalty,论文中有更多细节)能显著减少内存使用且性能下降极小(这与通常对推理长度施加惩罚时观察到的现象不同,Arora et al., 2025),证明了将信念状态与推理过程隔离的效用。

图 7: 多目标 QA 中,精确匹配分数和峰值内存随目标数量的变化。在此评估中,带有峰值信念惩罚(PBP)的 ABBEL 保持了可比的性能,同时使用的内存少于 MEM1 和不带 PBP 的 ABBEL。

相关工作

管理长上下文的替代方案涉及不同的权衡,值得根据部署系统的需求加以考虑。上下文压缩方法生成密集表示,虽然计算效率高,但牺牲了人类可理解性(Kontonis et al., 2026; Eyuboglu et al., 2025; Gupta et al., 2025; Chevalier et al., 2023; Deng et al., 2025; Deng et al., 2025; Bulatov et al., 2022)。针对特定环境手工设计的摘要提示(Wang et al., 2025; Örwall et al., 2025; Starace et al., 2025)和剪枝策略(Jiang et al., 2024)需要专家知识,并且不允许 agent 在决策策略中学习该记住什么。将长上下文处理到外部记忆存储(Packer et al., 2023; Xu et al., 2025)中供 agent 或子 agent 查询的方法(Zhang et al., 2025)是互补的,因为它们可能通过摘要训练来改进下一个上下文的创建。

我们想指出一些令人兴奋的相关工作:专注于数学的通用递归式摘要(Wu et al., 2026)、结合信念生成的推理(Zhou et al., 2025)、使用与我们通用信念评分器类似的自编码器目标来蒸馏摘要模块的竞争性编程(DeepReinforce et al., 2026),以及向摘要添加连续特征(Kontonis et al., 2026)。

更好的记忆下一步是什么?

通过将显式信念状态用作多步交互的信息瓶颈,可以实现更多可能性。你可以根据行动对信念状态的影响来奖励行动,以引导探索;传输显式信念状态以实现 agent 之间更好的通信;甚至通过直接修改 agent 决策所依赖的记忆来提高用户可控性。

某些形式的信息(例如一个人的长相)仅靠文本难以很好地表示。一个持续学习的系统也必须能够捕捉这类信息。此外,如果我们希望一个系统学会用一种全新的语言交流,或者学会玩一个全新的游戏并超越世界上任何人,那么在对话或游戏生命周期中积累的技能必须以非常压缩的形式存储,本质上承担起模型权重本身的角色。

更强大的系统可能会利用多种记忆形式的组合,其中上下文的内容可能对应工作记忆,而其他方法则用于短期和长期记忆。如何实例化这些其他形式的记忆——例如通过测试时训练(test-time training)、适配器记忆(adapter memories)、连续上下文记忆(continuous context memories)或它们的某种组合——是一个令人兴奋的挑战。

致谢

致谢:我们要感谢 Alane Suhr 和 Kartik Goyal 对本研究的指导,以及 Ethan Mendes、David He、Jitesh Jain 和 Nicholas Tomlin 对本文初稿的评论。我们还要感谢 MEM1 的作者们的邮件往来,并分享了我们认为特别有见地的私人审稿人反馈。

引用

如果 ABBEL 对您未来的工作有所启发,请使用以下信息引用我们!以下是一些进行类似研究的建议。

@misc{lidayan2026abbellearningnaturallanguagebelief,
      title={ABBEL: Learning Natural-Language Belief States for Memory-Efficient Interaction},
      author={Aly Lidayan and Jakob Bjorner and Satvik Golechha and Kartik Goyal and Alane Suhr},
      year={2026},
      eprint={2512.20111},
      archivePrefix={arXiv},
      primaryClass={cs.CL},
      url={https://arxiv.org/abs/2512.20111},
}

¹ 使用更新的模型时,注意力计算达到 50% FLOPs 的 token 数远大于 25K。像 gpt-oss 和 DeepSeekv4 那样将线性注意力替代方案与全注意力交错使用,可以大幅减少注意力计算的 FLOPs。例如,对于 DeepSeekv4-Pro(1.6T A49B),需要接近 45 万 token 才能达到 50% 的权衡点。Grandcode 使用 Qwen-3.5-397B-A17B,该模型在约 15 万 token 时注意力达到 50% FLOPs。

² 该设置理论上可以用计算效率更高的工具解决,但作为研究递归式摘要特性的灵活测试平台很有用。Bertsimas et al., 2022 表明,使用 JavaScript 游戏的原始词汇表,可以通过动态规划找到 Wordle 游戏的精确解;但显然,Wordle 作为在 K 个字母、L 次尝试以及某些有效词和正确词词典 D 下的猜词游戏,其通用公式化表述中,确定所需最少步数是 NP 难的。

³ 实际上,摘要存在 O(N/K) 的开销成本。N 是总行动数,K 是触发摘要前的行动数。这对于任何摘要方法都是必然成立的。为便于说明,此 GIF 使用 K=1。在我们的实验中,为了更突出摘要的弱点,我们也使用 K=1。实际上,由于 K 可以选择接近高效硬件限制的值,开销很小。

译自 Berkeley · BAIR · 录于 二〇二六年七月二十七日