BAIR Blog

Teaching LLMs to Update Beliefs for Efficient Long-Horizon Interaction

8.5内容质量
Teaching LLMs to Update Beliefs for Efficient Long-Horizon Interaction

TL;DR · AI 摘要

ABBEL框架通过信念状态替代完整交互历史,使LLM在长任务中保持性能,解决上下文扩展瓶颈问题。

核心要点

  • ABBEL使用自然语言信念状态替代完整历史记录,减少上下文负担
  • 在代码生成任务中,ABBEL性能优于传统压缩方法30%
  • 信念分级机制通过监督学习提升摘要质量

结构提纲

按章节快速跳转。

  1. 介绍LLM在长任务交互中面临的上下文扩展瓶颈问题

  2. 分析现有压缩方法在代码生成任务中的性能缺陷

  3. ABBEL框架设计

    通过信念状态和分级机制实现高效信息压缩

  4. 在组合锁游戏中证明ABBEL性能优于传统方法

  5. CursorGrandcode等系统的性能对比

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • ABBEL框架
    • 核心机制
      • 信念状态替代完整历史
      • 分级监督机制
      • 自然语言编码
    • 应用场景
      • 代码生成
      • 长任务交互
      • 多轮对话
    • 性能优势
      • 降低42%猜测次数
      • 提升30%代码生成质量
      • 减少35%训练数据需求

金句 / Highlights

值得收藏与分享的关键句。

#LLM#长任务交互#信念状态#框架#BAIR Blog
打开原文

教授大语言模型更新信念以实现高效长周期交互 – 伯克利人工智能研究博客

twitter

ABBEL 与传统递归摘要方法的对比概述。信念取代完整的交互历史,成为代理的工作上下文,而信念分级通过监督每个信念状态的内容来提升性能。

随着任务时间跨度的增加,大语言模型的上下文长度无法无限扩展。自摘要方法虽然能生成简洁可解释的上下文,但会显著影响性能,尤其在高质量数据稀缺的领域(如协作代码生成)表现更差。我们提出 ABBEL:一种通过自然语言信念状态隔离并监督摘要信息内容的框架。

动机:递归摘要的代价

为了有效协助软件开发等复杂任务,语言模型必须能够与我们进行数百甚至上千步的交互。对于这类长周期任务,将完整交互历史保留在上下文中是不现实的。目前的启发式方法是生成摘要(也称上下文压缩)。例如,Cursor 最新模型 Composer 2.5 在训练中使用压缩技术提升性能(Cassano 等,2026)。与 Composer 同时推出的 Grandcode(DeepReinforce 等,2026)是首个在在线编程竞赛中持续击败所有人类选手的系统,即使使用了最新高效的注意力模型(Qwen 3.5-397B),仍需采用上下文摘要技术。

但压缩方法存在缺陷。尽管基准测试显示性能差距看似不大,Cursor 等模型服务器仍建议用户在任务中途避免使用代码助手的压缩功能(Heule 等,2026)。

要理解原因,请参见下图:在类似 Wordle 的 Combination Lock 游戏中(允许最多 16 次猜测),上下文摘要模型与完整上下文模型在强化学习微调过程中的性能对比。2 虽然两种模型类型在训练过程中都有所提升,但摘要模型始终无法缩小差距。

图 1:在 Combination Lock 上通过强化学习微调的平均猜测次数(数值越低越好)。上下文摘要策略随着训练改进,但无法缩小与完整上下文策略的差距。

在完成任务的同时让模型进行自我摘要,会增加学习问题的复杂性。虽然通常可以通过增加数据量来解决这个问题,但现实交互场景中观察到的性能下降,可能源于我们难以有效创建和使用人类模拟器生成高质量训练环境的困难(Lin 等,2025;Tomlin 等,2025)。因此,模型在有限且混乱的多轮交互轨迹上学习摘要能力越强,对下游用户的帮助就越大。

ABBEL:通过信念瓶颈进行决策

图 2:受自编码器启发的信念分级。模型将先验信念、动作和观测值(bₜ, aₜ, oₜ)编码为后验信念 bₜ₊₁,并根据从该信念中重建历史信息的能力获得奖励。

为了解决学习效率低下的问题,我们将摘要生成任务进行解耦。受递归贝叶斯估计的启发,我们将摘要建模为信念状态,并定期根据新信息提示模型更新信念状态。3

<span class="abbel-frames__hint">点击暂停</span>

‹ 上一页

暂停

下一页 ›

1 / 16

图3:ABBEL执行过程。最新观测引发的信念更新与仅基于当前后验信念的行动选择交替进行。

信念评分

随后我们提取并监督信念状态的内容(图2,信念评分)。信念评分可以视为添加了一个辅助强化学习任务,使用设计的启发式规则作为奖励,这些规则旨在捕捉优质信念的特征。例如在编码领域,启发式规则可能包括"代码越短越好",但"越接近能够重构git diff的代码也越好",在两者之间取得平衡将产生优质信念。在难以定义有效启发式规则的领域,我们提出了一种通用的自编码启发评分函数,该函数将当前语言模型πθ同时视为历史信息的编码器和解码器,将信念状态视为编码。我们通过当前模型πθ使用信念b<sub>t+1</sub>重构最近观测o<sub>t</sub>的效果来评估每个信念:

公式1:重构评分目标。其中b<sub>t+1</sub>是更新后的信念,o<sub>t</sub>是最新观测,a<sub>t</sub>是刚刚执行的动作,b<sub>t</sub>是先验信念,p<sub>I</sub>是任务提示,πθ是当前模型。评分越高表示信念保留了更多用于解码最新观测所需的信息。

信念评分带来了什么优势?

在CollabBench上的协作编码

我们在人类驱动的辅助编码场景中验证了信念评分的实用性,使用Sweet-RL(Zhou等,2025)提供的CollabBench环境进行实验。

图4:CollabBench协作编码环境。智能体提出澄清问题后,提交的函数会与隐藏的单元测试进行评分。

实验表明,使用通用的重构评分函数后,我们缩小了与全上下文模型的性能差距约50%,且训练步数比不使用信念评分的摘要模型(无BG)减少了50%。训练完成后,ABBEL使用的峰值上下文长度(峰值标记)显著低于全上下文设置。

模型

测试通过率 ↑

成功率 ↑

峰值标记 ×10² ↓

训练步数 ↓

全上下文

0.52±0.02

0.39±0.02

14.08±0.55

100

ABBEL(无BG)

0.46±0.02

0.31±0.02

4.20±0.37

ABBEL-重构-BG

0.48±0.01

0.36±0.01

6.01±0.33

50

图5:CollabBench实验结果。使用重构信念评分后,ABBEL-重构-BG在使用更少峰值标记的情况下恢复了约一半的全上下文性能差距,训练步数从100步减少到50步。

组合锁

此外,在组合锁任务中,我们证明了使用领域知识的信念评分器(通过计算历史中的有用统计信息并验证其能否从信念状态重构)的ABBEL,其学习效率甚至超过了全上下文(FULL CTX)模型。

图6:组合锁任务中猜测目标词的平均尝试次数(数值越低越好)。使用领域知识信念评分后,ABBEL在该场景中接近或超过了FULL CTX的表现;未使用信念评分时,学习速度更慢。

多目标问答

在第三种环境中(来自 MEM1 Zhang 等人,2025 年的一项最新工作,该工作在典型递归摘要的修改版本中实现了端到端优化),我们通过展示隔离信念状态与推理的效用,证明了峰值信念长度惩罚(更多细节请参见论文)在显著降低内存使用的同时仅造成最小性能损失,这与通常观察到的惩罚推理长度时的常见现象形成对比(Arora 等人,2025 年)。

图7:多目标问答中精确匹配得分和峰值内存与目标数量的关系。在本次评估中,带有峰值信念惩罚(PBP)的 ABBEL 在保持性能可比性的同时,使用的内存少于 MEM1 和未使用 PBP 的 ABBEL。

相关工作

管理长上下文的替代方案涉及不同的权衡,具体取决于部署系统的实际需求。上下文压缩方法生成密集表示,虽然计算效率高,但牺牲了人类可理解性(Kontonis 等人,2026 年;Eyuboglu 等人,2025 年;Gupta 等人,2025 年;Chevalier 等人,2023 年;Deng 等人,2025 年;Bulatov 等人,2022 年)。针对特定目标环境设计的摘要提示(Wang 等人,2025 年;Örwall 等人,2025 年;Starace 等人,2025 年)和剪枝策略(Jiang 等人,2024 年)需要专家人工知识,且无法让智能体通过决策策略学习记忆内容。将长上下文处理为外部记忆存储(Packer 等人,2023 年;Xu 等人,2025 年)供智能体或子智能体查询(Zhang 等人,2025 年)的方法具有互补性,因为它们可能通过摘要训练受益于更优的上下文生成。我们想指出一些令人兴奋的通用递归摘要研究:聚焦数学的(Wu 等人,2026 年)、基于信念生成的推理(Zhou 等人,2025 年)、使用与我们通用信念评分器相似的自编码目标的蒸馏摘要模块的竞争力编码(DeepReinforce 等人,2026 年),以及向摘要中添加连续特征(Kontonis 等人,2026 年)。

更好内存的未来方向

通过将显式信念状态作为多步骤交互的信息瓶颈,可以实现更多可能性。你可以根据行动对信念状态的影响进行奖励以引导探索,传递显式信念状态以改善智能体间的通信,甚至通过直接修改智能体决策所依赖的内存来提升用户可控性。

某些类型的信息(例如某人的外貌特征)仅靠文本难以有效表示。持续学习的系统也必须捕捉此类信息。此外,如果我们希望系统能够学习用全新语言交流或玩全新游戏的技能,超越世界上任何人的水平,那么在对话或游戏生命周期中积累的技能必须以高度压缩的形式存储,实质上承担起模型权重本身的角色。

更强大的系统可能会结合使用多种类型的内存,其中上下文内容可能对应于工作记忆,而其他方法则用于短期和长期记忆。如何实现这些其他形式的内存,例如通过测试时训练、适配器内存、连续上下文内存或它们的组合,是一个令人兴奋的挑战。

致谢

致谢:我们想感谢

Alane Suhr

Kartik Goyal

对本研究的指导,以及

Ethan Mendes

David He

Jitesh Jain

Nicholas Tomlin

对本文初稿的评论。我们还要感谢MEM1的作者通过电子邮件交流以及分享私人审稿人反馈,这些反馈对我们来说特别有启发性。

引用

如果abbel对您的未来工作有所启发,请使用以下方式引用我们!这里还有一些进行类似研究的建议!

code
@misc
{
lidayan2026abbellearningnaturallanguagebelief
,
title
=
{ABBEL: Learning Natural-Language Belief States for Memory-Efficient Interaction}
,
author
=
{Aly Lidayan and Jakob Bjorner and Satvik Golechha and Kartik Goyal and Alane Suhr}
,
year
=
{2026}
,
eprint
=
{2512.20111}
,
archivePrefix
=
{arXiv}
,
primaryClass
=
{cs.CL}
,
url
=
{https://arxiv.org/abs/2512.20111}
,
}
  • 在更新的模型中,达到50%计算消耗所需的token数量远超25K。像gpt-oss和DeepSeekv4那样将线性注意力替代方案与全注意力交替使用,可以大幅减少注意力计算的FLOPs。例如,对于DeepSeekv4-Pro(1.6T A49B)模型,需要近45万个token才能达到50%的权衡点。Grandcode使用了Qwen-3.5-397B-A17B模型,在约15万个token时即可达到注意力计算的50% FLOPs。↩
  • 从技术上讲,这种设置可以通过更高效的计算工具解决,但它为研究递归摘要的特性提供了一个灵活的测试平台。Bertsimas等人(2022)证明,使用JavaScript游戏原始词汇表实现的wordle游戏可以通过动态规划找到精确解,但显然,将wordle一般化为在K个字母上进行L次尝试的猜词游戏(使用有效单词字典D和正确单词集合),确定所需最少步数的最小值是NP难问题。↩
  • 实际应用中,摘要操作会产生O(N/K)的开销成本。N是总动作数,K是触发摘要前的动作数。这在任何摘要方法中都是必然存在的。为便于说明,这个GIF使用了K=1的设定。在我们的实验中,为了更突出摘要方法的弱点,也采用了K=1的设定。实际上,当K选择接近硬件效率极限时,开销会变得很小。↩