Hugging Face Blog

How Much Memory Does Your Agent Actually Need?

8.5内容质量

TL;DR · AI 摘要

代理内存剂量需根据模型能力精确校准:大模型需完整指南集,小模型需精简核心加任务检索,饱和模型无提升。

核心要点

  • 大模型(如DeepSeek-V3.2)使用完整指南集可提升+9.5pp任务完成率
  • 中等模型(如gpt-oss-120b)采用精简核心+任务检索可获+16.1pp提升
  • 饱和模型(如GLM-5)无论增加何种内存配置均无显著提升

结构提纲

按章节快速跳转。

  1. 提出代理内存配置需根据模型能力进行剂量校准的核心问题

  2. 内存剂量与模型能力呈非线性关系,需分层配置

  3. 大模型需完整指南集,小模型需精简核心加任务检索

  4. 已达性能上限的模型无法通过增加内存获得提升

  5. 根据模型参数量、上下文窗口和任务分布动态调整内存配置

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • 代理内存剂量校准
    • 关键洞察
      • 剂量与模型能力非线性关系
    • 模型层级
      • 大模型
        • 完整指南集提升9.5pp
      • 中等模型
        • 精简核心+任务检索提升16.1pp
      • 饱和模型
        • 无显著提升
    • 实践方法
      • 根据参数量/上下文窗口动态调整

金句 / Highlights

值得收藏与分享的关键句。

#Agent Memory#Model Optimization#ALTK-Evolve#Hugging Face
打开原文

您的代理实际需要多少内存?

返回文章

[0

[-1

企业

]

文章

2026年8月18日发布

点赞

48

[

  • +42

Vatche Isahagian

Vatche

关注

ibm-research

Gaodan Fang

gaodan-fang

Jayaram Radhakrishnan

jayaramkr

Punleuk Oum

illeatmyhat

Ashwath Vaithinathan Aravindan

ashwath-vaithina

Evelyn Duesterwald

evduester

G Thomas

gsthomasx

Vinod Muthusamy

vinodmut

Merve Unuvar

mrvnvr

Ayhan Sebin

ayhansebin

在我们之前的帖子中,我们将ALTK-EvolveACE进行了比较,展示了如何传递代理的自我提炼指南——每项任务检索少量指南与注入完整指南集——会影响准确性和成本。本文将回到更基础的问题:您应该为其提供多少内存?

为代理配备智能内存看似简单:从过去的工作中提炼经验,将其放回上下文中,更多经验应带来更好表现。但事实并非总是如此。当我们将评估扩展到八种模型(从30B密集模型到前沿专有系统)时,一个发现尤为突出:

智能内存不是简单的开关功能,而是需要根据模型进行校准的剂量。

TL;DR

  • ALTK-Evolve使代理能够从自身历史轨迹中学习:提炼可复用的指南,并在推理时注入回系统,无需权重更新也无需人工标注。
  • 合适的剂量因模型层级而异:有容量的强模型需要完整指南集,较弱模型在紧凑核心加任务检索的组合下表现最佳,而饱和模型则无明显收益。
  • 精选检索可能是最准确且成本最低的方案:gpt-oss-120b仅增加5% token成本就实现了+16.1pp任务完成度提升——提示缓存技术使完整指南集在生产环境中仍具成本优势。

核心洞察:剂量取决于模型能力

并非所有模型都能从相同内存规模中获益。在跨越能力光谱的八种模型中,我们观察到三种重复模式:

  • 有容量的强模型需要完整指南集——包括罕见边缘案例的教训。它们具备吸收并应用所有内容的能力。DeepSeek-V3.2(671B MoE)在获得完整自提炼指南集后,任务完成度提升了+9.5个百分点。
  • 小型或较弱模型会被大量指南集淹没。对这些模型而言,紧凑的高置信核心加每任务少量相关指南的组合效果最佳。gpt-oss-120b(117B MoE)采用这种选择性方案后任务完成度提升+16.1pp——而完整指南集提升更少且消耗约50%更多token。
  • 已饱和模型无明显收益。我们将这种现象称为"饱和模式"——该标签描述的是观察到的现象,而非已证明的原因。模型可能已在这些任务上接近性能上限,指南可能未覆盖其剩余失败场景,或未能有效应用指导原则。在我们的测试中,GLM-5(745B MoE)就处于这种状态。

将模型归入某种模式而非其他,不仅仅是参数数量的问题。基准测试容量、上下文窗口大小、架构、指南质量及任务分布等因素似乎共同决定了模型所处的位置,分离这些因素仍是持续进行的工作。无论具体情况如何,实际结论保持一致:合适的内存剂量取决于模型,我们可以对其进行校准。

学习发生在模型外部,而非内部

"Memory" here doesn't mean replaying a past transcript. It means a guideline set — strategies that worked, mistakes to avoid, and edge cases — distilled from the agent's own prior trajectories. The loop is straightforward:

  • The agent attempts tasks and produces trajectories.
  • ALTK-Evolve extracts behavioral guidelines from both its successful and unsuccessful runs.
  • It consolidates those guidelines into a reusable set.
  • At inference time, the agent receives either the full guideline set or a task-relevant selection of it.

No model weights are updated. The learning loop changes the guidance available to the agent , not the underlying model — which is exactly why it's cheap to adopt and portable across the eight models we tested.

Results Across the Spectrum

We evaluated on AppWorld — 585 multi-step tasks (168 test_normal + 417 test_challenge ) across 9 simulated apps (calendars, messaging, payments, and so on). Tasks are scored two ways: whether the agent fully completes each task ( TGC — Task Goal Completion ) and whether every variant of a scenario passes ( SGC — Scenario Goal Completion , a stricter, all-or-nothing bar). Full definitions are in the appendix.

The three configurations we compare

Because the confusing part of any memory study is what's actually in the context window , we define the configurations up front.

Both memory configurations draw from the same guideline set , mined once (via the loop above) from AppWorld's training split only. What changes between them is only how that one set is delivered — the full guideline set injects all of it every step, while curated retrieval delivers a selected subset — never how the guidelines were produced, and no test-split data ever goes into building it.

Configuration

What's in the agent's context

Baseline

No memory — the agent as shipped.

Full guideline set

Every mined guideline, injected on every ReAct step.

Curated retrieval

A fixed, high-confidence core of those same guidelines plus a few task-relevant ones retrieved for each task (a fixed portion + a variable portion).

The number of guidelines a model mines depends on its own capability, so we report configurations by strategy — "full guideline set" vs. "curated retrieval" — rather than by raw counts, which aren't comparable across models.

The three patterns, in one view

Representative models from the eight-model sweep, measured by task completion (TGC) on test_normal :

Figure 1. Representative models in the three observed patterns. Bars show TGC on AppWorld test_normal for baseline vs. the best-memory configuration; the x-axis begins at 40% to make differences visible. TGC alone understates the larger SGC gains — see the SGC columns in the table below.

The figure plots TGC to keep it readable; the table adds the stricter SGC metric, where the gains are often larger:

Model

Pattern

Baseline TGC / SGC

Best-memory TGC / SGC

Best config

Δ TGC

Δ SGC

gpt-oss-120b (117B MoE)

Weak / selective

39.9 / 21.4

56.0 / 37.5

+16.1

DeepSeek-V3.2 (671B MoE)

Strong w/ headroom

79.8 / 64.3

89.3 / 80.4

+9.5

Claude Opus 4.6

90.5 / 87.5

94.6 / 94.6

+4.1

+7.1

GPT-5.5

Strong (near-ceiling)

92.3 / 82.1

95.2 / 89.3

+2.9

+7.2

GLM-5 (745B MoE)

Saturated

87.5 / 80.4

0.0

/think

最经济的内存策略也可以是最优的

一个实际的考量:注入完整的指南集会增加每个ReAct步骤的输入量,因为每轮对话都需要重新发送指南。我们观察到以下结果:

配置

每任务令牌数(基线)

每任务令牌数(+内存)

开销

DeepSeek-V3.2

148K

263K

+78%

gpt-oss-120b

110K

166K

+51%

116K

+5%

表1. 每任务平均令牌使用量,按无内存基线计算,跨代理步骤累计。

两个关键结论:

  • 精选检索可将成本保持在基线附近。对于较弱模型,选择性检索在准确率上占优,同时在成本上也占优——实现两全其美(gpt-oss-120b仅增加5%令牌即可实现+16.1pp TGC)。此处的性能提升无需增加推理成本。
  • 内存不会导致推理循环膨胀。DeepSeek在有/无内存情况下执行的ReAct步骤数量基本相同(平均约18-19步),因此增加的成本是输入令牌膨胀,而非轨迹变长。

生产环境中的真实效率杠杆是提示缓存:指南集的静态部分在各步骤中完全相同,可以进行缓存,从而大幅降低有效成本。具有缓存意识的提示设计——保持共享指南集前缀稳定以维持可缓存性——值得专门进行工程优化。我们还假设上下文窗口大小起着作用:具有更大窗口的模型可能更有效地吸收完整的指南集,而上下文较小的模型则能从保持注入内容紧凑的检索中获益更多。我们尚未进行隔离该因素的受控实验。

内存应进行校准,而非简单累积

教训不是要给代理所有它学到的内容,而是要给它实际能利用的经验量。

  • 对于弱模型,这意味着一个紧凑的核心加上几个特定任务的教训——这恰好也是成本最低的方案。
  • 对于有提升空间的强模型,这意味着保留完整的指南集,并通过提示缓存在生产环境中保持其可负担性。
  • 对于已饱和的模型,这意味着在充分理解其剩余失败模式之前,不要额外增加上下文。

这些收益在所有模型中都切实存在——自动实现、无泄漏、无需人工标注——但前提是剂量与模型匹配。

下一步计划

这只是起点,而非终点:

  • 学习型选择器。我们目前的检索按余弦相似度对指南进行排序,我们已证明这并不能完美预测哪些指南对特定任务有帮助。基于结果信号训练的选择器是自然的下一步。
  • 针对非常弱模型的内存。低于最低能力基线时,自蒸馏缺乏信号。针对非常弱模型的教师蒸馏内存是一个我们正在探索的独立问题。
  • 超出AppWorld的范围。这些结果已在AppWorld上得到验证——这是一个严格的多步骤基准,但只是一个基准。更广泛的代理基准测试和实际部署正在进行中。
  • 隔离上下文窗口。如上所述,我们希望进行受控实验,将上下文窗口大小与原始能力分离开。

尝试使用 ALTK-Evolve 库——其中包含此处使用的提取、整合和检索流程——或阅读完整技术报告以了解完整方法和消融实验。

附录:理解指标

AppWorld 任务通过两个指标进行评分,均以百分比形式呈现(数值越高越好):

  • TGC — 任务目标完成度。代理完全且正确完成的单个任务占比。这是核心的“是否完成任务”的指标数值。
  • SGC — 场景目标完成度。一个更严格、非此即彼的指标。每个场景包含同一任务的多个变体(相同请求但使用不同数据、表述或边界条件)。只有当代理在所有变体上都成功时,SGC 才会将场景视为通过。它衡量的是可靠性——一个通常能解决任务但某个变体失败的代理会在 TGC 上得分,但不会在 SGC 上得分。

更多该作者的文章

在考虑 ACE?我们可以通过更少的 Token 实现

29

2026年8月11日

模型路由很简单。直到它不是。

86

2026年7月15日

社区

编辑

预览

通过拖拽到文本输入框、粘贴或

点击此处

上传图片、音频和视频。

轻点或粘贴此处上传图片

评论

· 注册或登录以发表评论

  • +36