How Much Memory Does Your Agent Actually Need?
TL;DR · AI 摘要
代理内存剂量需根据模型能力精确校准:大模型需完整指南集,小模型需精简核心加任务检索,饱和模型无提升。
核心要点
- 大模型(如DeepSeek-V3.2)使用完整指南集可提升+9.5pp任务完成率
- 中等模型(如gpt-oss-120b)采用精简核心+任务检索可获+16.1pp提升
- 饱和模型(如GLM-5)无论增加何种内存配置均无显著提升
结构提纲
按章节快速跳转。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- 代理内存剂量校准
- 关键洞察
- 剂量与模型能力非线性关系
- 模型层级
- 大模型
- 完整指南集提升9.5pp
- 中等模型
- 精简核心+任务检索提升16.1pp
- 饱和模型
- 无显著提升
- 实践方法
- 根据参数量/上下文窗口动态调整
金句 / Highlights
值得收藏与分享的关键句。
Agentic memory is not a feature you switch on. It's a dose you calibrate to the model.
DeepSeek-V3.2 (671B MoE) climbed +9.5 percentage points with full guideline set
gpt-oss-120b gained +16.1pp task completion at only +5% tokens
Saturated models show no measurable gain from additional memory
您的代理实际需要多少内存?
返回文章
[0
[-1
企业
]
文章
2026年8月18日发布
点赞
48
[
- +42
Vatche Isahagian
Vatche
关注
Gaodan Fang
gaodan-fang
Jayaram Radhakrishnan
jayaramkr
Punleuk Oum
illeatmyhat
Ashwath Vaithinathan Aravindan
ashwath-vaithina
Evelyn Duesterwald
evduester
G Thomas
gsthomasx
Vinod Muthusamy
vinodmut
Merve Unuvar
mrvnvr
Ayhan Sebin
ayhansebin
在我们之前的帖子中,我们将ALTK-Evolve与ACE进行了比较,展示了如何传递代理的自我提炼指南——每项任务检索少量指南与注入完整指南集——会影响准确性和成本。本文将回到更基础的问题:您应该为其提供多少内存?
为代理配备智能内存看似简单:从过去的工作中提炼经验,将其放回上下文中,更多经验应带来更好表现。但事实并非总是如此。当我们将评估扩展到八种模型(从30B密集模型到前沿专有系统)时,一个发现尤为突出:
智能内存不是简单的开关功能,而是需要根据模型进行校准的剂量。
TL;DR
- ALTK-Evolve使代理能够从自身历史轨迹中学习:提炼可复用的指南,并在推理时注入回系统,无需权重更新也无需人工标注。
- 合适的剂量因模型层级而异:有容量的强模型需要完整指南集,较弱模型在紧凑核心加任务检索的组合下表现最佳,而饱和模型则无明显收益。
- 精选检索可能是最准确且成本最低的方案:gpt-oss-120b仅增加5% token成本就实现了+16.1pp任务完成度提升——提示缓存技术使完整指南集在生产环境中仍具成本优势。
核心洞察:剂量取决于模型能力
并非所有模型都能从相同内存规模中获益。在跨越能力光谱的八种模型中,我们观察到三种重复模式:
- 有容量的强模型需要完整指南集——包括罕见边缘案例的教训。它们具备吸收并应用所有内容的能力。DeepSeek-V3.2(671B MoE)在获得完整自提炼指南集后,任务完成度提升了+9.5个百分点。
- 小型或较弱模型会被大量指南集淹没。对这些模型而言,紧凑的高置信核心加每任务少量相关指南的组合效果最佳。gpt-oss-120b(117B MoE)采用这种选择性方案后任务完成度提升+16.1pp——而完整指南集提升更少且消耗约50%更多token。
- 已饱和模型无明显收益。我们将这种现象称为"饱和模式"——该标签描述的是观察到的现象,而非已证明的原因。模型可能已在这些任务上接近性能上限,指南可能未覆盖其剩余失败场景,或未能有效应用指导原则。在我们的测试中,GLM-5(745B MoE)就处于这种状态。
将模型归入某种模式而非其他,不仅仅是参数数量的问题。基准测试容量、上下文窗口大小、架构、指南质量及任务分布等因素似乎共同决定了模型所处的位置,分离这些因素仍是持续进行的工作。无论具体情况如何,实际结论保持一致:合适的内存剂量取决于模型,我们可以对其进行校准。
学习发生在模型外部,而非内部
"Memory" here doesn't mean replaying a past transcript. It means a guideline set — strategies that worked, mistakes to avoid, and edge cases — distilled from the agent's own prior trajectories. The loop is straightforward:
- The agent attempts tasks and produces trajectories.
- ALTK-Evolve extracts behavioral guidelines from both its successful and unsuccessful runs.
- It consolidates those guidelines into a reusable set.
- At inference time, the agent receives either the full guideline set or a task-relevant selection of it.
No model weights are updated. The learning loop changes the guidance available to the agent , not the underlying model — which is exactly why it's cheap to adopt and portable across the eight models we tested.
Results Across the Spectrum
We evaluated on AppWorld — 585 multi-step tasks (168 test_normal + 417 test_challenge ) across 9 simulated apps (calendars, messaging, payments, and so on). Tasks are scored two ways: whether the agent fully completes each task ( TGC — Task Goal Completion ) and whether every variant of a scenario passes ( SGC — Scenario Goal Completion , a stricter, all-or-nothing bar). Full definitions are in the appendix.
The three configurations we compare
Because the confusing part of any memory study is what's actually in the context window , we define the configurations up front.
Both memory configurations draw from the same guideline set , mined once (via the loop above) from AppWorld's training split only. What changes between them is only how that one set is delivered — the full guideline set injects all of it every step, while curated retrieval delivers a selected subset — never how the guidelines were produced, and no test-split data ever goes into building it.
Configuration
What's in the agent's context
Baseline
No memory — the agent as shipped.
Full guideline set
Every mined guideline, injected on every ReAct step.
Curated retrieval
A fixed, high-confidence core of those same guidelines plus a few task-relevant ones retrieved for each task (a fixed portion + a variable portion).
The number of guidelines a model mines depends on its own capability, so we report configurations by strategy — "full guideline set" vs. "curated retrieval" — rather than by raw counts, which aren't comparable across models.
The three patterns, in one view
Representative models from the eight-model sweep, measured by task completion (TGC) on test_normal :
Figure 1. Representative models in the three observed patterns. Bars show TGC on AppWorld test_normal for baseline vs. the best-memory configuration; the x-axis begins at 40% to make differences visible. TGC alone understates the larger SGC gains — see the SGC columns in the table below.
The figure plots TGC to keep it readable; the table adds the stricter SGC metric, where the gains are often larger:
Model
Pattern
Baseline TGC / SGC
Best-memory TGC / SGC
Best config
Δ TGC
Δ SGC
gpt-oss-120b (117B MoE)
Weak / selective
39.9 / 21.4
56.0 / 37.5
+16.1
DeepSeek-V3.2 (671B MoE)
Strong w/ headroom
79.8 / 64.3
89.3 / 80.4
+9.5
Claude Opus 4.6
90.5 / 87.5
94.6 / 94.6
+4.1
+7.1
GPT-5.5
Strong (near-ceiling)
92.3 / 82.1
95.2 / 89.3
+2.9
+7.2
GLM-5 (745B MoE)
Saturated
87.5 / 80.4
0.0
/think
最经济的内存策略也可以是最优的
一个实际的考量:注入完整的指南集会增加每个ReAct步骤的输入量,因为每轮对话都需要重新发送指南。我们观察到以下结果:
配置
每任务令牌数(基线)
每任务令牌数(+内存)
开销
DeepSeek-V3.2
148K
263K
+78%
gpt-oss-120b
110K
166K
+51%
116K
+5%
表1. 每任务平均令牌使用量,按无内存基线计算,跨代理步骤累计。
两个关键结论:
- 精选检索可将成本保持在基线附近。对于较弱模型,选择性检索在准确率上占优,同时在成本上也占优——实现两全其美(gpt-oss-120b仅增加5%令牌即可实现+16.1pp TGC)。此处的性能提升无需增加推理成本。
- 内存不会导致推理循环膨胀。DeepSeek在有/无内存情况下执行的ReAct步骤数量基本相同(平均约18-19步),因此增加的成本是输入令牌膨胀,而非轨迹变长。
生产环境中的真实效率杠杆是提示缓存:指南集的静态部分在各步骤中完全相同,可以进行缓存,从而大幅降低有效成本。具有缓存意识的提示设计——保持共享指南集前缀稳定以维持可缓存性——值得专门进行工程优化。我们还假设上下文窗口大小起着作用:具有更大窗口的模型可能更有效地吸收完整的指南集,而上下文较小的模型则能从保持注入内容紧凑的检索中获益更多。我们尚未进行隔离该因素的受控实验。
内存应进行校准,而非简单累积
教训不是要给代理所有它学到的内容,而是要给它实际能利用的经验量。
- 对于弱模型,这意味着一个紧凑的核心加上几个特定任务的教训——这恰好也是成本最低的方案。
- 对于有提升空间的强模型,这意味着保留完整的指南集,并通过提示缓存在生产环境中保持其可负担性。
- 对于已饱和的模型,这意味着在充分理解其剩余失败模式之前,不要额外增加上下文。
这些收益在所有模型中都切实存在——自动实现、无泄漏、无需人工标注——但前提是剂量与模型匹配。
下一步计划
这只是起点,而非终点:
- 学习型选择器。我们目前的检索按余弦相似度对指南进行排序,我们已证明这并不能完美预测哪些指南对特定任务有帮助。基于结果信号训练的选择器是自然的下一步。
- 针对非常弱模型的内存。低于最低能力基线时,自蒸馏缺乏信号。针对非常弱模型的教师蒸馏内存是一个我们正在探索的独立问题。
- 超出AppWorld的范围。这些结果已在AppWorld上得到验证——这是一个严格的多步骤基准,但只是一个基准。更广泛的代理基准测试和实际部署正在进行中。
- 隔离上下文窗口。如上所述,我们希望进行受控实验,将上下文窗口大小与原始能力分离开。
尝试使用 ALTK-Evolve 库——其中包含此处使用的提取、整合和检索流程——或阅读完整技术报告以了解完整方法和消融实验。
附录:理解指标
AppWorld 任务通过两个指标进行评分,均以百分比形式呈现(数值越高越好):
- TGC — 任务目标完成度。代理完全且正确完成的单个任务占比。这是核心的“是否完成任务”的指标数值。
- SGC — 场景目标完成度。一个更严格、非此即彼的指标。每个场景包含同一任务的多个变体(相同请求但使用不同数据、表述或边界条件)。只有当代理在所有变体上都成功时,SGC 才会将场景视为通过。它衡量的是可靠性——一个通常能解决任务但某个变体失败的代理会在 TGC 上得分,但不会在 SGC 上得分。
更多该作者的文章
在考虑 ACE?我们可以通过更少的 Token 实现
29
2026年8月11日
模型路由很简单。直到它不是。
86
2026年7月15日
社区
编辑
预览
通过拖拽到文本输入框、粘贴或
点击此处
上传图片、音频和视频。
轻点或粘贴此处上传图片
评论
· 注册或登录以发表评论
- +36