mem0(@mem0ai)

https://t.co/wyA9Gm54vW

8.5内容质量

TL;DR · AI 摘要

现有回忆基准测试已饱和,无法准确评估代理系统,需转向行动基准测试并关注成本指标。

核心要点

  • 现有回忆基准测试已饱和,GPT-4o在LongMemEval中得分0.606
  • 行动基准测试更贴近实际任务,但多数未验证记忆依赖性
  • 评分答案存在错误,如6.4%的LoCoMo答案错误

结构提纲

按章节快速跳转。

  1. 现有记忆基准测试无法反映真实代理任务需求。

  2. 直接提问模式与实际任务需求存在本质差异。

  3. GPT-4o在文本检索环节存在0.264的性能缺口。

  4. ·DolphinBench评估

    16个基准测试中仅1项验证记忆依赖性。

  5. 62.81%的错误答案被LLM评分器误判为正确。

  6. 需发展行动基准测试并纳入成本指标评估。

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • 回忆基准测试的局限性
    • 测试模式缺陷
      • 直接提问 vs 任务执行
    • 评估指标缺失
      • 成本/延迟指标缺失
    • 评分系统漏洞
      • LLM评分器误判率62.81%

金句 / Highlights

值得收藏与分享的关键句。

#AI代理#基准测试#记忆系统#DolphinBench
打开原文

mem0 on X: "https://t.co/wyA9Gm54vW" / X

mem0

@mem0ai

$

基于召回的智能体记忆基准测试的饱和度

2

7

49

46

大多数记忆基准测试检验系统在直接提问时能否找到事实。但现实中的智能体几乎从不会被直接提问。它们通常会收到任务,例如发送更新、在通常时间预订会议,或在团队上个月迁移到的频道中发帖。决定任务是否正确完成的事实通常根本不在请求中。

一个召回基准测试可能会问:"团队使用什么消息平台?"这个问题本身已经完成了大部分工作。它告诉系统存在一个存储的事实,并明确指示系统查找哪个事实。当系统开始搜索时,使用记忆最困难的部分早已被完成。

处理任务的智能体则没有这样的提示。它必须注意到之前学到的某些内容相关,检索正确的记录,将其应用于任务,然后通过调用合适的工具采取行动。召回基准测试跳过了第一步,仅对书面答案进行评分,但第一步正是智能体最容易失败的环节。

在召回基准测试中,问题本身完成了"注意到"这一步。而在行动基准测试中,智能体必须自己完成这一步。

召回基准测试已趋于饱和

众所周知的召回基准测试经过精心构建,目前大多数系统在这些测试中表现良好。正因如此,高分已无法准确反映智能体的实际表现。

LongMemEval清晰地展示了这一模式:GPT-4o在没有历史会话时得分为0.606,当提供合适的过往会话时得分提升至0.870,这说明剩余的差距主要在于找到文本,而非理解文本。

ConvoMem从另一个角度展示了类似现象。当历史对话少于150条时,简单地将所有内容放入提示中可获得70%至82%的得分,而记忆系统仅获得30%至45%。这一结果更多反映了基准测试本身的问题,因为它奖励的是文本的可用性,而非对记忆的管理能力。

更深层次的问题在于这些基准测试检验的内容。DolphinBench论文从智能体记忆基准测试需要的三个属性对16个记忆基准测试进行了评分。

第一个属性是任务是否要求智能体采取行动。第二个属性是是否每个结果都必须报告成本和延迟,而不仅仅是准确性。第三个属性是每个测试是否能被证明仅通过记忆就能解决,而无法通过其他方式解决。

.✓表示"是",✗表示"否",~表示"部分满足",具体原因见表格单元格。来源:DolphinBench论文表1

前10行完全无法测试"注意到"这一步,因为它们都采用提问方式。基于行动的基准测试修正了这一问题,但没有一个能证明每个测试都依赖记忆,仅有一个测试报告了成本数据。

如果一个问题可以通过常识、其表述方式或最后一条消息回答,那么高分反映的是捷径而非记忆。一些测试即使拥有完美记忆也无法通过,这让每个分数都存在未知的上限。

  1. 仅凭准确性会隐藏成本。将完整对话放入提示中是强有力的准确性基准,但这种方法既慢又昂贵。在Mem0论文的LoCoMo评估中,全上下文方法在最慢的5%请求中耗时17.12秒,而Mem0仅需1.44秒,且使用的token数量超过其十倍以上。

当基准测试仅报告准确性时,重新阅读所有内容的方法总是看起来最佳,即使这种方法在生产环境中过于缓慢且成本过高。

代理基准测试已找到更优方案

AI代理的基准测试采取了不同路径。它们停止评估代理说了什么,转而检查代理实际产生了哪些改变。

tau-bench给代理分配客户服务任务,然后将数据库的最终状态与应达到的状态进行对比。它还衡量代理在多次重复尝试(称为pass^k)中每次都能成功完成任务的频率。领先的代理完成的任务不足一半。

SWE-bench通过运行隐藏测试来评估代码修复效果。当OpenAI审核并创建SWE-bench Verified时,38.3%的任务被证明表述不清,修复这些问题使GPT-4o的得分从16%提升至33.2%。

这两个教训对记忆测试同样适用:评估代理实际产生的改变,并在任务真正重要前验证每个任务。表格中的基于动作的记忆基准测试已采用第一个教训,MemoryArena展示了其重要性:在LoCoMo上几乎完美得分的代理,在其关联的多步骤任务上的成功率仅为0.19。

第二个教训仍是当前缺失的关键点。

代理记忆基准测试需要证明的内容

这些教训提出了三个要求。

  • 请求中不能包含答案。如果包含,测试衡量的是代理是否遵循指令,而非是否记忆。
  • 任务必须能通过相关历史解决,而无历史则无法解决。唯一可靠的验证方式是两种方式都进行测试。
  • 评分者必须检查代理采取的具体行动。说出"I remember your team uses Discord"与将消息发送到正确频道是完全不同的行为。

第二个要求通过认证门禁(certification gate)强制执行,这是每个测试在纳入前必须通过的检查。每个测试会运行四次:两次仅包含包含必要事实的过去消息,两次无任何历史记录。只有在包含历史记录时通过测试且无历史记录时失败的测试才会被保留。

只有在包含预言消息时通过测试且无历史记录时失败的测试才会被采用。

DolphinBench

我们构建了DolphinBench(论文)以满足这三个要求。它追踪三位模拟人物数年的职业和私人生活:Morgan,一家初创公司CEO;Alex,一名基础设施工程师;Riley,一名产品经理。

$?

/$

每个人的对话历史包含约500,000个token的消息,总共有13,539条消息。代理通过其正常记忆系统读取这段历史,然后被赋予600个任务。这些任务针对模拟应用(如电子邮件、Slack、Discord、日历、CRM和GitHub)运行,这些应用通过MCP(一种标准化的代理工具提供方式)连接。

评分器会检查代理所调用的工具。只有当所有检查都通过时,任务才算通过。在1,920项检查中,有68%是精确比较而非模型判断。

基准的设计受到三个选择的影响:

  • 历史记录中仅包含用户的消息。每个代理在阅读时会自行撰写回复,就像实际使用时一样。
  • 每个请求在撰写时无法看到其依赖的事实。当撰写模型能够看到该事实时,它会不断暗示这一信息。
  • 每项测试都必须通过认证关卡,使用GPT-5.6 Luna进行验证。未能通过的测试会被重写或删除。

每个结果必须报告准确性、总成本(包括阅读历史记录和运行测试)以及每项任务的中位时间。

以下是一个单个测试的示例。2023年4月25日,Morgan仅陈述了一条规则:部署通过检查前,发布说明应放在#eng-releases,且绝不能放在#eng-all。此后有2,963条不相关消息。2026年9月14日,新请求到达:"Jake建议将此发布更新发往#eng-all...将更新发布到适当的Discord频道。"

2023年陈述的一条规则,在2,963条消息的掩埋下,决定了2026年的工具调用。

在13个官方配置中,有7个将更新发布到#eng-releases。其余6个遵循Jake的建议,发布到#eng-all。他们的消息写得很好,但发错了地方。

结果显示的内容

每个官方运行都包含代理所做操作的完整记录,因此我们重新分析了所有7,800次评分运行。

  1. 结果取决于整体设置。每个设置都包含一个框架和一个模型。所有记忆系统(包括内置记忆)在GPT-5.6 Luna上的得分都高于MiniMax M3或Claude Code,因此记忆评分必须与所使用的框架和模型一起评估。

这就是为什么排行榜按完整配置而非单独记忆系统进行排名。Mem0在Hermes的两个配置中得分最高,Honcho在Claude Code上得分最高。

  1. 记忆系统在模型最需要帮助时提升最大。Hermes的内置记忆并非空缺,它包含记忆文件和对过往对话的关键词搜索,所有附加的记忆系统都基于它运行。由于每个配置都执行相同的600项任务,我们通过McNemar检验(配对结果的标准检验)逐项比较它们。

在相同配置下,与内置记忆相比,任务提升具有配对显著性

使用MiniMax M3时,每个记忆系统都提供了显著帮助。Mem0增加了128项通过任务,Honcho增加了125项,Hindsight增加了87项,所有结果都具有统计显著性(p < 0.001)。使用GPT-5.6 Luna时,提升幅度较小,Mem0增加的30项任务具有统计显著性(p = 0.034)。

更强的模型能从内置工具中获得更大收益,因此附加的记忆层需要弥补的差距更小。并非所有记忆系统在每个配置中都优于内置记忆,这也是衡量完整配置的另一个原因。

  1. 最佳系统在准确性上差距较小,因此成本和速度变得重要。在每个配置中,领先的记忆系统彼此之间的得分差距仅在几个点内。在Luna上,Mem0、Hindsight和Honcho得分分别为70.7%、69.5%和68.5%;在MiniMax上,Mem0和Honcho得分分别为47.8%和47.3%。

在如此微小的边缘情况下,成本和速度帮助区分了这些系统。在Luna上,Mem0在内存系统中具有最快的中位时间,其最慢的5%任务在82秒内完成,而Hindsight在内存系统中总成本最低。这就是为什么基准测试需要这三个数字。

  1. 几乎所有的成本都来自于读取历史记录。

每个配置的花费去向

运行600个任务的成本非常低:在Luna上,Mem0的总成本为96.21美元,其中仅3.23美元用于任务执行。在所有13个配置中,87%到99%的成本在第一个任务之前就已产生,因为代理需要回复13,539条消息,而内存系统需要处理这些消息。对于某些内存系统而言,它们自身的处理成本是账单中最大的部分。

在生产环境中,内存成本随着代理读取的历史记录量增加而增长,而不是随着回答问题的数量增加。

  1. 代理通常因使用错误的细节而失败。使用GPT-5.6 Luna时,94%到97%的失败任务调用了正确的工具,但使用了错误的回忆细节,例如错误的频道、接收者或日期。在Claude Code上,至少有一半的失败任务从未进行过必要的调用。

论文中的示例“我提前离开,请点一杯小拿铁自取”被所有13个配置失败。咖啡馆在历史记录中仅被提及一次,是在1,344天前的历史消息第一条中。11个配置询问了使用哪家咖啡馆,但没有一个识别出用户已经告诉过他们。

总结/思考

召回基准测试仍然有用。它们衡量了系统在被询问时能否找到信息,目前大多数系统都能通过该测试。该领域不需要另一个将事实直接嵌入问题的基准测试。

如果你想证明系统能够记住足够的信息来回答问题,召回基准测试是合适的工具。如果你想证明系统能够记住足够的信息来采取正确行动,你需要评估它采取的行动。DolphinBench正是为第二种情况而构建的。

你可以查看排行榜和数据集,或使用自己的工具、模型和内存系统运行测试并提交结果。

在上下文中

本文是In Context系列的一部分,该系列由@mem0ai撰写,主题是AI代理的内存和上下文工程。

Mem0是一个开源的内存层,专为LLM和AI代理设计,用于实现跨会话的长期、个性化、上下文感知的交互。

  • 获取免费API密钥:app.mem0.ai
  • 从开源仓库进行自托管

方法说明:我们从DolphinBench仓库中的公开运行记录中计算了配对测试、成本分解和失败分类。

参考文献

  • DolphinBench: Mapping the Pareto Frontier of Agent Memory (arXiv:2609.24971)
  • DolphinBench 网站和仓库
  • LoCoMo (arXiv:2402.17753)
  • LongMemEval (arXiv:2410.10813)
  • ConvoMem (arXiv:2511.10523)
  • ATANT v1.1 (arXiv:2604.10981)
  • Gururangan 等人,NLI数据中的标注伪影 (arXiv:1803.02324)
  • Mem0: 构建生产就绪的AI代理 (arXiv:2504.19413)
  • tau-bench (arXiv:2406.12045)
  • SWE-bench (arXiv:2310.06770) 和 SWE-bench Verified
  • MemoryCode (arXiv:2502.13791)
  • MemoryArena (arXiv:2602.16313)
  • Mem2ActBench (arXiv:2601.19935)
  • MEMTRACK (arXiv:2510.01353)
  • STATE-Bench (Microsoft)

2026年9月29日 下午4:56

·

3,985

浏览量