Empty shelves or lost keys? Recall is the bottleneck for parametric factuality

TL;DR · AI 摘要
前沿LLMs的事实性错误主要源于回忆失败而非编码失败,Google提出知识分析框架区分两者并验证该结论。
核心要点
- 知识分析框架将事实错误分为编码失败(empty shelves)和回忆失败(lost keys)两类
- WikiProfile基准测试包含2150个维基百科衍生事实及10个相关问题
- Gemini3和GPT-5等前沿模型80%的事实错误属于回忆失败
结构提纲
按章节快速跳转。
- §引言
提出LLMs事实性错误的两种根本原因假设并引出研究目标
定义编码/回忆/识别三类能力并建立五类知识画像分类体系
- ›实验方法
设计WikiProfile基准测试验证模型在事实编码与回忆能力上的表现差异
- ·核心发现
前沿LLMs80%的事实错误源于回忆失败而非编码缺失
- ›技术启示
应重点优化模型的回忆机制而非单纯扩大训练数据规模
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- 事实性错误根源分析
- 核心机制
- 知识画像分类体系
- 编码/回忆/识别三类能力
- 实验验证
- WikiProfile基准测试
- Gemini3/GPT-5测试结果
- 技术启示
- 优化回忆机制
- 推理优化方法
金句 / Highlights
值得收藏与分享的关键句。
前沿LLMs编码了几乎所有事实,但80%的事实错误源于无法回忆已编码信息
WikiProfile基准测试包含2150个事实,每个事实配10个问题检测三类能力
回忆失败可通过思维链提示等推理优化方法改善,而编码失败需要扩大训练数据
空货架还是丢失的钥匙?回忆是参数事实性的瓶颈
2026年8月12日
Nitay Calderon 和 Gal Yona,Google Research 研究科学家
当大型语言模型(LLMs)出现事实性错误时,是由于它们从未学习过这些事实,还是因为它们无法回忆起已编码的信息?我们的知识分析框架揭示了后者:前沿LLMs几乎编码了所有事实,但难以回忆起其中许多内容。
快速链接
- 论文
- WikiProfile
- 分享 复制链接 ×
事实性对于确保大型语言模型(LLMs)的可靠性至关重要。当模型回答事实性问题时出现错误,是由于该事实从未被编码,还是因为该事实已被编码但无法访问?标准准确率指标会将这些情况合并计算,尽管它们暗示了截然不同的局限性和不同的干预措施。编码失败需要扩大模型规模或扩展数据覆盖范围,而回忆失败可能还指向有助于LLMs更好地利用已有编码信息的后训练和推理时方法。
在《空货架还是丢失的钥匙?回忆是参数事实性的瓶颈》中,我们引入了知识分析,这是一种行为框架,可以同时衡量编码和回忆能力,并利用它来分析前沿LLMs(如Gemini3和GPT-5)事实性背后的瓶颈。我们随后表明,许多前沿LLMs的事实性错误更应被理解为“丢失的钥匙”(回忆失败),而非“空货架”(编码失败)。
类比而言,我们使用编码表示事实的参数化表示,回忆表示在没有外部提示的情况下检索已编码事实,识别表示在备选方案中识别正确事实。为支持这一分析,我们引入了WikiProfile,这是一个包含2,150个维基百科衍生事实的基准测试,每个事实都配对了10个问题,用于探测编码、回忆和识别能力。
核心思想:知识分析
知识分析将分析单位从单个问题转向事实本身。我们不再询问模型是否正确回答了某个特定问题,而是提出更广泛的问题:该事实的状态如何?我们将每个事实归类为五种知识分析类型之一:(1)编码失败,(2)回忆失败,(3)直接回忆,(4)思考后回忆,(5)无需编码的推理。这些分析类型比单纯的问题级准确率能提供更深入的诊断信息。
分类依据是事实是否被编码以及其可访问性:无法回忆、可直接回忆,或仅在思考后可回忆(在最终答案前触发中间计算,包括思维链提示和优化思考的LLMs)。
根据图片宽度确定适当宽度
对于移动设备图片,使用默认宽度
描述事实的五种知识分析类型。
我们通过三个行为概念来具体化这一分析:
- 编码:如果模型能在类似预训练的上下文中正确复现事实,则认为该事实已被编码。在我们的设置中,我们通过命题补全和上下文提问来衡量这一点,这些方法将模型置于与预训练期间自然出现事实的上下文相似的环境中(不透露答案),从而促使模型暴露其是否已编码该事实。
- 知识:如果模型能够针对同一事实的不同表述(包括直接问题和反向问题)正确回答语义等价的问题,则说明模型掌握了该事实(例如,若 *A 是 B*,直接问题会问“B 是什么?”,而反向问题会问“A 是什么?”)。
- 回忆:如果模型能够回忆起一个已编码的事实,则说明模型掌握了该事实。若模型无需思考即可回忆起事实,我们称之为直接回忆;若模型掌握的是未被编码的事实,则称为无编码推理。这种情况仅在开启思考模式且模型依赖其他已编码事实进行多跳推理或合理推测时发生。
Top:我们从维基百科提取事实,这是预训练数据的主要来源。Left:我们通过提示大语言模型(LLM)在原始上下文中复现事实来衡量编码能力。Right:我们通过提出不同表述和关系方向的问题(包括开启和关闭思考模式)来衡量知识掌握程度。
引入 WikiProfile
为实现知识分析,我们构建了 WikiProfile,这是一个用于衡量自然事实真实性的基准测试。WikiProfile 通过完全自动化的流程构建,该流程由带有思考能力的提示大语言模型 Gemini-2.5-Pro 驱动。提示词通过在小规模验证集上手动优化开发。我们通过识别实体有序对(主语和宾语)来从维基百科页面中提取候选事实,其中主语在文档中首次出现。每个事实均配对 10 个任务:2 个用于编码评估,4 个用于知识评估,以及 4 个多项选择版本用于识别测试。
我们通过生成、优化和过滤三步流程生成直接问题和反向问题,确保每个问题表述清晰、具体、简洁且答案唯一。所有问题均通过搜索引擎进行过滤,剔除返回多个答案或需要澄清的案例。经过自动化过滤和最终人工验证后,基准测试包含 2,150 个事实。
基于提示大语言模型的全自动流程。左(紫色):事实提取与命题补全任务构建。中(红色和蓝色):通过生成、优化和过滤构建直接问题和反向问题。右(绿色):基于直接/反向问题对生成其余问题(自然表述、上下文相关和多项选择版本)。
我们如何评估大语言模型
我们评估了 13 个大语言模型。每个模型均在开启和关闭思考模式两种情况下进行评估。对于每个模型、事实和任务,我们采样 8 个响应。响应由提示大语言模型自动评分者进行自动评分(更多细节见论文),生成约 450 万个响应。
主要结果:回忆而非编码是瓶颈
在前沿大语言模型(Gemini-2.5-Pro、Gemini-3-Pro 和 Flash、GPT-5)中,事实编码接近饱和,但回忆能力尚未达到瓶颈。对于 Gemini-3-Pro 和 GPT-5,95-98% 的事实已被编码,但这些模型仍无法直接回忆 26-34% 的事实。即使开启思考模式,它们在 11-12% 的事实仍表现失败。这意味着在前沿模型中,事实性错误越来越多地不是源于知识缺失,而是源于知识虽已存储但无法可靠调用。换句话说,瓶颈正在从知识获取转向知识利用。
Scaling reinforces this picture. In the Gemma 3 family, larger models show far fewer encoding failures, but recall failures remain substantial and become a larger share of the remaining errors. Scaling improves what the model stores more than it improves what the model can access.
五种特征在13个LLM中的分布(百分比)。黑线表示潜在知识。如图所示,随着模型规模扩大,编码失败率显著下降,但召回失败在前沿模型中仍持续存在。
为什么会出现召回失败?
我们的研究结果表明,召回能力与事实学习时的条件密切相关。当查询内容偏离训练时的上下文、表述方式或顺序时,召回会变得更加困难。我们重点分析了两种系统性出现这种情况的情形。
罕见事实被编码但难以召回
先前研究表明,LLMs在处理长尾(罕见)事实时存在困难,通常将其归因于模型容量问题。我们的研究结果提出了补充性观点:当比较低流行度和高流行度事实时,我们发现罕见事实的编码率与流行事实接近。编码差距相对较小,但召回差距更大。这重新定义了长尾问题:许多罕见事实并未缺失于模型参数中,而是存在但难以访问。瓶颈已从知识获取转向知识利用。
我们比较了两个流行度层级(底部20% vs. 顶部20%)的编码率和直接召回率。Δ表示层级间的差距。如图所示,编码差距较窄而召回差距较宽。详见我们论文中所有LLM的结果。
反向问题可验证但难以召回
我们重新审视了"反向诅咒"现象:当LLMs知道"A是B"却无法回答"B是什么"时。乍看之下,这可能暗示LLMs缺乏双向知识。但我们的研究结果对这一观点进行了修正。在开放式生成(即召回)任务中,反向问题始终比直接问题更难;但在多项选择验证(即识别)任务中,反向问题与直接问题难度相当,甚至更易。这种差异具有重要意义:如果模型在选项中能识别正确答案却无法在反向查询中生成,问题并非简单地双向知识缺失。事实似乎已被编码且可识别,但当查询方向偏离训练时遇到方式时,仍难以召回。反向诅咒本质上是召回问题。
我们比较了两个任务中直接问题和反向问题的表现:验证(多项选择)和生成(闭卷考试)。Δ表示直接设置与反向设置间的差距。LLMs在验证任务中能有效处理反向问题,但在生成任务中表现不佳。
作为恢复机制的思考
现在我们探讨一个关键问题:什么机制能够恢复原本无法访问的知识?为此,我们研究了"思考"这一机制的潜力。思考对召回的提升效果最显著的区域,正是直接召回最薄弱的区域。这种提升对罕见事实和反向问题尤为明显,既缩小了流行度差距,也缩小了方向性差距。
我们分析了思考对回忆(已编码事实的知晓)的影响。左图:我们比较了两个事实流行度层级(底部20% vs. 顶部20%)。右图:我们比较了直接问题和反向问题。流行度或方向性差距分别用Δ(无思考)和ΔT(有思考)表示。
如图所示,思考缩小了差距(ΔT < Δ)。
更具体地说,在经过思考优化的模型中,思考能够恢复约40-65%的已编码但未被直接知晓的事实。相比之下,对于未被编码的事实,思考的帮助要小得多。这一模式表明,思考主要充当回忆辅助机制:它帮助模型访问已编码的事实,而非主要通过复杂多步骤推理推导答案。但需要指出的是,思考并非免费。它会带来计算成本,且尚不清楚如何准确判断模型何时应调用思考。
我们报告了在事实是否被编码(红色)或未被编码(黄色)的条件下,通过思考变为已知的未知事实百分比。在经过思考优化的大型语言模型中,思考可恢复40-65%的已编码事实,但仅能恢复5-15%的未编码事实。
总结
知识分析使我们能够精准诊断大型语言模型中的事实行为。将此方法应用于维基百科事实,我们的结果表明,我们应重新思考前沿大型语言模型中事实性错误的处理方式。如果编码已接近饱和,那么事实性的进一步提升可能更多来自模型规模或数据的扩展之外。通过证明思考可以恢复大量已编码但未被直接知晓的事实,事实性方面的后续改进可能不仅来自更好的知识获取,还来自对模型中已编码知识的更好利用。
- 标签:
- 生成式AI
- 自然语言处理
其他相关文章
- 2026年7月30日 Science One Framework:通过证据链实现的可验证自主研究框架 一般科学 · 机器智能 · 自然语言处理
- 2026年7月22日 SymptomAI:面向日常症状评估的对话式AI代理 一般科学 · 健康与生物科学 · 自然语言处理 · 负责任的AI
- 2026年7月15日 朝着揭示扩散模型创造力的方向 算法与理论 · 生成式AI · 机器智能
×
❮
❯
条形图展示思考步骤如何在不同事实流行度和问题方向上提升各种模型的召回率。
图示说明语言模型中五种知识检索状态,从编码失败到直接回忆。
堆叠条形图展示五种知识检索状态在不同语言模型中的分布情况。
折线图显示如果事实已在模型中编码,通过思考检索到的可能性显著提高。
流程图详细说明WikiProfile管道如何将维基百科文档转换为验证过的多项选择题。
条形图显示语言模型对高流行度事实的编码和回忆效果优于低流行度事实。
图示说明大型语言模型中的事实性知识操作化。它将编码定义为在预训练上下文中复现事实,将知晓定义为正确回答关于该事实的直接或反向问题。
条形图比较语言模型在验证和生成任务中直接与反向事实检索的性能。