Towards Data Science

LLM Summarizers Skip the Identification Step

8.5内容质量
LLM Summarizers Skip the Identification Step

TL;DR · AI 摘要

LLM生成的摘要可能缺乏识别步骤,导致错误的总结。应将LLM生成的摘要视为源文档的结构化声明,并要求每个声明声明其支持类别。

核心要点

  • LLM生成的摘要可能缺乏识别步骤
  • 每个声明应声明其支持类别
  • 识别步骤改变了模型允许的断言

结构提纲

按章节快速跳转。

  1. 介绍LLM生成的摘要存在的问题。

  2. 识别步骤在因果推理中的重要性。

  3. 识别步骤如何改变模型允许的断言。

  4. 识别步骤在实际应用中的表现。

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • LLM生成的摘要

金句 / Highlights

值得收藏与分享的关键句。

#LLM#摘要#识别步骤
打开原文

标题:LLM摘要生成器跳过了识别步骤

来源网址:https://towardsdatascience.com/llm-summarizers-skip-the-identification-step/

发布日期:2026-05-10T13:00:00+00:00

Markdown 内容: 它将一个五分钟的对话转换成八个清晰的部分。决策。行动项。风险。未解决的问题。每个部分读起来就像是由一位认真听讲的人写的。

然而,阅读原始的对话记录,你会发现其中两个部分是从一句模棱两可的句子中推断出来的,一个完全是虚构的,而三个则是根据模型之前对会议总结应该包含的内容进行模式匹配得出的。这些内容自信、格式规范且结构上与实际发生过这些事情的会议总结无法区分。

这并不是通常意义上的幻觉问题。模型并没有编造关于世界的一个事实。它是在编造关于会议的一个事实。而且这种失败模式在输出中并不明显。它只是听起来很自信的文字,读者无法轻易地用源材料来验证。

在另一个领域,这种失败模式有一个名字,并且比语言模型更古老。这就是当你在没有识别的情况下进行估计时会发生的情况。

这篇文章不是一个新的摘要基准测试。它是一个设计模式的论点,我还没有在人工智能工程文献中看到将其作为核心设计约束来讨论:将LLM生成的摘要视为对源材料的结构化声明,要求每个声明都声明其支持类别,并限制审查阶段,使它们只能削弱未经支持的声明而不是使输出更加平滑。我将通过实践中的表现、产生的结果以及失效的地方来解释这一点。

缺失的步骤

因果推理是一种分析传统,它形式化了识别一个量和估计一个量之间的区别。识别是指论证你拥有的数据可以支持你想提出的主张。估计是在确定识别之后产生一个数字的过程。这个顺序是不可谈判的。你不能估计一个治疗效果,因为你还没有首先论证它是可以从观察数据中识别出来的,因为得到的结果是没有意义的。它看起来像是一种效果。但它不是一种效果。

在观察性研究环境中工作的从业者会花费大量时间在识别上。他们绘制因果图。他们争论混杂因素。他们区分数据能够支持什么和不能支持什么。当最终进入估计步骤时,这通常是简单的部分。

现在考虑一个LLM摘要生成器做了什么。它接收一个对话记录。它生成关于该对话记录内容的结构化声明:做出的决策、接受的承诺、提出的风险、分配的下一步。每个声明实际上是对潜在数量的一种估计。决策已经做出或没有做出。承诺已经接受或没有接受。摘要在声明这些数量的值。

没有识别步骤。模型不会问对话记录是否包含足够的证据来支持声明。它生成声明是因为格式需要一个声明。

LLM摘要生成的行为类似于观察性分析,但通常部署时没有任何类似于识别步骤的东西。

人工智能工程文献并没有忽视底层问题。幻觉检测)、校准不确定性、选择性预测和放弃RAG接地、引用验证、事实一致性声明验证:这些都是严肃的研究方向,每个都解决了失败的一个真实层面。它们的共同之处在于,它们将捏造视为一种模型行为,在事后进行测量、评分或抑制。

识别是不同的层次。它不会对输出的信任度进行评分。它通过要求每个声明都声明其是什么以及来自哪里来改变模型最初允许声明的内容。这两个层次是互补的。一个识别良好的管道仍然受益于下游的校准和接地工作。一个只做下游工作的管道是在过滤本不应以这种方式产生的输出。

对话记录中的识别是什么样子

观察性数据中的识别是一个关于数据能支持什么的问题。对话记录中的识别是同样的问题,但针对特定的来源。给定这个对话记录,哪些可以直接观察到,哪些可以在声明假设的基础上推断出来,哪些根本无法支持?

这就是全部的关键。每个摘要生成器产生的声明都应该声明属于这三个类别中的哪一个。观察声明指向对话记录中的特定片段,并且除了该片段所表达的内容外不作其他声明。推断声明声明所做的假设以及推理所跨越的证据。建议声明声明这是模型的建议,而不是参与者的决定。

一个不能将声明归入这些类别的摘要生成器没有理由生成该声明。在这种情况下正确的输出不是更平滑的声明。而是没有声明。

这对摘要的消费者来说是不舒服的,因为这意味着当底层对话内容较少时,许多部分将是空的。这种不适正是关键所在。这是信息。它告诉读者,会议实际上并没有产生八个实质性部分,无论摘要生成器想要写什么。

该架构遵循框架设计。包括三个LLM阶段和一个确定性渲染器。

图 1
图 1

_图 1. 管道架构:三个 LLM 阶段,一个确定性渲染器。_

图片由作者提供

第一阶段从转录中提取结构化的事实。包括发言者轮次、明确的承诺、明确的决定和明确的数量。这个阶段是刻意保守的。它可以错过一些东西,但不允许凭空捏造。

第二阶段将这些事实综合成八个部分中的主张对象。每个主张带有标签:观察到的、推断出的或建议的。每个主张都指向提取的事实中的证据。综合是分析工作发生的地方,也是模型最可能产生偏差的地方。

第三阶段进行审核。这是执行识别工作的阶段,其约束条件是设计中最重要的一部分。

审核阶段不能将分析改写得更平滑。它不能添加听起来更好的建议。它不能凭空发明缺失的上下文。

它只能使用一组有限的操作,并且禁止做其他任何事情。它可以删除一个主张。它可以将主张从观察降级为推断,或者从推断降级为建议。它可以将主张移动到更合适的部分。它可以用显式不足证据占位符替换一个主张。当一个部分中的所有内容都无法通过审查时,它可以折叠整个部分。

图 2
图 2

_图 2. 审核阶段允许应用的五种操作。_

不在这个列表上的任何操作都是被禁止的,包括编写更好的主张。

图片由作者提供

replace_with_insufficient_evidence 操作值得单独列出。 这个系统会在输出中插入一个占位符,代替原来自信的主张。这就是将识别工作付诸实践。读者可以在文本中清楚地看到合成阶段生成的主张,而源材料无法支持这些主张。

为什么不对称很重要。 允许改进分析的审阅者会成为系统试图解决的问题的另一个来源。只允许削弱或删除的审阅者只能在一个方向上失败:过于谨慎。这是一种可以容忍的失败模式。相反的情况则不行。

设计产生的结果以及拒绝产生的结果

这不是基准测试。这是一个基于固定场景的小型压力测试,旨在检查架构是否产生了它所构建的行为。三个转录文件不足以对LLM摘要做出一般性结论。它们足以检查特定的设计选择是否具有预期的结果。

固定场景包括:一次决策会议,在其中选择了三个真实替代方案中的定价模型;一次工作会话,揭示了一个测量问题但未解决;以及一次包含几乎无决策内容的简短两人同步会议。

没有发生的事情。 在三次运行中,管道生成了零伪造承诺和零无根据的数量。这是架构旨在使其更难实现的目标。如果主张没有指向证据,则该主张无法通过管道。审核阶段也不能制造证据来维持主张的生命力。结果不是保证。只有确定性渲染器才能给出保证。提取、综合和审核仍然是LLM调用,仍然可能失败。重点在于,架构倾向于将这些失败导向移除而不是伪造,固定场景也与这一点一致。

发生的事情。 我觉得更有趣的结果是弃权率。

图 3
图 3

_图 3. 弃权率随输入信号的稀疏程度而变化。_

在三个固定场景的转录文件中,空置部分的比例从17%上升到了58%。

在所有三个固定场景中:0个伪造承诺,0个无根据的数量。

图片由作者提供

在丰富的决策会议上,管道使17%的部分空置或替换为不足证据占位符。在工作会话中,这一比例上升到25%。在简短的同步会议中,这一比例达到了58%。当输入信号稀疏时,系统生成的空部分大约是丰富输入信号情况下的三倍半。

这就是设计试图产生的行为。无论输入如何,填充相同八个部分的摘要器并不是在总结。它只是在生成符合模板的输出。模板在起作用,模型只是表面的修饰。

一个根据输入稀疏程度相应弃权的摘要器正在做不同的事情。它将转录视为内容变化的源,并让这种变化反映在输出中。空部分不是模型的失败。它们是模型拒绝断言源材料不支持的内容。

图 4
图 4

_图 4. 渲染输出中的识别表现。_

摘自决策会议的固定场景,类别标签在行内显示。

图片由作者提供

阅读结果。 标签不是装饰。它们改变了读者处理输出的方式。观察到的主张邀请读者对照转录进行验证。推断出的主张邀请读者审视产生它的假设。不足证据占位符邀请读者要么自己查看源材料,要么接受会议实际上并未产生那种形式的主张。

消费者提出的反对意见

有一种观点认为空节段是一个可用性问题。读者期望看到一个总结。读者得到的是一个带有明确空白的局部总结。读者需要做更多的工作。

这种反对意见值得直接回答。那些得到了流畅的八节总结的读者已经在无形中做了更多的工作。他们将会阅读总结,根据它采取行动,最终发现有两个行动项实际上并未达成一致,还有一个风险从未被提出。这种发现的成本很高,体现在会议资源的错配、承诺的遗漏以及对工具信任的缓慢侵蚀。

诚实的空节段会将成本提前。读者可以立即看到这些空白,并决定如何处理。打开对话记录。询问参与者。将会议视为无结论。每一种反应都比基于自信但未获得源数据支持的总结采取行动更好。

这与观察分析人员在拒绝报告没有标识的点估计时所做的权衡相同。消费者更喜欢一个数字。分析师拒绝提供。消费者从没有数字的情况下做出的决策,平均而言,比从数据无法支持的数字中做出的决策更好。

将模式推广

这种架构可以转移应用。任何从源生成结构化声明的 LLM 工作流都可以重新定义为观察分析,并增加一个标识层。

法律发现的文件审查。病患笔记摘要。客户通话分析。代码审查摘要。目前,这些领域都是以一次性生成问题的形式部署的,模型从源生成结构化输出,消费者信任结果。它们都有类似会议总结器的失败模式,每个都可以通过类似的架构变得更可审计:一个保守提取源内容的阶段,一个生成带证据指针的标签声明的综合阶段,以及一个禁止添加或强化任何内容的审计阶段。这些领域的实现和风险概况各不相同。模式可以转移,具体细节则不同。

标签和证据指针不是可选功能。它们是使识别步骤实际可行的部分。没有标签的声明无法识别。没有证据指针的声明无法审核。审计阶段的单调弱化约束防止了识别工作的倒退,这是由模型希望生成更平滑输出所导致的。

这对构建这些系统的人意味着什么

校准的不确定性估计是有价值的。幻觉基准测试是有价值的。锚定和引用工作也是有价值的。但它们都不能替代拒绝生成源数据不支持的声明这一纪律。

这种纪律在许多 LLM 系统中缺失,部分原因是文化原因。该领域起源于机器学习,模型的目标是对每个输入生成输出。文献中并不陌生的是有时正确的输出是没有输出的概念,但对于训练生成模型以填充接下来的内容的默认倾向来说,这却是陌生的。然而,对于观察分析来说,这很自然,因为许多问题的答案是数据无法支持的。

因此,使 LLM 分析系统可信的技术可能主要不是来自 LLM 文献本身。它们可能来自已经解决了在源数据作为约束条件的情况下如何进行诚实分析的学科。因果推断就是其中之一。调查方法学是另一个。法医会计也是。

_那些已经知道如何拒绝在没有标识的情况下进行估计的人,对当前 LLM 分析工具的问题有着独特的视角,并且知道如何解决这些问题。_

因果推断教会了一代从业者不要估计他们尚未首先识别的内容。LLM 总结器犯了同样的错误,只是用文字而不是数字。解决方案不仅仅是更好的模型。解决方案是恢复观察分析从未放弃的步骤,并通过一种无法被说服去做正确事情的架构来强制执行。

  1. 将标签视为装饰性的。如果标签在上游没有强制执行,则它们只是装饰。它们必须在合成阶段通过指向证据的指针来分配,并在下游针对该指针进行审核。一个生成带有证据指针标签的合成阶段并不是在做识别工作。它是在生成看起来像识别的类别。
  2. 让审核阶段发挥作用。这是容易犯的错误。一个能够添加建议、提供缺失上下文或重写笨拙声明的审阅者会觉得自己很有用。这也是合成阶段已经存在的失败模式,只是装扮成质量控制的样子。限制审核为一组固定的削弱操作。其他任何操作都是系统在自相矛盾。
  3. 混淆弃权与低质量。在一个简短的会议中,一个总结器返回大部分空的部分并不表示失败。而在同一个简短的会议中,一个返回自信的八部分输出的总结器是失败的,只是不明显。评估这些系统的标准不是摘要完整性,而是弃权率是否随源中的信号变化而变化。
  4. 从三个固定点推导出一般性结论。三个转录文件足以检查某个设计选择是否产生了预期的行为。但它们不足以对LLM摘要做出一般性结论。如果你构建了这样的版本,你需要自己的固定点集和自己对弃权水平的定义,以适应你的使用场景。

关键的不对称性

只能削弱其输出的管道只有一个失败模式:过于谨慎。能够增强其输出的管道则具有文献在过去几年中记录的所有失败模式。

选择第一种而不是第二种并不是技术决策。这是一个关于系统用途的决策。如果系统是为了生成流畅的文本,那么第二种在所有指标上都胜出。如果系统是为了生成读者可以在行动前审核的声明,只有第一种是可辩护的。

目前大多数工具都是为第一个目标而构建并部署的,仿佛它们是为第二个目标而构建的。将这种差距视为方法论问题而非模型质量问题,这改变了可用的补救措施。

  • * *

_仓库、评估工具和示例输出可在 GitHub 上找到。完整的笔记本将一个转录文件通过每个阶段,并运行评估工具跨所有三个固定点。_

  • * *

员工数据科学家,专注于因果推理、实验和决策科学。我撰写关于如何将模糊的业务问题转化为决策就绪分析的文章。

更多类似内容,请访问我的 LinkedIn 页面 Image 5: 👇

Image 6: 🔗LinkedIn