When LLM judges agree, should we believe them?
TL;DR · AI 摘要
使用Ising模型进行依赖感知的标签聚合,可提升多评委LLM评估的准确性,减少因评委输出相关性导致的误差。
核心要点
- Ising模型方法在三个任务中提升9-14%准确率,优于加权多数投票基线。
- 评委面板需评估多样性,检查同意聚类模式,调整置信度而非同等对待所有投票。
- 评委输出相关性可能掩盖真实证据,需通过统计方法检测并调整聚合结果。
结构提纲
按章节快速跳转。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- 依赖感知的标签聚合
- Ising模型
- 处理评委依赖关系
- 评委相关性
- 训练血缘/提示模板/模型家族
- 实验结果
- 3任务提升9-14%
金句 / Highlights
值得收藏与分享的关键句。
使用Ising模型进行依赖感知的标签聚合,可提升多评委LLM评估的准确性,减少因评委输出相关性导致的误差。
在三个任务中,该方法比加权多数投票基线提升9-14%准确率。
评委输出相关性可能掩盖真实证据,需通过统计方法检测并调整聚合结果。
当LLM评委达成一致时,我们应该相信他们吗? - Amazon Science
对话式人工智能
当LLM评委达成一致时,我们应该相信他们吗?
通过降低高度相关输出的LLM评委意见权重,可确保评委小组真正反映多元视角
作者:
Krishna Balasubramanian
Sasha Podkopaev
2026年8月26日
5分钟阅读
分享
- 复制链接
- 邮件
- X
- 领英
- Line
- QZone
- 新浪微博
- 微信
分享到微信
x
关键要点
- 引入基于伊辛模型的依赖感知标签聚合方法,解决当评委共享训练背景、提示词或模型家族时,一致性评分被高估的问题
- 提出将评委小组视为网络结构,同时建模评委间成对依赖关系和个体可靠性,使无监督场景下能区分独立证据与共性错误
- 在三个任务(相关性分类、毒性检测、摘要评估)中,10人评委小组相较加权多数投票基线方法,准确率提升9-14%
- 为LLM作为评委的流水线提供实践指导:统计评估小组多样性、检查一致性聚类模式、按评委相关性调整置信度而非平等对待所有投票
这个回答有帮助吗?
想象评估一个检索增强生成系统。用户提出问题,系统检索文本段落,LLM评委判断其相关性。为降低噪声,你让多个评委模型评估相同段落。8个评委说"相关",2个说"不相关"。
10个评委中8个同意看似有说服力。但重要问题不仅是同意人数,更在于他们是否独立达成一致。
如果8个同意的评委确实是独立证据来源,那么一致性是强信号。但如果他们共享提示模板、训练背景、模型家族或共同盲区,可能重复相同错误。投票数会让证据看起来比实际更强。
评委间输出的相关性限制了多评委小组的实用性。
我们与Shiva Kasiviswanathan合作撰写的论文《通过伊辛模型实现LLM作为评委的依赖感知标签聚合》,在本届国际机器学习会议(ICML)上发表,解决了这个问题。我们提出评估评委输出相关性并相应调整综合评分的方法,确保观点多样性。
在三个不同任务的测试中,我们的方法在标准指标上相较最佳基线(按历史准确性加权的评委小组)提升了9%到14%。
当部分评委输出相关时,10票可能包含少于10个独立证据。
隐含假设
多数投票的吸引力在于其简洁性。每个评委一票,票数多者胜出。加权多数投票是自然改进:更准确的评委获得更多权重。
这两种方法都是有用的基线。但它们基于相同的简化视角:错误评委被视为独立出错。
该假设对于LLM作为评委的系统来说往往过于乐观。两个评委可能因为对评分标准的理解相似而同时失败。多个评委如果接收到相同的示例,可能会继承相同的评估偏见。一组相关模型可能对相同的措辞敏感。在这些情况下,多数意见可能不如表面看起来那么有信息量。
评委小组是一个网络
更好的聚合方法应将评委小组视为一个评委网络。每个评委仍然有其自身的可靠性特征,但评委之间的配对也可以存在关系。某些配对的同意频率高于其个人可靠性特征预测的水平,包括在共同错误上的判断。其他配对则能提供更具互补性的视角。
我们使用Ising模型来建模这些关系,这是一种可以表示二元变量之间成对依赖关系的统计模型。在LLM作为评委的场景中,聚合器同时学习评委的技能和评委之间的相似性。
多数投票统计票数;加权投票学习每个评委的可靠性;依赖感知聚合还学习评委之间的关系。
我们的方法专为无监督场景设计:它通过评委的输出进行学习,而无需使用人工参考标签进行训练。它将每个项目的真正标签视为潜在变量,与描述评委可靠性和依赖性的参数联合推断。
依赖建模有两个有用的层次。在第一种情况下,评委之间的关系模式对正负标签大致相同。最终决策仍然看起来像加权投票,但权重会根据相关性进行调整。冗余的一致性可以被折算,而不会使预测规则难以解释。
第二种变体——类别依赖模型——允许关系模式随着标签变化。当一致性结构包含类别信息时(例如,评委在明确项目上表现出广泛一致,但在模糊项目上分裂成可识别的集群时),这种方法非常有用。这种方法更具表现力,但需要更多数据来可靠估计额外参数。
从评估日志中学习
从初始参数设置开始,算法将每个项目的投票组合起来,估计其真实标签为正的概率。这些软概率是模型当前的最佳猜测,而不是外部标签。然后,算法在更新这些概率和从概率中重新估计评委可靠性和成对依赖性之间交替进行。参考标签仅在之后用于衡量实验准确性。
这种方法对已经大规模收集LLM作为评委输出的团队尤其相关。现有的评估日志包含的不仅仅是投票;它们包含一致性和分歧的模式。依赖感知聚合将这些模式转化为可用信号。
学习到的评委关系可用于审计过程中,帮助识别冗余评委和任务特定的共同盲点。
相同的网络模型还能回答实际问题。相似的模型是增加了独立证据,还是主要相互强化?一个任务是否产生广泛一致,而另一个任务产生集群特定的分歧?增加另一个评委更可能改进评估,还是仅仅复制现有偏见来源?
评估
我们对三种二分类任务进行了评估:检索信息的相关性分类、毒性分类和摘要评估。评审小组包含10个评审模型,所有模型均在温度为零的条件下运行——这意味着它们的输出没有随机性,相同的输入将始终产生相同的输出。
我们将依赖感知模型与两种条件独立性基线进行比较:加权多数投票和均匀多数投票。在三个任务中,当系统拥有足够多的评估项和评审模型以估计有意义的关系时,建模依赖性可提高准确性。
使用全部10个评审模型和每个任务的最大可用训练数据,依赖感知模型在相关性任务上达到0.912的准确率,显著高于加权多数投票的0.820和均匀多数投票的0.804;在毒性任务上达到0.792,优于基线的0.694和0.695;在摘要任务上达到0.806,优于基线的0.737和0.561。
所有10个评审模型的测试准确率结果汇总。依赖感知变体在加权和均匀多数投票基线之上均有提升。
最佳实践
对于使用LLM作为评审的团队,依赖感知聚合方法建议采用以下实用做法:
- 首先,评估评审小组而非单个评审。即使单个评审表现强劲,若它们以相同方式失效,整个小组仍可能冗余。
- 其次,将模型多样性视为统计多样性。混合不同模型家族或架构仅在改变任务关键错误模式时才有帮助。
- 第三,检查一致性结构。强聚类可能揭示共享评分标准、共同模型行为或任务特定的模糊性。即使最终标签不变,这些信息仍具有价值。
- 最后,结合依赖性报告不确定性。10个相关投票不应总是产生与10个独立投票相同的置信度。
当LLM评审达成一致时,我们应探究其原因。有时一致性是独立证据,有时是共同的盲区。优秀的聚合方法应能区分这两种情况。
致谢:Shiva Prasad Kasiviswanathan
研究领域
- 对话式人工智能
- 机器学习
标签
- 大型语言模型(LLMs)
关于作者
Krishna Balasubramanian是加州大学戴维斯分校统计学副教授,同时也是亚马逊学者。
Sasha Podkopaev是亚马逊网络服务(AWS)的应用科学家。