LLMs Are Not (Consistently) Bayesian: Quantifying Internal (In)consistencies of LLMs’ Probabilistic Beliefs
TL;DR · AI 摘要
大语言模型在概率信念更新中存在系统性不一致性,非贝叶斯启发式方法在实际任务中表现更优。
核心要点
- 非贝叶斯启发式更新在下游任务中优于精确贝叶斯更新
- 信息处理差距可诊断LLM推理系统缺陷
- LLMs的概率世界模型可能存在系统性误设
结构提纲
按章节快速跳转。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- LLMs概率信念不一致性研究
- 研究方法
- 信息处理差距度量
- 实验发现
- 非贝叶斯启发式优势
- 概率模型误设
- 应用价值
- 系统诊断工具
金句 / Highlights
值得收藏与分享的关键句。
非贝叶斯启发式更新在下游任务中表现优于精确贝叶斯更新
信息处理差距度量可作为LLM系统诊断工具
LLMs的概率世界模型存在系统性误设导致性能差异
LLMs 并非(始终)贝叶斯:量化 LLM 概率信念的内部(不)一致性 - Apple 机器学习研究
研究领域
方法和算法
内容类型
论文
发布日期
2026年8月
LLMs 并非(始终)贝叶斯:量化 LLM 概率信念的内部(不)一致性
作者:Chacha Chen†, Matthew Jörke†‡, Adam Goliński, Masha Fedzechkina, Guillermo Sapiro, Sinead Williamson, Nicholas Foti
查看出版物
复制Bibtex
现代AI系统正在被部署到医学、科学和法律等复杂领域,在这些领域中,根据观察到的证据,通常没有单一的正确答案。此类系统必须能够表示和更新关于世界的不确定信念,以在新证据到来时做出理性决策。我们引入了一种新颖的技术,将LLM作为信息处理规则进行研究,并利用信息处理差距(与贝叶斯更新的偏差)来研究LLM如何根据证据更新其概率信念的内部(不)一致性。我们进行了广泛的实验,评估了多种LLM将证据纳入其信念的方法。其中一些方法产生了(几乎)贝叶斯更新,从而最优地处理证据;而其他方法使用了学习到的启发式方法。令人惊讶的是,非贝叶斯启发式更新在下游任务表现方面通常优于精确的贝叶斯更新(最优信息处理)——这表明LLM对世界的概率模型存在错误设定。最后,我们展示了我们的度量如何提供诊断工具,以识别基于LLM的推理系统的潜在问题。
- † 斯坦福大学
- ‡ 贡献相同
- ** 本研究在苹果公司期间完成
相关阅读与更新
PrimeX:世界观、观点和解释的数据集
2025年10月27日 研究领域 数据科学与标注 ,研究领域 语音与自然语言处理 会议 EMNLP
随着语言模型的采用不断推进,更好地向模型表示个别用户的需求也在增加。语言模型能否利用个人信念系统的某些方面来提高对齐效果?遵循先前研究,我们在观点预测领域通过开发PrimeX数据集来探讨这个问题,该数据集包含来自858名美国居民的公开意见调查数据,并额外提供了两种信念信息来源:……
阅读更多
MUSCLE:兼容LLM演进的模型更新策略
2024年10月23日 研究领域 方法和算法 ,研究领域 语音与自然语言处理 会议 EMNLP
大型语言模型(LLMs)经常通过数据或架构的更改来更新以提高性能。在更新过程中,开发人员通常优先考虑提高整体性能指标,而较少关注与早期模型版本的兼容性。从一个模型版本到下一个版本的性能实例级退化(实例回归)可能会干扰用户的心理模型……
发现机器学习领域的机遇。
我们的机器学习研究每天都在取得新突破。
与我们合作