如何从数学角度选择直方图的最佳分箱

TL;DR · AI 摘要
文章通过数学方法探讨直方图最优分箱策略,提出基于信息理论和泰勒展开的分箱优化方案。
核心要点
- 使用信息理论中的先验后验概率推导出最优分箱公式,避免过拟合问题。
- 采用泰勒展开分析数据分布平滑性,指导分箱数量随样本量增长而调整。
- 结合物理领域的微扰理论思想,构建更稳健的数据密度估计方法。
结构提纲
按章节快速跳转。
介绍直方图分箱选择的重要性及传统方法局限性。
基于数据量增加应提升分辨率的直觉,提出物理和数学类比思路。
假设密度函数光滑性,利用其导数局部描述分布特性。
引入贝叶斯框架,通过后验概率评估模型优劣,防止过拟合。
使用 surprisal 衡量模型质量,强调信息增益而非参数数量。
结合信息论与微扰理论,提出适用于大数据集的分箱规则。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- 直方图最优分箱
- 数学基础
- 泰勒展开
- 微扰理论
- 信息论方法
- 贝叶斯建模
- 模型权重
金句 / Highlights
值得收藏与分享的关键句。
在数据量增加时,分箱数量应按照 n^(1/3) 的比例增长以保持分辨率。
贝叶斯方法通过先验后验概率计算,确保模型不会因参数过多而过拟合。
直方图分箱优化需考虑数据密度估计的平滑性和统计鲁棒性。
标题:如何从数学角度选择直方图的最佳区间
URL 来源:https://towardsdatascience.com/fun-with-histograms-and-densities/
发布日期:2026-05-23T17:00:00+00:00
Markdown 内容: 你是否曾想过如何选择直方图的区间?你是否曾经思考过,选择区间的原因是否不仅仅是看起来美观?虽然直方图是最基础的数据可视化工具,但设置其分辨率非常重要,尤其是在直方图本身用于进一步分析时。直方图通常用于可视化数据的密度。在这篇文章中,我们将探讨密度拟合的数学原理,特别关注随着数据集增长,区间应该如何缩小。受物理学中的微扰理论和数学中的泰勒展开等相邻领域启发,我们将找到一种严谨的方法来构建密度函数。
_all images are by the author_
背景
近似方法
直观上很简单:你拥有的数据越多,你应该能看到的细节就越多。如果你观察的是十个观测样本,那么两到三个宽区间可能就是你能承受的最大范围,否则你的可视化会变成一堆空隙。但如果你有千万个观测样本,这些宽区间就会像低分辨率的像素化照片一样显得粗糙。你想要通过增加区间数量来“放大”视图。然而问题在于:我们应该如何精确地调整这种分辨率?
在物理学中,当我们面对一个无法精确求解的复杂系统时,常常会采用微扰理论。例如,在量子电动力学(QED)中,我们通过将复杂的相互作用展开为一个小耦合常数(如电子电荷 _e_)来近似处理。这个“相互作用强度”为我们提供了一个自然的近似层次结构。但对于直方图来说,什么是类似的“电荷”?是否存在一个基本参数控制着我们的离散数据点与我们试图估计的底层分布之间的相互作用?
数学提供了另一条路径:泰勒展开。如果我们假设底层密度函数足够光滑(解析),我们可以用它的导数局部描述它。这听起来是一个有希望的方向,因为高阶项可以被证明趋于零。尽管我们可能愿意接受对解析分布的限制,但这并不能明确地得出特定的区间大小。
另一种思路是将问题视为基函数展开。就像我们可以使用傅里叶变换或勒让德多项式表示分段连续函数一样,我们可以将直方图区间看作一组基函数。通过这种方法,我们可以用 L2 范数来逼近该函数。但这种方法也带来了一些挑战。我们该如何高效地计算这些函数的系数?更重要的是,我们如何满足概率密度函数的物理约束条件?不同于一般的傅里叶级数,密度函数必须严格为正且归一化为一。我们将在接下来看到,来自信息论的方法与基函数展开具有相似之处。
信息论
先验与后验
对于贝叶斯统计或信息论的介绍,请参阅(Murphy, 2022)。在贝叶斯方法中,模型 $P \left(\right. X \mid \theta \left.\right)$,其中 _X_ 是我们要建模的可观测量,$\theta$ 是我们的参数,还包含一个先验分布 𝑃(𝜃|ℳ),它反映了我们在观察数据之前对分布的信念。在观察到数据之后,我们可以估计后验分布 $P \left(\right. \theta \mid X \left.\right)$
𝑃(𝜃|𝑋) = 𝑃(𝑋|𝜃)𝑃(𝜃|ℳ)/𝑃(𝑋)
这个过程在数学上优雅,因为它完全避免了过拟合的风险。然而,它需要严格的纪律:我们不允许在看到数据后再选择模型或先验。如果使用数据来决定使用哪种模型结构,就会破坏推理的基本逻辑。
给定数据的最可能模型 vs 模型加权
可以通过考虑模型的惊讶度(参见例如 (Vries, 2026))来计算模型的质量:
log 𝑃(𝑋|ℳ) = −surprisal = accuracy – complexity
参数过多的模型(因为可能会被诱惑去包含所有类型的假设性相互作用)可能达到惊人的准确性,但它们会被自身的复杂性惩罚。理想模型并不是最详细的模型;而是用最少的冗余信息捕捉最多信息的那个模型。
在考虑一组模型时,可以计算每个模型相对于所考虑模型的似然:
𝑃(ℳ𝑖 ∣ 𝑋) ~ 𝑃(𝑋 | ℳ𝑖) 𝑃(ℳ𝑖 )
人们倾向于简单地选择概率最高的模型并继续前进。但这种“赢家通吃”的方法存在风险:
- 统计波动:数据 𝑋 可能包含一个随机异常,使次优模型暂时看起来更优。
- 群体权重:有时许多“不太可能”的模型之和实际上超过了单一“最佳”模型的概率。
因此,更稳健的做法是保留所有模型,并根据其概率进行加权。需要注意的是,这不是不同真理的“混合”;我们仍然假设只有一个模型是真的,但我们使用所有可能性的分布来反映我们自身的不确定性。
密度
使用贝叶斯方法的密度估计
为了将密度视为一个正式模型,我们将它的 𝐾 个区间(bins)看作参数。具体来说,我们为每个区间分配一个权重 $w_{k}$,表示数据点落入该区间的概率。由于总概率必须等于一($\sum_{k} w_{k} = 1$),一个具有 𝐾 个区间的密度由 𝐾 −1 个独立参数定义,这类模型也被称为混合模型。在我们的贝叶斯框架中,我们需要为这些权重指定先验分布。鉴于我们处理的是必须加总为一的类别比例,狄利克雷(Dirichlet)分布是数学上自然的选择。
超参数的选择
狄利克雷分布由超参数控制,通常表示为 𝛼。这些值代表我们的“伪计数”——本质上是我们尚未看到第一个数据点时对密度外观的信念。当我们假设一个平坦先验(即证据 𝑃(𝑋) 是常数)时,选择 𝛼 的两种主要策略如下:
- 𝛼 =1/𝐾(稀疏选择):当预期数据高度集中时常用此方法。它假设大多数区间为空,因此是一种“促进稀疏性”的先验。
- 𝛼 =1(均匀选择):也称为平坦先验或拉普拉斯先验,它假设所有可能的权重分布都是等可能的。它实际上是在真实数据到来之前,为每个区间增加了一个“虚拟”观测值。
对于构建标准密度而言,第二种选择 𝛼 = 1 通常是更自然的。它反映了一个中性的起点,在此假设下,数据在区间内均匀分布,直到证据表明并非如此。
通过这种方式定义区间,我们将密度的“像素化”转换为一个严谨的模型。我们现在拥有一组固定的参数(𝐾 − 1 个权重)和一个明确的先验(𝛼 = 1)。下一步是使用数据来确定最优的区间数量 𝐾,平衡拟合精度与参数复杂度之间的关系。
示例
请查看下图中的数据:

当使用 8 个区间拟合时,我们得到:

从这个密度图中可以看到,最右侧的区间值高于零,尽管该区间内没有数据点。这是贝叶斯方法的结果,它基于我们的先验信念和观察到的数据估计了所相信的密度。
总结来说,我们使用贝叶斯方法得到了一个密度。我们定义了一个先验 𝑃(𝜃),反映了我们对均匀密度的期望。然后我们使用数据计算出后验 𝑃(𝜃|𝑋),这决定了最终密度的基础。
加权密度
利用前一节的方法,我们可以使用 1、2、4、8、16、32、64、128、256、512 和 1024 个区间来构建密度。更多的区间可以提供更精确的数据拟合,但也引入了更多复杂性。正如前一节所讨论的那样,可以通过准确性和复杂性来计算其证据。当把每个密度视为一个模型时,我们可以计算其相对于我们考虑的模型集合的似然性。这产生了下图:

在上一节中提到,可以选择“最佳”模型,这种情况下是使用 8 个区间。然而,更安全的做法是对所有模型取加权总和。这会得到:

重要的是要认识到,从贝叶斯的角度来看,这就是我们能做到的最好结果。另外请注意,在这张图中存在一个包含 1024 个区间的密度。最后,可以证明更高阶的密度 N 将会衰减。
不等宽区间密度
上述获得的密度看起来有些“方块状”,这是由于使用了等宽区间造成的。还有其他选项,例如随机分割(并相应调整先验)。这会产生下图:

带误差条的密度
现在为了完善密度的构建,可视化我们对这些密度的不确定性可能是有趣的。虽然数值计算较为昂贵,但计算密度标准差的表达式却相当简洁(F. Pijlman, 2023):
$$ \sigma_{P \left(\right. x \mid X \left.\right)}^{2} = P \left(\right. x \mid X \left.\right) \left(\right. P \left(\right. x \mid x , X \left.\right) - P \left(\right. x \mid X \left.\right) \left.\right) $$
这给出了以下密度:


结论
我们从一个简单的问题开始:直方图中的区间选择是否有数学基础?由于区间本质上连接了数据点与密度,我们研究了如何为密度选择区间。
使用贝叶斯方法(信息论)可以拟合密度,而无需担心过拟合(过多区间显示过多细节)。尽管可以计算“最佳”区间宽度,但我们发现:
- 模型加权允许我们结合多种分辨率,从而提供更平滑且更真实的数据显示。
- 狄利克雷先验为我们提供了一种严谨的方式来表达我们对数据分布的初始假设。
正如微扰理论为物理相互作用提供了一个层次结构,该贝叶斯框架也为数据解析提供了层次结构。随着更多数据的可用,解析尺度会自然地扩展。需要注意的是,当学习具有相互作用展开的模型时,这些思想也可以被使用。
在随机选择的箱体情况下,也探讨了结合不同解析度密度的方法。这导致了平滑的直方图,对于大多数数据集而言可能显得更加自然。
我们还介绍了在直方图中使用标准差。尽管标准差的计算最初是针对贝叶斯模型推导的,但其计算过程表明了更广泛的应用性。因此,它可以用于可视化密度中的剩余不确定性。
致谢
EdgeAI “Edge AI Technologies for Optimised Performance Embedded Processing”项目获得了欧洲联盟地平线欧洲研究与创新计划以及奥地利、比利时、法国、希腊、意大利、拉脱维亚、卢森堡、荷兰和挪威的支持下,由关键数字技术联合执行机构(KDT JU)资助,资助协议编号为No. 101097300。
参考文献
- F. Pijlman, J. L. (2023). _Variance of Likelihood of Data_. https://sitb2023.ulb.be/proceedings/, 34/37.
- Murphy, K. (2022). _Probabilistic Machine Learning: An Introduction_. MIT Press.
- Vries, B. d. (2026). _Active Inference for Physical AI Agents_. arXiv.
作者简介
Fetze Pijlman 是位于荷兰埃因霍温的Signify Research公司的首席科学家。他的研究领域涵盖概率机器学习、贝叶斯推断和信号处理,特别关注将这些数学框架应用于物联网、传感和智能系统。