10 Statistical Traps We Often Overlook
TL;DR · AI 摘要
本文揭示了统计学中常见的10个陷阱,帮助读者避免数据误解。重点包括平均值与中位数的差异、样本偏差、相关性不等于因果性等核心问题。
核心要点
- 平均值易受极端值影响,中位数更能反映典型值(如薪资数据)
- 样本偏差可能导致结论错误(如仅调查特定群体)
- 相关性不等于因果性,需通过实验验证因果关系
结构提纲
按章节快速跳转。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- 统计陷阱
- 平均值陷阱
- 极端值影响
- 中位数替代
- 样本偏差
- 选择偏差
- 结论失真
- 相关性陷阱
- 虚假因果
- 实验验证
金句 / Highlights
值得收藏与分享的关键句。
当最高收入者薪资从33k变为500k时,平均值从29k跃升至122.4k,但中位数保持29k。
样本偏差可能导致结论错误,如仅调查城市居民推断全国消费习惯。
相关性不等于因果性,需通过控制变量实验验证因果关系。
我们常忽视的10个统计陷阱 | Towards Data Science
数据科学
我们常忽视的10个统计陷阱
超越公式的统计思维
2026年9月9日
10分钟阅读时间
图片由Negative Space提供,来源:Pexels
我们都经历过这样的场景:坐在大学课堂上,教授在黑板上写下一堆公式,要求我们背诵"因为这就是考试内容"——教授更在意的是分数,即使我喜欢这门学科,因为这就是学生被评估的方式!对我来说,统计学课程就是这样的经历。
每当我想起统计学课程,就会想起黑板上密密麻麻的数字和指令:计算平均值、找出中位数、计算标准差、绘制图表或报告p值。
然后,不知怎么的,我们被要求看着数据集并理解它想告诉我们的信息。我必须承认,这部分才是乐趣所在,但结构化课程并不是这样教授统计学的。
当我开始自学并发现数据背后故事的乐趣时,我才发现统计学非常有趣。因为知道如何计算统计量并不等于理解统计量的含义。在当今这个被数字、图表、百分比、民意调查、研究和"数据驱动"主张所包围的世界里,懂得如何解读数据可以帮助你避免被误导。
这就是我写这篇文章的原因:更好地解释10个常被方程和考试问题所掩盖的统计学要点。
1. 平均值并不总是"平均"的
让我们从统计学中最熟悉的词汇之一开始:平均值。我们经常将"平均"和"均值"互换使用。但从技术上讲,"平均"是一个更宽泛的非正式术语,而"均值"是描述数据集中心的一种特定方式。
举个例子:假设有五个人的收入分别是25k、27k、29k、31k和33k。
如果我们考虑这五个特定数字,均值是29k。看起来一切都很合理。但如果我们将收入最高的人的工资改为500k?均值突然变成了122.4k。
现在的问题是,"典型"的人突然变成了六位数收入者吗?你可能会回答当然不是。我认为虽然计算是正确的,但解释是错误的。
这就是为什么我们需要理解均值到底在做什么。它将所有观测值的总和平均分配给每个观测值。因此,均值对极端值特别敏感。
这就是中位数的作用!它给了我们一个不同的视角。将观测值按顺序排列并取中间的那个。在两个例子中,中位数都是29k!
如果我们把数字当作绝对值来看,这两个数字在统计学上都是"正确的",但它们回答的是略有不同的问题,这也是本文的重点。
均值问的是:
如果总和被平均分配,每个观测值会得到多少?
中位数问的是:
有序数据的中间值是多少?
有时候,这种差异就是整个故事!这就是为什么你经常看到房价、工资和财富使用中位数而不是均值来报告。极少数极大值可能会显著拉高均值。
统计学还教会我们如何压缩信息。当我们面对包含数百万条记录的数据集时,需要将其压缩成几个具有代表性的数字,以便更轻松地传达信息。尽管这很有用,但也存在危险。
假设有两个班级的平均考试成绩都是70%。仅凭这一点,我们会认为他们的表现相似。这是一个合理的假设,但并不总是正确的。如果成绩分布如下:
班级A:65, 68, 69, 70, 71, 72, 75 班级B:30, 50, 65, 70, 75, 90, 110
两者的平均值都可能在70附近。但显然这两个数据集完全不同。
第一个班级的数据紧密聚集,而第二个班级的数据分布更分散。仅考虑平均值会掩盖数据的真实形态。
这是阅读统计数据时最重要的习惯之一:不要只停留在汇总统计量上!这并不足够!我们还需要考虑分布、异常值、数据的离散程度以及观测数量。单个数字可以概括数据,但它本身并不是数据。
3. 变量不会孤立存在
这就是统计学变得既有趣又容易被误用的地方。
假设一项研究发现,喝更多咖啡的人报告的压力水平更高。大多数人会立即认为:咖啡导致压力!但其实研究并没有这样说。
也许工作时间更长的人喝更多咖啡并经历更多压力。在这种情况下,工作时间可能是一个混淆变量。或者,可能已经处于压力中的人更倾向于喝咖啡。
现在这段关系的叙述完全不同了!例如,某人的工作类型可能同时影响咖啡消费和压力水平。
关键在于,观察到两个变量同步变化并不自动告诉我们它们变化的原因。这是在分析数据时最容易犯的错误之一。
缺失的问题是:还有什么可能解释这种关系?
这个问题往往比计算本身更有价值。
4. 控制变量不仅仅是技术细节
当研究人员试图理解变量之间的关系时,他们通常会尝试考虑其他变量。这就是控制变量、混淆因素和分层等概念变得重要的地方。
想象我们发现经常锻炼的人更可能报告更好的心理健康状况。这听起来很直接!但年龄可能同时影响锻炼习惯和心理健康!或者收入可能影响健身房的使用、空闲时间和医疗保健!或者现有的健康状况可能同时影响锻炼和心理健康。
我们考虑的变量越多,分析就会变得越复杂。但这种复杂性并不一定是问题。事实上,有时简化故事才是问题所在。现实世界的数据很少会附带一个清晰的标签:
“这里有一个变量负责一切。”
良好的统计思维意味着对过于简单的解释保持怀疑。
5. 相关性不等于因果性,但问题比这更深刻!
我们所有人都听过“相关性不等于因果性”;这可能是入门统计学(以及新闻文章!)中最常重复的句子。但仅仅记住这句话是不够的。我们需要问:为什么相关性无法证明因果性?
考虑著名的冰淇淋销售与溺水死亡统计。我们清楚从逻辑上讲,购买冰淇淋不会导致溺水。我们也知道温度和季节同时影响两者。这是一个典型的混淆变量例子。
但因果关系往往更难判断。有时A影响B,有时B影响A,有时A和B相互影响,有时第三个变量同时影响两者。有时当人群被划分为有意义的群体时,这种关系可能完全消失。
或者更常见的情况是,我们缺乏足够的信息来判断,这可能会让人感到些许不安。但“我们不知道”本身就是一个合法的统计结论。
6. 你的大脑倾向于确认你已有的信念
这可能是最重要的统计学教训。我们不会以空白的心态面对数据。我们有观点、经验、政治立场、假设、预期以及之前听到的故事。
一旦我们有了假设,就会自然寻找支持它的证据。这种现象被称为确认偏误。
想象有人告诉你:
“年轻人不再读书了。”
你可能会看到一群青少年在看手机,然后想,确实如此。但这是对原始主张的证据吗?你选择了一个符合你已有故事的观察。
更好的方法是问自己:什么数据会改变我的想法?这其实是一个非常困难的问题!如果你无法想象一个可能说服你承认错误的观察,那你已经不再是在检验假设……而是在捍卫一种信念。
7. 在阅读结论前先看图表
图表特别擅长利用我们的假设。一个图表可能在技术上是准确的,但仍可能给你误导的印象。由于这种现象在数据展示中被频繁使用,每当我看到图表时,我都会问自己:
- Y轴是从零开始的吗?
- 比例是线性的吗?
- 间隔是相等的吗?
- 图表显示的是绝对数值还是百分比?
- 样本量有多大?
- 比较的是什么?
- 什么被遗漏了?
这很重要,因为你经常看到文章标题声称“饮用X后癌症风险翻倍!”,这会让你觉得“翻倍”听起来非常严重。
但假设原始风险是1000人中有1人,增加到1000人中有2人。虽然这是翻倍,但是否也意味着每100人中增加了1个百分点?不,实际上只增加了0.1个百分点。
措辞本身未必是谎言,但呈现方式会显著改变我们对结果的感知。这就是为什么相对风险和绝对风险绝不能被当作等同的概念。
8. 样本量很重要——但更大并不总是更好
我们倾向于将样本量视为某种魔法数字。听到“基于10万人的调查”听起来比“基于1000人的调查”更有说服力,但如果样本存在系统性偏差,即使样本量很大,结论也可能很差。
想象你向10万名电动车车主提问:
“你喜欢电动车吗?”
你可能会得到关于电动车车主的非常可靠答案。但你没有学到的是……整个群体的真实想法。
这是一个抽样问题。谁被纳入了?谁被排除了?他们是如何被招募的?人们是随机选择的吗?某些群体是否更容易参与?有强烈观点的人是否更倾向于回应?
一个巨大的有偏样本仍然是有偏的,这些观测值是如何获得的同样重要。
9. 统计显著性并不必然意味着实际意义
这里还有一个陷阱。假设一种新的教学方法使平均考试成绩从72.1%提高到72.4%。在足够大的数据集下,这种差异可能具有统计显著性。
现在的问题是,我们是否应该在意?也许应该,也许不应该。
统计显著性主要关注观察到的差异是否不太可能在特定统计模型或零假设下出现。它不会自动告诉我们:
- 效应是否显著,
- 是否在实践中重要,
- 是否有用,
- 是否值得成本,
- 或者在现实生活中是否能察觉到这种差异。
统计上显著的结果可能在实际中毫无意义;而未能达到统计显著性的结果并不一定意味着“什么都没发生”。
这项研究没有提供足够的信息让我们区分效应和噪声。因此,再次强调,单独的数字本身并不能得出结论。
10. 学会询问数据集中没有的内容
或许最被低估的统计技能是了解数据无法告诉你的内容。如果我们有一个包含以下信息的数据集:
- 年龄
- 收入
- 教育程度
- 所在地
- 就业状况
你可以相对容易地分析这些变量之间的关系……但动机呢?家庭状况?性格?机会获取?历史事件?
未被测量的因素不会在分析中凭空出现……我知道你在想什么:这听起来显而易见,但令人惊讶的是人们很容易忘记这一点。
统计模型只能使用你提供给它的信息。有时,最重要的变量恰恰是你没有收集的那个。
下次你遇到统计数据、研究或看起来令人印象深刻的图表时,不要问:
“这证明了什么?”而是问:究竟在测量什么?是如何定义的?目标人群是谁?样本是如何选择的?谁可能被遗漏了?
试着判断它是否真正回答了汇总统计量的实际含义。数据中存在哪些聚类?数据分布有多广?是否有异常观测值?是否存在混淆变量?
但最重要的是,要询问数据没有告诉我们的内容。哪些内容未被测量?做了哪些假设?哪些结论超出了现有证据的范围?
统计学更关乎思考,而非数字本身。
本文的讽刺之处在于,统计学通常被当作数学来教授,没错,数学确实重要。毕竟,你需要知道如何计算平均值。你需要理解分布。你需要知道方差、置信区间和统计检验在做什么。
但知道计算方法并不等于理解结果。真正的技能是学会看到一个数字时,抵制立即将其转化为故事的冲动。
50,000平均薪资 → 好吧。平均的是什么?
20%的增长 → 20%的什么?
强相关性 → 是哪两个变量之间的相关性?基于多少观测值?还有哪些因素可能解释它?
统计上显著的效果 → 效应有多大?是否重要?
一项针对10万人的研究 → 这些人是谁?是如何被选中的?
世界每天都在产生海量的数据!我们每天都会看到许多数字、图表和新闻报道。挑战不仅仅是学习如何计算统计数据,更重要的是学习如何质疑这些数据,因为数据本身并不会附带对其的解释。
如果我们不够谨慎,就可能让统计数据说出我们想要的几乎任何内容。统计素养的目标并不是让我们变得更擅长寻找支持已有观点的数据,而是鼓励我们批判性地思考数据真正想表达的内容。