Learning
VOL. XXV · NO. 08 · Probability & Statistics · 01 JAN 1970

假设检验的陷阱:p 值误用与多重比较

概率论与统计学 · 01 JAN 1970 · 7 min read · 1,658 words
· · ·

p < 0.05 不等于真理——可重复性危机的统计根源

**预计时间:**25 分钟读 + 15 分钟做习题 = 40 分钟。

本课方法论承诺
读完这节课,你将掌握: p-hacking 的机制与后果——为什么挑数据凑显著会系统性扭曲科学; 多重比较问题——做 20 次检验,至少一次假阳性的概率是 64%; Bonferroni / FDR 校正——如何控制错误发现率。

一、核心概念定义

p 值误用(p-hacking)

p-hacking(又称 data dredging / significance chasing)是指研究者有意或无意地通过以下方式使 p 值”显著”(< 0.05):

  • 多次检验同一假设:变换模型 specification,直到 p < 0.05
  • 选择性报告:只报告显著结果,隐藏不显著结果
  • 在检验后定义假设:看到数据模式后”反推”假设
  • 停止规则的灵活性:收集数据直到 p < 0.05

后果:发表文献中的显著结果系统性高估真实效应。 Simmons et al. (2011) 证明,灵活的数据收集和分析策略可以把假阳性的概率从 5% 提升到 60% 以上。

多重比较问题(Multiple Comparisons Problem)

当同时检验 m 个独立假设(H₀₁, H₀₂, …, H₀ₘ),每个在 α = 0.05 水平下检验:

  • 每次检验的 Type I 错误率 = 5%
  • 至少一次假阳性的概率 = 1 - (1 - 0.05)ᵐ
m至少一次假阳性概率
15%
523%
1040%
2064%
10099.4%

基因组学是典型场景:检验 20,000 个基因,用 α = 0.05 会导致约 1000 个假阳性!

Bonferroni 校正

最保守的多重比较校正:将总体 α 平摊到 m 次检验:

α’ = α / m

如 α = 0.05, m = 20 → α’ = 0.0025。只有当 p < 0.0025 时才拒绝 H₀。

缺点:过于保守,容易增加 Type II 错误(漏掉真实效应)。

FDR 控制(False Discovery Rate)

Benjamini-Hochberg (1995) 方法:控制假阳性占所有拒绝 H₀ 的比例

  • 将 p 值排序:p₁ ≤ p₂ ≤ … ≤ pₘ
  • 找到最大的 k 使得 pₖ ≤ (k/m) × q(q 是目标 FDR,通常 0.05)
  • 拒绝前 k 个 H₀

与 Bonferroni 的区别:FDR 允许一些假阳性,但控制其比例;Bonferroni 追求零假阳性。

二、学科直觉

  1. p = 0.049 和 p = 0.051 的实质差异几乎为零:0.05 是人为的阈值。在两个样本量相同、效应量相同的实验中,0.049 和 0.051 的差异可能只是抽样误差。用二元”显著/不显著”框架丢失了大量信息。
  2. “没有证据 ≠ 证据没有”:p > 0.05 时,“没有足够证据拒绝 H₀”不等于”H₀ 为真”。可能是效应真实存在但样本量太小检测不出来。
  3. 可重复性危机的统计根源是激励结构:期刊只发表显著结果 → 研究者 p-hack → 文献中显著结果过多 → replicability 下降。这是心理学/经济学可重复性危机的核心机制。

三、跨学科应用

可重复性危机:心理学的教训

2011 年,Daryl Bem 在 Journal of Personality and Social Psychology 发表论文,声称” precognition 存在”(人可以预知未来)。p 值”显著”——但实验设计事后被证明有多种 p-hacking 机会。

2015 年,Open Science Collaboration 的可重复性项目(Replicability Project)尝试复制 100 个心理学实验,结果:

  • 原研究平均效应量 r = 0.37
  • 复制实验平均效应量 r = 0.20(下降 50%)
  • 原研究 97% 显著,复制仅 36% 显著

核心发现:可重复性差的主要原因是发表偏倚 + p-hacking,不是心理学”不科学”。

p 值误用的代价
p-hacking 的代价不仅是"错误的论文被发表",更是"基于错误证据的后续研究被启动"。药物开发中,p-hacked 的 preclinical 数据进入临床试验 → 患者承担风险 → 数十亿美元浪费。统计误用的外部性远超出学术界。

A/B 测试:多重比较的实战

你在 A/B 测试中同时看 5 个指标(转化率、停留时间、分享率、付费率、留存率)。每个指标单独检验,α = 0.05。

  • 至少一个指标”显著”的概率 = 1 - (1-0.05)⁵ ≈ 23%
  • 即使用户不做任何改动,5 个指标中约 1 个会”显著”

正确做法

  1. 实验前确定主要指标(1 个),只对它做正式检验
  2. 其他指标作为探索性分析,需要校正或验证
  3. 或使用 FDR 控制

金融:回测中的多重比较

量化交易者在一个策略中测试 100 个参数组合,发现某个组合历史收益显著。这很可能是过拟合——在历史数据上”偶然显著”的随机模式,实盘立即失效。

解决方案

  1. 样本外检验(out-of-sample testing)
  2. 交叉验证
  3. 对多重比较做 Bonferroni 或 FDR 校正

练习题

单选题

1

p-hacking 的核心问题是?

2

同时检验 20 个独立假设,α = 0.05,至少一次假阳性的概率约为?

3

Bonferroni 校正的逻辑是?

4

FDR(False Discovery Rate)控制的是?

5

以下哪种不是 p-hacking?

6

可重复性危机的主要统计根源是?

7

p = 0.051 和 p = 0.049 的实质差异?

案例分析

C1

C1. 案例:某量化团队测试 100 个策略参数组合,发现组合 A 年化 30%, Sharpe = 2.5,p < 0.01。最可能的问题是?

反事实思考题

T1

T1. 反事实:如果强制所有期刊只发表"预注册"的研究(假设和检验方法在数据收集前固定)。最直接的结果是?

下一步:Lesson 0009 · 贝叶斯思维实战:先验选择与后验更新——从理论到实战的贝叶斯方法。