假设检验的陷阱:p 值误用与多重比较
p < 0.05 不等于真理——可重复性危机的统计根源
**预计时间:**25 分钟读 + 15 分钟做习题 = 40 分钟。
一、核心概念定义
p 值误用(p-hacking)
p-hacking(又称 data dredging / significance chasing)是指研究者有意或无意地通过以下方式使 p 值”显著”(< 0.05):
- 多次检验同一假设:变换模型 specification,直到 p < 0.05
- 选择性报告:只报告显著结果,隐藏不显著结果
- 在检验后定义假设:看到数据模式后”反推”假设
- 停止规则的灵活性:收集数据直到 p < 0.05
后果:发表文献中的显著结果系统性高估真实效应。 Simmons et al. (2011) 证明,灵活的数据收集和分析策略可以把假阳性的概率从 5% 提升到 60% 以上。
多重比较问题(Multiple Comparisons Problem)
当同时检验 m 个独立假设(H₀₁, H₀₂, …, H₀ₘ),每个在 α = 0.05 水平下检验:
- 每次检验的 Type I 错误率 = 5%
- 至少一次假阳性的概率 = 1 - (1 - 0.05)ᵐ
| m | 至少一次假阳性概率 |
|---|---|
| 1 | 5% |
| 5 | 23% |
| 10 | 40% |
| 20 | 64% |
| 100 | 99.4% |
基因组学是典型场景:检验 20,000 个基因,用 α = 0.05 会导致约 1000 个假阳性!
Bonferroni 校正
最保守的多重比较校正:将总体 α 平摊到 m 次检验:
α’ = α / m
如 α = 0.05, m = 20 → α’ = 0.0025。只有当 p < 0.0025 时才拒绝 H₀。
缺点:过于保守,容易增加 Type II 错误(漏掉真实效应)。
FDR 控制(False Discovery Rate)
Benjamini-Hochberg (1995) 方法:控制假阳性占所有拒绝 H₀ 的比例。
- 将 p 值排序:p₁ ≤ p₂ ≤ … ≤ pₘ
- 找到最大的 k 使得 pₖ ≤ (k/m) × q(q 是目标 FDR,通常 0.05)
- 拒绝前 k 个 H₀
与 Bonferroni 的区别:FDR 允许一些假阳性,但控制其比例;Bonferroni 追求零假阳性。
二、学科直觉
- p = 0.049 和 p = 0.051 的实质差异几乎为零:0.05 是人为的阈值。在两个样本量相同、效应量相同的实验中,0.049 和 0.051 的差异可能只是抽样误差。用二元”显著/不显著”框架丢失了大量信息。
- “没有证据 ≠ 证据没有”:p > 0.05 时,“没有足够证据拒绝 H₀”不等于”H₀ 为真”。可能是效应真实存在但样本量太小检测不出来。
- 可重复性危机的统计根源是激励结构:期刊只发表显著结果 → 研究者 p-hack → 文献中显著结果过多 → replicability 下降。这是心理学/经济学可重复性危机的核心机制。
三、跨学科应用
可重复性危机:心理学的教训
2011 年,Daryl Bem 在 Journal of Personality and Social Psychology 发表论文,声称” precognition 存在”(人可以预知未来)。p 值”显著”——但实验设计事后被证明有多种 p-hacking 机会。
2015 年,Open Science Collaboration 的可重复性项目(Replicability Project)尝试复制 100 个心理学实验,结果:
- 原研究平均效应量 r = 0.37
- 复制实验平均效应量 r = 0.20(下降 50%)
- 原研究 97% 显著,复制仅 36% 显著
核心发现:可重复性差的主要原因是发表偏倚 + p-hacking,不是心理学”不科学”。
A/B 测试:多重比较的实战
你在 A/B 测试中同时看 5 个指标(转化率、停留时间、分享率、付费率、留存率)。每个指标单独检验,α = 0.05。
- 至少一个指标”显著”的概率 = 1 - (1-0.05)⁵ ≈ 23%
- 即使用户不做任何改动,5 个指标中约 1 个会”显著”
正确做法:
- 实验前确定主要指标(1 个),只对它做正式检验
- 其他指标作为探索性分析,需要校正或验证
- 或使用 FDR 控制
金融:回测中的多重比较
量化交易者在一个策略中测试 100 个参数组合,发现某个组合历史收益显著。这很可能是过拟合——在历史数据上”偶然显著”的随机模式,实盘立即失效。
解决方案:
- 样本外检验(out-of-sample testing)
- 交叉验证
- 对多重比较做 Bonferroni 或 FDR 校正
练习题
单选题
p-hacking 的核心问题是?
同时检验 20 个独立假设,α = 0.05,至少一次假阳性的概率约为?
Bonferroni 校正的逻辑是?
FDR(False Discovery Rate)控制的是?
以下哪种不是 p-hacking?
可重复性危机的主要统计根源是?
p = 0.051 和 p = 0.049 的实质差异?
案例分析
C1. 案例:某量化团队测试 100 个策略参数组合,发现组合 A 年化 30%, Sharpe = 2.5,p < 0.01。最可能的问题是?
反事实思考题
T1. 反事实:如果强制所有期刊只发表"预注册"的研究(假设和检验方法在数据收集前固定)。最直接的结果是?
下一步:Lesson 0009 · 贝叶斯思维实战:先验选择与后验更新——从理论到实战的贝叶斯方法。