Learning
VOL. XXV · NO. 06 · Probability & Statistics · 01 JAN 1970

统计推断基础:估计与检验

概率论与统计学 · 01 JAN 1970 · 6 min read · 1,538 words
· · ·

从数据中提取信号——点估计、区间估计与假设检验的逻辑

**预计时间:**25 分钟读 + 15 分钟做习题 = 40 分钟。

本课方法论承诺
读完这节课,你将掌握: 点估计 vs 区间估计——一个数字 vs 一个范围; 假设检验的完整逻辑——原假设、备择假设、检验统计量、p 值、显著性水平; 两类错误(Type I / Type II)的权衡——没有免费午餐。

一、核心概念定义

统计推断(Statistical Inference)

样本数据推断总体参数的过程。样本是有限的、有噪音的;总体是无限的、真实的。推断的本质是在不确定性中做决策。

点估计(Point Estimation)

用单个数字估计总体参数。样本均值 X̄ 是总体均值 μ 的点估计;样本比例 p̂ 是总体比例 p 的点估计。

好的点估计的性质

  • 无偏性:E[θ̂] = θ(估计值的期望等于真实值)
  • 一致性:n → ∞ 时,θ̂ → θ(样本量越大越准)
  • 有效性:在所有无偏估计中,方差最小

区间估计(Interval Estimation)

给出一个范围,并声明”真实参数有 X% 概率落在这个范围内”(贝叶斯)或”这个方法 X% 的时间会产生包含真实参数的区间”(频率派)。

最常用:95% 置信区间 = 点估计 ± 1.96 × 标准误差

假设检验(Hypothesis Testing)

提出两个 competing 假设,用数据判断哪个更可能:

  • 原假设 H₀(Null):默认立场(如”药物无效”)
  • 备择假设 H₁(Alternative):想要证明的立场(如”药物有效”)

检验逻辑

  1. 假设 H₀ 为真
  2. 计算观察到当前数据或更极端数据的概率(p 值)
  3. 如果 p < α(通常 0.05),拒绝 H₀
  4. 如果 p ≥ α,不拒绝 H₀(注意:不等于接受 H₀

两类错误

H₀ 为真H₀ 为假
拒绝 H₀Type I 错误(假阳性)概率 = α正确决策(统计功效)
不拒绝 H₀正确决策Type II 错误(假阴性)概率 = β

权衡:降低 α(更严格)会增加 β(更容易漏掉真实效应)。α = 0.05 是惯例,不是自然法则。

二、学科直觉

  1. 估计的精度随 √n 改善:标准误差 = σ/√n。样本量翻倍,精度只提高 √2 ≈ 1.41 倍。这就是为什么从 100 样本到 10000 样本,精度只提高 10 倍而非 100 倍——边际收益递减。
  2. 不拒绝 H₀ ≠ 接受 H₀:这是最常见的误解。p = 0.06 时”没有显著证据”≠“药物无效”。可能是效应真实存在但样本量太小检测不出来(Type II 错误)。
  3. 显著性水平 α 是研究者的选择:α = 0.05 是惯例,但有些领域用 0.01(粒子物理)或 0.10(探索性研究)。选择 α 是在 Type I 和 Type II 错误之间做权衡——没有免费的午餐。

三、跨学科应用

A/B 测试:产品决策的统计基础

A/B 测试本质上是一个假设检验:

  • H₀:新版本与旧版本转化率无差异
  • H₁:新版本转化率更高
  • 检验统计量:两组转化率的 z 分数
  • 决策:p < 0.05 → 上线新版本

产品经理的关键问题:n = 多少才够?根据效应量(你期望的提升幅度)和 α、β 计算所需样本量。期望 20% 提升,n ≈ 每组 1000;期望 2% 提升,n ≈ 每组 20000+。

医学: Screening vs Diagnostic

Screening 测试(如乳腺癌筛查)用假设检验思维:

  • H₀:没有癌症
  • 高灵敏度(低 Type II)→ 尽量不漏诊
  • 但高灵敏度意味着假阳性(Type I)增加 → 需要 follow-up 诊断测试
过度诊断陷阱
Screening 的悖论:检测越敏感,发现的"异常"越多,但其中很多是 benign(不会恶化)。过度诊断导致过度治疗,带来真实的伤害。这是贝叶斯思维的直接应用——先验(患病率)极低时,即使检测灵敏度高,阳性预测值也低。

质量控制:过程能力指数

六西格玛用 Cpk 指数衡量过程能力:

  • Cpk = min[(USL - μ)/3σ, (μ - LSL)/3σ]
  • Cpk > 1.67 表示过程能力足够(6σ 水平)
  • 本质上是假设检验:过程均值是否在规格限内 6σ

练习题

单选题

1

点估计的本质是?

2

95% 置信区间意味着?

3

Type I 错误是?

4

不拒绝 H₀ 意味着?

5

降低 α(如从 0.05 到 0.01)的直接后果是?

6

标准误差 = σ/√n 意味着?

7

假设检验中,p < 0.05 意味着?

案例分析

C1

C1. 案例:某 A/B 测试新功能转化率 12% vs 旧版 10%,n = 200,p = 0.08。产品经理说"没显著差异,保持旧版"。统计学家怎么看?

反事实思考题

T1

T1. 反事实:如果 α 永远固定在 0.05,不允许根据领域调整。最可能导致的系统性错误是什么?

下一步:Lesson 0007 · 回归分析:从线性到最小二乘——用模型量化变量关系。