统计推断基础:估计与检验
从数据中提取信号——点估计、区间估计与假设检验的逻辑
**预计时间:**25 分钟读 + 15 分钟做习题 = 40 分钟。
一、核心概念定义
统计推断(Statistical Inference)
从样本数据推断总体参数的过程。样本是有限的、有噪音的;总体是无限的、真实的。推断的本质是在不确定性中做决策。
点估计(Point Estimation)
用单个数字估计总体参数。样本均值 X̄ 是总体均值 μ 的点估计;样本比例 p̂ 是总体比例 p 的点估计。
好的点估计的性质:
- 无偏性:E[θ̂] = θ(估计值的期望等于真实值)
- 一致性:n → ∞ 时,θ̂ → θ(样本量越大越准)
- 有效性:在所有无偏估计中,方差最小
区间估计(Interval Estimation)
给出一个范围,并声明”真实参数有 X% 概率落在这个范围内”(贝叶斯)或”这个方法 X% 的时间会产生包含真实参数的区间”(频率派)。
最常用:95% 置信区间 = 点估计 ± 1.96 × 标准误差
假设检验(Hypothesis Testing)
提出两个 competing 假设,用数据判断哪个更可能:
- 原假设 H₀(Null):默认立场(如”药物无效”)
- 备择假设 H₁(Alternative):想要证明的立场(如”药物有效”)
检验逻辑:
- 假设 H₀ 为真
- 计算观察到当前数据或更极端数据的概率(p 值)
- 如果 p < α(通常 0.05),拒绝 H₀
- 如果 p ≥ α,不拒绝 H₀(注意:不等于接受 H₀)
两类错误
| H₀ 为真 | H₀ 为假 | |
|---|---|---|
| 拒绝 H₀ | Type I 错误(假阳性)概率 = α | 正确决策(统计功效) |
| 不拒绝 H₀ | 正确决策 | Type II 错误(假阴性)概率 = β |
权衡:降低 α(更严格)会增加 β(更容易漏掉真实效应)。α = 0.05 是惯例,不是自然法则。
二、学科直觉
- 估计的精度随 √n 改善:标准误差 = σ/√n。样本量翻倍,精度只提高 √2 ≈ 1.41 倍。这就是为什么从 100 样本到 10000 样本,精度只提高 10 倍而非 100 倍——边际收益递减。
- 不拒绝 H₀ ≠ 接受 H₀:这是最常见的误解。p = 0.06 时”没有显著证据”≠“药物无效”。可能是效应真实存在但样本量太小检测不出来(Type II 错误)。
- 显著性水平 α 是研究者的选择:α = 0.05 是惯例,但有些领域用 0.01(粒子物理)或 0.10(探索性研究)。选择 α 是在 Type I 和 Type II 错误之间做权衡——没有免费的午餐。
三、跨学科应用
A/B 测试:产品决策的统计基础
A/B 测试本质上是一个假设检验:
- H₀:新版本与旧版本转化率无差异
- H₁:新版本转化率更高
- 检验统计量:两组转化率的 z 分数
- 决策:p < 0.05 → 上线新版本
产品经理的关键问题:n = 多少才够?根据效应量(你期望的提升幅度)和 α、β 计算所需样本量。期望 20% 提升,n ≈ 每组 1000;期望 2% 提升,n ≈ 每组 20000+。
医学: Screening vs Diagnostic
Screening 测试(如乳腺癌筛查)用假设检验思维:
- H₀:没有癌症
- 高灵敏度(低 Type II)→ 尽量不漏诊
- 但高灵敏度意味着假阳性(Type I)增加 → 需要 follow-up 诊断测试
质量控制:过程能力指数
六西格玛用 Cpk 指数衡量过程能力:
- Cpk = min[(USL - μ)/3σ, (μ - LSL)/3σ]
- Cpk > 1.67 表示过程能力足够(6σ 水平)
- 本质上是假设检验:过程均值是否在规格限内 6σ
练习题
单选题
点估计的本质是?
95% 置信区间意味着?
Type I 错误是?
不拒绝 H₀ 意味着?
降低 α(如从 0.05 到 0.01)的直接后果是?
标准误差 = σ/√n 意味着?
假设检验中,p < 0.05 意味着?
案例分析
C1. 案例:某 A/B 测试新功能转化率 12% vs 旧版 10%,n = 200,p = 0.08。产品经理说"没显著差异,保持旧版"。统计学家怎么看?
反事实思考题
T1. 反事实:如果 α 永远固定在 0.05,不允许根据领域调整。最可能导致的系统性错误是什么?
下一步:Lesson 0007 · 回归分析:从线性到最小二乘——用模型量化变量关系。