贝叶斯思维实战:先验选择与后验更新
从理论到实战——先验不是主观臆断,而是可用数据约束的
**预计时间:**25 分钟读 + 15 分钟做习题 = 40 分钟。
一、核心概念定义
共轭先验(Conjugate Prior)
如果先验分布和似然函数的组合使得后验分布与先验属于同一分布族,则称该先验为共轭先验。
经典例子:Beta-Binomial 共轭
- 似然:Binomial(n, p)(n 次独立试验的成功次数)
- 共轭先验:Beta(α, β)
- 后验:Beta(α + 成功次数, β + 失败次数)
威力:后验的参数更新只是简单的加法——不需要复杂的数值积分。
先验的类型
| 类型 | 定义 | 示例 | 适用场景 |
|---|---|---|---|
| 客观先验 | 最小信息先验,让数据主导 | Beta(1,1) = Uniform,Beta(0.5,0.5) = Jeffreys | 无知状态、探索性分析 |
| 主观先验 | 基于领域知识或历史数据 | Beta(10,2) 表示”基于历史,p ≈ 0.8” | 有 strong prior 信息 |
| 层次先验 | 先验本身有参数,这些参数从更高层推断 | p ~ Beta(α, β),α, β 从群体数据推断 | 多组数据的 partial pooling |
贝叶斯因子(Bayes Factor)
比较两个假设的证据强度:
BF₁₀ = P(数据|H₁) / P(数据|H₀)
- BF₁₀ > 10:强证据支持 H₁
- BF₁₀ < 0.1:强证据支持 H₀
- 0.1 < BF₁₀ < 10:证据不充分
与 p 值的区别:p 值只看 H₀ 下的数据概率,贝叶斯因子比较两个假设。
二、学科直觉
- 先验是”你开始的地方”,不是”你的偏见”:好的先验编码了所有相关历史信息。如果你是一家成立 10 年的公司,你的”产品成功率”先验不应该从 0.5 开始(无知),而应该从历史数据开始(如 30%)。无知先验在有信息时是浪费。
- 数据越多,先验越不重要:n → ∞ 时,后验 ≈ 正态分布,均值 ≈ MLE,方差 ≈ 1/n。这就是”大样本下频率派和贝叶斯派结论趋同”的原因。争议只在小样本。
- 后验方差衡量剩余不确定性:后验越集中(方差小),说明数据已经把信念锁定得越紧。后验分散(方差大)说明即使看了数据,你仍不确定——需要更多数据。
三、跨学科应用
A/B 测试的贝叶斯视角
传统 A/B 测试:p < 0.05 就上线。贝叶斯 A/B 测试:计算后验概率 P(新 > 旧 | 数据)。
- 先验:历史数据表明转化率通常在 5-15% → Beta(3, 20)
- 新版本 200 用户,转化 30 次;旧版本 200 用户,转化 20 次
- 后验:新 ~ Beta(33, 191), 旧 ~ Beta(23, 181)
- P(新 > 旧) ≈ ?
Monte Carlo 抽样估计:P(新 > 旧) ≈ 85%
决策:85% 概率新版本更好——上线。但注意:这与 p = 0.08(频率派不显著)的结论不同。贝叶斯框架整合了先验,更早做出决策。
医疗诊断的连续更新
患者做了三项独立检测,每项灵敏度 90%、特异度 90%。先验患病率 1%。
- 第一项阳性:P(病|+) = 0.083(从 1% 升到 8.3%)
- 第二项阳性:以 8.3% 为先验,P(病|++) = 0.48
- 第三项阳性:以 48% 为先验,P(病|+++) = 0.96
连续三次阳性把患病概率从 1% 推到了 96%——这就是贝叶斯更新的威力。
产品迭代的信念更新
新功能上线后,用户反馈是连续的数据流:
| 时间 | 数据 | 先验 | 后验 |
|---|---|---|---|
| Day 1 | 5 用户,3 好评 | Beta(3, 20) | Beta(6, 22) → P(好评率>0.5) ≈ ? |
| Day 7 | 累计 50 用户,30 好评 | Beta(6, 22) | Beta(36, 42) → P ≈ ? |
| Day 30 | 累计 200 用户,110 好评 | Beta(36, 42) | Beta(146, 132) → P ≈ ? |
后验分布越来越集中,决策越来越有把握。
练习题
单选题
Beta-Binomial 共轭的先验分布是?
以下哪项是客观先验?
贝叶斯因子 BF₁₀ > 10 意味着?
小样本下,贝叶斯 vs 频率派的典型差异是?
n → ∞ 时,贝叶斯后验与频率派 MLE 的关系是?
"后验方差大"意味着?
连续贝叶斯更新的本质是?
案例分析
C1. 案例:某 SaaS 公司历史 churn rate 15%。新版本上线后,第一周 100 用户中 5 人 churn。贝叶斯分析(先验 Beta(15,85))后验 P(churn < 10%) ≈ 72%。决策?
反事实思考题
T1. 反事实:如果所有 A/B 测试都用"先验 = 历史均值"而不是"先验 = 均匀分布"。对决策速度的影响是?
下一步:Lesson 0010 · 概率论与统计学的交叉:从模型到决策——综合决策理论。