概率分布:用数学描述不确定性
产品经理的数学课 · 第21讲
概率分布:用数学描述不确定性
每个产品决策都面临不确定性。概率分布是你描述和量化这种不确定性的语言——它告诉你「各种可能结果的概率是多少」。
前言
你管理一个在线客服系统。老板问:
- 「明天会有多少用户来咨询?」
- 「每次咨询要处理多久?」
- 「用户要等多久才能开始对话?」
这三个问题对应三种不同的概率分布:
- 用户咨询次数 → 泊松分布
- 每次处理时长 → 指数分布
- 用户等待时间 → 指数分布
概率分布不是抽象的数学概念——它是你描述产品现实的工具。每种分布都有特定的应用场景。
核心概念
什么是概率分布?
概率分布:描述一个随机变量取各种值的概率。
离散分布:随机变量只取有限个值(比如抛硬币:正面/反面) 连续分布:随机变量可以取任意值(比如身高:175.3cm, 175.31cm, …)
正态分布(Normal Distribution)
形状:钟形曲线,对称,中间高两边低
参数:
- μ(均值):曲线的中心位置
- σ(标准差):曲线的宽度(数据的分散程度)
应用场景:
- 人的身高、体重
- 测量误差
- 产品的质量指标
68-95-99.7 法则:
- 68% 的数据在 μ ± σ 范围内
- 95% 的数据在 μ ± 2σ 范围内
- 99.7% 的数据在 μ ± 3σ 范围内
例子:用户平均停留 5 分钟,标准差 1.5 分钟。
- 68% 的用户停留 3.5-6.5 分钟
- 95% 的用户停留 2-8 分钟
- 99.7% 的用户停留 0.5-9.5 分钟
泊松分布(Poisson Distribution)
形状:右偏,长尾
参数:
- λ(lambda):单位时间内的平均事件次数
应用场景:
- 每小时的用户咨询次数
- 每天的订单数量
- 每月的系统故障次数
例子:平均每小时 10 次咨询(λ = 10)。
- P(0 次) ≈ 0.000045(几乎不可能)
- P(5 次) ≈ 0.038(3.8%)
- P(10 次) ≈ 0.125(12.5%)
- P(15 次) ≈ 0.035(3.5%)
指数分布(Exponential Distribution)
形状:右偏,从某个值开始快速下降
参数:
- λ(lambda):事件发生的速率(λ = 1/均值)
应用场景:
- 用户等待时间
- 系统故障间隔时间
- 客服处理时长
例子:平均处理时长 5 分钟(λ = 0.2)。
- P(等待 < 1 分钟) ≈ 0.18(18%)
- P(等待 < 3 分钟) ≈ 0.45(45%)
- P(等待 < 5 分钟) ≈ 0.63(63%)
- P(等待 < 10 分钟) ≈ 0.86(86%)
二项分布(Binomial Distribution)
形状:对称或右偏(取决于 p)
参数:
- n:试验次数
- p:每次试验成功的概率
应用场景:
- 投放广告的点击率
- 用户注册转化率
- A/B 测试的转化次数
例子:100 人看到广告,点击率 5%(n=100, p=0.05)。
- P(0 次点击) ≈ 0.006(0.6%)
- P(5 次点击) ≈ 0.180(18.0%)
- P(10 次点击) ≈ 0.017(1.7%)
如何选择正确的分布?
| 问题类型 | 推荐分布 | 参数 |
|---|---|---|
| 某个时间点有多少事件发生? | 泊松分布 | λ(平均事件数) |
| 事件之间的等待时间是多少? | 指数分布 | λ(事件速率) |
| n 次试验中有多少次成功? | 二项分布 | n, p |
| 某个指标围绕均值波动? | 正态分布 | μ, σ |
| 某个指标在某个范围内? | 均匀分布 | a, b |
产品经理的应用
应用场景一:客服系统容量规划
你的客服系统:
- 平均每小时 20 次咨询(泊松分布)
- 每次咨询平均处理 10 分钟(指数分布)
问题:需要多少客服人员?
计算(排队论):
- 如果有 3 个客服:平均等待时间 15 分钟(太长)
- 如果有 4 个客服:平均等待时间 3 分钟(可接受)
- 如果有 5 个客服:平均等待时间 0.5 分钟(很好)
决策:安排 4 个客服人员。
应用场景二:系统故障预测
你的系统:
- 平均每月 2 次故障(泊松分布)
- 故障间隔时间服从指数分布(均值 15 天)
问题:下个月会发生多少次故障?
预测(泊松分布):
- P(0 次) ≈ 13.5%
- P(1 次) ≈ 27.1%
- P(2 次) ≈ 27.1%
- P(3 次) ≈ 18.0%
- P(≥4 次) ≈ 14.3%
决策:有 14.3% 的概率会发生 4 次或更多故障——需要准备应急方案。
应用场景三:广告效果评估
你投放广告:
- 1000 人看到广告
- 历史点击率 3%
问题:需要多少次展示才能获得 100 次点击?
计算(二项分布):
- 期望:100 / 0.03 ≈ 3333 次展示
- 标准差:√(3333 × 0.03 × 0.97) ≈ 10 次点击
- 95% 置信区间:80-120 次点击
决策:需要约 3333 次展示,预期获得 100 次点击(±20 次)。
常见误区
误区一:所有分布都是正态分布
「用户数据应该服从正态分布」
很多现实数据不服从正态分布。咨询次数是泊松分布,等待时间是指数分布,收入是对数正态分布。先判断数据类型,再选择正确的分布。
误区二:用均值代替分布
「平均等待时间 5 分钟,就按 5 分钟规划」
均值只是中心趋势。你需要看整个分布——特别是尾部(长等待时间的概率)。用分布做规划,不只用均值。
误区三:忽略分布的参数
「泊松分布和指数分布都用 λ,所以一样」
λ 的含义不同:
- 泊松分布:λ = 平均事件次数
- 指数分布:λ = 事件速率(1/均值)
参数含义不同,应用也不同。
误区四:分布假设错误
「用户停留时间服从正态分布」
正态分布是对称的,但用户停留时间通常右偏(有很多短停留,少数很长停留)。用错误的分布会得到错误的结论。
PM/BA 应用
| 场景 | 分布选择 | 决策价值 |
|---|---|---|
| 客服容量 | 泊松 + 指数 | 优化人员配置 |
| 故障预测 | 泊松 | 准备应急方案 |
| 广告效果 | 二项 | 估算展示需求 |
| 用户行为 | 正态/对数正态 | 预测行为模式 |
| 排队时间 | 指数 | 优化等待体验 |
课后测验
题目 1
你的客服系统平均每小时 15 次咨询。以下哪种分布最适合描述咨询次数?
A. 正态分布
B. 泊松分布
C. 指数分布
D. 二项分布
查看答案与解析
答案:B(泊松分布)
泊松分布描述「单位时间内事件发生的次数」:
- 事件独立发生
- 平均发生率已知(λ = 15 次/小时)
- 事件次数是离散的(0, 1, 2, …)
正态分布描述连续数据(身高、体重)
指数分布描述事件之间的等待时间
二项分布描述固定次数试验的成功次数
题目 2
用户平均停留时间 5 分钟,标准差 2 分钟。如果假设正态分布,95% 的用户停留时间在什么范围?
A. 1-9 分钟
B. 3-7 分钟
C. 0-10 分钟
D. 2-8 分钟
查看答案与解析
答案:A(1-9 分钟)
68-95-99.7 法则:
- 95% 的数据在 μ ± 2σ 范围内
- μ = 5,σ = 2
- 5 ± 2×2 = 5 ± 4 = [1, 9]
注意:实际用户停留时间通常不服从正态分布(右偏),这只是理论计算。
题目 3
你的系统平均每 30 天故障 1 次。故障间隔时间服从什么分布?
A. 泊松分布
B. 正态分布
C. 指数分布
D. 均匀分布
查看答案与解析
答案:C(指数分布)
指数分布描述「事件之间的等待时间」:
- 故障之间的间隔时间
- 平均间隔 30 天(λ = 1/30)
- 等待时间是连续的
泊松分布描述「单位时间内的故障次数」,不是间隔时间。
本课要点
- 概率分布描述不确定性:每种分布适合特定类型的数据
- 泊松分布:单位时间内的事件次数(咨询次数、订单量)
- 指数分布:事件之间的等待时间(处理时长、故障间隔)
- 二项分布:固定次数试验的成功次数(点击率、转化率)
- 正态分布:围绕均值波动的连续数据(身高、误差)
延伸阅读
- Ross, 《A First Course in Probability》 — 概率论教材
- Bertsekas & Tsitsiklis, 《Introduction to Probability》 — MIT 概率论课程教材
- Halford & Schouwenaars, 《Probability for Product Managers》 — 产品经理的概率应用
下一步
下一课:排列组合:从可能性中找到最优解 — 用排列组合解决产品设计中的选择问题。
工具提示:画出你的产品指标的分布图——它更像正态分布、泊松分布还是指数分布?选择正确的分布是准确预测的第一步。