统计学基础:均值、方差与正态分布
产品经理的数学课 · 第2讲
统计学基础:均值、方差与正态分布
统计学不是让数据说话——数据不会说话。统计学是帮你听到数据真正想说的话,而不是你想听的话。
前言
你每天都在看数据:DAU、转化率、留存曲线、NPS。但你有没有想过——这些数字到底在告诉你什么?
DAU 涨了 3%,是真实增长还是随机波动?转化率下降了 0.5 个百分点,需要关注吗?用户满意度评分 4.2/5,这算好还是不好?
这些问题的答案,取决于你理解三个核心概念:均值(集中趋势)、方差(离散程度)和分布(数据的形状)。缺少任何一个,你对数据的理解都是残缺的。
核心概念
均值:数据的重心
算术均值是最常用的集中趋势度量:
$$ \bar{x} = \frac{1}{n} \sum_{i=1}^{n} x_i $$
例子:你产品的 5 个用户每日使用时长(分钟):10, 15, 8, 22, 45。
均值 = (10+15+8+22+45)/5 = 20 分钟
但均值有陷阱:那 45 分钟的重度用户把均值拉高了。5 个用户中有 4 个低于均值。这时候中位数(排序后中间的值 = 15)更能代表「典型用户」。
什么时候用均值 vs 中位数:
| 数据特征 | 用均值 | 用中位数 |
|---|---|---|
| 分布对称、无极端值 | ✓ | — |
| 有极端值/偏态分布 | — | ✓ |
| 需要数学运算(如求和) | ✓ | — |
| 需要「典型值」 | — | ✓ |
方差:数据的离散程度
均值告诉你数据的「中心」,但完全不同的数据可以有相同的均值:
- 数据集 A:19, 20, 21(均值 = 20)
- 数据集 B:1, 20, 39(均值 = 20)
方差量化了数据围绕均值的分散程度:
$$ s^2 = \frac{1}{n-1} \sum_{i=1}^{n} (x_i - \bar{x})^2 $$
- 数据集 A 的方差 ≈ 1
- 数据集 B 的方差 ≈ 361
标准差(方差的平方根)更直观,因为它和原始数据单位一致:
- 数据集 A 的标准差 ≈ 1
- 数据集 B 的标准差 ≈ 19
PM 应用:如果用户使用时长的标准差很大,说明「典型用户」这个概念本身就没有意义——你需要把用户分群。
正态分布:最重要的分布
如果你把大量数据画成直方图,很多会呈现钟形曲线——中间高、两边低、大致对称。这就是正态分布(高斯分布)。
正态分布由两个参数完全确定:
- μ(均值):曲线的中心位置
- σ(标准差):曲线的宽度(离散程度)
68-95-99.7 法则(经验法则):
| 范围 | 覆盖比例 |
|---|---|
| μ ± 1σ | 约 68% |
| μ ± 2σ | 约 95% |
| μ ± 3σ | 约 99.7% |
例子:你的 App 平均加载时间是 2 秒,标准差是 0.5 秒。
- 约 68% 的用户加载时间在 1.5-2.5 秒之间
- 约 95% 的用户加载时间在 1.0-3.0 秒之间
- 几乎所有用户(99.7%)在 0.5-3.5 秒之间
如果某个用户加载时间是 5 秒(超过均值 6 个标准差),这不是「慢」——这是一个几乎不可能在正态分布中出现的异常值。可能是网络问题、设备问题、或者你的监控系统有 bug。
抽样:从局部推断整体
你不可能调查所有用户,只能抽样。抽样的核心问题是:样本均值有多接近总体均值?
中心极限定理:无论总体分布是什么形状,只要样本量足够大(通常 n ≥ 30),样本均值的分布近似正态分布。
$$ \bar{x} \sim N\left(\mu, \frac{\sigma^2}{n}\right) $$
这意味着样本均值的标准差(标准误)= σ/√n。
关键推论:样本量翻 4 倍,标准误减半。从 100 个样本到 400 个样本,精度提升 2 倍。但从 10000 到 10400,提升微乎其微。收益递减。
产品经理的应用
应用场景一:A/B 测试的统计基础
A/B 测试的本质是假设检验:
- 零假设 H₀:实验组和对照组没有差异
- 备择假设 H₁:实验组和对照组有差异
- 收集数据:计算两组的均值差异
- 判断:这个差异是「真实存在」还是「随机波动」?
如果差异的标准误很小(样本大),一个微小的差异也可能是统计显著的。但统计显著 ≠ 实际显著——0.1% 的转化率提升可能统计显著,但对业务毫无意义。
应用场景二:异常检测
你发现某天的 DAU 突然下降了 15%。这是异常吗?
如果你的历史 DAU 标准差是 3%,那 15% 的下降 = 5 个标准差。在正态分布下,这几乎是不可能的随机事件。你需要立刻排查:是不是服务器挂了?是不是数据源出了问题?
但如果你的 DAU 波动本身就很大(标准差 10%),15% 的下降只是 1.5 个标准差——可能只是正常的波动。
同样的 15% 下降,结论完全不同——取决于方差。
应用场景三:用户分群
你的 App 平均使用时长是 20 分钟。但标准差是 15 分钟。
- 约 34% 的用户在 5-20 分钟(轻度用户)
- 约 34% 的用户在 20-35 分钟(中度用户)
- 约 13% 的用户在 35-50 分钟(重度用户)
- 约 2% 的用户超过 50 分钟(超级用户)
如果你只看均值(20 分钟),你会以为「典型用户用 20 分钟」。但实际上不存在典型用户——你需要针对不同分群设计不同策略。
常见误区
误区一:均值陷阱
「我们的用户平均收入是 50 万」
如果你的用户中有 1% 是年收入 1000 万的超高净值人群,他们能把均值从 20 万拉到 50 万。中位数可能只有 18 万。99% 的用户低于均值。
永远同时报告均值和中位数,或者直接用分位数。
误区二:标准差的忽视
「我们的平均响应时间是 200ms,非常好」
如果标准差是 500ms,那约 16% 的用户等待时间超过 700ms。平均值很好,但尾部用户体验极差。你需要关注的不是均值,而是 P95 或 P99(第 95 或第 99 百分位数)。
误区三:样本量不足就下结论
「10 个用户中有 8 个喜欢新设计,80% 满意率!」
10 个样本的置信区间宽到离谱。80% 满意率的 95% 置信区间大约是 44%-97%——也就是说真实满意率可能是 44%。小样本的百分比几乎没有决策价值。
PM/BA 应用
| 场景 | 统计工具 | 决策价值 |
|---|---|---|
| A/B 测试 | 假设检验、置信区间 | 判断差异是否真实 |
| 异常监控 | Z-score、标准差 | 区分正常波动和真实异常 |
| 用户分群 | 分位数、聚类 | 识别不同行为模式 |
| 满意度调研 | 中位数、四分位距 | 避免极端值扭曲结论 |
| 需求预估 | 均值、标准差 | 评估预估的不确定性 |
课后测验
题目 1
你的产品平均日活是 10000,标准差是 1000。如果日活服从正态分布,以下哪个说法正确?
A. 约 95% 的天数日活在 8000-12000 之间
B. 约 68% 的天数日活在 9000-11000 之间
C. 约 99.7% 的天数日活在 7000-13000 之间
D. 以上全部正确
查看答案与解析
答案:D
- A:μ ± 2σ = 10000 ± 2000 = 8000-12000,约 95% ✓
- B:μ ± 1σ = 10000 ± 1000 = 9000-11000,约 68% ✓
- C:μ ± 3σ = 10000 ± 3000 = 7000-13000,约 99.7% ✓
全部符合 68-95-99.7 法则。
题目 2
你有两个用户群体的使用时长数据:
- 群体 A:均值 30 分钟,标准差 5 分钟
- 群体 B:均值 30 分钟,标准差 20 分钟
以下哪项描述正确?
A. 两个群体的用户行为完全相同
B. 群体 A 的用户行为更一致,群体 B 的用户行为差异更大
C. 群体 B 的用户更有价值
D. 均值相同说明不需要区分两个群体
查看答案与解析
答案:B
均值相同只说明「平均使用量」一样。但标准差告诉我们:
- 群体 A 的用户行为高度一致(大部分在 25-35 分钟),可以用单一策略
- 群体 B 的用户差异巨大(可能从 5 分钟到 55 分钟),需要分群策略
D 是最危险的思维——只看均值不看方差。
题目 3
你做了 A/B 测试,实验组转化率 4.2%,对照组 3.8%。你计算出 p 值为 0.03。以下哪个说法正确?
A. 实验组比对照组好 4.2%
B. 有 3% 的概率这个差异是随机产生的
C. 有 97% 的把握认为实验组更好
D. 这个差异在统计上显著(α=0.05),但还需要考虑实际意义
查看答案与解析
答案:D
- A 错误:实验组比对照组好 0.4 个百分点(4.2% - 3.8%),不是 4.2%
- B 错误:p 值的定义是「如果零假设为真,观察到当前或更极端结果的概率」,不是「差异是随机的概率」
- C 错误:p 值不是「实验组更好的概率」
- D 正确:p < 0.05 说明统计显著,但 0.4 个百分点的提升是否值得上线,还需要考虑开发成本、用户体验等实际因素
本课要点
- 均值告诉你中心,方差告诉你离散——只看均值是盲人摸象
- 正态分布的 68-95-99.7 法则是快速判断异常的基础
- 中心极限定理让抽样推断成为可能——样本量翻4倍,精度翻2倍
- 统计显著 ≠ 实际显著——p 值是工具,不是结论
- 分位数(P95/P99)比均值更能反映尾部风险
延伸阅读
- David Freedman, 《Statistics》 — 最好的统计学入门教材,无公式推导
- Howard Wainer, 《Picturing the Uncertain World》 — 可视化统计思维
- Carl Bergstrom & Jevin West, 《Calling Bullshit》第4-5章 — 如何识别数据误导
下一步
下一课:排列组合:可能性的计算 — 当你需要计算「有多少种可能」时,组合数学是你的工具箱。
工具提示:记住经验法则就够了。你不需要查表——知道 68%、95%、99.7% 对应 1/2/3 个标准差,足以处理 90% 的实际场景。