Learning
VOL. VI · NO. 02 · Mathematics · 01 JAN 1970

统计学基础:均值、方差与正态分布

数学 · 01 JAN 1970 · 10 min read · 2,538 words
· · ·

产品经理的数学课 · 第2讲

统计学基础:均值、方差与正态分布

统计学不是让数据说话——数据不会说话。统计学是帮你听到数据真正想说的话,而不是你想听的话


前言

你每天都在看数据:DAU、转化率、留存曲线、NPS。但你有没有想过——这些数字到底在告诉你什么?

DAU 涨了 3%,是真实增长还是随机波动?转化率下降了 0.5 个百分点,需要关注吗?用户满意度评分 4.2/5,这算好还是不好?

这些问题的答案,取决于你理解三个核心概念:均值(集中趋势)、方差(离散程度)和分布(数据的形状)。缺少任何一个,你对数据的理解都是残缺的。


核心概念

均值:数据的重心

算术均值是最常用的集中趋势度量:

$$ \bar{x} = \frac{1}{n} \sum_{i=1}^{n} x_i $$

例子:你产品的 5 个用户每日使用时长(分钟):10, 15, 8, 22, 45。

均值 = (10+15+8+22+45)/5 = 20 分钟

但均值有陷阱:那 45 分钟的重度用户把均值拉高了。5 个用户中有 4 个低于均值。这时候中位数(排序后中间的值 = 15)更能代表「典型用户」。

什么时候用均值 vs 中位数:

数据特征用均值用中位数
分布对称、无极端值
有极端值/偏态分布
需要数学运算(如求和)
需要「典型值」

方差:数据的离散程度

均值告诉你数据的「中心」,但完全不同的数据可以有相同的均值:

  • 数据集 A:19, 20, 21(均值 = 20)
  • 数据集 B:1, 20, 39(均值 = 20)

方差量化了数据围绕均值的分散程度:

$$ s^2 = \frac{1}{n-1} \sum_{i=1}^{n} (x_i - \bar{x})^2 $$

  • 数据集 A 的方差 ≈ 1
  • 数据集 B 的方差 ≈ 361

标准差(方差的平方根)更直观,因为它和原始数据单位一致:

  • 数据集 A 的标准差 ≈ 1
  • 数据集 B 的标准差 ≈ 19

PM 应用:如果用户使用时长的标准差很大,说明「典型用户」这个概念本身就没有意义——你需要把用户分群。

正态分布:最重要的分布

如果你把大量数据画成直方图,很多会呈现钟形曲线——中间高、两边低、大致对称。这就是正态分布(高斯分布)。

正态分布由两个参数完全确定:

  • μ(均值):曲线的中心位置
  • σ(标准差):曲线的宽度(离散程度)

68-95-99.7 法则(经验法则):

范围覆盖比例
μ ± 1σ约 68%
μ ± 2σ约 95%
μ ± 3σ约 99.7%

例子:你的 App 平均加载时间是 2 秒,标准差是 0.5 秒。

  • 约 68% 的用户加载时间在 1.5-2.5 秒之间
  • 约 95% 的用户加载时间在 1.0-3.0 秒之间
  • 几乎所有用户(99.7%)在 0.5-3.5 秒之间

如果某个用户加载时间是 5 秒(超过均值 6 个标准差),这不是「慢」——这是一个几乎不可能在正态分布中出现的异常值。可能是网络问题、设备问题、或者你的监控系统有 bug。

抽样:从局部推断整体

你不可能调查所有用户,只能抽样。抽样的核心问题是:样本均值有多接近总体均值?

中心极限定理:无论总体分布是什么形状,只要样本量足够大(通常 n ≥ 30),样本均值的分布近似正态分布。

$$ \bar{x} \sim N\left(\mu, \frac{\sigma^2}{n}\right) $$

这意味着样本均值的标准差(标准误)= σ/√n。

关键推论:样本量翻 4 倍,标准误减半。从 100 个样本到 400 个样本,精度提升 2 倍。但从 10000 到 10400,提升微乎其微。收益递减


产品经理的应用

应用场景一:A/B 测试的统计基础

A/B 测试的本质是假设检验

  1. 零假设 H₀:实验组和对照组没有差异
  2. 备择假设 H₁:实验组和对照组有差异
  3. 收集数据:计算两组的均值差异
  4. 判断:这个差异是「真实存在」还是「随机波动」?

如果差异的标准误很小(样本大),一个微小的差异也可能是统计显著的。但统计显著 ≠ 实际显著——0.1% 的转化率提升可能统计显著,但对业务毫无意义。

应用场景二:异常检测

你发现某天的 DAU 突然下降了 15%。这是异常吗?

如果你的历史 DAU 标准差是 3%,那 15% 的下降 = 5 个标准差。在正态分布下,这几乎是不可能的随机事件。你需要立刻排查:是不是服务器挂了?是不是数据源出了问题?

但如果你的 DAU 波动本身就很大(标准差 10%),15% 的下降只是 1.5 个标准差——可能只是正常的波动。

同样的 15% 下降,结论完全不同——取决于方差。

应用场景三:用户分群

你的 App 平均使用时长是 20 分钟。但标准差是 15 分钟。

  • 约 34% 的用户在 5-20 分钟(轻度用户)
  • 约 34% 的用户在 20-35 分钟(中度用户)
  • 约 13% 的用户在 35-50 分钟(重度用户)
  • 约 2% 的用户超过 50 分钟(超级用户)

如果你只看均值(20 分钟),你会以为「典型用户用 20 分钟」。但实际上不存在典型用户——你需要针对不同分群设计不同策略。


常见误区

误区一:均值陷阱

「我们的用户平均收入是 50 万」

如果你的用户中有 1% 是年收入 1000 万的超高净值人群,他们能把均值从 20 万拉到 50 万。中位数可能只有 18 万。99% 的用户低于均值。

永远同时报告均值和中位数,或者直接用分位数。

误区二:标准差的忽视

「我们的平均响应时间是 200ms,非常好」

如果标准差是 500ms,那约 16% 的用户等待时间超过 700ms。平均值很好,但尾部用户体验极差。你需要关注的不是均值,而是 P95 或 P99(第 95 或第 99 百分位数)。

误区三:样本量不足就下结论

「10 个用户中有 8 个喜欢新设计,80% 满意率!」

10 个样本的置信区间宽到离谱。80% 满意率的 95% 置信区间大约是 44%-97%——也就是说真实满意率可能是 44%。小样本的百分比几乎没有决策价值。


PM/BA 应用

场景统计工具决策价值
A/B 测试假设检验、置信区间判断差异是否真实
异常监控Z-score、标准差区分正常波动和真实异常
用户分群分位数、聚类识别不同行为模式
满意度调研中位数、四分位距避免极端值扭曲结论
需求预估均值、标准差评估预估的不确定性

课后测验

题目 1

你的产品平均日活是 10000,标准差是 1000。如果日活服从正态分布,以下哪个说法正确?

A. 约 95% 的天数日活在 8000-12000 之间
B. 约 68% 的天数日活在 9000-11000 之间
C. 约 99.7% 的天数日活在 7000-13000 之间
D. 以上全部正确

查看答案与解析

答案:D

  • A:μ ± 2σ = 10000 ± 2000 = 8000-12000,约 95% ✓
  • B:μ ± 1σ = 10000 ± 1000 = 9000-11000,约 68% ✓
  • C:μ ± 3σ = 10000 ± 3000 = 7000-13000,约 99.7% ✓

全部符合 68-95-99.7 法则。

题目 2

你有两个用户群体的使用时长数据:

  • 群体 A:均值 30 分钟,标准差 5 分钟
  • 群体 B:均值 30 分钟,标准差 20 分钟

以下哪项描述正确?

A. 两个群体的用户行为完全相同
B. 群体 A 的用户行为更一致,群体 B 的用户行为差异更大
C. 群体 B 的用户更有价值
D. 均值相同说明不需要区分两个群体

查看答案与解析

答案:B

均值相同只说明「平均使用量」一样。但标准差告诉我们:

  • 群体 A 的用户行为高度一致(大部分在 25-35 分钟),可以用单一策略
  • 群体 B 的用户差异巨大(可能从 5 分钟到 55 分钟),需要分群策略

D 是最危险的思维——只看均值不看方差。

题目 3

你做了 A/B 测试,实验组转化率 4.2%,对照组 3.8%。你计算出 p 值为 0.03。以下哪个说法正确?

A. 实验组比对照组好 4.2%
B. 有 3% 的概率这个差异是随机产生的
C. 有 97% 的把握认为实验组更好
D. 这个差异在统计上显著(α=0.05),但还需要考虑实际意义

查看答案与解析

答案:D

  • A 错误:实验组比对照组好 0.4 个百分点(4.2% - 3.8%),不是 4.2%
  • B 错误:p 值的定义是「如果零假设为真,观察到当前或更极端结果的概率」,不是「差异是随机的概率」
  • C 错误:p 值不是「实验组更好的概率」
  • D 正确:p < 0.05 说明统计显著,但 0.4 个百分点的提升是否值得上线,还需要考虑开发成本、用户体验等实际因素

本课要点

  1. 均值告诉你中心,方差告诉你离散——只看均值是盲人摸象
  2. 正态分布的 68-95-99.7 法则是快速判断异常的基础
  3. 中心极限定理让抽样推断成为可能——样本量翻4倍,精度翻2倍
  4. 统计显著 ≠ 实际显著——p 值是工具,不是结论
  5. 分位数(P95/P99)比均值更能反映尾部风险

延伸阅读

  • David Freedman, 《Statistics》 — 最好的统计学入门教材,无公式推导
  • Howard Wainer, 《Picturing the Uncertain World》 — 可视化统计思维
  • Carl Bergstrom & Jevin West, 《Calling Bullshit》第4-5章 — 如何识别数据误导

下一步

下一课:排列组合:可能性的计算 — 当你需要计算「有多少种可能」时,组合数学是你的工具箱。


工具提示:记住经验法则就够了。你不需要查表——知道 68%、95%、99.7% 对应 1/2/3 个标准差,足以处理 90% 的实际场景。