Learning
VOL. VI · NO. 39 · Mathematics · 01 JAN 1970

信息论:用比特度量不确定性

数学 · 01 JAN 1970 · 10 min read · 2,322 words
· · ·

芒格思维模型课 · 第39讲

信息论:用比特度量不确定性

芒格说:「告诉别人他已知的事,信息量为零。」香农 1948 年用数学严格化了这句话——信息 = 不确定性的消除。这是数字时代的元科学。


核心概念

定义:信息论研究信息的量化、存储和传输。核心是「熵」——一个随机变量不确定性的度量。香农用 1 个公式统一了通信、压缩、统计、机器学习。

香农熵(Shannon Entropy)

对离散随机变量 $X$ 取值 $x_i$ 概率 $p_i$:

$$H(X) = -\sum_i p_i \log_2 p_i$$

  • 单位:比特(bit)
  • 直觉:平均需要多少比特编码 $X$ 的一个取值
  • 范围:$0 \leq H(X) \leq \log_2 n$($n$ 为可能取值数)

特殊情况

  • 确定性事件($p = 1$):$H = 0$(无不确定性)
  • 均匀分布($p_i = 1/n$):$H = \log_2 n$(最大不确定性)

互信息(Mutual Information)

$$I(X; Y) = H(X) - H(X | Y)$$

直觉:知道 $Y$ 后,$X$ 的不确定性减少了多少。互信息度量两个变量的「真实关联」,不像相关系数只捕捉线性关系。

KL 散度(相对熵)

$$D_{KL}(P | Q) = \sum_i p_i \log \frac{p_i}{q_i}$$

直觉:用 $Q$ 近似 $P$ 时的「信息损失」。KL ≥ 0,等号当且仅当 $P = Q$

应用

  • 衡量两个分布的差异
  • 模型训练中的交叉熵损失
  • 变分推断的目标函数

最大熵原理

在已知约束下,选择熵最大的分布——这是「最不偏的」选择。

  • 已知均值方差 → 高斯分布
  • 已知均值 → 指数分布
  • 已知支持集有限且无其他信息 → 均匀分布

直觉:「不要把不知道的当作知道」——最大熵是数学化的谦逊。


数学直觉

直觉一:信息 = 惊讶

定义自信息:$I(x) = -\log_2 p(x)$

  • 小概率事件发生 → 信息量大(令人惊讶)
  • 大概率事件发生 → 信息量小(预料之中)

例子

  • 「太阳今天升起」:$p \approx 1$,$I \approx 0$ bit
  • 「某彩票中奖」:$p = 10^{-7}$,$I \approx 23$ bit
  • 「2026 年某天有大地震」:$p = 10^{-4}$,$I \approx 13$ bit

熵 = 平均惊讶程度 = 不确定性的量化。

直觉二:熵 = 不可压缩性

香农信源编码定理:平均编码长度 ≥ 熵

  • 抛硬币($H = 1$ bit):需要 1 比特编码
  • 抛 6 面骰子($H = \log_2 6 \approx 2.58$ bit):平均需要 2.58 比特
  • 不均匀分布:可压缩!用短码表高频,长码表低频

洞察:Zip、gzip、PNG 本质都是「找到数据的低熵表示」。规律 = 可压缩 = 低熵;随机 = 不可压缩 = 高熵

直觉三:互信息 = 真实关联

相关系数只捕捉线性关系,互信息捕捉任意关系。

例子:$Y = X^2$,$X$ 在 ${-1, 0, 1}$ 均匀分布。

  • 相关系数 $\rho(X, Y) = 0$(线性无关)
  • 互信息 $I(X; Y) > 0$($Y$ 完全由 $X$ 决定)

应用:特征选择时,互信息比相关系数更稳健——能发现非线性依赖。

直觉四:KL 散度 = 「错配代价」

用 $Q$ 编码来自 $P$ 的数据,平均多花 $\log(p_i/q_i)$ 比特。这是 $Q$ 不匹配 $P$ 的「代价」。

深度学习中的交叉熵损失: $$L = -\sum y_i \log \hat{y}i = H(P) + D{KL}(P | \hat{P})$$

最小化交叉熵 = 最小化 KL 散度 = 让预测分布逼近真实分布。这是分类任务的标准损失函数


跨学科应用

商业:A/B 测试与信息价值

A/B 测试的本质是信息收集

  • 测试前:转化率 $p$ 未知,熵 $H = -p \log p - (1-p) \log(1-p)$
  • 测试后:$p$ 估计精确,熵降低

最优样本量:当信息收益(熵减少)= 测试成本时停止。这是贝叶斯最优实验设计的思想。

洞察:商业决策中「再收集多少信息」= 信息论问题。信息价值 = 决策改善的期望收益,应与收集成本比较。

投资:市场预测的 KL 散度

量化策略的预测分布 $\hat{P}$ 与真实分布 $P$ 的 KL 散度决定盈亏:

  • KL 小(预测准):策略盈利
  • KL 大(预测错):策略亏损

洞察:主动管理的「信息比率」本质是预测分布与市场隐含分布的 KL 散度。Alpha = 信息优势的量化

最大熵建模:在已知约束(均值、方差、矩)下,用最大熵分布作为「最无偏预测」。Bridgewater 的全天候策略隐含这种思想——不预测,只在已知风险预算下最大化稳健性。

决策:信息收集的最优停止

信号检测理论:在噪声中识别信号,本质是假设检验。

$$\text{后验熵} = H(X | Y) < H(X) = \text{先验熵}$$

决策规则

  • 收集信息直到后验熵足够低(不确定性消除到决策阈值)
  • 收集成本 > 信息价值时停止

芒格洞察:「能力圈」= 你熵最低的领域。在能力圈内决策,信息密度高;圈外决策,熵高,等于赌博。

数据压缩与编码

  • 霍夫曼编码:根据概率分配变长码,平均长度接近熵
  • Lempel-Ziv(gzip):通用压缩,不需要先验概率
  • 算术编码:可达熵极限

现代应用

  • 5G 通信的 LDPC 码、Polar 码逼近香农容量
  • JPEG(DCT + 熵编码)、H.264(视频压缩)的核心都是熵编码
  • 深度学习的「信息瓶颈」理论:网络层间互信息的压缩

课后测验

题目 1(单选)

「均匀分布的熵最大」这一论断的直觉解释是:

A. 均匀分布最容易编码 B. 均匀分布的不确定性最高,因为每个结果都同样可能 C. 均匀分布的方差最大 D. 均匀分布的均值最大

查看答案与解析

答案:B

熵度量不确定性。在所有取 $n$ 个值的分布中,均匀分布 $p_i = 1/n$ 让每个结果都「最不可预测」——没有任何结果比其他更可能。

数学上,由 Jensen 不等式: $$H(P) = -\sum p_i \log p_i \leq \log \sum p_i = \log n = H(\text{Uniform})$$

洞察:均匀分布 = 「最无知」状态。最大熵原理正是利用这一点——在已知约束下选熵最大的分布,相当于承认自己的无知

题目 2(案例分析)

某分类模型预测「这张图是猫的概率 0.7,狗 0.2,鸟 0.1」。真实标签是猫(即真实分布 $P = (1, 0, 0)$)。

问题

  1. 计算预测分布 $\hat{P} = (0.7, 0.2, 0.1)$ 与真实分布 $P$ 的交叉熵。
  2. 若另一个模型预测 $(0.9, 0.05, 0.05)$,交叉熵如何变化?
  3. 从信息论角度解释:为什么交叉熵是分类任务的合适损失?
查看答案与解析

1. 交叉熵计算

$$H(P, \hat{P}) = -\sum P_i \log \hat{P}_i = -\log 0.7 \approx 0.357 \text{ nat}$$

(自然对数单位 nat;若用 $\log_2$,约 0.515 bit)

2. 改进模型的交叉熵

$$H(P, \hat{P}’) = -\log 0.9 \approx 0.105 \text{ nat}$$

改进明显——预测更准,交叉熵更小。

3. 信息论解释

交叉熵 $H(P, \hat{P}) = H(P) + D_{KL}(P | \hat{P})$。当 $P$ 是 one-hot(真实标签),$H(P) = 0$,所以:

$$H(P, \hat{P}) = D_{KL}(P | \hat{P})$$

最小化交叉熵 = 最小化 KL 散度 = 让预测分布逼近真实分布。这是分类任务的「正确」损失函数——它直接衡量预测与真相的信息差异。

对比均方误差:MSE 不适合分类,因为它假设高斯噪声;交叉熵是概率分布间距离的自然度量。

题目 3(反事实)

假设 KL 散度的概念从未被提出(人类无法量化两个概率分布的差异),哪些领域会受到根本性影响?至少列举两个并解释。

查看答案与解析

受影响的领域

  1. 没有现代机器学习

    • 分类任务的交叉熵损失不存在,模型训练无目标函数
    • 变分推断(VAE、变分贝叶斯)整个框架消失
    • 强化学习中的策略梯度(PPO 等)依赖 KL 约束防止策略突变,失去它训练不稳定
  2. 没有信息压缩理论

    • 香农信源编码定理依赖 KL 散度证明「平均编码长度 ≥ 熵」
    • 失去它,无法证明压缩算法的最优性
    • JPEG、MP3、ZIP 等失去理论基础
  3. 没有贝叶斯模型比较

    • 贝叶斯因子、证据下界(ELBO)都基于 KL 散度
    • 失去它,无法量化「模型拟合数据的好坏」vs「模型复杂度」的权衡
  4. 没有变分推断

    • 用简单分布近似复杂后验的整个范式消失
    • 大规模贝叶斯推断不可行,概率编程(Pyro、Stan)失去数学基础

核心洞察:KL 散度是「分布间距离」的数学化身。它统一了压缩、推断、学习——是信息论连接机器学习的桥梁。


本课要点

  1. 熵 = 不确定性:均匀分布最大,确定性最小
  2. 信息 = 惊讶:小概率事件信息量大
  3. 互信息 = 真实关联:捕捉非线性依赖,优于相关系数
  4. KL 散度 = 错配代价:交叉熵 = 熵 + KL,分类损失的根
  5. 最大熵 = 数学化的谦逊:已知约束下选最无偏分布

延伸阅读

  • Shannon, 《A Mathematical Theory of Communication》 — 1948 年开创论文
  • Cover & Thomas, 《Elements of Information Theory》 — 经典教材
  • MacKay, 《Information Theory, Inference, and Learning Algorithms》 — 信息论 + ML 统一视角

下一步

下一课:博弈论进阶 — 演化稳定策略、重复博弈、信号博弈与拍卖理论。