信息论:用比特度量不确定性
芒格思维模型课 · 第39讲
信息论:用比特度量不确定性
芒格说:「告诉别人他已知的事,信息量为零。」香农 1948 年用数学严格化了这句话——信息 = 不确定性的消除。这是数字时代的元科学。
核心概念
定义:信息论研究信息的量化、存储和传输。核心是「熵」——一个随机变量不确定性的度量。香农用 1 个公式统一了通信、压缩、统计、机器学习。
香农熵(Shannon Entropy)
对离散随机变量 $X$ 取值 $x_i$ 概率 $p_i$:
$$H(X) = -\sum_i p_i \log_2 p_i$$
- 单位:比特(bit)
- 直觉:平均需要多少比特编码 $X$ 的一个取值
- 范围:$0 \leq H(X) \leq \log_2 n$($n$ 为可能取值数)
特殊情况:
- 确定性事件($p = 1$):$H = 0$(无不确定性)
- 均匀分布($p_i = 1/n$):$H = \log_2 n$(最大不确定性)
互信息(Mutual Information)
$$I(X; Y) = H(X) - H(X | Y)$$
直觉:知道 $Y$ 后,$X$ 的不确定性减少了多少。互信息度量两个变量的「真实关联」,不像相关系数只捕捉线性关系。
KL 散度(相对熵)
$$D_{KL}(P | Q) = \sum_i p_i \log \frac{p_i}{q_i}$$
直觉:用 $Q$ 近似 $P$ 时的「信息损失」。KL ≥ 0,等号当且仅当 $P = Q$。
应用:
- 衡量两个分布的差异
- 模型训练中的交叉熵损失
- 变分推断的目标函数
最大熵原理
在已知约束下,选择熵最大的分布——这是「最不偏的」选择。
- 已知均值方差 → 高斯分布
- 已知均值 → 指数分布
- 已知支持集有限且无其他信息 → 均匀分布
直觉:「不要把不知道的当作知道」——最大熵是数学化的谦逊。
数学直觉
直觉一:信息 = 惊讶
定义自信息:$I(x) = -\log_2 p(x)$
- 小概率事件发生 → 信息量大(令人惊讶)
- 大概率事件发生 → 信息量小(预料之中)
例子:
- 「太阳今天升起」:$p \approx 1$,$I \approx 0$ bit
- 「某彩票中奖」:$p = 10^{-7}$,$I \approx 23$ bit
- 「2026 年某天有大地震」:$p = 10^{-4}$,$I \approx 13$ bit
熵 = 平均惊讶程度 = 不确定性的量化。
直觉二:熵 = 不可压缩性
香农信源编码定理:平均编码长度 ≥ 熵。
- 抛硬币($H = 1$ bit):需要 1 比特编码
- 抛 6 面骰子($H = \log_2 6 \approx 2.58$ bit):平均需要 2.58 比特
- 不均匀分布:可压缩!用短码表高频,长码表低频
洞察:Zip、gzip、PNG 本质都是「找到数据的低熵表示」。规律 = 可压缩 = 低熵;随机 = 不可压缩 = 高熵。
直觉三:互信息 = 真实关联
相关系数只捕捉线性关系,互信息捕捉任意关系。
例子:$Y = X^2$,$X$ 在 ${-1, 0, 1}$ 均匀分布。
- 相关系数 $\rho(X, Y) = 0$(线性无关)
- 互信息 $I(X; Y) > 0$($Y$ 完全由 $X$ 决定)
应用:特征选择时,互信息比相关系数更稳健——能发现非线性依赖。
直觉四:KL 散度 = 「错配代价」
用 $Q$ 编码来自 $P$ 的数据,平均多花 $\log(p_i/q_i)$ 比特。这是 $Q$ 不匹配 $P$ 的「代价」。
深度学习中的交叉熵损失: $$L = -\sum y_i \log \hat{y}i = H(P) + D{KL}(P | \hat{P})$$
最小化交叉熵 = 最小化 KL 散度 = 让预测分布逼近真实分布。这是分类任务的标准损失函数。
跨学科应用
商业:A/B 测试与信息价值
A/B 测试的本质是信息收集:
- 测试前:转化率 $p$ 未知,熵 $H = -p \log p - (1-p) \log(1-p)$
- 测试后:$p$ 估计精确,熵降低
最优样本量:当信息收益(熵减少)= 测试成本时停止。这是贝叶斯最优实验设计的思想。
洞察:商业决策中「再收集多少信息」= 信息论问题。信息价值 = 决策改善的期望收益,应与收集成本比较。
投资:市场预测的 KL 散度
量化策略的预测分布 $\hat{P}$ 与真实分布 $P$ 的 KL 散度决定盈亏:
- KL 小(预测准):策略盈利
- KL 大(预测错):策略亏损
洞察:主动管理的「信息比率」本质是预测分布与市场隐含分布的 KL 散度。Alpha = 信息优势的量化。
最大熵建模:在已知约束(均值、方差、矩)下,用最大熵分布作为「最无偏预测」。Bridgewater 的全天候策略隐含这种思想——不预测,只在已知风险预算下最大化稳健性。
决策:信息收集的最优停止
信号检测理论:在噪声中识别信号,本质是假设检验。
$$\text{后验熵} = H(X | Y) < H(X) = \text{先验熵}$$
决策规则:
- 收集信息直到后验熵足够低(不确定性消除到决策阈值)
- 收集成本 > 信息价值时停止
芒格洞察:「能力圈」= 你熵最低的领域。在能力圈内决策,信息密度高;圈外决策,熵高,等于赌博。
数据压缩与编码
- 霍夫曼编码:根据概率分配变长码,平均长度接近熵
- Lempel-Ziv(gzip):通用压缩,不需要先验概率
- 算术编码:可达熵极限
现代应用:
- 5G 通信的 LDPC 码、Polar 码逼近香农容量
- JPEG(DCT + 熵编码)、H.264(视频压缩)的核心都是熵编码
- 深度学习的「信息瓶颈」理论:网络层间互信息的压缩
课后测验
题目 1(单选)
「均匀分布的熵最大」这一论断的直觉解释是:
A. 均匀分布最容易编码 B. 均匀分布的不确定性最高,因为每个结果都同样可能 C. 均匀分布的方差最大 D. 均匀分布的均值最大
查看答案与解析
答案:B
熵度量不确定性。在所有取 $n$ 个值的分布中,均匀分布 $p_i = 1/n$ 让每个结果都「最不可预测」——没有任何结果比其他更可能。
数学上,由 Jensen 不等式: $$H(P) = -\sum p_i \log p_i \leq \log \sum p_i = \log n = H(\text{Uniform})$$
洞察:均匀分布 = 「最无知」状态。最大熵原理正是利用这一点——在已知约束下选熵最大的分布,相当于承认自己的无知。
题目 2(案例分析)
某分类模型预测「这张图是猫的概率 0.7,狗 0.2,鸟 0.1」。真实标签是猫(即真实分布 $P = (1, 0, 0)$)。
问题:
- 计算预测分布 $\hat{P} = (0.7, 0.2, 0.1)$ 与真实分布 $P$ 的交叉熵。
- 若另一个模型预测 $(0.9, 0.05, 0.05)$,交叉熵如何变化?
- 从信息论角度解释:为什么交叉熵是分类任务的合适损失?
查看答案与解析
1. 交叉熵计算:
$$H(P, \hat{P}) = -\sum P_i \log \hat{P}_i = -\log 0.7 \approx 0.357 \text{ nat}$$
(自然对数单位 nat;若用 $\log_2$,约 0.515 bit)
2. 改进模型的交叉熵:
$$H(P, \hat{P}’) = -\log 0.9 \approx 0.105 \text{ nat}$$
改进明显——预测更准,交叉熵更小。
3. 信息论解释:
交叉熵 $H(P, \hat{P}) = H(P) + D_{KL}(P | \hat{P})$。当 $P$ 是 one-hot(真实标签),$H(P) = 0$,所以:
$$H(P, \hat{P}) = D_{KL}(P | \hat{P})$$
最小化交叉熵 = 最小化 KL 散度 = 让预测分布逼近真实分布。这是分类任务的「正确」损失函数——它直接衡量预测与真相的信息差异。
对比均方误差:MSE 不适合分类,因为它假设高斯噪声;交叉熵是概率分布间距离的自然度量。
题目 3(反事实)
假设 KL 散度的概念从未被提出(人类无法量化两个概率分布的差异),哪些领域会受到根本性影响?至少列举两个并解释。
查看答案与解析
受影响的领域:
-
没有现代机器学习:
- 分类任务的交叉熵损失不存在,模型训练无目标函数
- 变分推断(VAE、变分贝叶斯)整个框架消失
- 强化学习中的策略梯度(PPO 等)依赖 KL 约束防止策略突变,失去它训练不稳定
-
没有信息压缩理论:
- 香农信源编码定理依赖 KL 散度证明「平均编码长度 ≥ 熵」
- 失去它,无法证明压缩算法的最优性
- JPEG、MP3、ZIP 等失去理论基础
-
没有贝叶斯模型比较:
- 贝叶斯因子、证据下界(ELBO)都基于 KL 散度
- 失去它,无法量化「模型拟合数据的好坏」vs「模型复杂度」的权衡
-
没有变分推断:
- 用简单分布近似复杂后验的整个范式消失
- 大规模贝叶斯推断不可行,概率编程(Pyro、Stan)失去数学基础
核心洞察:KL 散度是「分布间距离」的数学化身。它统一了压缩、推断、学习——是信息论连接机器学习的桥梁。
本课要点
- 熵 = 不确定性:均匀分布最大,确定性最小
- 信息 = 惊讶:小概率事件信息量大
- 互信息 = 真实关联:捕捉非线性依赖,优于相关系数
- KL 散度 = 错配代价:交叉熵 = 熵 + KL,分类损失的根
- 最大熵 = 数学化的谦逊:已知约束下选最无偏分布
延伸阅读
- Shannon, 《A Mathematical Theory of Communication》 — 1948 年开创论文
- Cover & Thomas, 《Elements of Information Theory》 — 经典教材
- MacKay, 《Information Theory, Inference, and Learning Algorithms》 — 信息论 + ML 统一视角
下一步
下一课:博弈论进阶 — 演化稳定策略、重复博弈、信号博弈与拍卖理论。