致知录
第 VI 卷 · 第 39 篇 · Mathematics · 1970.01.01

信息论:用比特度量不确定性

数学 · 1970.01.01 · 10 分钟阅读 · 2,320 字
目录 · 22
芒格思维模型课 · 第39讲

芒格说:「告诉别人他已知的事,信息量为零。」香农 1948 年用数学严格化了这句话——信息 = 不确定性的消除。这是数字时代的元科学。


核心概念

定义:信息论研究信息的量化、存储和传输。核心是「熵」——一个随机变量不确定性的度量。香农用 1 个公式统一了通信、压缩、统计、机器学习。

香农熵(Shannon Entropy)

对离散随机变量 XX 取值 xix_i 概率 pip_i

H(X)=ipilog2piH(X) = -\sum_i p_i \log_2 p_i

  • 单位:比特(bit)
  • 直觉:平均需要多少比特编码 XX 的一个取值
  • 范围:0H(X)log2n0 \leq H(X) \leq \log_2 nnn 为可能取值数)

特殊情况

  • 确定性事件(p=1p = 1):H=0H = 0(无不确定性)
  • 均匀分布(pi=1/np_i = 1/n):H=log2nH = \log_2 n(最大不确定性)

互信息(Mutual Information)

I(X;Y)=H(X)H(XY)I(X; Y) = H(X) - H(X | Y)

直觉:知道 YY 后,XX 的不确定性减少了多少。互信息度量两个变量的「真实关联」,不像相关系数只捕捉线性关系。

KL 散度(相对熵)

DKL(PQ)=ipilogpiqiD_{KL}(P \| Q) = \sum_i p_i \log \frac{p_i}{q_i}

直觉:用 QQ 近似 PP 时的「信息损失」。KL ≥ 0,等号当且仅当 P=QP = Q

应用

  • 衡量两个分布的差异
  • 模型训练中的交叉熵损失
  • 变分推断的目标函数

最大熵原理

在已知约束下,选择熵最大的分布——这是「最不偏的」选择。

  • 已知均值方差 → 高斯分布
  • 已知均值 → 指数分布
  • 已知支持集有限且无其他信息 → 均匀分布

直觉:「不要把不知道的当作知道」——最大熵是数学化的谦逊。


数学直觉

直觉一:信息 = 惊讶

定义自信息:I(x)=log2p(x)I(x) = -\log_2 p(x)

  • 小概率事件发生 → 信息量大(令人惊讶)
  • 大概率事件发生 → 信息量小(预料之中)

例子

  • 「太阳今天升起」:p1p \approx 1I0I \approx 0 bit
  • 「某彩票中奖」:p=107p = 10^{-7}I23I \approx 23 bit
  • 「2026 年某天有大地震」:p=104p = 10^{-4}I13I \approx 13 bit

熵 = 平均惊讶程度 = 不确定性的量化。

直觉二:熵 = 不可压缩性

香农信源编码定理:平均编码长度 ≥ 熵

  • 抛硬币(H=1H = 1 bit):需要 1 比特编码
  • 抛 6 面骰子(H=log262.58H = \log_2 6 \approx 2.58 bit):平均需要 2.58 比特
  • 不均匀分布:可压缩!用短码表高频,长码表低频

洞察:Zip、gzip、PNG 本质都是「找到数据的低熵表示」。规律 = 可压缩 = 低熵;随机 = 不可压缩 = 高熵

直觉三:互信息 = 真实关联

相关系数只捕捉线性关系,互信息捕捉任意关系。

例子Y=X2Y = X^2XX{1,0,1}\{-1, 0, 1\} 均匀分布。

  • 相关系数 ρ(X,Y)=0\rho(X, Y) = 0(线性无关)
  • 互信息 I(X;Y)>0I(X; Y) > 0YY 完全由 XX 决定)

应用:特征选择时,互信息比相关系数更稳健——能发现非线性依赖。

直觉四:KL 散度 = 「错配代价」

QQ 编码来自 PP 的数据,平均多花 log(pi/qi)\log(p_i/q_i) 比特。这是 QQ 不匹配 PP 的「代价」。

深度学习中的交叉熵损失L=yilogy^i=H(P)+DKL(PP^)L = -\sum y_i \log \hat{y}_i = H(P) + D_{KL}(P \| \hat{P})

最小化交叉熵 = 最小化 KL 散度 = 让预测分布逼近真实分布。这是分类任务的标准损失函数


跨学科应用

商业:A/B 测试与信息价值

A/B 测试的本质是信息收集

  • 测试前:转化率 pp 未知,熵 H=plogp(1p)log(1p)H = -p \log p - (1-p) \log(1-p)
  • 测试后:pp 估计精确,熵降低

最优样本量:当信息收益(熵减少)= 测试成本时停止。这是贝叶斯最优实验设计的思想。

洞察:商业决策中「再收集多少信息」= 信息论问题。信息价值 = 决策改善的期望收益,应与收集成本比较。

投资:市场预测的 KL 散度

量化策略的预测分布 P^\hat{P} 与真实分布 PP 的 KL 散度决定盈亏:

  • KL 小(预测准):策略盈利
  • KL 大(预测错):策略亏损

洞察:主动管理的「信息比率」本质是预测分布与市场隐含分布的 KL 散度。Alpha = 信息优势的量化

最大熵建模:在已知约束(均值、方差、矩)下,用最大熵分布作为「最无偏预测」。Bridgewater 的全天候策略隐含这种思想——不预测,只在已知风险预算下最大化稳健性。

决策:信息收集的最优停止

信号检测理论:在噪声中识别信号,本质是假设检验。

后验熵=H(XY)<H(X)=先验熵\text{后验熵} = H(X | Y) < H(X) = \text{先验熵}

决策规则

  • 收集信息直到后验熵足够低(不确定性消除到决策阈值)
  • 收集成本 > 信息价值时停止

芒格洞察:「能力圈」= 你熵最低的领域。在能力圈内决策,信息密度高;圈外决策,熵高,等于赌博。

数据压缩与编码

  • 霍夫曼编码:根据概率分配变长码,平均长度接近熵
  • Lempel-Ziv(gzip):通用压缩,不需要先验概率
  • 算术编码:可达熵极限

现代应用

  • 5G 通信的 LDPC 码、Polar 码逼近香农容量
  • JPEG(DCT + 熵编码)、H.264(视频压缩)的核心都是熵编码
  • 深度学习的「信息瓶颈」理论:网络层间互信息的压缩

课后测验

题目 1(单选)

「均匀分布的熵最大」这一论断的直觉解释是:

A. 均匀分布最容易编码 B. 均匀分布的不确定性最高,因为每个结果都同样可能 C. 均匀分布的方差最大 D. 均匀分布的均值最大

查看答案与解析

答案:B

熵度量不确定性。在所有取 nn 个值的分布中,均匀分布 pi=1/np_i = 1/n 让每个结果都「最不可预测」——没有任何结果比其他更可能。

数学上,由 Jensen 不等式: H(P)=pilogpilogpi=logn=H(Uniform)H(P) = -\sum p_i \log p_i \leq \log \sum p_i = \log n = H(\text{Uniform})

洞察:均匀分布 = 「最无知」状态。最大熵原理正是利用这一点——在已知约束下选熵最大的分布,相当于承认自己的无知

题目 2(案例分析)

某分类模型预测「这张图是猫的概率 0.7,狗 0.2,鸟 0.1」。真实标签是猫(即真实分布 P=(1,0,0)P = (1, 0, 0))。

问题

  1. 计算预测分布 P^=(0.7,0.2,0.1)\hat{P} = (0.7, 0.2, 0.1) 与真实分布 PP 的交叉熵。
  2. 若另一个模型预测 (0.9,0.05,0.05)(0.9, 0.05, 0.05),交叉熵如何变化?
  3. 从信息论角度解释:为什么交叉熵是分类任务的合适损失?
查看答案与解析

1. 交叉熵计算

H(P,P^)=PilogP^i=log0.70.357 natH(P, \hat{P}) = -\sum P_i \log \hat{P}_i = -\log 0.7 \approx 0.357 \text{ nat}

(自然对数单位 nat;若用 log2\log_2,约 0.515 bit)

2. 改进模型的交叉熵

H(P,P^)=log0.90.105 natH(P, \hat{P}') = -\log 0.9 \approx 0.105 \text{ nat}

改进明显——预测更准,交叉熵更小。

3. 信息论解释

交叉熵 H(P,P^)=H(P)+DKL(PP^)H(P, \hat{P}) = H(P) + D_{KL}(P \| \hat{P})。当 PP 是 one-hot(真实标签),H(P)=0H(P) = 0,所以:

H(P,P^)=DKL(PP^)H(P, \hat{P}) = D_{KL}(P \| \hat{P})

最小化交叉熵 = 最小化 KL 散度 = 让预测分布逼近真实分布。这是分类任务的「正确」损失函数——它直接衡量预测与真相的信息差异。

对比均方误差:MSE 不适合分类,因为它假设高斯噪声;交叉熵是概率分布间距离的自然度量。

题目 3(反事实)

假设 KL 散度的概念从未被提出(人类无法量化两个概率分布的差异),哪些领域会受到根本性影响?至少列举两个并解释。

查看答案与解析

受影响的领域

  1. 没有现代机器学习

    • 分类任务的交叉熵损失不存在,模型训练无目标函数
    • 变分推断(VAE、变分贝叶斯)整个框架消失
    • 强化学习中的策略梯度(PPO 等)依赖 KL 约束防止策略突变,失去它训练不稳定
  2. 没有信息压缩理论

    • 香农信源编码定理依赖 KL 散度证明「平均编码长度 ≥ 熵」
    • 失去它,无法证明压缩算法的最优性
    • JPEG、MP3、ZIP 等失去理论基础
  3. 没有贝叶斯模型比较

    • 贝叶斯因子、证据下界(ELBO)都基于 KL 散度
    • 失去它,无法量化「模型拟合数据的好坏」vs「模型复杂度」的权衡
  4. 没有变分推断

    • 用简单分布近似复杂后验的整个范式消失
    • 大规模贝叶斯推断不可行,概率编程(Pyro、Stan)失去数学基础

核心洞察:KL 散度是「分布间距离」的数学化身。它统一了压缩、推断、学习——是信息论连接机器学习的桥梁。


本课要点

  1. 熵 = 不确定性:均匀分布最大,确定性最小
  2. 信息 = 惊讶:小概率事件信息量大
  3. 互信息 = 真实关联:捕捉非线性依赖,优于相关系数
  4. KL 散度 = 错配代价:交叉熵 = 熵 + KL,分类损失的根
  5. 最大熵 = 数学化的谦逊:已知约束下选最无偏分布

延伸阅读

  • Shannon, 《A Mathematical Theory of Communication》 — 1948 年开创论文
  • Cover & Thomas, 《Elements of Information Theory》 — 经典教材
  • MacKay, 《Information Theory, Inference, and Learning Algorithms》 — 信息论 + ML 统一视角

下一步

下一课:博弈论进阶 — 演化稳定策略、重复博弈、信号博弈与拍卖理论。