Learning
VOL. XXIV · NO. 02 · Statistics · 01 JAN 1970

Mle

统计推断思维 · 01 JAN 1970 · 5 min read · 1,377 words
· · ·

0002 · 最大似然估计:从数据反推模型

核心概念定义

最大似然估计(Maximum Likelihood Estimation, MLE)是统计学的核心工具:给定观测数据,找出最可能产生这些数据的参数值。

似然函数:L(θ|data) = P(data|θ)。注意它不是”参数的概率”——参数是频率派的固定值,没有概率分布。它是”给定这个参数,数据出现的概率”。

MLE 直觉:哪个参数值让观测到的数据”最不意外”?如果你抛硬币 100 次得到 70 次正面,最可能的 p(正面概率)是多少?答案是 0.7——任何其他 p 值都让”70 次正面”更不可能出现。

MLE 与贝叶斯的关系:当贝叶斯先验是均匀的(无偏好),贝叶斯后验的众数 = MLE。所以 MLE 可看作”无信息先验的贝叶斯估计”。但当样本小、噪声大时,无信息先验不是真的无信息——它本身就是一种激进的假设。

过度拟合风险:MLE 找的是”最拟合当前数据”的参数,但当前数据有噪声。把噪声也当信号拟合,就是过拟合——训练集上完美,新数据上崩溃。正则化(加惩罚项)就是治这个病的。

学科直觉

MLE 的核心直觉是:“最可能产生这些数据的参数”不等于”最正确的参数”——尤其当数据少、噪声大时。

三个直觉

  1. 似然 ≠ 概率:P(data|θ) 是数据在参数下的概率;L(θ|data) 是同一函数但把数据当固定、参数当变量。它不是”参数为真的概率”。混淆二者会犯倒置错误(检察官谬误)。
  2. 最拟合 ≠ 最正确:100 个数据点用 100 个参数可以完美拟合(每个参数对应一个点),但毫无预测力。拟合度越高,泛化能力可能越差——这是过拟合的本质。
  3. 小样本偏差:MLE 在小样本下系统性偏极端——抛 3 次得 3 正面,MLE 估计 p=1.0(必然正面),但这显然不合理。贝叶斯先验能拉回中心,这就是为什么小样本贝叶斯比 MLE 更稳健。

跨学科应用

投资:回测中的过拟合

量化策略回测时,调参让历史回报最大——这就是 MLE 思维。但调得越精细,越可能拟合了历史噪声而非真实规律。回测 200% 年化的策略,实盘可能亏钱——因为参数被历史特定噪声”过拟合”。防范:样本外测试、正则化(限制参数复杂度)、贝叶斯先验(拉回合理范围)。

机器学习:从数据反推模型

LLM 训练本质是 MLE——找最可能产生训练文本的参数。但纯 MLE 会过拟合(背下训练集),所以加正则化(dropout、weight decay)和交叉验证。模型能力 vs 过拟合是 ML 的核心张力。

商业:从成功案例反推”成功公式”

分析 10 个独角兽总结出”成功公式”——这是 MLE。但这些公司可能是 1000 个尝试者中的幸存者,公式拟合的是幸存样本的特定噪声。用 MLE 思维反推商业模式,几乎必然过拟合。需要贝叶斯修正:先验是”大部分尝试都失败”,似然是”这些幸存者的共同点”,后验比纯 MLE 更保守。

决策:单一案例的参数估计

从一次失败推断”这种事必败”——这是 n=1 的 MLE,必然过拟合。理性做法:先验是基础率(这类事一般成功率多少),用这次案例更新先验。小样本永远需要先验兜底

练习题

单选题

1

某量化团队用 5 年历史数据训练策略,调出年化 80% 回报的模型,实盘运行 3 个月亏损 30%。最可能的根本原因是?

案例题

某分析师研究 100 家”10 倍股”的共同特征,发现它们都有”创始人是工程师出身”这一特征,建议只投工程师创业的公司。请用 MLE 视角批判这个结论。

参考答案:(1) MLE 问题:分析师在幸存者样本上找最大似然的”成功参数”,但样本被”10 倍”条件预筛选——幸存者偏差让 MLE 系统性偏极端。(2) 缺失对照:100 家 10 倍股有 80 家工程师创始人,但 1000 家失败公司可能也有 800 家工程师创始人——对照下”工程师”与”成功”无关联。MLE 只看正样本会假阳性。(3) 过拟合:100 家公司的特定特征组合有无数种可能,找出的”工程师”可能只是这 100 家的偶然特征。正确做法:贝叶斯框架,先验是”创始人背景与成功无关”,用对照数据更新。这道题揭示:从结果反推原因时,MLE 在幸存者样本上几乎必然过拟合。

反事实题

1

假设 MLE 在任何样本量下都无偏(不再小样本偏极端)。在这种世界中,以下哪个现象会消失?