Mle
0002 · 最大似然估计:从数据反推模型
核心概念定义
最大似然估计(Maximum Likelihood Estimation, MLE)是统计学的核心工具:给定观测数据,找出最可能产生这些数据的参数值。
似然函数:L(θ|data) = P(data|θ)。注意它不是”参数的概率”——参数是频率派的固定值,没有概率分布。它是”给定这个参数,数据出现的概率”。
MLE 直觉:哪个参数值让观测到的数据”最不意外”?如果你抛硬币 100 次得到 70 次正面,最可能的 p(正面概率)是多少?答案是 0.7——任何其他 p 值都让”70 次正面”更不可能出现。
MLE 与贝叶斯的关系:当贝叶斯先验是均匀的(无偏好),贝叶斯后验的众数 = MLE。所以 MLE 可看作”无信息先验的贝叶斯估计”。但当样本小、噪声大时,无信息先验不是真的无信息——它本身就是一种激进的假设。
过度拟合风险:MLE 找的是”最拟合当前数据”的参数,但当前数据有噪声。把噪声也当信号拟合,就是过拟合——训练集上完美,新数据上崩溃。正则化(加惩罚项)就是治这个病的。
学科直觉
MLE 的核心直觉是:“最可能产生这些数据的参数”不等于”最正确的参数”——尤其当数据少、噪声大时。
三个直觉:
- 似然 ≠ 概率:P(data|θ) 是数据在参数下的概率;L(θ|data) 是同一函数但把数据当固定、参数当变量。它不是”参数为真的概率”。混淆二者会犯倒置错误(检察官谬误)。
- 最拟合 ≠ 最正确:100 个数据点用 100 个参数可以完美拟合(每个参数对应一个点),但毫无预测力。拟合度越高,泛化能力可能越差——这是过拟合的本质。
- 小样本偏差:MLE 在小样本下系统性偏极端——抛 3 次得 3 正面,MLE 估计 p=1.0(必然正面),但这显然不合理。贝叶斯先验能拉回中心,这就是为什么小样本贝叶斯比 MLE 更稳健。
跨学科应用
投资:回测中的过拟合
量化策略回测时,调参让历史回报最大——这就是 MLE 思维。但调得越精细,越可能拟合了历史噪声而非真实规律。回测 200% 年化的策略,实盘可能亏钱——因为参数被历史特定噪声”过拟合”。防范:样本外测试、正则化(限制参数复杂度)、贝叶斯先验(拉回合理范围)。
机器学习:从数据反推模型
LLM 训练本质是 MLE——找最可能产生训练文本的参数。但纯 MLE 会过拟合(背下训练集),所以加正则化(dropout、weight decay)和交叉验证。模型能力 vs 过拟合是 ML 的核心张力。
商业:从成功案例反推”成功公式”
分析 10 个独角兽总结出”成功公式”——这是 MLE。但这些公司可能是 1000 个尝试者中的幸存者,公式拟合的是幸存样本的特定噪声。用 MLE 思维反推商业模式,几乎必然过拟合。需要贝叶斯修正:先验是”大部分尝试都失败”,似然是”这些幸存者的共同点”,后验比纯 MLE 更保守。
决策:单一案例的参数估计
从一次失败推断”这种事必败”——这是 n=1 的 MLE,必然过拟合。理性做法:先验是基础率(这类事一般成功率多少),用这次案例更新先验。小样本永远需要先验兜底。
练习题
单选题
某量化团队用 5 年历史数据训练策略,调出年化 80% 回报的模型,实盘运行 3 个月亏损 30%。最可能的根本原因是?
案例题
某分析师研究 100 家”10 倍股”的共同特征,发现它们都有”创始人是工程师出身”这一特征,建议只投工程师创业的公司。请用 MLE 视角批判这个结论。
参考答案:(1) MLE 问题:分析师在幸存者样本上找最大似然的”成功参数”,但样本被”10 倍”条件预筛选——幸存者偏差让 MLE 系统性偏极端。(2) 缺失对照:100 家 10 倍股有 80 家工程师创始人,但 1000 家失败公司可能也有 800 家工程师创始人——对照下”工程师”与”成功”无关联。MLE 只看正样本会假阳性。(3) 过拟合:100 家公司的特定特征组合有无数种可能,找出的”工程师”可能只是这 100 家的偶然特征。正确做法:贝叶斯框架,先验是”创始人背景与成功无关”,用对照数据更新。这道题揭示:从结果反推原因时,MLE 在幸存者样本上几乎必然过拟合。
反事实题
假设 MLE 在任何样本量下都无偏(不再小样本偏极端)。在这种世界中,以下哪个现象会消失?