Learning
VOL. XXIV · NO. 04 · Statistics · 01 JAN 1970

Resampling

统计推断思维 · 01 JAN 1970 · 6 min read · 1,442 words
· · ·

0004 · 重抽样方法:不假设分布的推断

核心概念定义

重抽样方法(Resampling Methods)通过反复从数据本身抽取样本来估计统计量的分布,不依赖任何分布假设。这是统计学的”无理论推断”——让数据自己说话。

三大方法

Bootstrap(自助法)

从原始数据中有放回抽样,每次抽出和原数据等量的样本,计算统计量。重复 1000-10000 次,得到统计量的经验分布。用它估计均值、中位数、回归系数的置信区间,无需假设正态分布

直觉:原始数据是总体的最佳估计,有放回抽样模拟”如果从总体再抽一次”的过程。

交叉验证(Cross-Validation)

把数据分训练集和验证集,在训练集上拟合模型,在验证集上评估。k 折交叉验证把数据分 k 份,轮流用 k-1 份训练、1 份验证,取 k 次评估的平均。

直觉:模型在训练集上的表现不可信(可能过拟合),只有在”没见过的数据”上的表现才有意义。

置换检验(Permutation Test)

零假设是”两组无差异”。把两组数据合并打乱,随机分成两组,计算差异。重复 10000 次,看原始差异在打乱分布中的位置——如果极端(前 5%),拒绝零假设。

直觉:如果两组真的无差异,那么标签怎么贴都无所谓;如果贴标签显著影响差异,说明真有差异。零分布来自数据本身,不假设正态

学科直觉

重抽样的核心直觉是:不假设分布反而更鲁棒——因为假设错了比不假设更危险。

三个直觉

  1. 数据自带分布信息:与其假设”数据来自正态分布”,不如让数据自己展示分布。Bootstrap 用经验分布替代理论分布,适用面更广。
  2. 过拟合检验靠”没见过的数据”:模型在训练集上的拟合度是上限,不是真实表现。交叉验证用”未见数据”测泛化能力——这是防范过拟合的标准工具。
  3. 零分布可以构造:传统检验假设零分布(如 t 分布),但实际数据常不满足假设。置换检验自己构造零分布,无需假设——更稳健,尤其小样本。

跨学科应用

量化投资:回测中的交叉验证

回测在历史数据上调参,等于在训练集上拟合——必然高估实盘表现。正确做法是样本外测试:用 2010-2020 训练,用 2021-2023 验证。如果策略在样本外失效,说明过拟合。没有样本外验证的回测结果不可信

机器学习:泛化能力评估

模型选择(线性 vs 树 vs 神经网络)必须基于交叉验证,而非训练集精度。复杂模型训练集精度高,但交叉验证精度可能更低——这是过拟合的信号。K 折交叉验证是 ML 标配,因为它诚实地报告泛化能力。

小样本推断:分布未知的利器

传统检验(t 检验、卡方)假设特定分布,小样本 + 非正态数据下失效。置换检验不假设分布,只要样本代表总体,结论就稳健。在医学罕见病、商业 A/B 测试小流量场景下,重抽样是利器。

决策:自举你的判断分布

面临不确定决策时,与其给单点估计(“我预计营收 1 亿”),不如给区间估计。Bootstrap 思维:用历史相似项目的数据,自举营收分布,得出”95% 概率落在 7000 万到 1.3 亿”。区间比点估计诚实——它承认不确定性。

练习题

单选题

1

某量化策略回测显示 2015-2023 年化回报 25%,团队据此募资。最关键的验证缺失是?

案例题

某产品经理用 A/B 测试新功能,实验组 200 人转化率 5%,对照组 200 人转化率 3%。统计软件报告”p=0.08,不显著”。PM 想上线新功能但担心判断错误。请用重抽样方法给出更稳健的判断。

参考答案:(1) 传统 t 检验假设转化率近似正态,但小样本 + 二项分布(转化/不转化)下假设可能失效。(2) 置换检验:把两组 400 人合并,随机分成 200+200,计算转化率差异,重复 10000 次,看”原始 2% 差异”在随机分布中的位置。如果排在前 5%,说明差异不太可能是随机产生的——即使 t 检验 p=0.08。(3) Bootstrap:分别对实验组和对照组的转化率做 bootstrap,估计两组转化率的 95% 置信区间,看是否重叠。(4) 决策建议:重抽样可能给出更细的 p 值,但 2% 差异 + 200 人样本本身统计功效低——如果上线成本低,可接受不确定性上线并持续观察;如果上线成本高,应先扩大样本量。这道题揭示:小样本下重抽样比传统检验更稳健,但仍受样本量限制。

反事实题

1

假设交叉验证不存在——你只能用全部数据训练模型,用同一批数据评估。在这种世界中,以下哪个问题最严重?