点估计、偏差、方差、MSE 与一致性
层级:A|必学
1. 怎样评价一个参数估计规则
估计量不仅看当前数据上数值是否“合理”,还看重复抽样性质:是否系统偏、是否波动、样本增大能否接近真值、是否充分利用信息。偏差—方差权衡是正则化和模型复杂度的统计基础。
2. 偏差
估计量 的偏差:
无偏若对所有参数值
样本均值对总体均值无偏。高斯方差 MLE(分母 )对总体方差有向下偏差;分母 修正无偏。
无偏是重复抽样平均性质,不表示当前误差为零。
3. 方差
它衡量换一批数据估计值的波动。两个无偏估计量中,方差小者通常更精确,但还要看适用模型与稳健性。
参数向量用协方差矩阵描述估计不确定性。
4. MSE 分解
加减 展开:
因此有偏估计可能比无偏估计 MSE 更小。岭回归收缩参数,引入偏差但可大幅降低病态方向方差。
5. 一致性
若样本量增大:
称依概率一致。它是大样本性质,允许有限样本有偏。
例如方差 MLE 分母 有偏但一致,因为偏差随 消失。
一致性不说明有限样本好,也不提供收敛速度。
6. 渐近无偏与渐近正态
渐近无偏:
渐近正态:
后者支持标准误和置信区间。若估计量有 量级偏差,中心可能需要修正。
7. 效率
在无偏估计量类中,方差达到 Cramér–Rao 下界称有效。标量参数在正则条件下:
为 Fisher 信息。MLE 在许多正则模型下渐近有效。
正则条件、模型正确与固定维度很重要;超参数边界、混合模型和高维问题可能不满足。
8. 稳健性
估计量可能在理想模型下高效,却对少量污染极敏感。
- 均值:高斯下高效,但 breakdown point 为 0;
- 中位数:对极端值稳健,breakdown point 接近 50%;
- Huber M-estimator:中心平方、尾部线性,折衷效率与稳健。
只用偏差方差评价理想模型不够,还要检查模型错设与污染。
9. 充分性
统计量 对参数充分,若在给定 后样本条件分布不再依参数。Fisher–Neyman 因子分解:
Bernoulli 样本成功数对 充分。充分性说明为该模型估参数无需原始顺序,但不代表压缩对其他任务无损。
10. Rao–Blackwell
若 是充分统计量,对无偏估计 :
仍无偏且方差不大于 。条件期望平均掉与参数信息无关的随机性。
11. 收缩估计
把高方差估计向共同中心收缩:
偏差增加,方差乘 。多参数问题中 James–Stein 现象表明维度至少 3 时,样本均值向中心适当收缩可在总平方风险上优于逐坐标无偏均值。
这给层级 Bayesian、target encoding 平滑和多任务共享提供直觉。
12. 模型选择后的估计偏差
先在许多特征/模型中选效果最好,再报告同数据上的系数、p 值或性能,会有 selection bias。传统标准误把模型当预先指定,通常过于乐观。可用独立验证、嵌套 CV、选择后推断或完整 pipeline bootstrap。
13. 预测估计量的偏差—方差
对固定 ,训练集随机导致预测 变化:
模型越灵活通常偏差降低、方差升高,但“双下降”等现代现象说明简单单调曲线不是普适定律。
易错点
- 无偏不等于低误差或好预测。
- 一致是大样本性质,不保证小样本。
- MLE 不必有限样本无偏。
- 理想模型效率不等于污染下稳健。
- 数据驱动选择后传统不确定性会过度乐观。
常见问答
Q1:为什么机器学习允许偏差?
目标通常是最小预测风险而非无偏参数估计;适当偏差换来的方差下降可改善测试 MSE。
Q2:正则化估计一致吗?
取决于 随样本量的变化、模型和维度。固定强正则可能保留渐近偏差,衰减得当可一致。
Q3:低训练方差如何测?
用多次独立训练集/重采样或不同随机种子估计预测波动;种子波动与数据抽样波动是不同来源。
练习
- 写出 MSE 偏差—方差分解。
- 有偏但一致是否可能?举例。
- 无偏估计方差更大,MSE 能否更差?
- Rao–Blackwell 的作用是什么?
- 为什么模型选择后同数据性能乐观?
答案与提示
- 。
- 可以,如分母 的样本方差 MLE。
- 可以。
- 对充分统计量条件化,保持无偏并降低/不增方差。
- 选择专门利用了候选中的随机好波动。