经验风险、期望风险与泛化
层级:B|建议先修:05-09、06-10、06-12
机器学习不是要记住训练样本,而是要在同一数据机制产生的新样本上表现良好。学习理论用期望风险、经验风险和泛化误差来表达这一区别。
1. 数据、假设与损失
设输入标签对 服从未知分布 。训练集
通常假设独立同分布。假设或模型记为 ,损失为 。
常见损失包括 0-1 损失、平方损失、绝对损失和交叉熵。
2. 期望风险
期望风险又称真实风险或总体风险:
它描述模型面对未来同分布样本时的平均损失,是我们真正关心的目标。但 未知,所以无法直接精确计算。
3. 经验风险
训练集上的平均损失为
对一个固定且不依赖训练集选择的 ,经验风险是期望风险的样本均值;大数定律说明样本足够多时它趋近于真实风险。
4. 经验风险最小化
经验风险最小化(ERM)选择
训练大多数模型都可视为 ERM 或其正则化版本。关键困难是: 正是用同一训练集挑出来的,因此不能简单把固定模型的大数定律直接套在 上。
5. 泛化差距
模型 的泛化差距可写为
训练损失很低但真实损失很高是过拟合。为了保证训练后选出的模型也可靠,通常需要控制整个假设空间的统一偏差:
若这个上界小,则不论算法从 中选出哪个模型,训练表现都能代表真实表现。
6. 有限假设类的基本界
若损失在 内,对固定 ,Hoeffding 不等式给出
若 ,对所有假设使用并集界:
令右侧不超过 ,可得以至少 的概率,
这展示了三件事:样本量增大使界缩小;假设空间越大越难泛化;更高置信度需要付出 代价。
7. ERM 的超额风险分解
令类内最优假设
则 ERM 解 满足
证明思路是加入并减去两个经验风险,并用 。因此统一收敛直接控制 ERM 的估计误差。
8. 逼近误差与估计误差
相对所有可能预测函数的 Bayes 最优风险,模型误差可粗分为:
- 逼近误差:假设空间太受限,连类内最优模型也无法表达真实规律;
- 估计误差:样本有限,选出的模型没有达到类内真实最优;
- 优化误差:算法未把训练目标优化到足够好。
扩大模型类通常降低逼近误差,却可能提高估计和优化难度,这就是复杂度折中。
9. 正则化经验风险
结构风险最小化常写为
其中 衡量复杂度。正则化不只是防止参数数值过大,也是在偏好更小的有效假设集合,从而改善泛化。
模型选择、早停、数据增强和先验约束也可形成隐式或显式正则化。
10. 训练、验证与测试
- 训练集用于拟合参数;
- 验证集用于选超参数和模型;
- 测试集只用于最终一次无偏近似评估。
反复查看测试结果并据此调参,会让测试集也参与模型选择,使报告出现乐观偏差。
11. 分布偏移
经典泛化分析通常假设训练和测试来自同一分布。若出现协变量偏移、标签偏移、概念漂移或选择偏差,即使训练集很大,经验风险也未必估计目标环境风险。此时需要重新定义目标分布并采用重加权、领域适配或在线监测等方法。
12. 易错点
- 泛化好不等于训练误差一定高;过参数化模型也可能借助隐式偏置泛化。
- 参数数量不是复杂度的唯一衡量,还与范数、间隔、算法稳定性和数据结构有关。
- 理论上界常较松,但能揭示依赖关系和设计原则。
- i.i.d. 假设在时间序列、用户重复样本和图数据中常被破坏。
常见问答
Q1:为什么固定模型的测试表现可信,训练后挑出的模型却要更谨慎?
选择过程会偏好在训练样本上偶然表现好的模型,产生选择偏差;需要统一控制或独立验证数据。
Q2:训练误差和测试误差接近就一定好吗?
不一定。二者都很高说明欠拟合;泛化差距小只说明二者接近。
Q3:数据越多是否一定不会过拟合?
更多独立同分布数据通常有帮助,但数据泄漏、分布偏移、错误标签和持续调参仍可导致错误结论。
Q4:正则化参数越大越好吗?
不是。过强正则化会增大逼近偏差,应通过独立验证或理论依据选择。
练习
- 写出期望风险和经验风险的区别。
- 用有限假设类界说明 增大时所需样本量如何变化。
- 推导 ERM 超额风险不超过两倍统一偏差的结论。
- 举例说明反复使用测试集为何会造成泄漏。
答案与提示
- 前者是未知总体分布下的期望,后者是有限训练样本上的平均。
- 为保持 不变,样本量至少按 增长。
- 插入 和 ,中间项因 ERM 不大于 0,其余两项各由统一偏差控制。
- 每轮根据测试结果选模型,相当于把测试信息反馈进训练流程,最终模型对该测试集也发生适配。