L1/L2 正则化、稀疏性与几何解释
层级:A|必学
1. 正则化在表达什么
训练损失只关心拟合样本。正则化加入对参数或函数结构的偏好,在多解、噪声和有限数据下选择更稳定的模型。它可改善泛化、可辨识性和数值条件,但不保证任何任务都更好。
2. 两种常见目标
L2(ridge/weight decay 相关):
L1(Lasso):
越大,正则偏好越强。特征未缩放时,同一个 对不同单位的系数不公平。
3. 惩罚形式与约束形式
常与
对应:对合适的 可能有相同解。 是惩罚价格, 是预算。映射依数据与问题,不应把数值直接互换。
4. L2 的作用
梯度为 ,持续把权重拉向零,但在光滑损失下通常不会让其精确等于零。岭回归闭式解:
若 ,每个奇异方向的最小二乘系数被因子
收缩。数据支持弱的小奇异方向收缩更多。
5. L1 为何产生稀疏
L1 在 0 有尖角,次梯度为区间 。最优条件可让一个范围内的损失梯度被该区间抵消,从而 。
二维几何:损失椭圆向外扩张,首次接触 L1 菱形约束往往发生在坐标轴尖角;接触点某坐标为零。L2 圆边界光滑,接触点一般不在轴上。
6. 一维软阈值
考虑
解为
- :减去 ;
- :加上 ;
- :直接变为 0。
这清楚展示 L1 的稀疏阈值机制。
7. Elastic Net
它结合稀疏与稳定收缩。高度相关特征中,纯 Lasso 可能任意选一个、路径不稳定;Elastic Net 更倾向成组保留,同时 L2 项改善强凸性。
8. Bayesian 解释
MAP 估计中:
- 高斯先验 对应 L2 惩罚;
- Laplace 先验 对应 L1 惩罚。
这是目标函数层面的对应。MAP 单点估计不等同完整 Bayesian 后验;“L2 就是高斯先验”还需匹配尺度与似然。
9. 正则化与特征缩放
若把特征 放大 倍,为保持预测,对应 缩小 倍,正则代价随之改变。故 L1/L2 回归通常先标准化数值特征,并把变换保存到部署 pipeline。
one-hot 与连续特征是否用同样尺度、组特征是否整体惩罚,需要业务判断。
10. 截距与归一化参数
截距通常不正则,因为它表示整体基线,且惩罚会使结果依赖标签平移。神经网络中偏置、BatchNorm/LayerNorm 的 scale/bias 常从 weight decay 中排除,但不是绝对规则。
11. L1 不等于可靠特征选择
Lasso 得到零系数不自动证明特征无因果/业务价值:
- 高相关特征会互相替代;
- 选择随样本波动;
- 非线性与交互可能被线性模型漏掉;
- 标准化和 改变选择;
- 数据泄漏会让虚假特征被选中。
应通过稳定性选择、重采样、领域知识和独立验证确认。
12. 其他正则化
- Group Lasso:整组参数一起进入/退出;
- 核范数:鼓励矩阵低秩;
- total variation:鼓励分段平滑;
- dropout、数据增强、早停:具有隐式/显式正则效果;
- 图 Laplacian 正则:鼓励相邻节点预测平滑。
正则化应匹配希望的结构,而不是默认只选 L2。
易错点
- L2 通常收缩但不产生精确稀疏。
- 特征不标准化会让正则惩罚不可比。
- Adam 中 L2 梯度与解耦 weight decay 不等价。
- 稀疏系数不等于真实特征不重要。
- 应只用训练/验证流程选择,不能看测试集调参。
常见问答
Q1:正则化越强泛化越好吗?
不是。过强会欠拟合。验证性能通常呈折衷,需要在无泄漏验证集上选择。
Q2:为什么岭回归能解决共线性?
它给 所有特征值加 ,使解唯一并降低小特征值方向的噪声放大。
Q3:Lasso 特征数是否不超过样本数?
在一般位置和标准线性 Lasso 条件下常有类似性质,但退化、实现与推广模型会有例外,不应当无条件定律使用。
练习
- 一维软阈值中 的解是什么?
- 呢?
- 为什么 L2 改善条件数?
- 解释 L1 球尖角与稀疏的关系。
- 为什么标准化应在训练折内拟合?
答案与提示
- 2。
- 0。
- 特征值从 变为 ,最小值抬升。
- 损失等高线更易在坐标轴尖角接触约束边界,对应零坐标。
- 用全数据均值/方差会把验证信息泄漏进训练。