最小二乘与正规方程
层级:A|必学
1. 最小二乘是机器学习的原型问题
它把线性代数、几何投影、概率高斯噪声和凸优化连接起来。即使实际模型更复杂,理解最小二乘也能帮助你理解损失、闭式解、正则化、条件数和残差诊断。
2. 模型与矩阵形式
每行一个样本:
yi=wTxi+b+ϵi.
可把一列 1 加到设计矩阵并把 b 合入参数。记
y=Xβ+ϵ,
X∈Rn×p,β∈Rp。最小二乘求
β^=argβmin21∥Xβ−y∥22.
1/2 只为简化导数。
3. 梯度推导
L(β)=21(Xβ−y)T(Xβ−y).
梯度:
∇βL=XT(Xβ−y).
令其为零:
XTXβ^=XTy.
这就是正规方程。Hessian 为
∇2L=XTX⪰0,
所以目标凸,任何解都是全局最优。
4. 闭式解的条件
若 X 满列秩,XTX≻0 可逆:
β^=(XTX)−1XTy.
若不满列秩,参数解不唯一,但最优预测 Xβ^ 仍唯一;伪逆给最小范数解:
β^=X+y.
实现不要显式求逆,应调用 QR/SVD 的 lstsq 或稳定求解器。
5. 几何投影
Xβ 永远在 X 的列空间。最小二乘从列空间中找离 y 最近的点:
y^=Xβ^=PXy.
残差
r=y−y^
与列空间正交:
XTr=0.
这正是正规方程的另一写法。若设计矩阵包含全一截距列,则 1Tr=0,残差和为零。
6. 一元线性回归
含截距模型 yi=wxi+b+ϵi:
w^=∑i(xi−xˉ)2∑i(xi−xˉ)(yi−yˉ),
b^=yˉ−w^xˉ.
斜率是样本协方差与 x 样本方差的比。若所有 xi 相同,分母为 0,无法识别斜率。
7. 高斯噪声与极大似然
假设
ϵi∼iidN(0,σ2).
则
p(y∣X,β)∝exp(−2σ21∥y−Xβ∥22).
最大化似然等价于最小化平方误差。平方损失隐含了关于噪声的统计假设,不只是计算方便。
8. 岭回归
βmin21∥Xβ−y∥2+2λ∥β∥2.
正规方程:
(XTX+λI)β^=XTy.
λ>0 使矩阵正定、解唯一,并收缩病态方向。通常不惩罚截距,因此合并截距时正则化矩阵对应位置应为 0。
9. 加权最小二乘
不同样本噪声方差不同时,可设正权重:
βmin21(y−Xβ)TW(y−Xβ),
W 常为对角矩阵。正规方程:
XTWXβ^=XTWy.
若权重与逆噪声方差成正比,来自异方差高斯似然。
10. 数值问题
形成 XTX 会把 2-范数条件数平方:
κ(XTX)=κ(X)2.
因此:
- 中等满秩问题用 QR;
- 秩亏或病态用 SVD;
- 大规模稀疏问题用迭代最小二乘;
- 特征缩放和岭正则化改善条件。
11. 残差与建模假设
残差图可检查:
- 非线性结构;
- 方差随预测变化(异方差);
- 异常点;
- 时间/群组相关。
最小二乘总能输出一个代数解,但统计解释需要噪声均值、独立性、方差等条件。预测与因果解释又是不同目标。
易错点
- 闭式公式不表示代码要显式求逆。
- X 不满列秩时参数不唯一,预测可仍唯一。
- 正规方程数值上可能比 QR/SVD 差。
- 高斯噪声假设对应平方损失;重尾噪声可能更适合鲁棒损失。
- 默认惩罚截距会依赖标签基线,不一定合理。
常见问答
Q1:为什么叫“最小二乘”?
“二乘”是旧译,指残差的平方;目标是让平方和最小。
Q2:R² 高是否模型就好?
不一定。它可能来自泄漏、过拟合或非独立数据,也不保证因果、校准和部署分布性能。
Q3:绝对误差为什么没有相同闭式解?
L1 目标分段线性且在零不可微;一维位置最优是中位数,多元回归通常用线性规划、次梯度或专用方法。
练习
- 推导 ∇β21∥Xβ−y∥2。
- 为什么正规方程表示残差与每列特征正交?
- X 不满列秩时为什么参数不唯一?
- 岭回归如何改变 XTX 的特征值?
- 高斯噪声下负对数似然为何得到平方误差?
答案与提示
- XT(Xβ−y)。
- 置梯度为零即 XT(Xβ−y)=0。
- 存在非零 v 使 Xv=0,若 β 是解,则 β+cv 预测相同。
- 每个特征值增加 λ。
- 高斯指数项为残差平方除以 2σ2,其余项与 β 无关。