机器学习数学基础 120 章

多元高斯与协方差矩阵

层级:B|按需

1. 多维不确定性的基本模型

多元高斯用均值向量与协方差矩阵描述位置、各方向尺度和线性依赖。LDA/QDA、GMM、高斯过程、Kalman filter 与概率图模型都大量使用它。

2. 定义与密度

XN(μ,Σ),X\sim\mathcal N(\mu,\Sigma),

X,μRdX,\mu\in\mathbb R^dΣRd×d\Sigma\in\mathbb R^{d\times d} 对称正定时密度为

p(x)=1(2π)d/2Σ1/2exp[12(xμ)TΣ1(xμ)].p(x)=\frac1{(2\pi)^{d/2}|\Sigma|^{1/2}} \exp\left[-\frac12(x-\mu)^T \Sigma^{-1}(x-\mu)\right].

Σ\Sigma 仅半正定,分布可定义但退化在低维子空间上,对整个 Rd\mathbb R^d 没有普通密度。

3. Mahalanobis 距离

指数中的

DM2=(xμ)TΣ1(xμ)D_M^2=(x-\mu)^T\Sigma^{-1}(x-\mu)

是平方 Mahalanobis 距离。它按方差与相关性缩放:高方差方向同样位移较不异常,相关特征不会简单重复计数。

等密度面满足 DM2=cD_M^2=c,是以协方差特征向量为主轴的椭球。

4. 谱几何

Σ=QΛQT.\Sigma=Q\Lambda Q^T.

在旋转坐标 z=QT(xμ)z=Q^T(x-\mu) 下:

DM2=izi2λi.D_M^2=\sum_i\frac{z_i^2}{\lambda_i}.

λi\sqrt{\lambda_i} 决定椭球各主轴标准差。行列式

Σ=iλi|\Sigma|=\prod_i\lambda_i

控制总体积尺度。

5. 线性变换定义

ZN(0,I)Z\sim N(0,I),取 AA 使 AAT=ΣAA^T=\Sigma

X=μ+AZX=\mu+AZ

XN(μ,Σ)X\sim N(\mu,\Sigma)。可用 Cholesky A=LA=L 采样。

更一般:

Y=BX+cN(Bμ+c,BΣBT).Y=BX+c \sim N(B\mu+c,B\Sigma B^T).

因此任意线性组合 aTXa^TX 都是一元高斯。这也可作为多元高斯定义。

6. 边缘分布

把向量分块:

X=[XaXb],μ=[μaμb],Σ=[ΣaaΣabΣbaΣbb].X=\begin{bmatrix}X_a\\X_b\end{bmatrix}, \quad \mu=\begin{bmatrix}\mu_a\\\mu_b\end{bmatrix}, \quad \Sigma=\begin{bmatrix} \Sigma_{aa}&\Sigma_{ab}\\ \Sigma_{ba}&\Sigma_{bb} \end{bmatrix}.

XaN(μa,Σaa).X_a\sim N(\mu_a,\Sigma_{aa}).

高斯边缘只需取相应均值分量与协方差子矩阵,无需积分计算。

7. 条件高斯

给定 Xb=xbX_b=x_b

XaXb=xbN(μab,Σab),X_a|X_b=x_b \sim N(\mu_{a|b},\Sigma_{a|b}), μab=μa+ΣabΣbb1(xbμb),\mu_{a|b} =\mu_a+\Sigma_{ab}\Sigma_{bb}^{-1}(x_b-\mu_b), Σab=ΣaaΣabΣbb1Σba.\Sigma_{a|b} =\Sigma_{aa}-\Sigma_{ab} \Sigma_{bb}^{-1}\Sigma_{ba}.

条件均值对已知变量线性调整,条件协方差不依具体 xbx_b 且不大于边缘协方差。实现用线性求解,不显式求逆。

8. 零协方差与独立

多元联合高斯中,若 Σab=0\Sigma_{ab}=0,则 Xa,XbX_a,X_b 独立。对一般分布不成立。

精度矩阵

Λ=Σ1\Lambda=\Sigma^{-1}

的零非对角块对应给定其他变量后的条件独立,这是高斯图模型的基础。

9. LDA 与 QDA

生成分类:

XY=kN(μk,Σk).X|Y=k\sim N(\mu_k,\Sigma_k).
  • 若各类共享 Σ\Sigma,log posterior 差中的二次项抵消,决策边界线性(LDA);
  • 若各类协方差不同,保留二次项,边界二次(QDA)。

QDA 参数更多,小样本高维时协方差估计不稳定。

10. 协方差估计与正则化

样本协方差

S=1n1XcTXcS=\frac1{n-1}X_c^TX_c

dnd\ge n 时奇异。常用:

  • 对角协方差;
  • 共享协方差;
  • shrinkage Σ^=(1α)S+ατI\hat\Sigma=(1-\alpha)S+\alpha\tau I
  • 因子/低秩加对角;
  • 稀疏精度矩阵(graphical lasso)。

结构假设以偏差换方差和计算稳定。

11. 对数密度的稳定计算

不要计算 Σ1\Sigma^{-1}Σ|\Sigma|

  1. Cholesky Σ=LLT\Sigma=LL^T
  2. Lz=xμLz=x-\mu,二次型为 z2\|z\|^2
  3. logΣ=2ilogLii\log|\Sigma|=2\sum_i\log L_{ii}

若 Cholesky 失败,检查对称性、尺度、重复特征和正定性,再考虑小 jitter。

12. 高维现象

标准高斯中 X2χd2\|X\|^2\sim\chi_d^2,质量并不集中在均值点 0,而集中在半径约 d\sqrt d 的薄壳。密度最高点与“典型样本”不同,这是高维概率的重要直觉。

易错点

  1. 协方差必须对称 PSD;普通密度要求 PD。
  2. 每个边缘都高斯不一定联合高斯。
  3. 一般分布中零协方差不保证独立。
  4. 实现不要显式求协方差逆和行列式。
  5. 高斯密度最大点不一定是高维典型集合所在位置。

常见问答

Q1:为什么协方差条件数会影响分类?

Mahalanobis 距离要除以小特征值,估计误差被放大,决策边界对噪声敏感。

Q2:Naive Bayes 与对角高斯有何关系?

给定类别特征条件独立且各特征高斯,对应每类对角协方差;若方差结构再共享,可进一步简化。

Q3:多元高斯能表示多峰吗?

单个不能,它是单峰椭圆。GMM 用多个高斯加权可表示多峰与更复杂形状。

练习

  1. XN(μ,Σ)X\sim N(\mu,\Sigma),求 aTX+ba^TX+b 分布。
  2. 协方差特征值为 9、1,椭球主轴标准差比是多少?
  3. 为什么 dnd\ge n 时样本协方差奇异?
  4. 写出条件高斯均值公式。
  5. LDA 边界为何线性?

答案与提示

  1. N(aTμ+b,aTΣa)N(a^T\mu+b,a^T\Sigma a)
  2. 3:13:1
  3. 中心化数据秩至多 n1n-1SS 秩也不超过它。
  4. μa+ΣabΣbb1(xbμb)\mu_a+\Sigma_{ab}\Sigma_{bb}^{-1}(x_b-\mu_b)
  5. 各类共享协方差,log 密度的共同二次项比较时抵消,只剩关于 xx 的线性项。