机器学习数学基础 120 章

隐变量、混合模型与 EM 的统计解释

层级:B|按需

1. 观测分布可能由未观测亚群体混合

用户行为可能来自不同意图,延迟来自缓存命中/未命中,图像像素来自不同对象。隐变量 ZZ 表示未观测状态,联合模型容易描述,但边缘似然含求和/积分。

2. 隐变量模型

p(x,zθ)=p(zθ)p(xz,θ).p(x,z|\theta)=p(z|\theta)p(x|z,\theta).

只观察 xx

p(xθ)=zp(x,zθ)p(x|\theta)=\sum_zp(x,z|\theta)

或连续 zz 积分。后验

p(zx,θ)p(z|x,\theta)

推断哪个隐状态解释观测。

隐变量是模型构造,不一定对应唯一真实实体。

3. 有限混合模型

p(x)=k=1Kπkpk(xθk),p(x)=\sum_{k=1}^{K}\pi_kp_k(x|\theta_k), πk0,kπk=1.\pi_k\ge0,\quad\sum_k\pi_k=1.

生成过程:先 ZCategorical(π)Z\sim Categorical(\pi),再 XpZX\sim p_Z。边缘密度是成分密度加权和,可多峰。

4. GMM

p(x)=kπkN(xμk,Σk).p(x)=\sum_k\pi_kN(x|\mu_k,\Sigma_k).

参数量随 K,dK,d 快速增长:全协方差每类约 d(d+1)/2d(d+1)/2。小样本高维常用对角、球形、共享或低秩结构。

5. Complete vs observed likelihood

若知道 zikz_{ik} one-hot:

logp(X,Zθ)=i,kzik[logπk+logpk(xiθk)].\log p(X,Z|\theta) =\sum_{i,k}z_{ik} [\log\pi_k+\log p_k(x_i|\theta_k)].

参数更新易做。实际 ZZ 未知,observed likelihood:

ilogkπkpk(xiθk),\sum_i\log\sum_k\pi_kp_k(x_i|\theta_k),

log-sum 难直接分离。EM 用 E[zikxi]E[z_{ik}|x_i] 代替未知指示的软期望。

6. 责任度

γik=P(Zi=kxi,θ)=πkpk(xiθk)jπjpj(xiθj).\gamma_{ik}=P(Z_i=k|x_i,\theta) =\frac{\pi_kp_k(x_i|\theta_k)} {\sum_j\pi_jp_j(x_i|\theta_j)}.

γik\gamma_{ik} 是当前模型下后验,不是客观标签概率。各类密度、先验和模型错设都会影响。

数值上计算 log score

aik=logπk+logpk(xi),a_{ik}=\log\pi_k+\log p_k(x_i),

再用 LogSumExp 归一化。

7. EM 的统计意义

E 步计算完整数据充分统计量的条件期望;M 步仿佛拥有带分数计数的完整数据,最大化期望 complete log-likelihood。

对 GMM:

Nk=iγik,N_k=\sum_i\gamma_{ik}, πk=Nk/n,μk=iγikxiNk,\pi_k=N_k/n, \quad \mu_k=\frac{\sum_i\gamma_{ik}x_i}{N_k}, Σk=iγik(xiμk)(xiμk)TNk.\Sigma_k=\frac{\sum_i\gamma_{ik}(x_i-\mu_k)(x_i-\mu_k)^T}{N_k}.

8. 标签交换与不可辨识

交换两个成分编号,边缘分布完全相同,因此似然有 K!K! 个等价参数表示。Bayesian 后验会 label switching,不能直接平均未对齐的成分均值。

还有成分重叠、过多成分与参数退化造成更深不可辨识。

9. 似然奇异性

一个高斯中心对准单点、协方差行列式趋 0,密度和似然可趋无穷。因此 GMM 普通 MLE 可能不存在有限全局最大。实践:

  • covariance floor/jitter;
  • MAP/先验;
  • 限制最小簇权重;
  • tied/diagonal covariance;
  • 删除退化成分。

这不是优化器 bug,而是模型似然结构。

10. 选择成分数

  • 独立验证 log-likelihood;
  • AIC/BIC;
  • held-out predictive density;
  • Bayesian nonparametric 模型;
  • 聚类稳定性与业务可解释。

BIC 依正则渐近,而混合模型常非正则,仍常作启发式。轮廓系数等距离聚类指标与概率似然衡量不同。

11. 混合与卷积不同

混合:先随机选一个成分,密度加权相加;卷积:多个独立随机量相加。混合方差包含组内与组间;卷积方差(独立)是方差相加。

12. 硬聚类与软聚类

GMM responsibility 提供软成员;取 argmax 得硬标签但丢不确定性。k-means 可看作等球形、相同小方差 GMM 的极限;其目标不含混合权重/协方差概率解释。

13. 缺失数据

高斯模型下可把缺失分量纳入隐变量,E 步用条件高斯计算期望充分统计量。简单均值填补忽略后验不确定性;EM 仍依 MAR 等缺失机制假设。

14. 其他隐变量模型

  • factor analysis/PPCA:连续低维隐因子;
  • HMM:序列离散状态;
  • topic model:文档主题比例;
  • VAE:神经生成模型与变分后验;
  • item response:能力隐变量。

共同结构是联合模型 + 边缘化 + 后验推断。

易错点

  1. 混合成分不必对应真实类别。
  2. EM 单调不保证全局最优。
  3. GMM 似然可因协方差塌缩无界。
  4. 成分标签不可辨识。
  5. 软责任度依模型,不是无模型真相。

常见问答

Q1:GMM 能自动发现任意形状簇吗?

单成分是椭圆,多成分可逼近复杂形状,但一个业务簇可能需多个成分;成分数与簇数不必相同。

Q2:为什么多初始化?

似然非凸,有多个局部极值与退化区域;不同初始责任/中心会到不同解。

Q3:EM 何时停止?

监控观测 log-likelihood 相对变化、参数变化和最大迭代;应确保稳定计算下似然不降,并检查退化。

练习

  1. 写出有限混合密度与责任度。
  2. 为什么 complete likelihood 易优化?
  3. GMM 标签交换说明什么?
  4. 协方差塌缩为何使似然无界?
  5. 混合与卷积区别?

答案与提示

  1. 加权和与 Bayes 归一化公式。
  2. 已知成分指示后 log-likelihood 对成分分离为加权和。
  3. 参数不可辨识,有多个等价表示。
  4. 高斯归一化因子 Σ1/2|\Sigma|^{-1/2} 趋无穷,单点残差可为零。
  5. 混合随机选一个来源,卷积把多个随机量相加。