机器学习数学基础 120 章

似然函数与极大似然估计

层级:A|必学

1. 同一个公式,不同角色

p(xθ)p(x|\theta)

固定 θ\theta、变量为 xx 时是数据分布;观测 xx 固定、把它看成 θ\theta 的函数时称似然:

L(θ;x)=pθ(x).L(\theta;x)=p_\theta(x).

似然不是“参数的概率”,不要求对 θ\theta 积分为 1。

2. iid 样本似然

L(θ)=i=1np(xiθ).L(\theta)=\prod_{i=1}^{n}p(x_i|\theta).

极大似然估计:

θ^MLE=argmaxθL(θ).\hat\theta_{MLE}=\arg\max_\theta L(\theta).

乘积分解依赖给定参数后的样本独立。时间/群组依赖需写正确联合似然。

3. 对数似然

(θ)=logL(θ)=ilogp(xiθ).\ell(\theta)=\log L(\theta) =\sum_i\log p(x_i|\theta).

因 log 严格递增,最大点不变。优点:乘积变和、便于求导、避免下溢。训练常最小化负对数似然(NLL):

(θ).-\ell(\theta).

4. Bernoulli MLE

xi{0,1}x_i\in\{0,1\}

(p)=i[xilogp+(1xi)log(1p)].\ell(p)=\sum_i[x_i\log p+(1-x_i)\log(1-p)].

令成功数 k=ixik=\sum_ix_i

(p)=klogp+(nk)log(1p).\ell(p)=k\log p+(n-k)\log(1-p).

求导:

(p)=kpnk1p=0p^=k/n.\ell'(p)=\frac kp-\frac{n-k}{1-p}=0 \Rightarrow \hat p=k/n.

二阶导为负(内部),故是最大值;全成功/全失败时最优在边界。

5. 高斯 MLE

iid N(μ,σ2)N(\mu,\sigma^2)

(μ,σ2)=n2log(2π)n2logσ212σ2i(xiμ)2.\ell(\mu,\sigma^2) =-\frac n2\log(2\pi) -\frac n2\log\sigma^2 -\frac1{2\sigma^2}\sum_i(x_i-\mu)^2. μ^=xˉ,\hat\mu=\bar x, σ^2=1ni(xixˉ)2.\hat\sigma^2=\frac1n\sum_i(x_i-\bar x)^2.

方差 MLE 有偏但一致。MLE 的目标是最大似然,不是无偏性。

6. Score 与 Fisher 信息

Score:

s(θ)=θlogp(Xθ).s(\theta)=\nabla_\theta\log p(X|\theta).

在正则条件下:

Eθ[s(θ)]=0.E_\theta[s(\theta)]=0.

Fisher 信息:

I(θ)=E[s(θ)s(θ)T]=E[θ2logp(Xθ)].I(\theta)=E[s(\theta)s(\theta)^T] =-E[\nabla^2_\theta\log p(X|\theta)].

它衡量分布对参数变化的敏感度。iid nn 个样本信息相加:In=nI1I_n=nI_1,估计标准误因此常按 1/n1/\sqrt n

7. MLE 的渐近性质

在模型正确、可辨识、参数为内部点、光滑等正则条件下:

n(θ^θ0)N(0,I(θ0)1).\sqrt n(\hat\theta-\theta_0) \Rightarrow N(0,I(\theta_0)^{-1}).

MLE 通常一致、渐近正态、渐近有效。但混合模型、边界参数、支持依参数、高维和模型错设会破坏标准结论。

8. 可辨识性

若不同参数给同一分布:

pθ1=pθ2,quadθ1θ2,p_{\theta_1}=p_{\theta_2},quad\theta_1\ne\theta_2,

参数不可辨识。GMM 分量标签置换、Softmax logits 共同平移、神经网络隐藏单元置换都是例子。似然可能有多个等价最大点,Hessian 奇异。

9. 不变性

θ^\hat\theta 是 MLE,且 ϕ=g(θ)\phi=g(\theta),在适当一一/定义条件下 g(θ^)g(\hat\theta)ϕ\phi 的 MLE。比如方差 MLE 的标准差估计为 σ^2\sqrt{\hat\sigma^2}

但无偏性不在非线性变换下保持:E[g(θ^)]g(Eθ^)E[g(\hat\theta)]\ne g(E\hat\theta)

10. 似然与交叉熵

真实分布 PP、模型 qθq_\theta

EP[logqθ(X)]=H(P)+DKL(Pqθ).E_P[-\log q_\theta(X)] =H(P)+D_{KL}(P\|q_\theta).

H(P)H(P)θ\theta 无关,所以总体上最大似然等价于最小化从真实分布到模型的 KL。经验 NLL 是该期望的样本平均。

11. 似然比

比较嵌套模型:

Λ=2[(θ^full)ell(θ^restricted)].\Lambda=2[\ell(\hat\theta_{full})-ell(\hat\theta_{restricted})].

在正则条件下,Wilks 定理给其渐近 χ2\chi^2 分布,自由度为参数数差。边界、混合模型与小样本可能不适用。

12. 数值实现

  • 始终用 log-likelihood;
  • 使用 logits 与 logsumexp;
  • 正参数用 log/softplus 参数化;
  • 协方差用 Cholesky;
  • 检查梯度、边界和多个初始化;
  • 报告优化是否真正收敛;
  • 标准误用观测 Hessian、sandwich 或 bootstrap,匹配模型假设。

易错点

  1. 似然不是参数概率分布。
  2. iid 连乘必须有条件独立假设。
  3. MLE 不保证有限样本无偏。
  4. 局部数值极大不一定全局 MLE。
  5. 标准渐近理论有正则条件。

常见问答

Q1:似然可以大于 1 吗?

连续模型似然值是密度乘积,可大于 1;它不是事件概率。比较需在同一数据表示与基准测度下。

Q2:训练 NLL 降低为何测试可能变差?

MLE 优化经验分布,灵活模型会拟合抽样噪声;需要验证、正则化和容量控制。

Q3:MLE 与最小二乘何时相同?

条件误差独立同方差高斯、均值由回归模型给出且方差固定/共同估计时,参数均值部分等价。

练习

  1. 写出 iid 似然与 log-likelihood。
  2. 推导 Bernoulli MLE。
  3. 高斯方差 MLE 为什么分母为 nn
  4. 似然为何不需对参数归一化?
  5. Fisher 信息随 iid 样本数如何变化?

答案与提示

  1. 乘积与 log 后求和。
  2. 对 log-likelihood 求导置零得成功比例。
  3. 它来自最大化似然的一阶条件;无偏修正是另一目标。
  4. 数据固定后它只是参数评分函数。
  5. 线性相加为 nI1nI_1