机器学习数学基础 120 章

最大后验估计与贝叶斯估计

层级:A|必学

1. 从一个最优参数到参数不确定性

MLE 把参数视为固定未知量,选择最能解释数据的值。Bayesian 方法给参数先验,观察数据后得到后验分布;MAP 只取后验最高点,是 Bayesian 推断的点估计之一。

2. Bayes 更新

p(θD)=p(Dθ)p(θ)p(D).p(\theta|D) =\frac{p(D|\theta)p(\theta)}{p(D)}.
  • prior p(θ)p(\theta):观察当前数据前信息;
  • likelihood p(Dθ)p(D|\theta)
  • posterior p(θD)p(\theta|D)
  • evidence p(D)=p(Dθ)p(θ)dθp(D)=\int p(D|\theta)p(\theta)d\theta

后验整合了数据与先验,并可传播到预测。

3. MAP

θ^MAP=argmaxθp(θD)=argmaxθ[logp(Dθ)+logp(θ)].\hat\theta_{MAP} =\arg\max_\theta p(\theta|D) =\arg\max_\theta [\log p(D|\theta)+\log p(\theta)].

证据对 θ\theta 为常数可省略。等价最小化 NLL 加负 log prior。

  • 高斯先验 N(0,τ2I)N(0,\tau^2I) 对应 L2;
  • Laplace 先验对应 L1。

因此很多正则化目标可解释为 MAP。

4. MAP 与 MLE

MLE:

argmaxp(Dθ).\arg\max p(D|\theta).

MAP 多先验项。样本量增大、先验固定且正则时,似然 O(n)O(n) 往往压过先验 O(1)O(1),二者接近;弱可辨识、高维或强先验时仍不同。

MAP 不在非线性重参数化下保持不变,因为密度会乘 Jacobian;MLE 有相应不变性。后验分布本身正确变换不会丢失一致性。

5. 后验均值、中位数与 MAP 对应不同损失

Bayesian 决策选择使后验期望损失最小的动作:

  • 平方损失:后验均值;
  • 绝对损失:后验中位数;
  • 0-1 点损失(离散):后验众数/MAP。

连续参数的“精确点 0-1 损失”不实际,MAP 常主要作为优化方便的代表点。

6. Beta–Bernoulli

pBeta(α,β),p\sim Beta(\alpha,\beta),

观察 ss 成功、ff 失败:

pDBeta(α+s,β+f).p|D\sim Beta(\alpha+s,\beta+f).

后验均值:

E[pD]=α+sα+β+s+f.E[p|D]=\frac{\alpha+s}{\alpha+\beta+s+f}.

内部众数(参数都 >1>1):

pMAP=α+s1α+β+s+f2.p_{MAP}=\frac{\alpha+s-1} {\alpha+\beta+s+f-2}.

MLE 为 s/(s+f)s/(s+f)。三者不要混淆。

7. 后验预测

未来 xnewx_{new}

p(xnewD)=p(xnewθ)p(θD)dθ.p(x_{new}|D) =\int p(x_{new}|\theta)p(\theta|D)d\theta.

它平均参数不确定性,而 plug-in 预测只用 θ^\hat\theta

p(xnewθ^).p(x_{new}|\hat\theta).

小数据时后验预测通常更宽、更校准;大模型积分需 MCMC、变分或 Laplace 近似。

8. 可信区间

后验 95% credible interval [a,b][a,b] 可直接解释为

P(θ[a,b]D)=0.95P(\theta\in[a,b]|D)=0.95

(区间由当前数据计算后)。这与频率置信区间的重复抽样覆盖解释不同。

等尾区间与最高后验密度(HPD)区间可能不同,多峰后验用单一区间会跨越低密度区域。

9. 共轭先验

若先验与后验同一分布族,称共轭:

  • Beta–Bernoulli/Binomial;
  • Dirichlet–Categorical/Multinomial;
  • Gamma–Poisson(rate);
  • Gaussian–Gaussian。

共轭提供解析更新与直觉,但不必为了计算方便选择不合业务的先验。

10. 层级 Bayesian 与部分汇聚

多个组参数

θjp(θjϕ)\theta_j\sim p(\theta_j|\phi)

共享超参数 ϕ\phi。小样本组向总体均值收缩,大样本组更多由自身数据决定,称 partial pooling。它比完全分组(高方差)或完全合并(高偏差)更灵活。

11. 先验预测检查

在看数据拟合前:

  1. 从先验采参数;
  2. 从模型采模拟数据;
  3. 检查是否产生合理业务范围。

参数尺度看似宽松的先验,经非线性模型可能产生极端预测。先验预测比只看参数密度更直观。

12. 后验检查与敏感性

  • 多个先验强度/形状下重算;
  • posterior predictive check;
  • MCMC 收敛与有效样本量;
  • 变分近似是否低估方差;
  • 模型错设与异常值稳健性。

后验精确只是在给定模型与先验下精确,不能消除模型错设。

易错点

  1. MAP 不是完整 Bayesian 推断。
  2. 后验均值、MAP 与 MLE通常不同。
  3. MAP 依参数化密度。
  4. credible interval 与 confidence interval 解释不同。
  5. “平坦先验”不一定无信息,且可能导致不 proper 后验。

常见问答

Q1:正则化系数怎样对应先验方差?

还取决于似然是否求和/平均及噪声尺度。不能脱离目标归一化直接说 λ=1/τ2\lambda=1/\tau^2

Q2:Bayesian 方法是否不会过拟合?

仍会。错误先验、过灵活模型、近似推断和数据泄漏都可导致问题;后验平均提供一种复杂度处理而非免疫。

Q3:先验能用历史数据学习吗?

可以用层级模型或经验 Bayes,但要避免与当前数据重复计数,并传播超参数不确定性。

练习

  1. 写出 MAP 的 log 目标。
  2. 高斯先验为什么对应 L2?
  3. Beta(2,2) 先验,观察 8 成功 2 失败,后验是什么?
  4. 平方损失下 Bayesian 点估计是什么?
  5. 后验预测与 plug-in 预测差别?

答案与提示

  1. logp(Dθ)+logp(θ)\log p(D|\theta)+\log p(\theta)
  2. 负 log 高斯密度含 θ2/(2τ2)\|\theta\|^2/(2\tau^2)
  3. Beta(10,4)。
  4. 后验均值。
  5. 前者对参数后验积分,后者固定一个估计值。