最大后验估计与贝叶斯估计
层级:A|必学
1. 从一个最优参数到参数不确定性
MLE 把参数视为固定未知量,选择最能解释数据的值。Bayesian 方法给参数先验,观察数据后得到后验分布;MAP 只取后验最高点,是 Bayesian 推断的点估计之一。
2. Bayes 更新
- prior :观察当前数据前信息;
- likelihood ;
- posterior ;
- evidence 。
后验整合了数据与先验,并可传播到预测。
3. MAP
证据对 为常数可省略。等价最小化 NLL 加负 log prior。
- 高斯先验 对应 L2;
- Laplace 先验对应 L1。
因此很多正则化目标可解释为 MAP。
4. MAP 与 MLE
MLE:
MAP 多先验项。样本量增大、先验固定且正则时,似然 往往压过先验 ,二者接近;弱可辨识、高维或强先验时仍不同。
MAP 不在非线性重参数化下保持不变,因为密度会乘 Jacobian;MLE 有相应不变性。后验分布本身正确变换不会丢失一致性。
5. 后验均值、中位数与 MAP 对应不同损失
Bayesian 决策选择使后验期望损失最小的动作:
- 平方损失:后验均值;
- 绝对损失:后验中位数;
- 0-1 点损失(离散):后验众数/MAP。
连续参数的“精确点 0-1 损失”不实际,MAP 常主要作为优化方便的代表点。
6. Beta–Bernoulli
观察 成功、 失败:
后验均值:
内部众数(参数都 ):
MLE 为 。三者不要混淆。
7. 后验预测
未来 :
它平均参数不确定性,而 plug-in 预测只用 :
小数据时后验预测通常更宽、更校准;大模型积分需 MCMC、变分或 Laplace 近似。
8. 可信区间
后验 95% credible interval 可直接解释为
(区间由当前数据计算后)。这与频率置信区间的重复抽样覆盖解释不同。
等尾区间与最高后验密度(HPD)区间可能不同,多峰后验用单一区间会跨越低密度区域。
9. 共轭先验
若先验与后验同一分布族,称共轭:
- Beta–Bernoulli/Binomial;
- Dirichlet–Categorical/Multinomial;
- Gamma–Poisson(rate);
- Gaussian–Gaussian。
共轭提供解析更新与直觉,但不必为了计算方便选择不合业务的先验。
10. 层级 Bayesian 与部分汇聚
多个组参数
共享超参数 。小样本组向总体均值收缩,大样本组更多由自身数据决定,称 partial pooling。它比完全分组(高方差)或完全合并(高偏差)更灵活。
11. 先验预测检查
在看数据拟合前:
- 从先验采参数;
- 从模型采模拟数据;
- 检查是否产生合理业务范围。
参数尺度看似宽松的先验,经非线性模型可能产生极端预测。先验预测比只看参数密度更直观。
12. 后验检查与敏感性
- 多个先验强度/形状下重算;
- posterior predictive check;
- MCMC 收敛与有效样本量;
- 变分近似是否低估方差;
- 模型错设与异常值稳健性。
后验精确只是在给定模型与先验下精确,不能消除模型错设。
易错点
- MAP 不是完整 Bayesian 推断。
- 后验均值、MAP 与 MLE通常不同。
- MAP 依参数化密度。
- credible interval 与 confidence interval 解释不同。
- “平坦先验”不一定无信息,且可能导致不 proper 后验。
常见问答
Q1:正则化系数怎样对应先验方差?
还取决于似然是否求和/平均及噪声尺度。不能脱离目标归一化直接说 。
Q2:Bayesian 方法是否不会过拟合?
仍会。错误先验、过灵活模型、近似推断和数据泄漏都可导致问题;后验平均提供一种复杂度处理而非免疫。
Q3:先验能用历史数据学习吗?
可以用层级模型或经验 Bayes,但要避免与当前数据重复计数,并传播超参数不确定性。
练习
- 写出 MAP 的 log 目标。
- 高斯先验为什么对应 L2?
- Beta(2,2) 先验,观察 8 成功 2 失败,后验是什么?
- 平方损失下 Bayesian 点估计是什么?
- 后验预测与 plug-in 预测差别?
答案与提示
- 。
- 负 log 高斯密度含 。
- Beta(10,4)。
- 后验均值。
- 前者对参数后验积分,后者固定一个估计值。