机器学习数学基础 120 章

条件期望、全期望与全方差公式

层级:B|按需

1. 在已知信息下重新取平均

条件期望 E[XY]E[X|Y] 是给定 YY 信息后对 XX 的最佳均方预测。它不仅是一个数,而通常是 YY 的函数。回归函数、缺失值估计、偏差—方差与层级模型都依赖它。

2. 给定具体值的条件期望

离散:

E[XY=y]=xx,p(xy).E[X|Y=y]=\sum_xx,p(x|y).

连续:

E[XY=y]=x,p(xy)dx.E[X|Y=y]=\int x,p(x|y)dx.

对每个 yy 得到一个数,合成函数

m(y)=E[XY=y].m(y)=E[X|Y=y].

代入随机变量 YYm(Y)=E[XY]m(Y)=E[X|Y],本身仍是随机变量。

3. 条件期望的性质

E[aX+bZY]=aE[XY]+bE[ZY].E[aX+bZ|Y] =aE[X|Y]+bE[Z|Y].

g(Y)g(Y) 只依赖已知条件:

E[g(Y)XY]=g(Y)E[XY].E[g(Y)X|Y]=g(Y)E[X|Y].

XXYY 独立:

E[XY]=E[X].E[X|Y]=E[X].

条件期望保留已知变量函数不变:E[g(Y)Y]=g(Y)E[g(Y)|Y]=g(Y)

4. 全期望公式(塔式法则)

E[E[XY]]=E[X].E[E[X|Y]]=E[X].

离散证明:

yE[XY=y]p(y)=yxx,p(xy)p(y)=xx,p(x).\sum_yE[X|Y=y]p(y) =\sum_y\sum_xx,p(x|y)p(y) =\sum_xx,p(x).

更一般,若信息层级 GH\mathcal G\subseteq\mathcal H

E[E[XH]G]=E[XG].E[E[X|\mathcal H]|\mathcal G] =E[X|\mathcal G].

先用更多信息预测,再忘掉一部分,等于直接只用较少信息预测。

5. 回归函数

平方损失下,对固定 xx 选择预测 aa

E[(Ya)2X=x].E[(Y-a)^2|X=x].

分解:

E[(Ya)2X]=Var(YX)+(E[YX]a)2.E[(Y-a)^2|X] =Var(Y|X)+(E[Y|X]-a)^2.

第一项与 aa 无关,所以最优

f(x)=E[YX=x].f^*(x)=E[Y|X=x].

绝对损失下最优是条件中位数;0-1 分类下最优是后验概率最大的类别。

6. 条件方差

Var(XY)=E[(XE[XY])2Y].Var(X|Y) =E[(X-E[X|Y])^2|Y].

它也是 YY 的函数,描述给定信息后仍剩多少不确定性。异方差回归中,Var(YX=x)Var(Y|X=x)xx 改变。

7. 全方差公式

Var(X)=E[Var(XY)]+Var(E[XY]).Var(X) =E[Var(X|Y)] +Var(E[X|Y]).

解释:

  • 组内平均方差:给定 YY 后仍有的随机性;
  • 组间方差:不同 YY 条件均值的变化。

总不确定性 = 平均不可解释不确定性 + 被 YY 解释的均值变化。

8. 推导全方差

利用 Var(X)=E[X2]E[X]2Var(X)=E[X^2]-E[X]^2

E[Var(XY)]=E[E[X2Y]E[XY]2]=E[X2]E[E[XY]2],E[Var(X|Y)] =E[E[X^2|Y]-E[X|Y]^2] =E[X^2]-E[E[X|Y]^2], Var(E[XY])=E[E[XY]2]E[X]2.Var(E[X|Y]) =E[E[X|Y]^2]-E[X]^2.

相加中间项抵消。

9. 混合模型例子

类别 ZZXZ=kX|Z=k 均值 μk\mu_k、方差 σk2\sigma_k^2,权重 πk\pi_k

E[X]=kπkμk,E[X]=\sum_k\pi_k\mu_k, Var(X)=kπkσk2+kπk(μkE[X])2.Var(X)=\sum_k\pi_k\sigma_k^2 +\sum_k\pi_k(\mu_k-E[X])^2.

混合分布方差不仅是各分量方差加权平均,还包含分量均值之间的差异。

10. Rao–Blackwell 直觉

对某估计量 TT,用充分信息 SS 条件化:

T=E[TS].T^*=E[T|S].

在合适条件下,保持期望不变且方差不增。条件期望通过“平均掉无关随机性”得到更稳定估计,是 Rao–Blackwell 定理的核心。

11. 缺失值预测

平方误差下用 E[XmissXobs]E[X_{miss}|X_{obs}] 是最优点预测,但直接填条件均值会低估不确定性、破坏变量关系。多重插补从条件分布采样多份数据,传播缺失不确定性。

12. 条件期望与信息

加入更多信息通常不能增加最小均方预测误差。若 GH\mathcal G\subseteq\mathcal H

E[(XE[XH])2]E[(XE[XG])2].E[(X-E[X|\mathcal H])^2] \le E[(X-E[X|\mathcal G])^2].

但有限数据估计更复杂函数会增加估计误差,所以实际模型添加特征仍可能过拟合。

易错点

  1. E[XY]E[X|Y] 通常是随机变量,不是固定常数。
  2. 全期望是对条件期望再按 YY 分布平均。
  3. 总方差不能只平均条件方差,还要加条件均值方差。
  4. 平方损失最优是条件均值,其他损失可能不同。
  5. 条件均值填补会低估方差。

常见问答

Q1:给更多特征为什么理论误差不增,实际却可能变差?

Bayes 最优在真实分布已知时不增;有限样本估计会增加方差、优化与分布偏移风险。

Q2:E[XY]=E[X]E[X|Y]=E[X] 是否说明独立?

不一定,只说明条件均值不变,分布高阶形态仍可能依赖 YY。独立要求整个条件分布不变。

Q3:全方差与 ANOVA 有何关系?

都是把总变异分解为组内与组间部分;样本 ANOVA 是相应有限样本平方和分解。

练习

  1. 写出离散条件期望公式。
  2. 证明全期望公式。
  3. 混合两类权重各 1/2,均值 -1、1,类内方差均 2,求总方差。
  4. 平方损失为何选择条件均值?
  5. X,YX,Y 独立,E[XY]E[X|Y] 是什么?

答案与提示

  1. xxp(xy)\sum_xx p(x|y)
  2. 展开联合概率并交换求和。
  3. 组内 2,组间 1,总 3。
  4. 分解为条件方差加 (E[YX]a)2(E[Y|X]-a)^2
  5. E[X]E[X]