数学期望与期望的运算
层级:A|必学
1. 期望是概率加权的长期平均
机器学习中的风险、均方误差、交叉熵、偏差—方差和 Monte Carlo 估计都以期望为中心。期望不是“最可能值”,也不一定是一个可能取到的值;它是分布整体的加权中心。
2. 离散期望
若 X 取值 x,PMF 为 p(x):
E[X]=x∑x,p(x),
前提是相应和绝对收敛或期望有定义。
公平骰子:
E[X]=61+2+3+4+5+6=3.5.
骰子不可能掷出 3.5,但它是长期平均。
3. 连续期望
密度 p(x):
E[X]=∫−∞∞x,p(x)dx.
例如 U(a,b):
E[X]=2a+b.
有些重尾分布总概率为 1,却期望不存在或发散,例如标准 Cauchy 分布。不能假设每个随机变量都有有限均值。
4. 随机变量函数的期望(LOTUS)
无需先求 Y=g(X) 的分布:
E[g(X)]=x∑g(x)pX(x)
或
E[g(X)]=∫g(x)pX(x)dx.
多变量:
E[g(X,Y)]=∬g(x,y)p(x,y)dxdy.
损失风险 E[ℓ(f(X),Y)] 就是这个形式。
5. 期望的线性性
对常数 ai,b:
E[i∑aiXi+b]=i∑aiE[Xi]+b.
不要求 Xi 独立。它是最重要、最常被低估的性质。
例:n 个事件发生总数
N=i∑1{Ai}.
即使事件依赖:
E[N]=i∑P(Ai).
6. 乘积期望
一般
E[XY]=E[X]E[Y].
若 X,Y 独立且期望存在,才可分解:
E[XY]=E[X]E[Y].
零协方差也给同一等式,但不必独立。对非线性 g,通常
E[g(X)]=g(E[X]).
Jensen 不等式给凸/凹时的方向。
7. 指示变量技巧
E[1{A}]=P(A).
因为指示变量取 1 的概率为 P(A)。许多计数的期望可以拆为指示变量和,而无需计算完整分布。
分类 0-1 风险:
R(f)=E[1{f(X)=Y}]=P(f(X)=Y).
8. 样本均值的期望
若 Xi 同均值 μ:
Xˉ=n1i∑Xi,
E[Xˉ]=n1i∑E[Xi]=μ.
这不要求独立,只要求同均值;独立性主要影响方差和集中程度。
9. 向量与矩阵期望
对随机向量逐分量取期望:
E[X]=(E[X1],…,E[Xd])T.
线性变换:
E[AX+b]=AE[X]+b.
矩阵随机变量也逐元素取期望。常量矩阵可移出期望,但随机量乘积不能随意拆。
10. 期望风险与经验风险
R(θ)=E(X,Y)∼P[ℓθ(X,Y)].
未知 P 使它无法精确计算。经验风险
R^n(θ)=n1i∑ℓθ(xi,yi)
是 Monte Carlo/样本平均估计。对固定 θ、iid 数据,它通常无偏:
ED[R^n(θ)]=R(θ).
但用同一数据选择 θ^ 后,训练风险对所选模型通常乐观,不能简单套固定参数无偏性。
11. 交换期望与求导
在适当条件下:
∇θE[ℓ(θ;X)]=E[∇θℓ(θ;X)].
mini-batch 梯度因此估计总体/全量梯度。条件包括可微性与支配可积等;极端重尾、支持依参数或不连续时要谨慎。
12. 尾和公式
对非负整数随机变量:
E[X]=k=1∑∞P(X≥k).
它把期望写成尾概率之和,常用于等待时间和算法运行步数分析。
易错点
- 期望不一定是可取值,也不等于众数。
- 期望线性不需要独立。
- 乘积期望分解通常需要独立/零协方差条件。
- E[g(X)] 一般不等于 g(E[X])。
- 某些重尾分布期望不存在。
常见问答
Q1:均值为什么对离群值敏感?
观测值线性进入平均,极端值贡献不受界;中位数只依排序,更稳健。
Q2:期望概率损失可以用一个 batch 精确得到吗?
不能,只是随机估计;batch 越大通常方差越小,但数据代表性也关键。
Q3:训练损失是否是总体风险的无偏估计?
对预先固定模型可近似无偏;模型由同一训练集选择后,训练损失有选择乐观偏差。
练习
- 求 Bernoulli(p) 的期望。
- 公平骰子的平方期望 E[X2] 是多少?
- 证明样本均值期望为总体均值。
- 事件发生数 N=∑i1{Ai} 的期望是什么?
- 给出 E[g(X)]=g(E[X]) 的例子。
答案与提示
- p。
- (1+4+9+16+25+36)/6=91/6。
- 用期望线性性。
- ∑iP(Ai),不要求独立。
- 非退化 X 与 g(x)=x2,差为方差。