机器学习数学基础 120 章

方差、标准差与高阶矩

层级:A|必学

1. 均值不描述波动

两个分布可有相同均值,却一个集中、一个分散。方差衡量随机变量相对均值的平均平方偏离,标准差把单位恢复为原变量单位。

2. 方差定义

μ=E[X]\mu=E[X]

Var(X)=E[(Xμ)2].\operatorname{Var}(X) =E[(X-\mu)^2].

标准差:

SD(X)=Var(X).\operatorname{SD}(X)=\sqrt{\operatorname{Var}(X)}.

方差单位是原单位平方,标准差与原变量同单位。方差非负,等于 0 当且仅当 XX 几乎必然为常数。

3. 计算公式

展开:

Var(X)=E[X2](E[X])2.\operatorname{Var}(X) =E[X^2]-(E[X])^2.

推导:

E[X22μX+μ2]=E[X2]2μ2+μ2.E[X^2-2\mu X+\mu^2] =E[X^2]-2\mu^2+\mu^2.

该公式理论简洁,但浮点中若 E[X2]E[X^2]E[X]2E[X]^2 都很大且接近,相减会严重消去;计算样本方差应使用稳定两遍法或 Welford 在线算法。

4. 平移与缩放

Var(X+c)=Var(X),\operatorname{Var}(X+c)=\operatorname{Var}(X), Var(aX+b)=a2Var(X).\operatorname{Var}(aX+b)=a^2\operatorname{Var}(X).

加常数只平移,不改变波动;放大 aa 倍使标准差放大 a|a| 倍、方差放大 a2a^2

5. 随机变量之和

Var(X+Y)=Var(X)+Var(Y)+2Cov(X,Y).\operatorname{Var}(X+Y) =\operatorname{Var}(X)+\operatorname{Var}(Y) +2\operatorname{Cov}(X,Y).

若不相关,协方差为 0,方差相加。独立蕴含不相关(有限二阶矩下),所以独立时也相加。

一般:

Var(iaiXi)=ijaiajCov(Xi,Xj).\operatorname{Var}\left(\sum_ia_iX_i\right) =\sum_i\sum_ja_ia_j\operatorname{Cov}(X_i,X_j).

6. 样本均值方差

XiX_i iid,方差 σ2\sigma^2

Var(Xˉ)=Var(1niXi)=σ2n.\operatorname{Var}(\bar X) =\operatorname{Var}\left(\frac1n\sum_iX_i\right) =\frac{\sigma^2}{n}.

标准误为 σ/n\sigma/\sqrt n。样本量扩大 4 倍,均值标准误约减半,不是降到四分之一。

若样本正相关,协方差项使有效样本量低于 nn

7. 总体方差与样本方差

数据 x1,ldots,xnx_1,ldots,x_n

sn2=1ni(xixˉ)2s_n^2=\frac1n\sum_i(x_i-\bar x)^2

是经验分布方差/MLE(高斯均值同时估计时),但对总体方差有向下偏差。无偏样本方差:

s2=1n1i(xixˉ)2.s^2=\frac1{n-1}\sum_i(x_i-\bar x)^2.

分母 n1n-1 来自估计均值消耗一个自由度。预测/描述时选哪个要明确语境,库的默认 ddof 可能不同。

8. 矩与中心矩

kk 阶原点矩:

E[Xk].E[X^k].

kk 阶中心矩:

E[(Xμ)k].E[(X-\mu)^k].

一阶原点矩是均值,二阶中心矩是方差。

偏度

标准化三阶中心矩:

γ1=E[(Xμσ)3].\gamma_1=E\left[\left(\frac{X-\mu}{\sigma}\right)^3\right].

衡量分布非对称方向。

峰度

标准化四阶中心矩:

γ2=E[(Xμσ)4].\gamma_2=E\left[\left(\frac{X-\mu}{\sigma}\right)^4\right].

高斯峰度为 3,超额峰度为 0。它更与尾部/极端值相关,不应简单解释为图形“尖不尖”。

9. 均方误差

估计量 θ^\hat\theta

MSE(θ^)=E[(θ^θ)2]=Var(θ^)+Bias(θ^)2.\operatorname{MSE}(\hat\theta) =E[(\hat\theta-\theta)^2] =\operatorname{Var}(\hat\theta) +\operatorname{Bias}(\hat\theta)^2.

这说明有偏估计可能通过显著降低方差获得更小 MSE,正则化的统计动机之一。

10. 变异系数

CV=σμCV=\frac{\sigma}{|\mu|}

提供无量纲相对波动,但均值接近 0 时不稳定,负均值与区间尺度变量也需谨慎。不能用于所有数据类型。

11. 鲁棒尺度

标准差对离群值敏感。常用:

  • MAD:中位绝对偏差;
  • IQR:四分位距;
  • 截尾/winsorized 尺度。

数据探索时同时看分位数和标准差,尤其对延迟、收入等重尾分布。

易错点

  1. 方差不是平均绝对偏差。
  2. Var(X+Y)Var(X+Y) 一般不能直接方差相加,要有协方差项。
  3. 标准差与标准误不同;前者描述个体波动,后者描述估计均值波动。
  4. 样本方差分母 nnn1n-1 服务不同目的。
  5. 直接用 E[X2]E[X]2E[X^2]-E[X]^2 算浮点方差可能不稳定。

常见问答

Q1:方差大是否数据质量差?

不一定。它可能是真实异质性、有用信号、单位尺度,也可能是噪声。需结合条件分布与任务。

Q2:为什么平均多个模型能降低方差?

若误差不完全相关,平均的方差包含缩小的个体方差与协方差;多样性越大,降低越明显。

Q3:神经网络初始化为什么关心方差?

层层线性组合会放大或缩小激活/梯度方差,Xavier/He 初始化试图让尺度跨层稳定。

练习

  1. Bernoulli(pp) 方差是多少?
  2. Var(X)=4Var(X)=4,求 Var(3X+5)Var(3X+5)
  3. iid 均值取 100 个样本,单样本方差 25,均值标准误是多少?
  4. 为什么样本方差用 n1n-1 可无偏?
  5. 写出 Var(XY)Var(X-Y)

答案与提示

  1. p(1p)p(1-p)
  2. 36。
  3. 25/100=0.5\sqrt{25/100}=0.5
  4. 样本偏差相对估计均值受一个线性约束、自由度为 n1n-1;正式期望计算给修正。
  5. Var(X)+Var(Y)2Cov(X,Y)Var(X)+Var(Y)-2Cov(X,Y)