机器学习数学基础 120 章

大数定律与中心极限定理

层级:A|必学

1. 两个定理回答不同问题

  • 大数定律(LLN):样本平均会不会接近总体均值?
  • 中心极限定理(CLT):样本平均围绕总体均值的随机波动近似什么形状、多大尺度?

LLN 给一致性,CLT 给近似分布与 1/n1/\sqrt n 误差尺度。两者不能互换。

2. 样本均值

iid X1,ldots,XnX_1,ldots,X_n

Xˉn=1ni=1nXi.\bar X_n=\frac1n\sum_{i=1}^{n}X_i.

若均值 μ\mu、方差 σ2<\sigma^2<\infty

E[Xˉn]=μ,Var(Xˉn)=σ2n.E[\bar X_n]=\mu, \qquad Var(\bar X_n)=\frac{\sigma^2}{n}.

Chebyshev 不等式给

P(Xˉnμϵ)σ2nϵ20.P(|\bar X_n-\mu|\ge\epsilon) \le\frac{\sigma^2}{n\epsilon^2}\to0.

这直接证明弱大数定律的一种情形。

3. 弱大数定律

XˉnPμ,\bar X_n\xrightarrow{P}\mu,

即对任意 ϵ>0\epsilon>0

P(Xˉnμ>ϵ)0.P(|\bar X_n-\mu|>\epsilon)\to0.

样本越多,平均偏离真实均值固定幅度的概率趋零。

4. 强大数定律

Xˉna.s.μ,\bar X_n\xrightarrow{a.s.}\mu,

表示以概率 1,沿几乎每条无限样本序列,样本均值最终收敛到 μ\mu。几乎必然收敛比依概率收敛强。

定理条件有多个版本。iid 且 EX<E|X|<\infty 是经典强大数条件之一。

5. 中心极限定理

若 iid,均值 μ\mu、方差 0<σ2<0<\sigma^2<\infty

n(Xˉnμ)σdN(0,1).\frac{\sqrt n(\bar X_n-\mu)}{\sigma} \xrightarrow{d}\mathcal N(0,1).

等价近似:

XˉnN(μ,σ2n)\bar X_n\approx \mathcal N\left(\mu,\frac{\sigma^2}{n}\right)

对大 nn 成立。

6. CLT 不说原始数据变高斯

无论 XiX_i 是偏态、离散或其他分布,在条件下标准化的和/均值可能近似高斯。原始单个 XiX_i 分布不随 nn 改变。

XiX_i 本身高斯,样本均值对任何 nn 都精确高斯,不需近似。

7. 标准误与置信区间

样本均值标准误:

SE(Xˉ)=σn.SE(\bar X)=\frac\sigma{\sqrt n}.

σ\sigma 未知时用样本标准差 ss 估计。大样本近似 95% 区间:

xˉ±1.96sn.\bar x\pm1.96\frac{s}{\sqrt n}.

小样本高斯总体且方差未知时用 t 分布而非标准正态。

8. 收敛速度与 Berry–Esseen

有有限三阶绝对矩时,CDF 近似误差上界大致为

O(1/n)O(1/\sqrt n)

并依赖 EXμ3/σ3E|X-\mu|^3/\sigma^3。偏斜重尾越强,需要更大 nn 才近似良好。“n=30n=30 一定够”没有普遍依据。

9. CLT 失效或需修改的情形

  • 无限方差重尾(如 Cauchy):普通 CLT 不适用;
  • 强依赖序列:方差需包含自相关,可能有专门 CLT;
  • 非同分布:有 Lindeberg–Feller 等推广;
  • 极端尾概率:中心区域高斯近似好不表示尾部准确;
  • 自适应选择/可选停止:简单 iid 推断可能失效。

10. 有效样本量

相关样本均值方差:

Var(Xˉ)=σ2n[1+2k=1n1(1kn)ρk].Var(\bar X)=\frac{\sigma^2}{n} \left[1+2\sum_{k=1}^{n-1} \left(1-\frac{k}{n}\right)\rho_k\right].

正自相关使方差大于 σ2/n\sigma^2/n,可定义更小的有效样本量。用户群组、时间序列与 MCMC 都需考虑。

11. Bernoulli 比例近似

KBinomial(n,p)K\sim Binomial(n,p)p^=K/n\hat p=K/n

p^N(p,p(1p)n).\hat p\approx N\left(p,\frac{p(1-p)}n\right).

npnpn(1p)n(1-p) 太小时,正态近似差且 Wald 区间可能越出 [0,1][0,1];可用 Wilson、exact 或 Bayesian 区间。

12. Monte Carlo 误差

用独立样本估计 μ=E[f(X)]\mu=E[f(X)]

μ^N=1Nif(Xi).\hat\mu_N=\frac1N\sum_if(X_i).

LLN 保证一致,CLT 给

μ^NN(μ,Var(f(X))N).\hat\mu_N\approx N\left(\mu, \frac{Var(f(X))}{N}\right).

误差减半需要样本约增 4 倍,这解释了 Monte Carlo 的慢 1/N1/\sqrt N 速率。

13. 训练与泛化

对预先固定模型,经验损失是总体风险的样本平均,LLN 支持其收敛。但模型从同一数据中选择,且假设空间可能巨大,需要一致收敛、复杂度控制或独立验证,不能对每个候选单独套 LLN 后自动得到所选模型保证。

易错点

  1. LLN 不说明误差分布高斯。
  2. CLT 不说明原始数据高斯。
  3. 标准误按 1/n1/\sqrt n,不是 1/n1/n
  4. 相关样本的有效样本量小于行数。
  5. 重尾与极端尾部可能让正态近似很差。

常见问答

Q1:样本很多,偏差会自动消失吗?

随机抽样误差会缩小,但系统性偏差、测量误差、选择偏差和模型错设不会因更多同类数据消失。

Q2:为什么 A/B 测试常用正态近似?

样本均值/比例在大样本下由 CLT 近似高斯;但用户聚类、比例极端、序贯监控和多重实验需调整。

Q3:Cauchy 样本均值为何不稳定?

Cauchy 无有限均值和方差,独立 Cauchy 平均仍是同尺度 Cauchy,不随 nn 集中。

练习

  1. iid 方差 16,样本量 64,均值标准误。
  2. 样本量扩大 9 倍,标准误变为多少倍?
  3. 写出 CLT 的标准化形式。
  4. LLN 与 CLT 各回答什么?
  5. 为什么训练选择后的最小经验风险会乐观?

答案与提示

  1. 4/8=0.54/8=0.5
  2. 1/3。
  3. n(Xˉμ)/σN(0,1)\sqrt n(\bar X-\mu)/\sigma\Rightarrow N(0,1)
  4. 前者是一致性,后者是缩放误差的极限分布。
  5. 在许多带噪候选中专门选择表现最好的一个,利用了随机波动。