大数定律与中心极限定理
层级:A|必学
1. 两个定理回答不同问题
- 大数定律(LLN):样本平均会不会接近总体均值?
- 中心极限定理(CLT):样本平均围绕总体均值的随机波动近似什么形状、多大尺度?
LLN 给一致性,CLT 给近似分布与 1/n 误差尺度。两者不能互换。
2. 样本均值
iid X1,ldots,Xn,
Xˉn=n1i=1∑nXi.
若均值 μ、方差 σ2<∞:
E[Xˉn]=μ,Var(Xˉn)=nσ2.
Chebyshev 不等式给
P(∣Xˉn−μ∣≥ϵ)≤nϵ2σ2→0.
这直接证明弱大数定律的一种情形。
3. 弱大数定律
XˉnPμ,
即对任意 ϵ>0:
P(∣Xˉn−μ∣>ϵ)→0.
样本越多,平均偏离真实均值固定幅度的概率趋零。
4. 强大数定律
Xˉna.s.μ,
表示以概率 1,沿几乎每条无限样本序列,样本均值最终收敛到 μ。几乎必然收敛比依概率收敛强。
定理条件有多个版本。iid 且 E∣X∣<∞ 是经典强大数条件之一。
5. 中心极限定理
若 iid,均值 μ、方差 0<σ2<∞:
σn(Xˉn−μ)dN(0,1).
等价近似:
Xˉn≈N(μ,nσ2)
对大 n 成立。
6. CLT 不说原始数据变高斯
无论 Xi 是偏态、离散或其他分布,在条件下标准化的和/均值可能近似高斯。原始单个 Xi 分布不随 n 改变。
若 Xi 本身高斯,样本均值对任何 n 都精确高斯,不需近似。
7. 标准误与置信区间
样本均值标准误:
SE(Xˉ)=nσ.
σ 未知时用样本标准差 s 估计。大样本近似 95% 区间:
xˉ±1.96ns.
小样本高斯总体且方差未知时用 t 分布而非标准正态。
8. 收敛速度与 Berry–Esseen
有有限三阶绝对矩时,CDF 近似误差上界大致为
O(1/n)
并依赖 E∣X−μ∣3/σ3。偏斜重尾越强,需要更大 n 才近似良好。“n=30 一定够”没有普遍依据。
9. CLT 失效或需修改的情形
- 无限方差重尾(如 Cauchy):普通 CLT 不适用;
- 强依赖序列:方差需包含自相关,可能有专门 CLT;
- 非同分布:有 Lindeberg–Feller 等推广;
- 极端尾概率:中心区域高斯近似好不表示尾部准确;
- 自适应选择/可选停止:简单 iid 推断可能失效。
10. 有效样本量
相关样本均值方差:
Var(Xˉ)=nσ2[1+2k=1∑n−1(1−nk)ρk].
正自相关使方差大于 σ2/n,可定义更小的有效样本量。用户群组、时间序列与 MCMC 都需考虑。
11. Bernoulli 比例近似
K∼Binomial(n,p),p^=K/n:
p^≈N(p,np(1−p)).
当 np 或 n(1−p) 太小时,正态近似差且 Wald 区间可能越出 [0,1];可用 Wilson、exact 或 Bayesian 区间。
12. Monte Carlo 误差
用独立样本估计 μ=E[f(X)]:
μ^N=N1i∑f(Xi).
LLN 保证一致,CLT 给
μ^N≈N(μ,NVar(f(X))).
误差减半需要样本约增 4 倍,这解释了 Monte Carlo 的慢 1/N 速率。
13. 训练与泛化
对预先固定模型,经验损失是总体风险的样本平均,LLN 支持其收敛。但模型从同一数据中选择,且假设空间可能巨大,需要一致收敛、复杂度控制或独立验证,不能对每个候选单独套 LLN 后自动得到所选模型保证。
易错点
- LLN 不说明误差分布高斯。
- CLT 不说明原始数据高斯。
- 标准误按 1/n,不是 1/n。
- 相关样本的有效样本量小于行数。
- 重尾与极端尾部可能让正态近似很差。
常见问答
Q1:样本很多,偏差会自动消失吗?
随机抽样误差会缩小,但系统性偏差、测量误差、选择偏差和模型错设不会因更多同类数据消失。
Q2:为什么 A/B 测试常用正态近似?
样本均值/比例在大样本下由 CLT 近似高斯;但用户聚类、比例极端、序贯监控和多重实验需调整。
Q3:Cauchy 样本均值为何不稳定?
Cauchy 无有限均值和方差,独立 Cauchy 平均仍是同尺度 Cauchy,不随 n 集中。
练习
- iid 方差 16,样本量 64,均值标准误。
- 样本量扩大 9 倍,标准误变为多少倍?
- 写出 CLT 的标准化形式。
- LLN 与 CLT 各回答什么?
- 为什么训练选择后的最小经验风险会乐观?
答案与提示
- 4/8=0.5。
- 1/3。
- n(Xˉ−μ)/σ⇒N(0,1)。
- 前者是一致性,后者是缩放误差的极限分布。
- 在许多带噪候选中专门选择表现最好的一个,利用了随机波动。