机器学习数学基础 120 章

总体、样本、统计量与经验分布

层级:A|必学

1. 从概率模型到数据推断

概率论常假设分布 PP 已知,问随机结果如何;统计学观察有限样本,反推未知分布或参数。机器学习训练就是用样本选择预测函数,并量化它对未来数据的可靠程度。

2. 总体

总体可以指:

  • 有限对象集合,如某日全部订单;
  • 概念上的数据生成分布 PP,如未来同类用户请求。

总体参数是固定但未知的量,例如

μ=EP[X],σ2=VarP(X).\mu=E_P[X], \qquad\sigma^2=Var_P(X).

有限总体调查与超总体建模的抽样假设不同,不能随意混用独立性和有限总体修正。

3. 样本

随机样本

X1,ldots,XniidPX_1,ldots,X_n\overset{iid}\sim P

是随机变量;观测后得到

x1,ldots,xn.x_1,ldots,x_n.

iid 是建模假设,不是数据文件天然性质。同一用户多条记录、时间序列、空间数据和网络节点常有依赖。

4. 参数与统计量

参数描述总体/模型,如 θ,p,μ,σ2\theta,p,\mu,\sigma^2。统计量是样本的函数,不能含未知参数:

T=T(X1,ldots,Xn).T=T(X_1,ldots,X_n).

例:

Xˉ=1niXi,\bar X=\frac1n\sum_iX_i, S2=1n1i(XiXˉ)2.S^2=\frac1{n-1}\sum_i(X_i-\bar X)^2.

观测前统计量是随机变量,有抽样分布;观测后得到具体数值。

5. 估计量与估计值

用于估计参数的统计量称估计量,如 μ^=Xˉ\hat\mu=\bar X。符号帽子表示由数据估得。

  • 估计量:随机规则 θ^(X1,ldots,Xn)\hat\theta(X_1,ldots,X_n)
  • 估计值:代入当前数据后的数。

讨论“无偏、方差、一致性”针对估计量在重复抽样下的性质,不是一个数值样本的属性。

6. 经验分布

把每个观测点放概率 1/n1/n

P^n=1ni=1nδxi,\hat P_n=\frac1n\sum_{i=1}^{n}\delta_{x_i},

δxi\delta_{x_i} 是点质量。经验 CDF:

F^n(x)=1ni1{xix}.\hat F_n(x)=\frac1n\sum_i\mathbf1\{x_i\le x\}.

样本平均就是经验分布下期望:

1nif(xi)=EP^n[f(X)].\frac1n\sum_if(x_i)=E_{\hat P_n}[f(X)].

经验风险最小化正是用经验分布替代未知总体分布。

7. 观测单位与分析单位

数据表一行不一定是独立分析单位。若用户是随机抽样单位、一位用户有多次点击:

  • 按行切分可能同一用户泄漏到训练与测试;
  • 标准误按行计算会过小;
  • 高频用户在经验风险中权重更大。

应明确抽样单位、标签单位、评估单位与部署决策单位。

8. 抽样框与目标总体

目标总体是希望推广到的对象;抽样框是实际有机会进入数据的对象。二者不一致产生 coverage bias。例如只记录登录用户,无法无条件代表所有访问者。

更多样本只减少随机误差,不会自动修复覆盖缺失、选择偏差与错误标签。

9. 缺失与删失

  • 缺失:变量未记录;
  • 右删失:只知事件时间超过观察截止;
  • 截断:不满足条件的对象根本不进入样本。

把删失时长当完整观测、把缺失行直接删除都可能偏。统计模型必须匹配观测机制。

10. 训练、验证、测试样本

  • 训练集:拟合参数;
  • 验证集:选择超参数、模型、阈值;
  • 测试集:在所有选择完成后做近似无偏终评。

反复查看测试集并据此修改,相当于把测试集纳入训练/选择,结果产生选择偏差。线上部署分布若变化,静态测试仍不能代表未来。

11. 充分统计量预览

统计量 T(X)T(X) 若在给定 TT 后,样本关于参数不再提供额外信息,称充分统计量。Bernoulli iid 中成功总数 iXi\sum_iX_ipp 充分;不需保留成功出现的顺序来估计 pp

充分性依模型,不表示统计量保留所有业务信息。

易错点

  1. 参数固定未知,估计量因样本随机。
  2. 一行不一定是独立样本。
  3. 经验分布只支持观测点,不代表真实分布无其他取值。
  4. 大样本不能修复系统性抽样偏差。
  5. 反复用测试集会把它变成验证集。

常见问答

Q1:全量数据库还需要统计推断吗?

若只描述当前有限数据库可少用抽样推断;若推广到未来、未观测人群或有测量随机性,仍存在超总体和过程不确定性。

Q2:训练集是不是总体?

通常不是,它是目标分布的一次样本;把它当总体会混淆训练拟合与未来泛化。

Q3:交叉验证后还需要独立测试集吗?

若交叉验证参与大量选择,独立测试更可信;数据极少时可嵌套交叉验证估计选择过程性能。

练习

  1. 区分参数、统计量、估计值。
  2. 写出经验 CDF。
  3. 为什么同一用户记录不能普通随机分行切分?
  4. 解释抽样框与目标总体差异。
  5. 反复看测试指标有什么后果?

答案与提示

  1. 参数描述总体,统计量是样本函数,估计值是该函数在当前数据上的实现。
  2. n1i1{xix}n^{-1}\sum_i1\{x_i\le x\}
  3. 用户特征与行为泄漏且观测相关,测试不再模拟新用户/未来情形。
  4. 有机会被记录者未必覆盖希望推广者,导致 coverage bias。
  5. 对测试集过拟合,报告误差乐观。