机器学习数学基础 120 章

假设检验、p 值与第一/第二类错误

层级:B|按需

1. 检验是一套反证式决策程序

先规定原假设 H0H_0 与统计量,问:如果 H0H_0 真的成立,当前或更极端数据有多罕见?p 值小表示数据与 H0H_0 难相容,但不是 H0H_0 为真的概率。

2. 基本组成

  • 原假设 H0H_0:默认模型,如差异 Δ=0\Delta=0
  • 备择 H1H_1:关心的偏离;
  • 检验统计量 T(D)T(D)
  • H0H_0 下抽样分布;
  • 显著性水平 α\alpha
  • 拒绝域或 p 值规则。

必须在看结果前尽量确定方向、指标、停止规则与分析方法。

3. p 值

p 值是在 H0H_0 成立及检验假设满足时,得到当前统计量或更不利于 H0H_0 的结果的概率。

双侧正态例:观察 zz

p=2P(Zz),ZN(0,1).p=2P(Z\ge|z|),\quad Z\sim N(0,1).

它不是:

  • P(H0D)P(H_0|D)
  • 结果由随机产生的概率;
  • 效果有业务意义的概率;
  • 研究可复现的概率。

4. 第一类与第二类错误

真实情况 不拒绝 H0H_0 拒绝 H0H_0
H0H_0 正确 第一类错误(假阳性)
H1H_1 第二类错误(假阴性) 正确
α=P(reject H0H0),\alpha=P(\text{reject }H_0|H_0), β=P(fail reject H0H1 at specified effect),\beta=P(\text{fail reject }H_0|H_1\text{ at specified effect}),

power =1β=1-\beta

功效依真实效果大小、样本量、噪声、检验与显著性水平。

5. 单侧与双侧

  • 双侧:检测任一方向差异;
  • 单侧:只把预先关心方向视为拒绝证据。

看到结果后把双侧改单侧会把 p 值人为减小,增加第一类错误。若反方向也有业务影响,通常用双侧。

6. 均值检验

单样本高斯未知方差:

t=xˉμ0s/ntn1quad(H0).t=\frac{\bar x-\mu_0}{s/\sqrt n} \sim t_{n-1}quad(H_0).

两独立组常用 Welch t;配对数据对差值做 t 检验。非高斯大样本可依 CLT,但重尾、小样本和强依赖需 permutation/bootstrap/稳健方法。

7. 比例与列联表

  • 单/双比例 z 检验;
  • 小计数用 Fisher exact;
  • 多类别关联用 χ2\chi^2 检验;
  • McNemar 用于配对二分类预测。

比较两个模型同一测试集准确率时,预测正确性是配对的,不能把两个比例当独立。

8. 检验与置信区间对偶

双侧 α\alpha 检验在常见正则设置下拒绝 H0:θ=θ0H_0:\theta=\theta_0,当且仅当 1α1-\alpha 置信区间不包含 θ0\theta_0

区间比单 p 值信息更多:显示效果方向、大小和不确定性。

9. 统计显著与实际显著

大样本下极小无关差异也可 p 很小。应预先定义最小业务重要差异(MDE/SESOI),报告效果量与区间。

若目标是证明差异足够小,普通“未拒绝零差异”不够;应做等效性检验(TOST)或非劣效检验。

10. 功效与样本量

样本量计划需要:

  • 显著性 α\alpha
  • 目标功效;
  • 最小重要效果;
  • 方差/基准率;
  • 分配比例;
  • 多重比较与流失;
  • 群组设计效应。

用观察到的效果做“事后功效”通常只是 p 值的变换,信息有限;更有用是区间与未来设计灵敏度。

11. 可选停止

每天看一次普通 p 值,一显著就停,会累计第一类错误。应使用:

  • 预定固定样本;
  • group sequential/alpha spending;
  • always-valid p/e-values;
  • Bayesian 决策规则并校准运营代价。

实验平台必须把监控规则纳入推断。

12. 模型假设与稳健性

p 值条件于抽样、独立、分布/方差与分析计划。模型错设时即使计算精确也无正确意义。随机化实验可用 randomization inference 减少分布假设,但仍需处理干扰、失访和不依从。

易错点

  1. p 值不是原假设为真的概率。
  2. 不显著不等于无效果。
  3. 统计显著不等于业务重要。
  4. 结果后改单侧、指标或样本停止规则会膨胀假阳性。
  5. 同一测试样本上的模型比较是配对数据。

常见问答

Q1:p=0.03 表示重复实验 97% 会成功吗?

不是。它只描述 H0H_0 下当前统计量的尾概率,复现概率还取决于真实效果、功效、偏差和设计。

Q2:为什么 p=0.051 与 0.049 不应被当完全不同?

它们证据强度几乎相同,0.05 是人为决策阈值。应看效果量、区间和成本。

Q3:A/B 测试用户有多次事件如何处理?

随机化/分析单位通常是用户,应按用户聚合或用 cluster-robust/层级方法,不能把每次事件当独立用户。

练习

  1. 定义第一类、第二类错误与功效。
  2. p 值不是什么?列两项。
  3. 为什么同一数据上比较模型用配对检验?
  4. 未拒绝 H0H_0 能否证明等效?
  5. 反复查看 p 值提前停止有什么问题?

答案与提示

  1. 假阳性、假阴性、1β1-\beta
  2. 不是 P(H0D)P(H_0|D),也不是复现概率/业务意义概率。
  3. 每个样本上的两个预测结果相关,差值方差应利用配对。
  4. 不能,需等效性设计与区间落入等效界。
  5. 膨胀总体第一类错误率。