机器学习数学基础 120 章

置信区间与标准误

层级:B|按需

1. 点估计必须配不确定性

“转化率提升 0.3%”若没有标准误、区间与抽样单位,无法判断是稳定信号还是随机波动。置信区间是一个由随机样本生成的区间过程,其长期覆盖率受模型与方法保证。

2. 频率学派解释

95% 置信区间程序满足:在相同机制重复抽样并每次构造区间,约 95% 区间包含固定真参数。

当前数据得到 [a,b][a,b] 后,严格频率解释不是“参数有 95% 概率在其中”,因为参数固定、区间已实现。日常语言常简化,但要知道与 Bayesian credible interval 的区别。

3. 已知方差的均值区间

高斯或大样本:

Xˉμσ/nN(0,1).\frac{\bar X-\mu}{\sigma/\sqrt n} \sim N(0,1).

1α1-\alpha 区间:

xˉ±z1α/2σn.\bar x\pm z_{1-\alpha/2} \frac\sigma{\sqrt n}.

95% 时 z0.9751.96z_{0.975}\approx1.96

4. 未知方差的 t 区间

高斯样本:

xˉ±tn1,1α/2sn.\bar x\pm t_{n-1,1-\alpha/2} \frac s{\sqrt n}.

t 临界值比 1.96 大,反映估计 σ\sigma 的额外不确定性;nn 大时接近高斯。

非高斯小样本下 t 区间可能不可靠,考虑变换、稳健方法或 bootstrap。

5. 比例区间

Wald:

p^±zp^(1p^)/n\hat p\pm z \sqrt{\hat p(1-\hat p)/n}

简单但在小样本/边界表现差。Wilson score 区间通常更好且保持在 [0,1][0,1];Clopper–Pearson exact 保守;Beta 后验区间有 Bayesian 解释。

报告方法,而非统一叫“95% 区间”。

6. 两组差异

独立均值差:

(xˉ1xˉ2)±ts12n1+s22n2.(\bar x_1-\bar x_2) \pm t^*\sqrt{\frac{s_1^2}{n_1}+\frac{s_2^2}{n_2}}.

Welch 方法不假设两组方差相等,通常比默认 pooled t 更稳健。

配对数据对差值 di=xi1xi0d_i=x_{i1}-x_{i0} 做单样本区间。比例、风险比、odds ratio 的区间常在合适变换尺度构造。

7. Delta method

θ^N(θ,SE2)\hat\theta\approx N(\theta,SE^2)

gg 光滑:

g(θ^)N(g(θ),[g(θ)SE]2).g(\hat\theta) \approx N(g(\theta),[g'(\theta)SE]^2).

例如对正参数取 log 后构造对称区间,再指数变回,得到原尺度非对称正区间。

8. Bootstrap 区间

重复有放回重采样,得到 θ^(b)\hat\theta^{*(b)}

  • percentile:取 bootstrap 分位数;
  • basic:围绕原估计反射分位数;
  • studentized:标准化后构造;
  • BCa:修正偏差与加速度。

不同方法覆盖不同。群组/时间依赖需按群或 block 重采样;预处理和模型选择应在每次 bootstrap 内完整重跑。

9. 置信区间不是预测区间

  • 均值置信区间:总体平均估计的不确定性,随 nn 缩窄;
  • 新观测预测区间:还包含个体噪声,通常更宽,即使 nn\to\infty 也不收缩为零。

线性高斯回归预测区间包含噪声方差与均值估计方差。

10. 置信水平与宽度

更高覆盖要求更宽区间;更大样本缩窄区间;更大噪声加宽区间。若要把误差半宽减半,在独立同分布下常需约四倍样本。

统计显著但区间窄小可能业务无意义;区间宽跨越重要正负阈值则证据不足。

11. 多重区间

同时报告许多 95% 区间,至少一个漏真值的概率会增大。需要 simultaneous confidence bands、Bonferroni/Holm、FDR 或预先指定主指标。

“每个参数 95%”不等于“整个参数向量同时 95%”。

12. 模型错设与 robust SE

回归中异方差会使经典同方差标准误错误;可用 heteroskedasticity-consistent sandwich SE。群组相关用 cluster-robust;时间相关用 HAC/Newey–West 或时间模型。

robust SE 不修复系数因遗漏变量、选择偏差导致的偏差,只调整特定方差估计。

易错点

  1. 频率置信区间不是参数后验概率区间。
  2. 标准误不是样本标准差。
  3. Wald 比例区间在边界可越出 [0,1][0,1]
  4. 预测区间比均值置信区间宽。
  5. 多重报告需要同时覆盖调整。

常见问答

Q1:区间包含 0 是否说明“没有效果”?

只说明在该置信水平和模型下数据与零及区间内其他值相容;区间宽可能是精度不足,不是证明效果为零。

Q2:样本巨大区间很窄就可信吗?

只降低随机误差。偏差、依赖、泄漏与模型错设可让窄区间精确地围住错误值。

Q3:交叉验证均值可直接用折间标准差算区间吗?

折结果相关且训练集重叠,普通 s/Ks/\sqrt K 往往不正确。用重复/嵌套 CV、配对比较或专门方差方法。

练习

  1. 均值 10、已知 SE=2SE=2,近似 95% 区间。
  2. 置信水平从 95% 升 99%,区间怎样变化?
  3. 区分均值置信区间与预测区间。
  4. 为什么配对设计常缩窄差异区间?
  5. 多个指标同时看需注意什么?

答案与提示

  1. 10±3.92=[6.08,13.92]10\pm3.92=[6.08,13.92]
  2. 更宽。
  3. 前者只含均值估计不确定性,后者还含新个体噪声。
  4. 利用同一对象正相关,差值消除个体基线波动。
  5. 多重比较/同时覆盖,避免挑选偶然显著者。