机器学习数学基础 120 章

描述统计与数据分布检查

层级:A|必学

1. 建模前先知道数据长什么样

均值与标准差不足以描述偏态、重尾、多峰、缺失、异常和群组差异。描述统计的任务是压缩数据并暴露结构,不是用一个漂亮数字替代检查。

2. 位置统计量

均值

xˉ=1nixi.\bar x=\frac1n\sum_ix_i.

利用全部数值、适合对称轻尾数据,但对极端值敏感。

中位数

排序后 50% 分位数。它最小化绝对偏差和:

medianinargminaixia.\operatorname{median}in\arg\min_a\sum_i|x_i-a|.

对少量离群值稳健。

众数

出现频率最高值;连续数据依赖 bin/KDE,可能多峰或不唯一。

3. 分位数

qαq_\alpha 使约 alphaalpha 比例数据不超过它。四分位数 Q1,Q2,Q3Q_1,Q_2,Q_3 对应 25%、50%、75%。

不同软件有多种插值定义,小样本结果可能不同。报告业务分位数(P50/P90/P99)时固定方法,尤其分布式近似 quantile。

4. 离散程度

  • 极差:maxmin\max-min,极端敏感;
  • 方差/标准差:平方偏差;
  • IQR:Q3Q1Q_3-Q_1
  • MAD:medianximedian(x)\operatorname{median}|x_i-\operatorname{median}(x)|
  • 变异系数:s/xˉs/|\bar x|,仅适合有意义零点、均值非零的比例尺度。

近高斯时 1.4826×MAD1.4826\times MAD 可估标准差(具体 MAD 定义需明确)。

5. 偏度与重尾

正偏/右偏:长右尾,常见延迟、收入;均值常大于中位数。负偏相反。

重尾表示极端值概率比高斯大。样本偏度、峰度对极端值非常敏感,小样本不稳。应结合 log 坐标、Q–Q 图和尾部经验概率。

6. 直方图

bin 宽太大掩盖多峰,太小显示噪声。若 y 轴为 count,柱高是数量;若 density,柱面积和为 1。比较不同样本量组时应使用相同 bin 边界和密度/比例。

不要用截断坐标制造差异,也不要只展示总分布而隐藏分组。

7. 箱线图

常见 Tukey 规则把

[Q11.5IQR,Q3+1.5IQR][Q_1-1.5IQR, Q_3+1.5IQR]

外点标记为潜在异常。它是探索规则,不是自动删除标准。大样本或重尾分布自然会有许多“离群点”。

8. ECDF 与 Q–Q 图

经验 CDF 不依赖 bin,能直接读任意阈值比例。Q–Q 图比较样本分位数与参考分布分位数:若近直线则位置尺度后形状相近;尾部偏离提示重尾/轻尾或偏态。

Q–Q 图也可比较两个数据集分布,而不只高斯性。

9. 类别变量

检查:

  • 频数与比例;
  • 稀有类别;
  • 未知/其他类别;
  • 类别随时间/群组变化;
  • 训练与部署出现的新类别;
  • 高基数与疑似标识符。

类别编号的均值通常无语义。

10. 缺失值

至少报告每列、每行/用户、时间和标签组的缺失比例。创建缺失指示变量检查缺失是否与其他特征/结果相关。

把缺失填 0 会混淆真实零;删除缺失行若缺失非完全随机会偏。预处理统计必须只在训练数据拟合。

11. 二变量与多变量检查

  • 数值—数值:散点、hexbin、相关与非线性趋势;
  • 类别—数值:分组分位数/箱图;
  • 类别—类别:列联表、条件比例;
  • 高维:相关矩阵、PCA、聚类,但先排除泄漏与 ID。

Simpson 悖论提醒:总体趋势可与分组趋势相反,必须检查关键分层。

12. 数据质量与分布漂移

检查范围、单位、重复、时间戳顺序、逻辑约束、标签延迟、采集版本。训练/验证/线上比较:

  • 数值分位数、PSI/KS/Wasserstein;
  • 类别比例与新类别;
  • 缺失率;
  • 特征—标签关系;
  • 预测分数与校准。

单变量漂移指标不能捕捉所有联合或条件漂移。

易错点

  1. 均值标准差不够描述重尾与多峰。
  2. 箱线图“异常点”不能自动删除。
  3. quantile 算法/插值定义可能不同。
  4. 用全数据计算预处理统计会泄漏。
  5. 总体相关可能掩盖分组反向趋势。

常见问答

Q1:数据很大还需要画图吗?

需要,可用分层抽样、聚合、hexbin 与近似分位数。大数据同样会有系统错误,甚至更难被汇总数字发现。

Q2:应该先删除离群值吗?

先判断来源:错误、不同总体、真实极端还是业务关键。可修正、分层、鲁棒建模、截尾或保留,不能只按 z-score 机械删除。

Q3:为什么 P99 很不稳定?

它由尾部很少观测决定,抽样方差大,数据依赖与时间聚集更明显。应报告区间或按合理窗口聚合。

练习

  1. 均值与中位数分别最适合什么情形?
  2. IQR 如何计算?
  3. 为什么 histogram 需报告 bin 规则?
  4. 缺失填 0 有什么风险?
  5. 给出一个必须分组检查的业务变量。

答案与提示

  1. 均值适合轻尾对称/平方损失,中位数适合偏态重尾/绝对损失。
  2. Q3Q1Q_3-Q_1
  3. bin 可改变多峰、尾部和形状观感。
  4. 把未观测与真实零混合,并可能造成偏差/泄漏。
  5. 如地区、设备、用户新老、时间段、实验组等。