描述统计与数据分布检查
层级:A|必学
1. 建模前先知道数据长什么样
均值与标准差不足以描述偏态、重尾、多峰、缺失、异常和群组差异。描述统计的任务是压缩数据并暴露结构,不是用一个漂亮数字替代检查。
2. 位置统计量
均值
利用全部数值、适合对称轻尾数据,但对极端值敏感。
中位数
排序后 50% 分位数。它最小化绝对偏差和:
对少量离群值稳健。
众数
出现频率最高值;连续数据依赖 bin/KDE,可能多峰或不唯一。
3. 分位数
使约 比例数据不超过它。四分位数 对应 25%、50%、75%。
不同软件有多种插值定义,小样本结果可能不同。报告业务分位数(P50/P90/P99)时固定方法,尤其分布式近似 quantile。
4. 离散程度
- 极差:,极端敏感;
- 方差/标准差:平方偏差;
- IQR:;
- MAD:;
- 变异系数:,仅适合有意义零点、均值非零的比例尺度。
近高斯时 可估标准差(具体 MAD 定义需明确)。
5. 偏度与重尾
正偏/右偏:长右尾,常见延迟、收入;均值常大于中位数。负偏相反。
重尾表示极端值概率比高斯大。样本偏度、峰度对极端值非常敏感,小样本不稳。应结合 log 坐标、Q–Q 图和尾部经验概率。
6. 直方图
bin 宽太大掩盖多峰,太小显示噪声。若 y 轴为 count,柱高是数量;若 density,柱面积和为 1。比较不同样本量组时应使用相同 bin 边界和密度/比例。
不要用截断坐标制造差异,也不要只展示总分布而隐藏分组。
7. 箱线图
常见 Tukey 规则把
外点标记为潜在异常。它是探索规则,不是自动删除标准。大样本或重尾分布自然会有许多“离群点”。
8. ECDF 与 Q–Q 图
经验 CDF 不依赖 bin,能直接读任意阈值比例。Q–Q 图比较样本分位数与参考分布分位数:若近直线则位置尺度后形状相近;尾部偏离提示重尾/轻尾或偏态。
Q–Q 图也可比较两个数据集分布,而不只高斯性。
9. 类别变量
检查:
- 频数与比例;
- 稀有类别;
- 未知/其他类别;
- 类别随时间/群组变化;
- 训练与部署出现的新类别;
- 高基数与疑似标识符。
类别编号的均值通常无语义。
10. 缺失值
至少报告每列、每行/用户、时间和标签组的缺失比例。创建缺失指示变量检查缺失是否与其他特征/结果相关。
把缺失填 0 会混淆真实零;删除缺失行若缺失非完全随机会偏。预处理统计必须只在训练数据拟合。
11. 二变量与多变量检查
- 数值—数值:散点、hexbin、相关与非线性趋势;
- 类别—数值:分组分位数/箱图;
- 类别—类别:列联表、条件比例;
- 高维:相关矩阵、PCA、聚类,但先排除泄漏与 ID。
Simpson 悖论提醒:总体趋势可与分组趋势相反,必须检查关键分层。
12. 数据质量与分布漂移
检查范围、单位、重复、时间戳顺序、逻辑约束、标签延迟、采集版本。训练/验证/线上比较:
- 数值分位数、PSI/KS/Wasserstein;
- 类别比例与新类别;
- 缺失率;
- 特征—标签关系;
- 预测分数与校准。
单变量漂移指标不能捕捉所有联合或条件漂移。
易错点
- 均值标准差不够描述重尾与多峰。
- 箱线图“异常点”不能自动删除。
- quantile 算法/插值定义可能不同。
- 用全数据计算预处理统计会泄漏。
- 总体相关可能掩盖分组反向趋势。
常见问答
Q1:数据很大还需要画图吗?
需要,可用分层抽样、聚合、hexbin 与近似分位数。大数据同样会有系统错误,甚至更难被汇总数字发现。
Q2:应该先删除离群值吗?
先判断来源:错误、不同总体、真实极端还是业务关键。可修正、分层、鲁棒建模、截尾或保留,不能只按 z-score 机械删除。
Q3:为什么 P99 很不稳定?
它由尾部很少观测决定,抽样方差大,数据依赖与时间聚集更明显。应报告区间或按合理窗口聚合。
练习
- 均值与中位数分别最适合什么情形?
- IQR 如何计算?
- 为什么 histogram 需报告 bin 规则?
- 缺失填 0 有什么风险?
- 给出一个必须分组检查的业务变量。
答案与提示
- 均值适合轻尾对称/平方损失,中位数适合偏态重尾/绝对损失。
- 。
- bin 可改变多峰、尾部和形状观感。
- 把未观测与真实零混合,并可能造成偏差/泄漏。
- 如地区、设备、用户新老、时间段、实验组等。