一元高斯分布
层级:A|必学
1. 高斯分布为何重要
许多小独立影响相加后近似高斯;平方误差对应高斯噪声似然;均值估计在大样本下近似高斯;多种解析推断以高斯为基础。但现实数据并不因为常见就自动高斯,尤其重尾、偏态和多峰数据。
2. 密度
X∼N(μ,σ2),quadσ>0,
f(x)=2πσ21exp[−2σ2(x−μ)2].
- μ:位置/均值;
- σ2:方差;
- σ:标准差。
密度关于 μ 对称,均值=中位数=众数=μ。
3. 标准高斯
Z∼N(0,1).
标准化:
Z=σX−μ.
于是
P(X≤x)=Φ(σx−μ),
Φ 为标准高斯 CDF,没有初等闭式,使用数值库。
4. 68–95–99.7 规则
近似:
P(∣X−μ∣≤σ)≈0.683,
P(∣X−μ∣≤2σ)≈0.954,
P(∣X−μ∣≤3σ)≈0.997.
它只适用于高斯分布。对重尾数据,“3 sigma” 异常率会远高于 0.3%。
5. 线性变换与相加
若 X∼N(μ,σ2):
aX+b∼N(aμ+b,a2σ2).
独立高斯 Xi 的线性组合仍高斯:
i∑aiXi∼N(i∑aiμi,i∑ai2σi2).
联合高斯变量即使相关,线性组合仍高斯,方差需协方差项。
6. 对数密度
logf(x)=−21log(2π)−logσ−2σ2(x−μ)2.
固定 σ 时,最大化高斯似然等价于最小化平方误差。若还估计 σ,不能丢掉 −logσ,否则可通过无意义增大方差减小平方项。
7. MLE
iid 数据:
μ^MLE=xˉ,
σ^MLE2=n1i∑(xi−xˉ)2.
方差 MLE 对总体方差有偏;无偏估计分母用 n−1。MLE 目标和无偏性是不同评价标准。
8. 高斯噪声与最小二乘
回归假设
Y=fθ(X)+ϵ,ϵ∼N(0,σ2).
条件密度:
p(y∣x,θ)=N(y∣fθ(x),σ2).
负对数似然包含平方残差。若误差方差随 x 变化,可让模型同时预测 μ(x) 与 logσ2(x),形成异方差高斯回归。
9. 共轭性
已知方差、均值高斯先验与高斯似然共轭,后验仍高斯。后验精度(方差倒数)等于先验精度与数据精度相加:
τpost=τprior+n/σ2.
后验均值是先验均值与样本均值按精度加权平均。未知均值方差的共轭族为 Normal–Inverse-Gamma 等。
10. 高斯最大熵性质
在均值与方差固定的所有连续分布中,高斯具有最大微分熵。它表示只知道前两阶矩时,选择高斯引入的额外结构最少之一。但“最大熵”依约束和连续坐标,不能用来宣称所有噪声都高斯。
11. 正态性诊断
- histogram/KDE 受 bin/带宽影响;
- Q–Q 图比较分位数,尾部偏离清楚;
- Shapiro 等检验大样本时对微小偏离过于敏感;
- 更重要的是检查推断/预测是否对偏离稳健。
线性回归通常要求条件残差近似满足假设,不要求输入特征本身高斯。
12. 数值计算
尾概率使用 logcdf/logsf,不要用 1-cdf;多个高斯密度相乘在 log 域求和;优化方差用 s=logσ2 参数化保证正数,并对极端值设合理稳定限制。
易错点
- 参数是方差 σ2 还是标准差 σ 要看记号/API。
- 数据均值方差像高斯不证明分布高斯。
- 中心极限定理说和/均值近似高斯,不说原数据高斯。
- 固定方差时平方误差等价;估计方差时不能丢归一化项。
- 输入特征无需高斯,回归误差假设是条件性的。
常见问答
Q1:为什么高斯尾部常低估线上极端延迟?
延迟受排队、重试、共享故障和混合状态影响,常右偏重尾。应建模 log-delay、Gamma/Log-normal、分位数或极值尾部。
Q2:z-score 大于 3 就一定异常吗?
不一定。阈值依分布、样本量、多重比较和业务代价;估计均值方差本身也有不确定性。
Q3:L2 正则与高斯有何联系?
参数高斯先验的负 log 密度是二次项,MAP 对应 L2 惩罚。
练习
- X∼N(2,9) 的均值、标准差。
- Z=(X−2)/3 的分布。
- 独立 X∼N(1,4),Y∼N(2,9),求 X+Y 分布。
- 高斯 MLE 方差分母是什么?无偏估计呢?
- 为什么异方差高斯损失不能只最小化残差除方差?
答案与提示
- 2 与 3。
- N(0,1)。
- N(3,13)。
- n 与 n−1。
- 还需 logσ 归一化惩罚,否则模型会把方差任意放大。