机器学习数学基础 120 章

均匀、指数、Beta 与 Gamma 分布

层级:B|按需

1. 四类常见连续结构

  • Uniform:区间内无偏好;
  • Exponential:Poisson 过程等待时间;
  • Beta:[0,1][0,1] 上的概率参数;
  • Gamma:正数上的等待总时长、率/尺度与先验。

掌握支持集、参数含义、均值方差和常见关系即可。

2. Uniform 分布

XU(a,b),a<b,X\sim U(a,b),\quad a<b, f(x)={1/(ba),axb,0,其他.f(x)=\begin{cases} 1/(b-a),&a\le x\le b,\\ 0,&\text{其他}. \end{cases} E[X]=a+b2,Var(X)=(ba)212.E[X]=\frac{a+b}{2}, \qquad Var(X)=\frac{(b-a)^2}{12}.

区间概率只看长度:

P(cXd)=dcbaP(c\le X\le d)=\frac{d-c}{b-a}

(子区间在支持内)。

Uniform 常用于随机初始化和逆 CDF 采样的基础随机数,但“区间内无信息”依参数化而变,不是普适无信息先验。

3. Exponential 分布

率参数 λ>0\lambda>0

XExp(λ),X\sim Exp(\lambda), f(x)=λeλx,x0.f(x)=\lambda e^{-\lambda x},\quad x\ge0. F(x)=1eλx,S(x)=eλx,F(x)=1-e^{-\lambda x}, \quad S(x)=e^{-\lambda x}, E[X]=1/λ,Var(X)=1/λ2.E[X]=1/\lambda, \qquad Var(X)=1/\lambda^2.

λ\lambda 单位是每单位时间事件率;有些软件用尺度 β=1/λ\beta=1/\lambda

4. Exponential 无记忆性

P(X>s+tX>s)=P(X>t).P(X>s+t|X>s)=P(X>t).

因为

eλ(s+t)eλs=eλt.\frac{e^{-\lambda(s+t)}}{e^{-\lambda s}} =e^{-\lambda t}.

它对应恒定 hazard:已经等待多久不改变接下来瞬时事件率。真实故障率随设备老化时不适合 Exponential。

5. Beta 分布

PBeta(α,β),0<P<1,P\sim Beta(\alpha,\beta),\quad0<P<1, f(p)=1B(α,β)pα1(1p)β1.f(p)=\frac1{B(\alpha,\beta)} p^{\alpha-1}(1-p)^{\beta-1}.

Beta 函数

B(α,β)=Γ(α)Γ(β)Γ(α+β)B(\alpha,\beta) =\frac{\Gamma(\alpha)\Gamma(\beta)} {\Gamma(\alpha+\beta)}

负责归一化。

E[P]=αα+β,E[P]=\frac\alpha{\alpha+\beta}, Var(P)=αβ(α+β)2(α+β+1).Var(P)=\frac{\alpha\beta} {(\alpha+\beta)^2(\alpha+\beta+1)}.

6. Beta 形状与伪计数

  • α=β=1\alpha=\beta=1:Uniform(0,1)(0,1)
  • α,β>1\alpha,\beta>1:内部单峰;
  • 都小于 1:U 形,偏好接近 0/1;
  • α>β\alpha>\beta:质量偏向 1;反之偏向 0。

在 Bernoulli 共轭中,可把 α,β\alpha,\beta 粗略理解为成功/失败伪计数,但不同后验均值公式可能对应 α1\alpha-1 的 mode 解释,不能混用。

观察 ss 成功、ff 失败:

Beta(α,β)Beta(α+s,β+f).Beta(\alpha,\beta)\to Beta(\alpha+s,\beta+f).

7. Gamma 函数

Γ(a)=0xa1exdx,\Gamma(a)=\int_0^\infty x^{a-1}e^{-x}dx, Γ(a+1)=aΓ(a),\Gamma(a+1)=a\Gamma(a),

正整数时

Γ(n)=(n1)!.\Gamma(n)=(n-1)!.

它把阶乘推广到正实数,并出现在多种分布归一化常数中。计算大值使用 lgamma(log Gamma)避免溢出。

8. Gamma 分布

形状 k>0k>0、率 λ>0\lambda>0

XGamma(k,λ),X\sim Gamma(k,\lambda), f(x)=λkΓ(k)xk1eλx,x>0.f(x)=\frac{\lambda^k}{\Gamma(k)} x^{k-1}e^{-\lambda x},\quad x>0. E[X]=k/λ,Var(X)=k/λ2.E[X]=k/\lambda, \qquad Var(X)=k/\lambda^2.

若软件用尺度 θ=1/λ\theta=1/\lambda:均值 kθk\theta、方差 kθ2k\theta^2。参数化差异是常见严重 bug。

9. 等待时间关系

Poisson 过程率为 λ\lambda

  • 第一次事件等待时间 Exp(λ)=Gamma(1,λ)Exp(\lambda)=Gamma(1,\lambda)
  • kk 次事件到达时间 Gamma(k,λ)Gamma(k,\lambda)(整数 kk 时也称 Erlang)。

独立同率 Gamma 的和仍 Gamma,形状相加。

10. Gamma-Poisson 与负二项

若 Poisson 率 Λ\Lambda 本身服从 Gamma,边缘计数是负二项分布,方差大于均值。这给 Poisson 过度离散一个层级解释:不同个体拥有不同潜在事件率。

Gamma 也是 Poisson 率参数的共轭先验(具体更新依 rate/scale 约定)。

11. 采样

  • Uniform 是伪随机生成器基础;
  • Exponential 可用 X=logU/λX=-\log U/\lambda
  • Beta 可由独立 Gamma 比值:G1/(G1+G2)G_1/(G_1+G_2)
  • Gamma 使用 Marsaglia–Tsang 等专用算法。

生产代码应使用经过验证的库,关注参数化与随机数质量。

12. 如何选分布

先看支持和生成机制:

  • 有界区间且平坦:Uniform;
  • 正等待、恒定 hazard:Exponential;
  • 概率/比例:Beta(但比例含大量 0/1 时需零一膨胀);
  • 正连续右偏、等待和/率:Gamma。

再用残差、分位数和后验预测检查,不只看直方图像不像。

易错点

  1. Exponential/Gamma 的 rate 与 scale 互为倒数。
  2. Beta 只支持 (0,1)(0,1),不能直接表示精确 0/1 点质量。
  3. Uniform 先验不在重参数化下保持“无信息”。
  4. Exponential 要求恒定 hazard。
  5. Gamma 函数 Γ(n)=(n1)!\Gamma(n)=(n-1)!,不是 n!n!

常见问答

Q1:Beta 均值能作为平滑概率吗?

可以。Beta-Bernoulli 后验均值 (α+s)/(α+β+n)(\alpha+s)/(\alpha+\beta+n) 是带先验伪计数的平滑估计。

Q2:概率输出为什么有时用 Beta 回归?

当响应是 (0,1)(0,1) 内连续比例且方差随均值变化,Beta 分布比高斯更符合支持;精确边界需额外处理。

Q3:服务延迟适合 Exponential 吗?

可作简单基线,但真实延迟常有重尾、多峰、超时截断与排队依赖,Log-normal、Gamma、Weibull 或混合更常合适。

练习

  1. U(2,6)U(2,6) 的均值与方差。
  2. Exp(λ=2)Exp(\lambda=2) 的均值、方差与 P(X>1)P(X>1)
  3. Beta(2,3)Beta(2,3) 的均值。
  4. Gamma(k=3,rate=2)Gamma(k=3,rate=2) 的均值与方差。
  5. rate=2 对应 scale 是多少?

答案与提示

  1. 4 与 16/12=4/316/12=4/3
  2. 1/2,1/4,e21/2,1/4,e^{-2}
  3. 2/52/5
  4. 3/23/23/43/4
  5. 1/21/2