机器学习数学基础 120 章

不定积分、定积分与微积分基本定理

层级:B|按需

1. 连续概率为什么需要积分

离散随机变量通过求和计算总概率与期望;连续随机变量要把无穷多个微小区间的概率累积起来,使用积分。理解积分的“累积/面积”含义比熟练大量换元技巧更重要。

2. 原函数与不定积分

F(x)=f(x)F'(x)=f(x),称 FFff 的一个原函数。所有原函数只差常数:

f(x)dx=F(x)+C.\int f(x)\,dx=F(x)+C.

例如

x2dx=x33+C.\int x^2dx=\frac{x^3}{3}+C.

因为常数导数为零,必须写积分常数 CC。不定积分是原函数族,不是一个确定数值。

3. 定积分是累积量

abf(x)dx\int_a^bf(x)\,dx

可理解为把区间切成许多小段,求矩形面积和的极限:

if(xi)Δxi.\sum_i f(x_i^*)\Delta x_i.

f0f\ge0,它是曲线下方面积;若函数可负,则是带符号面积。dxdx 表示积分变量及微小宽度。

4. 微积分基本定理

ff 连续且 F=fF'=f

abf(x)dx=F(b)F(a).\int_a^bf(x)dx=F(b)-F(a).

它把累积面积问题转成原函数端点差。

另一方向:

G(x)=axf(t)dtG(x)=f(x).G(x)=\int_a^xf(t)dt \quad\Rightarrow\quad G'(x)=f(x).

导数与积分在适当条件下互为逆运算。

5. 积分的线性与区间性质

ab(αf+βg)dx=αabfdx+βabgdx,\int_a^b(\alpha f+\beta g)dx =\alpha\int_a^bfdx+\beta\int_a^bgdx, abf=acf+cbf,\int_a^bf= \int_a^cf+\int_c^bf, baf=abf.\int_b^af=-\int_a^bf.

f(x)g(x)f(x)\le g(x),则

abf(x)dxabg(x)dx.\int_a^bf(x)dx\le\int_a^bg(x)dx.

这些性质对应概率可加性、期望线性和分段计算。

6. 常用积分

xpdx=xp+1p+1+C(p1),\int x^pdx=\frac{x^{p+1}}{p+1}+C \quad(p\ne-1), 1xdx=logx+C,\int\frac1x dx=\log|x|+C, exdx=ex+C.\int e^xdx=e^x+C.

高斯积分

ex2/2dx=2π\int_{-\infty}^{\infty}e^{-x^2/2}dx=\sqrt{2\pi}

没有初等原函数,但定积分可用二维化与极坐标求出。机器学习中许多积分必须数值计算或近似。

7. 换元积分

u=g(x)u=g(x)du=g(x)dxdu=g'(x)dx

f(g(x))g(x)dx=f(u)du.\int f(g(x))g'(x)dx=\int f(u)du.

定积分还要变换上下限:

abf(g(x))g(x)dx=g(a)g(b)f(u)du\int_a^bf(g(x))g'(x)dx =\int_{g(a)}^{g(b)}f(u)du

(在适当单调/可微条件下)。它是链式法则的逆向。

例:

2xex2dx=ex2+C.\int 2xe^{x^2}dx=e^{x^2}+C.

8. 分部积分

由乘积法则:

udv=uvvdu.\int u\,dv=uv-\int v\,du.

例如

xexdx=xexex+C.\int xe^xdx=xe^x-e^x+C.

期望推导、Gamma 函数和某些概率恒等式会用到,但不需进行大量技巧训练。

9. 反常积分

无穷区间或函数在端点无界时,用极限定义:

af(x)dx=limbabf(x)dx.\int_a^\infty f(x)dx =\lim_{b\to\infty}\int_a^bf(x)dx.

极限存在且有限才称收敛。概率密度必须在整个支持集上积分为 1;若积分发散,就不能归一化为概率分布。

10. 概率密度与概率

连续随机变量密度 p(x)0p(x)\ge0

p(x)dx=1.\int_{-\infty}^{\infty}p(x)dx=1.

区间概率:

P(aXb)=abp(x)dx.P(a\le X\le b)=\int_a^bp(x)dx.

单点概率通常为 0,因为零宽度区间的积分为 0。密度值可大于 1,只要总面积为 1。

期望:

E[g(X)]=g(x)p(x)dx.\mathbb E[g(X)] =\int g(x)p(x)dx.

它是按概率密度加权的连续平均。

11. 累积分布函数

F(x)=P(Xx)=xp(t)dt.F(x)=P(X\le x)=\int_{-\infty}^{x}p(t)dt.

FF 可微:

F(x)=p(x).F'(x)=p(x).

所以 CDF 是密度的累积,密度是 CDF 的导数。CDF 永远在 [0,1][0,1] 且单调不减。

12. 期望对参数求导

L(θ)=(θ,x)p(x)dx,L(\theta)=\int\ell(\theta,x)p(x)dx,

在合适正则条件下:

θL=θ(θ,x)p(x)dx.\nabla_\theta L =\int\nabla_\theta\ell(\theta,x)p(x)dx.

这支持用 Monte Carlo 样本平均估计梯度。但若分布 pθp_\theta 也依赖参数,求导还需考虑密度变化,得到重参数化或 score-function 方法。

易错点

  1. 不定积分要加常数,定积分结果是数。
  2. 定积分是带符号面积,函数为负时贡献为负。
  3. 密度值不是单点概率,可以大于 1。
  4. 换元时定积分上下限也要换。
  5. 求导与积分交换需要条件,不是纯形式操作。

常见问答

Q1:机器学习需要会算复杂积分吗?

不需要大量手算。要能读懂密度归一化、边缘化、期望和换元;复杂积分通常用数值法、采样或解析库。

Q2:为什么连续变量 P(X=x)=0P(X=x)=0 仍可能观察到某个值?

理论精确点概率为零,但观测设备有有限精度,实际记录代表一个小区间。零概率事件并非逻辑上不可能。

Q3:高斯密度最大值能超过 1 吗?

可以。标准差很小时曲线又高又窄,总面积仍为 1。

练习

  1. 023x2dx\int_0^2 3x^2dx
  2. p(x)=2xp(x)=2x[0,1][0,1],验证它是密度。
  3. P(X1/2)P(X\le1/2)
  4. 求该分布 E[X]\mathbb E[X]
  5. 解释为什么 11/xdx\int_1^\infty1/x\,dx 不收敛。

答案与提示

  1. 8。
  2. 非负且积分 [x2]01=1[x^2]_0^1=1
  3. 01/22xdx=1/4\int_0^{1/2}2x dx=1/4
  4. 01x(2x)dx=2/3\int_0^1x(2x)dx=2/3
  5. 等于 limblogb=\lim_{b\to\infty}\log b=\infty