不定积分、定积分与微积分基本定理
层级:B|按需
1. 连续概率为什么需要积分
离散随机变量通过求和计算总概率与期望;连续随机变量要把无穷多个微小区间的概率累积起来,使用积分。理解积分的“累积/面积”含义比熟练大量换元技巧更重要。
2. 原函数与不定积分
若 F′(x)=f(x),称 F 是 f 的一个原函数。所有原函数只差常数:
∫f(x)dx=F(x)+C.
例如
∫x2dx=3x3+C.
因为常数导数为零,必须写积分常数 C。不定积分是原函数族,不是一个确定数值。
3. 定积分是累积量
∫abf(x)dx
可理解为把区间切成许多小段,求矩形面积和的极限:
i∑f(xi∗)Δxi.
若 f≥0,它是曲线下方面积;若函数可负,则是带符号面积。dx 表示积分变量及微小宽度。
4. 微积分基本定理
若 f 连续且 F′=f:
∫abf(x)dx=F(b)−F(a).
它把累积面积问题转成原函数端点差。
另一方向:
G(x)=∫axf(t)dt⇒G′(x)=f(x).
导数与积分在适当条件下互为逆运算。
5. 积分的线性与区间性质
∫ab(αf+βg)dx=α∫abfdx+β∫abgdx,
∫abf=∫acf+∫cbf,
∫baf=−∫abf.
若 f(x)≤g(x),则
∫abf(x)dx≤∫abg(x)dx.
这些性质对应概率可加性、期望线性和分段计算。
6. 常用积分
∫xpdx=p+1xp+1+C(p=−1),
∫x1dx=log∣x∣+C,
∫exdx=ex+C.
高斯积分
∫−∞∞e−x2/2dx=2π
没有初等原函数,但定积分可用二维化与极坐标求出。机器学习中许多积分必须数值计算或近似。
7. 换元积分
若 u=g(x)、du=g′(x)dx:
∫f(g(x))g′(x)dx=∫f(u)du.
定积分还要变换上下限:
∫abf(g(x))g′(x)dx=∫g(a)g(b)f(u)du
(在适当单调/可微条件下)。它是链式法则的逆向。
例:
∫2xex2dx=ex2+C.
8. 分部积分
由乘积法则:
∫udv=uv−∫vdu.
例如
∫xexdx=xex−ex+C.
期望推导、Gamma 函数和某些概率恒等式会用到,但不需进行大量技巧训练。
9. 反常积分
无穷区间或函数在端点无界时,用极限定义:
∫a∞f(x)dx=b→∞lim∫abf(x)dx.
极限存在且有限才称收敛。概率密度必须在整个支持集上积分为 1;若积分发散,就不能归一化为概率分布。
10. 概率密度与概率
连续随机变量密度 p(x)≥0 且
∫−∞∞p(x)dx=1.
区间概率:
P(a≤X≤b)=∫abp(x)dx.
单点概率通常为 0,因为零宽度区间的积分为 0。密度值可大于 1,只要总面积为 1。
期望:
E[g(X)]=∫g(x)p(x)dx.
它是按概率密度加权的连续平均。
11. 累积分布函数
F(x)=P(X≤x)=∫−∞xp(t)dt.
若 F 可微:
F′(x)=p(x).
所以 CDF 是密度的累积,密度是 CDF 的导数。CDF 永远在 [0,1] 且单调不减。
12. 期望对参数求导
若
L(θ)=∫ℓ(θ,x)p(x)dx,
在合适正则条件下:
∇θL=∫∇θℓ(θ,x)p(x)dx.
这支持用 Monte Carlo 样本平均估计梯度。但若分布 pθ 也依赖参数,求导还需考虑密度变化,得到重参数化或 score-function 方法。
易错点
- 不定积分要加常数,定积分结果是数。
- 定积分是带符号面积,函数为负时贡献为负。
- 密度值不是单点概率,可以大于 1。
- 换元时定积分上下限也要换。
- 求导与积分交换需要条件,不是纯形式操作。
常见问答
Q1:机器学习需要会算复杂积分吗?
不需要大量手算。要能读懂密度归一化、边缘化、期望和换元;复杂积分通常用数值法、采样或解析库。
Q2:为什么连续变量 P(X=x)=0 仍可能观察到某个值?
理论精确点概率为零,但观测设备有有限精度,实际记录代表一个小区间。零概率事件并非逻辑上不可能。
Q3:高斯密度最大值能超过 1 吗?
可以。标准差很小时曲线又高又窄,总面积仍为 1。
练习
- 求 ∫023x2dx。
- 若 p(x)=2x 在 [0,1],验证它是密度。
- 求 P(X≤1/2)。
- 求该分布 E[X]。
- 解释为什么 ∫1∞1/xdx 不收敛。
答案与提示
- 8。
- 非负且积分 [x2]01=1。
- ∫01/22xdx=1/4。
- ∫01x(2x)dx=2/3。
- 等于 limb→∞logb=∞。