机器学习数学基础 120 章

总目录与学习路线

本目录按照“读懂机器学习需要什么”组织,而不是按照大学课程的院系边界组织。一个知识点只在最自然的位置详细讲解,其他章节通过链接引用它。

本书共 9 卷、120 个知识点章节。需要直接打开某一文件时,请使用全书章节索引

第一卷:数学语言与初等工具

编号 独立章节 层级 主要用途
01-01 实数、数轴、区间与绝对值 A 定义域、距离、误差
01-02 幂、指数、对数与换底 A 似然、交叉熵、指数族
01-03 集合、命题、逻辑与量词 A 样本空间、假设空间、算法条件
01-04 关系、映射与函数 A 模型、损失函数、复合函数
01-05 方程、不等式与绝对值不等式 A 决策边界、约束、误差界
01-06 求和、连乘、阶乘与组合数 A 经验风险、似然、计数概率
01-07 坐标、距离、直线、平面与超平面 A 线性模型、SVM、聚类
01-08 数学证明、反例、归纳与渐近记号 B 理解定理、复杂度和学习界

第二卷:线性代数

编号 独立章节 层级 主要用途
02-01 标量与向量 A 特征表示、参数表示
02-02 矩阵、形状、索引与数据表 A 数据集、线性变换、批计算
02-03 向量的加减、数乘与线性组合 A 参数更新、表示组合
02-04 矩阵加法、乘法、转置与分块 A 所有线性模型与推导
02-05 内积、夹角、余弦相似度 A 相似性、投影、核方法
02-06 范数与距离 A 损失、正则化、最近邻、聚类
02-07 线性相关、线性无关与生成 B 冗余特征、秩、可辨识性
02-08 向量空间、子空间、基与维数 B 降维、表示空间
02-09 线性方程组与高斯消元 A 最小二乘、数值求解
02-10 矩阵的秩、行空间、列空间与零空间 B 降维、唯一解、欠定问题
02-11 行列式及其几何意义 B 可逆性、变量变换、高斯密度
02-12 逆矩阵与 Moore–Penrose 伪逆 B 闭式解、欠定和超定系统
02-13 线性变换与仿射变换 A 神经网络层、数据变换
02-14 正交、投影与 Gram–Schmidt 正交化 B 最小二乘、PCA、QR
02-15 特征值与特征向量 B PCA、谱聚类、稳定性
02-16 对称矩阵、正定矩阵与二次型 B 协方差、凸性、核函数
02-17 矩阵的迹及常用恒等式 B 矩阵求导、方差、降维
02-18 LU、QR 与 Cholesky 分解 C 稳定求解、最小二乘、采样
02-19 奇异值分解与低秩近似 B PCA、压缩、去噪、推荐
02-20 矩阵微分与常用矩阵导数 B 线性回归、神经网络、优化

第三卷:微积分

编号 独立章节 层级 主要用途
03-01 函数、极限与连续性 A 导数、收敛、近似的基础
03-02 一元导数、切线与变化率 A 损失最小化
03-03 求导法则与一元链式法则 A 复合模型求导
03-04 偏导数、全微分与多元函数 A 多参数模型
03-05 梯度、方向导数与等高线 A 梯度下降、敏感性分析
03-06 Jacobian 矩阵与 Hessian 矩阵 B 向量函数、二阶优化
03-07 多元链式法则、计算图与反向传播 A 神经网络训练
03-08 泰勒展开与局部近似 A 梯度下降、Newton 法、泛化分析
03-09 不定积分、定积分与微积分基本定理 B 连续概率的期望与归一化
03-10 多重积分与变量替换 B 多元密度、边缘化、Jacobian
03-11 凸函数、凹函数与 Jensen 不等式 B 优化、EM、概率界
03-12 指数、对数、Sigmoid、Softmax 与 LogSumExp A 分类模型、稳定计算
03-13 数值微分、梯度检查与近似误差 B 调试反向传播

第四卷:优化方法

编号 独立章节 层级 主要用途
04-01 优化问题、目标函数与局部/全局最优 A 统一理解“训练”
04-02 最小二乘与正规方程 A 线性回归、投影
04-03 梯度下降、步长与收敛直觉 A 基础训练算法
04-04 随机梯度、小批量与在线学习 A 大规模训练
04-05 动量、自适应学习率与学习率计划 B 神经网络优化
04-06 Newton 法与拟 Newton 法 B 二阶优化、逻辑回归
04-07 约束、可行域与投影优化 B SVM、概率参数
04-08 拉格朗日乘子法 B 等式约束、SVM 前置
04-09 KKT 条件与互补松弛 B SVM、稀疏解
04-10 对偶问题与强/弱对偶 B SVM、核技巧
04-11 凸优化与凸优化问题识别 B 全局最优保证
04-12 L1/L2 正则化、稀疏性与几何解释 A 防过拟合、特征选择
04-13 坐标下降与近端梯度 C Lasso、稀疏模型
04-14 交替优化、Jensen 下界与 EM 算法 B 混合模型、隐变量模型

第五卷:概率论

编号 独立章节 层级 主要用途
05-01 随机试验、样本空间、事件与概率公理 A 概率语言的起点
05-02 排列组合与古典概型 B 有限概率、分布计数
05-03 条件概率与乘法公式 A 分类、图模型
05-04 全概率公式与贝叶斯公式 A 贝叶斯分类、后验推断
05-05 独立、条件独立与常见误解 A 朴素贝叶斯、图模型
05-06 随机变量及离散/连续之别 A 用数描述随机结果
05-07 PMF、PDF 与 CDF A 分布的三种描述
05-08 联合分布、边缘分布与条件分布 A 多特征与多变量模型
05-09 数学期望与期望的运算 A 风险、损失、均值
05-10 方差、标准差与高阶矩 A 不确定性、偏差—方差
05-11 协方差与相关系数 A 特征关系、协方差矩阵
05-12 条件期望、全期望与全方差公式 B 分层模型、误差分解
05-13 随机变量函数与分布变换 B 激活变换、变量替换
05-14 随机变量之和与卷积 B 噪声叠加、极限定理
05-15 伯努利、二项、类别与多项分布 A 二分类、多分类、计数
05-16 Poisson 与几何分布 B 事件计数、等待时间
05-17 均匀、指数、Beta 与 Gamma 分布 B 先验、寿命与采样
05-18 一元高斯分布 A 噪声、回归、生成模型
05-19 多元高斯与协方差矩阵 B LDA、GMM、概率图模型
05-20 大数定律与中心极限定理 A 经验均值、正态近似
05-21 Markov、Chebyshev、Hoeffding 等概率界 C 泛化误差与集中性
05-22 随机采样与 Monte Carlo 估计 B 数值积分、近似推断

第六卷:数理统计

编号 独立章节 层级 主要用途
06-01 总体、样本、统计量与经验分布 A 从数据推断规律
06-02 描述统计与数据分布检查 A 建模前的数据理解
06-03 随机样本与抽样分布 B 标准误、置信区间
06-04 点估计、偏差、方差、MSE 与一致性 A 评价估计器
06-05 似然函数与极大似然估计 A 训练概率模型
06-06 最大后验估计与贝叶斯估计 A 先验、正则化
06-07 置信区间与标准误 B 表达估计不确定性
06-08 假设检验、p 值、第一/第二类错误 B 模型和特征检验
06-09 多重比较与选择偏差 C 大量实验、特征筛选
06-10 统计决策、损失、风险与 Bayes 最优 A 分类理论基础
06-11 偏差—方差分解 A 欠拟合与过拟合
06-12 训练集、验证集、交叉验证与自助法 A 模型评估与选择
06-13 线性回归的统计解释 B 噪声假设、区间、诊断
06-14 非参数密度估计、直方图与核密度 B 概率密度估计
06-15 k 近邻密度估计与局部方法 B kNN、异常检测
06-16 隐变量、混合模型与 EM 的统计解释 B GMM、缺失数据

第七卷:信息论

编号 独立章节 层级 主要用途
07-01 信息量与熵 A 决策树、编码、不确定性
07-02 交叉熵与对数损失 A 分类训练目标
07-03 KL 散度及其非对称性 A 分布差异、变分推断
07-04 联合熵、条件熵与互信息 B 特征选择、信息增益
07-05 最大熵原理 C 最大熵模型、指数族
07-06 指数族分布与充分统计量 C 广义线性模型、共轭性

第八卷:图、随机过程与学习理论

编号 独立章节 层级 主要用途
08-01 图、节点、边、路径、连通与树 B 决策树、图模型、聚类
08-02 有向无环图、拓扑序与因子分解 B 贝叶斯网络
08-03 d-分离与条件独立 C 概率图模型结构
08-04 无向图、势函数与因子图 C MRF、CRF
08-05 Markov 链与平稳分布 B MCMC、序列模型
08-06 隐 Markov 模型的概率结构 B 序列建模
08-07 精确推断、变量消元与消息传递 C 图模型推断
08-08 MCMC、Metropolis–Hastings 与 Gibbs 采样 C 近似后验
08-09 Markov 决策过程与 Bellman 方程 B 强化学习
08-10 动态规划、Monte Carlo 与时序差分 B 强化学习算法
08-11 经验风险、期望风险与泛化 B 学习理论入口
08-12 PAC 可学习性与样本复杂度 C “需要多少数据”
08-13 VC 维、增长函数与打散 C 模型容量
08-14 Rademacher 复杂度与稳定性直觉 C 更细的泛化界
08-15 核函数、正定核与 RKHS 直觉 B SVM、核方法

第九卷:数值计算与工程实现

编号 独立章节 层级 主要用途
09-01 浮点数、舍入误差与机器精度 A 避免“公式对、代码错”
09-02 上溢、下溢与数值稳定技巧 A Softmax、似然、归一化
09-03 条件数、病态问题与正则化 B 线性系统、回归
09-04 为什么不应该显式求逆 A 稳定高效的线性代数
09-05 自动微分、符号微分与数值微分 B 深度学习框架原理
09-06 随机数、可复现性与模拟实验 B 初始化、采样、评估

与《机器学习》章节的反向索引

西瓜书主题 优先补习的数学章节
模型评估与选择 06-01~06-12,05-09~05-11,08-11
线性模型 02-01~02-06,03-02~03-08,04-01~04-06,06-05,03-12
决策树 07-01~07-04,05-09,06-10
神经网络 02-04、02-13、03-04~03-08、03-12、04-03~04-05,09-01~09-05
支持向量机 01-07、02-05~02-06、02-16、04-07~04-11、08-15
贝叶斯分类器 05-03~05-19、06-05~06-06、06-10、07-02~07-06
集成学习 05-09~05-12、05-21、06-11、07-02
聚类 02-05~02-06、04-01~04-03、05-19、06-14~06-16
降维与度量学习 02-06、02-10、02-14~02-19、04-02
特征选择与稀疏学习 04-12~04-13、07-04、06-09
计算学习理论 01-03、01-08、05-20~05-21、08-11~08-14
半监督学习 05-08、05-12、08-01~08-05、02-15~02-16
概率图模型 05-03~05-19、08-01~08-08、07-01~07-06
强化学习 05-09、05-12、05-20、08-05、08-09~08-10

建议学习顺序

第一阶段:恢复公式阅读能力(约 20~30 小时)

读完第一卷、02-01~02-06、03-01~03-08、05-01~05-11、06-01~06-06。完成后应能理解线性回归、逻辑回归、决策树和基础神经网络的大部分公式。

第二阶段:打通经典机器学习(约 30~45 小时)

补完 02-09、02-14~02-20、04-01~04-12、05-15~05-20、06-10~06-16、07-01~07-04。完成后可系统阅读 SVM、贝叶斯分类器、集成、聚类与降维。

第三阶段:深入理论与概率模型(约 25~40 小时)

按兴趣学习剩余 B/C 章节,重点是凸对偶、概率界、图模型、学习理论和数值计算。不要把这一阶段当作开始阅读西瓜书的前置条件。