线性变换与仿射变换
层级:A|必学
1. 矩阵真正代表的是变换
把矩阵只当数字表,会让矩阵乘法显得人为。把它看成空间之间的函数,旋转、缩放、投影、降维和全连接层便具有统一形式。线性变换保持线性组合,仿射变换在线性变换后再平移。
2. 线性变换的定义
映射 T:Rn→Rm 若对任意向量 x,y 和标量 a,b 满足
T(ax+by)=aT(x)+bT(y),
则为线性变换。等价地,它同时保持加法与数乘:
T(x+y)=T(x)+T(y),T(cx)=cT(x).
取 c=0 可得所有线性变换必须满足
T(0)=0.
所以不把原点映射到原点的变换不是线性的。
3. 每个有限维线性变换都有矩阵表示
在标准基下,令矩阵 A 的第 j 列为 T(ej):
A=[T(e1) ⋯ T(en)].
任意 x=∑jxjej,由线性性
T(x)=j∑xjT(ej)=Ax.
因此理解矩阵各列,就是理解变换如何作用于坐标轴基向量。
4. 典型二维变换
缩放
A=[sx00sy].
沿两个坐标方向分别缩放。
旋转
R(θ)=[cosθsinθ−sinθcosθ].
它保持长度和夹角,且 RTR=I。
反射
[100−1]
关于横轴反射。
投影到横轴
P=[1000].
它丢掉第二维,不可逆,且 P2=P。
剪切
[10k1]
把横坐标按纵坐标平移,保持面积但改变夹角。
5. 核与像
线性变换的核是
kerT={x:T(x)=0}=Null(A),
像是
ImT={T(x):x∈Rn}=Col(A).
核描述被完全丢掉的方向,像描述可达到的输出。线性变换一一对应当且仅当核只有零向量;覆盖整个输出空间当且仅当像等于 Rm。
6. 变换复合
若先用 B,再用 A:
TA(TB(x))=A(Bx)=(AB)x.
所以矩阵乘法顺序从右到左。不同变换通常不交换,例如先投影再旋转与先旋转再投影结果不同。
7. 仿射变换
f(x)=Ax+b
称为仿射变换。它在线性变换后加平移 b,一般 f(0)=b=0,所以严格说不线性。
仿射变换保持仿射组合:若 ∑ici=1,
f(i∑cixi)=i∑cif(xi).
它把直线映为直线、平行线映为平行线,并保持点之间的比例,但不一定保持长度和角度。
8. 用增广坐标合并偏置
定义
x~=[x1],A~=[Ab],
则
Ax+b=A~x~.
在更完整的齐次坐标中还可把仿射变换写成方阵。这解释了为何线性模型常把截距视为恒为 1 的特征,但正则化时通常不惩罚该偏置坐标。
9. 神经网络层
全连接层先做仿射变换
z=Wx+b,
再做非线性激活
h=ϕ(z).
若多层之间没有非线性,
W2(W1x+b1)+b2=(W2W1)x+(W2b1+b2),
仍只是一个仿射变换。无论叠多少层,表达能力都不会超越单层仿射模型,因此激活函数不可缺少。
10. 特征变换与模型线性
模型
f(x)=wTϕ(x)+b
对特征映射后的表示 ϕ(x) 是线性的,但对原始 x 可以是非线性的。例如 ϕ(x)=(x,x2)T 可拟合二次曲线。所谓“线性模型”通常指对参数或所选特征线性,需要看语境。
11. 数据中心化与标准化
中心化 x↦x−μ 是仿射变换;逐特征标准化
x↦D−1(x−μ)
也是仿射变换,其中 D 为尺度对角矩阵。PCA 一般先中心化,因为它寻找围绕均值的线性子空间。
易错点
- Ax+b 有偏置时严格说是仿射,不是线性。
- 线性变换必须把零映到零,但这不是充分条件。
- 矩阵列是基向量的像,行则给出输出坐标的线性函数。
- 多层纯线性网络仍是单个线性/仿射变换。
- 不可逆变换丢失信息,无法从输出唯一恢复输入。
常见问答
Q1:逻辑回归为什么被叫线性模型?
它的 log-odds 对输入是仿射函数,决策边界是超平面;最终概率经过 Sigmoid,整体函数并非严格线性。
Q2:卷积也是线性变换吗?
固定卷积核、不加激活时是线性变换;加偏置后是仿射。卷积利用稀疏连接与参数共享形成特殊矩阵结构。
Q3:标准化是否可逆?
若所有尺度非零且保存均值与尺度,则可逆;零方差特征会造成不可逆或需要特殊处理。
练习
- 判断 T(x)=2x+3 是否为从 R 到 R 的线性变换。
- 写出把二维向量横坐标扩大 3 倍、纵坐标缩小一半的矩阵。
- 矩阵 P=diag(1,0) 的核与像分别是什么?
- 证明两个仿射变换的复合仍是仿射变换。
- 解释没有激活的三层全连接网络为何可合并。
答案与提示
- 不是,T(0)=3=0;它是仿射变换。
- diag(3,1/2)。
- 核为纵轴,像为横轴。
- A2(A1x+b1)+b2=(A2A1)x+(A2b1+b2)。
- 连续矩阵乘积和偏置组合仍可写成单个 Wx+b。