符号约定

记号 含义
R \mathbb{R} 全体实数
R2 \mathbb{R}^2 全体有序实数对 (x,y) (x, y) ,即平面
Rn \mathbb{R}^n 全体 n n 元有序实数组
u,v,w \mathbf{u}, \mathbf{v}, \mathbf{w} 向量(黑体小写字母)
s,t,a,b,c s, t, a, b, c 标量(实数)
0 \mathbf{0} 零向量
span \operatorname{span} 张成(span)
v \lVert \mathbf{v} \rVert 向量的模(长度)
     \iff 当且仅当
\blacksquare 证毕

1. 向量与线性运算

1. 向量的概念

1. 定义

向量是既有大小又有方向的量。具体来说,一个二维向量是一个有序实数对:

v=(v1,  v2),v1,v2R\mathbf{v} = (v_1,\; v_2), \qquad v_1, v_2 \in \mathbb{R}

其中:

  • v1 v_1 v \mathbf{v} 的第一分量(x x 分量)
  • v2 v_2 v \mathbf{v} 的第二分量(y y 分量)

全体二维向量构成的集合记作 R2 \mathbb{R}^2

几何上,把向量 v=(v1,v2) \mathbf{v} = (v_1, v_2) 的起点放在平面直角坐标系的原点,则它的终点落在点 (v1,v2) (v_1, v_2) 上。因此向量可以画成一支从原点出发的箭头:v1 v_1 是箭头终点的横坐标(向右为正),v2 v_2 是纵坐标(向上为正)。代数对象与几何对象一一对应,这是"数形结合"的起点。

类似地,n n 维向量n n 元有序实数组 (v1,v2,,vn) (v_1, v_2, \dots, v_n) ,全体记作 Rn \mathbb{R}^n 。本章为便于画图只讨论 R2 \mathbb{R}^2 ,但所有定义、定理与证明均可逐字推广到 Rn \mathbb{R}^n ——几何直觉先在平面上建立,代数推理天然适用于任意维度。

2. 特性

1. 相等

两个向量 u=(u1,u2) \mathbf{u} = (u_1, u_2) v=(v1,v2) \mathbf{v} = (v_1, v_2) 相等,当且仅当对应分量相等:

u=v    u1=v1 且 u2=v2\mathbf{u} = \mathbf{v} \iff u_1 = v_1 \text{ 且 } u_2 = v_2

几何上,两支箭头长度相等且方向相同,就表示同一个向量。因此向量是"自由"的:把一支箭头在平面内平移,它所代表的向量不变。通俗地说,平面上的箭头按"经平移后能完全重合"分成等价类,一个向量就是一个等价类,而坐标定义 (v1,v2) (v_1, v_2) 直接以数对为对象,回避了等价类的细节。

例如,(3,1) (3, 1) 表示向右 3 个单位、向上 1 个单位的箭头;它与 (1,2) (1, 2) 不相等,因为 31 3 \neq 1 ,第一分量不同。

2. 零向量

分量全为零的向量

0=(0,0)\mathbf{0} = (0, 0)

称为零向量。零向量对应起点与终点重合的箭头,没有确定的方向;约定它与任何向量共线(见 3.3 节)。零向量在线性代数中的地位类似于数 0 0 :它是加法的单位元(见 2.4 节运算律第 3 条)。

3. 模

向量 v=(v1,v2) \mathbf{v} = (v_1, v_2) (长度、范数)定义为

v=v12+v22\lVert \mathbf{v} \rVert = \sqrt{v_1^2 + v_2^2}

几何依据是勾股定理:从原点到终点 (v1,v2) (v_1, v_2) 的箭头,两条直角边长为 v1 \lvert v_1 \rvert v2 \lvert v_2 \rvert ,斜边长即上式。模为 1 1 的向量称为单位向量

模的基本性质:

  1. 非负性v0 \lVert \mathbf{v} \rVert \geq 0
  2. 退化性v=0    v=0 \lVert \mathbf{v} \rVert = 0 \iff \mathbf{v} = \mathbf{0}
  3. 正齐次性sv=sv \lVert s\,\mathbf{v} \rVert = \lvert s \rvert \cdot \lVert \mathbf{v} \rVert

证明:

(1) 因 v120 v_1^2 \geq 0 v220 v_2^2 \geq 0 ,故 v12+v220 v_1^2 + v_2^2 \geq 0 ,算术平方根非负。

(2) 若 v=0 \mathbf{v} = \mathbf{0} ,显然 v=0 \lVert \mathbf{v} \rVert = 0 。反之,若 v=0 \lVert \mathbf{v} \rVert = 0 ,则 v12+v22=0 v_1^2 + v_2^2 = 0 ;实数的平方非负,两个非负数之和为零必须每一项为零,故 v1=v2=0 v_1 = v_2 = 0 ,即 v=0 \mathbf{v} = \mathbf{0}

(3) 按定义展开:

sv2=(sv1)2+(sv2)2=s2(v12+v22)=s2v2\lVert s\,\mathbf{v} \rVert^2 = (s v_1)^2 + (s v_2)^2 = s^2\,(v_1^2 + v_2^2) = \lvert s \rvert^2\, \lVert \mathbf{v} \rVert^2

其中用到 s2=s2 s^2 = \lvert s \rvert^2 。两边均为非负数,开平方得 sv=sv \lVert s\mathbf{v} \rVert = \lvert s \rvert \lVert \mathbf{v} \rVert \blacksquare

由正齐次性,任何非零向量都可分解为

v=vv^,v^=1vv,v^=1\mathbf{v} = \lVert \mathbf{v} \rVert \cdot \hat{\mathbf{v}}, \qquad \hat{\mathbf{v}} = \frac{1}{\lVert \mathbf{v} \rVert}\,\mathbf{v}, \qquad \lVert \hat{\mathbf{v}} \rVert = 1

通俗地说,数乘把向量拆成"长度 × \times 单位方向",大小与方向由此分离。

例如,(3,4)=5 \lVert (3, 4) \rVert = 5 (3,4) (3, 4) 的单位方向是 (35,45) (\tfrac{3}{5}, \tfrac{4}{5}) ;而 2(3,4)=25=10 \lVert -2 \cdot (3,4) \rVert = \lvert -2 \rvert \cdot 5 = 10

2. 线性运算

1. 向量加法

u=(u1,u2) \mathbf{u} = (u_1, u_2) v=(v1,v2) \mathbf{v} = (v_1, v_2) ,它们的定义为对应分量相加:

u+v=(u1+v1,  u2+v2)\mathbf{u} + \mathbf{v} = (u_1 + v_1,\; u_2 + v_2)

几何意义是位移的相继发生(三角形法则):先沿 u \mathbf{u} 走一段位移,再沿 v \mathbf{v} 走一段位移,总位移就是 u+v \mathbf{u} + \mathbf{v} 。画图时,把 v \mathbf{v} 的起点平移到 u \mathbf{u} 的终点,从 u \mathbf{u} 的起点指向 v \mathbf{v} 的终点的箭头即为 u+v \mathbf{u} + \mathbf{v}

代数与几何的一致性:从原点沿 u \mathbf{u} 到达 (u1,u2) (u_1, u_2) ,再沿 v \mathbf{v} 走意味着横坐标再增加 v1 v_1 、纵坐标再增加 v2 v_2 ,终点为 (u1+v1,  u2+v2) (u_1 + v_1,\; u_2 + v_2) ——正是定义的右端。可见"分量相加"不是人为规定,而是位移合成这一几何事实的代数写照。

u,v \mathbf{u}, \mathbf{v} 都以原点为起点时,u+v \mathbf{u} + \mathbf{v} 恰好是以 u,v \mathbf{u}, \mathbf{v} 为邻边的平行四边形的对角线,称为平行四边形法则(图 1-1)。

2. 标量乘法

sR s \in \mathbb{R} v=(v1,v2) \mathbf{v} = (v_1, v_2) 数乘定义为每个分量同乘 s s

sv=(sv1,  sv2)s\,\mathbf{v} = (s\,v_1,\; s\,v_2)

几何意义(图 1-2):

  • s>1 s > 1 :方向不变,长度拉伸为原来的 s s 倍(如 2v 2\mathbf{v}
  • 0<s<1 0 < s < 1 :方向不变,长度缩短(如 0.5v 0.5\mathbf{v}
  • s=0 s = 0 :得到零向量 0 \mathbf{0}
  • s<0 s < 0 :方向反转,长度变为 s \lvert s \rvert 倍(如 v -\mathbf{v}

其中"长度变为 s \lvert s \rvert 倍"的严格依据是模的正齐次性(见 1.2 节模的性质 3),而非图形直觉。

3. 负向量与减法

u:=(1)u,uv:=u+(v)-\mathbf{u} := (-1)\,\mathbf{u}, \qquad \mathbf{u} - \mathbf{v} := \mathbf{u} + (-\mathbf{v})

u -\mathbf{u} u \mathbf{u} 长度相等(u=1u \lVert -\mathbf{u} \rVert = \lvert -1 \rvert \lVert \mathbf{u} \rVert )、方向相反。uv \mathbf{u} - \mathbf{v} 的几何形象是"从 v \mathbf{v} 的终点指向 u \mathbf{u} 的终点"的那支箭头(平移到原点)。验证减法确为加法的逆运算:

(uv)+v=u+(v)+v=u+((v)+v)=u+0=u(\mathbf{u}-\mathbf{v})+\mathbf{v} = \mathbf{u}+(-\mathbf{v})+\mathbf{v} = \mathbf{u}+\bigl((-\mathbf{v})+\mathbf{v}\bigr) = \mathbf{u}+\mathbf{0} = \mathbf{u}

每一步分别用了减法定义、结合律、交换律与负元、零元——运算律是推理的"合法手续",这是第一个实例。

4. 运算律

对任意 u,v,wR2 \mathbf{u}, \mathbf{v}, \mathbf{w} \in \mathbb{R}^2 s,tR s, t \in \mathbb{R}

名称 数学表达式
加法交换律 u+v=v+u \mathbf{u} + \mathbf{v} = \mathbf{v} + \mathbf{u}
加法结合律 (u+v)+w=u+(v+w) (\mathbf{u} + \mathbf{v}) + \mathbf{w} = \mathbf{u} + (\mathbf{v} + \mathbf{w})
零元 u+0=u \mathbf{u} + \mathbf{0} = \mathbf{u}
负元 u+(1)u=0 \mathbf{u} + (-1)\mathbf{u} = \mathbf{0}
数乘结合律 s(tu)=(st)u s(t\mathbf{u}) = (st)\mathbf{u}
单位标量 1u=u 1\mathbf{u} = \mathbf{u}
分配律(对向量加法) s(u+v)=su+sv s(\mathbf{u} + \mathbf{v}) = s\mathbf{u} + s\mathbf{v}
分配律(对标量加法) (s+t)u=su+tu (s+t)\mathbf{u} = s\mathbf{u} + t\mathbf{u}

证明:

通用策略:按分量展开,把向量的等式化归为实数的等式。由向量相等的定义,只需分别验证两个分量。记 u=(u1,u2) \mathbf{u} = (u_1, u_2) v=(v1,v2) \mathbf{v} = (v_1, v_2) w=(w1,w2) \mathbf{w} = (w_1, w_2)

(1) u+v \mathbf{u}+\mathbf{v} 的第一分量为 u1+v1 u_1 + v_1 v+u \mathbf{v}+\mathbf{u} 的第一分量为 v1+u1 v_1 + u_1 ;由实数加法交换律二者相等。第二分量同理。

(2) (u+v)+w (\mathbf{u}+\mathbf{v})+\mathbf{w} 的第一分量为 (u1+v1)+w1 (u_1+v_1)+w_1 u+(v+w) \mathbf{u}+(\mathbf{v}+\mathbf{w}) 的第一分量为 u1+(v1+w1) u_1+(v_1+w_1) ;由实数加法结合律二者相等。第二分量同理。

(3) u+0=(u1+0,  u2+0)=(u1,u2)=u \mathbf{u}+\mathbf{0} = (u_1+0,\; u_2+0) = (u_1, u_2) = \mathbf{u} ,用了实数的零元性质。

(4) u+(1)u=(u1+(u1),  u2+(u2))=(0,0)=0 \mathbf{u}+(-1)\mathbf{u} = (u_1+(-u_1),\; u_2+(-u_2)) = (0,0) = \mathbf{0} ,用了实数的负元性质。

(5) s(tu) s(t\mathbf{u}) 的第一分量为 s(tu1) s(tu_1) (st)u (st)\mathbf{u} 的第一分量为 (st)u1 (st)u_1 ;由实数乘法结合律二者相等。第二分量同理。

(6) 1u=(1u1,  1u2)=(u1,u2)=u 1\mathbf{u} = (1 \cdot u_1,\; 1 \cdot u_2) = (u_1, u_2) = \mathbf{u}

(7) s(u+v) s(\mathbf{u}+\mathbf{v}) 的第一分量为 s(u1+v1) s(u_1+v_1) su+sv s\mathbf{u}+s\mathbf{v} 的第一分量为 su1+sv1 su_1+sv_1 ;由实数乘法对加法的分配律二者相等。第二分量同理。

(8) (s+t)u (s+t)\mathbf{u} 的第一分量为 (s+t)u1 (s+t)u_1 su+tu s\mathbf{u}+t\mathbf{u} 的第一分量为 su1+tu1 su_1+tu_1 ;由实数分配律(另一方向)二者相等。第二分量同理。 \blacksquare

通俗地说,向量的运算律不需要重新发明,它们全部按分量继承自实数的运算律——"数"的规则自动升维到"形"的世界。这八条定律是后文一切推理的合法手续(3.6 节的证明将逐步引用它们),也是"线性空间"公理体系的原型。

3. 线性组合与张成

1. 线性组合

u,vR2 \mathbf{u}, \mathbf{v} \in \mathbb{R}^2 a,bR a, b \in \mathbb{R} 。形如

au+bva\,\mathbf{u} + b\,\mathbf{v}

的向量称为 u \mathbf{u} v \mathbf{v} 线性组合a,b a, b 称为组合系数。

线性组合是线性代数中最重要的概念——线性方程组、矩阵乘法、基与坐标,本质上都在回答同一个问题:哪些向量能表示成哪些向量的线性组合。

e1=(1,0) \mathbf{e}_1 = (1, 0) e2=(0,1) \mathbf{e}_2 = (0, 1) 。对任意 (x,y)R2 (x, y) \in \mathbb{R}^2

xe1+ye2=(x,  y)x\,\mathbf{e}_1 + y\,\mathbf{e}_2 = (x,\; y)

即平面上任何向量都是 e1,e2 \mathbf{e}_1, \mathbf{e}_2 的线性组合,且系数恰好就是它的坐标。通俗地说,坐标的本质就是相对于这组"标准参考方向"的组合系数。

2. 张成

向量 u,v \mathbf{u}, \mathbf{v} 的全体线性组合构成的集合称为它们的张成

span{u,v}={au+bv  :  a,bR}\operatorname{span}\{\mathbf{u}, \mathbf{v}\} = \{\, a\mathbf{u} + b\mathbf{v} \;:\; a, b \in \mathbb{R} \,\}

几何直觉:固定两支箭头 u,v \mathbf{u}, \mathbf{v} ,让系数取遍所有实数,问"用它们能够到平面上的哪些点"。答案只有三种可能:

  1. u=v=0 \mathbf{u} = \mathbf{v} = \mathbf{0} :一切组合都是 0 \mathbf{0} ,张成退化为一个点
  2. u,v \mathbf{u}, \mathbf{v} 共线(至少一个非零):张成是一条过原点的直线(图 1-3)
  3. u,v \mathbf{u}, \mathbf{v} 不共线且都非零:张成是整个平面 R2 \mathbb{R}^2 (图 1-4)

情形 2、3 的严格证明见 3.5 节。

3. 共线

u,v \mathbf{u}, \mathbf{v} 称为共线的(平行,记作 uv \mathbf{u} \parallel \mathbf{v} ),如果存在 cR c \in \mathbb{R} 使 u=cv \mathbf{u} = c\mathbf{v} ,或存在 cR c \in \mathbb{R} 使 v=cu \mathbf{v} = c\mathbf{u}

该定义涵盖"某个向量是零向量"的情形:零向量与任何向量共线,因为 0=0u \mathbf{0} = 0 \cdot \mathbf{u} 恒成立。若两个向量都非零,则共线等价于"终点落在同一条过原点的直线上"(习题 1.6)。

4. 判别式

u=(u1,u2) \mathbf{u} = (u_1, u_2) v=(v1,v2) \mathbf{v} = (v_1, v_2) ,定义

D=u1v2u2v1D = u_1 v_2 - u_2 v_1

引理(共线判别)v0 \mathbf{v} \neq \mathbf{0} ,则

uv    D=u1v2u2v1=0\mathbf{u} \parallel \mathbf{v} \iff D = u_1 v_2 - u_2 v_1 = 0

证明:

\Leftarrow )设 D=0 D = 0 ,即 u1v2=u2v1 u_1 v_2 = u_2 v_1 。因 v0 \mathbf{v} \neq \mathbf{0} v1,v2 v_1, v_2 至少一个非零。不妨设 v10 v_1 \neq 0 (若 v1=0 v_1 = 0 v20 v_2 \neq 0 ,对换下标 1、2 后以下论证逐字成立)。取 c=u1/v1 c = u_1 / v_1 ,则第一分量 u1=cv1 u_1 = c v_1 ;第二分量由条件及 v10 v_1 \neq 0

u2=u1v2v1=(cv1)v2v1=cv2u_2 = \frac{u_1 v_2}{v_1} = \frac{(c v_1) v_2}{v_1} = c v_2

u=cv \mathbf{u} = c\mathbf{v} ,共线。

\Rightarrow )若 u=cv \mathbf{u} = c\mathbf{v} ,则

D=(cv1)v2(cv2)v1=c(v1v2v2v1)=0D = (c v_1) v_2 - (c v_2) v_1 = c\,(v_1 v_2 - v_2 v_1) = 0 \qquad \blacksquare

数形结合:D \lvert D \rvert 恰好等于 u,v \mathbf{u}, \mathbf{v} 张成的平行四边形的面积(见 3.7 节)。"D=0 D = 0 "在几何上就是平行四边形被压扁成一条线段(面积为零),即两向量共线。这个量是行列式的二维雏形。

5. 张成平面判定定理

定理u,vR2 \mathbf{u}, \mathbf{v} \in \mathbb{R}^2 均非零,则以下三个命题等价:

span{u,v}=R2    u,v 不共线    D=u1v2u2v10\operatorname{span}\{\mathbf{u}, \mathbf{v}\} = \mathbb{R}^2 \iff \mathbf{u}, \mathbf{v} \text{ 不共线} \iff D = u_1 v_2 - u_2 v_1 \neq 0

证明:

采用「① \Rightarrow \Rightarrow \Rightarrow ①」的环形证法:其中 ②      \iff ③ 已由共线判别引理沟通(不共线     D0 \iff D \neq 0 ),故只需再证 ① \Rightarrow ② 与 ③ \Rightarrow ① 两个蕴含。

(③ \Rightarrow ①:D0span=R2 D \neq 0 \Rightarrow \operatorname{span} = \mathbb{R}^2 任取 w=(w1,w2)R2 \mathbf{w} = (w_1, w_2) \in \mathbb{R}^2 ,要找系数 a,b a, b 使 au+bv=w a\mathbf{u} + b\mathbf{v} = \mathbf{w} 。按分量写出,这是一个关于 a,b a, b 的二元一次方程组:

{au1+bv1=w1au2+bv2=w2\begin{cases} a\,u_1 + b\,v_1 = w_1 \\ a\,u_2 + b\,v_2 = w_2 \end{cases}

第一式乘 v2 v_2 、第二式乘 v1 v_1 ,相减消去 b b

a(u1v2u2v1)=w1v2w2v1,aD=w1v2w2v1a\,(u_1 v_2 - u_2 v_1) = w_1 v_2 - w_2 v_1, \qquad\text{即}\qquad a\,D = w_1 v_2 - w_2 v_1

D0 D \neq 0 ,可解出 a=w1v2w2v1D a = \dfrac{w_1 v_2 - w_2 v_1}{D} 。对称地,第一式乘 u2 u_2 、第二式乘 u1 u_1 相减(消去 a a ),得 b(v1u2v2u1)=w1u2w2u1 b\,(v_1 u_2 - v_2 u_1) = w_1 u_2 - w_2 u_1 ;分子分母同乘 1 -1 ,即 b=u1w2u2w1D b = \dfrac{u_1 w_2 - u_2 w_1}{D}

代回验证:

au+bv=((w1v2w2v1)u1+(u1w2u2w1)v1D,    (w1v2w2v1)u2+(u1w2u2w1)v2D)a\mathbf{u} + b\mathbf{v} = \left( \frac{(w_1 v_2 - w_2 v_1)u_1 + (u_1 w_2 - u_2 w_1)v_1}{D},\;\; \frac{(w_1 v_2 - w_2 v_1)u_2 + (u_1 w_2 - u_2 w_1)v_2}{D} \right)

考察第一个分量的分子,展开并重新分组:

w1u1v2w2u1v1+u1w2v1u2w1v1=w1(u1v2u2v1)+(w2u1v1+u1w2v1)=0=w1Dw_1 u_1 v_2 - w_2 u_1 v_1 + u_1 w_2 v_1 - u_2 w_1 v_1 = w_1 (u_1 v_2 - u_2 v_1) + \underbrace{(- w_2 u_1 v_1 + u_1 w_2 v_1)}_{=\,0} = w_1 D

故第一个分量 =w1D/D=w1 = w_1 D / D = w_1 。同理第二个分量 =w2 = w_2 。于是 au+bv=w a\mathbf{u} + b\mathbf{v} = \mathbf{w} 。由 w \mathbf{w} 任意,span{u,v}=R2 \operatorname{span}\{\mathbf{u},\mathbf{v}\} = \mathbb{R}^2

(① \Rightarrow ②:span=R2 \operatorname{span} = \mathbb{R}^2 \Rightarrow 不共线) 反证。假设 u,v \mathbf{u}, \mathbf{v} 共线。因二者均非零,由引理存在 c c 使 u=cv \mathbf{u} = c\mathbf{v} 。于是任意线性组合

au+bv=a(cv)+bv=(ac)v+bv=(ac+b)va\mathbf{u} + b\mathbf{v} = a(c\mathbf{v}) + b\mathbf{v} = (ac)\mathbf{v} + b\mathbf{v} = (ac + b)\,\mathbf{v}

三步依次用了替换、数乘结合律、分配律。令 t=ac+b t = ac + b ,则 span{u,v}={tv:tR} \operatorname{span}\{\mathbf{u},\mathbf{v}\} = \{t\mathbf{v} : t \in \mathbb{R}\} ,这是过原点、方向为 v \mathbf{v} 的直线:每个 tv t\mathbf{v} 的终点 (tv1,tv2) (t v_1, t v_2) 满足直线方程(若 v10 v_1 \neq 0 ,由 x=tv1 x = t v_1 解出 t=x/v1 t = x/v_1 ,代入得 y=v2v1x y = \tfrac{v_2}{v_1} x ;若 v1=0 v_1 = 0 x0 x \equiv 0 ,是竖直直线);反之该直线上任一点都形如 tv t\mathbf{v}

但这条直线不等于整个平面:取向量 w=(v2,  v1) \mathbf{w} = (-v_2,\; v_1) ,计算它与 v \mathbf{v} 的判别式

D(v,w)=v1v1v2(v2)=v12+v22=v2>0D(\mathbf{v}, \mathbf{w}) = v_1 \cdot v_1 - v_2 \cdot (-v_2) = v_1^2 + v_2^2 = \lVert \mathbf{v} \rVert^2 > 0

(最后一步用了 v0 \mathbf{v} \neq \mathbf{0} 与模的退化性),故由引理,w \mathbf{w} v \mathbf{v} 不共线,即 w{tv}=span{u,v} \mathbf{w} \notin \{t\mathbf{v}\} = \operatorname{span}\{\mathbf{u},\mathbf{v}\} 。这与 span{u,v}=R2 \operatorname{span}\{\mathbf{u},\mathbf{v}\} = \mathbb{R}^2 矛盾。故 u,v \mathbf{u}, \mathbf{v} 不共线。

三个命题环形贯通,定理得证。 \blacksquare

数形结合:图 1-4 中橙色小点是所有整数系数组合 au+bv a\mathbf{u}+b\mathbf{v} a,bZ a,b \in \mathbb{Z} )的终点,构成一张倾斜的网格。定理说明:当系数从整数放宽到全部实数时,这张网格密密地铺满整个平面(证明还给出了到达任一点 w \mathbf{w} 的精确"导航系数" a,b a, b )。而图 1-3 中共线的情形,无论如何放宽系数,点永远被限制在一条直线上——“一个方向"只能换来"一条轨道”。

例如,u=(3,1) \mathbf{u} = (3,1) v=(1,2) \mathbf{v} = (1,2) D=3211=50 D = 3 \cdot 2 - 1 \cdot 1 = 5 \neq 0 ,二者张成整个平面。取 w=(2,5) \mathbf{w} = (2, 5)

a=22515=15,b=35125=135a = \frac{2 \cdot 2 - 5 \cdot 1}{5} = -\frac{1}{5}, \qquad b = \frac{3 \cdot 5 - 1 \cdot 2}{5} = \frac{13}{5}

代回验证:15(3,1)+135(1,2)=(35+135,  15+265)=(2,5) -\tfrac{1}{5}(3,1) + \tfrac{13}{5}(1,2) = (-\tfrac{3}{5}+\tfrac{13}{5},\; -\tfrac{1}{5}+\tfrac{26}{5}) = (2, 5) \checkmark

6. 张成的封闭性

定理 对任意 u,vR2 \mathbf{u}, \mathbf{v} \in \mathbb{R}^2 ,集合 span{u,v} \operatorname{span}\{\mathbf{u}, \mathbf{v}\} 满足:

  1. 对加法封闭:若 x,yspan{u,v} \mathbf{x}, \mathbf{y} \in \operatorname{span}\{\mathbf{u}, \mathbf{v}\} ,则 x+yspan{u,v} \mathbf{x} + \mathbf{y} \in \operatorname{span}\{\mathbf{u}, \mathbf{v}\}
  2. 对数乘封闭:若 xspan{u,v} \mathbf{x} \in \operatorname{span}\{\mathbf{u}, \mathbf{v}\} cR c \in \mathbb{R} ,则 cxspan{u,v} c\,\mathbf{x} \in \operatorname{span}\{\mathbf{u}, \mathbf{v}\}

证明:

由张成的定义,存在实数 a1,b1,a2,b2 a_1, b_1, a_2, b_2 使

x=a1u+b1v,y=a2u+b2v\mathbf{x} = a_1 \mathbf{u} + b_1 \mathbf{v}, \qquad \mathbf{y} = a_2 \mathbf{u} + b_2 \mathbf{v}

(1) 由结合律与交换律,向量的连加可以任意重排次序与括号,故

x+y=(a1u+b1v)+(a2u+b2v)=(a1u+a2u)+(b1v+b2v)\mathbf{x} + \mathbf{y} = (a_1 \mathbf{u} + b_1 \mathbf{v}) + (a_2 \mathbf{u} + b_2 \mathbf{v}) = (a_1 \mathbf{u} + a_2 \mathbf{u}) + (b_1 \mathbf{v} + b_2 \mathbf{v})

再由分配律合并同类项:

x+y=(a1+a2)u+(b1+b2)v\mathbf{x} + \mathbf{y} = (a_1 + a_2)\,\mathbf{u} + (b_1 + b_2)\,\mathbf{v}

这是 u,v \mathbf{u}, \mathbf{v} 的线性组合,故 x+yspan{u,v} \mathbf{x}+\mathbf{y} \in \operatorname{span}\{\mathbf{u},\mathbf{v}\}

(2) 由分配律与数乘结合律:

cx=c(a1u+b1v)=c(a1u)+c(b1v)=(ca1)u+(cb1)vc\,\mathbf{x} = c\,(a_1 \mathbf{u} + b_1 \mathbf{v}) = c\,(a_1 \mathbf{u}) + c\,(b_1 \mathbf{v}) = (c a_1)\,\mathbf{u} + (c b_1)\,\mathbf{v}

cxspan{u,v} c\mathbf{x} \in \operatorname{span}\{\mathbf{u},\mathbf{v}\} \blacksquare

通俗地说,张成是一块"自给自足"的区域:从里面任取向量做线性运算,结果跑不出去。若张成是一条直线(图 1-3),直线上两支向量相加、数乘仍在直线上;若张成是全平面(图 1-4),更无处可逃。具有这种封闭性的集合将来称为线性子空间。请注意证明的每一步都在引用运算律——没有那八条合法手续,这里连一步都迈不出去。

7. 面积解释(选学)

定理0,u,u+v,v \mathbf{0}, \mathbf{u}, \mathbf{u}+\mathbf{v}, \mathbf{v} 为顶点的平行四边形的面积等于

u1v2u2v1=D\lvert u_1 v_2 - u_2 v_1 \rvert = \lvert D \rvert

证明(割补法)分三步。

第 1 步(剪切引理):把 v \mathbf{v} 换成 v=v+tu \mathbf{v}' = \mathbf{v} + t\mathbf{u} (沿 u \mathbf{u} 的方向"推歪",称为剪切),平行四边形面积不变。旧平行四边形顶点为 0,u,u+v,v \mathbf{0}, \mathbf{u}, \mathbf{u}+\mathbf{v}, \mathbf{v} ,新顶点为 0,u,u+v,v \mathbf{0}, \mathbf{u}, \mathbf{u}+\mathbf{v}', \mathbf{v}' 。设 t>0 t > 0 t<0 t < 0 同理)。沿平行于 u \mathbf{u} 的直线把旧平行四边形靠 v \mathbf{v} 一侧切下一个三角形,平移补到另一侧:割下的三角形与新补上的三角形三边分别相等(两条边是 u \mathbf{u} 方向上等长的平行线段,第三条边公共),由三角形全等判定(SSS)二者恰好拼合,得到新平行四边形,面积不变——剪切保面积。

第 2 步(剪成矩形):若 u10 u_1 \neq 0 ,取 t=v1/u1 t = -v_1/u_1 ,则

v=v+tu=(0,  v2v1u1u2)\mathbf{v}' = \mathbf{v} + t\mathbf{u} = \left(0,\; v_2 - \tfrac{v_1}{u_1} u_2\right)

的第一分量为零,成为竖直向量。再对 u \mathbf{u} 做一次剪切(第 1 步中交换 u,v \mathbf{u}, \mathbf{v}' 的角色):若 v0 \mathbf{v}' \neq \mathbf{0} ,取剪切量把 u \mathbf{u} 变为水平向量 u=(u1,0) \mathbf{u}' = (u_1, 0) 。于是原平行四边形经过两次保面积的剪切,变成由 (u1,0) (u_1, 0) (0,h) (0, h) (其中 h=v2v1u1u2 h = v_2 - \tfrac{v_1}{u_1} u_2 )张成的矩形,其面积为

u1h=u1(v2v1u1u2)=u1v2u2v1=D\lvert u_1 \rvert \cdot \lvert h \rvert = \left\lvert u_1 \left(v_2 - \tfrac{v_1}{u_1} u_2\right) \right\rvert = \lvert u_1 v_2 - u_2 v_1 \rvert = \lvert D \rvert

第 3 步(退化情形):若 u1=0 u_1 = 0 u \mathbf{u} 竖直)且 u0 \mathbf{u} \neq \mathbf{0} ,改为沿 u \mathbf{u} 剪切 v \mathbf{v} 使其水平,同理得矩形面积 u2v1=D \lvert u_2 v_1 \rvert = \lvert D \rvert 。若剪切后 h=0 h = 0 ,即 D=0 D = 0 ,平行四边形退化为一条线段,面积 0=D 0 = \lvert D \rvert ,公式仍成立。 \blacksquare

这个定理说明:D D 的符号记录了从 u \mathbf{u} 转到 v \mathbf{v} 是逆时针(D>0 D > 0 )还是顺时针(D<0 D < 0 ),即定向;D \lvert D \rvert 记录了面积,即测度。一个两行的代数式同时编码了方向与大小,这是行列式在高维的完整推广的预告。

4. 演示图像

配套演示程序(仅依赖 C++ 标准库)把本章内容绘制为 PPM 图像,输出于 output/chapter1/ 目录。图像采用 PPM(P6)格式:文件头为文本(格式标识、宽、高、最大颜色值),其后逐像素存放 R、G、B 三个字节,任何常见看图软件均可打开。

坐标映射(数形结合的代码体现):数学坐标 (x,y) (x, y) 以原点居中、y y 轴向上,而图像像素的 y y 轴向下,程序中的换算为

px=W2+xunit,py=H2yunit\text{px} = \frac{W}{2} + \lfloor x \cdot \text{unit} \rceil, \qquad \text{py} = \frac{H}{2} - \lfloor y \cdot \text{unit} \rceil

其中 unit 是每数学单位的像素数。第二个式子中的减号正是"翻转 y y 轴"这一几何动作留下的代数痕迹。

图像文件 内容 对应正文
output/chapter1/fig_1_1_addition.ppm 平行四边形法则 图 1-1,2.1 节
output/chapter1/fig_1_2_scalar.ppm 数乘的伸缩与反向 图 1-2,2.2 节
output/chapter1/fig_1_3_span_line.ppm 共线向量的张成是一条直线 图 1-3,3.5 节
output/chapter1/fig_1_4_span_plane.ppm 不共线向量的组合铺满平面 图 1-4,3.5 节

图 1-1(fig_1_1_addition.ppm:深色背景上有单位网格;红色箭头为 u=(3,1) \mathbf{u}=(3,1) ,蓝色箭头为 v=(1,2) \mathbf{v}=(1,2) ,两条灰色辅助线把二者的终点连成平行四边形,绿色箭头 u+v=(4,3) \mathbf{u}+\mathbf{v}=(4,3) 恰好沿对角线——这就是交换律的几何面貌。

图 1-2(fig_1_2_scalar.ppm:四支箭头 v \mathbf{v} (蓝)、2v 2\mathbf{v} (红)、0.5v 0.5\mathbf{v} (橙)、v -\mathbf{v} (紫)全部落在过原点的同一条直线上——数乘不改变"所在直线",只改变"走多远、朝哪头"。

图 1-3(fig_1_3_span_line.ppm:方向 d=(2,1) \mathbf{d}=(2,1) 的灰色直线贯穿画布,橙色点是整数倍的 d \mathbf{d} 。即便系数取遍全体实数,也只能在这条直线上滑动。

图 1-4(fig_1_4_span_plane.ppm:以 u=(1.5,0.5) \mathbf{u}=(1.5,0.5) (红)、v=(0.5,1.5) \mathbf{v}=(-0.5,1.5) (蓝)为"斜坐标轴"(D=1.5×1.50.5×(0.5)=2.50 D = 1.5 \times 1.5 - 0.5 \times (-0.5) = 2.5 \neq 0 ),橙色格点铺开成覆盖整个画布的倾斜网格——不共线的两个方向足以够到平面上的每一点。

5. 小结

概念 代数形式 几何形象
向量 有序实数对 (v1,v2) (v_1, v_2) 原点出发的一支箭头(平移不变)
加法 对应分量相加 三角形 / 平行四边形法则
数乘 每个分量同乘 s s 沿原方向伸缩,s<0 s < 0 时反向
v12+v22 \sqrt{v_1^2 + v_2^2} 箭头长度(勾股定理)
线性组合 au+bv a\mathbf{u} + b\mathbf{v} 用两个方向"搭配"出新向量
张成 全体组合的集合 点 / 直线 / 全平面,对线性运算封闭
判别式 D D u1v2u2v1 u_1 v_2 - u_2 v_1 平行四边形有向面积(D=0     D = 0 \iff 共线)

三条主线:

  1. 运算律免费继承:向量运算的全部性质按分量归结为实数运算律,而运算律是后文一切推理的合法手续(3.6 节的证明即为示范)。
  2. 大小与方向分离v=vv^ \mathbf{v} = \lVert \mathbf{v} \rVert \cdot \hat{\mathbf{v}} ——数乘把向量拆成长度与单位方向。
  3. D D 预告了行列式:判定共线与否的量同时是面积——代数判别式与几何测度合二为一。

如果 u,v \mathbf{u}, \mathbf{v} 共线,那么其中一个是"冗余"的——去掉一个,张成不变(习题 1.7)。把"冗余"精确化,就得到线性无关与基的概念,这是下一章的主题。

6. 习题

  1. (证明细节补全) 2.4 节运算律证明中多处写了"第二分量同理"。以 (1)、(5)、(7)、(8) 四条为例,把"同理"部分的实数等式逐一写出,并指明每一步用的是实数的哪条运算律。
  2. (几何证明) 只用三角形法则的图形(不用分量),解释加法结合律 (u+v)+w=u+(v+w) (\mathbf{u}+\mathbf{v})+\mathbf{w} = \mathbf{u}+(\mathbf{v}+\mathbf{w}) :三支箭头首尾相接,两种"加括号"方式为何指向同一终点?
  3. (模的计算)
    (a) 求 e1+e2 \lVert \mathbf{e}_1 + \mathbf{e}_2 \rVert ,并说明它就是单位正方形的对角线长;
    (b) 求 (6,8) (6, 8) (6,8) (-6, 8) 的模,解释为何二者相等——模丢失了什么信息?
    © 求 (6,8) (6, 8) 的单位方向向量 v^ \hat{\mathbf{v}} ,并验证 v=vv^ \mathbf{v} = \lVert \mathbf{v} \rVert \hat{\mathbf{v}}
  4. (张成计算) u=(1,1) \mathbf{u}=(1,1) v=(1,1) \mathbf{v}=(1,-1)
    (a) 计算 D D ,判断它们是否张成 R2 \mathbb{R}^2
    (b) 用 3.5 节的公式求 a,b a, b 使 au+bv=(2,3) a\mathbf{u} + b\mathbf{v} = (2, 3) ,并代回验证;
    © 求 a,b a, b 使 au+bv=(1,0) a\mathbf{u} + b\mathbf{v} = (1, 0) 。由此写出用 u,v \mathbf{u},\mathbf{v} 表示 e1 \mathbf{e}_1 的表达式——你刚刚完成了一次"换基"。
  5. (退化情形) 证明:span{u}={0}    u=0 \operatorname{span}\{\mathbf{u}\} = \{\mathbf{0}\} \iff \mathbf{u} = \mathbf{0} ;若 u0 \mathbf{u} \neq \mathbf{0} ,则 span{u} \operatorname{span}\{\mathbf{u}\} 是过原点的直线。(提示:后者可仿照 3.5 节证明中的直线方程论证。)
  6. (定义的刻画)u,v \mathbf{u}, \mathbf{v} 均非零。证明:u,v \mathbf{u}, \mathbf{v} 共线      \iff u \mathbf{u} v \mathbf{v} 的终点落在同一条过原点的直线上。
  7. (冗余性)u,v \mathbf{u}, \mathbf{v} 共线且均非零。证明 span{u,v}=span{u}=span{v} \operatorname{span}\{\mathbf{u}, \mathbf{v}\} = \operatorname{span}\{\mathbf{u}\} = \operatorname{span}\{\mathbf{v}\} ——去掉任何一个,张成不变。
  8. (编程) 修改配套演示程序中绘制向量加法的函数:先画 u+v \mathbf{u}+\mathbf{v} (绿),再从 v \mathbf{v} 的终点出发、用黄色箭头按三角形法则画一遍 v+u \mathbf{v}+\mathbf{u} 的路径。重新运行,观察两支和向量完全重合——你"看见"了交换律。
  9. (编程) 仿照图 1-4 的演示,取 u=(1,0) \mathbf{u}=(1,0) v=(2,0) \mathbf{v}=(2,0) (共线),画出整数系数组合 au+bv a\mathbf{u}+b\mathbf{v} 的点。观察所有点退化到 x x 轴上——你"看见"了 3.5 节定理的第二步与习题 7 的"冗余性"。
  10. (向 n n 维推广) 把运算律 (1)(交换律)与 (7)(分配律)的证明逐字改写到 Rn \mathbb{R}^n :设 u=(u1,,un) \mathbf{u}=(u_1,\dots,u_n) 等,验证所有分量。体会代数推理天然适用于任意维度。
  11. (思考) 三维空间 R3 \mathbb{R}^3 中,一个非零向量的张成是什么?两个不共线向量的张成是什么?三个向量何时能张成整个 R3 \mathbb{R}^3 ?(提示:类比"点 \to 线 \to \to 体"的升维模式。)

2. 线性无关与基

第一章末尾留下了一个问题:若两个向量共线,其中一个就是"冗余"的——去掉它,张成不变。本章把"冗余"精确化为线性相关,把"不多不少、恰好够用"的向量组精确化为,并回答一个根本问题:平面的"维数"到底是什么意思?

1. 线性相关与线性无关

1. 定义

v1,v2,,vkR2 \mathbf{v}_1, \mathbf{v}_2, \dots, \mathbf{v}_k \in \mathbb{R}^2 k k 为任意正整数)。若存在不全为零的实数 a1,,ak a_1, \dots, a_k ,使得

a1v1+a2v2++akvk=0a_1 \mathbf{v}_1 + a_2 \mathbf{v}_2 + \cdots + a_k \mathbf{v}_k = \mathbf{0}

则称向量组 {v1,,vk} \{\mathbf{v}_1, \dots, \mathbf{v}_k\} 线性相关;否则称为线性无关。线性无关的含义是:只要

a1v1++akvk=0a_1 \mathbf{v}_1 + \cdots + a_k \mathbf{v}_k = \mathbf{0}

就必有 a1==ak=0 a_1 = \cdots = a_k = 0 ——只有零组合才能抵消回原点

其中"不全为零"指 a1,,ak a_1, \dots, a_k 中至少一个不为零。本章重点讨论 k=1 k = 1 k=2 k = 2 的情形;k3 k \geq 3 的情形将在 3.6 节登场。

几何解读:

  • 线性相关:组内方向"互相欠债"——存在一种非零的搭配,使几段位移首尾相接恰好走回原点,说明有的方向可由其余方向"赔付"(2.1 节的冗余定理将严格化这句话)
  • 线性无关:除全部系数取零外,任何组合都回不到原点——组内方向彼此独立,谁也替代不了谁(图 2-1 与图 2-2 是两种情形的对照)

2. 特性

1. 含零向量必相关

u=0 \mathbf{u} = \mathbf{0} ,则对任何 v \mathbf{v} ,取 a=1,  b=0 a = 1,\; b = 0

10+0v=01 \cdot \mathbf{0} + 0 \cdot \mathbf{v} = \mathbf{0}

系数 (1,0) (1, 0) 不全为零,故 {u,v} \{\mathbf{u}, \mathbf{v}\} 线性相关。通俗地说,零向量是"天生的冗余":它自己就能和自己抵消(10=0 1 \cdot \mathbf{0} = \mathbf{0} )。

2. 单个向量的相关性

{v} 线性相关    v=0\{\mathbf{v}\} \text{ 线性相关} \iff \mathbf{v} = \mathbf{0}

证明:

\Leftarrow )若 v=0 \mathbf{v} = \mathbf{0} ,则 1v=0 1 \cdot \mathbf{v} = \mathbf{0} ,系数非零,相关。

\Rightarrow )设相关,则存在 a0 a \neq 0 使 av=0 a\mathbf{v} = \mathbf{0} 。于是

v=1v=(1aa)v=1a(av)=1a0=0\mathbf{v} = 1 \cdot \mathbf{v} = \left(\tfrac{1}{a} \cdot a\right)\mathbf{v} = \tfrac{1}{a}\,(a\mathbf{v}) = \tfrac{1}{a}\,\mathbf{0} = \mathbf{0}

三步依次用了单位标量律、数乘结合律与条件 av=0 a\mathbf{v} = \mathbf{0} \blacksquare

即:单个非零向量线性无关——一个非零方向不欠任何债。

3. 两个向量:相关当且仅当共线

定理u,vR2 \mathbf{u}, \mathbf{v} \in \mathbb{R}^2 ,则 {u,v} \{\mathbf{u}, \mathbf{v}\} 线性相关      \iff u,v \mathbf{u}, \mathbf{v} 共线(第一章 3.3 节)。

证明:

\Leftarrow )设共线。若其一为零向量,由特性 1 已相关;若均非零,由共线定义存在 c c 使 u=cv \mathbf{u} = c\mathbf{v} ,于是用分配律(对标量加法)与实数的负元性质:

1u+(c)v=cv+(c)v=(c+(c))v=0v=01 \cdot \mathbf{u} + (-c) \cdot \mathbf{v} = c\mathbf{v} + (-c)\mathbf{v} = (c + (-c))\,\mathbf{v} = 0 \cdot \mathbf{v} = \mathbf{0}

系数 (1,c) (1, -c) 中第一个为 10 1 \neq 0 ,不全为零,相关。

\Rightarrow )设相关,存在 (a,b)(0,0) (a, b) \neq (0, 0) 使 au+bv=0 a\mathbf{u} + b\mathbf{v} = \mathbf{0}

  • b0 b \neq 0 :移项得 bv=(a)u b\mathbf{v} = (-a)\mathbf{u} (用了负元与交换律),两边同乘 1/b 1/b 并用数乘结合律,得

v=(ab)u\mathbf{v} = \left(-\tfrac{a}{b}\right)\mathbf{u}

v \mathbf{v} u \mathbf{u} 的倍数,共线。

  • b=0 b = 0 :则 a0 a \neq 0 au=0 a\mathbf{u} = \mathbf{0} ,由特性 2 的论证得 u=0 \mathbf{u} = \mathbf{0} ,而零向量与任何向量共线。 \blacksquare

证明中的每一步移项、约分都在引用第一章 2.4 节的运算律——八条合法手续再次上岗。

2. 线性相关的刻画

1. 冗余定理

定理 {u,v} \{\mathbf{u}, \mathbf{v}\} 线性相关      \iff 其中一个向量可由另一个线性表示(是另一个的实数倍)。

证明:

\Leftarrow )设 u=cv \mathbf{u} = c\mathbf{v} ,则如 1.3 节所示,(1,c) (1, -c) 是不全为零的抵消组合,相关。

\Rightarrow )设相关。若其一为零向量,则 0=0w \mathbf{0} = 0 \cdot \mathbf{w} w \mathbf{w} 为另一个),已得表示;若均非零,由 1.3 节定理二者共线,即存在 c c 使 u=cv \mathbf{u} = c\mathbf{v} (或 v=cu \mathbf{v} = c\mathbf{u} ),得表示。 \blacksquare

冗余定理给"冗余"以精确含义:相关组中必有一个成员是多余的——删去它,张成不变(习题 2.8;亦即第一章习题 1.7 的另一面)。线性无关则刻画"无冗余":谁也不能由谁赔出来。图 2-1 中 v=0.5u \mathbf{v} = 0.5\,\mathbf{u} ,删掉任何一个,剩下的仍张成同一条直线。

2. 判别式判定

第一章的判别式 D D 在此成为唯一的判官。

定理u=(u1,u2) \mathbf{u} = (u_1, u_2) v=(v1,v2) \mathbf{v} = (v_1, v_2) ,则

{u,v} 线性无关    D=u1v2u2v10\{\mathbf{u}, \mathbf{v}\} \text{ 线性无关} \iff D = u_1 v_2 - u_2 v_1 \neq 0

证明:

au+bv=0 a\mathbf{u} + b\mathbf{v} = \mathbf{0} 按分量写出,得到关于 a,b a, b 的齐次线性方程组:

{au1+bv1=0au2+bv2=0\begin{cases} a\,u_1 + b\,v_1 = 0 \\ a\,u_2 + b\,v_2 = 0 \end{cases}

第一式乘 v2 v_2 、第二式乘 v1 v_1 相减(消去 b b ),得 aD=0 a\,D = 0 ;对称地,第一式乘 u2 u_2 、第二式乘 u1 u_1 相减(消去 a a ),得 b(v1u2v2u1)=0 b\,(v_1 u_2 - v_2 u_1) = 0 ,即 bD=0 -b\,D = 0

D0 D \neq 0 :由 aD=0 a D = 0 bD=0 b D = 0 (乘积为零且一个因子非零,则另一个为零)得 a=b=0 a = b = 0 。故零组合只有零系数,无关。

D=0 D = 0 :要证相关。若 v=0 \mathbf{v} = \mathbf{0} ,取 (a,b)=(0,1) (a, b) = (0, 1) 即可;若 v0 \mathbf{v} \neq \mathbf{0} ,由第一章 3.4 节引理(D=0 D = 0 v0 \mathbf{v} \neq \mathbf{0} )得存在 c c 使 u=cv \mathbf{u} = c\mathbf{v} ,于是 (1,c) (1, -c) 是不全为零的抵消组合,相关。 \blacksquare

数形结合:D=0 D = 0 意味着平行四边形面积归零(第一章 3.7 节)——两个方向压扁到一条线上,自然可以互相抵消;D0 D \neq 0 则两个方向撑开一块真正的"面",谁也替代不了谁。

3. 四条命题的汇合

综合第一章 3.5 节(张成平面判定定理)与本章 1.3、2.2 节,对均非零的两个向量 u,v \mathbf{u}, \mathbf{v} ,以下命题两两等价:

命题 出处
D=u1v2u2v10 D = u_1 v_2 - u_2 v_1 \neq 0 第一章 3.4 节引理
u,v \mathbf{u}, \mathbf{v} 不共线 第一章 3.3 节
span{u,v}=R2 \operatorname{span}\{\mathbf{u}, \mathbf{v}\} = \mathbb{R}^2 第一章 3.5 节
{u,v} \{\mathbf{u}, \mathbf{v}\} 线性无关 本章 2.2 节

代数(方程组只有零解)、几何(面积非零)、结构(无冗余、张成全平面)在判别式 D D 上会师——这正是"基"概念的入口。

3. 基与坐标

1. 定义(基)

若向量组 {u,v} \{\mathbf{u}, \mathbf{v}\} 同时满足:

  1. 够用span{u,v}=R2 \operatorname{span}\{\mathbf{u}, \mathbf{v}\} = \mathbb{R}^2 (平面上任何向量都能表示成它们的线性组合)
  2. 无冗余{u,v} \{\mathbf{u}, \mathbf{v}\} 线性无关(每个成员都不可替代)

则称 {u,v} \{\mathbf{u}, \mathbf{v}\} R2 \mathbb{R}^2 的一组

通俗地说,基是平面的"最省料脚手架":两个方向足够搭到平面任何角落(够用),而且一个都不能少(无冗余)。

注记:在 R2 \mathbb{R}^2 中,当向量个数恰为 2 时,条件 1 与条件 2 互相蕴含(2.3 节的等价表)——这是"向量个数等于维数"的二维巧合。但当向量个数不是 2 时二者不再等价:3 个向量可以够用却有冗余,1 个向量无冗余却不够用(见 3.6 节)。因此定义按两个条件给出,这套模式将原封不动地推广到高维。

2. 标准基

e1=(1,0),e2=(0,1)\mathbf{e}_1 = (1, 0), \qquad \mathbf{e}_2 = (0, 1)

  • 够用:任何 (x,y)=xe1+ye2 (x, y) = x\,\mathbf{e}_1 + y\,\mathbf{e}_2 (第一章 3.1 节)
  • 无冗余ae1+be2=(a,b)=0 a\,\mathbf{e}_1 + b\,\mathbf{e}_2 = (a, b) = \mathbf{0} 迫使 a=b=0 a = b = 0

{e1,e2} \{\mathbf{e}_1, \mathbf{e}_2\} 是一组基,称为标准基。我们从小使用的"坐标",就是向量关于标准基的组合系数。

3. 坐标:存在且唯一

定理(坐标的存在性与唯一性){u,v} \{\mathbf{u}, \mathbf{v}\} R2 \mathbb{R}^2 的一组基,则任意 wR2 \mathbf{w} \in \mathbb{R}^2 恰有一对系数 (a,b) (a, b) 使

w=au+bv\mathbf{w} = a\,\mathbf{u} + b\,\mathbf{v}

这对系数 (a,b) (a, b) 称为 w \mathbf{w} 在基 {u,v} \{\mathbf{u}, \mathbf{v}\} 下的坐标

证明:

存在性:由条件 1(张成),wspan{u,v} \mathbf{w} \in \operatorname{span}\{\mathbf{u},\mathbf{v}\} ,故至少存在一组表示。

唯一性:设有两组 w=au+bv=au+bv \mathbf{w} = a\,\mathbf{u} + b\,\mathbf{v} = a'\,\mathbf{u} + b'\,\mathbf{v} 。两式相减(第一章减法定义与分配律):

0=ww=(aa)u+(bb)v\mathbf{0} = \mathbf{w} - \mathbf{w} = (a - a')\,\mathbf{u} + (b - b')\,\mathbf{v}

由条件 2(无关),必须 aa=0 a - a' = 0 bb=0 b - b' = 0 ,即两组系数相同。 \blacksquare

存在性保证"到得了",唯一性保证"导航指令唯一"——这正是"坐标"一词的全部含义。求解坐标只需解二元一次方程组,第一章 3.5 节的消元法已给出公式:

a=w1v2w2v1D,b=u1w2u2w1D,D=u1v2u2v1a = \frac{w_1 v_2 - w_2 v_1}{D}, \qquad b = \frac{u_1 w_2 - u_2 w_1}{D}, \qquad D = u_1 v_2 - u_2 v_1

分母非零正是"基"的保证(2.2 节判定定理)。

例如,取基 u=(1.5,0.5) \mathbf{u} = (1.5, 0.5) v=(0.5,1.5) \mathbf{v} = (-0.5, 1.5) D=2.5 D = 2.5 ),求 w=(2,3) \mathbf{w} = (2, 3) 的坐标:

a=2×1.53×(0.5)2.5=4.52.5=1.8,b=1.5×30.5×22.5=3.52.5=1.4a = \frac{2 \times 1.5 - 3 \times (-0.5)}{2.5} = \frac{4.5}{2.5} = 1.8, \qquad b = \frac{1.5 \times 3 - 0.5 \times 2}{2.5} = \frac{3.5}{2.5} = 1.4

代回验证:1.8(1.5,0.5)+1.4(0.5,1.5)=(2.70.7,  0.9+2.1)=(2,3) 1.8\,(1.5, 0.5) + 1.4\,(-0.5, 1.5) = (2.7 - 0.7,\; 0.9 + 2.1) = (2, 3) \checkmark (图 2-3)

4. 换基:坐标是"相对的"

同一个向量 w=(2,3) \mathbf{w} = (2, 3)

  • 在标准基 {e1,e2} \{\mathbf{e}_1, \mathbf{e}_2\} 下,坐标是 (2,3) (2, 3)
  • 在斜基 {u,v} \{\mathbf{u}, \mathbf{v}\} 下,坐标是 (1.8,1.4) (1.8, 1.4)

向量本身没有变,坐标却变了——坐标是相对于基的读数,不是向量的固有属性。这就像同一座山,从南门与从北门测得的方位数据不同:山(向量)是客观的,读数(坐标)依赖于参照系(基)。基改变时坐标如何换算,是下一章(矩阵)的核心问题之一。

5. 基的最小性

定理{u,v} \{\mathbf{u}, \mathbf{v}\} 是基,则去掉任何一个向量后,张成严格变小:

span{u}span{u,v}=R2\operatorname{span}\{\mathbf{u}\} \subsetneq \operatorname{span}\{\mathbf{u}, \mathbf{v}\} = \mathbb{R}^2

证明:

首先 span{u}R2 \operatorname{span}\{\mathbf{u}\} \subseteq \mathbb{R}^2 显然(第一章 3.6 节封闭性的特例)。要证严格小,需找一个属于 R2 \mathbb{R}^2 但不属于 span{u} \operatorname{span}\{\mathbf{u}\} 的向量——v \mathbf{v} 就是候选。

由无关性,v \mathbf{v} 不是 u \mathbf{u} 的倍数(否则由冗余定理相关);而 span{u}={tu} \operatorname{span}\{\mathbf{u}\} = \{t\,\mathbf{u}\} 恰是 u \mathbf{u} 的全体倍数(第一章习题 1.5),故 vspan{u} \mathbf{v} \notin \operatorname{span}\{\mathbf{u}\} \blacksquare

(图 2-4:完整的基铺满整个画布;去掉 v \mathbf{v} 后只剩一条黄色直线——“少一个方向,丢失整个平面”。)

这解释了"无冗余"的结构含义:基的每个成员都承担着不可替代的覆盖任务。因此基是最小的张成组——任何更少(只含 1 个向量)的组都张不成 R2 \mathbb{R}^2

6. 维数

基恰好含两个向量,这不是巧合,而是"二维"这个词的数学来源。

引理(三向量必相关) R2 \mathbb{R}^2 中任意三个向量 p,q,r \mathbf{p}, \mathbf{q}, \mathbf{r} 线性相关。

证明:

p,q \mathbf{p}, \mathbf{q} 是否共线分类:

  1. p,q \mathbf{p}, \mathbf{q} 共线:由 1.3 节定理,存在不全为零的 (α,β) (\alpha, \beta) 使 αp+βq=0 \alpha\,\mathbf{p} + \beta\,\mathbf{q} = \mathbf{0} ,于是

αp+βq+0r=0\alpha\,\mathbf{p} + \beta\,\mathbf{q} + 0 \cdot \mathbf{r} = \mathbf{0}

系数 (α,β,0) (\alpha, \beta, 0) 不全为零(α,β \alpha, \beta 至少一个非零),故 {p,q,r} \{\mathbf{p}, \mathbf{q}, \mathbf{r}\} 相关。

  1. p,q \mathbf{p}, \mathbf{q} 不共线:由第一章 3.5 节定理,span{p,q}=R2 \operatorname{span}\{\mathbf{p}, \mathbf{q}\} = \mathbb{R}^2 ,故 r \mathbf{r} 可表示为 r=ap+bq \mathbf{r} = a\,\mathbf{p} + b\,\mathbf{q} (3.3 节存在性)。于是

(a)p+(b)q+1r=0(-a)\,\mathbf{p} + (-b)\,\mathbf{q} + 1 \cdot \mathbf{r} = \mathbf{0}

系数第三个为 10 1 \neq 0 ,不全为零,相关。 \blacksquare

定理(基的大小唯一) R2 \mathbb{R}^2 的任何一组基都恰含 2 个向量。

证明:

一组基必须同时够用与无冗余:

  • 不能只含 1 个向量:单个向量的张成是 {0} \{\mathbf{0}\} 或一条过原点的直线(第一章习题 1.5),达不到 R2 \mathbb{R}^2 ——不够用。
  • 不能含 3 个及以上向量:从中任取三个向量,由引理它们线性相关;把这三个的非零抵消组合补上系数 0(对应其余成员)后仍是整组的非零抵消组合,故整组线性相关——违反无冗余。("部分相关则整体相关"的一般论证见习题 2.7。)
  • 恰含 2 个是可行的:标准基即实例。 \blacksquare

于是定义:R2 \mathbb{R}^2 维数

dimR2=2\dim \mathbb{R}^2 = 2

维数 = 基的大小 = 张成全平面所需的最少向量数 = 保持线性无关的最多向量数。它不依赖基的选择——任何基都恰含 2 个向量。

通俗地说,平面的"自由度"是 2:锁定平面上的一个向量需要且只需要 2 个独立读数。基就是这 2 个读数的测量方向——方向可以任选(不共线即可),但读数的个数(维数)是空间自身的属性,谁也改不了。

4. 演示图像

配套演示程序(仅依赖 C++ 标准库)把本章内容绘制为 PPM 图像,输出于 output/chapter2/ 目录。

图像文件 内容 对应正文
output/chapter2/fig_2_1_dependent.ppm 线性相关:共线冗余与非零抵消 图 2-1,1.2 与 2.1 节
output/chapter2/fig_2_2_independent.ppm 线性无关:斜坐标网 图 2-2,2.2 节
output/chapter2/fig_2_3_coordinates.ppm 基与坐标:换基与平行四边形分解 图 2-3,3.3 与 3.4 节
output/chapter2/fig_2_4_minimal.ppm 基的最小性:去掉一向量张成跌为直线 图 2-4,3.5 节

图 2-1(fig_2_1_dependent.ppmu=(2,1) \mathbf{u}=(2,1) (红)与 v=(1,0.5) \mathbf{v}=(1,0.5) (蓝)共线(v=0.5u \mathbf{v} = 0.5\mathbf{u} )。全部整数系数组合(橙色小点)无论怎样搭配都困在灰色直线上;绿色箭头 2v 2\mathbf{v} 恰好压在红色箭头 u \mathbf{u} 上——u2v=0 \mathbf{u} - 2\mathbf{v} = \mathbf{0} ,一个非零组合把两个方向"抵消回零",这就是线性相关的几何面貌。

图 2-2(fig_2_2_independent.ppmu=(1.5,0.5) \mathbf{u}=(1.5,0.5) (红)与 v=(0.5,1.5) \mathbf{v}=(-0.5,1.5) (蓝),D=2.50 D = 2.5 \neq 0 ,线性无关。青色线族是"u \mathbf{u} 坐标取定值"的点集(沿 v \mathbf{v} 方向的整条直线),黄色线族是"v \mathbf{v} 坐标取定值"的点集——两族线织成覆盖整个平面的斜坐标网。原点处的绿点标记唯一能"抵消回零"的组合 0u+0v 0\mathbf{u} + 0\mathbf{v}

图 2-3(fig_2_3_coordinates.ppmw=(2,3) \mathbf{w} = (2,3) (绿)在标准基下坐标为 (2,3) (2, 3) ;在斜基 {u,v} \{\mathbf{u}, \mathbf{v}\} 下解得 w=1.8u+1.4v \mathbf{w} = 1.8\mathbf{u} + 1.4\mathbf{v} 。红色路径"先沿 u \mathbf{u} 方向走 1.8 步、再沿 v \mathbf{v} 方向走 1.4 步"与蓝色路径"先 v \mathbf{v} u \mathbf{u} "殊途同归于 w \mathbf{w} 的终点——平行四边形分解就是坐标的几何形象,两个橙色点标记中途落点 au a\mathbf{u} bv b\mathbf{v}

图 2-4(fig_2_4_minimal.ppm:完整的基 {u,v} \{\mathbf{u}, \mathbf{v}\} 的整数组合铺满整个画布(橙色点阵);去掉 v \mathbf{v} 后,张成收缩为黄色直线——基中没有任何可删的成员,“少一个方向,丢失整个平面”。

5. 小结

概念 代数形式 几何形象
线性相关 存在非零系数使组合为零 方向冗余:可抵消回原点(图 2-1)
线性无关 组合为零 \Rightarrow 系数全零 方向独立:除零外无法抵消(图 2-2)
冗余定理 相关      \iff 一个是另一个的倍数 删掉冗余成员,张成不变
判别式判定 无关     D0 \iff D \neq 0 平行四边形有面积
张成 R2 \mathbb{R}^2 且线性无关 恰好够用的两个方向
坐标 w=au+bv \mathbf{w} = a\mathbf{u} + b\mathbf{v} 的唯一 (a,b) (a, b) 斜方向上的导航指令(图 2-3)
最小性 去掉任何成员张成变小 少一个方向,丢失整个平面(图 2-4)
维数 dimR2=2 \dim \mathbb{R}^2 = 2 自由度为 2

三条主线:

  1. 相关/无关是"共线"的方程组语言D=0     D = 0 \iff 齐次方程组有非零解      \iff 共线      \iff 有冗余——判别式 D D 依然是唯一的判官。
  2. 基 = 够用 + 无冗余:坐标是相对于基的读数,其唯一性恰由无关性保证;换基改变坐标,不改变向量。
  3. 维数第一次获得精确定义:任何基都恰含 2 个向量——"二维"不再是日常语言,而是定理。

给定基,求坐标就是解线性方程组——下一章把解方程组的过程本身组织成一种新的对象(矩阵),让"换基"“求解”"变换"拥有统一的代数语言。

6. 习题

  1. (定义辨析) 判断对错并说明理由:
    (a) 若 u,v \mathbf{u}, \mathbf{v} 线性相关,则其中必有一个是零向量;
    (b) 任何包含零向量的向量组线性相关;
    © 若 au+bv=0 a\mathbf{u} + b\mathbf{v} = \mathbf{0} a=0 a = 0 ,则 {u,v} \{\mathbf{u}, \mathbf{v}\} 线性无关。
  2. (判定计算) 用判别式 D D 判定下列向量组的相关性:
    (a) (1,2),  (2,4) (1, 2),\; (2, 4)
    (b) (1,2),  (2,3) (1, 2),\; (2, 3)
    © (3,0),  (0,3) (3, 0),\; (0, -3)
    (d) 0,  (1,1) \mathbf{0},\; (1, 1)
  3. (证明){u,v} \{\mathbf{u}, \mathbf{v}\} 线性无关,证明 {u+v,  uv} \{\mathbf{u} + \mathbf{v},\; \mathbf{u} - \mathbf{v}\} 也线性无关。(提示:设 a(u+v)+b(uv)=0 a(\mathbf{u}+\mathbf{v}) + b(\mathbf{u}-\mathbf{v}) = \mathbf{0} ,用分配律整理为 (a+b)u+(ab)v=0 (a+b)\mathbf{u} + (a-b)\mathbf{v} = \mathbf{0} ,再解关于 a,b a, b 的方程组。)
  4. (坐标计算) 取基 u=(1,1) \mathbf{u} = (1, 1) v=(1,1) \mathbf{v} = (1, -1)
    (a) 求 w=(3,1) \mathbf{w} = (3, 1) 在该基下的坐标;
    (b) 求 e1=(1,0) \mathbf{e}_1 = (1, 0) 在该基下的坐标——标准基的基向量在别的基下另有坐标,这正是"换基"。
  5. (反例)u=(1,0) \mathbf{u} = (1, 0) v=(2,0) \mathbf{v} = (2, 0) (线性相关)。写出 w=(3,0) \mathbf{w} = (3, 0) 的两组不同表示,说明相关的组不能给出唯一坐标(对照 3.3 节唯一性定理中"无关"条件的作用)。
  6. (证明) 证明:{u,  u+v} \{\mathbf{u},\; \mathbf{u} + \mathbf{v}\} 线性无关      \iff {u,v} \{\mathbf{u}, \mathbf{v}\} 线性无关。(两个方向的证明都可从"设组合为零,整理系数"入手。)
  7. (推广)k3 k \geq 3 ,向量组中某三个成员线性相关。证明整组线性相关(3.6 节定理证明中用到的事实)。
  8. (冗余定理的结构){u,v} \{\mathbf{u}, \mathbf{v}\} 线性相关且 v0 \mathbf{v} \neq \mathbf{0} 。证明 span{u,v}=span{v} \operatorname{span}\{\mathbf{u}, \mathbf{v}\} = \operatorname{span}\{\mathbf{v}\} :删掉冗余成员,张成不变(第一章习题 1.7 现在有了完整的理论武器)。
  9. (编程) 修改演示 3(坐标分解):另取 w=(1,1) \mathbf{w} = (1, 1) ,重新计算坐标并验证 au+bv=w a\mathbf{u} + b\mathbf{v} = \mathbf{w} 。观察平行四边形随 w \mathbf{w} 的变化。
  10. (思考) 仿照本章,尝试写出 R3 \mathbb{R}^3 的理论框架:三个向量线性无关是什么意思?什么样的三个向量构成 R3 \mathbb{R}^3 的基?dimR3 \dim \mathbb{R}^3 应当是几?判别式 D D 的"三维类比"应当长什么样?(提示:对照习题 1.11 的"点→线→面→体"升维模式;D D 的类比将在行列式一章揭晓。)

3. 矩阵与线性方程组

上一章末尾留下的话头是:求坐标就是解线性方程组,而"解方程组的过程本身"值得被组织成一种新的对象。本章引入矩阵。表面上,矩阵只是一张两行两列的数表;实质上,它是线性映射的代数化身——四个数字封装了一个"搬运整个平面"的规则。我们将看到:同一张数表,既可按行读(方程组),也可按列读(向量的组合),还可当作变换读(把整个平面揉捏变形),三种读法互相翻译,是本章反复出现的主旋律。

1. 矩阵:线性映射的账本

1. 定义

定义(二阶矩阵与矩阵—向量乘法) 一个 2×2 2 \times 2 矩阵 是四个数排成的方阵

A=(abcd),A = \begin{pmatrix} a & b \\ c & d \end{pmatrix},

作用于向量 v=(x,y) \mathbf{v} = (x, y) 的结果定义为

Av=(abcd)(xy)=(ax+bycx+dy).A\mathbf{v} = \begin{pmatrix} a & b \\ c & d \end{pmatrix}\begin{pmatrix} x \\ y \end{pmatrix} = \begin{pmatrix} ax + by \\ cx + dy \end{pmatrix}.

即:新向量的第 i i 个分量 = 矩阵第 i i 行与 v \mathbf{v} 逐项相乘再求和。这样,一个矩阵确定了一个规则 vAv \mathbf{v} \mapsto A\mathbf{v} ,把平面上的每个向量送到另一个向量。

例如

(0110)(xy)=(yx),\begin{pmatrix} 0 & -1 \\ 1 & 0 \end{pmatrix}\begin{pmatrix} x \\ y \end{pmatrix} = \begin{pmatrix} -y \\ x \end{pmatrix},

它把 (1,0) (1, 0) 送到 (0,1) (0, 1) 、把 (0,1) (0, 1) 送到 (1,0) (-1, 0) ——整个平面逆时针旋转了 90 90^\circ 。矩阵是旋转的账本。

2. 列向量是基向量的去向

定理(列的意义)A A 的第一列为 a1=(a,c) \mathbf{a}_1 = (a, c) ,第二列为 a2=(b,d) \mathbf{a}_2 = (b, d) ,则对任意 v=(x,y) \mathbf{v} = (x, y)

Av=xa1+ya2.A\mathbf{v} = x\,\mathbf{a}_1 + y\,\mathbf{a}_2.

证明:直接按定义展开两个分量:

Av=(ax+by,  cx+dy)=(xa+yb,  xc+yd)=x(a,c)+y(b,d)=xa1+ya2.A\mathbf{v} = (ax + by,\; cx + dy) = (x a + y b,\; x c + y d) = x(a, c) + y(b, d) = x\mathbf{a}_1 + y\mathbf{a}_2.

其中第二步交换了乘法次序(数的交换律),第三步用第一章向量加法与数乘的定义。 \blacksquare

通俗地说:想知道一个矩阵把平面揉成什么样,只需看它把两个基向量 e1,e2 \mathbf{e}_1, \mathbf{e}_2 送到哪里——第一列是 e1 \mathbf{e}_1 的去向,第二列是 e2 \mathbf{e}_2 的去向。任意向量 (x,y) (x, y) 的像不过是这两个去向按 x:y x : y 加权求和。矩阵的全部信息浓缩在两个列向量里,其余行为都是线性性的自动结果。图 3-1 把整个标准网格变到新位置的,正是列向量 (1.5,1) (1.5, 1) (0.5,1) (-0.5, 1)

3. 线性映射的完整刻画

定义(线性映射) 称规则 T:R2R2 T: \mathbb{R}^2 \to \mathbb{R}^2 线性映射,若对一切向量与数满足:

公理 数学表达式
保加法 T(u+v)=Tu+Tv T(\mathbf{u} + \mathbf{v}) = T\mathbf{u} + T\mathbf{v}
保数乘 T(tv)=tTv T(t\mathbf{v}) = t\, T\mathbf{v}

合并二者得 T(au+bv)=aTu+bTv T(a\mathbf{u} + b\mathbf{v}) = a\,T\mathbf{u} + b\,T\mathbf{v} 线性映射与线性组合可交换次序——先组合再变换,等于先变换再组合。

定理(矩阵 = 线性映射)

(i)每个矩阵按 vAv \mathbf{v} \mapsto A\mathbf{v} 定义一个线性映射。

(ii)反之,每个线性映射 T T 都由唯一矩阵 AT A_T 实现:AT A_T 的两列恰为 Te1 T\mathbf{e}_1 Te2 T\mathbf{e}_2

证明:(i)保加法:

A(u+v)=(ux+vx)a1+(uy+vy)a2=(uxa1+uya2)+(vxa1+vya2)=Au+Av,A(\mathbf{u} + \mathbf{v}) = (u_x + v_x)\mathbf{a}_1 + (u_y + v_y)\mathbf{a}_2 = (u_x \mathbf{a}_1 + u_y \mathbf{a}_2) + (v_x \mathbf{a}_1 + v_y \mathbf{a}_2) = A\mathbf{u} + A\mathbf{v},

第一、三步用了列的意义定理,第二步用第一章向量的加法公理(分量各自相加)。保数乘同理:A(tv)=(tvx)a1+(tvy)a2=t(vxa1+vya2)=tAv A(t\mathbf{v}) = (t v_x)\mathbf{a}_1 + (t v_y)\mathbf{a}_2 = t(v_x \mathbf{a}_1 + v_y \mathbf{a}_2) = t A\mathbf{v}

(ii)任取 v=(x,y)=xe1+ye2 \mathbf{v} = (x, y) = x\mathbf{e}_1 + y\mathbf{e}_2 。由线性性,

Tv=T(xe1+ye2)=xTe1+yTe2.T\mathbf{v} = T(x\mathbf{e}_1 + y\mathbf{e}_2) = x\,T\mathbf{e}_1 + y\,T\mathbf{e}_2.

可见 T T 的行为完全被 Te1,  Te2 T\mathbf{e}_1,\; T\mathbf{e}_2 决定;把这两个向量竖着排成两列得到矩阵 AT A_T ,上式说明 Tv=ATv T\mathbf{v} = A_T \mathbf{v} 对一切 v \mathbf{v} 成立。若另一矩阵 B B 也实现 T T ,则两矩阵作用在 e1 \mathbf{e}_1 上给出相同结果,即第一列相同;同理第二列相同,故 B=AT B = A_T \blacksquare

通俗地说:"矩阵"与"线性映射"是一枚硬币的两面——矩阵是映射的坐标记录,映射是矩阵的几何动作。这条定理保证我们在两者间来回翻译时不会走失:谈几何时想映射,做计算时用矩阵。

2. 矩阵的运算

1. 加法与数乘:矩阵自身构成线性空间

按分量相加、逐项乘数:

A+B=(a+ab+bc+cd+d),sA=(sasbscsd).A + B = \begin{pmatrix} a + a' & b + b' \\ c + c' & d + d' \end{pmatrix},\qquad s A = \begin{pmatrix} sa & sb \\ sc & sd \end{pmatrix}.

几何上,A+B A + B 不是"两个变换的先后执行",而是逐点叠加(A+B)v=Av+Bv (A+B)\mathbf{v} = A\mathbf{v} + B\mathbf{v} (对一切 v \mathbf{v} ),像的向量和向量的和一样遵守平行四边形法则。这一性质说明映射的加法继承了向量的加法。

更深入地看:全体 2×2 2 \times 2 矩阵在上述加法与数乘下自身构成一个线性空间——八个基向量取

E11=(1000),E12=(0100),E21=(0010),E22=(0001),E_{11} = \begin{pmatrix} 1 & 0 \\ 0 & 0 \end{pmatrix},\quad E_{12} = \begin{pmatrix} 0 & 1 \\ 0 & 0 \end{pmatrix},\quad E_{21} = \begin{pmatrix} 0 & 0 \\ 1 & 0 \end{pmatrix},\quad E_{22} = \begin{pmatrix} 0 & 0 \\ 0 & 1 \end{pmatrix},

则任何 A=aE11+bE12+cE21+dE22 A = a E_{11} + b E_{12} + c E_{21} + d E_{22} ,且表示唯一。也就是说矩阵空间是四维的dimM2(R)=4 \dim M_2(\mathbb{R}) = 4 。"矩阵是向量"不是修辞,而是严格的空间成员资格(第五章将把这条线索推广成抽象线性空间理论)。

2. 乘法:复合的代数

定义(矩阵乘法)

AB=(abcd)(abcd)=(aa+bcab+bdca+dccb+dd).AB = \begin{pmatrix} a & b \\ c & d \end{pmatrix}\begin{pmatrix} a' & b' \\ c' & d' \end{pmatrix} = \begin{pmatrix} aa' + bc' & ab' + bd' \\ ca' + dc' & cb' + dd' \end{pmatrix}.

这个看似任意的公式有唯一目的:让矩阵乘法对应映射的复合

定理(乘法 = 复合) 对一切向量 v \mathbf{v} (AB)v=A(Bv) (AB)\mathbf{v} = A(B\mathbf{v}) 。即"先用 B B 变换、再用 A A 变换"的合成动作,恰好由矩阵 AB AB 一次完成。

证明:记 B B 的两列为 b1,b2 \mathbf{b}_1, \mathbf{b}_2 。对 v=(x,y) \mathbf{v} = (x, y) ,由列的意义定理,Bv=xb1+yb2 B\mathbf{v} = x\mathbf{b}_1 + y\mathbf{b}_2 。再用线性性:

A(Bv)=A(xb1+yb2)=x(Ab1)+y(Ab2).A(B\mathbf{v}) = A(x\mathbf{b}_1 + y\mathbf{b}_2) = x\,(A\mathbf{b}_1) + y\,(A\mathbf{b}_2).

另一方面,AB AB 的第 j j 列等于 ABej=A(Bej)=Abj AB\mathbf{e}_j = A(B\mathbf{e}_j) = A\mathbf{b}_j (在复合式中取 v=ej \mathbf{v} = \mathbf{e}_j ——严格地说,这里我们先承认 AB AB 的列由该式定义,下面直接验证按定义展开的乘法公式给出同样的列):Ab1=A(a,c)T=(aa+bc,  ca+dc)T A\mathbf{b}_1 = A(a', c')^{\mathsf T} = (a a' + b c',\; c a' + d c')^{\mathsf T} ,这正是 AB AB 的第一列按乘法公式算出的结果;第二列同理。于是

(AB)v=x(ABe1)+y(ABe2)=x(Ab1)+y(Ab2)=A(Bv).(AB)\mathbf{v} = x\,(AB\mathbf{e}_1) + y\,(AB\mathbf{e}_2) = x\,(A\mathbf{b}_1) + y\,(A\mathbf{b}_2) = A(B\mathbf{v}). \blacksquare

通俗地说:矩阵乘法的"行乘列"规则不是背出来的,是被"复合"逼出来的——想一次记录"先 B B A A "的总效果,别无选择。从现在起可以放心写 ABv AB\mathbf{v} 而不加括号:无论先复合还是先作用,结果一致。这也立即给出结合律 (AB)C=A(BC) (AB)C = A(BC) :两侧作用于任何向量都等于 AvC A\mathbf{v} \leftarrow C 先行、A A 最后收尾的同一动作,由矩阵 = 线性映射的唯一性即得。

3. 不可交换性

命题(次序即信息) 一般地 ABBA AB \neq BA

反例:取剪切 S=(1101) S = \begin{pmatrix} 1 & 1 \\ 0 & 1 \end{pmatrix} 与旋转 90 90^\circ R=(0110) R = \begin{pmatrix} 0 & -1 \\ 1 & 0 \end{pmatrix} 。计算两个乘积:

RS=(0111),SR=(1110),RS = \begin{pmatrix} 0 & -1 \\ 1 & 1 \end{pmatrix},\qquad SR = \begin{pmatrix} 1 & 1 \\ 1 & 0 \end{pmatrix},

两者在第二列已经不同。几何上看更直接:取 v=(2.5,0.5) \mathbf{v} = (2.5, 0.5) ,"先剪后旋"把剪切后的水平推斜再整体转 90 90^\circ ;"先旋后剪"则先把向量转进第二象限再沿新坐标轴剪切——两条路线到达不同终点(图 3-4,红色 RSv RS\mathbf{v} 与蓝色 SRv SR\mathbf{v} 分道扬镳)。

通俗地说:复合映射不可交换,正如"穿衣再洗漱"与"洗漱再穿衣"次序不同结果不同。这不是矩阵的缺陷,而是变换世界的真实秩序——代数上表现为 ABBA AB \neq BA ,几何上表现为路线分歧。

4. 转置与单位矩阵

定义(转置) AT A^{\mathsf T} 是行列互换后的矩阵:(abcd)T=(acbd) \begin{pmatrix} a & b \\ c & d \end{pmatrix}^{\mathsf T} = \begin{pmatrix} a & c \\ b & d \end{pmatrix} 。若 A=AT A = A^{\mathsf T} (即 b=c b = c ),称 A A 对称

单位矩阵 I=(1001) I = \begin{pmatrix} 1 & 0 \\ 0 & 1 \end{pmatrix} 是恒等映射的账本:Iv=v I\mathbf{v} = \mathbf{v} 。基本性质汇总:

性质 数学表达式 几何意义
左右单位元 IA=AI=A IA = AI = A 恒等变换不改变复合结果
转置反转次序 (AB)T=BTAT (AB)^{\mathsf T} = B^{\mathsf T} A^{\mathsf T} 行与列互换后复合倒序
双重转置 (AT)T=A (A^{\mathsf T})^{\mathsf T} = A 两次互换回到自身
对称性 AT=A    b=c A^{\mathsf T} = A \iff b = c 沿对角线镜像不变

其中 (AB)T=BTAT (AB)^{\mathsf T} = B^{\mathsf T} A^{\mathsf T} 可按分量直接验证(左右两侧的 (1,1) (1,1) 元均为 aa+bc a a' + b c' 等等);其深层含义将在第七、八章浮现——对称矩阵对应"沿正交镜面伸缩"的变换,转置则与内积紧密相关。

3. 线性方程组的三重视角

同一个方程组

{1.5a0.5b=20.5a+1.5b=3\begin{cases} 1.5a - 0.5b = 2 \\ 0.5a + 1.5b = 3 \end{cases}

可以用三种方式,三种读法对应三张不同的图像。

1. 行视角:两直线求交

每个方程是一条直线:1.5a0.5b=2 1.5a - 0.5b = 2 0.5a+1.5b=3 0.5a + 1.5b = 3 。方程组的解 (a,b)=(1.8,  1.4) (a, b) = (1.8,\; 1.4) 是两直线的交点(图 3-2,红色与蓝色直线相交于绿色点)。

直线何时无交点(平行)?两直线

α1a+β1b=γ1,α2a+β2b=γ2\alpha_1 a + \beta_1 b = \gamma_1,\qquad \alpha_2 a + \beta_2 b = \gamma_2

平行(或重合)当且仅当方向向量 (α1,β1) (\alpha_1, \beta_1) (α2,β2) (\alpha_2, \beta_2) 共线,即判别式 α1β2α2β1=0 \alpha_1\beta_2 - \alpha_2\beta_1 = 0 第二章的判别式 D D 再次现身——它判定两行是否"指向同一个方向"。

2. 列视角:凑出目标向量

把未知数当系数、把列当向量:

a(1.50.5)+b(0.51.5)=(23),a\begin{pmatrix} 1.5 \\ 0.5 \end{pmatrix} + b\begin{pmatrix} -0.5 \\ 1.5 \end{pmatrix} = \begin{pmatrix} 2 \\ 3 \end{pmatrix},

au+bv=w a\mathbf{u} + b\mathbf{v} = \mathbf{w} 。解方程组 = w \mathbf{w} 在基 {u,v} \{\mathbf{u}, \mathbf{v}\} 下的坐标——这正是第二章 3.3 节的内容,逐字重合。消元法给出的解

a=w1v2w2v1D,b=u1w2u2w1D,D=u1v2u2v1a = \frac{w_1 v_2 - w_2 v_1}{D},\qquad b = \frac{u_1 w_2 - u_2 w_1}{D},\qquad D = u_1 v_2 - u_2 v_1

中,D D 恰是系数矩阵 (1.50.50.51.5) \begin{pmatrix} 1.5 & -0.5 \\ 0.5 & 1.5 \end{pmatrix} 的判别式(下一章将命名为行列式)。

3. 变换视角:寻找原像

A A 是以 u,v \mathbf{u}, \mathbf{v} 为列的矩阵,方程组即 Ax=b A\mathbf{x} = \mathbf{b} ,其中 x=(a,b) \mathbf{x} = (a, b) b=w \mathbf{b} = \mathbf{w} 解方程组 = 找出被 A A 送到 b \mathbf{b} 的所有向量 x \mathbf{x} (原像)。这一视角把解的存在唯一性问题转化为映射的性质问题:

情形 判别式 几何图像 解集
D0 D \neq 0 两列不共线 A A 把平面一对一铺满平面 唯一解 x=A1b \mathbf{x} = A^{-1}\mathbf{b}
D=0 D = 0 b \mathbf{b} \notin 列空间 两列共线,b \mathbf{b} 不在其张成的直线上 平面被压扁成直线,b \mathbf{b} 在线外 无解
D=0 D = 0 b \mathbf{b} \in 列空间 b \mathbf{b} 恰在压扁后的直线上 整条直线的向量被送到同一个 b \mathbf{b} 无穷多解(一条直线)

通俗地说:三重视角是同一枚三棱镜——行视角看"约束的交点",列视角看"组合的配比",变换视角看"变换的追溯"。它们不谋而合地指向同一个判官 D D D0 D \neq 0 时三问同答(唯一解),D=0 D = 0 时三问同陷入"退化"。这种"殊途同归"正是线性代数结构感的来源。

4. 逆矩阵

1. 定义与求法

定义(可逆与逆矩阵) 若存在矩阵 B B 使 AB=BA=I AB = BA = I ,则称 A A 可逆B B 记作 A1 A^{-1} 。几何上:A1 A^{-1} 是撤销 A A 的变换——先搬过去再搬回来,等于什么都没做。

定理(逆矩阵公式)A=(abcd) A = \begin{pmatrix} a & b \\ c & d \end{pmatrix} detA=adbc0 \det A = ad - bc \neq 0 ,则 A A 可逆,且

A1=1detA(dbca).A^{-1} = \frac{1}{\det A}\begin{pmatrix} d & -b \\ -c & a \end{pmatrix}.

证明:直接验算两个乘积。主对角线:

(abcd)(dbca)=(adbcab+abcddcbc+ad)=(adbc)I,\begin{pmatrix} a & b \\ c & d \end{pmatrix}\begin{pmatrix} d & -b \\ -c & a \end{pmatrix} = \begin{pmatrix} ad - bc & -ab + ab \\ cd - dc & -bc + ad \end{pmatrix} = (ad - bc) I,

除以 detA=adbc \det A = ad - bc 即得 AA1=I A A^{-1} = I 。反向乘积逐项同样验算:(dbca)(abcd)=(adbc00adbc)=(adbc)I \begin{pmatrix} d & -b \\ -c & a \end{pmatrix}\begin{pmatrix} a & b \\ c & d \end{pmatrix} = \begin{pmatrix} ad - bc & 0 \\ 0 & ad - bc \end{pmatrix} = (ad-bc) I \blacksquare

公式中 (dbca) \begin{pmatrix} d & -b \\ -c & a \end{pmatrix} (主对角线互换、副对角线变号)称为 A A 伴随矩阵,记 adjA \operatorname{adj} A ;口诀:主换副变号,除以行列式

解方程组的矩阵语言Ax=b A\mathbf{x} = \mathbf{b} A A 可逆时,两侧左乘 A1 A^{-1} x=A1b \mathbf{x} = A^{-1}\mathbf{b} 。把逆矩阵公式代入并乘开,得到的恰是第一章消元法与第二章坐标公式:

x=1D(dbca)(w1w2)=1D(dw1bw2cw1+aw2),\mathbf{x} = \frac{1}{D}\begin{pmatrix} d & -b \\ -c & a \end{pmatrix}\begin{pmatrix} w_1 \\ w_2 \end{pmatrix} = \frac{1}{D}\begin{pmatrix} d w_1 - b w_2 \\ -c w_1 + a w_2 \end{pmatrix},

u=(a,c) \mathbf{u} = (a, c) v=(b,d) \mathbf{v} = (b, d) 的记号下即 a=(w1v2w2v1)/D a = (w_1 v_2 - w_2 v_1)/D b=(u1w2u2w1)/D b = (u_1 w_2 - u_2 w_1)/D 消元法、坐标公式、逆矩阵是同一件事的三套记号

2. 可逆性的等价刻画

定理(可逆性判据) 下列命题等价:

detA0 \det A \neq 0 ; ② A A 可逆; ③ Ax=0 A\mathbf{x} = \mathbf{0} 只有零解; ④ Ax=b A\mathbf{x} = \mathbf{b} 对一切 b \mathbf{b} 有解; ⑤ A A 把线性无关组送到线性无关组。

证明:② \Rightarrow ③:若 Ax=0 A\mathbf{x} = \mathbf{0} ,左乘 A1 A^{-1} x=0 \mathbf{x} = \mathbf{0} 。③ \Rightarrow ①(逆否):若 detA=0 \det A = 0 ,则两列共线,设第二列 =t = t 倍第一列,则 A(t,1)T=ta1a2=0 A(t, -1)^{\mathsf T} = t \mathbf{a}_1 - \mathbf{a}_2 = \mathbf{0} ,有非零解 (t,1)(0,0) (t, -1) \neq (0,0) ,与③矛盾。① \Rightarrow ②:逆矩阵公式。④ \Rightarrow ①(逆否):若 detA=0 \det A = 0 ,两列张成一条直线,直线外的 b \mathbf{b} (例如任一与列向量不共线的向量)无解。① \Rightarrow ④:对每个 b \mathbf{b} x=A1b \mathbf{x} = A^{-1}\mathbf{b} 是解。③ \Leftrightarrow ⑤:{Au,Av} \{ A\mathbf{u}, A\mathbf{v} \} 相关      \iff 有非零 (a,b) (a, b) 使 aAu+bAv=A(au+bv)=0 a A\mathbf{u} + b A\mathbf{v} = A(a\mathbf{u} + b\mathbf{v}) = \mathbf{0}      \iff au+bvkerA a\mathbf{u} + b\mathbf{v} \in \ker A ;③ 说 kerA={0} \ker A = \{\mathbf{0}\} ,代入即见等价。 \blacksquare

通俗地说:可逆的几何本质是"不丢信息"。detA0 \det A \neq 0 意味着两列不共线,平面被一对一地铺满整个平面,像和原像之间可以互相追溯;detA=0 \det A = 0 意味着某个方向被压扁(甚至整个平面被压成一条线),多个原像重叠成同一个像,像再也无法拆回原像——信息一旦被压扁就不可能无损恢复,这正是不可逆的物理含义。

3. 逆的运算性质

性质 数学表达式 几何意义
逆的逆 (A1)1=A (A^{-1})^{-1} = A 撤销"撤销"就是原始动作
倒序法则 (AB)1=B1A1 (AB)^{-1} = B^{-1}A^{-1} 先穿鞋后穿袜脱的次序反:脱时先脱鞋(后脱的先撤)
转置的逆 (AT)1=(A1)T (A^{\mathsf T})^{-1} = (A^{-1})^{\mathsf T} 行列互换与撤销互不干扰

倒序法则的验证:(B1A1)(AB)=B1(A1A)B=B1IB=I (B^{-1}A^{-1})(AB) = B^{-1}(A^{-1}A)B = B^{-1} I B = I ,另一侧同理。

5. 像与核:变换的骨架

1. 定义

定义(像与核)A A 是矩阵,定义

imA={Av:vR2},kerA={v:Av=0}.\operatorname{im} A = \{ A\mathbf{v} : \mathbf{v} \in \mathbb{R}^2 \},\qquad \ker A = \{ \mathbf{v} : A\mathbf{v} = \mathbf{0} \}.

(image,又称列空间)是变换能"够到"的全体向量;(kernel,又称零空间)是被送到零向量的全体向量。

命题(两者都是子空间且各由列向量控制)

(i)imA=span{a1,a2} \operatorname{im} A = \operatorname{span}\{\mathbf{a}_1, \mathbf{a}_2\} (列向量张成的集合);

(ii)kerA={0}    {a1,a2} \ker A = \{\mathbf{0}\} \iff \{\mathbf{a}_1, \mathbf{a}_2\} 线性无关     detA0 \iff \det A \neq 0 ;若 detA=0 \det A = 0 ,则 kerA \ker A 是一条过原点的直线。

证明:(i)wimA     \mathbf{w} \in \operatorname{im} A \iff 存在 (x,y) (x, y) 使 w=xa1+ya2    wspan{a1,a2} \mathbf{w} = x\mathbf{a}_1 + y\mathbf{a}_2 \iff \mathbf{w} \in \operatorname{span}\{\mathbf{a}_1, \mathbf{a}_2\} (用了列的意义定理)。(ii)v=(x,y)kerA    xa1+ya2=0 \mathbf{v} = (x, y) \in \ker A \iff x\mathbf{a}_1 + y\mathbf{a}_2 = \mathbf{0} 。若两列无关,仅零组合成立,故 kerA={0} \ker A = \{\mathbf{0}\} ;若相关(共线)且不全为零列,则齐次方程有一维解集——一条过原点的直线(第一章习题的齐次情形;若 A=O A = O 零矩阵,kerA=R2 \ker A = \mathbb{R}^2 是整个平面,即两维退化情形)。 \blacksquare

通俗地说:像回答"变换能到达哪里",核回答"谁会在变换中消失"。两者是一对互补的骨架:detA0 \det A \neq 0 时像满(整个平面)而核空(无人消失)——满射与单射同时成立;detA=0 \det A = 0 时像瘪成一条直线,同时核膨胀成一条直线——丢了多少维,就多余多少维

2. 秩与秩一矩阵

定义(秩) rankA=dim(imA) \operatorname{rank} A = \dim(\operatorname{im} A) ,即像空间的维数(张成像所需的最少方向数)。

2×2 2 \times 2 情形秩只有三种取值:

列向量状况 几何动作
2 2 两列不共线(detA0 \det A \neq 0 整个平面 {0} \{\mathbf{0}\} 一对一铺满(可逆)
1 1 两列共线且至少一列非零 一条直线 一条直线 平面压扁到直线
0 0 两列全为零 {0} \{\mathbf{0}\} 整个平面 一切归零

每一行都验证了同一个等式

dim(imA)+dim(kerA)=2=dimR2,\dim(\operatorname{im} A) + \dim(\ker A) = 2 = \dim \mathbb{R}^2,

秩一零化度定理在 R2 \mathbb{R}^2 的特例。第五章将证明它对任意维数成立。

秩 1 矩阵有一个漂亮的代数结构——它必是外积

命题(秩 1 = 外积) rankA=1 \operatorname{rank} A = 1 当且仅当存在非零列向量 u \mathbf{u} 与非零行向量 wT \mathbf{w}^{\mathsf T} 使 A=uwT A = \mathbf{u}\mathbf{w}^{\mathsf T} ,即

A=(u1u2)(w1w2)=(u1w1u1w2u2w1u2w2).A = \begin{pmatrix} u_1 \\ u_2 \end{pmatrix}\begin{pmatrix} w_1 & w_2 \end{pmatrix} = \begin{pmatrix} u_1 w_1 & u_1 w_2 \\ u_2 w_1 & u_2 w_2 \end{pmatrix}.

证明:( \Leftarrow )两列 (u1,u2)w1 (u_1, u_2) w_1 (u1,u2)w2 (u_1, u_2) w_2 都是 u \mathbf{u} 的倍数;因 u,w \mathbf{u}, \mathbf{w} 均非零,w1,w2 w_1, w_2 至少一个非零,故至少一列非零,两列张成一条直线,秩为 1。( \Rightarrow )秩 1 时两列共线且至少一列非零:取任一非零列作 u \mathbf{u} ,则两列分别 =su = s\mathbf{u} =tu = t\mathbf{u} s,t s, t 中至少一个非零),取 wT=(s,t) \mathbf{w}^{\mathsf T} = (s, t) 即可(w \mathbf{w} 亦非零)。 \blacksquare

通俗地说:外积 uwT \mathbf{u}\mathbf{w}^{\mathsf T} 的动作分两步理解——先把每个向量投影到方向 w \mathbf{w} 上读出一个数(wTv \mathbf{w}^{\mathsf T}\mathbf{v} ),再把这个数放大成 u \mathbf{u} 方向上的长度。全体向量先被压扁到一条数轴,再沿一根指定的箭头重新射出:“读数—重发”。图 3-3 中 A=(1224) A = \begin{pmatrix} 1 & 2 \\ 2 & 4 \end{pmatrix} (外积 (1,2)T(1,2) (1,2)^{\mathsf T}(1, 2) )把一圈向量全部压到橙色直线 span{(1,2)} \operatorname{span}\{(1,2)\} 上,而蓝色直线 span{(2,1)} \operatorname{span}\{(2,-1)\} 上的向量全部消失——它们是核。

6. 演示图像

本章演示程序位于 src/chapter3,生成图像位于 output/chapter3

图号 文件 内容
图 3-1 fig_3_1_matrix_grid.ppm 矩阵作用于标准网格
图 3-2 fig_3_2_line_intersect.ppm 解方程组 = 两直线求交
图 3-3 fig_3_3_rank1_collapse.ppm 秩 1 矩阵:压扁与消失
图 3-4 fig_3_4_composition.ppm 复合不可交换

图 3-1(fig_3_1_matrix_grid.ppmA=(1.50.511) A = \begin{pmatrix} 1.5 & -0.5 \\ 1 & 1 \end{pmatrix} 作用于整个标准网格(淡色原网格留作对照):网格线仍是直线且等距平行线保持等距(线性性的宏观写照),红色箭头 Ae1=(1.5,1) A\mathbf{e}_1 = (1.5, 1) 、蓝色箭头 Ae2=(0.5,1) A\mathbf{e}_2 = (-0.5, 1) 就是矩阵的两列——看两支箭头,就知道整个网格的去向

图 3-2(fig_3_2_line_intersect.ppm:行视角的图像:在系数平面 (a,b) (a, b) 中,两个分量方程各是一条直线(红与蓝),解 (1.8,1.4) (1.8, 1.4) 是交点(绿)。「解方程组」在几何上被还原为最古老的作图:找交点。

图 3-3(fig_3_3_rank1_collapse.ppm:秩 1 矩阵 (1224) \begin{pmatrix} 1 & 2 \\ 2 & 4 \end{pmatrix} :一圈输入向量(灰)的像(绿)全部落在橙色像直线上;蓝色核直线上的向量(及其平行线)整体归零。像损失一维、核补上一维——秩一零化度的直观写照。

图 3-4(fig_3_4_composition.ppm:剪切 S S 与旋转 90 90^\circ R R :同一向量 v \mathbf{v} 先剪后旋(红)与先旋后剪(蓝)到达不同位置,中间结果 Sv S\mathbf{v} Rv R\mathbf{v} 以橙点标记——复合的次序本身就是信息。

7. 小结

概念 代数形式 几何形象
矩阵 2×2 2\times 2 数表 线性映射的账本
列的意义 Av=xa1+ya2 A\mathbf{v} = x\mathbf{a}_1 + y\mathbf{a}_2 列是基向量的去向(图 3-1)
乘法 行乘列公式 变换的复合(图 3-4)
方程组 Ax=b A\mathbf{x} = \mathbf{b} 交点 / 坐标 / 原像三重视角(图 3-2)
逆矩阵 adjA/detA \operatorname{adj} A / \det A 撤销变换
可逆     detA0 \iff \det A \neq 0 一对一铺满,不丢信息
像与核 列空间 / 零空间 够到哪里 / 谁会消失(图 3-3)
dimimA \dim \operatorname{im} A 变换后剩下的自由度
秩一零化度 rank+dimker=2 \operatorname{rank} + \dim \ker = 2 压扁多少维,就多余多少维

三条主线:

  1. 矩阵与线性映射一一对应:列是基向量的去向,乘法是复合,逆是撤销——每条代数规则都被一条几何事实支撑,反之亦然。
  2. 解方程组 = 求原像:行视角(交点)、列视角(坐标)、变换视角(原像)互相翻译,可逆性定理与三种视角同时给出解的存在唯一性。
  3. 退化由判别式统一度量detA=0 \det A = 0 ⟺ 列共线 ⟺ 压扁 ⟺ 不可逆 ⟺ 有向量消失——一个数裁决了变换的全部命运,这个数的完整身份将在下一章揭晓。

8. 习题

  1. (计算)A=(2113) A = \begin{pmatrix} 2 & 1 \\ 1 & 3 \end{pmatrix} v=(1,2) \mathbf{v} = (1, 2) 。求 Av A\mathbf{v} ,并验证它等于 1(第一列)+2(第二列) 1\cdot(\text{第一列}) + 2\cdot(\text{第二列}) (列的意义定理)。
  2. (求逆) 求下列矩阵的逆(或证明不可逆):
    (a) (3121) \begin{pmatrix} 3 & 1 \\ 2 & 1 \end{pmatrix}
    (b) (1224) \begin{pmatrix} 1 & 2 \\ 2 & 4 \end{pmatrix}
    © 旋转 60 60^\circ 的矩阵 (1/23/23/21/2) \begin{pmatrix} 1/2 & -\sqrt{3}/2 \\ \sqrt{3}/2 & 1/2 \end{pmatrix} (答案应是一个旋转——验证你的结果)。
  3. (不可交换)A=(1201) A = \begin{pmatrix} 1 & 2 \\ 0 & 1 \end{pmatrix} B=(1031) B = \begin{pmatrix} 1 & 0 \\ 3 & 1 \end{pmatrix} 。计算 AB AB BA BA ,求出差别,并在几何上描述两个复合动作的区别(谁水平剪切谁垂直剪切)。
  4. (解方程组) 用逆矩阵求解 {2x+y=5x+3y=10 \begin{cases} 2x + y = 5 \\ x + 3y = 10 \end{cases} ,再用行视角(画两条直线)验证。
  5. (证明) 证明:若 A A 可逆且 AB=AC AB = AC ,则 B=C B = C (左消去律)。举例说明 A A 不可逆时消去律失效(提示:取秩 1 矩阵与两列相同的 B,C B, C )。
  6. (像与核)A=(1224) A = \begin{pmatrix} 1 & 2 \\ 2 & 4 \end{pmatrix} :求出 imA \operatorname{im} A kerA \ker A (各是一条直线),验证两直线互相垂直(这是巧合还是必然?对照第七章——答案与对称性有关)。
  7. (外积)A=(2142) A = \begin{pmatrix} 2 & -1 \\ 4 & -2 \end{pmatrix} 写成外积 uwT \mathbf{u}\mathbf{w}^{\mathsf T} ,并指出它的像直线与核直线的方向。
  8. (矩阵空间) 证明:全体 2×2 2\times 2 矩阵在矩阵加法与数乘下满足第一章的八条向量公理,从而 M2(R) M_2(\mathbb{R}) 是四维线性空间,{E11,E12,E21,E22} \{E_{11}, E_{12}, E_{21}, E_{22}\} 是它的一组基。
  9. (对称与反对称) 任何矩阵可分解 A=12(A+AT)+12(AAT) A = \tfrac{1}{2}(A + A^{\mathsf T}) + \tfrac{1}{2}(A - A^{\mathsf T}) ,前者对称、后者反对称(BT=B B^{\mathsf T} = -B )。验证这一分解,并问:反对称矩阵的形状是什么(设 B=(0tt0) B = \begin{pmatrix} 0 & t \\ -t & 0 \end{pmatrix} ,它是什么几何变换)?
  10. (编程) 修改演示 1:把矩阵换为 (0110) \begin{pmatrix} 0 & -1 \\ 1 & 0 \end{pmatrix} (旋转)与 (1101) \begin{pmatrix} 1 & 1 \\ 0 & 1 \end{pmatrix} (剪切),分别观察网格如何变形。旋转保持网格的方格形状吗?剪切呢?(为第七、八章的"正交变换 vs 一般变换"埋下伏笔。)

4. 行列式

判别式 D D 已在本书中三度现身:第一章它是平行四边形的面积,第二章它是无关性的判官,第三章它裁决可逆性。本章为它正式命名——行列式,并把它当作主角彻底研究:它既是代数对象(一个关于矩阵列向量的函数),也是几何对象(面积缩放因子与定向)。我们会证明它的全部基本性质,包括最重要的乘法公式 det(AB)=detAdetB \det(AB) = \det A \cdot \det B ,并用公理化的眼光重新审视:行列式是被"面积"三条件唯一逼出来的函数

1. 定义

1. 定义:判别式的正名

定义(行列式) 矩阵 A=(abcd) A = \begin{pmatrix} a & b \\ c & d \end{pmatrix} 行列式定义为

detA=adbc.\det A = ad - bc.

它等于前两章反复出现的判别式 D=u1v2u2v1 D = u_1 v_2 - u_2 v_1 (把两列取为 u=(a,c) \mathbf{u} = (a, c) v=(b,d) \mathbf{v} = (b, d) )。记号也写作

abcd=adbc.\begin{vmatrix} a & b \\ c & d \end{vmatrix} = ad - bc.

口诀:主对角线之积减副对角线之积。例:det(3124)=122=10 \det\begin{pmatrix} 3 & 1 \\ 2 & 4 \end{pmatrix} = 12 - 2 = 10 ;剪切矩阵 (1t01) \begin{pmatrix} 1 & t \\ 0 & 1 \end{pmatrix} 的行列式恒为 1;旋转矩阵 (cosθsinθsinθcosθ) \begin{pmatrix} \cos\theta & -\sin\theta \\ \sin\theta & \cos\theta \end{pmatrix} 的行列式恒为 cos2θ+sin2θ=1 \cos^2\theta + \sin^2\theta = 1

2. 三重几何身份

第一章已证 detA |\det A| 等于两列张成的平行四边形面积(3.7 节剪切证明)。本章再赋予它两个更深层的身份:

身份 含义 出场章节
面积 $ \det A
定向 detA<0     \det A < 0 \iff 平面被镜像翻转 本章 3 节、图 4-3
缩放因子 任何区域 S S 的像 A(S) A(S) 满足 $ \operatorname{area}(A(S)) = \det A

通俗地说:行列式把一个变换对面积、定向的全部影响压缩成一个数。det |\det| 告诉你面积放大几倍,sign(det) \operatorname{sign}(\det) 告诉你平面有没有被翻个面。零则宣告区域被压扁——可逆性丧失(第三章)。

2. 行列式与面积

1. 有向面积

定义(有向面积) 规定基向量对 (e1,e2) (\mathbf{e}_1, \mathbf{e}_2) 的定向为正(逆时针)。对列向量对 (u,v) (\mathbf{u}, \mathbf{v}) ,定义有向面积

[u,v]=det(u1v1u2v2)=u1v2u2v1,[\mathbf{u}, \mathbf{v}] = \det \begin{pmatrix} u_1 & v_1 \\ u_2 & v_2 \end{pmatrix} = u_1 v_2 - u_2 v_1,

即从 u \mathbf{u} 转到 v \mathbf{v} 若为逆时针则取正面积,顺时针取负。

命题(定向判别) [u,v]>0     [\mathbf{u}, \mathbf{v}] > 0 \iff u \mathbf{u} 沿不超过 180 180^\circ 的转角到 v \mathbf{v} 是逆时针方向;[u,v]<0     [\mathbf{u}, \mathbf{v}] < 0 \iff 顺时针;=0     = 0 \iff 共线。

证明(设 u,v \mathbf{u}, \mathbf{v} 均非零,极坐标 u=r(cosα,sinα) \mathbf{u} = r(\cos\alpha, \sin\alpha) v=s(cosβ,sinβ) \mathbf{v} = s(\cos\beta, \sin\beta) 0α,β<2π 0 \le \alpha, \beta < 2\pi ):

[u,v]=u1v2u2v1=rs(cosαsinβsinαcosβ)=rssin(βα).[\mathbf{u}, \mathbf{v}] = u_1 v_2 - u_2 v_1 = r s(\cos\alpha \sin\beta - \sin\alpha \cos\beta) = r s \sin(\beta - \alpha).

rs>0 r s > 0 ,符号完全由 sin(βα) \sin(\beta - \alpha) 决定:差角在 (0,π) (0, \pi) (从 u \mathbf{u} 逆时针转不到半圆即达 v \mathbf{v} )时为正;在 (π,0) (-\pi, 0) (顺时针)时为负;差角为 0 0 ±π \pm\pi (共线)时为零。 \blacksquare

通俗地说:有向面积是带符号的面积——两个向量除了"张多大的面"还携带着"旋向"信息。叉着手指比一下:从第一列转到第二列是逆时针,记正;顺时针,记负。这个符号将在图 4-3 中以"镜像翻转"的面貌出现。

2. 面积缩放因子

定理(缩放因子)A A 可逆,S S 是平面上任一"有面积"的区域(可被网格逼近),A(S)={Ax:xS} A(S) = \{ A\mathbf{x} : \mathbf{x} \in S \} 是其像,则

area(A(S))=detAarea(S).\operatorname{area}(A(S)) = |\det A| \cdot \operatorname{area}(S).

证明思路(用第一章的工具严格化):把 S S 用标准网格的正方胞腔逼近。每个小正方形胞腔由 εe1,εe2 \varepsilon \mathbf{e}_1, \varepsilon \mathbf{e}_2 张成,其像是由 εa1,εb1 \varepsilon \mathbf{a}_1, \varepsilon \mathbf{b}_1 (矩阵的两列缩小 ε \varepsilon 倍)张成的小平行四边形,面积为 ε2detA \varepsilon^2 |\det A| ,恰好是原面积 ε2 \varepsilon^2 detA |\det A| 倍。胞腔互不重叠地拼合(可逆时 A A 一对一),像也互不重叠,总面积按同一倍数缩放,取极限即得。 \blacksquare

通俗地说:不需要知道区域的形状,只需要知道它被 A A 变换——面积一律乘上同一个数 detA |\det A| 。图 4-1 中 A=(2112) A = \begin{pmatrix} 2 & 1 \\ 1 & 2 \end{pmatrix} det=3 \det = 3 )把单位正方形变成面积恰为 3 的平行四边形。这个结论是多元微积分中换元公式(雅可比行列式)的二维雏形:积分换元时 dxdy dx\,dy 要乘 detA |\det A| 才变成新坐标下的面积元。

3. 剪切保面积

剪切矩阵 (1t01) \begin{pmatrix} 1 & t \\ 0 & 1 \end{pmatrix} 的行列式为 1,故剪切不改变任何区域的面积。这不是巧合而是第一章 3.7 节"剪切引理"(平行四边形剪拼成等积矩形)的矩阵翻版:行列式为 1 的变换保持面积,几何上如同把一摞卡片推斜——形状变了,张数(面积)没变(图 4-2)。

3. 行列式的代数性质

1. 基本性质表

把行列式看作两列的函数 f(c1,c2) f(\mathbf{c}_1, \mathbf{c}_2)

性质 数学表达式 几何意义
转置不变 detAT=detA \det A^{\mathsf T} = \det A 行与列地位对称
双线性 f(au+au,v)=af(u,v)+af(u,v) f(a\mathbf{u} + a'\mathbf{u}', \mathbf{v}) = a f(\mathbf{u}, \mathbf{v}) + a' f(\mathbf{u}', \mathbf{v}) (列二同理) 有向面积随列向量线性变化
反对称(交换变号) f(v,u)=f(u,v) f(\mathbf{v}, \mathbf{u}) = -f(\mathbf{u}, \mathbf{v}) 交换旋向,定向翻转
退化 detA=0     \det A = 0 \iff 两列共线 平行四边形压扁无面积
单位矩阵 detI=1 \det I = 1 单位变换不缩放、不翻转
数乘 det(sA)=s2detA \det(sA) = s^2 \det A 两列都拉长 s s 倍,面积乘 s2 s^2
det(A1)=1/detA \det(A^{-1}) = 1/\det A 撤销缩放:倍数取倒数

证明选讲:(反对称)[v,u]=v1u2v2u1=(u1v2u2v1)=[u,v] [\mathbf{v}, \mathbf{u}] = v_1 u_2 - v_2 u_1 = -(u_1 v_2 - u_2 v_1) = -[\mathbf{u}, \mathbf{v}] 。(双线性)对列一线性:

[au+au,v]=(au1+au1)v2(au2+au2)v1=a[u1v2u2v1]+a[u1v2u2v1],[a\mathbf{u} + a'\mathbf{u}', \mathbf{v}] = (a u_1 + a' u_1') v_2 - (a u_2 + a' u_2') v_1 = a[u_1 v_2 - u_2 v_1] + a'[u_1' v_2 - u_2' v_1],

仅用了数的分配律。(转置不变)detAT=cadb \det A^{\mathsf T} = ca - db ?直接算:AT=(acbd) A^{\mathsf T} = \begin{pmatrix} a & c \\ b & d \end{pmatrix} detAT=adcb=adbc=detA \det A^{\mathsf T} = ad - cb = ad - bc = \det A 。(数乘)sA sA 的两列都是原来的 s s 倍,由双线性提出两个 s s 因子。(逆)由下一节的乘法公式:1=detI=det(AA1)=detAdetA1 1 = \det I = \det(A A^{-1}) = \det A \cdot \det A^{-1} \blacksquare

特别地,反对称蕴含列相等则行列式为零f(u,u)=f(u,u) f(\mathbf{u}, \mathbf{u}) = -f(\mathbf{u}, \mathbf{u}) 迫使 f=0 f = 0 )——几何上:两列重合,平行四边形退化为线段。

2. 公理化刻画(深入)

定理(行列式的唯一性) 设函数 f f 消费一对列向量、输出一个数,满足:

(i)对每个列向量线性(双线性);(ii)交换两列变号(反对称);(iii)f(e1,e2)=1 f(\mathbf{e}_1, \mathbf{e}_2) = 1 (在标准正方形上归一)。

f(u,v)=[u,v]=u1v2u2v1 f(\mathbf{u}, \mathbf{v}) = [\mathbf{u}, \mathbf{v}] = u_1 v_2 - u_2 v_1 ,即行列式是满足三条件的唯一函数。

证明:把两列按标准基展开:u=u1e1+u2e2 \mathbf{u} = u_1 \mathbf{e}_1 + u_2 \mathbf{e}_2 v=v1e1+v2e2 \mathbf{v} = v_1 \mathbf{e}_1 + v_2 \mathbf{e}_2 。反复使用双线性展开:

f(u,v)=u1v1f(e1,e1)+u1v2f(e1,e2)+u2v1f(e2,e1)+u2v2f(e2,e2).f(\mathbf{u}, \mathbf{v}) = u_1 v_1 f(\mathbf{e}_1, \mathbf{e}_1) + u_1 v_2 f(\mathbf{e}_1, \mathbf{e}_2) + u_2 v_1 f(\mathbf{e}_2, \mathbf{e}_1) + u_2 v_2 f(\mathbf{e}_2, \mathbf{e}_2).

由反对称,f(e1,e1)=f(e2,e2)=0 f(\mathbf{e}_1, \mathbf{e}_1) = f(\mathbf{e}_2, \mathbf{e}_2) = 0 f(e2,e1)=f(e1,e2)=1 f(\mathbf{e}_2, \mathbf{e}_1) = -f(\mathbf{e}_1, \mathbf{e}_2) = -1 。代入:

f(u,v)=u1v21+u2v1(1)=u1v2u2v1.f(\mathbf{u}, \mathbf{v}) = u_1 v_2 \cdot 1 + u_2 v_1 \cdot (-1) = u_1 v_2 - u_2 v_1. \blacksquare

通俗地说:行列式不是被"定义"出来的,而是被三条件出来的——想找一个函数既线性地响应每列的伸缩叠加,又对交换列向敏感,还把标准方形认作 1,别无选择,只有 adbc ad - bc 。这三条公理正是"有向面积"的全部直觉:面积随边线性增长、交换两边定向翻转、单位方形面积为一。高阶行列式的定义正是照搬这三条公理——这是本节最重要的启示:公理是定义的推广路线图

4. 乘法公式

定理(乘法公式) 对任意两个 2×2 2 \times 2 矩阵:

det(AB)=detAdetB.\det(AB) = \det A \cdot \det B.

代数证明:设 A=(abcd) A = \begin{pmatrix} a & b \\ c & d \end{pmatrix} B=(abcd) B = \begin{pmatrix} a' & b' \\ c' & d' \end{pmatrix} 。则

AB=(aa+bcab+bdca+dccb+dd),AB = \begin{pmatrix} aa' + bc' & ab' + bd' \\ ca' + dc' & cb' + dd' \end{pmatrix},

det(AB)=(aa+bc)(cb+dd)(ab+bd)(ca+dc).\det(AB) = (aa' + bc')(cb' + dd') - (ab' + bd')(ca' + dc').

展开八个乘积项:

=aacb+aadd+bccb+bcddabcaabdcbdcabddc.= a a' c b' + a a' d d' + b c' c b' + b c' d d' - a b' c a' - a b' d c' - b d' c a' - b d' d c'.

八项中两对相消:aacbabca=0 a a' c b' - a b' c a' = 0 bcddbddc=0 b c' d d' - b d' d c' = 0 (数的乘法交换律使每对互为相反数)。余下四项按 detA \det A 的两项分组,各自提出公因子:

det(AB)=(aaddabdc)+(bccbbdca)=ad(adbc)bc(adbc)=(adbc)(adbc),\det(AB) = (a a' d d' - a b' d c') + (b c' c b' - b d' c a') = ad\,(a'd' - b'c') - bc\,(a'd' - b'c') = (ad - bc)(a'd' - b'c'),

det(AB)=detAdetB \det(AB) = \det A \cdot \det B \blacksquare

几何证明(更有启发):把 B B 先作用于区域 S S ,面积乘 detB |\det B| ;再作用 A A ,面积乘 detA |\det A| 。合成的 AB AB 一次完成两个动作,面积乘积为

area(AB(S))=detAdetBarea(S),\operatorname{area}(AB(S)) = |\det A| \cdot |\det B| \cdot \operatorname{area}(S),

对照缩放因子定理即知 det(AB)=detAdetB |\det(AB)| = |\det A||\det B| 。定向同理跟踪符号:两次翻转抵消(负负得正)、一次翻转变号,符号也严格相乘——故不必取绝对值。(严格的符号论证需要缩放因子定理对有向面积成立,这一推广是自然的:有向面积同样按倍数缩放且保留符号信息。) \blacksquare

通俗地说:代数证明是技巧的堆积,几何证明一句话讲完——复合的缩放 = 缩放的复合。图 4-4 演示:放大 2 倍(det=4 \det = 4 )再旋转 45°(det=1 \det = 1 ),总效果面积仍放大 4 倍:4×1=4 4 \times 1 = 4 。乘法公式从此不再是需要背诵的恒等式,而是"面积因子可以约分"的常识。

5. 应用

1. 克拉默法则

定理(克拉默法则)detA0 \det A \neq 0 ,方程组 Ax=b A\mathbf{x} = \mathbf{b} 的解为

x1=detA1detA,x2=detA2detA,x_1 = \frac{\det A_1}{\det A},\qquad x_2 = \frac{\det A_2}{\det A},

其中 Aj A_j 是把 A A 的第 j j 列换成 b \mathbf{b} 后的矩阵。

证明:解的唯一性由第三章可逆性定理。直接验证:

detA1=det(b1bb2d)=b1db2b,x1detA=x1(adbc).\det A_1 = \det \begin{pmatrix} b_1 & b \\ b_2 & d \end{pmatrix} = b_1 d - b_2 b,\qquad x_1 \det A = x_1(ad - bc).

由方程组 ax1+bx2=b1 a x_1 + b x_2 = b_1 cx1+dx2=b2 c x_1 + d x_2 = b_2 ,用 d d 乘第一式、b -b 乘第二式相加:

(adcb)x1+(bddb)x2=db1bb2=detA1,(a d - c b) x_1 + (b d - d b) x_2 = d b_1 - b b_2 = \det A_1,

x1detA=detA1 x_1 \det A = \det A_1 。因 detA0 \det A \neq 0 x1=detA1/detA x_1 = \det A_1/\det A x2 x_2 对称同理。 \blacksquare

几何意义detAj \det A_j 是"把目标 b \mathbf{b} 换进第 j j 列"的有向面积。解的分子分母都是面积,坐标是面积之比x1=[b,c2]/[c1,c2] x_1 = [\mathbf{b}, \mathbf{c}_2]/[\mathbf{c}_1, \mathbf{c}_2] ——b \mathbf{b} 与第二列张成的面积占两列张成面积的比例,恰是 b \mathbf{b} 沿第一列方向的"含量"。这与第二章坐标公式 a=(w1v2w2v1)/D a = (w_1 v_2 - w_2 v_1)/D 完全一致:坐标 = 面积比

2. 行列式的函数论视角(深入)

det \det 看作矩阵空间 M2(R) M_2(\mathbb{R}) (第三章 2.1 节的四维空间)上的函数,它不是线性的:det(sA)=s2detA \det(sA) = s^2 \det A (二次齐次)。但它限制在每列上是线性的——"双线性"因此得名。这类函数是现代数学中"多重线性代数"的起点;外积、微分形式、以及物理中的叉乘,都是同一思想的化身。初步的联络:第三章 5.2 节的外积 uwT \mathbf{u}\mathbf{w}^{\mathsf T} 是秩 1 矩阵,其行列式为零(两列共线),而任意两向量 u,v \mathbf{u}, \mathbf{v} 拼成的矩阵行列式 [u,v] [\mathbf{u}, \mathbf{v}] 是关于两个向量的反对称双线性函数——"双线性 + 反对称"的模式将在第八章(外积视角看 SVD)与更高级的课程中反复出现。

6. 演示图像

本章演示程序位于 src/chapter4,生成图像位于 output/chapter4

图号 文件 内容
图 4-1 fig_4_1_area_scale.ppm 面积缩放因子
图 4-2 fig_4_2_shear_area.ppm 剪切保面积
图 4-3 fig_4_3_orientation.ppm 负行列式 = 定向反转
图 4-4 fig_4_4_multiplicative.ppm 乘法公式

图 4-1(fig_4_1_area_scale.ppmA=(2112) A = \begin{pmatrix} 2 & 1 \\ 1 & 2 \end{pmatrix} det=3 \det = 3 )把单位正方形(灰色轮廓,两邻边红/蓝箭头)变成橙色平行四边形——数格子可验证面积恰为 3。

图 4-2(fig_4_2_shear_area.ppm:剪切 (1101) \begin{pmatrix} 1 & 1 \\ 0 & 1 \end{pmatrix} det=1 \det = 1 )把紫色正方形推歪成橙色平行四边形:底不变、高不变(水平边斜推不改变竖直高度),面积严格不变——卡瓦列里原理的线性代数版本。

图 4-3(fig_4_3_orientation.ppmF=(1001) F = \begin{pmatrix} 1 & 0 \\ 0 & -1 \end{pmatrix} det=1 \det = -1 )沿 x x 轴镜像:紫色正方形(红边 e1 \mathbf{e}_1 在前、蓝边 e2 \mathbf{e}_2 在上,逆时针定向)翻到橙色平行四边形(e1 \mathbf{e}_1 不动、e2 \mathbf{e}_2 翻转到下方,定向变顺时针)。面积数值不变,但"旋向"被反转——符号的意义。

图 4-4(fig_4_4_multiplicative.ppm:放大 2 倍的 A A det=4 \det = 4 )与旋转 45° 的 B B det=1 \det = 1 ):紫色单位方形 → 橙色大方块(面积 4)→ 旋转后青色轮廓(面积仍 4)。det(BA)=4=4×1 \det(BA) = 4 = 4 \times 1 :面积因子相乘。

7. 小结

概念 代数形式 几何形象
行列式 adbc ad - bc 有向面积 / 面积缩放因子
有向面积 [u,v]=u1v2u2v1 [\mathbf{u}, \mathbf{v}] = u_1 v_2 - u_2 v_1 逆时针为正、顺时针为负
缩放因子 $ \operatorname{area}(A(S)) = \det A
双线性 + 反对称 + 归一 三公理唯一确定 det \det 面积直觉的公理化(升维路线图)
乘法公式 det(AB)=detAdetB \det(AB) = \det A \det B 复合缩放 = 缩放相乘(图 4-4)
剪切 det=1 \det = 1 推斜不推扁,保面积(图 4-2)
镜像 det=1 \det = -1 面积不变、定向反转(图 4-3)
克拉默法则 xj=detAj/detA x_j = \det A_j / \det A 坐标 = 面积之比

三条主线:

  1. 一个数浓缩变换的全部度量信息:面积倍数、定向符号、退化判定全部由 detA \det A 一手包办;零值则统一了"压扁、共线、不可逆、有核"。
  2. 公理化视角是升维的钥匙:"双线性 + 反对称 + 归一"三条件在二维唯一确定行列式;高维行列式、乃至微分形式,都由同一组公理定义。
  3. 几何证明与代数证明互补:乘法公式的代数展开验证了正确性,几何论证(缩放复合)揭示了必然性——两个证明合起来才是完整的理解。

8. 习题

  1. (计算) 求下列行列式,并各自给出几何解释:
    (a) 3162 \begin{vmatrix} 3 & 1 \\ 6 & 2 \end{vmatrix}
    (b) 1111 \begin{vmatrix} 1 & 1 \\ 1 & -1 \end{vmatrix}
    © 旋转 θ \theta 角的矩阵(验证恒为 1)。
  2. (面积计算) 求顶点为 (0,0),(3,1),(1,4),(2,3) (0,0), (3,1), (1,4), (-2,3) 的四边形面积(提示:按对角线剖分成两个三角形,各用有向面积;或直接用两邻边张成的平行四边形)。验证结果等于 det |\det| 的适当组合。
  3. (证明) 直接展开验证 det(AB)=detAdetB \det(AB) = \det A \det B ,把 4.4 节证明中省略的分组补齐(按 detA \det A 的两项重新组合)。
  4. (克拉默) 用克拉默法则解 {3x+2y=12xy=1 \begin{cases} 3x + 2y = 12 \\ x - y = 1 \end{cases} ,指出两个分子行列式各自的几何意义。
  5. (证明) 证明:detA=0     \det A = 0 \iff 存在非零矩阵 B B 使 AB=O AB = O (提示:"←"考虑 B B 的列;“→” 取核中非零向量做列)。
  6. (三角函数) 利用 4.2.1 节的公式 [u,v]=rssin(βα) [\mathbf{u}, \mathbf{v}] = r s \sin(\beta - \alpha) 证明:sin(βα)=sinβcosαcosβsinα \sin(\beta - \alpha) = \sin\beta\cos\alpha - \cos\beta\sin\alpha (行列式恒等式即三角恒等式)。
  7. (公理化)g g 是双线性且反对称的双列函数但 g(e1,e2)=c g(\mathbf{e}_1, \mathbf{e}_2) = c (不一定为 1)。证明 g=cdet g = c \cdot \det (唯一性定理的推广:归一化条件只影响常数倍)。
  8. (对称矩阵) 证明对称矩阵 (abbd) \begin{pmatrix} a & b \\ b & d \end{pmatrix} 的行列式 =adb20 = a d - b^2 \leq 0 当且仅当什么条件?由此说明:若对称矩阵两列共线(det=0 \det = 0 ),则两列同时是 (1,ad) (1, \sqrt{-a d}) 型向量与其相反……更精确地:证明 adb2 ad \leq b^2 且等号成立当且仅当两列共线。(第八章将用特征值重新解读这个不等式:对称矩阵的 det=λ1λ2 \det = \lambda_1 \lambda_2 。)
  9. (思考) 三阶行列式的合理定义应当是什么?写出你猜测的公式,并检查它是否满足双线性、反对称、归一三条公理。(提示:3×3 3 \times 3 有 6 项、每项是三个数的乘积,符号由排列的奇偶性决定。)
  10. (编程) 修改演示 3:把镜像矩阵换为 (1001) \begin{pmatrix} -1 & 0 \\ 0 & 1 \end{pmatrix} (沿 y y 轴镜像)与旋转 180° 的 I -I 。两者的行列式各是多少?观察 I -I det=1 \det = 1 )为什么不是镜像(旋转两个基向量,定向不变)——体会"翻转"与"转半圈"的区别。

5. 线性空间

前四章的全部理论建立在 R2 \mathbb{R}^2 的具体坐标上。本章把坐标拆掉,只保留"能加、能乘、运算律成立"的骨架——线性空间。抽象不是目的而是杠杆:一套公理、一套证明,同时适用于几何向量、多项式、矩阵、函数乃至无穷级数。我们将在抽象环境中重建基、维数、线性映射的整套理论,并证明前四章反复预告的秩一零化度定理的一般形式。几何上,本章的图像依然发生在平面上——但请记住:平面只是无穷多个线性空间中的一个"模特",定理本身不依赖任何坐标。

1. 公理化定义

1. 定义

定义(线性空间)V V 是一个非空集合,其元素称为向量,其上定义了两个运算:加法 u+vV \mathbf{u} + \mathbf{v} \in V 与数乘 tvV t\mathbf{v} \in V tR t \in \mathbb{R} )。若以下八条公理恒成立,则称 V V (连同两个运算)为一个线性空间(或向量空间):

编号 公理 数学表达式
A1 加法交换律 u+v=v+u \mathbf{u} + \mathbf{v} = \mathbf{v} + \mathbf{u}
A2 加法结合律 (u+v)+w=u+(v+w) (\mathbf{u} + \mathbf{v}) + \mathbf{w} = \mathbf{u} + (\mathbf{v} + \mathbf{w})
A3 零向量存在 存在 0V \mathbf{0} \in V 使 v+0=v \mathbf{v} + \mathbf{0} = \mathbf{v} 对一切 v \mathbf{v}
A4 负向量存在 对每个 v \mathbf{v} 存在 v -\mathbf{v} 使 v+(v)=0 \mathbf{v} + (-\mathbf{v}) = \mathbf{0}
M1 数乘分配(对向量) t(u+v)=tu+tv t(\mathbf{u} + \mathbf{v}) = t\mathbf{u} + t\mathbf{v}
M2 数乘分配(对数) (s+t)v=sv+tv (s + t)\mathbf{v} = s\mathbf{v} + t\mathbf{v}
M3 数乘结合律 (st)v=s(tv) (st)\mathbf{v} = s(t\mathbf{v})
M4 单位元 1v=v 1\mathbf{v} = \mathbf{v}

通俗地说:线性空间就是"凡是要用的运算规则都成立"的地方。八条公理不描述向量"是什么"(箭头?多项式?声音信号?),只描述向量"如何运算"。只要运算律成立,前四章发展的每件武器——线性组合、相关无关、基、坐标——都可以原封不动地搬进来。

从公理立即可推出一批"免费"结论(证明只用公理,不用坐标):

命题(零向量与负向量的唯一性,加法消去律)(i)满足 A3 的零向量唯一;(ii)每个向量的负向量唯一;(iii)u+v=u+wv=w \mathbf{u} + \mathbf{v} = \mathbf{u} + \mathbf{w} \Rightarrow \mathbf{v} = \mathbf{w} ;(iv)0v=0 0\mathbf{v} = \mathbf{0} (1)v=v (-1)\mathbf{v} = -\mathbf{v} t0=0 t\mathbf{0} = \mathbf{0}

证明:(i)若 0,0 \mathbf{0}, \mathbf{0}' 都满足 A3,则 0=0+0 \mathbf{0} = \mathbf{0} + \mathbf{0}' (把 0 \mathbf{0}' 当零向量用)=0+0 = \mathbf{0}' + \mathbf{0} (A1)=0 = \mathbf{0}' (把 0 \mathbf{0} 当零向量用)。(ii)若 v+u=0=v+w \mathbf{v} + \mathbf{u} = \mathbf{0} = \mathbf{v} + \mathbf{w} ,两侧加 v -\mathbf{v} (A4)并反复用 A2、A3 即得 u=w \mathbf{u} = \mathbf{w} 。(iii)两侧加 u -\mathbf{u} 同理。(iv)0v=(0+0)v=0v+0v 0\mathbf{v} = (0 + 0)\mathbf{v} = 0\mathbf{v} + 0\mathbf{v} (M2),两边加 (0v) -(0\mathbf{v}) 0=0v \mathbf{0} = 0\mathbf{v} v+(1)v=1v+(1)v=(1+(1))v=0v=0 \mathbf{v} + (-1)\mathbf{v} = 1\mathbf{v} + (-1)\mathbf{v} = (1 + (-1))\mathbf{v} = 0\mathbf{v} = \mathbf{0} (M4、M2、刚证结论),由负向量唯一性 (1)v=v (-1)\mathbf{v} = -\mathbf{v} t0=t(0v)=(t0)v=0v=0 t\mathbf{0} = t(0\mathbf{v}) = (t \cdot 0)\mathbf{v} = 0\mathbf{v} = \mathbf{0} (M3)。 \blacksquare

这套"无坐标推理"是本章的新工作方式:不画图也能证明,但每次证明后都要同平面的直觉对账

2. 例子库

公理的力量在于例子众多。以下每个例子都是完整合法的线性空间:

空间 “向量” 零向量 维数
R2 \mathbb{R}^2 平面箭头 (x,y) (x, y) (0,0) (0, 0) 2 2
Rn \mathbb{R}^n n n 元数组 (0,,0) (0,\dots,0) n n
P2 P_2 :次数 2 \le 2 的多项式 a+bx+cx2 a + bx + cx^2 0 0 (零多项式) 3 3 (基 1,x,x2 1, x, x^2
M2 M_2 2×2 2\times2 矩阵 矩阵 A A 零矩阵 O O 4 4 (第三章 2.1 节)
C[a,b] C[a, b] [a,b] [a,b] 上连续函数 函数 f f 零函数 \infty (无穷维)
{0} \{\mathbf{0}\} 仅一个零向量 它自己 0 0

验证示例(P2 P_2 是线性空间):两个二次以内多项式相加仍是二次以内(合并同类项,次数不增);数乘同理;八条公理逐条对应多项式恒等式的普通代数。零向量是零多项式,负向量是系数全部变号。

反例(起到毒剂检测的作用):(i)全体正实数 R>0 \mathbb{R}_{>0} 配普通乘法"看似向量",但 0 0 \notin 集合,A3 崩溃;(ii)开口向上的抛物线全体 {x2+bx+c} \{x^2 + bx + c\} 对加法不封闭(两个相加得 2x2+ 2x^2 + \dots ,首项变成 2);(iii)不过原点的直线对加法不封闭(第一章习题已见)——它们提醒我们:公理不是陈词滥调,而是入会资格审查,每一条都在排除一批伪装者。

通俗地说:线性空间像"会员制俱乐部"——只要能按规矩加、乘,就能进门,无论你是箭头、多项式还是一段音频信号。公理化带来的红利是:证明一次,处处生效。例如刚证的"零向量唯一"适用于上表所有空间,无需逐一验证。

3. 子空间

1. 定义与判定

定义(子空间) WV W \subseteq V 若在继承 V V 的运算后自身构成线性空间,则称 W W V V 子空间

定理(判定定理) WV W \subseteq V W W 非空)是子空间      \iff 以下两条封闭性成立:(i)u,vWu+vW \mathbf{u}, \mathbf{v} \in W \Rightarrow \mathbf{u} + \mathbf{v} \in W ;(ii)vW,  tRtvW \mathbf{v} \in W,\; t \in \mathbb{R} \Rightarrow t\mathbf{v} \in W

证明:( \Rightarrow )子空间自己满足八公理,特别地封闭。( \Leftarrow )八条公理中 A1、A2、M1—M4 只涉及加法与数乘的等式,在 W W 中原样成立(它们是 V V 中等式的限制)。剩下 A3、A4:因 W W 非空取 vW \mathbf{v} \in W ,则 0=0vW \mathbf{0} = 0\mathbf{v} \in W (用 (ii) 与 1.1 节命题 (iv)),A3 成立;v=(1)vW -\mathbf{v} = (-1)\mathbf{v} \in W (再用 (ii)),A4 成立。 \blacksquare

通俗地说:判定子空间不需要重查八条公理,只需两条封闭性——“加不出去、乘不出去”。直觉图像:子空间必须包含零向量、必须沿每个成员的整个方向延伸(图 5-1:过原点的直线是 R2 \mathbb{R}^2 的子空间,平移后的平行线不是——它不含零向量,数乘一个负数立刻"乘出去")。

2. 两个来自矩阵的子空间

命题 对任意矩阵 A A kerA \ker A imA \operatorname{im} A 都是 R2 \mathbb{R}^2 的子空间。

证明:核:0kerA \mathbf{0} \in \ker A A0=0 A\mathbf{0} = \mathbf{0} );若 Au=Av=0 A\mathbf{u} = A\mathbf{v} = \mathbf{0} ,则 A(u+v)=Au+Av=0 A(\mathbf{u} + \mathbf{v}) = A\mathbf{u} + A\mathbf{v} = \mathbf{0} A(tu)=tAu=0 A(t\mathbf{u}) = t A\mathbf{u} = \mathbf{0} ——两条封闭性成立。像:0=A0imA \mathbf{0} = A\mathbf{0} \in \operatorname{im} A ;若 p=Au \mathbf{p} = A\mathbf{u} q=Av \mathbf{q} = A\mathbf{v} ,则 p+q=A(u+v)imA \mathbf{p} + \mathbf{q} = A(\mathbf{u} + \mathbf{v}) \in \operatorname{im} A tp=A(tu)imA t\mathbf{p} = A(t\mathbf{u}) \in \operatorname{im} A 。全部论证只用线性性,未触碰任何坐标。 \blacksquare

P2 P_2 中也有熟悉的影子:W={满足 p(1)=0 的 p} W = \{\text{满足 } p(1) = 0 \text{ 的 } p\} 是子空间(验证:(p+q)(1)=p(1)+q(1)=0 (p+q)(1) = p(1)+q(1) = 0 (tp)(1)=tp(1)=0 (tp)(1) = t\,p(1) = 0 )——它是"求值映射 pp(1) p \mapsto p(1) 的核"。子空间语言把相隔万里的结构(矩阵的核、多项式的根约束)统一在同一个框架下。

4. 基、维数与坐标

1. 线性组合语言的平移

以下定义逐字平移自第二章,只是把 R2 \mathbb{R}^2 换成任意空间 V V 线性组合a1v1++akvk a_1\mathbf{v}_1 + \dots + a_k\mathbf{v}_k )、张成 span \operatorname{span} 线性相关/无关(张成 V V 且无关)、维数 dimV \dim V (基的大小)。第二章的全部定理——冗余定理、坐标存在唯一性、基的最小性——证明中只用了八条公理,因此在任何线性空间中自动成立。

例:P2 P_2 {1,x,x2} \{1, x, x^2\} 是基(任意 a+bx+cx2 a + bx + cx^2 的表示显然唯一——系数即坐标);{1,x,1+x} \{1, x, 1+x\} 相关(第三者 = 前两者之和);{1,x+x2} \{1, x + x^2\} 无关但只张成二维子空间 {a+bx+bx2} \{a + bx + bx^2\} (中间两个系数被捆绑)。

2. 基的大小唯一(一般定理)

定理(维数良定义) 有限维空间 V V 的任意两组基含有相同个数的向量。

证明(第二章 3.6 节引理的推广,施特鲁斯替换引理路线):设 {b1,,bn} \{\mathbf{b}_1, \dots, \mathbf{b}_n\} {c1,,cm} \{\mathbf{c}_1, \dots, \mathbf{c}_m\} 都是基且 m>n m > n 。逐个把 c1,,cn \mathbf{c}_1, \dots, \mathbf{c}_n 换入第一组(替换引理:把无关组中的一个向量换成组外新向量而仍无关,只要新向量在原组的张成中;标准推导见第二章 3.6 节的三向量引理,同样的归纳在抽象空间中逐字成立):得到基 {c1,,cn} \{\mathbf{c}_1, \dots, \mathbf{c}_n\} 。此时 cn+1V=span{c1,,cn} \mathbf{c}_{n+1} \in V = \operatorname{span}\{\mathbf{c}_1, \dots, \mathbf{c}_n\} ,故 {c1,,cn+1} \{\mathbf{c}_1, \dots, \mathbf{c}_{n+1}\} 相关——与基的无关性矛盾。故 mn m \le n ;对称地 nm n \le m ,得 m=n m = n \blacksquare

(推论:n+1 n + 1 个向量一定相关(dimV=n \dim V = n 时);无关组可扩充成基;张成组可剪枝成基。这些"胖瘦定理"与第二章的结论同构,证明从略——它们是同一套公理的必然后果。)

3. 坐标:每个有限维空间都是某个 Rn \mathbb{R}^n

定理(坐标同构)dimV=n \dim V = n ,取定基 B={b1,,bn} \mathcal{B} = \{\mathbf{b}_1, \dots, \mathbf{b}_n\} ,则映射

v=ixibi    (x1,,xn)Rn\mathbf{v} = \sum_i x_i \mathbf{b}_i \;\longmapsto\; (x_1, \dots, x_n) \in \mathbb{R}^n

是良好定义的(坐标唯一)、线性的、一对一且到上的。

证明:坐标存在唯一性是第二章 3.3 节定理的抽象版(存在:基张成;唯一:若两组系数给出同一向量,相减得 (xixi)bi=0 \sum (x_i - x_i')\mathbf{b}_i = \mathbf{0} ,无关性迫使系数差全零)。线性性:u+v \mathbf{u} + \mathbf{v} 的坐标 = 坐标之和,tv t\mathbf{v} 的坐标 = 坐标的 t t 倍(逐项用公理展开)。一对一即坐标唯一性;到上即每个 n n 元数组给出一个线性组合。 \blacksquare

通俗地说:这是抽象理论的第一份大回报——只要选定基,多项式可以当作数组、矩阵可以当作数组、任何有限维空间都可以当作 Rn \mathbb{R}^n 来计算。抽象空间是"多姿势的 Rn \mathbb{R}^n ":换一组基就是换一套坐标。第一章到第四章在 R2 \mathbb{R}^2 中做的一切计算,都能平移到多项式空间、函数空间——只要先选好基。

5. 线性映射与秩一零化度定理

1. 抽象线性映射

定义 T:VW T: V \to W (两线性空间)线性,若保加法、保数乘(第三章 1.3 节的两公理)。核 kerT={v:Tv=0W} \ker T = \{\mathbf{v} : T\mathbf{v} = \mathbf{0}_W\} 与像 imT={Tv} \operatorname{im} T = \{T\mathbf{v}\} 分别是 V V W W 的子空间(3.2 节证明逐字平移)。

第三章的"矩阵 = 线性映射"定理现在有了抽象对应:选定域与目标空间的基后,每个线性映射由唯一矩阵实现。证明与第三章 1.3 节相同(像由基向量的去向决定);矩阵的大小由两空间维数决定——例如把 T:P2M2 T: P_2 \to M_2 用基 {1,x,x2} \{1, x, x^2\} {E11,E12,E21,E22} \{E_{11}, E_{12}, E_{21}, E_{22}\} 表示,得到一个 4×3 4 \times 3 矩阵。线性代数从此不再局限于方阵。

2. 秩一零化度定理(一般形式)

定理(秩一零化度)T:VW T: V \to W 线性,V V 有限维,则

dimV=dim(imT)+dim(kerT).\dim V = \dim(\operatorname{im} T) + \dim(\ker T).

证明:记 r=dim(imT) r = \dim(\operatorname{im} T) ,取像的一组基 {u1,,ur} \{\mathbf{u}_1, \dots, \mathbf{u}_r\} ,对每个 ui \mathbf{u}_i 选一个原像 viV \mathbf{v}_i \in V Tvi=ui T\mathbf{v}_i = \mathbf{u}_i )。再取核的一组基 {k1,,kk} \{\mathbf{k}_1, \dots, \mathbf{k}_k\} k=dimkerT k = \dim \ker T )。断言:

B={v1,,vr,  k1,,kk}\mathcal{B} = \{\mathbf{v}_1, \dots, \mathbf{v}_r,\; \mathbf{k}_1, \dots, \mathbf{k}_k\}

V V 的基。这将完成证明(dimV=r+k \dim V = r + k )。

张成:任取 vV \mathbf{v} \in V 。其像可写 Tv=iaiui T\mathbf{v} = \sum_i a_i \mathbf{u}_i 。考虑 v=viaivi \mathbf{v}' = \mathbf{v} - \sum_i a_i \mathbf{v}_i ,则

Tv=TviaiTvi=Tviaiui=0,T\mathbf{v}' = T\mathbf{v} - \sum_i a_i T\mathbf{v}_i = T\mathbf{v} - \sum_i a_i \mathbf{u}_i = \mathbf{0},

vkerT=span{kj} \mathbf{v}' \in \ker T = \operatorname{span}\{\mathbf{k}_j\} ,于是 v=iaivi+jbjkjspan(B) \mathbf{v} = \sum_i a_i \mathbf{v}_i + \sum_j b_j \mathbf{k}_j \in \operatorname{span}(\mathcal{B})

无关:设 iaivi+jbjkj=0 \sum_i a_i \mathbf{v}_i + \sum_j b_j \mathbf{k}_j = \mathbf{0} 。作用 T T

0=T0=iaiTvi+jbjTkj=iaiui+0,\mathbf{0} = T\mathbf{0} = \sum_i a_i T\mathbf{v}_i + \sum_j b_j T\mathbf{k}_j = \sum_i a_i \mathbf{u}_i + \mathbf{0},

{ui} \{\mathbf{u}_i\} 无关得 ai=0 a_i = 0 全部;代回原式只剩 jbjkj=0 \sum_j b_j \mathbf{k}_j = \mathbf{0} ,再由 {kj} \{\mathbf{k}_j\} 无关得 bj=0 b_j = 0 全部。 \blacksquare

通俗地说:定理的几何画面(图 5-3)——一圈输入向量被压扁到像直线上,而核这条直线上的向量全部消失。V V 的维数被"记账式"地拆成两笔:像里留下的自由度(秩)+ 核里消失的自由度(零化度),收支相抵,总量不变。第三章 5.2 节的表格(2=1+1 2 = 1 + 1 等)正是本定理在 R2 \mathbb{R}^2 的特例;从此以后,任何维数的变换都服从这条守恒律。

推论(方阵情形) T:RnRn T: \mathbb{R}^n \to \mathbb{R}^n 线性时,单射      \iff 满射      \iff 双射。证明:单射即 kerT={0} \ker T = \{\mathbf{0}\} ,即 dimker=0 \dim \ker = 0 ,即 dimim=n \dim \operatorname{im} = n ,即像 = 全空间(满射);反之亦然。这个"两端夹逼中间自动成立"的现象只在方阵(域=目标空间同维)时出现,是有限维线性代数最优美的结论之一。

3. 同构

定义(同构) 线性映射 T:VW T: V \to W 若是双射(其逆自动线性),称 T T 同构,记 VW V \cong W

定理 两个有限维空间同构      \iff 维数相同。(“维数是线性空间的唯一身份证”。)

证明:( \Rightarrow )同构限制在基上是无关组到无关组的一一对应:若 aiTbi=0 \sum a_i T\mathbf{b}_i = \mathbf{0} ,线性性得 T(aibi)=0 T(\sum a_i \mathbf{b}_i) = \mathbf{0} ,单射迫使 aibi=0 \sum a_i \mathbf{b}_i = \mathbf{0} ,无关性迫使 ai=0 a_i = 0 。故 T T 把基送到基,维数相等。( \Leftarrow )各自取基,按位置配对 bici \mathbf{b}_i \mapsto \mathbf{c}_i 再线性延拓,得到线性双射。 \blacksquare

通俗地说:维数相同的一切有限维空间在结构上不可区分——P2 P_2 R3 \mathbb{R}^3 、"3 个样本的时间序列"是同一个数学对象的三套皮肤。同构是把"看起来不同的东西"翻译成"本质上相同的东西"的正式语言。

6. 仿射子空间与解集结构

1. 仿射子空间

定义(仿射子空间) V V 的子集 S S 若是某个子空间 W W 的平移:S=p+W={p+w:wW} S = \mathbf{p} + W = \{\mathbf{p} + \mathbf{w} : \mathbf{w} \in W\} ,则称 S S 仿射子空间。当 pS \mathbf{p} \in S 任意时,W=Sp={sp:sS} W = S - \mathbf{p} = \{\mathbf{s} - \mathbf{p} : \mathbf{s} \in S\} 与平移起点无关,称为 S S 方向子空间

几何上,仿射子空间是"不强制过原点的直线/平面":R2 \mathbb{R}^2 中的仿射子空间恰是:点(W={0} W = \{\mathbf{0}\} )、不过原点的直线(W W 为一维)、全平面(W=R2 W = \mathbb{R}^2 )。图 5-1 的灰色平行线就是橙色子空间的平移:它继承了"方向"却丢失了"过原点"的资格,故不是子空间。

2. 非齐次方程组的解集结构

定理(解集结构)Ax=b A\mathbf{x} = \mathbf{b} 有解 xp \mathbf{x}_p (特解),则全部解的集合为

{x:Ax=b}=xp+kerA={xp+k:kkerA}.\{\mathbf{x} : A\mathbf{x} = \mathbf{b}\} = \mathbf{x}_p + \ker A = \{\mathbf{x}_p + \mathbf{k} : \mathbf{k} \in \ker A\}.

即:解集 = 特解 + 齐次解空间(一个仿射子空间,方向 = 核)。

证明:( \supseteq )若 kkerA \mathbf{k} \in \ker A ,则 A(xp+k)=Axp+Ak=b+0=b A(\mathbf{x}_p + \mathbf{k}) = A\mathbf{x}_p + A\mathbf{k} = \mathbf{b} + \mathbf{0} = \mathbf{b} ,是解。( \subseteq )若 Ax=b A\mathbf{x} = \mathbf{b} ,则 A(xxp)=bb=0 A(\mathbf{x} - \mathbf{x}_p) = \mathbf{b} - \mathbf{b} = \mathbf{0} ,故 xxpkerA \mathbf{x} - \mathbf{x}_p \in \ker A ,即 xxp+kerA \mathbf{x} \in \mathbf{x}_p + \ker A \blacksquare

推论(解的唯一性判据) Ax=b A\mathbf{x} = \mathbf{b} 的解要么不存在,要么恰一个(kerA={0} \ker A = \{\mathbf{0}\} 时),要么无穷多个且构成一条平行于核的直线(dimkerA=1 \dim \ker A = 1 时)——绝无"恰好两个解"的可能。

通俗地说:图 5-4 把定理画了出来:特解 xp \mathbf{x}_p 是一枚绿色锚点,解集是核直线(蓝)平移到锚点处的橙色直线,线上每个黄点都被 A A 送到同一个 b \mathbf{b } 。直觉解读:求一个解,再允许"沿核方向自由漂移"——漂移在变换中不可见(被 A A 吞掉),所以漂到哪儿都是解。求解算法由此获得结构:消元找到特解,回代得到核的基,两者拼出完整解集——这套流程对任何维数的方程组都成立。

7. 演示图像

本章演示程序位于 src/chapter5,生成图像位于 output/chapter5

图号 文件 内容
图 5-1 fig_5_1_subspaces.ppm 子空间 vs 仿射集
图 5-2 fig_5_2_image_kernel.ppm 投影矩阵的像与核
图 5-3 fig_5_3_rank_nullity.ppm 秩-零化度守恒
图 5-4 fig_5_4_affine_solution.ppm 解集 = 特解 + 核

图 5-1(fig_5_1_subspaces.ppm:橙色直线 span{(2,1)} \operatorname{span}\{(2,1)\} 过原点(绿色零向量坐镇原点),整数倍点阵展示数乘封闭;灰色平行线是它平移后的仿射集——不含零向量,一旦数乘负数就"飞出直线",永远成不了子空间。

图 5-2(fig_5_2_image_kernel.ppm:投影矩阵 P=12(1111) P = \tfrac{1}{2}\begin{pmatrix} 1 & 1 \\ 1 & 1 \end{pmatrix} 的像(红线 span{(1,1)} \operatorname{span}\{(1,1)\} )与核(蓝线 span{(1,1)} \operatorname{span}\{(1,-1)\} )恰成直角:任意向量 v \mathbf{v} (灰)被投影到 Pv P\mathbf{v} (绿),误差 vPv \mathbf{v} - P\mathbf{v} 落在核上(黄)——像与核把平面剖成两个互补的方向("互补"的精确含义将在第七章由正交性给出)。

图 5-3(fig_5_3_rank_nullity.ppm:一整圈单位向量(灰)在 P P 作用下全部压到红色像直线上(绿色箭头):dimim=1 \dim \operatorname{im} = 1 ;同时蓝色核直线上一整维的自由度消失:dimker=1 \dim \ker = 1 ;两者相加恰是输入空间的维数 2——守恒律的图像化。

图 5-4(fig_5_4_affine_solution.ppmPx=(1,1) P\mathbf{x} = (1,1) 的解集:绿色特解 xp=(1,1) \mathbf{x}_p = (1,1) ,橙色解直线是蓝色核直线的平移,线上黄点全部被 P P 映到同一个 (1,1) (1,1) ——“一个特解 + 全体自由漂移”。

8. 小结

概念 代数形式 几何形象
线性空间 八条公理 会员制俱乐部:能加能乘即入会
子空间 两条封闭性判定 必过原点、方向齐整(图 5-1)
基 / 维数 无关且张成 / 基的大小 自由度的精确计数
坐标同构 VRn V \cong \mathbb{R}^n 选基后万物皆数组
核与像 kerT \ker T imT \operatorname{im} T 消失方向 / 到达范围(图 5-2)
秩一零化度 dimV=dimim+dimker \dim V = \dim\operatorname{im} + \dim\ker 维数守恒:留下 + 消失 = 全部(图 5-3)
仿射子空间 p+W \mathbf{p} + W 不过原点的直线(图 5-1)
解集结构 解集 =xp+kerA = \mathbf{x}_p + \ker A 特解锚点 + 核方向漂移(图 5-4)

三条主线:

  1. 公理化是杠杆而非负担:一套证明覆盖几何向量、多项式、矩阵、函数——零向量唯一性、维数良定义、秩一零化度都是只靠八条公理推出的,坐标从未登场。
  2. 维数是空间的身份证:基的大小唯一、坐标同构、“同构      \iff 同维”——抽象空间被维数完全分类,有限维世界的地图就此闭合。
  3. 线性方程组的完整理论:解集 = 特解 + 核(仿射结构),存在性由 bim \mathbf{b} \in \operatorname{im} 裁决,唯一性由 ker={0} \ker = \{\mathbf{0}\} 裁决——第三章的三重视角现在被"像—核"两大子空间彻底统一。

9. 习题

  1. (公理检验) 下列集合哪些是 R2 \mathbb{R}^2 的子空间?逐一用两条封闭性判定,不合法的指出违反处:
    (a) {(x,y):x+y=0} \{(x, y) : x + y = 0\}
    (b) {(x,y):x+y=1} \{(x, y) : x + y = 1\}
    © {(x,y):xy=0} \{(x, y) : x y = 0\} (两坐标轴的并);
    (d) {(x,y):y=x2} \{(x, y) : y = x^2\}
  2. (多项式空间)P2 P_2 中判断下列向量组的相关性:
    (a) {1,  1+x,  1+x+x2} \{1,\; 1 + x,\; 1 + x + x^2\}
    (b) {x,  x2} \{x,\; x^2\}
    © {1+x,  1x,  2} \{1 + x,\; 1 - x,\; 2\} 。并给出 (a) 中每个向量在基 {1,x,x2} \{1, x, x^2\} 下的坐标。
  3. (维数计算)W={pP2:p(0)=p(1)} W = \{p \in P_2 : p(0) = p(1)\} 的维数与一组基(提示:设 p=a+bx+cx2 p = a + bx + cx^2 ,条件即 b+c=0 b + c = 0 ,消去一个参数)。
  4. (证明) 证明:W1,W2 W_1, W_2 是子空间 W1W2 \Rightarrow W_1 \cap W_2 是子空间;但 W1W2 W_1 \cup W_2 一般不是(举出平面上两条不同直线的反例——这解释了为什么"和" W1+W2 W_1 + W_2 才是正确的操作)。
  5. (秩一零化度) 定义 T:P2R T: P_2 \to \mathbb{R} Tp=p(1) Tp = p(1) (求值映射)。求 kerT \ker T imT \operatorname{im} T 与各自维数,验证 3=1+2 3 = 1 + 2
  6. (证明)T:VW T: V \to W 线性。证明:T T 单射      \iff kerT={0} \ker T = \{\mathbf{0}\} ;并用秩一零化度证明:dimV<dimW \dim V < \dim W T T 不可能满射,dimV>dimW \dim V > \dim W T T 不可能单射(“小推大必压扁,大推小必重叠”)。
  7. (解集结构){x+2y=42x+4y=8 \begin{cases} x + 2y = 4 \\ 2x + 4y = 8 \end{cases} 的解集,写成"特解 + 核"的形式,并画图验证解集是一条仿射直线。
  8. (坐标)w=(3,1) \mathbf{w} = (3, 1) 在基 {b1,b2} \{\mathbf{b}_1, \mathbf{b}_2\} b1=(1,1) \mathbf{b}_1 = (1, 1) b2=(1,1) \mathbf{b}_2 = (1, -1) 下的坐标。现在把同一套坐标思想用于 P2 P_2 :求 p(x)=2+3x+5x2 p(x) = 2 + 3x + 5x^2 在基 {1,  1+x,  1+x+x2} \{1,\; 1+x,\; 1+x+x^2\} 下的坐标(两个题目是同一个算法)。
  9. (思考) 无穷维空间 C[a,b] C[a,b] 没有有限基。 "{1,x,x2,} \{1, x, x^2, \dots\} 张成多项式全体,但连续函数如 sinx \sin x 不在其中"。由此解释:为什么说 dimC[a,b]= \dim C[a,b] = \infty ?(无穷维空间中秩一零化度定理依然成立,但需要更细的论证——第七章的傅里叶级数将给出"无穷维基"的雏形。)
  10. (编程) 修改演示 4:把目标换为 b=(1.5,1.5) \mathbf{b} = (1.5, 1.5) (仍在像直线上)与 b=(2,1) \mathbf{b} = (2, 1) (不在像直线上)。前者解直线平移,后者无解——用图像验证"存在性由 bim \mathbf{b} \in \operatorname{im} 裁决"。

6. 特征值与对角化

前几章我们把矩阵当作"变换的账本"整体使用。本章换一个提问方式:变换内部有没有Preferred方向——被矩阵作用后只伸缩、不转向的直线? 这些"不变方向"(特征向量)及其伸缩倍数(特征值)是矩阵最深层的指纹:它们决定了变换的骨架、迭代的长期行为、乃至矩阵高次幂的封闭公式。几何直觉始终是主线:特征方向是变换的"主轴",对角化就是把变换拆成"沿主轴独立伸缩"的复合。

1. 特征值与特征向量

1. 定义

定义(特征值与特征向量)A A 2×2 2 \times 2 矩阵。若存在非零向量 v \mathbf{v} 与数 λ \lambda 使

Av=λv,A\mathbf{v} = \lambda\mathbf{v},

则称 λ \lambda A A 特征值v \mathbf{v} 为属于 λ \lambda 特征向量

几何含义:A A 把整条直线 span{v} \operatorname{span}\{\mathbf{v}\} 原地伸缩(λ>0 \lambda > 0 )或翻转(λ<0 \lambda < 0 ),不会把它转离自身方向。注意特征向量不唯一:同一方向上任何非零倍数都是;特征值才是唯一归属每个方向的数。零向量被排除在定义外——它被一切矩阵送到零,不携带任何信息。

例:投影矩阵 P=12(1111) P = \tfrac{1}{2}\begin{pmatrix} 1 & 1 \\ 1 & 1 \end{pmatrix} (第五章图 5-2)在像直线方向 (1,1) (1,1) 上不改变(P(1,1)=(1,1) P(1,1) = (1,1) ,特征值 1),在核直线方向 (1,1) (1,-1) 上归零(P(1,1)=0=0(1,1) P(1,-1) = \mathbf{0} = 0 \cdot (1,-1) ,特征值 0)——像与核两个子空间恰是两条特征直线

2. 特征方程

定理(特征方程) λ \lambda A=(abcd) A = \begin{pmatrix} a & b \\ c & d \end{pmatrix} 的特征值      \iff

λ2(a+d)λ+(adbc)=0.\lambda^2 - (a + d)\,\lambda + (ad - bc) = 0.

(记 trA=a+d \operatorname{tr} A = a + d 。称 p(λ)=λ2trAλ+detA p(\lambda) = \lambda^2 - \operatorname{tr} A\,\lambda + \det A 特征多项式。)

证明Av=λv A\mathbf{v} = \lambda\mathbf{v} 有非零解      \iff (AλI)v=0 (A - \lambda I)\mathbf{v} = \mathbf{0} 有非零解      \iff det(AλI)=0 \det(A - \lambda I) = 0 (第三章可逆性判据:齐次方程有非零解即矩阵不可逆)。而

det(AλI)=det(aλbcdλ)=(aλ)(dλ)bc=λ2(a+d)λ+(adbc).\det(A - \lambda I) = \det\begin{pmatrix} a - \lambda & b \\ c & d - \lambda \end{pmatrix} = (a - \lambda)(d - \lambda) - bc = \lambda^2 - (a+d)\lambda + (ad - bc).

判别式 Δ=(trA)24detA \Delta = (\operatorname{tr} A)^2 - 4\det A 裁决根的形态:Δ>0 \Delta > 0 两个不同实根;Δ=0 \Delta = 0 一个重根;Δ<0 \Delta < 0 一对共轭复根。 \blacksquare

通俗地说:求特征值被化归为解一元二次方程——迹与行列式这两个矩阵不变量(换基不改变它们,见习题)恰好是方程的两个系数。几何预告:Δ<0 \Delta < 0 (如旋转矩阵)时变换没有任何实不变方向,向量被越转越远,"不变方向"只能在复平面上想象(见 2.3 节与图 6-4)。

3. 求解流程(例)

A=(2112) A = \begin{pmatrix} 2 & 1 \\ 1 & 2 \end{pmatrix} 的特征对:

第一步(特征方程)λ24λ+3=0 \lambda^2 - 4\lambda + 3 = 0 ,因式分解 (λ3)(λ1)=0 (\lambda - 3)(\lambda - 1) = 0 ,得 λ1=3 \lambda_1 = 3 λ2=1 \lambda_2 = 1

第二步(特征向量):对 λ1=3 \lambda_1 = 3 :解 (A3I)v=0 (A - 3I)\mathbf{v} = \mathbf{0} ,即 (1111)v=0 \begin{pmatrix} -1 & 1 \\ 1 & -1 \end{pmatrix}\mathbf{v} = \mathbf{0} ,行简化得 v1=v2 v_1 = v_2 ,取 v1=(1,1) \mathbf{v}_1 = (1, 1) 。对 λ2=1 \lambda_2 = 1 (1111)v=0 \begin{pmatrix} 1 & 1 \\ 1 & 1 \end{pmatrix}\mathbf{v} = \mathbf{0} v1=v2 v_1 = -v_2 ,取 v2=(1,1) \mathbf{v}_2 = (1, -1)

几何校验(图 6-1):A A 把对角线方向 (1,1) (1,1) 拉长 3 倍、把反对角方向 (1,1) (1,-1) 保持原样;一般向量(如 (2,0.5) (2, 0.5) )则被转向。两条特征直线(红/蓝)就是这张变换地图的"主干道"。

2. 特征值的基本性质

1. 迹与行列式是特征值之和与积

定理(韦达公式)λ1,λ2 \lambda_1, \lambda_2 A A 的两个特征值(含重根、含复根),则

λ1+λ2=trA,λ1λ2=detA.\lambda_1 + \lambda_2 = \operatorname{tr} A,\qquad \lambda_1 \lambda_2 = \det A.

证明:特征多项式 λ2trAλ+detA \lambda^2 - \operatorname{tr} A\,\lambda + \det A λ1,λ2 \lambda_1, \lambda_2 为根,故可分解为 (λλ1)(λλ2)=λ2(λ1+λ2)λ+λ1λ2 (\lambda - \lambda_1)(\lambda - \lambda_2) = \lambda^2 - (\lambda_1 + \lambda_2)\lambda + \lambda_1\lambda_2 ;两个首一二次多项式相等则系数相等。 \blacksquare

通俗地说:不用解方程也能读出特征值的"总量":迹 = 两个伸缩倍数之和,行列式 = 两个伸缩倍数之积(即面积因子——与第四章的缩放因子定理严丝合缝:det=λ1λ2 |\det| = |\lambda_1||\lambda_2| )。

2. 特征值的函数

定理(继承法则)Av=λv A\mathbf{v} = \lambda\mathbf{v} v0 \mathbf{v} \neq \mathbf{0} ),则:

矩阵 特征值 特征向量
Ak A^k k1 k \ge 1 λk \lambda^k v \mathbf{v} (不变)
A1 A^{-1} (若可逆) 1/λ 1/\lambda v \mathbf{v}
A+cI A + cI λ+c \lambda + c v \mathbf{v}
cA cA cλ c\lambda v \mathbf{v}

证明(逐行):Akv=Ak1(Av)=Ak1(λv)=λAk1v==λkv A^k \mathbf{v} = A^{k-1}(A\mathbf{v}) = A^{k-1}(\lambda\mathbf{v}) = \lambda A^{k-1}\mathbf{v} = \dots = \lambda^k \mathbf{v} (归纳,每步用线性性提出 λ \lambda )。A1 A^{-1} :由 Av=λv A\mathbf{v} = \lambda\mathbf{v} 两侧左乘 A1 A^{-1} v=λA1v \mathbf{v} = \lambda A^{-1}\mathbf{v} λ0 \lambda \neq 0 (否则 A A 不可逆——零特征值即 detA=0 \det A = 0 ),除以 λ \lambda A1v=1λv A^{-1}\mathbf{v} = \tfrac{1}{\lambda}\mathbf{v} (A+cI)v=Av+cv=(λ+c)v (A + cI)\mathbf{v} = A\mathbf{v} + c\mathbf{v} = (\lambda + c)\mathbf{v} (cA)v=cλv (cA)\mathbf{v} = c\lambda\mathbf{v} \blacksquare

通俗地说:特征向量是变换的"固定资产"——对矩阵做多项式运算、求逆,不变方向都不搬家,只是特征值跟着变。这条法则将直接即出矩阵幂的封闭公式(3.3 节)。

3. 复特征值与旋转

Δ<0 \Delta < 0 ,特征值为共轭复对 λ=α±iβ \lambda = \alpha \pm i\beta 。几何上这标志着变换含有"旋转成分":以旋转矩阵 Rθ=(cosθsinθsinθcosθ) R_\theta = \begin{pmatrix} \cos\theta & -\sin\theta \\ \sin\theta & \cos\theta \end{pmatrix} 为例(θ0,π \theta \neq 0, \pi ),

λ22cosθλ+1=0,λ=cosθ±isinθ=e±iθ,\lambda^2 - 2\cos\theta\,\lambda + 1 = 0,\qquad \lambda = \cos\theta \pm i\sin\theta = e^{\pm i\theta},

(欧拉公式,超出本书范围但值得铭记)。图 6-4 把它画了出来:向量 v \mathbf{v} R90 R_{90^\circ} 连续作用形成风车 vRvR2vR3vv \mathbf{v} \to R\mathbf{v} \to R^2\mathbf{v} \to R^3\mathbf{v} \to \mathbf{v} ,没有任何方向保持不动。实不变方向不存在,但特征值的辐角 θ \theta 精确记录了旋转角——复特征值不是"失败的实数",而是"旋转的语言"。第五章的复数提示在 此兑现了一半;另一半(共轭复根如何拼出实平面上的旋转)在更高级的课程中展开。

3. 对角化

1. 定义:换到特征坐标系

定义(相似与对角化) 若存在可逆矩阵 P P 使 P1AP=Λ P^{-1}AP = \Lambda 为对角阵,称 A A 可对角化Λ=(λ100λ2) \Lambda = \begin{pmatrix} \lambda_1 & 0 \\ 0 & \lambda_2 \end{pmatrix}

定理(对角化的结构) 下列等价:

(i)A A 可对角化;

(ii)A A 有两个线性无关的特征向量;

(iii)特征方程有两个不同实根,或 A A 已是数量矩阵(λI \lambda I )。

此时 P P 的两列恰为特征向量 v1,v2 \mathbf{v}_1, \mathbf{v}_2 Λ \Lambda 的对角元为对应特征值。

证明:(ii) \Rightarrow (i):设 v1,v2 \mathbf{v}_1, \mathbf{v}_2 无关,则 P=(v1  v2) P = (\mathbf{v}_1\; \mathbf{v}_2) 可逆(两列不共线,detP0 \det P \neq 0 )。计算

AP=(Av1  Av2)=(λ1v1  λ2v2)=(v1  v2)(λ100λ2)=PΛ,AP = (A\mathbf{v}_1\; A\mathbf{v}_2) = (\lambda_1 \mathbf{v}_1\; \lambda_2 \mathbf{v}_2) = (\mathbf{v}_1\; \mathbf{v}_2)\begin{pmatrix} \lambda_1 & 0 \\ 0 & \lambda_2 \end{pmatrix} = P\Lambda,

两侧左乘 P1 P^{-1} 即得。(i) \Rightarrow (ii):对角化式改写为 AP=PΛ AP = P\Lambda ,按列比较:A A 的第 j j 列 = P P 的第 j j 列乘 λj \lambda_j ,即 P P 的列是特征向量;P P 可逆故列无关。(ii)     \iff (iii):两个不同实根给出两个不同特征值,属于不同特征值的特征向量必无关(若 av1+bv2=0 a\mathbf{v}_1 + b\mathbf{v}_2 = \mathbf{0} 且均非零,用 A A 作用与原式联立:aλ1v1+bλ2v2=0 a\lambda_1\mathbf{v}_1 + b\lambda_2\mathbf{v}_2 = \mathbf{0} ,第一式乘 λ2 \lambda_2 相减得 a(λ1λ2)v1=0 a(\lambda_1 - \lambda_2)\mathbf{v}_1 = \mathbf{0} ,因 λ1λ2 \lambda_1 \neq \lambda_2 v10 \mathbf{v}_1 \neq 0 a=0 a = 0 ,进而 b=0 b = 0 )。重根情形:属于同一特征值的特征向量集合 {v:(AλI)v=0}=ker(AλI) \{\mathbf{v} : (A - \lambda I)\mathbf{v} = \mathbf{0} \} = \ker(A - \lambda I) 是个子空间,其维数至多为重数——重根时若这个特征空间维数为 1(如剪切矩阵,见例),找不到两个无关特征向量;若维数为 2,则 AλI A - \lambda I 的核是全平面,即 A=λI A = \lambda I 本身已对角。 \blacksquare

例(不可对角化:剪切) S=(1101) S = \begin{pmatrix} 1 & 1 \\ 0 & 1 \end{pmatrix} :特征多项式 (λ1)2 (\lambda - 1)^2 ,重根 λ=1 \lambda = 1 ker(SI)={(t,0)} \ker(S - I) = \{(t, 0)\} 仅一维——只有水平方向不动。剪切把每个非水平向量都推离原方向,只有一个不变方向,攒不齐两组特征坐标轴。几何诊断:剪切没有十字形主轴,只有一根主轴

通俗地说:对角化 = 换到特征坐标系看变换。在新坐标系(以特征向量为轴)里,矩阵变成 Λ \Lambda ——两个坐标各自独立伸缩、互不干扰(图 6-3:特征基网格沿红轴拉伸 3 倍、沿蓝轴不动,网格形状不歪,只是"疏密变了")。原坐标系里需要四个数描述的纠结动作,特征坐标系里只需两个数——好坐标把复杂变简单,这是线性代数的中心思想

2. 矩阵幂的封闭公式

定理(幂公式)A=PΛP1 A = P\Lambda P^{-1} ,则

Ak=PΛkP1,Λk=(λ1k00λ2k).A^k = P\Lambda^kP^{-1},\qquad \Lambda^k = \begin{pmatrix} \lambda_1^k & 0 \\ 0 & \lambda_2^k \end{pmatrix}.

证明:归纳。A2=(PΛP1)(PΛP1)=PΛ(P1P)ΛP1=PΛ2P1 A^2 = (P\Lambda P^{-1})(P\Lambda P^{-1}) = P\Lambda(P^{-1}P)\Lambda P^{-1} = P\Lambda^2P^{-1} ;设 Ak=PΛkP1 A^k = P\Lambda^k P^{-1} ,则 Ak+1=PΛkP1PΛP1=PΛk+1P1 A^{k+1} = P\Lambda^kP^{-1} \cdot P\Lambda P^{-1} = P\Lambda^{k+1}P^{-1} \blacksquare

通俗地说:把 A A 的动作想象成三段:P1 P^{-1} (翻译到特征语)→ Λ \Lambda (各自伸缩)→ P P (翻译回来)。重复 k k 次:翻译过去、连做 k k 次简单伸缩(中间的 P1P P^{-1}P 抵消)、翻译回来——只有伸缩被执行了 k k 遍,于是只有 λk \lambda^k 出现。这就是下一节应用的引擎。

4. 应用:差分方程与长期行为

1. 线性迭代系统

许多过程形如 vk+1=Avk \mathbf{v}_{k+1} = A\mathbf{v}_k (人口迁移、利率滚存、信号滤波):初始状态 v0 \mathbf{v}_0 被矩阵反复作用,vk=Akv0 \mathbf{v}_k = A^k \mathbf{v}_0 。幂公式给出完整解:把 v0 \mathbf{v}_0 写成特征组合 v0=c1v1+c2v2 \mathbf{v}_0 = c_1\mathbf{v}_1 + c_2\mathbf{v}_2 ,则

vk=Akv0=c1λ1kv1+c2λ2kv2.\mathbf{v}_k = A^k\mathbf{v}_0 = c_1\lambda_1^k\mathbf{v}_1 + c_2\lambda_2^k\mathbf{v}_2.

(证明:线性性与继承法则,Akvi=λikvi A^k\mathbf{v}_i = \lambda_i^k \mathbf{v}_i 。)长期行为完全由较大的 λ |\lambda| 裁决

| 主特征值 λ1 \lambda_1 λ1λ2 |\lambda_1| \ge |\lambda_2| ) | vk \mathbf{v}_k 的长期行为 |
| --------------------------------------------------------- | ----------------------------------------------------- |
| λ1>1 |\lambda_1| > 1 | 几何级数发散,方向趋向 v1 \mathbf{v}_1 |
| λ1<1 |\lambda_1| < 1 | 几何级数收敛到零(耗散) |
| λ1=1 \lambda_1 = 1 | 趋向稳态 c1v1 c_1 \mathbf{v}_1 (马尔可夫链的平稳分布) |
| λ1=1 \lambda_1 = -1 (且 λ2<1 |\lambda_2| < 1 ) | 两周期振荡 |
| λ1=1 |\lambda_1| = 1 ,复 | 边界振荡(旋转,不衰减) |

2. 例:斐波那契数列的封闭公式

斐波那契递推 Fk+1=Fk+Fk1 F_{k+1} = F_k + F_{k-1} 可以包装成矩阵迭代:取 vk=(Fk+1,Fk)T \mathbf{v}_k = (F_{k+1}, F_k)^{\mathsf T} ,则

vk+1=(Fk+2Fk+1)=(1110)(Fk+1Fk)=Avk.\mathbf{v}_{k+1} = \begin{pmatrix} F_{k+2} \\ F_{k+1} \end{pmatrix} = \begin{pmatrix} 1 & 1 \\ 1 & 0 \end{pmatrix}\begin{pmatrix} F_{k+1} \\ F_k \end{pmatrix} = A\mathbf{v}_k.

特征方程:λ2λ1=0 \lambda^2 - \lambda - 1 = 0 ,根为黄金比 φ=1+521.618 \varphi = \tfrac{1 + \sqrt 5}{2} \approx 1.618 ψ=1520.618 \psi = \tfrac{1 - \sqrt 5}{2} \approx -0.618 (注意 ψ=1/φ \psi = -1/\varphi )。特征向量分别取 (φ,1)T (\varphi, 1)^{\mathsf T} (ψ,1)T (\psi, 1)^{\mathsf T} (验证:A(φ,1)T=(φ+1,φ)T=φ(φ,1)T A(\varphi,1)^{\mathsf T} = (\varphi + 1, \varphi)^{\mathsf T} = \varphi(\varphi, 1)^{\mathsf T} ,末步用了 φ2=φ+1 \varphi^2 = \varphi + 1 )。初始 v0=(1,0) \mathbf{v}_0 = (1, 0) 分解为 15(φ,1)T15(ψ,1)T \tfrac{1}{\sqrt 5}(\varphi, 1)^{\mathsf T} - \tfrac{1}{\sqrt 5}(\psi, 1)^{\mathsf T} (解二元一次方程即得系数),故

vk=φk5(φ1)ψk5(ψ1),\mathbf{v}_k = \frac{\varphi^k}{\sqrt 5}\begin{pmatrix} \varphi \\ 1 \end{pmatrix} - \frac{\psi^k}{\sqrt 5}\begin{pmatrix} \psi \\ 1 \end{pmatrix},

取第二分量:

Fk=φkψk5    φk5.F_k = \frac{\varphi^k - \psi^k}{\sqrt 5} \;\approx\; \frac{\varphi^k}{\sqrt 5}.

(后一个近似成立因 ψ<1 |\psi| < 1 ,其贡献指数衰减。)整数数列被两个无理数的幂精确表出——特征值的"指纹"身份在此登峰造极。相邻两项之比 Fk+1/Fkφ F_{k+1}/F_k \to \varphi 也由同一公式读出:主特征值主幸长期统治迭代。

3. 幂迭代:不解方程找主特征值

解特征方程在大矩阵(几千几万维)时不可行,数值上改用幂迭代:任取 v0 \mathbf{v}_0 (不与特征方向正交即可),反复 vAv \mathbf{v} \gets A\mathbf{v} 并归一化。

收敛性:设 λ1 \lambda_1 严格占优(λ1>λ2 |\lambda_1| > |\lambda_2| )。由 4.1 节分解,vk=λ1k(c1v1+c2(λ2/λ1)kv2) \mathbf{v}_k = \lambda_1^k(c_1\mathbf{v}_1 + c_2(\lambda_2/\lambda_1)^k\mathbf{v}_2) ,归一化后括号内第二项以几何速率 λ2/λ1 |\lambda_2/\lambda_1| 消失,方向收敛到 v1 \mathbf{v}_1 ;同时 Avk/vkλ1 \|A\mathbf{v}_k\| / \|\mathbf{v}_k\| \to |\lambda_1| 。图 6-2:从 (1,0.2) (1, 0.2) 出发七步内箭头颜色渐变并贴合红色主轴——收敛速率 λ2/λ1=1/3 |\lambda_2/\lambda_1| = 1/3 ,每三步误差缩小到约三分之一。这就是 Google PageRank、主成分分析(第八章)等大型计算的心脏。

5. 演示图像

本章演示程序位于 src/chapter6,生成图像位于 output/chapter6

图号 文件 内容
图 6-1 fig_6_1_eigendirections.ppm 特征方向:不变的主轴
图 6-2 fig_6_2_power_iteration.ppm 幂迭代收敛到主轴
图 6-3 fig_6_3_diagonalize.ppm 对角化:特征基网格独立伸缩
图 6-4 fig_6_4_complex_eigen.ppm 旋转矩阵没有实特征向量

图 6-1(fig_6_1_eigendirections.ppmA=(2112) A = \begin{pmatrix} 2 & 1 \\ 1 & 2 \end{pmatrix} 的两条特征直线(红:λ=3 \lambda = 3 ;蓝:λ=1 \lambda = 1 ):一般向量 (2,0.5) (2, 0.5) (灰)的像(橙)方向改变;红轴上的向量被拉长 3 倍不转向,蓝轴上的向量保持不动——只有这两条主干道免于转向。

图 6-2(fig_6_2_power_iteration.ppm:幂迭代从 (1,0.2) (1, 0.2) 出发(颜色逐次变化),方向迅速贴合红色主轴 (1,1)/2 (1,1)/\sqrt 2 ——λ2/λ1=1/3 |\lambda_2/\lambda_1| = 1/3 的几何衰减清晰可见:前两步大转,之后每次仅微调。

图 6-3(fig_6_3_diagonalize.ppm:特征基 {(1,1),(1,1)} \{(1,1), (1,-1)\} 的格点(橙)被 A A 作用后(绿点):红轴方向拉开三倍、蓝轴方向纹丝不动,灰色连线显示每个格点的位移轨迹——"斜正交"网格保持形状,只有疏密改变,这就是对角化的几何体感。

图 6-4(fig_6_4_complex_eigen.ppm:旋转 90° 的风车:vRvR2vR3vv \mathbf{v} \to R\mathbf{v} \to R^2\mathbf{v} \to R^3\mathbf{v} \to \mathbf{v} (四色箭头),除零向量外无一幸免于转向——实特征向量不存在,特征值 ±i \pm i 记录的是旋转本身。

6. 小结

概念 代数形式 几何形象
特征对 Av=λv A\mathbf{v} = \lambda\mathbf{v} 不变方向 + 伸缩倍数(图 6-1)
特征方程 λ2trAλ+detA=0 \lambda^2 - \operatorname{tr} A\,\lambda + \det A = 0 主轴的代数入口
韦达公式 λ1+λ2=trA \lambda_1 + \lambda_2 = \operatorname{tr} A λ1λ2=detA \lambda_1\lambda_2 = \det A 伸缩倍数的和与积
继承法则 Akλk A^k \to \lambda^k A11/λ A^{-1} \to 1/\lambda 特征向量是固定资产
对角化 A=PΛP1 A = P\Lambda P^{-1} 换到主轴坐标系,动作 = 独立伸缩(图 6-3)
不可对角化 剪切:重根但特征空间一维 只有一根主轴,攒不齐十字
复特征值 Δ<0 \Delta < 0 α±iβ \alpha \pm i\beta 旋转成分,辐角即转角(图 6-4)
幂公式 Ak=PΛkP1 A^k = P\Lambda^kP^{-1} 翻译—连伸缩—翻译回来
迭代系统 vk=ciλikvi \mathbf{v}_k = \sum c_i\lambda_i^k\mathbf{v}_i 长期由最大 $

三条主线:

  1. 特征向量是变换的主轴:对角化 = 换到主轴坐标系,四个数的纠结动作被拆成两个独立伸缩——“好坐标把复杂变简单”。
  2. 特征值是矩阵的指纹:迹与行列式由它决定,矩阵幂由它表达,迭代长期行为由它裁决,斐波那契数由它精确生成——不变的代数身份,全息的几何信息。
  3. 退化与复数各有其意义:重根可能意味着"只有一根主轴"(剪切,不可对角化)也可能意味着"已经对角"(数量矩阵);复根不是失败而是旋转的语言——代数现象背后都有几何身份。

7. 习题

  1. (计算) 求下列矩阵的特征值与特征向量,并各用一句话描述几何动作:
    (a) (3005) \begin{pmatrix} 3 & 0 \\ 0 & 5 \end{pmatrix}
    (b) (4114) \begin{pmatrix} 4 & 1 \\ 1 & 4 \end{pmatrix}
    © (0220) \begin{pmatrix} 0 & 2 \\ 2 & 0 \end{pmatrix}
    (d) (1201) \begin{pmatrix} 1 & 2 \\ 0 & 1 \end{pmatrix} (不可对角化的例)。
  2. (迹与行列式) 不解方程,判断下列矩阵特征值的形态(两个不同实根 / 重根 / 复根):
    (a) (2112) \begin{pmatrix} 2 & 1 \\ 1 & 2 \end{pmatrix}
    (b) (1111) \begin{pmatrix} 1 & 1 \\ -1 & 1 \end{pmatrix}
    © (3111) \begin{pmatrix} 3 & -1 \\ 1 & 1 \end{pmatrix}
    (d) (2110) \begin{pmatrix} 2 & 1 \\ 1 & 0 \end{pmatrix} (斐波那契矩阵)。
  3. (证明) 证明:三角矩阵 (ab0d) \begin{pmatrix} a & b \\ 0 & d \end{pmatrix} 的特征值就是对角元 a,d a, d 。(这解释了为什么幂公式中 Λ \Lambda 的对角元是特征值:对角阵是特例。)
  4. (证明) 证明属于不同特征值的特征向量线性无关(3.1 节证明中的引理,补全细节),并由此说明:两个不同实根必可对角化。
  5. (幂公式)A=(2112) A = \begin{pmatrix} 2 & 1 \\ 1 & 2 \end{pmatrix} ,用对角化计算 A10 A^{10} (先求 P P Λ \Lambda P1 P^{-1} ,再乘出——结果应是一个具体整数矩阵)。
  6. (迭代系统)A=(0.90.10.20.8) A = \begin{pmatrix} 0.9 & 0.1 \\ 0.2 & 0.8 \end{pmatrix} (人口迁移模型:城市/乡村每年按比例流动)。求特征值与稳态向量(属于 λ=1 \lambda = 1 的特征向量,分量和为 1),并说明任意初始分布的长期趋向。
  7. (斐波那契) 用封闭公式 Fk=(φkψk)/5 F_k = (\varphi^k - \psi^k)/\sqrt 5 计算 F10 F_{10} ,验证与递推值一致(55 55 )。再证明 Fk+1/Fkφ F_{k+1}/F_k \to \varphi
  8. (证明) 证明:A A 可逆      \iff 0 0 不是 A A 的特征值;且若 Av=λv A\mathbf{v} = \lambda\mathbf{v} A1v=λ1v A^{-1}\mathbf{v} = \lambda^{-1}\mathbf{v} (继承法则的逆矩阵行)。
  9. (思考) 相似不变量:设 B=P1AP B = P^{-1}AP 。证明 trB=trA \operatorname{tr} B = \operatorname{tr} A detB=detA \det B = \det A (提示:用第四章乘法公式与转置性质化简 det(P1AP) \det(P^{-1}AP) ;迹的验证直接展开)。由此说明:不同基下同一变换的矩阵"表不同而魂相同",特征多项式是换基不变的。
  10. (编程) 修改演示 2:把矩阵换为 (130.52) \begin{pmatrix} 1 & 3 \\ 0.5 & 2 \end{pmatrix} (先解特征方程预计主轴方向与收敛速率,再运行观察是否一致)。再试剪切矩阵,观察幂迭代会发生什么(方向收敛到唯一主轴——但它不收敛到特征向量对,验证"只有一个特征方向")。

7. 内积与正交

到目前为止,线性空间只有"加与乘",没有角度、没有长度、没有垂直。本章补上这块拼图:内积。它一旦登场,几何的全部直觉——长度、夹角、垂直、投影、最短距离——都将获得代数定义;反过来,最小二乘拟合、傅里叶级数这些看似与几何无关的技术,将被看清楚本质上都是投影。本章还将兑现两个老承诺:第五章说"像与核互相垂直的精确含义本章给出",第六章说"对称矩阵的主轴互相正交"(下一章正式证明)。数形结合在本章达到峰值。

1. 内积

1. 定义

定义(内积)u=(u1,u2) \mathbf{u} = (u_1, u_2) v=(v1,v2) \mathbf{v} = (v_1, v_2) 定义

u,v=uv=u1v1+u2v2.\langle \mathbf{u}, \mathbf{v} \rangle = \mathbf{u} \cdot \mathbf{v} = u_1 v_1 + u_2 v_2.

它满足四条基本性质(对一切向量与数):

性质 数学表达式
对称性 u,v=v,u \langle \mathbf{u}, \mathbf{v} \rangle = \langle \mathbf{v}, \mathbf{u} \rangle
对第一变元线性 au+au,v=au,v+au,v \langle a\mathbf{u} + a'\mathbf{u}', \mathbf{v} \rangle = a\langle \mathbf{u}, \mathbf{v} \rangle + a'\langle \mathbf{u}', \mathbf{v} \rangle
正定性 v,v0 \langle \mathbf{v}, \mathbf{v} \rangle \ge 0 ,且 =0    v=0 = 0 \iff \mathbf{v} = \mathbf{0}
退化零 0,v=0 \langle \mathbf{0}, \mathbf{v} \rangle = 0

(验证都直逐项展开,例如对称性:u1v1+u2v2=v1u1+v2u2 u_1 v_1 + u_2 v_2 = v_1 u_1 + v_2 u_2 用数的交换律。由对称性,对第二变元也线性——“双线性”。)

2. 范数与夹角

定义(范数) v=v,v=v12+v22 \|\mathbf{v}\| = \sqrt{\langle \mathbf{v}, \mathbf{v}\rangle} = \sqrt{v_1^2 + v_2^2} (第一章的模)。定义(距离) d(u,v)=uv d(\mathbf{u}, \mathbf{v}) = \|\mathbf{u} - \mathbf{v}\|

定理(柯西一施瓦茨不等式)

u,vuv,|\langle \mathbf{u}, \mathbf{v} \rangle| \le \|\mathbf{u}\| \cdot \|\mathbf{v}\|,

等号成立      \iff 两向量共线。

证明:若 u=0 \mathbf{u} = \mathbf{0} 两边皆零,成立。设 u0 \mathbf{u} \neq \mathbf{0} ,对任意实数 t t ,由正定性:

0tu+v2=tu+v,  tu+v=t2u2+2tu,v+v2.0 \le \|t\mathbf{u} + \mathbf{v}\|^2 = \langle t\mathbf{u} + \mathbf{v},\; t\mathbf{u} + \mathbf{v} \rangle = t^2\|\mathbf{u}\|^2 + 2t\langle \mathbf{u}, \mathbf{v} \rangle + \|\mathbf{v}\|^2.

(展开用了双线性与对称性。)右端是 t t 的二次函数,开口向上且恒非负,故判别式 0 \le 0

u,v2u2v20.\langle \mathbf{u}, \mathbf{v} \rangle^2 - \|\mathbf{u}\|^2\|\mathbf{v}\|^2 \le 0.

开方即得。等号对应判别式 =0 = 0 ,即二次函数有实根 t0 t_0 使 t0u+v=0 \|t_0\mathbf{u} + \mathbf{v}\| = 0 ,即 v=t0u \mathbf{v} = -t_0 \mathbf{u} 共线。 \blacksquare

通俗地说:柯西一施瓦茨是"夹角存在性"的代数保障:由它可定义

cosθ=u,vuv,θ[0,π],\cos\theta = \frac{\langle \mathbf{u}, \mathbf{v} \rangle}{\|\mathbf{u}\|\,\|\mathbf{v}\|},\qquad \theta \in [0, \pi],

因为不等式恰好保证右端落在 [1,1] [-1, 1] 内。没有柯西一施瓦茨,"夹角"就没有定义;它也是泛函分析、概率论中一串不等式的祖先。

推论(三角不等式) u+vu+v \|\mathbf{u} + \mathbf{v}\| \le \|\mathbf{u}\| + \|\mathbf{v}\| (证明:平方展开,用柯西一施瓦茨估计交叉项)。

3. 转置的真正身份(深入)

内积给出转置的几何意义:对任意矩阵 A A

Au,v=u,ATv.\langle A\mathbf{u}, \mathbf{v} \rangle = \langle \mathbf{u}, A^{\mathsf T}\mathbf{v} \rangle.

证明:两边都等于 (au1+bu2)v1+(cu1+du2)v2=u1(av1+cv2)+u2(bv1+dv2) (a u_1 + b u_2)v_1 + (c u_1 + d u_2)v_2 = u_1(a v_1 + c v_2) + u_2(b v_1 + d v_2) ,逐项整理。 \blacksquare

通俗地说:"A A 搬过去"与"AT A^{\mathsf T} 搬过来"在配对中不可区分——转置是关于内积的"左右横移"。这句不起眼的恒等式是下一章谱定理证明的发动机。

2. 正交性

定义(正交) uv    u,v=0 \mathbf{u} \perp \mathbf{v} \iff \langle \mathbf{u}, \mathbf{v} \rangle = 0 。由夹角公式,内积为零即 cosθ=0 \cos\theta = 0 θ=90 \theta = 90^\circ )——垂直的代数化身(零向量与一切向量正交)。

定理(勾股定理) uvu+v2=u2+v2 \mathbf{u} \perp \mathbf{v} \Rightarrow \|\mathbf{u} + \mathbf{v}\|^2 = \|\mathbf{u}\|^2 + \|\mathbf{v}\|^2

证明u+v2=u2+2u,v+v2=u2+v2 \|\mathbf{u} + \mathbf{v}\|^2 = \|\mathbf{u}\|^2 + 2\langle\mathbf{u},\mathbf{v}\rangle + \|\mathbf{v}\|^2 = \|\mathbf{u}\|^2 + \|\mathbf{v}\|^2 (正交使交叉项消失)。 \blacksquare

正交基是"最省心的坐标系":向量 w=aq1+bq2 \mathbf{w} = a\mathbf{q}_1 + b\mathbf{q}_2 q1q2 \mathbf{q}_1 \perp \mathbf{q}_2 )的坐标可用内积直接读出——a=w,q1/q12 a = \langle\mathbf{w}, \mathbf{q}_1\rangle / \|\mathbf{q}_1\|^2 (两侧与 q1 \mathbf{q}_1 内积,另一项归零),无需解方程组。对照第二章:斜基求坐标要消元,正交基求坐标只要投影。

3. 正交投影

1. 问题与推导

问题:给定向量 w \mathbf{w} 与非零方向 u \mathbf{u} ,在直线 L=span{u} L = \operatorname{span}\{\mathbf{u}\} 上找离 w \mathbf{w} 最近的点(把 w \mathbf{w} "投影"到 L L )。

推导:候选点形如 tu t\mathbf{u} 。距离平方

wtu2=w22tw,u+t2u2\|\mathbf{w} - t\mathbf{u}\|^2 = \|\mathbf{w}\|^2 - 2t\langle\mathbf{w},\mathbf{u}\rangle + t^2\|\mathbf{u}\|^2

t t 的开口向上二次函数,最小值在顶点

t=w,uu2,p=projLw=w,uu2u.t^* = \frac{\langle\mathbf{w}, \mathbf{u}\rangle}{\|\mathbf{u}\|^2},\qquad \mathbf{p} = \operatorname{proj}_L \mathbf{w} = \frac{\langle\mathbf{w}, \mathbf{u}\rangle}{\|\mathbf{u}\|^2}\,\mathbf{u}.

定理(最近点刻画) pL \mathbf{p} \in L 是最近点      \iff 误差向量 e=wp \mathbf{e} = \mathbf{w} - \mathbf{p} 与整条直线 L L 正交(即 e,u=0 \langle\mathbf{e}, \mathbf{u}\rangle = 0 )。

证明:( \Rightarrow )代入 p=tu \mathbf{p} = t^*\mathbf{u} wtu,u=w,utu2=0 \langle\mathbf{w} - t^*\mathbf{u}, \mathbf{u}\rangle = \langle\mathbf{w},\mathbf{u}\rangle - t^*\|\mathbf{u}\|^2 = 0 (代入 t t^* )。( \Leftarrow )任取 tuL t\mathbf{u} \in L ,由勾股定理(eLtup \mathbf{e} \perp L \ni t\mathbf{u} - \mathbf{p} ):

wtu2=e+(ptu)2=e2+ptu2e2=wp2,\|\mathbf{w} - t\mathbf{u}\|^2 = \|\mathbf{e} + (\mathbf{p} - t\mathbf{u})\|^2 = \|\mathbf{e}\|^2 + \|\mathbf{p} - t\mathbf{u}\|^2 \ge \|\mathbf{e}\|^2 = \|\mathbf{w} - \mathbf{p}\|^2,

等号仅当 tu=p t\mathbf{u} = \mathbf{p} \blacksquare

通俗地说(图 7-1):投影 = “影子”,误差 = “影子顶端指向本人的垂直残段”。最近点的条件不是"距离最小"的直接陈述,而是垂直条件——这一转译是全章乃至全书的枢纽:“最优”(最小距离)与"正交"(垂直残差)是同一件事的两面

2. 投影矩阵

把投影写成矩阵:p=Pw \mathbf{p} = P\mathbf{w} ,其中

P=uuTuTu=1u12+u22(u12u1u2u1u2u22)P = \frac{\mathbf{u}\mathbf{u}^{\mathsf T}}{\mathbf{u}^{\mathsf T}\mathbf{u}} = \frac{1}{u_1^2 + u_2^2}\begin{pmatrix} u_1^2 & u_1 u_2 \\ u_1 u_2 & u_2^2 \end{pmatrix}

(外积形式——呼应第三章 5.2 节:投影是秩 1 矩阵)。它满足三条代数性质:

性质 数学表达式 几何意义
幂等 P2=P P^2 = P 投影两次 = 投影一次(影子已在直线上,再投不动)
对称 PT=P P^{\mathsf T} = P 配对对称(误差垂直性的矩阵化)
特征值 1(像方向)与 0(核方向) 保留分量 / 消灭分量

证明(幂等):P2=u(uTu)uT/(uTu)2=uuT/uTu=P P^2 = \mathbf{u}(\mathbf{u}^{\mathsf T}\mathbf{u})\mathbf{u}^{\mathsf T}/(\mathbf{u}^{\mathsf T}\mathbf{u})^2 = \mathbf{u}\mathbf{u}^{\mathsf T}/\mathbf{u}^{\mathsf T}\mathbf{u} = P (中间用了结合律把括号缩成一个数)。对称性直接由外积形式读出。特征值:Pu=u P\mathbf{u} = \mathbf{u} t=1 t^* = 1 ),Pe=0 P\mathbf{e} = \mathbf{0} (任意与 u \mathbf{u} 垂直的 e \mathbf{e} e,u=0 \langle\mathbf{e}, \mathbf{u}\rangle = 0 使系数归零)。 \blacksquare

第五章图 5-2、图 5-4 的投影矩阵 12(1111) \tfrac{1}{2}\begin{pmatrix} 1 & 1 \\ 1 & 1 \end{pmatrix} 正是 u=(1,1) \mathbf{u} = (1,1) 情形:它的像(保留方向)与核(消灭方向)互相垂直——那幅图的老谜团"为什么恰好垂直",现在是定理:投影矩阵的像与核互为正交补

4. 施密特正交化

1. 算法

斜基虽合法,但坐标计算要解方程(第二章)。能把任意基改装成正交基吗?能——逐个"剪影子":

输入:无关向量 u1,u2 \mathbf{u}_1, \mathbf{u}_2 输出:正交向量 q1,q2 \mathbf{q}_1, \mathbf{q}_2 ,张成相同。

第一步q1=u1 \mathbf{q}_1 = \mathbf{u}_1 (保留第一根)。

第二步:从 u2 \mathbf{u}_2 中剪掉它在 q1 \mathbf{q}_1 上的影子:

q2=u2projq1u2=u2u2,q1q12q1.\mathbf{q}_2 = \mathbf{u}_2 - \operatorname{proj}_{\mathbf{q}_1}\mathbf{u}_2 = \mathbf{u}_2 - \frac{\langle\mathbf{u}_2, \mathbf{q}_1\rangle}{\|\mathbf{q}_1\|^2}\mathbf{q}_1.

(若需单位正交基,再各自除以长度。)

正确性q2,q1=u2,q1u2,q1q12q1,q1=0 \langle\mathbf{q}_2, \mathbf{q}_1\rangle = \langle\mathbf{u}_2, \mathbf{q}_1\rangle - \frac{\langle\mathbf{u}_2,\mathbf{q}_1\rangle}{\|\mathbf{q}_1\|^2}\langle\mathbf{q}_1, \mathbf{q}_1\rangle = 0 (线性 + 内积自除);张成不变:q2 \mathbf{q}_2 u1,u2 \mathbf{u}_1, \mathbf{u}_2 的组合,反过来 u2=q2+(影子) \mathbf{u}_2 = \mathbf{q}_2 + (\text{影子}) 也是 q1,q2 \mathbf{q}_1, \mathbf{q}_2 的组合。图 7-2:蓝向量减去橙色影子得到绿色垂直分量——直角看得见。

高维推广照搬:第 k k 步从 uk \mathbf{u}_k 中剪掉它在前面所有 qj \mathbf{q}_j j<k j < k )上的影子。归纳论证同上。

2. 正交化 = 三角分解(深入)

把施密特过程反着读:u1=q1q^1 \mathbf{u}_1 = \|\mathbf{q}_1\|\hat{\mathbf{q}}_1 u2=u2,q^1q^1+q2q^2 \mathbf{u}_2 = \langle\mathbf{u}_2, \hat{\mathbf{q}}_1\rangle\hat{\mathbf{q}}_1 + \|\mathbf{q}_2\|\hat{\mathbf{q}}_2 q^i \hat{\mathbf{q}}_i 为单位正交向量),用矩阵表示:

(u1    u2)=(q^1    q^2)(q1u2,q^10q2),(\mathbf{u}_1\;\;\mathbf{u}_2) = (\hat{\mathbf{q}}_1\;\;\hat{\mathbf{q}}_2)\begin{pmatrix} \|\mathbf{q}_1\| & \langle\mathbf{u}_2, \hat{\mathbf{q}}_1\rangle \\ 0 & \|\mathbf{q}_2\| \end{pmatrix},

A=QR A = QR :任何可逆矩阵 = 正交矩阵 × \times 上三角矩阵。这就是著名的 QR 分解,数值线性代数(解方程组、求特征值)的中流砥柱——它的几何内容不过是"剪影子"。

5. 正交矩阵

定义(正交矩阵) Q Q 满足 QTQ=I Q^{\mathsf T}Q = I (即列向量为单位正交基)。

定理(刚体性质) 正交矩阵保持内积、长度与夹角:对一切 u,v \mathbf{u}, \mathbf{v}

Qu,Qv=u,v,Qv=v.\langle Q\mathbf{u}, Q\mathbf{v} \rangle = \langle\mathbf{u}, \mathbf{v}\rangle,\qquad \|Q\mathbf{v}\| = \|\mathbf{v}\|.

证明:用 1.3 节的转置恒等式:Qu,Qv=u,QTQv=u,Iv=u,v \langle Q\mathbf{u}, Q\mathbf{v} \rangle = \langle\mathbf{u}, Q^{\mathsf T}Q\mathbf{v}\rangle = \langle\mathbf{u}, I\mathbf{v}\rangle = \langle\mathbf{u}, \mathbf{v}\rangle 。取 u=v \mathbf{u} = \mathbf{v} 得保长度;保夹角由夹角公式(分子分母都不变)。 \blacksquare

(逆命题也成立:保持一切长度的线性变换必是正交的——习题。)2×2 2\times2 正交矩阵恰有两类:旋转 (cosθsinθsinθcosθ) \begin{pmatrix} \cos\theta & -\sin\theta \\ \sin\theta & \cos\theta \end{pmatrix} det=+1 \det = +1 )与反射 (cosθsinθsinθcosθ) \begin{pmatrix} \cos\theta & \sin\theta \\ \sin\theta & -\cos\theta \end{pmatrix} det=1 \det = -1 ,沿某条过原点直线镜像)。证明思路:设两列为单位正交向量,第一列 (cosθ,sinθ) (\cos\theta, \sin\theta) ,第二列与它垂直故为 ±(sinθ,cosθ) \pm(-\sin\theta, \cos\theta) ,两个符号对应两类。

通俗地说(图 7-4):正交变换是"刚体变换"——整个平面像一块刚性平板被搬动,网格不歪(对照第三章图 3-1 的剪切歪网格)、长度不变、角度不变。第四章的"旋转保面积"(det=1 \det = 1 )与"镜像反转定向"(det=1 \det = -1 )现在是同一个家族的两个分支:正交矩阵 = 保长度变换 = 旋转或反射

6. 最小二乘

1. 问题:不可解方程组的最优近似

数据拟合的标准场景:观测数据 (t1,y1),,(tm,ym) (t_1, y_1), \dots, (t_m, y_m) m>2 m > 2 ),想找直线参数 (c,d) (c, d) 使 cti+d=yi c t_i + d = y_i 对所有 i i 成立。写成矩阵形式 Ax=b A\mathbf{x} = \mathbf{b}

(t11tm1)(cd)=(y1ym).\begin{pmatrix} t_1 & 1 \\ \vdots & \vdots \\ t_m & 1 \end{pmatrix}\begin{pmatrix} c \\ d \end{pmatrix} = \begin{pmatrix} y_1 \\ \vdots \\ y_m \end{pmatrix}.

真实数据带噪声,b \mathbf{b} 一般不在 A A 的列空间里——方程组无解。退而求其次:找 x^ \hat{\mathbf{x}} 使残差 Ax^b2 \|A\hat{\mathbf{x}} - \mathbf{b}\|^2 (各点竖直残差的平方和)最小。

2. 解法:投影即最优

定理(正规方程) 最优解 x^ \hat{\mathbf{x}} 满足

ATAx^=ATb,A^{\mathsf T}A\,\hat{\mathbf{x}} = A^{\mathsf T}\mathbf{b},

且几何意义是:Ax^=projimAb A\hat{\mathbf{x}} = \operatorname{proj}_{\operatorname{im} A}\mathbf{b} (把目标投影到列空间上)。

证明(几何路线,3.1 节最近点刻画的推广):残差向量 e=bAx^ \mathbf{e} = \mathbf{b} - A\hat{\mathbf{x}} 应与整个列空间正交(否则在列空间内还存在更近的点)。而"与列空间中每个向量正交"等价于"与 A A 的每一列正交",即

0=ATe=AT(bAx^),\mathbf{0} = A^{\mathsf T}\mathbf{e} = A^{\mathsf T}(\mathbf{b} - A\hat{\mathbf{x}}),

整理即正规方程。(代数路线:残差平方是 x^ \hat{\mathbf{x}} 各分量的二次函数,令梯度为零得到同一方程——两条路线殊途同归。) \blacksquare

通俗地说:拟合直线不可能穿过每个噪声点,那就让"总平方残差"最小——最优拟合恰是把数据向量投影到模型能表达的子空间上。图 7-3:五个不共线点(灰橙点)配一条红直线,每点的竖直残差(橙线段)就像"影子与本人的差距",最优直线的标志是残差向量全体与模型子空间垂直。最小二乘 = 投影 = 正交——三大概念一条锁链。

(完整计算例:数据 (2,2.8),(1,1.1),(0,0.2),(1,1.3),(2,2.6) (-2,-2.8), (-1,-1.1), (0,0.2), (1,1.3), (2,2.6) ,用过原点模型 y=ct y = ct :正规方程退化为 c=tiyi/ti2 c = \sum t_i y_i / \sum t_i^2 。逐项算:tiyi=(2)(2.8)+(1)(1.1)+0+11.3+22.6=5.6+1.1+1.3+5.2=13.2 \sum t_i y_i = (-2)(-2.8)+(-1)(-1.1)+0+1\cdot1.3+2\cdot2.6 = 5.6+1.1+1.3+5.2 = 13.2 ti2=10 \sum t_i^2 = 10 ,故 c=1.32 c = 1.32 ——正是图 7-3 中红直线的斜率。)

7. 深入:函数空间的投影与傅里叶级数

第五章留下话头:无穷维空间 C[π,π] C[-\pi, \pi] (连续函数)没有有限基。内积的眼光让"无穷维的正交基"重新成为可能。

第一步(积分内积):定义

f,g=ππf(x)g(x)dx.\langle f, g \rangle = \int_{-\pi}^{\pi} f(x)g(x)\,dx.

验证它与 1.1 节的四条性质逐条对应(对称:积分与交换被积函数无关;线性:积分线性;正定:连续非负函数积分为零则恒为零)。第五章的抽象空间理论在此直接接管:C[π,π] C[-\pi,\pi] 是带内积的线性空间。

第二步(正交函数族):三角函数族

1,cosx,  sinx,cos2x,  sin2x,1,\quad \cos x,\; \sin x,\quad \cos 2x,\; \sin 2x,\quad \dots

两两正交(例如 cosx,sinx=ππcosxsinxdx=0 \langle\cos x, \sin x\rangle = \int_{-\pi}^{\pi}\cos x\sin x\,dx = 0 ——奇函数对称积分为零;cosmx,cosnx=0 \langle\cos mx, \cos nx\rangle = 0 mn m \neq n )由积化和差公式与正交性验证)。这就是函数世界的"正交坐标系"。

第三步(投影 = 傅里叶系数):把函数 f f 投影到这组正交基上,投影系数(正交基下坐标的读法,见第 2 节末尾)为

an=f,cosnxcosnx2=1πππf(x)cosnxdx(n1),bn=1πππf(x)sinnxdx,a_n = \frac{\langle f, \cos nx \rangle}{\|\cos nx\|^2} = \frac{1}{\pi}\int_{-\pi}^{\pi} f(x)\cos nx\,dx \quad (n \ge 1),\qquad b_n = \frac{1}{\pi}\int_{-\pi}^{\pi} f(x)\sin nx\,dx,

cosnx2=π \|\cos nx\|^2 = \pi 由直接积分,上式对 n1 n \ge 1 成立;常数项需单独处理:12=ππ1dx=2π \|1\|^2 = \int_{-\pi}^{\pi}1\,dx = 2\pi ,故常数项的系数为 a0=12πππf(x)dx a_0 = \frac{1}{2\pi}\int_{-\pi}^{\pi}f(x)\,dx ,即 f f 的平均值)——傅里叶系数就是投影系数,傅里叶级数就是把函数投影到无穷维正交基上的展开,截断的傅里叶级数就是"到前 N N 个谐波张成子空间的最小二乘最优近似"。声音的频谱分析、图像的 JPEG 压缩,底层都是本章的投影定理。

通俗地说:把函数看成无穷维空间中的"点",三角函数族是它的"正交坐标轴",傅里叶分析就是"沿各轴读坐标"。有限维(本章平面上的投影)与无穷维(傅里叶级数)用的是同一条定理:最近点 ⟺ 垂直残差。第五章"抽象空间是杠杆"的许诺至此完全兑现。

8. 演示图像

本章演示程序位于 src/chapter7,生成图像位于 output/chapter7

图号 文件 内容
图 7-1 fig_7_1_projection.ppm 正交投影:影子与垂直残差
图 7-2 fig_7_2_gram_schmidt.ppm 施密特正交化:剪影子
图 7-3 fig_7_3_least_squares.ppm 最小二乘拟合
图 7-4 fig_7_4_orthogonal.ppm 正交矩阵:刚体变换

图 7-1(fig_7_1_projection.ppm:把 w=(1,3) \mathbf{w} = (1,3) 投到方向 (2,1) (2,1) :绿色影子 (2,1) (2,1) 落在红线上,橙色误差从影子顶端垂直指向 w \mathbf{w} 顶端——直角看得见,"最近点 ⟺ 垂直"的图像化。

图 7-2(fig_7_2_gram_schmidt.ppm:斜基 (2,1) (2,1) (红)、(1,3) (1,3) (蓝):从蓝向量剪掉橙色影子(沿红方向的分量),得到与红轴垂直的绿色向量——两步剪影,斜基变正交基。

图 7-3(fig_7_3_least_squares.ppm:五个带噪声的数据点,拟合直线 y=1.32t y = 1.32 t (红)与各点的竖直残差(橙):正规方程给出的最优解使平方残差和最小——每个残差段就是"数据向量与模型子空间的差距"。

图 7-4(fig_7_4_orthogonal.ppm:旋转 30° 作用于标准网格:网格仍方方正正(青/黄,对照第三章图 3-1 被剪切扯歪的网格);向量对旋转前后长度、夹角全部不变——刚体变换。

9. 小结

概念 代数形式 几何形象
内积 u1v1+u2v2 u_1v_1 + u_2v_2 长度与角度的代数源头
柯西一施瓦茨 $ \langle\mathbf{u},\mathbf{v}\rangle
正交 u,v=0 \langle\mathbf{u},\mathbf{v}\rangle = 0 垂直(勾股定理成立)
投影 w,uu2u \frac{\langle\mathbf{w},\mathbf{u}\rangle}{|\mathbf{u}|^2}\mathbf{u} 影子;最近点(图 7-1)
最近点刻画 最优 ⟺ 残差垂直 "最优"与"正交"是同一件事
投影矩阵 P2=P P^2 = P PT=P P^{\mathsf T} = P 投影不动已投影;像 ⊥ 核
施密特 剪影子逐个正交化 斜基 → 正交基(图 7-2)
QR 分解 A=QR A = QR 正交化反向阅读(深入)
正交矩阵 QTQ=I Q^{\mathsf T}Q = I ,保长度 旋转或反射:刚体(图 7-4)
最小二乘 ATAx^=ATb A^{\mathsf T}A\hat{\mathbf{x}} = A^{\mathsf T}\mathbf{b} 投影到模型子空间(图 7-3)
傅里叶系数 1πfcosnx \frac{1}{\pi}\int f\cos nx 无穷维正交基下的投影(深入)

三条主线:

  1. 内积统一了几何与代数:长度、角度、垂直由一个公式诞生;柯西一施瓦茨是背后的定海神针。转置的身份(Au,v=u,ATv \langle A\mathbf{u},\mathbf{v}\rangle = \langle\mathbf{u},A^{\mathsf T}\mathbf{v}\rangle )连接前几章的矩阵运算。
  2. 投影是"最优"的几何形式:最近点、最小二乘、傅里叶截断全部归结为同一件事——垂直残差;正规方程是投影定理的矩阵记录。
  3. 正交坐标系是计算与理论的甜点区:正交基下坐标 = 投影(免解方程);施密特把任意基改装成正交基(QR 分解);正交矩阵保护全部度量结构。

10. 习题

  1. (计算) 求下列内积与夹角:
    (a) (1,2) (1,2) (3,1) (3,1)
    (b) (1,2) (1,2) (2,1) (-2,1) (应垂直);
    © (2,0) (2,0) (1,3) (-1,\sqrt 3) (应为 120°)。
  2. (柯西一施瓦茨)u=(1,2) \mathbf{u} = (1,2) v=(2,1) \mathbf{v} = (2,-1) 验证不等式两侧,并验证它们恰好垂直(等号情形是共线,这里交叉项直接为零)。再用不等式估计 (3,4),(5,12) |\langle(3,4),(5,12)\rangle| 与实际值比较。
  3. (投影计算)w=(3,2) \mathbf{w} = (3,2) 投影到方向 u=(1,1) \mathbf{u} = (1,-1) 上,求影子、残差,并验证残差与 u \mathbf{u} 垂直、勾股定理成立(w2=p2+e2 \|\mathbf{w}\|^2 = \|\mathbf{p}\|^2 + \|\mathbf{e}\|^2 )。
  4. (施密特) 对基 {(1,1),  (1,2)} \{(1,1),\; (1,2)\} 执行施密特正交化,得到正交基并单位化;然后写出 (3,5) (3,5) 在新正交基下的坐标(用内积直接读出,不解方程)。
  5. (证明) 证明:若 QTQ=I Q^{\mathsf T}Q = I Q Q 保长度;反之若线性映射 T T 保一切长度则其矩阵 Q Q 满足 QTQ=I Q^{\mathsf T}Q = I (逆命题:取 v=e1,e2 \mathbf{v} = \mathbf{e}_1, \mathbf{e}_2 e1+e2 \mathbf{e}_1 + \mathbf{e}_2 分别代入)。
  6. (投影矩阵)u=(1,2) \mathbf{u} = (1,2) :写出投影矩阵 P P ,验证 P2=P P^2 = P PT=P P^{\mathsf T} = P trP=1 \operatorname{tr} P = 1 detP=0 \det P = 0 (后两条与"特征值恰为 1、0"的关系?)。
  7. (最小二乘) 用过原点直线 y=ct y = ct 拟合数据 (1,1.5),(0,0.3),(1,0.9),(2,2.3) (-1,-1.5), (0,0.3), (1,0.9), (2,2.3) :写出正规方程、解出 c c 、计算各点残差并验证残差向量与 (ti) (t_i) 列向量正交(内积为零)。
  8. (证明) 证明三角不等式:u+vu+v \|\mathbf{u}+\mathbf{v}\| \le \|\mathbf{u}\| + \|\mathbf{v}\| 。(平方展开后用柯西一施瓦茨估计交叉项。)几何上这对应"三角形两边之和大于第三边"。
  9. (深入:QR)A=(1112) A = \begin{pmatrix} 1 & 1 \\ 1 & 2 \end{pmatrix} 做施密特正交化并写出 A=QR A = QR 分解(Q Q 正交、R R 上三角),验证 QR=A QR = A
  10. (思考/编程) 修改演示 3:换一组更分散的数据,或改用带截距模型 y=ct+d y = ct + d (此时模型子空间是二维平面,正规方程是 2×2 方程组)——观察最优直线如何变化。再思考:傅里叶级数取前一项(常数项 a0 a_0 )是什么?(f f 在常函数方向的投影 = 平均值。)

8. 对称矩阵、二次型与 SVD(进阶)

终章处理两类"结构最优"的矩阵。对称矩阵AT=A A^{\mathsf T} = A )是特征值理论的甜点区:谱定理保证它总能被正交矩阵对角化——主轴不仅存在而且互相垂直,变换 = 沿正交主轴的独立伸缩。一般矩阵没有这份福气(剪切不可对角化、旋转没有实特征向量),但奇异值分解(SVD) 补上了最后的拼图:任何矩阵都能分解成"旋转—伸缩—旋转",输入输出各有一组正交主轴。本章把全书工具用到极限——谱定理的证明需要第六章(特征值)+ 第七章(内积、转置恒等式)联手;SVD 的构造需要第四章(行列式)判可逆、第五章(像与核)定结构;最后的 PCA 应用连接统计与数据科学。

1. 谱定理

1. 对称矩阵的特征值是实数

定理(实谱性) 实对称矩阵的特征值都是实数。(对比第六章:旋转矩阵对称吗?不——它有复特征值,而对称性排除了这种可能。)

证明(需暂时进入复数域):设 λ \lambda A A 的特征值,z \mathbf{z} 是复特征向量(分量可复)。记 zˉ \bar{\mathbf{z}} 为逐分量共轭。由 Az=λz A\mathbf{z} = \lambda\mathbf{z} ,两侧左乘 zˉT \bar{\mathbf{z}}^{\mathsf T}

zˉTAz=λzˉTz.\bar{\mathbf{z}}^{\mathsf T}A\mathbf{z} = \lambda\,\bar{\mathbf{z}}^{\mathsf T}\mathbf{z}.

关键观察一:zˉTz=z12+z22 \bar{\mathbf{z}}^{\mathsf T}\mathbf{z} = |z_1|^2 + |z_2|^2 是正实数(分量非零)。关键观察二:zˉTAz \bar{\mathbf{z}}^{\mathsf T}A\mathbf{z} 是实数——因为(A A 实对称,Aˉ=A \bar A = A

zˉTAz=zTAzˉ=(zTAzˉ)T=zˉTATz=zˉTAz,\overline{\bar{\mathbf{z}}^{\mathsf T}A\mathbf{z}} = \mathbf{z}^{\mathsf T}A\bar{\mathbf{z}} = (\mathbf{z}^{\mathsf T}A\bar{\mathbf{z}})^{\mathsf T} = \bar{\mathbf{z}}^{\mathsf T}A^{\mathsf T}\mathbf{z} = \bar{\mathbf{z}}^{\mathsf T}A\mathbf{z},

依次用了共轭规则、转置不改变一阶数(标量)、对称性。于是 λ=(zˉTAz)/(zˉTz) \lambda = (\bar{\mathbf{z}}^{\mathsf T}A\mathbf{z})/(\bar{\mathbf{z}}^{\mathsf T}\mathbf{z}) = 实数/正实数 = 实数。 \blacksquare

通俗地说:对称性迫使特征方程的判别式 (a+d)24(adb2)=(ad)2+4b20 (a+d)^2 - 4(ad - b^2) = (a - d)^2 + 4b^2 \ge 0 (直接计算!)——复根被对称性排除。几何上:对称变换不含旋转成分,主轴是真实的直线。(上述复数证明的价值在于它对任何维数成立,判别式论证只是二维幸运。)

2. 特征向量互相正交

定理(正交主轴) 属于对称矩阵不同特征值的特征向量互相垂直。

证明:设 Au=λ1u A\mathbf{u} = \lambda_1\mathbf{u} Av=λ2v A\mathbf{v} = \lambda_2\mathbf{v} λ1λ2 \lambda_1 \neq \lambda_2 )。用第七章转置恒等式与对称性:

λ1u,v=λ1u,v=Au,v=u,ATv=u,Av=λ2u,v.\lambda_1\langle\mathbf{u}, \mathbf{v}\rangle = \langle\lambda_1\mathbf{u}, \mathbf{v}\rangle = \langle A\mathbf{u}, \mathbf{v}\rangle = \langle\mathbf{u}, A^{\mathsf T}\mathbf{v}\rangle = \langle\mathbf{u}, A\mathbf{v}\rangle = \lambda_2\langle\mathbf{u}, \mathbf{v}\rangle.

(λ1λ2)u,v=0 (\lambda_1 - \lambda_2)\langle\mathbf{u}, \mathbf{v}\rangle = 0 ;特征值不同迫使内积为零,即垂直。 \blacksquare

通俗地说:这条证明是全书"数形合璧"的缩微景观:转置恒等式(第七章)+ 对称性(代数)+ 特征方程(第六章)三件工具拼出几何结论(垂直)。第六章埋的伏笔"对称矩阵的主轴互相正交"至此兑现。

3. 谱定理

定理(谱定理,二维版)A A 实对称,则存在单位正交矩阵 Q Q QTQ=I Q^{\mathsf T}Q = I )与对角阵 Λ \Lambda 使

A=QΛQT,Λ=(λ100λ2).A = Q\Lambda Q^{\mathsf T},\qquad \Lambda = \begin{pmatrix} \lambda_1 & 0 \\ 0 & \lambda_2 \end{pmatrix}.

证明:由实谱性,特征值 λ1,λ2 \lambda_1, \lambda_2 为实数。若 λ1λ2 \lambda_1 \neq \lambda_2 :取对应特征向量并单位化得 q^1,q^2 \hat{\mathbf{q}}_1, \hat{\mathbf{q}}_2 ,它们正交(刚证),故 Q=(q^1  q^2) Q = (\hat{\mathbf{q}}_1\; \hat{\mathbf{q}}_2) 是正交矩阵。第六章 3.1 节对角化结构给出 AQ=QΛ AQ = Q\Lambda ;正交矩阵的逆是转置,故 A=QΛQ1=QΛQT A = Q\Lambda Q^{-1} = Q\Lambda Q^{\mathsf T} 。若 λ1=λ2=λ \lambda_1 = \lambda_2 = \lambda (重根):记 B=AλI=(abbd) B = A - \lambda I = \begin{pmatrix} a' & b' \\ b' & d' \end{pmatrix} (仍对称)。A A 的特征多项式为 (μλ)2 (\mu - \lambda)^2 ,故 B B 的特征多项式为 μ2 \mu^2 ,比较系数得 a+d=0 a' + d' = 0 (迹为零)且 adb2=0 a'd' - b'^2 = 0 (行列式为零)。代入 d=a d' = -a' a2b2=0 -a'^2 - b'^2 = 0 ,即 a2+b2=0 a'^2 + b'^2 = 0 ,迫使 a=b=0 a' = b' = 0 ,进而 d=0 d' = 0 ,故 B=O B = O A=λI A = \lambda I ——已经是数量矩阵(对角阵),取任意正交 Q Q (如 I I )均满足 A=QΛQT A = Q\Lambda Q^{\mathsf T} 。(与第六章对照:对称性把"重根 ⟹ 只有半套主轴"的剪切式悲剧排除在外——重根时对称矩阵必为数量矩阵,天然对角。) \blacksquare

通俗地说(图 8-1):对称矩阵 = 沿一组互相垂直的主轴独立伸缩。单位圆被对称矩阵映成椭圆:长轴沿 λ |\lambda| 大的特征方向、短轴沿小的,两轴互相垂直。对照第六章图 6-3(对角化的一般图像:主轴斜交):对称性是"主轴正交"的充要条件——它排除了剪切类的纠结动作。谱定理是线性代数的珠峰:任何对称矩阵,无论初始坐标多乱,都藏着一套正交的"天然坐标系"。统计学(协方差)、物理学(量子力学的可观测量)、几何学(二次曲面的主轴)共享这同一条定理。

2. 二次型

1. 定义与矩阵表示

定义(二次型) 二次齐次多项式

q(x,y)=ax2+2bxy+dy2q(x, y) = a x^2 + 2bxy + d y^2

称为二次型。用对称矩阵改写:

q(x)=xTAx,A=(abbd),q(\mathbf{x}) = \mathbf{x}^{\mathsf T}A\mathbf{x},\qquad A = \begin{pmatrix} a & b \\ b & d \end{pmatrix},

(展开验证:ax2+bxy+byx+dy2=ax2+2bxy+dy2 a x^2 + bxy + byx + d y^2 = ax^2 + 2bxy + dy^2 。)交叉项的系数被对称地平分给两个非对角元——每个二次型天然对应一个对称矩阵,谱定理因此自动适用。

几何图像:把 z=q(x,y) z = q(x, y) 画成三维曲面(碗、谷、鞍),二次型刻画"弯曲的方向与强度"。

2. 主轴定理:换到主轴坐标系

定理(主轴定理)A A 对应二次型 q q A=QΛQT A = Q\Lambda Q^{\mathsf T} 是谱分解。做正交变量替换 x=Qy \mathbf{x} = Q\mathbf{y} ,则

q=xTAx=yT(QTAQ)y=yTΛy=λ1y12+λ2y22.q = \mathbf{x}^{\mathsf T}A\mathbf{x} = \mathbf{y}^{\mathsf T}(Q^{\mathsf T}AQ)\mathbf{y} = \mathbf{y}^{\mathsf T}\Lambda\mathbf{y} = \lambda_1 y_1^2 + \lambda_2 y_2^2.

交叉项消失,只剩纯平方项。(中间一步用了 QTAQ=Λ Q^{\mathsf T}AQ = \Lambda ,即谱分解的改写。)

通俗地说:二次曲线(如 5x2+4xy+5y2=1 5x^2 + 4xy + 5y^2 = 1 )在原坐标里看不出形状;旋转坐标轴对齐主轴(正交替换正是旋转或反射,第七章),方程变成 3y12+7y22=1 3y_1^2 + 7y_2^2 = 1 (此处特征值为 3、7)——一眼认出是椭圆,主轴沿特征方向、半轴长 1/λ 1/\sqrt{\lambda} 解析几何的"转轴化简"就是谱定理

3. 正定性:能量语言

定义(定性分类) 对一切 x0 \mathbf{x} \neq \mathbf{0}

类别 条件 曲面 z=q z = q 的形状 特征值
正定 q(x)>0 q(\mathbf{x}) > 0 碗(唯一最低点) λ1,λ2>0 \lambda_1, \lambda_2 > 0
半正定 q0 q \ge 0 (可取零) 谷底平底 λ0 \lambda \ge 0
不定 有正有负 鞍面(一个方向上翘、一个方向下陷) 一正一负
负定 q<0 q < 0 倒碗 λ<0 \lambda < 0

定理(正定的两个判据) 下列等价:① q q 正定;② A A 的特征值全为正;③ 顺序主子式全正:a>0 a > 0 adb2>0 ad - b^2 > 0

证明(①      \iff ②):主轴定理中取 y=ei \mathbf{y} = \mathbf{e}_i (即 x=Qei= \mathbf{x} = Q\mathbf{e}_i = i i 个主轴方向):q=λi q = \lambda_i 。若某 λi0 \lambda_i \le 0 ,该方向上能量非正,与正定矛盾;反之若两特征值皆正,则 q=λ1y12+λ2y22>0 q = \lambda_1 y_1^2 + \lambda_2 y_2^2 > 0 (除非 y=0 \mathbf{y} = \mathbf{0} ,即 x=0 \mathbf{x} = \mathbf{0} )。(②      \iff ③:λ1+λ2=trA=a+d \lambda_1 + \lambda_2 = \operatorname{tr} A = a + d λ1λ2=detA=adb2 \lambda_1\lambda_2 = \det A = ad - b^2 (第六章韦达);两根皆正      \iff 和与积皆正。但③中要求的是 a>0 a > 0 而非 a+d>0 a + d > 0 ——更细的论证:若 det>0 \det > 0 则两根同号,此时 a a 的符号(当 a0 a \neq 0 时由配平方 q=a(x+bay)2+(db2a)y2 q = a(x + \tfrac{b}{a}y)^2 + (d - \tfrac{b^2}{a})y^2 ,第二项系数 =adb2a = \tfrac{ad - b^2}{a} a a 同号当 det>0 \det > 0 )决定全部符号:a>0 a > 0 det>0 \det > 0 即正定。a=0 a = 0 det=b20 \det = -b^2 \le 0 ,排除。) \blacksquare

通俗地说:二次型是"能量函数":把它想象成山顶地形图,正定 = 四面八方都向上翘(碗底稳定,小球滚回中心);不定 = 鞍面(一个方向滑下去、一个方向爬上去,马鞍点)。特征值逐方向给出"坡度":主轴方向上能量恰为 λix2 \lambda_i \|\mathbf{x}\|^2 。优化算法(梯度下降会不会收敛)、统计学(协方差会不会退化)、微分方程(平衡点稳不稳定)的第一步都是判断定性。

4. 负特征值:翻转的主轴

图 8-3 演示不定矩阵 B=(2332) B = \begin{pmatrix} 2 & 3 \\ 3 & 2 \end{pmatrix} (特征值 5 与 -1,主轴 (1,1) (1,1) (1,1) (1,-1) ):沿红轴拉伸 5 倍照常;沿蓝轴,特征向量被反向送出(Bv2=v2 B\mathbf{v}_2 = -\mathbf{v}_2 ,紫色箭头指向蓝色箭头的反方向)——负特征值 = 该主轴上的镜像翻转。二次型 q=2x2+6xy+2y2 q = 2x^2 + 6xy + 2y^2 沿两轴分别取值 5t2 5t^2 t2 -t^2 :一正一负,鞍面坐实。(对比第四章图 4-3 的整面翻转:det=1 \det = -1 只说"总定向反了",谱分解进一步指出翻转发生在哪根轴、程度多大。)

3. 奇异值分解(SVD)

1. 动机:一般矩阵缺什么

谱定理只属于对称矩阵。一般矩阵可能:特征向量不垂直(如 (110.11) \begin{pmatrix} 1 & 1 \\ 0.1 & 1 \end{pmatrix} ),甚至没有实特征向量(旋转)。但第三章起我们就知道:任何可逆矩阵把圆变成椭圆(线性映射送直线为直线、保平行)。椭圆天然有互相垂直的主轴——问题只是:输入端的哪两个垂直方向被送到输出端的主轴?这就是 SVD 要回答的。

2. 途经 ATA A^{\mathsf T}A :把不对称化为对称

命题 对任意实矩阵 A A ATA A^{\mathsf T}A 是对称半正定矩阵。

证明:对称:(ATA)T=AT(AT)T=ATA (A^{\mathsf T}A)^{\mathsf T} = A^{\mathsf T}(A^{\mathsf T})^{\mathsf T} = A^{\mathsf T}A 。半正定:对任意 x \mathbf{x} xTATAx=(Ax)T(Ax)=Ax20 \mathbf{x}^{\mathsf T}A^{\mathsf T}A\mathbf{x} = (A\mathbf{x})^{\mathsf T}(A\mathbf{x}) = \|A\mathbf{x}\|^2 \ge 0 (范数的平方,第七章)。 \blacksquare

通俗地说A A 自己不一定对称,但 ATA A^{\mathsf T}A (“先做 A A 再配对求能量”)永远对称半正定——谱定理适用!它的特征值 μi0 \mu_i \ge 0 ,记 σi=μi \sigma_i = \sqrt{\mu_i} 称为 A A 奇异值

关键事实链(设 A A 可逆,记 ATA A^{\mathsf T}A 的单位特征向量为 v1,v2 \mathbf{v}_1, \mathbf{v}_2 ,特征值 σ12σ22>0 \sigma_1^2 \ge \sigma_2^2 > 0 ):

(i)v1v2 \mathbf{v}_1 \perp \mathbf{v}_2 (对称矩阵的正交主轴);

(ii)Av1Av2 A\mathbf{v}_1 \perp A\mathbf{v}_2 (验证:Av1,Av2=v1TATAv2=σ22v1,v2=0 \langle A\mathbf{v}_1, A\mathbf{v}_2\rangle = \mathbf{v}_1^{\mathsf T}A^{\mathsf T}A\mathbf{v}_2 = \sigma_2^2\langle\mathbf{v}_1,\mathbf{v}_2\rangle = 0 ——转置恒等式再次立功);

(iii)Avi=σi \|A\mathbf{v}_i\| = \sigma_i (同法:Avi2=σi2 \|A\mathbf{v}_i\|^2 = \sigma_i^2 )。

结论:输入端的正交对 v1,v2 \mathbf{v}_1, \mathbf{v}_2 被送到输出端的正交对 Av1,Av2 A\mathbf{v}_1, A\mathbf{v}_2 ,长度变成 σ1,σ2 \sigma_1, \sigma_2 !单位圆(由所有单位向量组成)被映成椭圆,主轴方向恰是 Avi A\mathbf{v}_i 的方向、半轴长恰为 σi \sigma_i

3. 分解定理

定理(奇异值分解,二维版)A A 可逆,则存在正交矩阵 U,V U, V 与对角阵 Σ=diag(σ1,  σ2) \Sigma = \operatorname{diag}(\sigma_1,\; \sigma_2) σ1σ2>0 \sigma_1 \ge \sigma_2 > 0 )使

A=UΣVT.A = U\Sigma V^{\mathsf T}.

构造证明:如上取 V=(v1  v2) V = (\mathbf{v}_1\;\mathbf{v}_2) (输入端正交基)。定义 ui=Avi/σi \mathbf{u}_i = A\mathbf{v}_i/\sigma_i (单位化后的像),由(ii)它们正交,故 U=(u1  u2) U = (\mathbf{u}_1\;\mathbf{u}_2) 是正交矩阵。则

AV=(Av1  Av2)=(σ1u1  σ2u2)=UΣ,AV = (A\mathbf{v}_1\; A\mathbf{v}_2) = (\sigma_1\mathbf{u}_1\; \sigma_2\mathbf{u}_2) = U\Sigma,

右乘 VT V^{\mathsf T} (正交矩阵的逆)得 A=UΣVT A = U\Sigma V^{\mathsf T} \blacksquare

通俗地说(图 8-2):SVD 把任何矩阵的动作拆成三段广播体操:VT V^{\mathsf T} :转到输入主轴(旋转);Σ \Sigma :沿两轴各自伸缩 σ1,σ2 \sigma_1, \sigma_2 倍;U U :转到输出主轴(再旋转)。没有剪切、没有纠结——旋转和伸缩足以描述一切可逆线性映射!与谱定理的对比:谱分解是"一套坐标系自转自伸缩"(要求对称),SVD 是"输入一套轴、输出一套轴,中间只伸缩"(不要求任何特殊条件)。代价是用了两个正交矩阵而非一个。

(对称正定矩阵是两者重合的特例:A=QΛQT A = Q\Lambda Q^{\mathsf T} 本身就是 U=Q U = Q Σ=Λ \Sigma = \Lambda V=Q V = Q 的 SVD。)

4. 奇异值的信息论意义(深入)

公式 含义
最大奇异值 σ1=maxx=1Ax \sigma_1 = \max_{|\mathbf{x}| = 1}|A\mathbf{x}| 变换的最大放大倍数(算子范数)
最小奇异值 σ2=minx=1Ax \sigma_2 = \min_{|\mathbf{x}| = 1}|A\mathbf{x}| 最小放大倍数(离退化有多远)
条件数 κ=σ1/σ2 \kappa = \sigma_1/\sigma_2 数值稳定性:越大越病态
行列式 detA=±σ1σ2 \det A = \pm\sigma_1\sigma_2 缩放因子 = 奇异值之积(符号由 U、V 定向决定)

σ1 \sigma_1 的最大值刻画:Ax2 \|A\mathbf{x}\|^2 在单位圆上的最大值 = xTATAx \mathbf{x}^{\mathsf T}A^{\mathsf T}A\mathbf{x} 的最大值 = 主轴定理下的最大特征值 σ12 \sigma_1^2 ,在 x=v1 \mathbf{x} = \mathbf{v}_1 处取到。)"保留前 k k 个奇异值、丢弃其余"就是低秩近似:图像压缩(JPEG 的一部分)、推荐系统、噪声消减的统一原理——奇异值按重要性排队,这是 SVD 被誉为"线性代数的瑞士军刀"的原因。

5. 伪逆与最小范数解(深入)

不可逆矩阵(或高矮矩阵)的方程 Ax=b A\mathbf{x} = \mathbf{b} 无解或有无穷多解。第七章的最小二乘解决"无解"(找最近似),但无穷多解时选哪个?最小范数解:离原点最近的那个。SVD 给出统一答案:把 A=UΣVT A = U\Sigma V^{\mathsf T} Σ \Sigma 的非零对角元取倒数、零元保持零,得到 Σ+ \Sigma^+ ,定义伪逆

A+=VΣ+UT,x=A+b.A^+ = V\Sigma^+U^{\mathsf T},\qquad \mathbf{x}^* = A^+\mathbf{b}.

它同时是:bimA \mathbf{b} \in \operatorname{im} A 时的(最小范数)精确解,与 bimA \mathbf{b} \notin \operatorname{im} A 时的(最小范数)最小二乘解——把第五章解集结构与第七章投影定理焊接成一件工具。几何:先旋转回主轴坐标、只在"未被压扁"的方向上做除法、再转回去。

6. 应用:主成分分析(PCA)

统计学的中心问题之一:高维数据的"主要方向"。设数据中心化后为 x1,,xmR2 \mathbf{x}_1, \dots, \mathbf{x}_m \in \mathbb{R}^2 ,定义协方差矩阵

S=1mixixiTS = \frac{1}{m}\sum_i \mathbf{x}_i\mathbf{x}_i^{\mathsf T}

(对称半正定:wTSw=1miw,xi20 \mathbf{w}^{\mathsf T}S\mathbf{w} = \tfrac{1}{m}\sum_i\langle\mathbf{w},\mathbf{x}_i\rangle^2 \ge 0 ——外积之和,能量语言)。PCA 定理:数据在方向 w \mathbf{w} (单位)上的方差 wTSw \mathbf{w}^{\mathsf T}S\mathbf{w} 的最大值 = S S 的最大特征值 λ1 \lambda_1 ,在 w= \mathbf{w} = 主特征向量处取到(证明即 3.4 节 σ1 \sigma_1 的最大值刻画,把 ATA A^{\mathsf T}A 换成 S S :主轴定理下 wTSw=λ1y12+λ2y22λ1 \mathbf{w}^{\mathsf T}S\mathbf{w} = \lambda_1 y_1^2 + \lambda_2 y_2^2 \le \lambda_1 )。

通俗地说(图 8-4):沿 (1,1) (1,1) 拉长的点云(橙色点),协方差矩阵的谱分解自动找出红色主轴(数据最散开的方向)与蓝色副轴(最薄的方向)。把坐标轴转到主轴上,第一坐标承载最多的信息(方差),第二坐标多半是噪声——降维 = 保留前几个主成分 = 数据版的低秩近似。人脸识别、基因数据、金融风险因子,背后都是同一条谱定理。

4. 演示图像

本章演示程序位于 src/chapter8,生成图像位于 output/chapter8

图号 文件 内容
图 8-1 fig_8_1_spectral_circle.ppm 谱定理:圆 → 椭圆,主轴沿特征方向
图 8-2 fig_8_2_svd_circle.ppm SVD:输入/输出各一组正交主轴
图 8-3 fig_8_3_indefinite.ppm 负特征值 = 主轴翻转
图 8-4 fig_8_4_pca.ppm PCA:点云的主方向

图 8-1(fig_8_1_spectral_circle.ppm:对称矩阵 (2112) \begin{pmatrix} 2 & 1 \\ 1 & 2 \end{pmatrix} 把单位圆(灰)映成橙色椭圆:长半轴 3 沿红轴 (1,1) (1,1) λ=3 \lambda = 3 )、短半轴 1 沿蓝轴 (1,1) (1,-1) λ=1 \lambda = 1 )——两轴垂直,椭圆端点恰是单位特征向量被拉伸后的像。

图 8-2(fig_8_2_svd_circle.ppm:非对称矩阵 (2111) \begin{pmatrix} 2 & 1 \\ 1 & 1 \end{pmatrix} :单位圆(灰)→ 橙色椭圆。蓝箭头:输入端正交方向 v1,v2 \mathbf{v}_1, \mathbf{v}_2 ATA A^{\mathsf T}A 的特征向量);红箭头:输出端正交方向 u1,u2 \mathbf{u}_1, \mathbf{u}_2 ;两轴长度比 = 奇异值比。非对称 ≠ 纠结:旋转—伸缩—旋转三段即可描述。

图 8-3(fig_8_3_indefinite.ppm:不定矩阵 (2332) \begin{pmatrix} 2 & 3 \\ 3 & 2 \end{pmatrix} :红轴拉伸 5 倍照常;蓝轴上特征向量(蓝)的像(紫)指向反方向——λ=1 \lambda = -1 的翻转效应,鞍面的直观前身。

图 8-4(fig_8_4_pca.ppm:沿 (1,1) (1,1) 拉长的点云(橙点):协方差矩阵的谱分解给出红色主轴(方差最大方向)与蓝色副轴——PCA 不需要任何先验知识,纯靠线性代数从数据中"长"出坐标系。

5. 小结

概念 代数形式 几何形象
实谱性 对称 \Rightarrow 特征值全实 无旋转成分(图 8-1)
正交主轴 不同 λ \lambda 的特征向量垂直 主轴十字(图 8-1、8-2)
谱定理 A=QΛQT A = Q\Lambda Q^{\mathsf T} 沿正交主轴独立伸缩
二次型 q=xTAx q = \mathbf{x}^{\mathsf T}A\mathbf{x} 能量曲面:碗 / 谷 / 鞍
主轴定理 正交替换消交叉项 转轴化简二次曲线
正定判据 特征值全正     a>0,det>0 \iff a > 0,\, \det > 0 碗底稳定,小球归心
负特征值 λ<0 \lambda < 0 该主轴镜像翻转(图 8-3)
SVD A=UΣVT A = U\Sigma V^{\mathsf T} 旋转—伸缩—旋转(图 8-2)
奇异值 σi=λi(ATA) \sigma_i = \sqrt{\lambda_i(A^{\mathsf T}A)} 主轴放大倍数,按重要性排队
伪逆 A+=VΣ+UT A^+ = V\Sigma^+U^{\mathsf T} 只在未压扁方向做除法
PCA 协方差谱分解 数据的主方向(图 8-4)

三条主线:

  1. 对称性买来正交性:谱定理——对称矩阵永远可正交对角化,主轴十字天然垂直;能量(二次型)、统计(协方差)、几何(二次曲面主轴)三问一答。
  2. SVD 补全一切矩阵:非对称矩阵虽然主轴斜交甚至缺失,但输入输出两端各有一套正交轴,中间只剩伸缩——旋转与伸缩是线性映射的完整音节表;奇异值按重要性排队,支撑压缩与降维。
  3. 全书一条龙:向量 → 基与坐标 → 矩阵与方程组 → 行列式 → 抽象空间 → 特征值 → 内积与投影 → 谱定理与 SVD。每一章的工具都在终章会师:转置恒等式、秩一零化度、柯西一施瓦茨、主轴定理……最后一题(习题 10)将请你自己把这条龙再走一遍。

6. 习题

  1. (计算) 求对称矩阵 (3113) \begin{pmatrix} 3 & 1 \\ 1 & 3 \end{pmatrix} 的谱分解(特征值、单位特征向量、Q Q Λ \Lambda ),并写出对应二次型的主轴形式。
  2. (主轴定理) 化简二次曲线 5x2+4xy+5y2=1 5x^2 + 4xy + 5y^2 = 1 :求旋转角、主轴方程、曲线类型与半轴长(答案:特征值 3 与 7,椭圆 3y12+7y22=1 3y_1^2 + 7y_2^2 = 1 )。
  3. (证明) 另证谱定理的重根情形:设对称矩阵 A=(abbd) A = \begin{pmatrix} a & b \\ b & d \end{pmatrix} 的特征多项式有重根 λ \lambda (即判别式 (ad)2+4b2=0 (a - d)^2 + 4b^2 = 0 )。由实数的非负性证明 a=d a = d b=0 b = 0 ,即 A=λI A = \lambda I 。(这正是正文证明的另一种看法:对称矩阵的重根情形必为数量矩阵,剪切式的"半套主轴"被对称性排除。)再举例:非对称矩阵的重根情形(如剪切)为什么逃不过半套主轴的命运?
  4. (正定性) 判断下列二次型的定性(用两个判据各判一次,互相对照):
    (a) 2x2+2xy+2y2 2x^2 + 2xy + 2y^2
    (b) x2+4xy+y2 x^2 + 4xy + y^2
    © x22xy+y2 x^2 - 2xy + y^2 (半正定?写出取零的方向)。
  5. (证明) 证明:A A 正定      \iff 存在可逆矩阵 B B 使 A=BTB A = B^{\mathsf T}B 。("→"用谱分解 B=QΛQT B = Q\sqrt\Lambda Q^{\mathsf T} ;"←"用 xTAx=Bx2 \mathbf{x}^{\mathsf T}A\mathbf{x} = \|B\mathbf{x}\|^2 。这说明正定矩阵是"能量 = 长度平方"的矩阵。)
  6. (SVD 计算)A=(2111) A = \begin{pmatrix} 2 & 1 \\ 1 & 1 \end{pmatrix} 的 SVD:先算 ATA=(5332) A^{\mathsf T}A = \begin{pmatrix} 5 & 3 \\ 3 & 2 \end{pmatrix} ,求其特征值(σ12,σ22 \sigma_1^2, \sigma_2^2 ,即 (7±35)/2 (7 \pm 3\sqrt 5)/2 )与特征向量得 V V Σ \Sigma ,再算 U=AVΣ1 U = AV\Sigma^{-1} (数值验证各矩阵满足定义)。
  7. (证明) 证明奇异值的极值刻画:σ1=max{Ax:x=1} \sigma_1 = \max\{\|A\mathbf{x}\| : \|\mathbf{x}\| = 1\} (在 v1 \mathbf{v}_1 处取到)与 σ2=min{} \sigma_2 = \min\{\dots\} 。由此证明:可逆矩阵满足 σ2xAxσ1x \sigma_2\|\mathbf{x}\| \le \|A\mathbf{x}\| \le \sigma_1\|\mathbf{x}\| ——任何方向的放大倍数都被两个奇异值夹住。
  8. (伪逆) 对秩 1 矩阵 A=(1224) A = \begin{pmatrix} 1 & 2 \\ 2 & 4 \end{pmatrix} (第三章图 3-3):写出其 SVD(提示:先算 ATA=5(1224) A^{\mathsf T}A = 5\begin{pmatrix} 1 & 2 \\ 2 & 4 \end{pmatrix} ,其特征值为 0,25 0, 25 ,故非零奇异值 σ1=5 \sigma_1 = 5 ),求伪逆 A+ A^+ ,并验证 A+b A^+\mathbf{b} b=(1,2) \mathbf{b} = (1,2) 给出最小范数解、对 b=(1,0) \mathbf{b} = (1,0) 给出最小范数最小二乘解。
  9. (PCA) 对数据 (1,2),(2,3),(3,3),(4,5),(5,4) (1,2), (2,3), (3,3), (4,5), (5,4) (先中心化减去均值):求协方差矩阵、主特征向量(主成分方向)与两个特征值(主/副方差)。把数据投到主轴上,验证投影方差 = λ1 \lambda_1
  10. (总结) 全书回顾:用一页纸回答——判别式/行列式 D D 从第一章到第八章依次扮演了哪些角色?(面积、共线判官、可逆性、缩放因子、特征方程系数、奇异值的平方……)谱定理与 SVD 分别需要前几章的哪些定理作为零件?如果继续前进,你觉得下一个主题应当是什么(高维矩阵?复矩阵?张量?),为什么?

7. 结语:八条线索,一个主题

从一支箭头出发,到椭圆的主轴收尾,八条线索贯穿全书:

  1. 第一章(向量):加法与数乘——一切的起点;
  2. 第二章(无关与基):恰好够用的方向;
  3. 第三章(矩阵):线性映射的账本,列是基向量的去向;
  4. 第四章(行列式):一个数浓缩面积、定向与可逆性;
  5. 第五章(线性空间):公理化杠杆,维数是身份证;
  6. 第六章(特征值):主轴与指纹,迭代的命运;
  7. 第七章(内积):投影即最优,正交即免解;
  8. 第八章(谱定理与 SVD):旋转与伸缩——线性映射的最终音节表。

而唯一的主题只有一句:线性 = 可分解。线性组合把向量拆开(第一、二章),矩阵把变换拆成列的搬运(第三章),行列式把整体效果拆成一个数(第四章),基把空间拆成独立方向(第五、六章),正交基把方向拆到互不干扰(第七章),谱定理与 SVD 把任意线性映射拆成旋转与伸缩(第八章)。掌握"拆",就掌握了线性代数的全部野心——也是它统治现代科学(机器学习、信号处理、量子力学、统计)的原因:凡能线性化的世界,皆可分解、皆可计算、皆可理解

后续学习路线:矩阵的 LU/QR/特征值算法(数值线性代数)、复向量空间与若尔当标准形(高等代数)、张量与多线性代数(微分几何、深度学习)——它们都从这八章的某一句话出发。祝旅途愉快。