线性代数(B)(全部)

线性代数(B)(全部)

2026 春季学期线性代数(B)所有笔记,包括从行列式到线性空间(虽说正确的学习顺序应当是反的)的所有内容以及部分梳理,内容较为杂乱(包含大量与课本无关的个人理解,包含部分 AI 生成内容,格式未统一化,实则懒得管了)且未经整理(建议丢 AI 使用,让 AI 跟你说这个神人在想什么)。期中之前都没怎么学懂以至于其中爆炸,所幸期末还是支棱起来了,以至于总评至少不难看。希望学线性代数的小宝宝们能够少走弯路,不要被毒教材(点名表扬某四字教材)害了哦~

教材丘维声《简明线性代数》(以及丘维声《高等代数(上)》)

线性代数B笔记

\(\rm I\) 线性方程组、行列式

\(\it 1.1\) 行列式基础

\(S=[j_1, j_2, \cdots, j_n]^T\)\(1, 2,\cdots, n\) 的一个排列,\(\tau(S)\) 代表其逆序对对数。那么对 \(n\) 阶的方阵,其行列式定义为:

  • \(\det(A)=|A|=\sum_{\forall S}(-1)^{\tau(S)}\prod_{i=1}^na(i, j_i)\)
  • 或者说定义一种选取方式为选出 \(n\) 个行、列互不相同的坐标 \((x_i, j_i)\),那么 \(\det(A)\) 就是这样所有的选法的 \((-1)^{\tau(x)+\tau(y)}\prod a(x_i, y_i)\) 的总和。

\(\it 1.2\) 行列式的性质

  1. 下三角 / 上三角行列式的值可以直接计算。
  2. 行列式中,行和列的地位是完全等价的,记转置矩阵为某矩阵交换行与列之后得到的矩阵,即 \(A^T\)
  3. 某行 \((i, 1\sim n)\)(列同理)的值为 \(a(i, j)=kb(i, j)\),则可以将系数 \(k\) 提出来。
  4. 某行 \((i, 1\sim n)\)(列同理)的值为 \(a(i, j)=b(i, j)+c(i, j)\),则可以将该行的 \(b(i, j), c(i, j)\) 分到两个矩阵中分别求和。
  5. 互换两行,值取反。
  6. 某一行整体加上另一行的 \(k\) 倍,值不变。
    • 因此若出现两样一模一样或者一行是另一行的 \(k\) 倍,则值为 \(0\)

\(\it 1.3\) 代数余子式

由一个元素定义的情况

某个元素 \(a(x, y)\),将整个矩阵挖掉第 \(x\) 行与第 \(y\) 列,剩下矩阵按照原来次序组成的矩阵为 \((x, y)\)余子式,记为 \(M_{x, y}\)。再乘上 \((-1)^{x+y}\) 即为代数余子式\(A_{x, y}=(-1)^{x+y}M_{x, y}\)

【性质】

  • 按某行(列同理)展开:\(\det(A)=\sum_{j=1}^na(i, j)A_{i, j}\)
  • \(\sum_{j=1}^na(i, j)A_{k, j}=0\)\(i\not=k\)

【范德蒙德行列式】

  • 满足 \(a(i, j)=a_j^{i-1}\) 的行列式成为范德蒙德行列式。
  • \(\det(A)=\prod_{i\le j<i\le n}(a_i-a_j)\)

【三对角线行列式】

  • 满足 \(a(i, i)=a, a(i, i+1)=b, a(i, i-1)=c\)
  • \(\det(A)=\dfrac{\alpha^{n+1}-\beta^{n+1}}{\alpha-\beta}\)\((n+1)(\dfrac a2)^2\)\(\alpha=\beta\) 时),其中 \(\alpha, \beta\)\(x^2-ax+bc=0\) 的两根。

由多个元素定义的情况

\(n\) 阶方阵中取 \(k\)\(i_1, i_2, ..., i_k\)\(k\)\(j_1, j_2, ..., j_k\),它们互相交叉可以锁定 \(k^2\) 个元素,这些元素按照原有次序排列组成的新矩阵记作 \(A\dbinom{i_1, i_2, ..., i_k}{j_1, j_2, ..., j_k}\)。我们还可以定义这个新矩阵的余子式为原矩阵挖掉这 \(k\)\(k\) 列之后的矩阵的值,记为 \(A\dbinom{i'_1, i'_2, ..., i'_{n-k}}{j'_1, j'_2, ..., j'_{n-k}}\)。继续乘以 \((-1)^{(i_1+...+i_k)+(j_1+...+j_k)}\) 即得到代数余子式。

【拉普拉斯定理】

  • 任取 \(k\) 行(列同理)\(i_1, i_2, ..., i_k\),则在此基础上继续任选 \(j_1, j_2, ..., j_k\),则 \(\det(A)=\sum_{\{j_k\}}A\dbinom{\{i\}}{\{j\}}A\dbinom{\{i'\}}{\{j'\}}(-1)^{\sum i_t+j_t}\)。其中的 \((-1)^{\sum i_t+j_t}\) 部分按照 \(i', j'\) 计算是等价的。
  • 一个简单应用:\(|A|=\begin{vmatrix}A_1 & 0\\C & A_2\end{vmatrix}=|A_1||A_2|\)

\(\it 1.4\) 线性方程组、增广矩阵

一般矩阵 \(n\)\(m\) 列,可以通过初等行变换化为:

\[\begin{bmatrix} 1 & ... & ... & ... & ... & b_1\\ ... & 1 & ... & ... & ... & b_2\\ ... & ... & 1 & ... & ... & b_3 \end{bmatrix} \]

的形式,满足第 \(i\) 行首个不为零的元素的列坐标严格单增,即阶梯矩阵。然后往回带即为简化阶梯矩阵。

【克拉默法则】

  • 对于线性方程组 \(\{\sum_{j=1}^na_{ij}x_j=b_i\}_{i=1}^n\),其系数矩阵为 \(A=|a_{ij}|\)。则:
    1. 该方程组有唯一解的充要条件为 \(\det(A)\not=0\)
    2. 若该方程组有唯一解,则 \(x_j=\dfrac{|B_j|}{|A|}\),其中 \(B_j\) 的定义是将矩阵 \(A\) 的第 \(j\) 列按顺序替换为 \(b_1\sim b_n\) 之后的新矩阵。

\(\rm II\) 向量、矩阵、秩、空间

\(\it 2.1\) 线性相关

一个向量:\(\vec\alpha_i=[a_{1i}+a_{2i}+\cdots+a_{ni}]^T\)。改写原来的线性方程组,可以得到 \(x_1\vec\alpha_1+x_2\vec\alpha_2+\cdots+x_n\vec\alpha_n=\vec\beta\),称 \(\beta\) 可以由 \(\vec\alpha_{1\sim n}\) 线性表出。

【定义】

  • 线性相关:如果存在不全为 0 的系数 \(k_i\),满足 \(\sum_{i=1}^nk_i\vec\alpha_i=0\),则称向量组 \([\vec\alpha_1, \vec\alpha_2, \cdots, \vec\alpha_n]\) 线性相关;反之,则称线性无关。
  • 线性无关与线性相关的关系:如果向量组的子集线性相关,则其本身线性相关;如果向量组线性无关,则其任意子集线性无关。

【推论】

  • 如果向量组 \([\vec\alpha_1, \vec\alpha_2, \cdots, \vec\alpha_n]\) 线性相关 \(\Leftrightarrow\) 至少存在某一个向量 \(\vec\alpha_k\),其可以由剩余的向量线性表出。
  • 判断向量组是否线性无关,只需看其对应方程组是否只有零解。
  • 如果是 \(n\)\(n\) 维向量,则可以通过 \(\det(A)\) 判断是否是线性无关。\(\det(A)\not=0\) 代表只有零解,线性无关。

【推论】

  • 如果向量组线性无关,(说明其在高维视角下的某一个投影上满足严格线性无关)则其升维后的向量组也线性无关(维度越高,限制越严格)。
  • 如果向量组线性相关,则其降维后的向量组也线性相关。

【推论】

  • 如果向量组 \(\vec\alpha\) 线性无关:加入一个向量 \(\vec\beta\),线性相关 \(\Leftrightarrow\) \(\vec\beta\) 可以由 \(\{\vec\alpha\}\) 线性表出。
    • 向量组内部存在互相线性表出基本上等于线性相关。

\(\it 2.2\) 极大线性无关组

极大线性无关组是极大的,且任意满足条件的都是一个固定的值。

向量组等价:能够互相线性表出。

【性质】

  • 向量组与它的极大线性无关向量组等价。
  • 本质上极大线性无关组满足张成的向量空间与原向量组等价,且没有冗余向量。
  • 若向量组 \(\vec\alpha\) 能够表出向量组 \(\vec\beta\),则在维度上 \(\vec\beta\) 是低维的。

\(\it 2.3\) 矩阵的秩

矩阵的秩:矩阵的行向量的秩 = 矩阵列向量的秩,统称为矩阵的秩。

  • 矩阵的初等行变换不改变矩阵的秩。
  • 如果是 \(n\times n\) 的矩阵,其是否为满秩可以直接计算 \(\det(A)\) 得到。
  • 矩阵的秩等于其不为零的子式的最高阶数。
    • 子方阵秩不为 0?整个的rank至少为阶数。

【判断线性方程组是否有解】

  • 充要条件:其系数矩阵 \(A\) 和增广矩阵 \(\tilde A\) 具有相同的秩。(新增一个列向量 \([b_1, b_2, \cdots, b_n]^T\),若不改变秩,则这个列向量可以由原来的向量组线性表出,也就是有解)

\(\it 2.4\) 向量空间、基、维数

  • (丘砖 3.4)定义:\(U\)\(K^n\) 的一个子空间,如果线性无关的向量组 \(i=1, 2, \cdots, r, \vec\alpha_i\in U\) 满足 \(U\) 中任意一个向量均可以被 \(\{\vec\alpha_i\}\) 表示出,则 \(\{\vec\alpha_i\}\) 是空间 \(U\) 的一组。线性无关 + 都可以表出 = 基。

\(\it 2.5\) 齐次线性方程组的解集结构

\(\rm III\) 矩阵!!

先不说那些乱七八糟的证明,用直觉理解矩阵在干什么才是最重要的。

\(\it 3.1\) 矩阵到底是什么?

  • 我说矩阵就是一种穿越。
  • 定义:一个 \(n\times m\) 的矩阵 \(A\) 代表一种将 \(m\) 维向量 \(\mathbf x^T\) 按一定规则穿越到另一个 \(n\) 维空间的结果,相当于对 \(\mathbf x^T\) 做了一次变换,这种变换记作矩阵 \(A\),变换后的结果(\(n\) 维向量)记作 \(\mathbf y = A\mathbf x\)
  • 这种穿越具有怎样的性质?
    • 对偶空间:记 \(\vec r_i\) 为矩阵 \(A\) 的行向量,\(\vec c_j\) 为矩阵 \(A\) 的列向量。行向量张成的空间为 \(\text{Row}(A)\),列向量张成的空间为 \(\text{Col}(A)\)。任意一个参与变换的向量 \(\mathbf x^T\) 一定可以被分解为 \(\mathbf x^T = \mathbf x_r^T + \mathbf x_0^T\),满足 \(\mathbf x_r^T\in\text{Row}(A)\)\(\mathbf x_0^T\) 属于行空间的正交补空间中(是这么叫吗?总之 \(\forall\mathbf y\in\text{Row}(A), \mathbf y\cdot\mathbf x_0 = 0\)),且这种分解是唯一的。
    • 其中 \(\mathbf x_0^T\) 是可以舍弃的,因为这个分量在这个变换中完全不起作用。那么研究真正有用的 \(\mathbf x_r^T\),其经过矩阵变换后能得到一个确定的向量 \(\mathbf y^T\),且这种对应关系是一个双射。换句话说,只有 \(\mathbf x_r^T\) 才能变出 \(\mathbf y^T\),而 \(\mathbf y^T\) 只能由 \(\mathbf x_r^T\) 变出。
    • 正因 \(\text{Row}(A)\)\(\text{Col}(A)\) 中的全部向量具有一一对应关系,是一个双射,所以称其为对偶空间,它们自然拥有相同的维度数,行向量组和列向量组自然有相同的秩。
  • 那么行向量和列向量在其中承担怎样的职责?
    • 先看列向量:取 \(\mathbf e_j\in\text{Row}(A)\),代表行空间中的一个基底向量,那么 \(A\mathbf e_j^T\) 的结果即为矩阵 \(A\) 的第 \(j\) 列向量 \(\vec c_j\)。因此,矩阵 \(A\) 建立了 \(\vec e_j\to\vec c_j\) 的一种映射:即基向量 \(\mathbf e_j\) 按照穿越规则穿越的结果是 \(\vec c_j\)。而待处理向量 \(\mathbf x\) 可以视作 \(\text{Row}(A)\) 中所有基向量的线性组合,所以穿越结果 \(\mathbf y\) 自然是列向量组 \(\{\vec c_j\}\) 按照与 \(\mathbf x\) 相同的拼装规则拼出的结果,相当于新空间的“基底”。因此列向量描述的是穿越后会怎样
    • 再看行向量:在“矩阵乘向量”的过程中,记 \(\mathbf y = (y_1, y_2, ..., y_n)\),则 \(y_i = \mathbf x\cdot\vec r_i\)。毕竟所有 \(\vec r_i\) 是与 \(\mathbf x\) 处在同一空间中的,所以 \(\vec r_i\) 是测量 \(\mathbf x\) 的尺子:看看这个向量在 \(\vec r_i\) 上的分量是多少,决定了 \(y_i\) 的值。因此行向量描述的是对向量的测量
  • 所以,矩阵 \(A\) 本质上刻画了一个由 \(\text{Row}(A)\)\(\text{Col}(A)\) 的变换,行向量作为 \(\text{Row}(A)\) 中的尺子,而列向量作为原空间基底在 \(\text{Col}(A)\) 中的映射。矩阵是对空间的一种“线性扭曲”,它是在行空间与列空间之间建立了一个对偶的桥梁,同时把无关方向舍弃

\(\it 3.2\) 矩阵乘法到底是什么??

  • 我说矩阵乘法是穿越行为的复合,能够融合两个连续的变换(以及多个)。
  • 设矩阵 \(A\) 描述了空间 \(M_1\)\(M_2\) 的一次穿越,矩阵 \(B\) 描述了空间 \(M_2\)\(M_3\) 的一种穿越。那么矩阵 \(C=BA\) 描述的即是向量一次性完成两个变换所遵循的规则。这种复合满足结合律,即 \(B(A\mathbf x)=(BA)\mathbf x\)
  • 矩阵乘法中,行和列向量分别起什么作用?
    • 列向量视角:矩阵乘法 \(C = BA\),设 \(A\) 的第 \(j\) 列向量为 \(A_{:j}\),那么矩阵 \(C\) 的第 \(j\) 列向量 \(C_{:j} = BA_{:j}\),说明 \(C_{:j}\)\(A_{:j}\) 按照 \(B\) 的穿越规则变换后得到的结果,相当于是从空间 \(M_2\)\(M_3\) 的一种变换。再取 \(M_1\) 中的基向量 \(\mathbf e_j\),连续的映射关系即为 \(\mathbf e_j\to A_{:j}\to C_{:j}\)。此时,矩阵乘法完成了对列向量映射关系的合并。
    • 行向量视角:想象单位矩阵 \(I\),其含义可视为一个向量“变成自己的变换”,其中的行向量 \((0, 0, ..., 0, 1, 0, ..., 0)\) 可以视为一个空间“度量自己”的尺子(点乘后得到自己的分量)。考虑一个存在于 \(M_3\) 中的行向量 \(\mathbf x=(0, 0, ..., 0, 1, 0, ..., 0)\),我们一步一步将其“拉回” \(M_1\) 中,让它去测量 \(M_1\) 中的向量。首先计算 \(\mathbf y = \mathbf xB\),此时的尺子 \(\mathbf y\) 即为 \(B\) 对应行的行向量 \(B_{i:}\),说明 \(\mathbf x\)\(M_3\)\(\mathbf y\)\(M_2\) 发挥了一样的测量作用,可以视为一样的尺子。然后乘上 \(A\),得到 \(\mathbf z = \mathbf yA\),此时 \(\mathbf z\)\(M_1\) 中的尺子向量,发挥与 \(\mathbf x\) 一样的作用。综合所有的单位矩阵的行向量 \(\mathbf x = I_{i:}\),得到最后的复合变换形式:\(C=IBA=BA\)
  • 一句话:尺子前往 \(M_1\),留在过去;映射前往 \(M_3\),去往未来。(行向量通过右乘矩阵回溯到原空间,列向量通过左乘矩阵前进到像空间。)
  • 再说矩阵乘法的分配率:其表示“尺子”的度量是满足可加性的,用 \(\mathbf x\) 度量和用 \(\mathbf y\) 度量的结果的和就是直接用 \(\mathbf x+\mathbf y\) 度量的结果。

\(\it 3.3\) 矩阵的变换:转置、行列式、逆

【矩阵的转置】

  • 相当于交换尺子和映射,倒转变换方向。尺子变成映射,映射变成尺子,二者具有等价的地位。
  • \(\mathbf y\cdot(A\mathbf x) = (A^T\mathbf y)\cdot\mathbf x\) 恒等式。
  • 也就是说,\(A\)\(A^T\) 这两个矩阵描述了两个同构空间的变换关系,其中的向量不仅具有双射的关系,还具有更精确的代数描述。
  • 不过需要注意的是,矩阵 \(A\) 的变换往往具有拉伸原向量 \(\mathbf x\) 的效果,这换到 \(A^T\) 中仍然保留了对向量的拉伸效果,所以矩阵 \(AA^T\) 不能得到原来的向量,而是得到同一空间 \(\text{Row}(A)\) 中被拉伸两遍的向量(换言之,看矩阵 \(A\) 的输出能力)。

【矩阵的行列式】

  • 对于方阵,\(\det(AB) = \det(A)\cdot\det(B)\)
  • 对于 \(A_{s\times n}\)\(B_{n\times s}\),若 \(s>n\),则 \(AB\) 不是满秩矩阵,\(\det(AB) = 0\);否则 \(\det(AB) = \sum\limits_{1\le i_1<i_2<...<i_s\le n}\det A\dbinom{1, 2, ..., s}{i_1, i_2, ..., i_s}\cdot\det B\dbinom{i_1, i_2, ..., i_s}{1, 2, ..., s}\)

【可逆矩阵】

  • 方阵可逆的充要条件:\(\det(A)\not=0\)
  • 伴随矩阵 \(\text{adj}(A)(i, j)=A_{ji}\),注意是将 \(a_{ij}\) 替换为代数余子式 \(A_{ij}\)转置的结果。满足 \(A\cdot \text{adj}(A)=\det(A)I\)
  • 性质:
    • \(A\) 可逆,则 \(A^{-1}\) 也可逆,且 \((A^{-1})^{-1}=A\),即可逆是相互的。
    • \((AB)^{-1}=B^{-1}A^{-1}\)
    • \(A\) 可逆,则 \(A^T\) 也可逆,且 \((A^T)^{-1} = (A^{-1})^T\)
  • 可逆矩阵相当于从 \(I\) 出发,左乘一系列初等矩阵(相当于初等行变换),得到的结果,这保证了 \(\text{rank}(A)=n\)。这是充要的。
  • 如果对 \(A\) 进行一系列初等行变换得到了 \(I\),即 \(P_tP_{t-1}...P_2P_1A=I\),则对 \(I\) 进行同样的操作就可以得到 \(A^{-1}\),即 \(A^{-1}=P_tP_{t-1}...P_2P_1I=P_tP_{t-1}...P_2P_1=(P_1P_2...P_t)^{-1}\)

\(\it 3.4\) 矩阵分块

矩阵分块:将矩阵乘法中的 \(A=BC\) 中的每个单位元素改写为一个子矩阵,满足同行、列子矩阵的宽度是一致的。注意 \(A\) 的列方向矩阵宽度分布一定要和 \(B\) 的行方向矩阵宽度分布是一样的。那么 \(A=BC\) 完全可以按照普通矩阵乘法的步骤进行计算。

【分块矩阵初等行列变换】

  • 操作1:互换两个行块的位置。互换两个列块的位置。
  • 操作2:某行同时左乘某个可逆矩阵,某列右乘一个矩阵。
  • 操作3:某行同时加上另一行左乘 \(P\) 的结果,某一列同时加上另一列右乘 \(P\) 的结果。

单位矩阵分块得到的矩阵经过依次初等行、列变换得到的矩阵称为分块初等矩阵。

\(\it 3.5\) 正交矩阵

  • 定义:满足 \(AA^T=I\) 的矩阵。
  • 向量正交化(是一种变换)

\(\rm IV\) SVD视角下的转置与逆

在前面的讨论中,我们将矩阵理解为一种“穿越”(线性变换)。而要真正理解转置 \(A^T\) 与逆 \(A^{-1}\) 的区别,本质上需要借助奇异值分解(SVD)。

\(\it 4.1\) SVD:矩阵的本质结构

任意矩阵 \(A \in \mathbb{R}^{n\times m}\) 都可以分解为:

\[A = U \Sigma V^T \]

其中:

  • \(U \in \mathbb{R}^{n\times n}\):正交矩阵(输出空间的正交基)
  • \(V \in \mathbb{R}^{m\times m}\):正交矩阵(输入空间的正交基)
  • \(\Sigma \in \mathbb{R}^{n\times m}\):对角矩阵(奇异值)

【结构理解】矩阵 \(A\) 的作用可以拆解为三步:

  1. \(V^T\):将输入向量 \(\mathbf x\) 表达在一组“最适合被拉伸的正交基”上
  2. \(\Sigma\):沿各个方向独立拉伸(不发生混合)
  3. \(U\):将结果映射到输出空间

【一句话总结】矩阵 \(A\) = 换坐标(\(V^T\)) + 拉伸(\(\Sigma\)) + 再换坐标(\(U\)

\(\it 4.2\) 转置 \(A^T\) 的本质

对 SVD 取转置:

\[A^T = (U \Sigma V^T)^T = V \Sigma U^T \]

【结构对比】

矩阵 分解形式 作用顺序
\(A\) \(U \Sigma V^T\) \(V^T \mathbb Rightarrow \Sigma \mathbb Rightarrow U\)
\(A^T\) \(V \Sigma U^T\) \(U^T \mathbb Rightarrow \Sigma \mathbb Rightarrow V\)

【核心结论】转置 \(A^T\) 的作用是:交换 SVD 中前后两个正交变换,而保持中间的拉伸 \(\Sigma\) 不变。

【直观理解(升级版)】

  • \(A\):在“输入坐标系 \(V\)”中拉伸,再映射到“输出坐标系 \(U\)
  • \(A^T\):在“输出坐标系 \(U\)”中拉伸,再映射回“输入坐标系 \(V\)
  • \(A\) 决定“如何拉伸”,\(A^T\) 决定“在哪个坐标系中看这个拉伸”。

\(\it 4.3\) 为什么 \(A^T \neq A^{-1}\)

利用 SVD:

\[A^{-1} = V \Sigma^{-1} U^T \quad (\text{当 } A \text{ 可逆}) \]

\[A^T = V \Sigma U^T \]

【关键区别】

操作 拉伸部分
\(A^T\) \(\Sigma\)(保持原拉伸)
\(A^{-1}\) \(\Sigma^{-1}\)(完全反向拉伸)

【本质解释】

  • \(A^T\):不改变拉伸强度,仅交换坐标系
  • \(A^{-1}\):彻底“撤销”拉伸(恢复原状)

【结论】转置不会“反转变换”,它只是重新表达同一套拉伸结构;只有逆矩阵才真正撤销变换。

\(\it 4.4\) 正交矩阵的特殊情况

若:

\[A^T = A^{-1} \]

则:

\[A^T A = I \]


【含义】

  • 所有奇异值 \(\sigma_i = 1\)
  • 不发生拉伸,仅发生旋转/反射

【结论】当矩阵不改变长度和角度时(纯旋转/反射),转置等于逆。

\(\it 4.5\) 关于 \(A^T A\)\(AA^T\)

由 SVD 可得:

\[A^T A = V \Sigma^2 V^T \]

\[AA^T = U \Sigma^2 U^T \]


【结构解释】

  • \(A^T A\):在输入空间(Row)中进行拉伸
  • \(AA^T\):在输出空间(Col)中进行拉伸

【本质】

它们消除了“旋转”,只保留“拉伸结构”。


【几何意义】

  • 特征向量:主方向(\(V\)\(U\)
  • 特征值:拉伸强度的平方(\(\sigma_i^2\)

【一句话总结】

\(A^T A\)\(AA^T\) 是“只反映拉伸本质”的算子,它们刻画了矩阵对空间结构的扭曲程度。


\(\it 4.6\) 终极理解总结

  • \(A\):改变向量的位置(穿越)
  • \(A^T\):交换输入/输出坐标系(保持拉伸不变)
  • \(A^{-1}\):完全撤销变换(反向拉伸)
  • \(\Sigma\):唯一决定“数值放缩”的部分

🔥 最终一句话(强烈推荐记住):

矩阵的本质是“沿特定方向的拉伸”,而转置只是改变观察这组拉伸的坐标系。

线性代数(B) Part. 2

\(\rm V\) 矩阵的相抵与相似

\(\it 5.1\) 集合划分与等价关系、矩阵的相抵

设想一个完全图 \(G = (V, E)\),其中 \(E = \{(u, v)|\forall u, v\in V\}\)(允许自环)。那么一个二元关系就是边集的一个子集 \(W\subseteq E\)。如果一个二元关系是一个等价关系,当且仅当其能被表示为原图的若干个,且所有团的点的并集为 \(V\)

  • 换言之,\(V = \bigcup\limits_{i=1}^mV_i\)\(\forall i\not=j, V_i\cap V_j=\varnothing\)。则 \(W = \bigcup\limits_{i=1}^m\{(a, b)|a, b\in V_i\}\)

按照这个逻辑,设想 \(V = \mathbf M_{s\times k}\) 为数域 \(K\) 上的所有 \(s\times k\) 矩阵,若两个矩阵 \(A, B\) 能经过一系列初等行、列变换相互变形,则称 \(A, B\) 相抵。相抵关系是一种等价关系\(A\)\(B\) 相抵的充要条件为其有相同的秩。因为任意一个矩阵 \(A\) 总是能够通过初等变换化为标准型:

\[N=\begin{pmatrix} I_r & 0\\ 0 & 0 \end{pmatrix} \]

且是先只做初等行变换,再只做初等列变换。又由于一系列初等行变换可以写成满秩矩阵左乘的形式,一系列初等列变换可以写成满秩矩阵右乘的形式,所以任意矩阵 \(A\) 可以写成 \(A=PNQ\),其中 \(P, Q\) 代表初等变换,\(N\) 为标准型。

\(\it 5.2\) 广义逆矩阵与伪逆

用简洁的公式描述 \(A\mathbf x=\beta\) 的所有解?

\[AXA = A\\ A=U\Sigma V^T\\ U\Sigma V^TXU=U\\ \]

"广义逆"的最低限度:在 \(\text{Row}\)\(\text{Col}\) 之间建立双射关系,任意一个 \(A_{m\times n}\) 的广义逆 \(X\),至少要满足 \(\forall\mathbf x\in\text{Row}(A)\)\(XA\mathbf x=\mathbf x\)。这个表达式在代数上等效于 \(AXA=A\)。其中 \(X\) 的通解为:(\(n\times m\)

\[X=Q^{-1}\begin{pmatrix} I_r & B\\ C & D \end{pmatrix}P^{-1} \\ r = \text{rank}(A) \]

这样的任意一个 \(X\) 记作 \(A\) 的广义逆 \(A^-\)

那么:方程 \(A\mathbf x=\beta\) 有解的充要条件为 \(\beta\in\text{Col}(A)\),用代数语言表示即:\(\beta=AA^-\beta\),这能保证 \(\beta\) 完全没有左零空间的分量。那么 \(A\mathbf x=\beta\) 的通解即 \(\mathbf x_r=A^-\beta\) 加上任意一个 \(\text{Nul}(A)\) 中的向量。

记矩阵 \(\begin{pmatrix}I_r & B\\C & D\end{pmatrix}=N\)


首先研究 \(P, Q, P^{-1}, Q^{-1}\) 的性质:

  • \(P\) 的前 \(r\) 列向量张成 \(\text{Col}(A)\)
    • 考虑 \(A=PNQ\),其中 \(PN\) 这个矩阵运算的结果是保留 \(P\) 的前 \(r\) 列,其余部分压扁为 0,而右乘一个 \(Q\) 代表做若干初等列变换,这不改变当前的列空间,故 \(\text{Col}(A) = \text{Col}(PNQ)=\text{Col}(PN)=\text{Col}(\textsf{First }r\textsf{ columns of }P)\)
  • \(P\) 的后 \(m-r\) 列向量张成 \(\text{Nul}(A^T)\)
    • 因为 \(P\) 为满秩矩阵,故 \(\text{Col}(P) = \mathbb R^m\),而前 \(r\) 列张成 \(\text{Col}(A)\),剩下的依然为无关的线性向量组且与 \(\text{Col}(A)\) 无交,故结果为 \(\text{Nul}(A^T)\)
  • \(Q\) 的前 \(r\) 行向量张成 \(\text{Row}(A)\)
  • \(Q\) 的后 \(n-r\) 列向量张成 \(\text{Nul}(A)\)
  • \(P^{-1}\) 的前 \(r\) 行向量张成 \(\text{Col}(A)\),后 \(m-r\) 行向量张成 \(\text{Nul}(A^T)\)
    • 计算 \(P^{-1}P = I\),记 \(P^{-1}\) 的行向量为 \(\mathbf a_1\sim \mathbf a_m\)\(P\) 的列向量为 \(\mathbf b_1\sim\mathbf b_m\),则对于任意 \(i\in[r+1, m], j\in [1, r]\),均有 \(\mathbf a_i\cdot\mathbf b_j=0\),故这两个空间正交,而与 \(\text{Col}(A)=\text{span}\langle\mathbf b_1\sim \mathbf b_r \rangle\) 正交的空间即 \(\text{Nul}(A^T)\)。自然前 \(r\) 行张成的空间为 \(\text{Col}(A)\)
  • \(Q^{-1}\) 的前 \(r\) 列向量张成 \(\text{Row}(A)\),后 \(n-r\) 列向量张成 \(\text{Nul}(A)\)

然后考察对任意一个 \(\mathbf y\in\mathbb R^m\)\(X\mathbf y=Q^{-1}NP^{-1}\mathbf y\) 的性质:

  • 先算 \(P^{-1}\mathbf y\),已知 \(P^{-1}\) 的前 \(r\) 行为 \(\text{Col}(A)\),剩余为 \(\text{Nul}(A^T)\),按照这两个空间正交分解 \(\mathbf y=\mathbf y_r+\mathbf y_0\)。那么 \(P^{-1}\mathbf y_r\) 的后 \(m-r\) 个分量都为 \(0\)(因为 \(\mathbf y_r\) 与左零空间中的向量相乘结果为 \(0\)),同理 \(P^{-1}\mathbf y_0\) 的前 \(r\) 个分量为 \(0\)
  • \(P^{-1}\mathbf y=P^{-1}(\mathbf y_r+\mathbf y_0)\) 写成 \(\begin{pmatrix}y_1\\y_2\end{pmatrix}\) 的形式,其中 \(y_1\)\(\mathbf y_r\) 的结果,\(y_2\)\(\mathbf y_0\) 的结果。
  • 计算 \(NP^{-1}\mathbf y=\begin{pmatrix}I_r & B\\C & D\end{pmatrix}\dbinom{y_1}{y_2}=\dbinom{y_1+By_2}{Cy_1+Dy_2}\)。记 \(\mathbf z_1=\dbinom{y_1}{Cy_1}, \mathbf z_2=\dbinom{By_2}{Dy_2}\)
  • 重点考察 \(\mathbf z_1=\dbinom{y_1}{Cy_1}\),最后一步将其乘上 \(Q^{-1}\)。已知 \(Q^{-1}\) 的性质是前 \(r\) 列为 \(\text{Row}(A)\),那么 \(\mathbf z_1\) 的前 \(r\) 个分量为 \(\dbinom{y_1}0=NP^{-1}\mathbf y_r\) 的去掉 \(Cy_1\) 的部分。以 \(Q^{-1}\) 的前 \(r\) 列为输出向量,得到的结果是 \(y_1\) 部分对应分量倍数\(Q^{-1}\)\(r\) 个向量的线性组合,因此 \(Q^{-1}NP^{-1}\dbinom{y_1}0\in\text{Row}(A)\),且正好是 \(\mathbf x_r\)
  • 所以其他部分:\(Cy_1\)\(\mathbf y_r\) 映射到 \(\text{Nul}(A)\) 中有一个分量,\(By_2\)\(Dy_2\) 分别将 \(\mathbf y_0\) 映射到 \(\text{Row}(A)\)\(\text{Nul}(A)\) 中的分量。

鉴于矩阵 \(N\) 中的 \(B, C, D\) 部分可以任意地取,所以其中 \(Cy_1\) 的分量也就是 \(\mathbf y_r\) 映射到 \(\text{Nul}(A)\) 中的分量可以任意的去,而 \(\mathbf y_r\) 映射到 \(\text{Row}(A)\) 中的分量始终为 \(\mathbf x_r\),故这个组合可以取到所有的 \(\mathbf x=\mathbf x_r+\mathbf x_0\),其中 \(\forall \mathbf x_0\in\text{Nul}(A)\)。故方程 \(A\mathbf x=\beta\) 的所有解为:\(\mathbf x=A^-\beta\),其中 \(A^-\) 取遍所有可能的合法广义逆矩阵。

推广:

  1. 方程 \(A\mathbf x = 0\) 的所有解为:任取一个合法的广义逆矩阵 \(A^-\) 和任意的 \(\mathbf z\in\mathbb R^n\),则 \(\mathbf x_0 = (I_n-A^-A)\mathbf z\) 为方程 \(A\mathbf x = 0\) 的通解。
  2. 如果只知道矩阵 \(A\) 的任意一个广义逆 \(A^-\),也可以通过 \(\mathbf x = A^-\beta + (I_n-A^-A)\mathbf z\) 的方式写出方程 \(A\mathbf x = \beta\) 的通解,其中 \(\mathbf z\) 取遍所有 \(\mathbb R^n\) 中的向量。

【伪逆】

  • 对于广义逆的一般形式 \(A=PNQ, X = Q^{-1}\begin{pmatrix}I_r & B\\C & D\end{pmatrix}P^{-1}\),当 \(B, C, D\) 都为零矩阵的时候,称此时的 \(X\) 为矩阵 \(A\)伪逆,记作 \(A^+\)。定义上,若复数域上的 \(A=\mathbf M_{s\times k}\) 满足 \(\begin{cases}AXA = 0\\XAX = 0\\(AX)^* = AX\\(XA)^* = XA\end{cases}\),则称这个方程组的唯一解为伪逆 \(A^+\)

\(\it 5.3\) 矩阵的相似

定义上,对于 \(n\) 阶方阵 \(A, B\),如果存在可逆矩阵 \(P\) 满足 \(P^{-1}AP = B\),则称 \(A, B\)相似矩阵

  • 如何理解相似?即:矩阵代表的变换在不同基意义的坐标下的展示。如在标准基下定义一个变换 \(B\),此时在空间中有一组新的基 \(\mathbf y_1\sim\mathbf y_n\),满秩矩阵 \(P\) 代表将一个数值为 \(\mathbf y\) 中的坐标变换为数值为标准基坐标的一个矩阵,那么考虑如何重写矩阵 \(B\) 的变换:首先将标准基意义下的坐标替换为 \(\mathbf y\) 意义下,即左乘 \(P^{-1}\),然后执行在 \(\mathbf y\) 坐标意义下的变换 \(A\),最后变回标准基,乘 \(P\),综合即 \(B=PAP^{-1}\)
  • 而且注意相似关系与相抵关系是一个严格的class

定义矩阵的迹 trace:\(\text{tr}(A)=\sum\limits_{i=1}^na_{ii}\)。代表矩阵 \(A\) 特征值之和,但是我现在还看不懂,不过看着就很有用。

一些矩阵 trace 的性质:

  1. \(\text{tr}(A+B)=\text{tr}(A)+\text{tr}(B)\)
  2. \(\text{tr}(kA)=k\text{tr}(A)\)
  3. \(\text{tr}(AB)=\text{tr}(BA)\)

【可对角化】

  • 如果一个矩阵 \(A\) 能相似于一个对角矩阵 \(\text{diag}(\lambda_1\sim\lambda_n)\),则称 \(A\) 可对角化。其充要条件是:存在 \(n\) 个线性无关的列向量 \(\mathbf a_1\sim\mathbf a_n\)\(n\) 个系数 \(\lambda_1\sim\lambda_n\) 满足 \(A\mathbf a_i=\lambda_i\mathbf a_i\)。此时 \(P = (\mathbf a_1\sim \mathbf a_n)\) 即满足 \(P^{-1}AP=\text{diag}\{\lambda_1\sim\lambda_n\}\)
  • \(\lambda_i\)\(A\) 的一个特征值,\(\mathbf a_i\) 为对应 \(\lambda_i\) 的一个特征向量。零向量不是特征向量。
  • 求解特征值与特征向量:\(A\mathbf a_i=\lambda_i\mathbf a_i\)\((\lambda_iI-A)\mathbf a_i=0\),为求解 \(\mathbf a_i\) 的值(非零)则需要 \(|\lambda_iI-A|=0\),此时才有非零解。定义 \(f(\lambda)=|\lambda I-A|\)特征多项式,其所有根即为特征值,对应的解为特征向量。对于每个特定的特征值 \(\lambda\),其所有 \((\lambda I - A)\mathbf x=0\) 的解构成有关 \(\lambda\)特征子空间。即:\(E_{\lambda_i} = \text{Nul}(\lambda_iI - A)\)。任意两个 \(E_{\lambda_i}, E_{\lambda_j}\) 满足直和分解性质。
  • 特征多项式的性质:设 \(A\)\(n\) 级矩阵,其特征多项式满足:\(f(\lambda)=|\lambda I-A| = \sum\limits_{k=0}^nv_k\lambda^k\),其中 \(v_n=1, v_{n-1}=-\text{tr}(A), v_0=(-1)^n|A|\),且 \(v_{n-k}\)\(A\) 的所有 \(k\) 阶主子式的和乘以 \((-1)^k\)
  • \(A\) 有一个特征值 \(\lambda\),把 \(\lambda\) 对应的特征子空间的维数称为 \(\lambda\) 的几何重数,把 \(\lambda\) 作为特征多项式的根的重数为代数重数,则:几何重数不超过代数重数。
  • 相似的矩阵具有相同的特征值、特征多项式。
  • 相似标准型】若存在对角矩阵 \(\text{diag}\) 使得 \(A\sim\text{diag}\),那么 \(\text{diag} = \{\lambda_1\sim\lambda_n\}\) 即为矩阵 \(A\) 的相似标准型。任意一个矩阵 \(A\) 若可对角化,那么其相似标准型在不考虑 \(\lambda_1\sim\lambda_n\) 顺序的情况下是唯一的。
  • 矩阵 \(A\) 可对角化的充要条件是:\(A\) 的所有特征子空间构成 \(\mathbb K^n\) 的一组直和分解。

【实对称矩阵的特殊性质】

  • 正交对角化
    实对称矩阵 \(A\) 必可正交对角化:存在正交矩阵 \(Q\)\(Q^{-1}=Q^T\))与实对角矩阵 \(\Lambda\),使得

    \[Q^T A Q = \Lambda = \operatorname{diag}(\lambda_1,\dots,\lambda_n) \]

    对角元 \(\lambda_i\)\(A\) 的特征值(均为实数)。

  • 特征值与特征多项式
    特征多项式 \(\det(\lambda I - A)\)\(n\) 个根(按重数计)全是实数。
    不同特征值对应的特征子空间彼此正交。

  • 特征子空间
    对每个特征值 \(\lambda\),特征子空间 \(E_\lambda = \operatorname{Nul}(A-\lambda I)\)
    \(\dim E_\lambda = \lambda\) 的代数重数(几何重数 = 代数重数)。
    \(\mathbb{R}^n\) 可分解为各特征子空间的正交直和:

    \[\mathbb{R}^n = E_{\lambda_1} \oplus E_{\lambda_2} \oplus \dots \oplus E_{\lambda_k} \]

    且不同 \(E_{\lambda_i}\) 之间互相正交。

  • 相似与正交相似
    实对称矩阵之间的相似关系等价于正交相似关系。
    若两个实对称矩阵有相同的特征值(计重数),则它们必正交相似,即存在正交矩阵 \(Q\) 使 \(Q^T A Q = B\)

  • 与其他矩阵类对比

    • 一般实方阵:不一定可对角化,不一定特征值实数。
    • 实对称矩阵:可正交对角化,特征值实数。
    • 正交矩阵:在复数域可对角化,特征值模长为1,不一定实对称。
    • 正规矩阵:可酉对角化,但不一定是实对称。

\(\it 5.N\) 若尔当标准形:几何直觉与代数结构(意外的发现)

从三种基本操作出发

  • 纯伸缩:沿着某个方向(一维不变子空间)按比例 \(\lambda\) 拉长或压缩,对应实数特征值。
  • 旋转(可能带伸缩):在某个平面(二维不变子空间)内转动并均匀缩放,对应一对共轭复特征值 \(a\pm bi\),实数域上表现为 \(2\times2\) 实块 \(\begin{pmatrix}a & -b \\ b & a\end{pmatrix}\)
  • 剪切(链式拖动):一个方向被另一个方向“拉动”,并且这种拉动可以逐级传递,形成一条链。例如二维剪切 \(\begin{pmatrix}1 & 1 \\ 0 & 1\end{pmatrix}\) 把竖直线推斜,且没有足够多的特征向量。

为什么需要若尔当块?

  • 实数特征值只能捕捉纯伸缩(一维),复特征值对只能捕捉平面上的旋转+伸缩(二维)。
  • 剪切操作中,一个特征值对应的特征向量只有一条(几何重数=1),而它占用的维度(代数重数)可能大于1。例如 \(\begin{pmatrix}\lambda & 1 \\ 0 & \lambda\end{pmatrix}\) 的特征值 \(\lambda\) 的代数重数为2,几何重数为1。
  • 这意味着:仅仅用特征向量无法张成整个空间,需要引入广义特征向量来补充缺失的维度。

若尔当块(Jordan block)

  • 一个 \(k\) 阶若尔当块(对应特征值 \(\lambda\))具有形式:

    \[J_k(\lambda) = \begin{pmatrix} \lambda & 1 & 0 & \cdots & 0 \\ 0 & \lambda & 1 & \cdots & 0 \\ \vdots & \vdots & \ddots & \ddots & \vdots \\ 0 & 0 & \cdots & \lambda & 1 \\ 0 & 0 & \cdots & 0 & \lambda \end{pmatrix} \]

  • 它描述 “伸缩 \(\lambda\) 倍 + 长度为 \(k\) 的剪切链”
    • 第一个基向量是普通特征向量(方向不变)。
    • 第二个基向量被映射为 \(\lambda\cdot\) 自身 + 第一个基向量(被第一个方向拖动)。
    • 第三个基向量被映射为 \(\lambda\cdot\) 自身 + 第二个基向量,以此类推。
  • 整个 \(k\) 维子空间是不可再分解的不变子空间。

若尔当标准形(Jordan canonical form)

  • 在复数域上,任何方阵都相似于一个由若尔当块组成的块对角矩阵:

    \[A \sim \begin{pmatrix} J_{k_1}(\lambda_1) & & \\ & J_{k_2}(\lambda_2) & \\ & & \ddots \end{pmatrix} \]

  • 每个若尔当块对应一个特征值(实数或复数),块的大小等于该特征值的代数重数。
  • 若尔当标准形将整个空间分解为若干独立的不变子空间(每个子空间对应一个若尔当块),在这些子空间上变换就是“伸缩+剪切”(或“旋转+伸缩”),块之间互不干扰。

实数域上的处理

  • 实数矩阵的复特征值成对出现,对应的若尔当块在实数域上表现为 实若尔当块

    \[\begin{pmatrix} R & I_2 & & \\ & R & I_2 & \\ & & \ddots & I_2 \\ & & & R \end{pmatrix} ,\quad R = \begin{pmatrix}a & -b \\ b & a\end{pmatrix} \]

    其中 \(I_2\) 是二阶单位矩阵。这代表了“旋转+伸缩”与“平面之间的剪切”的复合。

总结

  • 特征值/特征向量 只能描述纯伸缩(实数)和旋转+伸缩(复共轭对)。
  • 剪切 需要更多维度来描述一个特征值,由此产生了若尔当块。
  • 若尔当标准形 将任意线性变换分解为若干个独立的“伸缩+剪切”原子操作(若尔当块)的直和,从而彻底揭示了变换的内在不变量。

从几何直觉看:若尔当块就是“剪切链”的代数化身。当你看到一个不可对角化的矩阵时,你就在观察一条或多条这样的链。

线性代数(B)笔记 Part 3.

\(\rm VI\) 二次型 · 矩阵的合同

\(\it 6.1\) 二次型与矩阵合同

【定义】

  • \(A, B\)\(n\) 阶实对称矩阵,若存在可逆矩阵 \(P\) 使 \(B=P^TAP\),则称 \(A\)\(B\) 合同,记作 \(A \cong B\)。本质上,合同刻画 同一个二次型(或对称双线性形式)在不同基下的度量矩阵,记变换基底 \(\mathbf x=P\mathbf y\)

  • 由于实对称矩阵一定存在 \(n\) 个正交的特征向量,所以如果 \(C^TAC=\Lambda\)(对角矩阵),那么 \(C\) 这个变换一定是基于 \(A\)\(n\) 个特征向量的方向的,放缩倍数随意(非零即可)。

  • 注意:在实数域上,因为乘了两遍 \(C\) ,所以有关实二次型的凹、凸、平的方向个数不改变,可以理解为高维圆锥曲线的 \(n\) 个方向中,有多少个方向是椭圆特征,有多少个方向是双曲特征,有多少方向是柱面特征(平的)是不由合同改变的。

  • 因此,两个矩阵合同的充要条件是具有相同的惯性指数 \(p, q\)。合同只关心这个。

  • 任意的实对称矩阵一定存在正交矩阵 \(Q\) 使得 \(Q^TAQ=\text{diag}(\lambda_1, ..., \lambda_n)\),其中 \(\lambda_i\) 为特征值。

  • 在复数域上,任何对称矩阵 \(A\)\(A^T = A\))都合同于 \(\begin{pmatrix} I_r & 0 \\ 0 & 0 \end{pmatrix}\),其中 \(r = \operatorname{rank}(A)\)。原因:复数域允许开平方,正负号可通过缩放变成 1;因此惯性指数退化为秩。

【合同变换的常用方法】

  • 配方法:通过配方将二次型化为平方和,直接得到合同变换矩阵(通常为上三角)。
  • 正交变换法:利用特征向量构造正交矩阵,得到正交合同标准形(特征值对角阵)。

\(\it 6.2\) 正定矩阵

【概念】

  • 称一个二次型 \(\mathbf x^TA\mathbf x\) 是正定的,当且仅当 \(\mathbf x^TA\mathbf x>0\)\(\forall\mathbf x\in\mathbb R^n\) 成立。同时将此时的 \(A\) 称为正定矩阵
  • \(A\) 是正定矩阵,当且仅当 \(A\) 的正惯性指数为 \(n\),也就是说 \(A\) 合同于 \(I\)。合同关系不改变矩阵的正定性。
  • 正定矩阵的行列式大于 0。
    • 矩阵 \(A\) 为正定矩阵的充要条件是,\(A\) 的每一个顺序主子式 \(A\dbinom{1, 2, \cdots, k}{1, 2, \cdots, k}>0\)
  • 同时可以定义半正定、负定、半负定等概念。

\(\rm VII\) 线性空间、线性映射

这一章的内容很早之前就通过几何直觉理解过了,只用记一些概念和定义。

【线性空间的定义】

  • 我们需要一个抽象集合 \(V\) 与一个数域 \(K\),在 \(V\) 中定义加法运算:\(\gamma = \alpha + \beta,\forall \alpha, \beta\in V\) 和数乘运算 \(\gamma = k\alpha, \forall \alpha\in V, k\in K\)
  • 需要满足八个定律:加法交换律、加法结合律、加法零元素、加法负元素、乘法一元素、数乘结合律、数字分配率、向量分配率。
    • \(V\) 是某个已知的线性空间的子集,那么只需验证对于加法和数乘封闭

线性代数(B):知识点梳理

针对一些概念性以及结论性的东西,在此进行梳理(应试导向)。

Chapter 4 矩阵

【矩阵乘积的性质】

  • 若干秩不等式:
    • \(\mathrm{rank}(AB)\le\min\{\mathrm{rank}(A), \mathrm{rank}(B)\}\)
    • \(\mathrm{rank}(AB)\ge\mathrm{rank}(A)+\mathrm{rank}(B)-n\)
    • \(AB=0\),则 \(\mathrm{rank}(A)+\mathrm{rank}(B)\le n\)
  • 矩阵乘积的行列式:\(|AB|=|A||B|\)

【分块矩阵】

  • 分块矩阵的乘法:在 \(C=AB\) 中,\(A\) 在列上的分块情况应当与 \(B\) 在行上的分块情况完全一致,且每块相乘的时候需要保证左右顺序的一致。
  • 分块矩阵的初等行变换:在乘法时为左乘。(一行同时左乘一个可逆矩阵 \(P\),行列式乘上 \(\det(P)\)
  • 分块矩阵的初等列变换:在乘法时为右乘
  • Sylvester 不等式:\(\mathrm{rank}(AB)\ge\mathrm{rank}(A)+\mathrm{rank}(B)-n\)
    • \(A:s\times n, B:n\times m\)
  • (书上 P139 有幂等矩阵)
  • Binet-Cauchy 公式:\(A\)\(s\times n\) 矩阵,\(B\)\(n\times s\) 矩阵(\(s\le n\)),则有 \(\det(AB)=\sum\limits_{1\le v_1<v_2<\cdots<v_s\le n}A\dbinom{1\sim s}{v_1\sim v_s}\cdot B\dbinom{v_1\sim v_s}{1\sim s}\)。若 \(s>n\),则 \(\det(AB)=0\)。(常用的秩不等式总结?这是应试模块)

【正交矩阵】

  • 概念:代数上满足 \(A^T=A^{-1}\)。实质为各个行 / 列向量都为单位向量且两两正交。表示的是纯旋转 / 反射的变换。
  • Schmidt 正交化:设 \(\alpha_1\sim\alpha_n\) 为待正交化的向量组,则令 \(\beta_k=\alpha_k-\sum\limits_{i=1}^{n-1}\dfrac{\alpha_k\cdot\beta_i}{\beta_i^2}\beta_i\)。然后令 \(\eta_i=\dfrac{\beta_i}{\|\beta_i\|}\) 即得到单位正交的向量组 \(\eta_1\sim\eta_n\)

Chapter 5 矩阵的相抵与相似

【矩阵的相抵】

  • 定义:\(A\) 能经过一系列初等行列变换变成 \(B\),则 \(A\)\(B\) 相抵。
  • 实质:两个 \(s\times n\) 矩阵相抵的充要条件是他们的秩相等。(初等行变换可以理解为左乘初等矩阵,初等列变换可以理解为右乘初等矩阵,任意的满秩方阵都可以分解为初等矩阵的乘积)
  • 相抵标准型:\(A=\begin{pmatrix} I_r & 0 \\ 0 & 0 \end{pmatrix}_{s\times n}, r=\mathrm{rank}(A)\)。存在可逆矩阵 \(P_{s\times s}, Q_{n\times n}\) 使得 \(A=P\begin{pmatrix} I_r & 0 \\ 0 & 0 \end{pmatrix}Q\)

【矩阵的相似】

  • 定义:存在可逆矩阵 \(P\) 使得 \(P^{-1}AP=B\),则 \(A\sim B\)
  • 实质:相似描述的是同一个线性变换在不同基下的呈现形式。(但过渡矩阵那一块我有点不扎实)
  • \(A\sim B\),则 \(\mathrm{rank}(A)=\mathrm{rank}(B), \mathrm{tr}(A)=\mathrm{tr}(B), \det(A)=\det(B)\)拥有相同的特征多项式
  • (这里貌似出现了是幂等矩阵、对合矩阵之类的了,是应试模块)

【特征值、特征向量】

  • 定义:存在值 \(\lambda\) 与向量 \(\mathbf v\) 满足 \(A\mathbf v=\lambda\mathbf v\),则称 \(\lambda\) 为方阵 \(A\) 的一个特征值,\(\mathbf v\) 为特征值 \(\lambda\) 对应的一个特征向量。
  • 求特征值:特征多项式 \(\det(\lambda I-A)\)。其在 \(\mathbb C\) 上一定有 \(n\) 个根。\(\lambda_0\)\(A\) 的一个特征值当且仅当 \(\det(\lambda_0I-A)=0\)。一个特征值 \(\lambda\) 可能对应多个特征向量 \(\mathbf v_1, \mathbf v_2, \cdots, \mathbf v_s\),这些特征向量线性无关,其直和构成有关特征值 \(\lambda\) 的特征子空间。不同特征子空间直和。

【矩阵的对角化】

  • 若矩阵 \(A\) 相似于对角矩阵 \(\Lambda\),则称 \(A\) 可对角化。
  • 数域上 \(K\) 的矩阵 \(A\) 可对角化,充要条件是 \(A\) 的特征多项式的每一个根都属于 \(K\),且每个特征值的代数重数等于几何重数。换句话说,所有特征子空间的直和为 \(K^n\)
    • 有关代数重数与几何重数的具体关系,是 Jordan 块与 Jordan 标准型讨论的内容,这里不深究。
  • 求法:求所有特征值 \(\lambda_1, \lambda_2, \cdots, \lambda_m\),对每个特征值 \(\lambda_i\) 都求出对应的特征向量 \(\mathbf v_{i, 1}, \mathbf v_{i, 2}, \cdots, \mathbf v_{i, m_i}\)。令 \(P=\begin{pmatrix} \mathbf v_1 & \mathbf v_2 & \cdots & \mathbf v_n \end{pmatrix}\)(按一定顺序排列),则满足 \(AP=P\Lambda\),此时 \(\Lambda=\mathrm{diag}(\lambda_1, \lambda_2, \cdots, \lambda_n)\),按照特征向量对应特征值的顺序排列。

【实对称矩阵】

  • 实对称矩阵一定存在 \(n\) 个实数特征值,一定可对角化。
  • 实对称矩阵有关不同特征值的特征向量是正交的。
  • 实对称矩阵一定正交相似(正交合同)于对角矩阵。
  • 矩阵是实对称矩阵的充要条件是可以正交对角化。

Chapter 6 二次型·矩阵的合同

【二次型与合同标准型】

  • 二次型:\(\mathbf x=(x_1, x_2, \cdots, x_n)^T, f(\mathbf x)=\mathbf x^TA\mathbf x\),其中 \(A\) 为对应的对称矩阵。
  • 对二次型做非退化线性变换 \(\mathbf x=C\mathbf y\)(其中 \(C\) 可逆),得到 \(\mathbf x^TA\mathbf x=\mathbf y^T(C^TAC)\mathbf y\)。记作 \(B=C^TAC\),即 \(B\cong A\)\(\mathbf x^TA\mathbf x=\mathbf y^TB\mathbf y\)
  • 合同标准型:\(A\cong\Lambda=\mathrm{diag}(\lambda_1, \lambda_2, \cdots, \lambda_n)\)。(注意合同标准型只要求是对角矩阵即可)
    • 正交合同:也就是正交相似。需要求正交矩阵 \(Q\) 满足 \(Q^TAQ=\Lambda\)。(求法很重要)
    • 求法:求所有特征值以及所有对应的特征向量。进行 Schmidt 正交化(只需同一个特征值内部正交化)。然后按照列向量排列为 \(Q\)。此时 \(\mathbf x=Q\mathbf y\) 即为正交替换。
    • 配方法,直接做题训练。
  • 任意的实对称矩阵都合同于对角矩阵。任意一个二次型都合同于一个只含平方项的二次型。

【实二次型的规范型】

  • 对于实二次型(实对称矩阵),合同的本质在于(充要条件)拥有相同的惯性指数 \(p, q\)。这里 \(\mathrm{rank}(A)=r=p+q\)。默认 \(p\) 表示正惯性指数。几何上理解就是圆锥曲线有多少个方向是椭圆的、双曲的、柱面的。
  • 规范型唯一:\(p\)\(1\)\(q\)\(-1\),剩下为 \(0\) 的对角矩阵。

【正定】

  • 定义:\(\forall\mathbf x\in\mathbb R^n\),有 \(\mathbf x^TA\mathbf x>0\),则称 \(A\) 正定。类似有半正定、负定、半负定。
  • 正定的充要条件是 \(p=n\),此时 \(A\cong I\),存在可逆矩阵使得 \(A=C^TC\)
  • 实对称矩阵正定的充要条件是每一个顺序主子式大于 \(0\)

Chapter 7 线性空间

【线性空间】

  • 八条定律(需要 \(F, V\)):加法交换律、加法结合律、存在零元素、存在负元素;\(1x=x\)\((kl)x=k(lx)\)\((k+l)x=kx+lx\)\(k(x+y)=kx+ky\)
  • 证明一个 \(F, V\) 是线性空间,其中 \(V\) 是某个已知线性空间的子集,则只需验证两条:\(x, y\in V\)\(x+y\in V\)\(x\in V\)\(kx\in V\)。(是这样吗?)
  • 过渡矩阵(不扎实):定义为 \(\begin{pmatrix} \beta_1 & \beta_2 & \cdots & \beta_n\end{pmatrix}=\begin{pmatrix} \alpha_1 & \alpha_2 & \cdots & \alpha_n \end{pmatrix}A\)。称 \(A\) 是基 \(\alpha\) 到基 \(\beta\) 的过渡矩阵。
    • \(A\) 的第 \(j\) 列为 \(\beta_j\) 在原基 \(\alpha_1\sim\alpha_n\) 的坐标。

【子空间的交与直和】

  • (各种维数公式都来了)
  • 验证直和:\(V_1\cap V_2=\{0\}\)\(V_1\cup V_2=W\)
  • (有关这一块的计算?)

【线性空间的同构】

  • 设在 \(V\)\(V'\) 中存在映射 \(\sigma\) 使得两者中的元素存在一个一一对应的关系 \(\sigma(x)=x'\),则 \(V\cong V'\)。充要条件是 \(\dim V=\dim V'\)

Chapter 8 线性映射

【线性映射】

  • 像、原像:
    • \(\ker\mathscr A:\mathrm{Nul}(A)\)
    • \(\mathrm{Im}\mathscr A:\mathrm{Col}(A)\)
  • 线性映射:\(\mathscr A:V\to V'\),满足 \(\mathscr A(x+y)=\mathscr A(x)+\mathscr A(y)\)\(\mathscr A(kx)=k\mathscr A(x)\)。称 \(\mathscr A:V\to V\) 的线性映射为线性变换。
    • 零变换:\(\mathscr 0(x)=0\);恒等变换:\(\mathscr I(x)=x\)
  • \(\mathrm{Hom}(V, V')\) 代表 \(V\to V'\) 的所有线性映射的集合,其本身也是一个线性空间。

【线性变换的矩阵表示】

  • 也就是:\(\begin{pmatrix} \mathscr A(x_1) & \mathscr A(x_2) & \cdots & \mathscr A(x_n) \end{pmatrix}=\begin{pmatrix} x_1 & x_2 & \cdots & x_n \end{pmatrix}A\)。称 \(A\) 为线性变换 \(\mathscr A\) 在基 \(x_1\sim x_n\) 下的矩阵。
    • 意思是,假设一个向量 \(\alpha\) 在基 \(x_1\sim x_n\) 的坐标为 \(\mathbf a=(a_1, a_2, \cdots, a_n)\),则 \(\mathscr A(\alpha)\) 在同一个基下的坐标为 \(A\mathbf a\)
  • \(\mathrm{Hom}(V, V')\cong \mathbf M_{\dim V\times \dim V'}(K)\)
  • 同一个线性变换 \(\mathscr A\) 在基 \(\alpha_1\sim\alpha_n\) 的矩阵为 \(A\),在基 \(\beta_1\sim\beta_n\) 的矩阵为 \(B\),从 \(\alpha_i\)\(\beta_i\) 的过渡矩阵为 \(S\),则有:\(B=S^{-1}AS\)。这是相似的本质。(但是我还没有搞清楚过渡矩阵具体的方向)。
    • 换言之,同一个向量 \(p\) 在基 \(\alpha\) 下的坐标为 \(\mathbf a\),在基 \(\beta\) 下的坐标为 \(\mathbf b\),那么这个关系是反过来的:\(\mathbf a=S\mathbf b\)
  • 对线性变换 \(\mathscr A\) 定义的特征值、特征向量、标准型。

【补充:线性变换的特征值与特征向量】

  • 转为取一个基下的矩阵。

线性代数(B):计算题整理

I 矩阵求逆

  • 目标:给定矩阵 \(A\),求 \(A^{-1}\)
  • 求法:
    • 伴随矩阵法:求伴随矩阵 \(A^*\),为每一个地方的代数余子式拼起来转置的结果。然后利用 \(A^*=|A|A^{-1}\) 得到。
    • 行变换法:构造矩阵 \(\begin{pmatrix} A & I_n \end{pmatrix}\),对左侧的 \(A\) 进行初等行变换(交换两行、某行乘以非零常数、 某行乘以常数加到另一行),对右侧进行相同的操作,直到左侧为 \(I\),此时矩阵形如 \(\begin{pmatrix} I_n & A^{-1} \end{pmatrix}\)

II 矩阵正交对角化

  • 目标:求正交矩阵 \(Q\) 使得 \(Q^TAQ=\Lambda\),其中 \(\Lambda\) 为对角矩阵。
  • 求法:
    • 首先求 \(|\lambda I-A|=0\) 解出 \(n\) 个特征值。
    • 对于每个特征值 \(\lambda_i\),解出 \((\lambda_iI-A)\mathbf x=0\) 的一组基,作为特征向量。
    • 不同特征值之间的特征向量自动正交,同一特征值的向量需要正交化处理(Schmidt)。
    • 单位化:所有向量除以自己的模长。
    • 按照顺序排列:\(Q=\begin{pmatrix} \mathbf v_1 & \mathbf v_2 & \cdots & \mathbf v_n \end{pmatrix}\),特征向量的顺序与特征值的顺序对应。
  • 检查方法:
    • 验证 \(Q^TQ=I\)
    • 验证 \(AQ=Q\Lambda\)

\[\begin{pmatrix} \dfrac1{\sqrt 2} & \dfrac1{\sqrt 6} & \dfrac{-1}{\sqrt 3} \\ \dfrac1{\sqrt 2} & \dfrac{-1}{\sqrt 6} & \dfrac1{\sqrt 3} \\ 0 & \dfrac2{\sqrt 6} & \dfrac1{\sqrt 3} \end{pmatrix} \]

III 二次型的标准化

  • 目标:给定一个二次型 \(\mathbf x^TA\mathbf x\) 或者直接给出矩阵 \(A\),要求求可逆变换 \(\mathbf x=C\mathbf y\) 使得变为只含平方项的二次型。
  • 求法:
    • 配方法(优先):直接针对表达式进行换元操作,需要一定注意力。(尤其适合不用写出变换矩阵 \(C\) 的时候,当然要求写出也没问题)
    • 正交替换法:就是 II 中的内容。
  • 具体而言,求出 \(\mathbf x=C\mathbf y\) 之后,矩阵 \(C^TAC\) 应当为对角矩阵。所以,求出 \(Q^TAQ=\Lambda\) 中的 \(Q\),那么 \(\mathbf x=Q\mathbf y\) 就是所求的变换。

IV 实对称矩阵的正定性判断

与 III 一致。正定还可以通过每个顺序主子式都正来判定。

V 同一线性变换在不同基下的矩阵

  • 目标:给定基 \(\alpha\) 与基 \(\beta\),某一线性变换 \(\mathscr A\) 在基 \(\alpha\) 下的矩阵为 \(A\),求其在基 \(\beta\) 下的矩阵 \(B\)
  • 求法:求 \(\alpha\)\(\beta\) 的过度矩阵 \(S\)。核心要点是:\(S\) 的第 \(j\) 列为 \(\beta_j\) 在基 \(\alpha\) 下的坐标。则 \(B=S^{-1}AS\)
  • 同一个向量在 \(\beta\)(新基)下的坐标为 \(\mathbf x_\beta\),在 \(\alpha\)(旧基)下的坐标为 \(\mathbf x_\alpha\),则有 \(\mathbf x_\alpha=S\mathbf x_\beta\)

VI 子空间的交与和的基和维数

  • 目标:给出子空间 \(V_1\)\(V_2\) 的各一组基 \(\alpha_1\sim\alpha_n\)\(\beta_1\sim\beta_m\),求 \(V_1\cap V_2\)\(V_1\cup V_2\) 的基。
  • 求法:
    • 并集:将 \(\alpha\)\(\beta\) 按照列向量的方式排布为矩阵 \(A, B\)。则求并集的方式就是构造分块矩阵 \(M=\begin{pmatrix} A & B \end{pmatrix}\) 并对 \(M\) 进行初等列变换。最后就能得到 \(V_1\cup V_2\) 的一组基。
    • 交集:设 \(V_1\cap V_2\) 中的某一向量为 \(\mathbf z\),则存在 \(\mathbf x, \mathbf y\) 使得 \(\mathbf z=A\mathbf x\)\(\mathbf z=B\mathbf y\)。也就是要解方程 \(A\mathbf x=B\mathbf y\)。构造分块矩阵方程 \(\begin{pmatrix} A & -B \end{pmatrix}\begin{pmatrix} \mathbf x \\ \mathbf y \end{pmatrix}=0\),解方程得到 \(\begin{pmatrix} \mathbf x \\ \mathbf y \end{pmatrix}\) 的解,进而写出 \(\mathbf z=B\mathbf y\) 或者 \(\mathbf z=A\mathbf x\) 有多少个。

VII 矩阵的幂

  • 目标:给定矩阵 \(A\),求 \(A^m\) 的通式。
  • 求法:对 \(A\) 进行对角化(课程范围内暂时不考虑不可对角化的情况),求出 \(A=P\Lambda P^{-1}\),其中 \(\Lambda=\mathrm{diag}(\lambda_1, \lambda_2, \cdots, \lambda_n)\)。则 \(A^m=P\Lambda^mP^{-1}=P\mathrm{diag}(\lambda_1^m, \lambda_2^m, \cdots, \lambda_n^m)P^{-1}\)

\[\begin{align} \\& A=\begin{pmatrix} 1 & 2 \\ 2 & 1 \end{pmatrix},求 A^m。\\& P=\begin{pmatrix} 1 & 1 \\ 1 & -1 \end{pmatrix}, \Lambda=\begin{pmatrix} 3 & 0 \\ 0 & -1 \end{pmatrix}\\& \\& A^m=P\Lambda^mP^{-1=}\begin{pmatrix} \dfrac12(-1)^m+\dfrac123^m & \dfrac12(-1)^m-\dfrac123^m \\ \dfrac12(-1)^m-\dfrac123^m & \dfrac12(-1)^m+\dfrac123^m \end{pmatrix} \end{align} $$ 注意顺序。# 线性代数(B):证明题模块复习 这是最重要的板块。## I 基本定理(工具箱) 【维数公式】 - $\dim(V_1+V_2)=\dim V_1+\dim V_2-\dim(V_1\cap V_2)$。 - 直和的判定:$V_1\cap V_2=\{0\}$ 且 $V=V_1+V_2$(构造直和分解)。 - $\dim V=\dim\ker\mathscr A+\dim\mathrm{Im}(\mathscr A)$。【秩不等式】 - $\mathrm{rank}(AB)\le\min\{\mathrm{rank}(A), \mathrm{rank}(B)\}$。 - Sylvester 不等式:$\mathrm{rank}(AB)\ge\mathrm{rank}(A)+\mathrm{rank}(B)-n$。 - 若 $AB=0$,则 $\mathrm{rank}(A)+\mathrm{rank}(B)\le n$。 - 可逆矩阵不改变矩阵的秩:$\mathrm{rank}(PAQ)=\mathrm{rank}(A)$(其中 $P, Q$ 可逆)。【线性映射与矩阵的表示】 - 线性变换在不同基下的表示(本质是相似):$B=S^{-1}AS$,其中 $S$ 是 $\alpha\to \beta$ 的过渡。 - 相似矩阵的不变量:秩 $\mathrm{rank}$,特征多项式(包含:迹 $\mathrm{trace}$、行列式 $\det$)。 - 过渡矩阵的方向:$\beta=\alpha S$,则 $\mathbf x_\alpha=S\mathbf x_\beta$。【特征值与对角化】 - 幂等矩阵 $A^2=A$:特征值只有 $0$ 或 $1$;可对角化;$\mathbb R^n=\mathrm{Nul}(A)\oplus\mathrm{Col}(A)$(如何严格证明?)。 - 对合矩阵 $A^2=I$:特征值为 $\pm 1$;可对角化;$\mathbb R^n=E_{1}\oplus E_{-1}$(依旧如何严格证明?)。- **注意**:通常零空间更容易与方程和特征值之类的联系起来。 - 正交矩阵的特征值为 $\pm 1$。【矩阵的合同】 - 合同不变量:实对称矩阵合同 $\Leftrightarrow$ $r, p$ 相等。 - 正定:$\forall\mathbf x^TA\mathbf x>0$;$\lambda_i>0$;所有顺序主子式正。## II 证明题模型归纳 【幂等矩阵、对合矩阵】 - $\mathrm{rank}(A)+\mathrm{rank}(I-A)=n$。这类式子本质上是在说直和分解,也就是对于 $A^2=A$ 的矩阵有 $\mathrm{Nul}(A)\oplus E_{1}=\mathbb R^n$。(不过这个条件我记得是充要的,如何反过来证?) - $A^2=I$ 类。 - 看到**有关 $\mathrm{rank}(I-A)$ 之类**的结构,**联系特征子空间** $\mathrm{Nul}(I-A)\cong E_1(A)$。 - 具体证明:- 对于 $A^2=A$,首先 $A$ 的特征值只能为 $0, 1$。设 $A$ 的列向量为 $\mathbf x_i$,则 $\forall\mathbf x_i$ 均有 $A\mathbf x_i=\mathbf x_i$。这说明 $\mathrm{Col}(A)\subseteq E_1, \dim\mathrm{Col}(A)\le\dim E_1$。同时 $\mathrm{Nul}(A)=E_0$,由于 $\dim\mathrm{Nul}(A)+\dim\mathrm{Col}(A)=n$,所以只能有 $\dim\mathrm{Col}(A)=\dim E_1$,也就是 $\dim E_1+\dim E_0=n$,即 $E_0\oplus E_1=\mathbb R^n$。- 对于 $A^2=I$,首先 $A$ 的特征值只能为 $-1, 1$。由于 $(I+A)(I-A)=0$,所以 $\mathrm{rank}(I+A)+\mathrm{rank}(I-A)\le n$。也就是 $\dim E_{-1}+\dim E_1\ge n$。而 $E_{-1}\oplus E_1\subseteq\mathbb R^n$,所以 $E_{-1}\oplus E_1=\mathbb R^n$。【$AB$ 与 $BA$ 的特征多项式】 - \]

\begin{vmatrix} \lambda I_n & B \ 0 & I_s-\dfrac{AB}{\lambda} \end{vmatrix}=\begin{vmatrix} \lambda I_n & B \ A & I_s \end{vmatrix}=\begin{vmatrix} \lambda I_n-BA & 0 \ A & I_s \end{vmatrix}

\[- 也就是 $|I_s-AB|$ 与 $|I_n-BA|$ 只差 $\lambda$ 的若干次方,从中看出 $AB$ 与 $BA$ 有相同的非零特征值,且重数相同。> LU-唯一分解:任意给定所有顺序主子式都不为零的 $n$ 阶矩阵 $A$,求证 $A$ 能唯一地分解为一个主对角线元素全部为 $1$ 的下三角矩阵 $B$ 与一个可逆的上三角矩阵 $C$ 的乘积,即 $A=BC$。- 证明:使用归纳法与分块矩阵 $A=\begin{pmatrix} A_1 & \mathbf x \\ \mathbf y^T & a \end{pmatrix}$,则 $A=\begin{pmatrix} A_1 & \mathbf x \\ \mathbf y^T & a \end{pmatrix}=\begin{pmatrix} P & 0 \\ \mathbf m^T & 1 \end{pmatrix}\begin{pmatrix} Q & \mathbf n \\ 0 & b \end{pmatrix}$,后两项为 $B$ 和 $C$。 - 解方程:$A_1=PQ$,由归纳法,存在这样的 $P, Q$(且都可逆)。 - $\mathbf y^T=\mathbf m^TQ$,解出 $\mathbf m=(Q^T)^{-1}\mathbf y$。 - $\mathbf x=P\mathbf n$,解出 $\mathbf n=P^{-1}\mathbf x$。 - $a=\mathbf m^T\mathbf n+b$,解出 $b=a-\mathbf m^T\mathbf n$。 - 所以看出存在且唯一。【低秩分解】 - 结论:$A\in\mathbf M_{s\times n}, \mathrm{rank}(A)=r$,则 $A$ 可以写成:$A=\sum\limits_{i=1}^r\mathbf x_i\mathbf y_i^T$,其中 $\mathbf x_i\in\mathbb R^s, \mathbf y_i\in\mathbb R^n$。 - 证明:- 核心在于任取 $\mathrm{Col}(A)$ 的一组基,然后用这组基表示 $A$ 的列向量。- 取 $\mathrm{Col}(A)$ 的一个基 $\mathbf a_1, \mathbf a_2, \cdots, \mathbf a_r$,设 $A$ 的第 $j$ 列的向量为 $\mathbf c_j$,则 $\mathbf c_j$ 能由 $\mathbf a_1\sim\mathbf a_n$ 表出,记作 $\mathbf c_j=\sum\limits_{i=1}^rb_{ij}\mathbf a_i$。 - 提取所有系数 $b$,得到 $\mathbf b_i=\begin{pmatrix} b_{i1} & b_{i2} & \cdots & b_{in} \end{pmatrix}^T$。 - 证毕。 - 或者 $A=P\begin{pmatrix} I_r & 0 \\ 0 & 0 \end{pmatrix}Q$,将中间的 $\begin{pmatrix} I_r & 0 \\ 0 & 0 \end{pmatrix}$ 分解为 $r$ 个 $1$ 再与 $P, Q$ 相乘即可。【QR 分解】(**本质:Schmidt 正交化**) - 结论:任意的可逆 $n$ 阶矩阵 $A$,都可以唯一地分解为 $A=QR$ 使得 $Q$ 为正交矩阵,$R$ 为对角元素全为正的上三角矩阵。 - 证明:这本质上反映了 Schmidt 正交化这一构造过程得到的两个基之间的过渡矩阵是上三角矩阵。在这里,$R$ 是**过渡矩阵**,$Q$ 是 **Schmidt 之后得到的基**。- 回顾过度矩阵的性质:$(\beta_1, \beta_2, \cdots, \beta_n)=(\alpha_1, \alpha_2, \cdots, \alpha_n) S$。其中 $S$ 的第 $j$ 列为 $\beta_j$ 在 $\alpha$ 下的坐标。- 那么在 Schmidt 正交化的过程中,设矩阵 $A$ 的列向量为 $\mathbf a_1\sim\mathbf a_n$,经过 Schmidt 正交化得到的单位向量为 $\mathbf q_1\sim\mathbf q_n$,那么由构造过程,$\mathbf a_i$ 可以由 $\mathbf q_1\sim\mathbf q_i$ 表出,不依赖后面的 $\mathbf q_{i+1}\sim\mathbf q_n$,所以 $S$ 的第 $j$ 列中,后 $n-j+1$ 个位置为 $0$。也就是 $S$ 为上三角矩阵(此处写为 $R$)。- $Q=\begin{pmatrix} \mathbf q_1 & \mathbf q_2 & \cdots & \mathbf q_n \end{pmatrix}$,得证。【邻接矩阵】 - $A$ 为邻接矩阵,则 $A^m$ 表示任意走 $m$ 步的到达结果。【Kronecker 积】 - 定义:$A\in\mathbf M_{n\times n}, B\in\mathbf M_{m\times m}$,则 $A$ 与 $B$ 的 Kronecker 积 $A\otimes B=\begin{pmatrix} a_{11}B & a_{12}B & \cdots & a_{1n}B \\ a_{21}B & a_{22}B & \cdots & a_{2n}B \\ \vdots & \vdots & & \vdots \\ a_{n1}B & a_{n2}B & \cdots & a_{nn}B \end{pmatrix}$。 - 这肯定是后面要学的高深知识,但是怎么处理?参考 $A$ 与 $B$ 的原本信息,保持分块矩阵的结构,具体拆开研究是下策。 - 丘砖 P235。 - Hadamard 矩阵?\]

\begin{vmatrix} A & -B \ B & A \end{vmatrix}=\begin{vmatrix} A & -B \ B+{\text i}A & A-{\text i}B \end{vmatrix}=\begin{vmatrix} A+{\text i}B & -B \ 0 & A-{\text i}B \end{vmatrix}=|A+{\text i}B||A-{\text i}B|.

\[ 【Schur 补】 - $M=\begin{pmatrix} A & B \\ C & D \end{pmatrix}$,若 $D$ 可逆,则 $M\to\begin{pmatrix} A-BD^{-1}C & 0 \\ C & D \end{pmatrix}$。【线性代数证明题的三层运算方式】 - 微观层:拆解为具体元素的标量运算 $C(i; j)=\sum\limits A(i;k)B(k;j)$。- 配方 / 二次型,求特征向量,验证代数等式,范数 / 内积。- 这是最后的手段(往往很麻烦)。 - 宏观层:只涉及矩阵本身的运算性质。- 乘法、迹 $\mathrm{trace}$、转置、逆、行列式、特征值与特征向量。- 相抵关系、相似关系、合同关系、秩不等式。 - 中间层:分块矩阵。- 为降维 / 递推 / 归纳服务:归纳证明三角化、LU-分解。- 观察输入 / 输出空间的关系:如 $AX-XB=C$。- 处理秩的叠加以及相关构造:$M=\begin{pmatrix} A & 0 \\ N & B \end{pmatrix}$。【证明正交相似于对角矩阵 / 上三角矩阵的惯用手段】 - 证明:$A$ 的特征多项式在复数域中的根都是实数,则 $A$ 正交相似于上三角矩阵。- 归纳:假设 $n-1$ 的情况成立,考虑 $n$ 阶矩阵 $A$。取 $A$ 的一个特征值与一个模长为 $1$ 的特征向量 $\lambda_1, \mathbf x_1$。则 $A\mathbf x_1=\lambda\mathbf x_1$。将 $\mathbf x_1$ 扩充为一组正交基 $\mathbf x_1, \mathbf x_2, \cdots, \mathbf x_n$,令 $Q=\begin{pmatrix} \mathbf x_1 & \mathbf x_2 & \cdots & \mathbf x_n \end{pmatrix}$。- 则 $Q^TA\mathbf x_1=\lambda Q^T\mathbf x_1$。而 $Q^TQ=I$,所以 $Q^T\mathbf x_1=\boldsymbol\varepsilon_1$。所以 $Q^TA\mathbf x_1=\lambda\boldsymbol\varepsilon_1$。- 所以 $Q^TAQ=\begin{pmatrix} \lambda & \mathbf a^T \\ \mathbf 0 & B\end{pmatrix}$。- 归纳假设,存在正交矩阵 $P$ 使得 $P^TBP=R$,$R$ 为上三角矩阵。- 那么考虑 $M=\begin{pmatrix} 1 & 0 \\ 0 & P \end{pmatrix}$,则 $M^T\begin{pmatrix} \lambda & \mathbf a^T \\ \mathbf 0 & B \end{pmatrix}M=\begin{pmatrix} \lambda & \mathbf a^TP \\ \mathbf 0 & R \end{pmatrix}$。- 所以 $(QM)^TA(QM)$ 为上三角矩阵。证毕。- 核心在于,$A\sim\begin{pmatrix} \lambda & \mathbf a^T \\ 0 & B \end{pmatrix}$ 的简化。 - 几何版本证明:- 本质是在说存在一个**旗结构**(基)。我们考虑归纳,取 $A$ 的一个模长为 $1$ 的特征向量 $\mathbf v_1$ 与对应的特征值 $\lambda_1$,则 $A\mathbf v_1=\lambda_1\mathbf v_1$。考虑空间 $\mathrm{span}\{\mathbf v_1\}^\perp$,也就是 $\mathbf v_1$ 这个向量张成空间的正交补 $U$,根据归纳法,在 $U$ 中存在一个变换($n-1$ 阶矩阵)$\mathscr B$ 满足归纳的结论,那么假设在 $U$ 中存在一系列包含的子空间 $U_1, U_2, \cdots, U_{n-1}$ 满足 $\dim U_i=i$ 且它们前后包含,那么 $V_i=\mathrm{span}\{\mathbf v_1\} + U_{i-1}$,则 $V_i$ 也满足这样的结构,归纳成立。 - 丘砖 P293 例6。【三角化矩阵与旗】 - 本质上,上三角矩阵描述的是一个**旗**:一个矩阵 $A$ 在基 $\mathbf x_1\sim\mathbf x_n$ 的意义下是上三角的,当且仅当 $A\mathbf x_i\in\mathrm{span}\{\mathbf x_1, \mathbf x_2, \cdots, \mathbf x_i\}$ 对于 $i=1, 2, \cdots, n$ 恒成立。 - 关键:**相似关系不改变这种旗的结构**。 - 所以上述的怎么技巧“取一个特征值 $\lambda$ 与特征向量 $\mathbf x_1$”就是在固定第一个“旗”。【条件:$AB=BA$】 - 这个条件说的是,$A$ 与 $B$ 有相同的“轴”。但是大多数时候涉及 Jordan 块,所以最简单的情况就是可对角化 / 实对称矩阵。 - 无论如何都可以推出:假设 $A\mathbf x=\lambda\mathbf x$,则 $A(B\mathbf x)=BA\mathbf x=\lambda(B\mathbf x)$,说明 $B\mathbf x$ 与 $\mathbf x$ 一样,都是 $E_\lambda$ 中的特征向量,所以 $B$ 在 $E_\lambda$ 中作用时,满足 $\forall\mathbf x\in E_\lambda$,都有 $B\mathbf x\in E_\lambda$,也就是说不会映射出去。## III 专题:相似与特殊矩阵 相似是同一个线性变换 $\mathscr A$ 在不同基下的表示。而这个变换本身可能有一些“隐藏的结构”(例如低秩、三角化、对角化),只有选对了基,这些结构才会在矩阵中显现出来。这与过度矩阵之间有着本质上的联系。 - 通法是,若 $B$ 为目标的特殊矩阵,那么 $B=P^{-1}AP$ 中, $P$ 为 $\mathscr A$ 由 $\varepsilon\to\mathbf x$ 的过渡矩阵,其中 $P=\begin{pmatrix} \mathbf x_1 & \mathbf x_2 & \cdots & \mathbf x_n \end{pmatrix}$。$\mathbf x_i$ 具体的选取方法与 $B$ 是什么特殊结构有关。| $\mathscr A$ 的性质(或 $\mathscr A$ 在标准基下的矩阵 $A$ 的性质) | 选取怎样的基构造 $P$ 作为 $\varepsilon\to\mathbf x$ 的过度矩阵 | $\mathscr A$ 在新基下的矩阵 $B=P^{-1}AP$ 呈现出怎样的性质 | | ------------------------------------------------- | ------------------------------------------------------------------------------------------------ | -------------------------------------------------- | | $\mathrm{rank}(A)=r<n$ | $\mathbf x_1\sim\mathbf x_r\in\mathrm{Row}(A), \mathbf x_{r+1}\sim\mathbf x_n\in\mathrm{Nul}(A)$ | $B$ 的后 $n-r$ 列为零 | | $A$ 可对角化 | $\mathbf x_i$ 为第 $i$ 个特征向量 | $B$ 为对角矩阵 $\mathrm{diag}(\lambda_1\sim\lambda_n)$ | | $A$ 可三角化(特征值全部为实数) | $\mathbf x_1$ 取某一个特征向量,归纳子空间 $[\mathrm{span}\{\mathbf x_1\}]^\perp$ | $B$ 为上三角矩阵 | | $A$ 为幂等矩阵 | $\mathbf x$ 取各个特征子空间中的向量 | $B=\begin{pmatrix} I_r & 0 \\ 0 & 0 \end{pmatrix}$ | | $A$ 为对合矩阵 | | |## IV 专题:矩阵合同证明题 - 合同的本质是 $p, q$ 相同。运用矩阵相似与特殊矩阵的思想,可以找到 $n$ 两两正交的单位向量,使得这些向量都是特征向量,也就是谱定理 $Q^TAQ=\Lambda=\mathrm{diag}(\lambda_1, \lambda_2, \cdots, \lambda_n)$,其中 $Q$ 是 $\varepsilon\to\mathbf v$ 的过渡矩阵,$\mathbf v_i$ 为 $A$ 的第 $i$ 个特征向量。从变换的角度看,只有矩阵被写作 $\Lambda$ 时才能看出其本质。 - 站在二次型的角度,合同只区分 $\lambda_1\sim\lambda_n$ 的正、负、零元素的个数是否一致,也就是这个高维圆锥曲线是否拥有相同的形状。【矩阵合同与分块矩阵 | Schur 补结构】 - 若 $M=\begin{pmatrix} A & B \\ B^T & D \end{pmatrix}$ 为 $n$ 阶对称矩阵,且 $A$ 为 $r$ 阶可逆矩阵,则有 $\begin{pmatrix} I_r & 0 \\ -B^TA^{-1} & I_{n-r} \end{pmatrix}\begin{pmatrix} A & B \\ B^T & D \end{pmatrix}\begin{pmatrix} I_r & -A^{-1}B \\ 0 & I_{n-r} \end{pmatrix}=\begin{pmatrix} A & 0 \\ 0 & D-B^TAB \end{pmatrix}$,从而 $\begin{pmatrix} A & B \\ B^T & D \end{pmatrix}\cong\begin{pmatrix} A & 0 \\ 0 & D-B^TAB \end{pmatrix}$。- 若 $M$ 是正定的,且 $A$ 可逆,则 $A, D$ 与 $D-B^TAB$ **都是正定的**。 - 从而对分块矩阵做相同的初等行、列变换也能得到合同关系。 - 实对称矩阵 $a_{ii}$ 的性质。【小结论】 - $A, B$ 为实对称矩阵,且 $AB=BA$,则存在正交矩阵 $Q$ 使得 $Q^TAQ$ 与 $Q^TBQ$ 同时为对角矩阵。 - 本质:$A$ 与 $B$ 共用同一组特征方向。假设 $A\mathbf x=\lambda\mathbf x$,则 $A(B\mathbf x)BA\mathbf x=\lambda(B\mathbf x)$。也就是说 $\mathbf y=B\mathbf x$ 与 $\mathbf x$ 是属于同一个 $E_\lambda$ 的特征向量,所以 $B\mathbf x\in E_\lambda$,也就是在 $E_\lambda$ 内部,变换 $B$ 始终将映射保持在内部。 - 先按照 $A$ 的特征子空间来分类:将 $A$ 与 $B$ 同时按照 $A$ 对角化的方法操作,此时 $A$ 的特征子空间已经调整为 $\varepsilon$ 的若干组合,而因为 $B$ 一开始就是实对称矩阵,所以 $B$ 的所有操作都是放缩(无旋转和剪切),因此在每一个 $A$ 的特征子空间(已经标准化)中,可以随意按照 $B$ 的喜好切割。- 丘砖 P325 6.2.4【正定矩阵】 - 正定矩阵可以与任意的其他实对称矩阵同时对角化。- 若正定矩阵 $A$,半正定矩阵 $B$,则有 $|A+B|\ge|A|+|B|$,等号成立当且仅当 $B=0$。 - 正定矩阵的任意主子式都 $>0$。 - 正定矩阵的 Schur 补:$|D-B^TAB|\le|D|$。 - 结构 $D-B^TA^{-1}B$ 的正定型:若 $A$ 可逆则正定。【Cholesky 分解】 - 证明:任意一个正定矩阵 $A$ 都可以分解为 $A=C^TC$,其中 $C$ 为上三角矩阵,且这种分解唯一。 - 解法:归纳,假设对于 $n-1$ 阶的时候成立。写出分块矩阵 $C=\begin{pmatrix} \lambda & \mathbf x^T \\ 0 & M \end{pmatrix}$,则 $C^TC=\begin{pmatrix} \lambda^2 & \lambda\mathbf x^T \\ \lambda\mathbf x & \mathbf x\mathbf x^T+M^TM \end{pmatrix}=A=\begin{pmatrix} a_{11} & \alpha^T \\ \alpha & B \end{pmatrix}$。 - 则 $\lambda=\sqrt{a_{11}}$ 唯一确定,$\mathbf x=\dfrac1\lambda\alpha$ 也唯一确定。 - 还剩 $M^TM=B-\mathbf x\mathbf x^T$,其中 $M$ 为上三角。只需证明 $B-\mathbf x\mathbf x^T$ 是正定,那么归纳就成立。 - 这是一个 Schur 补的结构,结论 $\begin{pmatrix} \lambda^2 & \dfrac1\lambda\mathbf x^T \\ \dfrac1\lambda\mathbf x & B \end{pmatrix}\cong\begin{pmatrix} 1 & 0 \\ 0 & B-\mathbf x1\mathbf x^T \end{pmatrix}$,所以 $B-\mathbf x\mathbf x^T$ 是正定的。 - 证明完毕。 \]