Singular Value Decomposition SVD
A=U\Sigma V^{T}=u_{1}\sigma_{1}v_{1}^{T}+\cdots+u_{r}\sigma_{r}v_{r}^{T} \end{align}$$ The singular value theorem for A is the eigenvalue theorem for $A^{T}A$ and $AA^{T}$. The Singular Value Decomposition separate any matrix into simple pieces 如果 $A$ 为 rectangle 非方阵,那么 $A^{T}A$ $A A^{T}$ 为对称的[[对称矩阵\|正定矩阵]] Square Symmetric Positive-Semidefinite 奇异值分解的理论,本质上就是矩阵和矩阵转置乘积的[[特征值和特征向量\|特征值]]理论 特征值将任意一个矩阵分解为列和行的形式 一个Rectangle Matrix $A_{(m\times n)}$ 实际上为一个从维度 $n$ 到维度 $m$ 的线性变换 $$\begin{align} AA^{T}\mathbf{u}_{i}=\sigma_{i}^{2}\mathbf{u}_{i} \\ A^{T}A\mathbf{v}_{i}=\sigma_{i}^{2}\mathbf{v}_{i} \\ \end{align}$$ $A A^{T}=S_{L}$ 的特征向量 $v_{i}$ 称为 Left singular vectors, 在 $\mathbf{R}^{m}$ 空间中 $A^{T} A=S_{R}$ 的特征向量 $\mathbf{v}_{i}$ 称为 Right singular vectors, 在 $\mathbf{R}^{n}$ 空间中 $$\begin{align} A\mathbf{v}_{i}=\sigma_{i}\mathbf{u}_{i} \end{align}$$ - rotate 左奇异值向量 - stretch 奇异值 - dimension erase 降维 - rotate 右奇异值向量 $$\begin{align} AV=U\Sigma \end{align}$$ --- ## AI 结构化补充(2026-05-02) ### 定义 **Singular Value Decomposition** 奇异值分解把任意矩阵 $A\in\mathbb R^{m\times n}$ 写成A=U\Sigma V
其中 $U\in\mathbb R^{m\times m}$ 与 $V\in\mathbb R^{n\times n}$ 是正交矩阵,$\Sigma\in\mathbb R^{m\times n}$ 只在主对角线上有非负数\sigma_1\ge \sigma_2\ge\cdots\ge \sigma_r>0,
其余对角线位置和非对角线位置为 $0$。这里 $r=\operatorname{rank}(A)$,非零的 $\sigma_i$ 称为 [[奇异值\|奇异值]],$U$ 与 $V$ 的列向量称为 [[奇异向量\|奇异向量]]。 SVD 对 $A$ 没有方阵、可逆或可对角化要求。非零奇异值来自两个半正定矩阵的共同非零谱:\sigma_i=\sqrt{\lambda_i(A^TA)}=\sqrt{\lambda_i(AA^T)},\qquad i=1,\ldots,r.
A=U\Sigma V^*,\qquad U^*U=I_m,\quad V
奇异值仍是 $A^*A$ 与 $AA^*$ 的非零特征值平方根。 如果把 $V$ 看成输入空间 $\mathbb R^n$ 的正交坐标,把 $U$ 看成输出空间 $\mathbb R^m$ 的正交坐标,那么 SVD 说明:任何线性变换都可以分解为\text{输入端正交换基}\quad\longrightarrow\quad \text{沿坐标轴伸缩和降秩}\quad\longrightarrow\quad \text{输出端正交换基}.
这比普通特征向量分解适用范围更广。特征向量分解 $A=X\Lambda X^{-1}$ 有三个结构性限制:特征向量通常不正交;矩阵可能没有足够多的特征向量;等式 $Ax=\lambda x$ 只适合方阵。SVD 改用输入端的 $v_i$ 与输出端的 $u_i$ 两组正交基,因此可以处理非方阵、秩亏矩阵和不可对角化矩阵。 ### 存在性、唯一性与域 任意有限维实矩阵或复矩阵都存在 SVD。奇异值作为 $A^*A$ 的非负特征值平方根,由 $A$ 唯一决定;按降序排列后,序列\sigma_1\ge\cdots\ge\sigma_{\min(m,n)}\ge0
唯一。左右奇异向量不完全唯一:若 $\sigma_i$ 是单重正奇异值,则对应的 $u_i,v_i$ 在实数域中可同时改号,在复数域中可同时乘以同一单位相位;若奇异值重复,则对应奇异子空间内可以任取酉正交基。零奇异值对应的零空间与左零空间补基也不唯一。 完整 SVD 使用 $m$ 个左奇异向量和 $n$ 个右奇异向量;经济型 SVD 只保留非零奇异值对应的A=U_r\Sigma_rV_r
或只保留 $\min(m,n)$ 个必要方向。截断 SVD 再进一步保留前 $k$ 个最大奇异值,是低秩近似而不是精确分解。 ### 基向量形式 设U=\begin{bmatrix}u_1&\cdots&u_m\end{bmatrix},\qquad V=\begin{bmatrix}v_1&\cdots&v_n\end{bmatrix}.
Av_i=\sigma_i u_i,\qquad i=1,\ldots,r.
对于 $i>r$,$v_i$ 位于零空间中,所以 $Av_i=0$。按列合并可得 reduced SVDAV_r=U_r\Sigma_r,
其中 $V_r=[v_1,\ldots,v_r]$,$U_r=[u_1,\ldots,u_r]$,$\Sigma_r=\operatorname{diag}(\sigma_1,\ldots,\sigma_r)$。再加入零空间和左零空间方向,得到完整形式AV=U\Sigma,\qquad A=U\Sigma V
u_1,\ldots,u_r \text{ 是 } C(A) \text{ 的正交基},\qquad u_{r+1},\ldots,u_m \text{ 是 } N(A^T) \text{ 的正交基},
v_1,\ldots,v_r \text{ 是 } C(A^T) \text{ 的正交基},\qquad v_{r+1},\ldots,v_n \text{ 是 } N(A) \text{ 的正交基}.
因此 $A$ 在行空间到列空间的限制上是一个由 $\sigma_i$ 控制的对角伸缩,而零空间方向全部被送到 $0$。 几何上,SVD 把单位球面送成列空间中的椭球:{Ax:|x|_2=1}.
椭球的主轴方向是 $u_i$,半轴长度是 $\sigma_i$;若 $A$ 秩亏,则若干半轴长度为 $0$,单位球被压扁到低维子空间。这个解释也说明奇异值为什么总是非负长度,而不是带方向符号的特征值。 ### 秩一展开 将 $U\Sigma V^T$ 按列乘行展开,得到A=\sigma_1u_1v_1^T+\sigma_2u_2v_2^T+\cdots+\sigma_ru_rv_r
每一项 $\sigma_i u_i v_i^T$ 都是 rank-one 矩阵:它只检测输入中的 $v_i$ 分量,并把该分量送到输出方向 $u_i$。按照\sigma_1\ge\sigma_2\ge\cdots\ge\sigma_r>0
排序后,秩一项天然按重要性排列;最大项 $\sigma_1u_1v_1^T$ 表示 $A$ 中最强的输入-输出耦合方向。 ### 从对称矩阵构造 SVD 的构造来自两个对称半正定矩阵:A^TA=V\Sigma^T\Sigma V^T,\qquad AA^T=U\Sigma\Sigma^T U
因此 $v_i$ 是 $A^TA$ 的正交特征向量,$\sigma_i^2$ 是对应特征值。对所有 $\sigma_i>0$,左奇异向量由u_i=\frac{Av_i}{\sigma_i}
得到。 关键点是这些 $u_i$ 自动正交。若 $i\ne j$,则u_i^Tu_j =\left(\frac{Av_i}{\sigma_i}\right)^T \left(\frac{Av_j}{\sigma_j}\right) =\frac{v_i^TA^TAv_j}{\sigma_i\sigma_j} =\frac{\sigma_j^2}{\sigma_i\sigma_j}v_i^Tv_j =0.
这一步解释了 SVD 为什么能从 $A^TA$ 的正交特征向量稳定地产生 $A$ 的输出端正交基。最后用 $N(A)$ 的任意正交基补齐 $V$,用 $N(A^T)$ 的任意正交基补齐 $U$。 ### 重复特征值与正交基 SVD 依赖的谱分解需要处理重复特征值。设 $S=A^TA$ 为对称矩阵,先取一个单位特征向量 $q_1$,并把它补成正交矩阵Q_1=\begin{bmatrix}q_1&q_2&\cdots&q_n\end{bmatrix}.
由于 $Sq_1=\lambda_1q_1$,矩阵 $Q_1^TSQ_1$ 的第一列除首项外全为 $0$,可写成分块形式Q_1^TSQ_1= \begin{bmatrix} \lambda_1&w^T\ 0&S_{n-1} \end{bmatrix}.
但 $Q_1^TSQ_1$ 仍然对称,所以必须有 $w=0$,并且 $S_{n-1}$ 也是对称矩阵。于是问题被限制到 $q_1^\perp$ 中的一个低一维对称块;对这个块重复同样过程,就通过归纳得到一组正交特征向量。 如果 $\lambda_1$ 与后续特征值重复,这个分块归纳不会失效:重复特征值对应的是一个特征子空间,子空间内任意正交基都可以作为特征向量。对称性保证不同特征值的子空间彼此正交,重复块内部再用正交化或同样的分块归纳选出正交基。这正是 $A^TA$ 能为 SVD 提供正交右奇异向量的原因。 ### 与特征值分解的关系 SVD 与 $A=X\Lambda X^{-1}$ 一般不是同一件事。它们完全重合需要两个条件:X=U=V,\qquad \Lambda=\Sigma.
这要求 $A$ 有一组正交特征向量,而且特征值全为非负数。换言之,当且仅当 $A$ 是对称正半定矩阵时,谱分解A=Q\Lambda Q
可以直接看成 SVD。 若 $A$ 是对称但有负特征值,SVD 会把负号吸收到某一侧奇异向量中,奇异值仍是非负长度;若 $A$ 不是方阵或不可对角化,普通特征值分解甚至没有同等形式,而 SVD 仍存在。 若 $S$ 是对称正定矩阵,则谱分解与 SVD 合并:S=Q\Lambda Q^T,\qquad U=V=Q,\qquad \Sigma=\Lambda.
对称正半定矩阵也有同样读法,只是 $\Lambda$ 与 $\Sigma$ 中允许出现零。 ### 计算例子 对A=\begin{bmatrix}3&0\4&5\end{bmatrix},
A^TA=\begin{bmatrix}25&20\20&25\end{bmatrix},\qquad AA
\sigma_1^2=45,\qquad \sigma_2
\sigma_1=\sqrt{45},\qquad \sigma_2=\sqrt5.
$A^TA$ 的单位特征向量为v_1=\frac1{\sqrt2}\begin{bmatrix}1\1\end{bmatrix},\qquad v_2=\frac1{\sqrt2}\begin{bmatrix}-1\1\end{bmatrix}.
由 $u_i=Av_i/\sigma_i$ 得u_1=\frac1{\sqrt{10}}\begin{bmatrix}1\3\end{bmatrix},\qquad u_2=\frac1{\sqrt{10}}\begin{bmatrix}-3\1\end{bmatrix}.
U=\frac1{\sqrt{10}}\begin{bmatrix}1&-3\3&1\end{bmatrix},\qquad \Sigma=\begin{bmatrix}\sqrt{45}&0\0&\sqrt5\end{bmatrix},\qquad V=\frac1{\sqrt2}\begin{bmatrix}1&-1\1&1\end{bmatrix}.
这个例子展示了计算顺序:先在输入端求 $A^TA$ 的正交特征向量 $v_i$,再用 $Av_i=\sigma_i u_i$ 定出输出端的 $u_i$,最后得到 $A=U\Sigma V^T$。 把同一个例子按秩一项完全展开,可以看到 SVD 不只是给出 $U,\Sigma,V$,而是给出两个数值矩阵之和:\sigma_1u_1v_1^T =\frac{\sqrt{45}}{\sqrt{20}} \begin{bmatrix}1&1\3&3\end{bmatrix} =\frac32 \begin{bmatrix}1&1\3&3\end{bmatrix}
\begin{bmatrix} 1.5&1.5\ 4.5&4.5 \end{bmatrix},
\sigma_2u_2v_2^T =\frac{\sqrt5}{\sqrt{20}} \begin{bmatrix}3&-3\-1&1\end{bmatrix} =\frac12 \begin{bmatrix}3&-3\-1&1\end{bmatrix}
\begin{bmatrix} 1.5&-1.5\ -0.5&0.5 \end{bmatrix}.
\begin{bmatrix} 1.5&1.5\ 4.5&4.5 \end{bmatrix} + \begin{bmatrix} 1.5&-1.5\ -0.5&0.5 \end{bmatrix}
\begin{bmatrix}3&0\4&5\end{bmatrix}.
### 极端上移矩阵 考虑严格上移矩阵A=\begin{bmatrix} 0&1&0&0\ 0&0&2&0\ 0&0&0&3\ 0&0&0&0 \end{bmatrix}.
它是严格三角矩阵,所有特征值都是 $0$。但是A^TA=\operatorname{diag}(0,1,4,9),\qquad AA
3,\ 2,\ 1.
SVD 会按 $3,2,1$ 的强弱顺序排列对应的 $u_i$ 与 $v_i$;第一项 $\sigma_1u_1v_1^T$ 正好取出矩阵中最大的条目 $3$。如果删除最后一行得到 $3\times4$ 矩阵,奇异值仍为 $3,2,1$,只是 $\Sigma$ 的形状变为 $3\times4$,这体现了 SVD 对矩形矩阵的适配性。 矩形 data matrix 的行和列常常代表不同对象。课程成绩矩阵可以让每一行表示一门课程、每一列表示一个学生,$a_{ij}$ 是成绩;此时 $\sigma_1u_1v_1^T$ 把一个 combination course $u_1$ 与一个 combination student $v_1$ 配对,$\sigma_1$ 是这对组合上的主导成绩强度。期刊关键词矩阵也类似:行是 key words,列是 articles,$a_{ij}$ 是某词在某文中的频率;最大的秩一项描述 hyperword $u_1$ 与 hyperarticle $v_1$ 之间最强的频率模式。 若把左下角条目从 $0$ 改成\frac1{60000},
特征值会从四个 $0$ 跳到半径为 $1/10$ 的四个点\frac1{10},\quad \frac{i}{10},\quad -\frac1{10},\quad -\frac{i}{10}.
3,\ 2,\ 1,\ \frac1{60000}.
这个例子说明:非正规矩阵的特征值可能对很小扰动极端敏感,而奇异值作为长度伸缩量更稳定。 ### 变分刻画与计算 令 $S=A^TA$。对称矩阵的最大特征值由 Rayleigh quotient 给出:\lambda_1(S)=\max_{x\ne0}\frac{x^TSx}{x
\frac{|Ax|^2}{|x|^2} =\frac{x^TA^TAx}{x
\sigma_1=\max_{x\ne0}\frac{|Ax|}{|x|}.
取得最大值的输入方向是 $v_1$,并且 $Av_1=\sigma_1u_1$。进一步限制 $x\perp v_1,\ldots,v_{k-1}$ 可逐个得到后续 $\sigma_k$。 因为|Ax|\le \sigma_1|x|,
若 $x$ 是方阵 $A$ 的特征向量,则|\lambda||x|=|Ax|\le\sigma_1|x|,
\sigma_1\ge |\lambda|_{\max}.
正交变换不改变奇异值。若 $Q_1,Q_2$ 为正交矩阵,则(Q_1^TAQ_2)^T(Q_1^TAQ_2)=Q_2^TA
它与 $A^TA$ 有相同特征值,因此 $Q_1^TAQ_2$ 与 $A$ 有相同奇异值。数值算法正是利用这一点:先用正交变换把一般矩阵化为 bidiagonal 矩阵;相应地,对称特征值问题会化为 tridiagonal 矩阵,因为(\text{bidiagonal})
是 tridiagonal。后续迭代再在不改变奇异值或特征值的前提下逼近对角形式。 ### 相邻概念 - [[奇异值\|奇异值]]:SVD 中的非负伸缩量,平方为 $A^TA$ 和 $AA^T$ 的共同非零特征值。 - [[奇异向量\|奇异向量]]:输入端的 $v_i$ 与输出端的 $u_i$,满足 $Av_i=\sigma_i u_i$。 - [[四个基本子空间\|四个基本子空间]]:SVD 为列空间、左零空间、行空间、零空间同时选择正交基。 - [[低秩近似\|低秩近似]]:截断小奇异值后的秩一展开。 - [[伪逆\|伪逆]]:在 SVD 中把非零奇异值取倒数并转置输入输出方向。 - [[极分解\|极分解]]:把同一线性变换写成正半定伸缩与正交变换的乘积。