投影矩阵 , 作用与向量 产生向量的投影
将向量投影到 z 轴上 将向量投影到 xy 平面上
投影到直线上
将向量 投影到 上,投影为
误差向量 记
投影向量:
\mathbf{p}&=\hat{\mathbf{x}}\mathbf{a}=\dfrac{\mathbf{a}^{T}\cdot \mathbf{b}}{\mathbf{a}^{T}\cdot \mathbf{a}}\mathbf{a} \\ \end{align}$$ **投影矩阵**: $$\begin{align} P=\dfrac{\mathbf{a} \mathbf{a}^{T} }{\mathbf{a}^{T}\mathbf{a}} \end{align}$$ **特殊性质**:幂等 - $P^{2}=P$ - $P^{n}=P$ 几何上的直观理解: 一个向量投影的投影,还是投影向量 因为一个向量经过投影矩阵作用得到投影向量后,再投影不会发生任何变化 ### 投影到子空间上 寻找线性组合使得与原向量的距离最小(误差最小) $A^{T}(\mathbf{b}-A \hat{\mathbf{x}})=\mathbf{0}\Rightarrow A^{T}A \hat{\mathbf{x}}=A^{T}\mathbf{b}$ **参数估计向量**: $$\hat{\mathbf{x}}=(A^{T}A)^{-1}A^{T}\mathbf{b}$$ **预测值向量/投影向量**: $$\mathbf{p}=A \hat{\mathbf{x}}=A(A^{T}A)^{-1}A^{T}\mathbf{b}$$ 将 $\mathbf{b}$ 投影到 $A$ 的列空间中 **投影矩阵**: $$P=A(A^{T}A)^{-1}A^{T}$$ [[最小二乘法\|最小二乘法]] --- ## AI 结构化补充(2026-05-02) ### 定义与直线公式 **Vector Projection** 向量投影是在给定方向或子空间中取出一个向量的“可解释分量”。在直线情形中,给定非零向量 $a\in\mathbb{R}^m$ 和任意向量 $b$,把 $b$ 投影到 $\operatorname{span}(a)$ 上,就是寻找这条直线上离 $b$ 最近的点 $p$。 因为 $p$ 位于 $\operatorname{span}(a)$,必可写成p=\hat x a.
e=b-p=b-\hat x a.
投影的决定性条件是误差与方向 $a$ 正交:a^T(b-\hat x a)=0.
a^Tb-\hat x,a
\hat x=\frac{a^Tb}{a
p=a\frac{a^Tb}{a^Ta} =\frac{a^Tb}{a
这里 $a^Ta=\|a\|^2>0$ 是必要边界条件;若 $a=0$,直线方向不存在,投影公式也没有意义。 同一公式用点积写为\operatorname{proj}_a b=\frac{a\cdot b}{a\cdot a}a.
缩放方向向量不会改变投影:用 $ka$ 代替 $a$ 时,分子和分母中的 $k$ 会抵消,目标直线仍是同一条直线。 直线投影的计算顺序很固定:先由a^T(b-\hat x a)=0
求出 $\hat x$,再写出 $p=\hat x a$,最后把 $p$ 写成 $Pb$ 以读出投影矩阵。这个顺序会原样推广到列空间投影:先找最佳系数,再找投影向量,最后找产生投影的矩阵。 ### 正交误差与最近点 向量投影不是把 $b$ “压短”到 $a$ 上,而是把 $b$ 分解为b=p+e,\qquad p\in\operatorname{span}(a),\quad e\perp a.
a^Te=a^T\left(b-a\frac{a^Tb}{a^Ta}\right) =a^Tb-a^Ta\frac{a^Tb}{a
这个正交条件同时给出最近点性质。任取直线上的另一点 $y=ta$,因为 $p-y\in\operatorname{span}(a)$ 且 $e\perp\operatorname{span}(a)$,b-y=e+(p-y),
|b-y|^2=|e|^2+|p-y|^2\ge |e|
等号只在 $y=p$ 时成立,因此 $p$ 是直线上离 $b$ 最近的唯一点。这就是[[投影定理\|投影定理]]在线投影中的最小距离形式。 两个边界情形很常用:若 $b$ 已经平行于 $a$,则 $p=b$、$e=0$;若 $b\perp a$,则 $a^Tb=0$,所以 $p=0$、$e=b$。 例如取a=\begin{bmatrix}1\2\2\end{bmatrix},\qquad b=\begin{bmatrix}1\1\1\end{bmatrix}.
有 $a^Tb=5$、$a^Ta=9$,所以p=\frac59a =\begin{bmatrix}5/9\10/9\10/9\end{bmatrix}, \qquad e=b-p =\begin{bmatrix}4/9\-1/9\-1/9\end{bmatrix}.
也就是 $p=(5/9,10/9,10/9)^T$。 检查误差:a
### 直线投影矩阵 直线投影也可以写成矩阵乘法。由p=a\frac{a^Tb}{a
可把乘在 $b$ 前面的矩阵读出为P=\frac{aa^T}{a
p=Pb.
这是投影到 $\operatorname{span}(a)$ 的秩一[[投影矩阵\|投影矩阵]]。它满足P^2=P,\qquad P
$P^2=P$ 表示投影一次后已经落在目标直线上,再投影不会改变结果;$P^T=P$ 表示这是[[正交投影\|正交投影]],误差方向正好落在 $\operatorname{span}(a)^\perp$。 对上面的 $a=(1,2,2)^T$,P=\frac19 \begin{bmatrix} 1&2&2\ 2&4&4\ 2&4&4 \end{bmatrix}.
这个矩阵的每一列都是 $a$ 的倍数,因此C(P)=\operatorname{span}(a),\qquad \operatorname{rank}P=1.
对 $b=(1,1,1)^T$,矩阵乘法给出Pb=\frac19 \begin{bmatrix} 1&2&2\ 2&4&4\ 2&4&4 \end{bmatrix} \begin{bmatrix}1\1\1\end{bmatrix} =\begin{bmatrix}5/9\10/9\10/9\end{bmatrix}=p.
它把任意 $b$ 送到这条直线上,而 $I-P$ 把 $b$ 送到垂直于 $a$ 的平面:(I-P)b=b-Pb=e.
### 从直线到列空间 线投影是子空间投影的 $1$ 维特例。若矩阵A=[a_1\ \cdots\ a_n]\in\mathbb{R}^{m\times n}
的列向量张成目标子空间 $C(A)$,则投影点写成p=A\hat x.
e=b-A\hat x.
正交投影要求误差垂直于 $C(A)$ 中的每个方向,等价于误差垂直于 $A$ 的每一列:A^T(b-A\hat x)=0.
A^TA\hat x=A
这里 $A^TA$ 是 $n\times n$ 对称矩阵。若 $A$ 的列线性无关,则N(A
所以 $A^TA$ 可逆,最优系数为\hat x=(A^TA)^{-1}A
p=A\hat x=A(A^TA)^{-1}A
当 $n=1$ 且 $A=a$ 时,这些公式退化回p=a\frac{a^Tb}{a
A= \begin{bmatrix} 1&0\ 1&1\ 1&2 \end{bmatrix}, \qquad b= \begin{bmatrix} 6\0\0 \end{bmatrix}
中的 $b$ 投影到 $C(A)$。有A^TA= \begin{bmatrix} 3&3\ 3&5 \end{bmatrix}, \qquad A^Tb= \begin{bmatrix} 6\0 \end{bmatrix}.
\hat x= \begin{bmatrix} 5\-3 \end{bmatrix}, \qquad p=A\hat x= \begin{bmatrix} 5\2\-1 \end{bmatrix}, \qquad e=b-p= \begin{bmatrix} 1\-2\1 \end{bmatrix}.
\begin{bmatrix}1\1\1\end{bmatrix}^Te=1-2+1=0,\qquad \begin{bmatrix}0\1\2\end{bmatrix}
### 与最小二乘的关系 投影到列空间就是求解最近点问题\min_x|b-Ax|
最优点 $A\hat x$ 的残差e=b-A\hat x
A
即 $e\in C(A)^\perp=N(A^T)$。在线性回归中,$A\hat x$ 是预测向量,$e$ 是残差向量;残差与设计矩阵每一列正交,说明沿已有特征方向继续微调不会降低平方误差。 若 $A$ 的列不独立,$A^TA$ 不可逆,公式 $A(A^TA)^{-1}A^T$ 不能直接使用;此时应先取 $C(A)$ 的一组基,或用 QR、SVD 等方式得到同一列空间的标准正交基。投影依赖的是目标子空间,而不是某组可能冗余的生成向量。 也不能在一般矩形矩阵上把 $(A^TA)^{-1}$ 拆成 $A^{-1}(A^T)^{-1}$。多数列空间投影问题中的 $A$ 是 $m\times n$ 矩形矩阵,$A^{-1}$ 根本不存在;只有当 $A$ 方阵且可逆时,目标列空间已经是整个 $\mathbb{R}^m$,此时投影矩阵才退化为 $I$。 [[正交误差\|正交误差]]把“最近点”条件写成误差正交,投影矩阵把同一个几何操作写成线性算子,[[最小二乘法\|最小二乘法]]则把列空间投影用于不可精确求解的线性方程组。