Covariance Matrix
一、基本定义
二维随机变量 的 4 个二阶中心矩排成矩阵的形式:
C= \begin{pmatrix} c_{11} & c_{12} \\ c_{21} & c_{22} \end{pmatrix} \quad {\color{red}\Leftrightarrow} \quad \begin{cases} c_{11} =E\left\{[X_{1}-E(X_{1})]^{2} \right\} \\ c_{22} =E\left\{[X_{2}-E(X_{2})]^{2} \right\} \\ c_{12} =E\left\{[X_{1}-E(X_{1})][X_{2}-E(X_{2})] \right\} \\ c_{21} =E\left\{[X_{2}-E(X_{2})][X_{1}-E(X_{1})] \right\} \end{cases} \end{align}$$ $n$ 维随机变量 $(X_{1},X_{2},\cdots X_{n})$ 的**协方差矩阵**: $$\begin{align} C=\begin{pmatrix} c_{11} & c_{12} & \cdots & c_{1n} \\ c_{21} & c_{22} & \cdots & c_{2n} \\ \vdots & \vdots & & \vdots \\ c_{n1} & c_{n2} & \cdots & c_{nn} \end{pmatrix} \end{align}$$ $$\begin{align} c_{ij}&=Cov(X_{i},X_{j}) =E\left\{[X_{i}-E(X_{i})][X_{j}-E(X_{j})] \right\} \quad(i,j=1,2,\cdots,n) \end{align}$$ 重要应用:研究[[多维正态分布\|多维正态分布]] ### 二、计算机的实现 >[!note] 注意 > > 以三个变量举例,可以扩展为 n 个变量的计算 矩阵计算, 过渡矩阵 $a$ $$\begin{align} a&=\begin{bmatrix} x_{1}& y_{1}& z_{1} \\ x_{2}& y_{2}& z_{2} \\ x_{3}& y_{3}& z_{3} \end{bmatrix}- \dfrac{1}{3}\begin{bmatrix} 1&1&1 \\ 1&1&1 \\ 1&1&1 \end{bmatrix}\begin{bmatrix} x_{1}& y_{1}& z_{1} \\ x_{2}& y_{2}& z_{2} \\ x_{3}& y_{3}& z_{3} \end{bmatrix} \\ \end{align}$$ 则协方差矩阵 $p$ 为: $$\begin{align} p= \dfrac{1}{3} a^{T}a \end{align}$$ ### 半正定性与协方差传播 $M$ 个随机变量组成随机向量X=(X_1,\ldots,X_M)^T,\qquad \bar X=E(X),
V=E[(X-\bar X)(X-\bar X)
矩阵第 $(i,j)$ 个条目就是 $Cov(X_i,X_j)$,对角线是各变量方差,非对角线是变量之间的协方差。若随机向量只有离散取值 $X_k$,联合概率为 $p_k$,记 $U_k=X_k-\bar X$,则V=\sum_k p_kU_kU_k
V=\sum_i\sum_j p_{ij} \begin{bmatrix} x_i-m_1\ y_j-m_2 \end{bmatrix} \begin{bmatrix} x_i-m_1 & y_j-m_2 \end{bmatrix}.
这说明 $V$ 是一批秩一矩阵 $UU^T$ 的非负加权和。每个 $UU^T$ 都是半正定矩阵,所以 $V$ 半正定。 同一事实也可以由任意线性组合的方差证明:\begin{align} c^TVc &=E\left[c^T(X-\bar X)(X-\bar X)^Tc\right]\ &=E\left[(c^TX-c^T\bar X)^2\right]\ &=Var(c^TX)\ge0. \end{align}
V=Q\Lambda Q^T,\qquad \lambda_i\ge0.
若某个 $\lambda_i=0$,则存在非零向量 $q_i$ 使 $q_i^TX$ 没有方差,表示变量之间存在确定的线性约束;这时 $V$ 奇异。例如两个同面粘在一起的公平硬币有V=\begin{bmatrix} \frac14 & \frac14\ \frac14 & \frac14 \end{bmatrix}, \qquad \det V=0.
Z=AX+b,
常数平移 $b$ 只改变均值,不改变协方差,协方差传播为V_Z=AV_XA
当 $A=\begin{bmatrix}1&1\end{bmatrix}$ 时,$Z=x+y$,于是Var(x+y)= \begin{bmatrix}1&1\end{bmatrix} \begin{bmatrix} \sigma_x^2 & \sigma_{xy}\ \sigma_{xy} & \sigma_y^2 \end{bmatrix} \begin{bmatrix}1\1\end{bmatrix} =\sigma_x^2+\sigma_y
A=\begin{bmatrix}1&-1\end{bmatrix},
V_Z= \begin{bmatrix}1&-1\end{bmatrix} \begin{bmatrix} \sigma_1^2 & \sigma_{12}\ \sigma_{12} & \sigma_2^2 \end{bmatrix} \begin{bmatrix}1\-1\end{bmatrix} =\sigma_1^2-2\sigma_{12}+\sigma_2
若两处误差有共同来源,$\sigma_{12}>0$,差分会减小剩余方差。这是后续[[多维正态分布\|多维正态分布]]、加权最小二乘和卡尔曼滤波中协方差传播的核心公式。 ### 样本协方差矩阵与 PCA 总体协方差矩阵描述随机向量的理论二阶结构;有限数据中通常先形成[[数据矩阵\|数据矩阵]],再计算[[样本协方差矩阵\|样本协方差矩阵]]。若A_0\in\mathbb{R}^{m\times n}
包含 $n$ 个样本和 $m$ 个测量变量,并按行减去样本均值得到中心化矩阵 $A$,则S=\frac{AA
$S$ 的对角元是各变量的样本方差,非对角元是变量之间的样本协方差;分母 $n-1$ 表示均值估计消耗了一个自由度。 在[[主成分分析\|主成分分析]]中,$S$ 的特征向量给出数据点云的主方向:Su_i=\sigma_i
如果把 $S$ 的特征值写成 $\sigma_i^2$,总方差就是T=\sigma_1^2+\cdots+\sigma_m
\frac{\sigma_i
当变量单位或尺度差异会扭曲主方向时,可用正对角矩阵 $D$ 做重标,转为[[相关矩阵\|相关矩阵]]C=DSD=\frac{DAA
此时对角线全为 $1$。