Covariance Matrix

多维随机向量的协方差构成的对称矩阵,用来描述一组变量的联合分布中的元素之间的线性关系

一、基本定义

二维随机变量 的 4 个二阶中心矩排成矩阵的形式:

C= \begin{pmatrix} c_{11} & c_{12} \\ c_{21} & c_{22} \end{pmatrix} \quad {\color{red}\Leftrightarrow} \quad \begin{cases} c_{11} =E\left\{[X_{1}-E(X_{1})]^{2} \right\} \\ c_{22} =E\left\{[X_{2}-E(X_{2})]^{2} \right\} \\ c_{12} =E\left\{[X_{1}-E(X_{1})][X_{2}-E(X_{2})] \right\} \\ c_{21} =E\left\{[X_{2}-E(X_{2})][X_{1}-E(X_{1})] \right\} \end{cases} \end{align}$$ $n$ 维随机变量 $(X_{1},X_{2},\cdots X_{n})$ 的**协方差矩阵**: $$\begin{align} C=\begin{pmatrix} c_{11} & c_{12} & \cdots & c_{1n} \\ c_{21} & c_{22} & \cdots & c_{2n} \\ \vdots & \vdots & & \vdots \\ c_{n1} & c_{n2} & \cdots & c_{nn} \end{pmatrix} \end{align}$$ $$\begin{align} c_{ij}&=Cov(X_{i},X_{j}) =E\left\{[X_{i}-E(X_{i})][X_{j}-E(X_{j})] \right\} \quad(i,j=1,2,\cdots,n) \end{align}$$ 重要应用:研究[[多维正态分布\|多维正态分布]] ### 二、计算机的实现 >[!note] 注意 > > 以三个变量举例,可以扩展为 n 个变量的计算 矩阵计算, 过渡矩阵 $a$ $$\begin{align} a&=\begin{bmatrix} x_{1}& y_{1}& z_{1} \\ x_{2}& y_{2}& z_{2} \\ x_{3}& y_{3}& z_{3} \end{bmatrix}- \dfrac{1}{3}\begin{bmatrix} 1&1&1 \\ 1&1&1 \\ 1&1&1 \end{bmatrix}\begin{bmatrix} x_{1}& y_{1}& z_{1} \\ x_{2}& y_{2}& z_{2} \\ x_{3}& y_{3}& z_{3} \end{bmatrix} \\ \end{align}$$ 则协方差矩阵 $p$ 为: $$\begin{align} p= \dfrac{1}{3} a^{T}a \end{align}$$ ### 半正定性与协方差传播 $M$ 个随机变量组成随机向量

X=(X_1,\ldots,X_M)^T,\qquad \bar X=E(X),

V=E[(X-\bar X)(X-\bar X)

矩阵第 $(i,j)$ 个条目就是 $Cov(X_i,X_j)$,对角线是各变量方差,非对角线是变量之间的协方差。若随机向量只有离散取值 $X_k$,联合概率为 $p_k$,记 $U_k=X_k-\bar X$,则

V=\sum_k p_kU_kU_k

V=\sum_i\sum_j p_{ij} \begin{bmatrix} x_i-m_1\ y_j-m_2 \end{bmatrix} \begin{bmatrix} x_i-m_1 & y_j-m_2 \end{bmatrix}.

这说明 $V$ 是一批秩一矩阵 $UU^T$ 的非负加权和。每个 $UU^T$ 都是半正定矩阵,所以 $V$ 半正定。 同一事实也可以由任意线性组合的方差证明:

\begin{align} c^TVc &=E\left[c^T(X-\bar X)(X-\bar X)^Tc\right]\ &=E\left[(c^TX-c^T\bar X)^2\right]\ &=Var(c^TX)\ge0. \end{align}

V=Q\Lambda Q^T,\qquad \lambda_i\ge0.

若某个 $\lambda_i=0$,则存在非零向量 $q_i$ 使 $q_i^TX$ 没有方差,表示变量之间存在确定的线性约束;这时 $V$ 奇异。例如两个同面粘在一起的公平硬币有

V=\begin{bmatrix} \frac14 & \frac14\ \frac14 & \frac14 \end{bmatrix}, \qquad \det V=0.

Z=AX+b,

常数平移 $b$ 只改变均值,不改变协方差,协方差传播为

V_Z=AV_XA

当 $A=\begin{bmatrix}1&1\end{bmatrix}$ 时,$Z=x+y$,于是

Var(x+y)= \begin{bmatrix}1&1\end{bmatrix} \begin{bmatrix} \sigma_x^2 & \sigma_{xy}\ \sigma_{xy} & \sigma_y^2 \end{bmatrix} \begin{bmatrix}1\1\end{bmatrix} =\sigma_x^2+\sigma_y

A=\begin{bmatrix}1&-1\end{bmatrix},

V_Z= \begin{bmatrix}1&-1\end{bmatrix} \begin{bmatrix} \sigma_1^2 & \sigma_{12}\ \sigma_{12} & \sigma_2^2 \end{bmatrix} \begin{bmatrix}1\-1\end{bmatrix} =\sigma_1^2-2\sigma_{12}+\sigma_2

若两处误差有共同来源,$\sigma_{12}>0$,差分会减小剩余方差。这是后续[[多维正态分布\|多维正态分布]]、加权最小二乘和卡尔曼滤波中协方差传播的核心公式。 ### 样本协方差矩阵与 PCA 总体协方差矩阵描述随机向量的理论二阶结构;有限数据中通常先形成[[数据矩阵\|数据矩阵]],再计算[[样本协方差矩阵\|样本协方差矩阵]]。若

A_0\in\mathbb{R}^{m\times n}

包含 $n$ 个样本和 $m$ 个测量变量,并按行减去样本均值得到中心化矩阵 $A$,则

S=\frac{AA

$S$ 的对角元是各变量的样本方差,非对角元是变量之间的样本协方差;分母 $n-1$ 表示均值估计消耗了一个自由度。 在[[主成分分析\|主成分分析]]中,$S$ 的特征向量给出数据点云的主方向:

Su_i=\sigma_i

如果把 $S$ 的特征值写成 $\sigma_i^2$,总方差就是

T=\sigma_1^2+\cdots+\sigma_m

\frac{\sigma_i

当变量单位或尺度差异会扭曲主方向时,可用正对角矩阵 $D$ 做重标,转为[[相关矩阵\|相关矩阵]]

C=DSD=\frac{DAA

此时对角线全为 $1$。