5.1.1 主成分分析法
主成分分析(principal component analysis,PCA)是一种统计方法。通过正交变换将一组可能存在相关性的变量转换为一组线性不相关的变量,转换后的这组变量称为主成分。
主成分分析是设法将原来众多具有一定相关性的指标重新组合成一组新的互相无关的综合指标来代替原来的指标。研究如何通过少数几个主成分来揭示多个变量间的内部结构,即从原始变量中导出少数几个主成分,使它们尽可能多地保留原始变量的信息,且彼此间互不相关。通常数学上的处理就是将原来多个指标作线性组合,作为新的综合指标。
假设在实际问题中,有m个样本,每个样本p个指标,我们把这p个指标看作p个随机变量,记为X 1,X 2,…,X p,主成分分析就是要把这p个指标的问题,转变为讨论p个指标的线性组合的问题,而这些新的指标F 1,F 2,…,F k(k≤p),按照保留主要信息量的原则充分反映原指标的信息,并且相互独立。这种由讨论多个指标降为少数几个综合指标的过程在数学上就称为降维。主成分分析通常的做法是,寻求原指标的线性组合Fi。

且满足以下几个条件:
(1)每个主成分的系数平方和为1。即
![]()
(2)主成分之间相互独立,即无重叠的信息。即
![]()
(3)主成分的方差依次递减,重要性依次递减,即
![]()
为了方便,我们在二维空间中讨论主成分的几何意义。设有n个样品,每个样品有两个观测变量X 1和X 2,在由变量X 1和X 2所确定的二维平面中,n个样本点所散布的情况如椭圆状,如图5.6所示。

图5.6 样本散布图
由图5.6可以看出这n个样本点无论是沿着X 1轴方向或X 2轴方向都具有较大的离散性,其离散的程度可以分别用观测变量X 1的方差和X 2的方差定量地表示。显然,如果只考虑X 1和X 2中的任何一个,那么包含在原始数据中的经济信息将会有较大的损失。
如果我们将X 1轴和X 2轴先平移,再同时按逆时针方向旋转θ角度,得到新坐标轴F 1和F 2。F 1和F 2是两个新变量,如图5.7所示。

图5.7 坐标轴变换
根据旋转变换的公式:
(https://www.daowen.com)
U'为旋转变换矩阵,它是正交矩阵,即有U'=U-1,U'U=I。
旋转变换的目的是使得n个样品点在F 1轴方向上的离散程度最大,即F 1的方差最大。变量F 1代表了原始数据的绝大部分信息,在研究某经济问题时,即使不考虑变量F 2也无损大局。经过上述旋转变换,原始数据的大部分信息集中到F 1轴上,对数据中包含的信息起到了浓缩作用,如图5.8所示。

图5.8 旋转坐标轴
F 1,F 2除可以对包含在X 1,X 2中的信息起浓缩作用外,还具有不相关的性质,这就使得在研究复杂的问题时避免了信息重叠带来的虚假性。二维平面上的个点的方差大部分都归结在F 1轴上,而F 2轴上的方差很小。F 1和F 2称为原始变量X 1和X 2的综合变量。F简化了系统结构,抓住了主要矛盾。
在实际问题中,X的协方差通常是未知的,样品有:
![]()
其协方差矩阵为:

基于协方差矩阵的主成分分析的计算步骤为

(2)求出分别所对应的特征向量U 1,U 2,…,U p,U i=(u 1i,u 2i,…,u pi)。
(3)计算累积贡献率,给出恰当的主成分个数
![]()
(4)计算所选出的k个主成分的得分。将原始数据的中心化值
![]()
代入前k个主成分的表达式,分别计算出各单位k个主成分的得分,并按得分值的大小排序。

高维数据变换MDS方法