0 R% F2 }2 j6 B& ]8 U2 o假如要求所取特征值反映的信息量占总体信息量的90%以上,则从累计特征值所占百分比看,只需取前两项即可。也就是说,只需取两个主要因子。对应于前两列特征值的特征向量,可求的其因子载荷矩阵A为:+ O( ^ l: p" _ i9 A1 X
+ ?0 R H- u+ V7 K
于是,该问题的因子模型为:. Y4 \7 v1 x ^# D `7 Z+ R [
3 }2 o1 g$ k+ t6 P5 f2 ~# q! f3 p因子分析:由以上可以看出,两个因子中,f1是全面反映生产、技术、交通和环境的因子,而f2却不同,它反映了对生产和技术这两项增长有利,而对交通和环境增长不利的因子。也就是说,按照原有统计资料得出的相关矩阵分析的结果是如果生产和技术都随f2增长了,将有可能出现交通紧张和环境恶化的问题,f2反映了这两方面的相互制约状况。' W- e) q' T9 M7 O5 B9 s* A' x6 k8 E
Python编程应用示例见:因子分析(KMO检验和Bartlett’s球形检验)6 h' Z! `, W+ i
( F _% e/ X) j; M) O# I5 d
三、主成分分析(PCA)与因子分析(FA)的联系与区别 1 Q9 W& ?2 t9 ~% K: D& h主成分分析(PCA)是一种数据降维技巧,它能将大量相关变量转化为一组很少的不相关变量,这些无关变量称为主成分。探索性因子分析(EFA)是一系列用来发现一组变量的潜在结构的方法。它通过寻找一组更小的、潜在的或隐藏的结构来解释已观测到的、显式的变量间的关系。 3 |. K# f! W' {! A$ p ; P$ x; x# j6 |& ^主成分(PC1和PC2)是观测变量(X1到X5)的线性组合。形成线性组合的权重都是通过最大化各主成分所解释的方差来获得,同时还要保证个主成分间不相关。相反,因子(F1和F2)被当做是观测变量的结构基础或“原因”,而不是它们的线性组合。代表观测变量方差的误差(e1到e5)无法用因子来解释。图中的圆圈表示因子和误差无法直接观测,但是可通过变量间的相互关系推导得到。 / B* Z- {6 c, w- N( @1 S # P3 ?0 W( @2 X7 [8 O两者之间的区别与联系,具体而言有如下几种: ( z ?; d; g# o' \ 4 N7 P: }5 b+ }% S联系:4 ~4 U! ~; m/ } K4 s. _
1. PCA和因子分析都是数据降维的重要方法,都对原始数据进行标准化处理,都消除了原始指标的相关性对综合评价所造成的信息重复的影响,都属于因素分析法,都基于统计分析方法; 0 _' S9 p; r% S! d! b8 v. Z 2. 二者均应用于高斯分布的数据,非高斯分布的数据采用ICA算法; - V5 }& Y8 Q" b+ I, R8 | 3. 二者构造综合评价时所涉及的权数具有客观性,在原始信息损失不大的前提下,减少了后期数据挖掘和分析的工作量。$ T! M& F/ k+ j& N& { |
" P3 k2 ~" o, i( }/ T8 d# t5 l
区别: - ]) K9 H. G1 K I 1. 原理不同; PCA的基本原理是利用降维(线性变换)的思想,在损失很少信息的前提下把多个指标转化为几个不相关的主成分,每个主成分都是原始变量的线性组合;' K$ W) ^! U- s" G
而FA基本原理是从原始变量相关矩阵内部的依赖关系出发,把因子表达成能表示成少数公共因子和仅对某一个变量有作用的特殊因子的线性组合(因子分析是主成分的推广,相对于主成分分析,更倾向于描述原始变量之间的相关关系); ( u, T9 T/ [, v% h 2.假设条件不同; 主成分分析不需要有假设,而因子分析需要假设各个共同因子之间不相关,特殊因子(specificfactor)之间也不相关,共同因子和特殊因子之间也不相关; . k8 R( F0 S6 c 3. 求解方法不同; 主成分分析的求解方法从协方差阵出发,而因子分析的求解方法包括主成分法、主轴因子法、极大似然法、最小二乘法、a因子提取法等; ; c4 j7 E9 V. v- d6 M& F0 v& Y" I 4. 降维后的“维度”数量不同,即因子数量和主成分的数量; 主成分分析的数量最多等于维度数;而因子分析中的因子个数需要分析者指定(SPSS和SAS根据一定的条件自动设定,只要是特征值大于1的因子主可进入分析),指定的因子数量不同而结果也不同。$ K& Q( n. @! F, |8 A, e
5. 线性表示方法不同; 因子分析是把变量表示成各公因子的线性组合;主成分分析中则是把主成分表示成各变量的线性组合。 i7 J5 W4 G7 Y: K, ~
6. 主成分和因子的变化不同; 主成分分析:当给定的协方差矩阵或者相关矩阵的特征值唯一时,主成分一般是固定的独特的;因子分析:因子不是固定的,可以旋转得到不同的因子。 , v# h6 E2 I: l# M. s6 j0 j 7.解释重点不同; 主成分分析:重点在于解释个变量的总方差;因子分析:则把重点放在解释各变量之间的协方差。3 L. p3 Q) v& t
8.算法上的不同; 主成分分析:协方差矩阵的对角元素是变量的方差;因子分析:所采用的协方差矩阵的对角元素不在是变量的方差,而是和变量对应的共同度(变量方差中被各因子所解释的部分)。 3 ~3 G, ]7 c- F 9.优点不同; 对于因子分析,可以使用旋转技术,使得因子更好的得到解释,因此在解释主成分方面因子分析更占优势;其次因子分析不是对原有变量的取舍,而是根据原始变量的信息进行重新组合,找出影响变量的共同因子,化简数据;如果仅仅想把现有的变量变成少数几个新的变量(新的变量几乎带有原来所有变量的信息)来进入后续的分析,则可以使用主成分分析,不过一般情况下也可以使用因子分析。 ) W3 {$ k7 H& n9 o6 _3 h& d ' b* X' l8 a3 B+ _ 综合来看,因子分析在实现中可以使用旋转技术,因此可以得到更好的因子解释,这一点比主成分占优势;另外,因子分析不需要舍弃原有变量,而是站到原有变量间的共性因子作为下一步应用的前提,其实就是由表及里去发现内在规律。但是,主成分分析由于不需要假设条件,并且可以最大限度的保持原有变量的大多数特征,因此适用范围更广泛,尤其是宏观的未知数据的稳定度更高。 ) V; n4 B" W+ ~) K4 G! R C8 L/ c' i* t9 S8 d总结 9 o( U3 ^+ D" ?6 P. X M( V因子分析跟主成分分析一样,由于侧重点都是进行数据降维,因此很少单独使用,大多数情况下都会有一些模型组合使用。例如:# G" Z- Z* a9 {' }$ d( ~
(1) 因子分析(主成分分析)+多元回归分析:判断并解决共线性问题之后进行回归预测;8 [0 h" ]4 O5 {( x
(2) 因子分析(主成分分析)+聚类分析:通过降维后的数据进行聚类并分析数据特点,但因子分析会更适合,原因是基于因子的聚类结果更容易解释,而基于主成分的聚类结果很难解释;* \/ H" F" I: {) M+ H
(3) 因子分析(主成分分析)+分类:数据降维(或数据压缩)后进行分类预测,这也是常用的组合方法。' V" L4 f. i3 w: a