QQ登录

只需要一步,快速开始

 注册地址  找回密码
查看: 3406|回复: 0
打印 上一主题 下一主题

[建模教程] 主成分分析 (一): 基本思想与主成分估计方法

[复制链接]
字体大小: 正常 放大
浅夏110 实名认证       

542

主题

15

听众

1万

积分

  • TA的每日心情
    开心
    2020-11-14 17:15
  • 签到天数: 74 天

    [LV.6]常住居民II

    邮箱绑定达人

    群组2019美赛冲刺课程

    群组站长地区赛培训

    群组2019考研数学 桃子老师

    群组2018教师培训(呼伦贝

    群组2019考研数学 站长系列

    跳转到指定楼层
    1#
    发表于 2020-6-8 15:21 |只看该作者 |倒序浏览
    |招呼Ta 关注Ta |邮箱已经成功绑定
    主成分分析(principal component analysis)是1901年Pearson对非随机变量引 入的,1933年Hotelling将此方法推广到随机向量的情形,主成分分析和聚类分析有很 大的不同,它有严格的数学理论作基础。  主成分分析的主要目的是希望用较少的变量去解释原来资料中的大部分变异,将我 们手中许多相关性很高的变量转化成彼此相互独立或不相关的变量。通常是选出比原始 变量个数少,能解释大部分资料中的变异的几个新变量,即所谓主成分,并用以解释资 料的综合性指标。由此可见,主成分分析实际上是一种降维方法。4 W" p0 Q6 h9 a3 S- ]' g) I
    2 T0 x4 b; O$ x/ H" o( Y

    % T2 m" O' {7 ]) u# {4 v0 y. T1 \$ H1 r- o$ m
    1  基本思想及方法
    3 d, H" E  a: C. S: d. e) Z, _! g& j1 k$ u0 }! E' z# B

    7 O% C) M2 I  W: F0 ]( n5 ?4 ?3 Z( M$ _
    $ H% {$ C1 F/ @' B
    + l2 D7 V9 j& ]/ Q. x
    1 确定各个主成分的方法
    8 u! l4 w5 U8 y: e' U1 v& \/ W7 O一个主成分不足以代表原来的 p 个变量,因此需要寻找第二个乃至第三、第四主 成分,第二个主成分不应该再包含第一个主成分的信息,统计上的描述就是让这两个主 成分的协方差为零,几何上就是这两个主成分的方向正交。具体确定各个主成分的方法 如下。
    3 p; v7 _1 e5 o7 r& \' a  c0 ?0 Y( Y# l% E
    7 o" h" a) ?' @$ x

    8 D' |1 N  V# |% N
    / a& J/ C( x" i' l) d2 注意事项
    ; Q. K  f' n" @ 1)主成分分析的结果受量纲的影响,由于各变量的单位可能不一样,如果各自改变量纲,结果会不一样,这是主成分分析的大问题,回归分析是不存在这种情况的, 所以实际中可以先把各变量的数据标准化,然后使用协方差矩阵或相关系数矩阵进行分 析。1 }% O/ D. p0 e0 T
    + K5 S0 J+ s8 n) j- V
    2)为使方差达到大的主成分分析,所以不用转轴(由于统计软件常把主成分分 析和因子分析放在一起,后者往往需要转轴,使用时应注意)。
    + e8 t* W& J0 N8 A
    2 |9 {; u) d/ C9 i2 U$ B 3)主成分的保留。用相关系数矩阵求主成分时,Kaiser主张将特征值小于1的主成 分予以放弃(这也是SPSS软件的默认值)。* Z8 t1 B) k  ~! C  h6 B

    1 X3 F% M% Q/ j. ~; p. F5 r 4)在实际研究中,由于主成分的目的是为了降维,减少变量的个数,故一般选取 少量的主成分(不超过5或6个),只要它们能解释变异的70%~80%(称累积贡献率) 就行了。  下面我们直接通过主成分估计(principle estimate)进一步阐述主成分分析的基 本思想和相关概念。$ Y/ f- a% M# e: v# X
    ; a* c: U( H& t+ Z! q, R7 J
    2  主成分估计
    # j) G6 J/ R* r5 @" U* C 主成分估计(principal component estimate)是Massy在1965年提出的,它是回归系数参数的一种线性有偏估计(biased estimate),同其它有偏估计,如岭估计(ridge estimate)等一样,是为了克服小二乘(LS)估计在设计矩阵病态(即存在多重共线性) 时表现出的不稳定性而提出的。  
    " J+ h4 u; e0 m/ T# b: o5 j. n9 m/ {! @6 B. l% k, k6 l$ W
    主成分估计采用的方法是将原来的回归自变量变换到另另一组变量,即主成分,选择其中一部分重要的主成分作为新的自变量(此时丢弃了一部分,影响不大的自变量, 这实际达到了降维的目的),然后用小二乘法对选取主成分后的模型参数进行估计, 后再变换回原来的模型求出参数的估计。 $ ]2 J. y2 _  g2 f* I! y

    6 Y" }! c- e! a
    6 V7 G$ a, X: L* U0 ~! v. t3 F% k" N( q+ A; @. S" J( A
    5 P$ y% W/ U, o# L3 i2 C
    7 D9 p8 ^, \& B# @* F3 _
    % o# g# j3 U7 j' n% Y* B; G

    ) n. }# Y, H# U. |
    : t+ v6 g& Z( }0 |4 P9 S5 e. Z% ]( K3 H/ M. }& v
    * a! y$ D2 O: C/ l

    & D$ m& Y: B; @( j1 o$ d) i# C: q% |+ ?7 t

    9 [2 U7 o! C2 I0 H) x3 ^
    , r6 k" u  h+ f6 y, z( z4 `* u6 X% A  L0 l# D7 H, `
    单参数主成分估计' [& h4 N, O. y* p) K/ I5 R2 a
    理论上表明:主成分估计在设计阵病态时优于LS估计,但(31)在特征值为1的附 近存在跳跃,会影响计算的稳定性,杨虎在1989年给出的单参数主成分估计解决了这个 问题。 ; V& Q' E/ H  ?/ ^" N7 o) k

    9 m3 `) ^' x, z) t- R$ r
    # l% |3 M& p* m) A8 X/ F! g5 o, C: |7 w2 B
    例3  Hald水泥问题,考察含如下四种化学成分 . }2 h' r- T1 H! V

    * Z/ j+ A0 A& C, Y5 Q$ e8 S( y* X+ J' X- \3 Q
    3 a! [+ E' K$ j! Y0 _

    2 F8 o6 B/ v8 s3 ~, ?8 d9 t0 W) ^# X4 D* `4 ?9 d
    相关系数阵的四个特征值依次为2.2357,1.5761,0.1866,0.0016。最后一个特征值接近于零,前三个特征值之和所占比例(累积贡献率)达到0.999594。于是我们略去 第4个主成分。其它三个保留的特征值对应的三个特征向量分别为
      z+ \0 `& R3 Q2 w! W0 f3 ?! ^5 D% f' w% ~# C: w( q
    ( H5 B% a' \) }2 D

    : C* G0 p- f( n8 N) r5 S2 T" M对Hald数据直接作线性回归得经验回归方程 : r0 `0 @, U  |; b

    ; D  p0 _* c. P5 H2 ?7 `$ d6 ?1 s, @% `

    : Q7 k0 t5 r: Q再由(31)式计算出主成分估计,即可获得如下主成分回归方程
    # g% h4 }4 H9 H/ p  {8 R: E; Y# {, N. I2 s4 M) Z* ^
    ) ~; W) [9 O+ F- _6 \( `; Q
    . S" T, r6 {) ~8 B+ I% y: a/ h7 h
    两个方程的区别在于后者具有更小的均方误差,因而更稳定。此外前者所有系数都无法 通过显著性检验。  计算的MATLAB程序如下:
      ^  `, K, G2 W* Gclc,clear
    2 j) _4 M9 G: |( O+ Uload sn.txt  %把原始的x1,x2,x3,x4,y的数据保存在纯文本文件sn.txt中 $ X& w* G( g% P, C6 H" o
    [m,n]=size(sn);num=3; %num为选取的主成分的个数 ; P$ K- c: Y, L% ^
    mu=mean(sn);sigma=std(sn); 2 W5 y! i" ]+ J5 O0 g  R* e
    snb=zscore(sn); %数据标准化
    3 p+ a  x  J( T4 Xb=snb(:,1:end-1); %x1,x2,x3,x4的数据赋给b 2 X; s: h- w7 m6 ^+ d
    r=cov(b);  %标准化数据的协方差阵就是相关系数阵
      N' _/ P! I7 [1 K1 z* p+ g- H[x,y,z]=pcacov(r);
    % i, N$ ^9 x+ qf=repmat(sign(sum(x)),size(x,1),1); % s: h  U, j5 x1 r% z
    x=x.*f;
    1 h$ ?3 z; F( A6 ~%以下是普通的小二乘法回归 ( i% O- }7 m( L4 v
    r=[ones(m,1),b]\snb(:,end);  %标准化数据的回归方程系数 0 E( X- L) j9 J0 p7 e& ]8 h# @
    bzh=mu./sigma;
    6 M8 ~+ P/ N3 g" Pch10=mu(end)-bzh(1:end-1)*r(2:end)*sigma(end)  %原始数据的常数项 ' c* ^& @' @! f- o' b0 n; q* q
    fr=r(2:end);fr=fr';
    % J6 T/ A/ C1 I4 rch1=fr./sigma(1:end-1)*sigma(end) %原始数据的x1,x2等等系数
      Y/ _9 g. H, s6 {%以下是主成分回归
    6 R' [! P3 x& n+ ^  p' g' Vpval=b*x(:,1:num);
    # Z# V' Z# u0 crp=[ones(m,1),pval]\snb(:,end);  %主成分数据的回归方程系数
    ( V- H! d2 c0 X% T: ]* C* H* Lbeta=x(:,1:num)*rp(2:num+1);           %标准化数据的回归方程系数 5 \" x. }& E; W+ z9 i8 _
    ch20=mu(end)-bzh(1:end-1)*beta*sigma(end)  %原始数据的常数项
      W3 p- u3 R: E& P* @fr=beta'; 4 C0 e! M# N; N" ^0 J* x0 u# |
    ch2=fr./sigma(1:end-1)*sigma(end) %原始数据的x1,x2等等系数 4 a2 {9 p* o2 B  e- q
    check1=sqrt(sum((sn(:,1:end-1)*ch1'+ch10-sn(:,end)).^2)/(m-n)) 8 X) j7 B/ e& @* ~0 U3 @
    check2=sqrt(sum((sn(:,1:end-1)*ch2'+ch20-sn(:,end)).^2)/(m-num-1)) 6 x5 O1 ?9 A* n" f& u
    ; z& `/ q4 ~3 R8 y; u7 i

    & ^; \+ |/ A& g/ D5 U8 f( s————————————————
    5 E8 |2 P$ K( e. E版权声明:本文为CSDN博主「wamg潇潇」的原创文章,遵循CC 4.0 BY-SA版权协议,转载请附上原文出处链接及本声明。+ V, M: |+ a/ d. w) g8 |
    原文链接:https://blog.csdn.net/qq_29831163/article/details/89577292/ s) h* E9 I; D$ M6 d, p) h
      h: k8 v9 E* ?( e3 o: V9 j
      L6 @  v; P9 _
    zan
    转播转播0 分享淘帖0 分享分享0 收藏收藏0 支持支持0 反对反对0 微信微信
    您需要登录后才可以回帖 登录 | 注册地址

    qq
    收缩
    • 电话咨询

    • 04714969085
    fastpost

    关于我们| 联系我们| 诚征英才| 对外合作| 产品服务| QQ

    手机版|Archiver| |繁體中文 手机客户端  

    蒙公网安备 15010502000194号

    Powered by Discuz! X2.5   © 2001-2013 数学建模网-数学中国 ( 蒙ICP备14002410号-3 蒙BBS备-0002号 )     论坛法律顾问:王兆丰

    GMT+8, 2026-9-13 05:00 , Processed in 2.619232 second(s), 50 queries .

    回顶部