SAS相关性分析' V0 l7 \1 E: o
在统计上,x和y变数的关系有两种理论模型,第一种是回归模型;第二种叫相关模型或双变数正态总体模型。回归模型除具有自变数和依变数的区别外,还具有预测的特征,即具有由x的数量变化预测y的数量变化。相关关系是指在一定范围内,一个变数的任一变量(如xi),虽然没有另一个变数的一个确定数值yi与之对应,但是却有一个特定的yi的条件概率分布与之对应,只要这种关系存在,我们就定义变数y和x有相关关系。相关模型中,没有自变数和依变数的区别,不具有预测特性,它仅表示两个变数的偕同变异。
0 ]) y5 Q' d* |! z 回归模型资料的统计方法叫回归分析,这一分析方法是要导出由x来预测或控制Y的回归方程,并确定当给自变数x为某一值时依变数y将会在什么范围内变化。相关模型资料的统计方法叫相关分析,这一分析是要测定两个变数在数量关系上的密切程度和性质。SAS系统的CORR过程能够计算两个变量间的相关系数,包括Pearson,Spearman,Hoeffding, Kendall等相关系数及其他一些统计量。* F2 }( @* |4 N: E; t. s; T
& v- i: Z1 m: X8 _CORR过程格式 - PROC CORR;
- VAR 变量表;
- WITH 变量表;
- PARTIAL 变量表;
- WEIGHT 变量;
- FREQ 变量;
- BY 变量表;
' A8 _" ?: q, U1 D
& O+ r' ?% H( z9 M2 V复制代码
[; u8 z0 a6 E, x$ v3 L8 hCORR过程语句说明) }, F0 X, X/ ~4 r" w
一、PROC CORR语句选择项
. g, w" p9 Y8 z0 V$ M* H/ SDATA=数据集 指明需处理的数据集名,缺省时为当前数据集。
% H# q6 ` D; l5 {: I, F) A% yOUTP=数据集 要求产生一个含有Pearson相关的一个新数据集。
0 ~4 r q4 }; jOUTS=数据集 要求产生一个含有Spearman相关的一个新数据集。
; M" F) e1 D* q3 H0 }, Z2 lOUTK=数据集 要求产生一个含有Kendall相关的一个新数据集。
! A) ?& K) ^* pOUTH=数据集 要求产生一个含有Hoeffding相关的一个新数据集。# L9 g N% f* m& g; z
PEARSON 计算通常的Pearson积矩相关,是缺省值。# c8 D0 E4 i/ R! X2 d# D2 D3 q
SPEARMAN 计算Spearman等级相关系数
L; R6 B7 U! `% O( a9 r& O2 NKENDALL 计算Kendallτ-b系数。& h9 H7 U0 J1 a
HOEFFDING 计算Hoeffding D统计量。
$ g6 k" \8 d7 ?9 K" C; U$ l" XNOMISS 将带有某一变量缺失值的观察值从所有计算中除去。
0 o! `) m6 a4 y2 y$ W' J" s {VARDEF=DF|WGT|N|WDF 指定计算方差和协方差的分母。N观察值个数,DF自由度,WGT权重合,WDF权重合减1。
! B* w; ] q+ k* e0 W% LNOSIMPLE 抑制简单统计。' n6 S6 J3 j B! M# b3 o3 c- T" M
BEST=n 只输出每个变量与其他变量间最高的n个相关系数。8 _8 ^' j0 `& s; D$ {
NOPRINT 抑制任何报表的输出。% {# x2 g) B5 ^, x: l% O
NOCORR 在输出数据集中不包括相关系数。6 t; P1 S* A$ G! W- H( Z. p
NOPROB 不输出相关系数的显著性测验。9 q. x3 ~6 [5 l2 X
RANK 将每一变量与其他变量的相关系数按由大到小的顺序排列。
3 ~; I# z, U- T" Y! D5 r. t二、VAR语句+ B/ O. u( y8 N% G8 P5 r
VAR 变量表) X1 F' o7 n: k+ p# Q" T1 Y) T
指明要计算相关分析的变量名,缺省时,计算所有数值型变量间相关系数。
1 m6 [. F) q1 D) \三、WITH语句' L( ~' [: }/ m% y2 K6 @
WITH变量表 指明特别配对的变量名,与VAR语句配对使用,VAR语句列出相关矩阵上部出现的变量,WITH语句列出左侧出现的变量。
# f$ x6 d* O, }% t9 m) E四、PARTIAL语句
' P* d/ Y& l# H; A2 [PARTIAL变量表 指明求偏相关时的偏变量名,同时激活NOMISS选择项。
( A8 Z3 @6 T* q- [8 W
/ n+ \# P7 m7 k& L$ g应用实例# B M. O" F$ n' s' V* J
例1 一些夏季害虫盛发期的早迟和春季温度高低有关。江苏武进县测定1956~1964年3月下旬至4月中旬旬平均温度累积值(x,单位:旬.度)和一代三化螟蛾盛发期(y,以5月10日为0)的数据见表1,试计算x和y的相关系数和决定系数。
: Q: T5 }& M S J* p) P表1 累积温和一代三化螟蛾盛发期的关系数据
! H( S3 j/ Q; u' I% x8 }$ j5 a- D5 IX累积温 35.5 34.1 31.7 40.3 36.8 40.2 31.7 39.2 44.2
- S2 E5 s g, sY盛发期 12 16 9 2 7 3 13 9 -1 P2 E, @# ^/ D& {0 p) _
● 程序及说明- DATA new;
- INPUT x y@@;
- CARDS;
- 35.5 12 34.1 16 31.7 9 40.3 2 36.8 7 40.2 3 31.7 13 39.2 9 44.2 -1
- PROC CORR;
- VAR x y;
- RUN;
4 ]$ b7 ]$ y' d7 q" g& W& Q( c
4 l& u- _% R; j) e7 B5 V ● 输出结果及说明
?" G4 I0 W2 Y+ U5 H9 y% P9 |5 s Correlation Analysis相关分析
; x; ?- a: S6 ]" @ 2 'VAR' Variables: X Y
! R! [& z$ [/ V& O8 U* J Simple Statistics
) M9 o9 R: E; `$ f6 u B* d简单统计
9 d9 q1 C+ [/ P ?; ?3 VVariable N Mean Std Dev Sum Minimum Maximum
6 p' K1 n U+ ^/ ^) y; u( m变量名 观察值个数 平均数 标准差 总和 最小数 最大数' g6 a: J4 h7 P, @
X 9 37.07778 4.25199 333.70000 31.70000 44.20000* I* G ]+ m6 p4 t0 k1 H; m: f
Y 9 7.77778 5.58520 70.00000 -1.00000 16.00000
4 u1 Y* I3 _5 E; b
c5 v8 L! W; J$ q, U Pearson Correlation Coefficients / Prob > |R| under Ho: Rho=0 / N = 9
3 t8 x+ M: Q7 _ PEARSON相关系数
0 R4 K9 j6 w3 t X Y: K+ x1 s# l7 _' u; H
X 1.00000 -0.837149 V- c K9 F0 j+ {+ B1 z
0.0 0.0049' O" y- t( v: u. d7 V% F5 O/ l5 p+ T
Y -0.83714 1.000005 _5 n- c: _' E7 `6 b! k! a" a
0.0049 0.0 . I. A6 O: b# }6 a4 H& S; `
可见,x与y相关系数为-0.83714,概率为0.0049,达到极显著水平。
6 ^. i; p, v5 _2 e5 Z( ?例2 测定13块中籼南京11号高产田的每亩穗数(x1,单位:万)、每穗粒数(x2)和每亩稻谷产量(y,单位:斤),得结果如表2。试分析每亩穗数、每穗粒数和亩产量间的相关。+ ^: K/ j" U; g: j: u# T
表2 每亩穗数(x1)、每穗粒数(x2)与亩产量(y)* W* B: s# ]( ]. Y
x1 x2 Y x1 x2 Y x1 x2 Y7 ]' A% a* Y7 r8 N) P. T
26.7 73.4 1008 33.8 64.6 1103 31.5 61.1 1004
" W& H0 R" E+ W$ h8 w; V$ q31.3 59.0 959 30.4 62.1 992 33.1 56.0 995/ _2 g# @0 Z8 b" Q. u) T# \3 |
30.4 65.9 1051 27.0 71.4 945 34.0 59.8 1045) c: p2 y/ [+ ?2 G J/ W
33.9 58.2 1022 33.3 64.5 1074
3 O' C4 |6 u: q+ d5 E- e' v/ k34.6 64.6 1097 30.4 64.1 1029 - }- ]6 J+ {7 A( m* j% K1 N
● 程序及说明 - DATA new;
- INPUT x1 x2 y;
- Cards;
- 26.7 73.4 1008
- 31.3 59.0 959
- 30.4 65.9 1051
- 33.9 58.2 1022
- 34.6 64.6 1097
- 33.8 64.6 1103
- 30.4 62.1 992
- 27.0 71.4 945
- 33.3 64.5 1074
- 30.4 64.1 1029
- 31.5 61.1 1004
- 33.1 56.0 995
- 34.0 59.8 1045
- PROC CORR NOSIMPLE;
- VAR x1 x2 y;
- RUN;% K K$ M1 b8 Q& u0 I
# B3 f' ]' R L
6 k( b; i0 O5 w1 I
● 输出结果及说明3 }6 a$ G, [0 s" q4 t
Correlation Analysis
, Y$ Z: |8 k" o, S 3 'VAR' Variables: X1 X2 Y
( ]2 z' L. E2 @, O# c Pearson Correlation Coefficients / Prob > |R| under Ho: Rho=0 / N = 13
9 ?: s, R* O* t* l X1 X2 Y! x' J# O+ P; S! _
X1 1.00000 -0.71738 0.629392 g C2 j, ` z4 E% Z( G
0.0 0.0058 0.0212
+ x. i; ~) C6 `- U! d t V3 J X2 -0.71738 1.00000 0.01347 p3 Y2 i: ^! r# ]& a
0.0058 0.0 0.96521 p* M: c8 p0 J' C
Y 0.62939 0.01347 1.00000
3 z/ t5 l9 | v+ v 0.0212 0.9652 0.0
9 r, Q7 c: U. E# n& [3 J0 ^由相关分析可知,x1和x2间的相关系数为-0.71738,达极显著水平(P=0.0058<0.01);x1和y的相关系数为0.62939,达显著水平(P=0.0212<0.05);x2和y的相关系数为0.01347,未达到显著水平(P=0.9652>0.05)。' M: `* @9 s3 B% H8 o
, |) I1 _# f; a7 k0 w3 d |