SAS相关性分析
3 W! s0 M+ ]$ K1 p0 R s: ?* ^ 在统计上,x和y变数的关系有两种理论模型,第一种是回归模型;第二种叫相关模型或双变数正态总体模型。回归模型除具有自变数和依变数的区别外,还具有预测的特征,即具有由x的数量变化预测y的数量变化。相关关系是指在一定范围内,一个变数的任一变量(如xi),虽然没有另一个变数的一个确定数值yi与之对应,但是却有一个特定的yi的条件概率分布与之对应,只要这种关系存在,我们就定义变数y和x有相关关系。相关模型中,没有自变数和依变数的区别,不具有预测特性,它仅表示两个变数的偕同变异。
) Y. C! j+ ~" m/ b) S y [0 _, ~ 回归模型资料的统计方法叫回归分析,这一分析方法是要导出由x来预测或控制Y的回归方程,并确定当给自变数x为某一值时依变数y将会在什么范围内变化。相关模型资料的统计方法叫相关分析,这一分析是要测定两个变数在数量关系上的密切程度和性质。SAS系统的CORR过程能够计算两个变量间的相关系数,包括Pearson,Spearman,Hoeffding, Kendall等相关系数及其他一些统计量。+ n5 Q4 z9 d- E7 K+ o5 [( F8 T) U
5 L+ \( q# E. }& A8 D6 X1 W
CORR过程格式 - PROC CORR;
- VAR 变量表;
- WITH 变量表;
- PARTIAL 变量表;
- WEIGHT 变量;
- FREQ 变量;
- BY 变量表;) K) |% n7 F5 C; E4 r; z
v6 t% }) U- H* y# T( q2 z4 E. K
复制代码
0 f6 k( e: m( }. }0 o6 |* _CORR过程语句说明
_( {& j; X/ Q- W; j! [/ u' w一、PROC CORR语句选择项
5 `, Y) P9 l; y) M4 k, Y4 lDATA=数据集 指明需处理的数据集名,缺省时为当前数据集。
. a7 C9 v6 h* a/ ^# h+ [3 VOUTP=数据集 要求产生一个含有Pearson相关的一个新数据集。
- h) K2 k2 w2 z& P% Q, D hOUTS=数据集 要求产生一个含有Spearman相关的一个新数据集。8 X) S8 G3 W- r
OUTK=数据集 要求产生一个含有Kendall相关的一个新数据集。
; O0 F$ S* k5 |0 I; HOUTH=数据集 要求产生一个含有Hoeffding相关的一个新数据集。
( Q, C4 [6 R, aPEARSON 计算通常的Pearson积矩相关,是缺省值。
5 u: e3 |2 J0 l! p8 ^SPEARMAN 计算Spearman等级相关系数5 [6 A8 g( B! C( z1 ?6 m1 b
KENDALL 计算Kendallτ-b系数。& q. s. q) g" o$ J' f
HOEFFDING 计算Hoeffding D统计量。$ L( y7 _5 q; K. C
NOMISS 将带有某一变量缺失值的观察值从所有计算中除去。7 ?2 y7 E4 T$ X! H/ v
VARDEF=DF|WGT|N|WDF 指定计算方差和协方差的分母。N观察值个数,DF自由度,WGT权重合,WDF权重合减1。
% F M, f2 `& _; t9 Q9 R- g9 a3 JNOSIMPLE 抑制简单统计。" m {3 ?4 P: X$ u
BEST=n 只输出每个变量与其他变量间最高的n个相关系数。' d2 m2 y+ r1 W, u
NOPRINT 抑制任何报表的输出。5 C! Y) o, z B4 B5 T
NOCORR 在输出数据集中不包括相关系数。
- M% x* O) F9 C0 k1 L' `1 t, S( eNOPROB 不输出相关系数的显著性测验。
0 n$ ^/ i* {$ q4 d! r* \8 iRANK 将每一变量与其他变量的相关系数按由大到小的顺序排列。3 |2 \. \! s1 V+ A& J! _4 N x
二、VAR语句: ?; t" q- K! l' H
VAR 变量表
: \" r, W9 p4 C2 O" @: Z) ]) t指明要计算相关分析的变量名,缺省时,计算所有数值型变量间相关系数。
1 u" G! ]3 y0 B0 x/ T6 V8 I- i三、WITH语句
( O4 H4 g8 k( C: D5 JWITH变量表 指明特别配对的变量名,与VAR语句配对使用,VAR语句列出相关矩阵上部出现的变量,WITH语句列出左侧出现的变量。
1 O: ~- s# R. i四、PARTIAL语句
# A$ }, c2 a3 m, `0 O6 b% IPARTIAL变量表 指明求偏相关时的偏变量名,同时激活NOMISS选择项。, l% l, \4 b2 `0 l( ~
; a% l$ f+ J2 m: p( \应用实例
& }; |9 G& d3 m9 i3 w例1 一些夏季害虫盛发期的早迟和春季温度高低有关。江苏武进县测定1956~1964年3月下旬至4月中旬旬平均温度累积值(x,单位:旬.度)和一代三化螟蛾盛发期(y,以5月10日为0)的数据见表1,试计算x和y的相关系数和决定系数。
& L( g' n% Z: V: e2 P表1 累积温和一代三化螟蛾盛发期的关系数据
' e( s' J1 h: y) N+ l$ d6 a8 L$ XX累积温 35.5 34.1 31.7 40.3 36.8 40.2 31.7 39.2 44.2
0 Q( x1 s: d9 g6 x2 CY盛发期 12 16 9 2 7 3 13 9 -1
& o# ?3 _0 G+ \, m/ Z9 q● 程序及说明- DATA new;
- INPUT x y@@;
- CARDS;
- 35.5 12 34.1 16 31.7 9 40.3 2 36.8 7 40.2 3 31.7 13 39.2 9 44.2 -1
- PROC CORR;
- VAR x y;
- RUN;9 A! }: ? P& J& Y% }
9 Z- c2 d j( _$ A8 F
● 输出结果及说明. x# n2 D, f! F- A0 G( j3 s# h" H
Correlation Analysis相关分析0 g0 u% t9 x% e( r
2 'VAR' Variables: X Y
0 c5 Y; P3 L* g Simple Statistics1 o; m+ o: }2 f$ C x& o
简单统计6 A6 a- A+ Q( q( F$ W/ ^
Variable N Mean Std Dev Sum Minimum Maximum
$ \. Y, j+ |) ?9 @变量名 观察值个数 平均数 标准差 总和 最小数 最大数
4 Z! {* O; o! JX 9 37.07778 4.25199 333.70000 31.70000 44.20000
7 N9 \& j% ? D% mY 9 7.77778 5.58520 70.00000 -1.00000 16.00000% Q: j( ^; A! S+ C! X
) [3 O E( ]( p+ T& m- H# L
Pearson Correlation Coefficients / Prob > |R| under Ho: Rho=0 / N = 9 4 o# x' S- i; n2 ]% ^+ {
PEARSON相关系数. X ]$ I% O2 y- Z8 s
X Y
) j5 }. C1 e# o; v! G X 1.00000 -0.83714. d* \ |0 _5 A
0.0 0.0049* h' o# n6 N! e' L" s
Y -0.83714 1.000002 _) \# V w* _
0.0049 0.0
, z# h) \" [# T7 E可见,x与y相关系数为-0.83714,概率为0.0049,达到极显著水平。9 n" c: h& y) ~1 i. k% P/ b
例2 测定13块中籼南京11号高产田的每亩穗数(x1,单位:万)、每穗粒数(x2)和每亩稻谷产量(y,单位:斤),得结果如表2。试分析每亩穗数、每穗粒数和亩产量间的相关。/ y) U5 a0 }8 G# `7 H
表2 每亩穗数(x1)、每穗粒数(x2)与亩产量(y)
$ }+ [% A }# O& C4 Qx1 x2 Y x1 x2 Y x1 x2 Y
/ a" v/ I0 S, B/ X7 }26.7 73.4 1008 33.8 64.6 1103 31.5 61.1 10043 H" k" e; G0 A/ i4 M% Z" B
31.3 59.0 959 30.4 62.1 992 33.1 56.0 995& L, q; G- A! z! v) F1 v; |3 T
30.4 65.9 1051 27.0 71.4 945 34.0 59.8 1045
, T* G3 m" ~) O! D- e! l8 V- S5 ?33.9 58.2 1022 33.3 64.5 1074
% z* D) c: L: g5 a; W P34.6 64.6 1097 30.4 64.1 1029
+ P" R5 w# s: o: _' U● 程序及说明 - DATA new;
- INPUT x1 x2 y;
- Cards;
- 26.7 73.4 1008
- 31.3 59.0 959
- 30.4 65.9 1051
- 33.9 58.2 1022
- 34.6 64.6 1097
- 33.8 64.6 1103
- 30.4 62.1 992
- 27.0 71.4 945
- 33.3 64.5 1074
- 30.4 64.1 1029
- 31.5 61.1 1004
- 33.1 56.0 995
- 34.0 59.8 1045
- PROC CORR NOSIMPLE;
- VAR x1 x2 y;
- RUN;
6 C# B' \" u8 _1 Q% R; m4 ]
* `: e \+ o! U9 q/ C0 A6 K& s 7 ~. J# k {4 g, p
● 输出结果及说明( ?. H) |- r; K% ^% V
Correlation Analysis
1 S5 x" W4 ^; E0 R6 \2 ` 3 'VAR' Variables: X1 X2 Y . r' v$ o# {9 e$ s0 m$ W
Pearson Correlation Coefficients / Prob > |R| under Ho: Rho=0 / N = 13 ' E; l+ t# C. v* H; I* B
X1 X2 Y
' z& Z9 w: I; a- L( g9 L+ o. N X1 1.00000 -0.71738 0.62939
( Z& ^7 D0 |6 m6 y 0.0 0.0058 0.0212
. P8 t5 h! Y4 ]3 y6 r9 p6 X; I X2 -0.71738 1.00000 0.01347$ D4 F0 e6 w' F3 K$ S+ j% z' T
0.0058 0.0 0.9652# m) f4 d$ v2 {
Y 0.62939 0.01347 1.00000
) ]2 x! a0 c: n* x. ` 0.0212 0.9652 0.0
6 G+ G" A* p5 N9 r由相关分析可知,x1和x2间的相关系数为-0.71738,达极显著水平(P=0.0058<0.01);x1和y的相关系数为0.62939,达显著水平(P=0.0212<0.05);x2和y的相关系数为0.01347,未达到显著水平(P=0.9652>0.05)。
. x& a# e8 R7 e" d4 `/ H
a( P0 w0 a$ O8 Q% b |