SAS相关性分析! s6 D3 d; n: }3 q
在统计上,x和y变数的关系有两种理论模型,第一种是回归模型;第二种叫相关模型或双变数正态总体模型。回归模型除具有自变数和依变数的区别外,还具有预测的特征,即具有由x的数量变化预测y的数量变化。相关关系是指在一定范围内,一个变数的任一变量(如xi),虽然没有另一个变数的一个确定数值yi与之对应,但是却有一个特定的yi的条件概率分布与之对应,只要这种关系存在,我们就定义变数y和x有相关关系。相关模型中,没有自变数和依变数的区别,不具有预测特性,它仅表示两个变数的偕同变异。! C6 R! I/ C3 Q4 h
回归模型资料的统计方法叫回归分析,这一分析方法是要导出由x来预测或控制Y的回归方程,并确定当给自变数x为某一值时依变数y将会在什么范围内变化。相关模型资料的统计方法叫相关分析,这一分析是要测定两个变数在数量关系上的密切程度和性质。SAS系统的CORR过程能够计算两个变量间的相关系数,包括Pearson,Spearman,Hoeffding, Kendall等相关系数及其他一些统计量。7 a6 X1 K- ~) V9 x$ R" I! M3 N
. f g' d4 \' ~. u! dCORR过程格式 - PROC CORR;
- VAR 变量表;
- WITH 变量表;
- PARTIAL 变量表;
- WEIGHT 变量;
- FREQ 变量;
- BY 变量表;* G) F4 [) H3 H7 S9 V
, w' x+ n5 G$ Y) N$ ~$ A" ^, V: P9 Y复制代码
, Z8 X1 k" g7 ZCORR过程语句说明. t6 k7 z/ b! ? z9 o& v. {4 ?
一、PROC CORR语句选择项" L# i/ N: g3 x# Z E+ J4 n' X* |
DATA=数据集 指明需处理的数据集名,缺省时为当前数据集。
2 c/ [) V: C: X% K% [& @OUTP=数据集 要求产生一个含有Pearson相关的一个新数据集。2 [) |* A3 F; f# e9 p3 Q
OUTS=数据集 要求产生一个含有Spearman相关的一个新数据集。: p& y& ]" h7 X7 k: W* y- j% n
OUTK=数据集 要求产生一个含有Kendall相关的一个新数据集。
; ^& \. @; o" m$ I9 rOUTH=数据集 要求产生一个含有Hoeffding相关的一个新数据集。
2 |9 w0 T0 X: x p4 `+ G) o$ T) \0 H1 rPEARSON 计算通常的Pearson积矩相关,是缺省值。& ]4 E5 v; {4 w a' J( ^5 ?7 I
SPEARMAN 计算Spearman等级相关系数! o R0 u. j. T, t$ ^, r" o/ H
KENDALL 计算Kendallτ-b系数。8 }& f- v1 e8 p/ @
HOEFFDING 计算Hoeffding D统计量。% G7 e! L( B* h. u
NOMISS 将带有某一变量缺失值的观察值从所有计算中除去。
- |% W( ]# V9 E; y% Q6 k! c1 cVARDEF=DF|WGT|N|WDF 指定计算方差和协方差的分母。N观察值个数,DF自由度,WGT权重合,WDF权重合减1。- E4 J/ x" W" p2 Z, K. Q
NOSIMPLE 抑制简单统计。
; e1 F K1 D3 l3 ^BEST=n 只输出每个变量与其他变量间最高的n个相关系数。
; w& D8 t5 a4 p+ v. `4 XNOPRINT 抑制任何报表的输出。
: O. ~4 r- R" i/ TNOCORR 在输出数据集中不包括相关系数。) G/ k: _' V+ G1 ]. X6 ?" {7 m
NOPROB 不输出相关系数的显著性测验。
]9 D# {* u# @+ T% L' ]RANK 将每一变量与其他变量的相关系数按由大到小的顺序排列。
% W$ Y: z' g1 c0 b" d7 S7 Y! s二、VAR语句9 s+ v% t, [3 \: I0 a, M! }
VAR 变量表. x" z2 i- j: R3 y7 D7 Z: U
指明要计算相关分析的变量名,缺省时,计算所有数值型变量间相关系数。
- K' f/ [* y4 T/ k3 r三、WITH语句( I: z" p6 z! _/ H
WITH变量表 指明特别配对的变量名,与VAR语句配对使用,VAR语句列出相关矩阵上部出现的变量,WITH语句列出左侧出现的变量。6 e$ D6 g6 i* v J# ?: R+ x) ]. \
四、PARTIAL语句- N, }# ~, n& I; e0 U
PARTIAL变量表 指明求偏相关时的偏变量名,同时激活NOMISS选择项。0 T" i4 o" S6 r) U
8 W0 s4 h; r+ p- H. W2 J. A应用实例- x5 h$ X- `% b; ^& ?' L) w+ x; B1 [
例1 一些夏季害虫盛发期的早迟和春季温度高低有关。江苏武进县测定1956~1964年3月下旬至4月中旬旬平均温度累积值(x,单位:旬.度)和一代三化螟蛾盛发期(y,以5月10日为0)的数据见表1,试计算x和y的相关系数和决定系数。6 V2 ~! u2 P' `2 D
表1 累积温和一代三化螟蛾盛发期的关系数据
& B2 {5 P; x" I0 yX累积温 35.5 34.1 31.7 40.3 36.8 40.2 31.7 39.2 44.2
y5 V, |: w6 \3 H9 e* f* LY盛发期 12 16 9 2 7 3 13 9 -1$ o2 _8 Q$ |; X( j' k4 I3 q! v4 j
● 程序及说明- DATA new;
- INPUT x y@@;
- CARDS;
- 35.5 12 34.1 16 31.7 9 40.3 2 36.8 7 40.2 3 31.7 13 39.2 9 44.2 -1
- PROC CORR;
- VAR x y;
- RUN;1 _4 Z. b7 f7 @1 ^- j+ v7 }
& @' Y! c1 i% P( \7 d% z. Z7 ` ● 输出结果及说明: v5 ~' m- ~+ N: j+ R
Correlation Analysis相关分析
5 I( l; e7 \% E. k; D 2 'VAR' Variables: X Y
- i8 q; C7 T0 p! s l Simple Statistics
$ j4 Z$ G Z" _: i简单统计
- \$ U! W8 U6 q7 U+ q( T% ]: zVariable N Mean Std Dev Sum Minimum Maximum! ~* e/ L. T$ q% p4 n
变量名 观察值个数 平均数 标准差 总和 最小数 最大数
( S$ x0 q$ [7 C4 m; wX 9 37.07778 4.25199 333.70000 31.70000 44.20000
3 B& e( W j9 W D% ^4 @) WY 9 7.77778 5.58520 70.00000 -1.00000 16.000005 q8 X& t, u1 i0 f5 d [" }0 e
3 |8 w6 p( `( f9 s/ \ Pearson Correlation Coefficients / Prob > |R| under Ho: Rho=0 / N = 9
, D8 [1 G/ F) Q4 l R, Z8 l PEARSON相关系数0 i4 q) g$ _/ W* t' U* E: K7 F
X Y9 n0 u- f4 F/ f1 b5 D
X 1.00000 -0.83714
- r3 j% g. n8 l8 s/ s3 h+ F 0.0 0.0049
1 ^. X S7 p7 Y; @ Y -0.83714 1.00000
: x$ W7 G- L* j) U0 A 0.0049 0.0
* r1 r1 Z: ~+ L* X/ @) B3 f可见,x与y相关系数为-0.83714,概率为0.0049,达到极显著水平。/ _, Q. K. }/ @. E S
例2 测定13块中籼南京11号高产田的每亩穗数(x1,单位:万)、每穗粒数(x2)和每亩稻谷产量(y,单位:斤),得结果如表2。试分析每亩穗数、每穗粒数和亩产量间的相关。1 e T* }* _3 u! r; f: Y/ n
表2 每亩穗数(x1)、每穗粒数(x2)与亩产量(y)
6 b% `% w# ^# S9 ~x1 x2 Y x1 x2 Y x1 x2 Y
5 S w, y# H s% C; G x; j1 c26.7 73.4 1008 33.8 64.6 1103 31.5 61.1 1004
$ s C; N; |8 O( X9 U) J$ h* Y O31.3 59.0 959 30.4 62.1 992 33.1 56.0 995
; ~- _/ w' d2 e; ?+ ?; T/ j30.4 65.9 1051 27.0 71.4 945 34.0 59.8 1045' F2 C# }1 y. {# |& i% r* V
33.9 58.2 1022 33.3 64.5 1074 $ l: t2 H/ c; e6 F
34.6 64.6 1097 30.4 64.1 1029 . `3 x) h! m3 {6 B8 X7 Y
● 程序及说明 - DATA new;
- INPUT x1 x2 y;
- Cards;
- 26.7 73.4 1008
- 31.3 59.0 959
- 30.4 65.9 1051
- 33.9 58.2 1022
- 34.6 64.6 1097
- 33.8 64.6 1103
- 30.4 62.1 992
- 27.0 71.4 945
- 33.3 64.5 1074
- 30.4 64.1 1029
- 31.5 61.1 1004
- 33.1 56.0 995
- 34.0 59.8 1045
- PROC CORR NOSIMPLE;
- VAR x1 x2 y;
- RUN;
( m2 K$ a, R0 U# ^7 v5 g X+ T; c + ]8 b4 b8 J# E( E- p
5 e6 c9 K/ |$ p3 X1 y. G8 W$ D
● 输出结果及说明+ z2 u' ]* \3 H' h: f8 N
Correlation Analysis6 h4 @& f' z8 o+ N4 `, P7 o2 W* v
3 'VAR' Variables: X1 X2 Y * U" q: T) p, h" }
Pearson Correlation Coefficients / Prob > |R| under Ho: Rho=0 / N = 13
2 t4 S( X$ e; P( [+ v X1 X2 Y( Z0 M9 C5 L' b- u Y- j8 I; u* l
X1 1.00000 -0.71738 0.62939 o) A: z3 T e3 g" ]( \* m
0.0 0.0058 0.0212
4 X. J2 s9 Z+ Y% e( `$ J- y7 u X2 -0.71738 1.00000 0.013478 t. _& T% o& F; U. u
0.0058 0.0 0.9652& _. \1 F9 X7 d/ F( g3 Z" ]
Y 0.62939 0.01347 1.000004 z$ W5 O1 i0 M5 f
0.0212 0.9652 0.0
. i$ c" Y5 ]# X9 `9 X由相关分析可知,x1和x2间的相关系数为-0.71738,达极显著水平(P=0.0058<0.01);x1和y的相关系数为0.62939,达显著水平(P=0.0212<0.05);x2和y的相关系数为0.01347,未达到显著水平(P=0.9652>0.05)。
; `7 v. w) X5 B" b K3 M. p1 V& y4 s# M0 w/ }6 G" D8 p# r
|