数学建模社区-数学中国

标题: 数学建模之回归分析 [打印本页]

作者: 杨利霞    时间: 2020-3-13 15:12
标题: 数学建模之回归分析

3 o4 f! `8 W' E6 `$ g
, Y* Z, k$ I( k1 @! c6 r- ?4 E) N
数学建模之回归分析

8 _% B- x# `) k& @% I6 D+ r* U5 t  J6 I+ ~/ m2 Z
应用场景
4 |; {, F$ k3 s# E! }1. 建立回归模型
% w$ u/ c, r( w/ K- X/ U$ i4 ]/ K1.1 筛选变量, n6 a: R7 D  ^: ^  r
1.1.1 确定样本空间
6 W& d- Y$ z# O! r1.1.2 对数据进行标准化处理8 {7 N; Z7 t' |5 m0 S' w- z, V* e! I
1.1.3 变量筛选" W, z3 h( I5 C7 U, C
1.1.4 调整复判定系数8 H/ `, ~! L4 s2 Y
1.2 最小二乘估计& T! \: J! t! v+ Q; F! v. c) F: A
2. 回归模型假设检验, T" T: o  D) Q1 ?& t
3. 回归参数假设检验和区间估计* b" y/ g: Y4 C9 X( J! _, i
4. 拟合效果分析
9 R0 o: T0 z; \4.1 残差的样本方差(MSE)
6 T# |& {" ]) L: p4 |4.2 判定系数(拟合优度)! D1 O! e  M& r  ]2 b1 Z
5. 利用回归模型进行预测5 O; @" T1 \- p) [0 ~
其他" \$ _% w" C' ]* U
偏相关系数(净相关系数): ], b+ r/ a( C) }2 i  K
复共线性和有偏估计方法
  y/ K5 t8 E  Z0 a; _) j# d8 n) G" z小结
/ n& G6 P5 D  m3 S应用场景
9 \. e: s- y9 y) ]) f5 s) I: J8 M1 x3 S, G
简单地说,回归分析是对拟合问题做的一种统计分析。
+ e  H- o5 K4 I  D* V3 L/ C( sP.S. 曲线拟合问题的特点是,根据得到的若干有关变量的一组数据,寻找因变量与(一个或几个)自变量之间一个函数,使这个函数对那组数据拟合得最好。通常。函数的形式可以由经验、先验知识或对数据的直接观察决定,要做的工作是由数据用最小二乘法计算函数中的待定系数。  K9 a$ d. S1 Y
" a  d6 u9 @0 u& a6 u' ]
具体地说,回归分析在一组数据的基础上研究以下问题:; [- E% [6 W- h3 l
12.png
& B# y- p3 t- ~1 ^0 f! d1. 建立回归模型
1 e& }- l( j$ g, G2 v
1 [6 z$ w8 O: z: m6 P2 a. D1.1 筛选变量
3 g& W7 z8 _8 m/ Q/ l6 Y8 J# V9 X
1.1.1 确定样本空间. G* R3 _- X% M5 J! J/ d; l3 S
11.png . [" J( Q2 e" v6 y

9 O) X  T/ G! r' m2 [  Y) H所构成的数据表可以写成一个n×m n \times mn×m维的矩阵。
2 b. h9 J3 M% ]% m/ c% S$ U8 V# j# ]) ~
1.1.2 对数据进行标准化处理1 D$ L5 s. J+ v( `& G7 A- L

& R, E1 H* _- _3 U, e(1)数据的中心化处理
( [* Q" I$ z0 Q' ?3 ]% O5 X实际上就是平移变化,+ G2 _& Y+ {4 _/ l2 B

- v- X) Z6 q3 w  l) c$ x$ b  ` 10.png
, r$ u8 H: z; a0 h" M5 n9 F& N  F2 {这种处理,可以是样本的均值为0 00,同时它既不改变样本点的相互位置,也不改变变量间的相关性,但变换后,有许多技术上的便利。- }  \1 q9 b) E  E4 d, b
(2)数据的无量纲化处理
6 c1 y+ [3 x5 q- g( c4 r- H在实际问题中,不同变量的测量单位往往是不同的。. w; c' |) X( L; H# r
为了消除变量的量纲效应,使每个变量都具有同等的表现力,数据分析中常用的消量纲的方法,是对不同的变量进行所谓的压缩处理——使每个变量的方差为1- h9 m( P8 L* F9 T# `
即,
) I5 z$ C2 V7 c5 e7 b# l4 N1 v+ x# p+ `; W" u2 S" z7 ], H" @4 G" i
9.png
+ D7 Z) {( m9 d9 y  ~( t: w, a当然,也有其他消量纲的方法,此处不一一列举。: s; _. M1 f) z" Q% J
(3)数据的标准化处理——对数据同时进行“中心化-压缩”处理. D" C  Z0 I! ^/ i6 z
即,
7 j% \8 [: \3 o9 R) E# o
: m6 d9 h3 N2 K$ z& c4 j! ^# l 8.png " m+ i9 i6 r3 ]' x' y
1.1.3 变量筛选
  @4 t- O) V6 h2 u" J9 X1 ^# a! Y
" r; K; F2 B. `3 Z2 ~2 E. T- d——选择哪些变量作为因变量的解释变量:
* J8 S: v" U7 o( W4 x- Z( \. ]/ Z3 v2 T0 L
一方面,希望尽可能不遗漏重要的解释变量
' |3 O8 `! A0 Y5 ~" z3 x一方面,遵循参数节省原则(自变量数目过大时,模型计算复杂,且往往会扩大估计方差,降低模型精度),使自变量的个数尽可能少  o2 p& D3 g" c/ V* J
(1)穷举法
* A+ ^( {4 n3 z( p% \5 S" Q列举出所有可能的潜在变量,再根据自变量的不同组合,选取合适的模型。9 |: d6 D: U& P
假设有m mm个潜在变量,则需要拟合与比较的方程个数为2m 2_m2
* Y3 H: N1 s* r( Y0 mm
: @( `* P8 a; }2 T3 Z$ I​        . N5 o3 g7 f8 M' x- O2 m/ e
——当m mm较大时不现实/ {  W* L9 _& Z2 }
) O  `1 a) Y& C& o0 D
(2)向前选择变量法
) K) q' y# [9 J( D8 i 6.png
4 \/ q, l# o+ U: J5 t5 m2 }* n8 f5 G1 }
4 y! Z, r4 ?  i& D0 f, T1 T$ t

) p/ c4 \+ z, R6 r" G0 y+ M& M 7.png 4 o' i$ Z4 P0 c/ N. u, Q

& v" b/ X: J- X) a7 d5 d4 Y$ u(3)向后删除变量法# B7 |6 q( l0 {) q4 C
4.png 8 f1 M! ]3 {8 _
(4)逐步回归法——最常用. P3 q% Z) @& |* w) R
5.png
$ B. Z3 w% R! d/ |: P7 J& V5 Z4 {8 D3 m( W0 Q! D/ K
1.1.4 调整复判定系数; d2 c9 Z; Z# @4 k
3.png
& B# H( G$ ^5 C( C* e* m" O5 G9 e1.2 最小二乘估计" h0 Z% l$ A$ E3 v

/ t, |4 H+ X9 l+ J2 [$ o+ Y一元线性回归、多元线性回归——略。
; q5 d  h4 p6 ^  \1 x1 l. @9 Z& [
3 M% ?& v+ m2 a: t- ]2. 回归模型假设检验% W8 O* y3 }# W$ c
, V6 F& \. Z# B8 S  F' ?- y
——检查自变量与因变量之间能否用一个线性关系模型表示(F FF检验)3 _# q" d" G. }- r5 f8 {* H

) C/ k4 }  D# R& q% u具体检验方法见书,此处不再赘述。
* B5 r, J1 O$ A! T
) H! j8 K; Z/ t3. 回归参数假设检验和区间估计9 Y/ f& K( l' ^# i% K7 |# R

0 b) {) R3 t- K4 W2 U——检查每一个自变量对因变量的影响是否显著(t tt 检验)
1 [3 z/ W5 U7 j; o% s* T
3 _+ o! \) S4 i/ C3 B$ s具体检验方法见书,此处不再赘述。& Z% s! `" l" i) N( y8 P  z

: u3 L+ g& o/ x' f5 T4 q! B! \4. 拟合效果分析
1 a; g  P8 I- F3 j/ e: ?) y! A4 i
7 n, ]2 F% E, l4.1 残差的样本方差(MSE)8 R6 q& `- S$ ]3 t
2.png
- ], w; g( R' j5 F2 N* n) ]7 f
. i4 W3 r- a" O+ z8 A4 e4.2 判定系数(拟合优度)6 ]' C$ b# u; _5 o' P! W* t, D

, h) \% R! Y) u; x. h 360截图165011039490135.png , |( Q# [$ d* O/ M( D* i1 T
2 i8 s7 {8 b: }- n
5. 利用回归模型进行预测
+ W7 B6 P, M4 r7 d$ F+ n1 w  a

5 o" @$ h$ L/ S
9 o2 e: z+ q' Q) f$ J/ ?其他
8 F+ m1 x9 |* c9 c1 S# C/ w( g) L7 H+ q/ F( G8 T* }
偏相关系数(净相关系数)) x; D, |- W- g8 d

, i7 g% \+ L* `5 ]" o5 U在研究两个变量之间的线性相关程度时,可考察这两个变量的简单相关系数。但在研究多个变量之间的线性相关程度时,单纯使用两两变量的简单相关系数往往具有虚假性。因为它只考虑了两个变量之间的相互作用,忽略了其他变量对这两个变量的影响。+ M" G- Z1 A: b' U3 `
' z3 w6 Z+ @6 Z8 \
复共线性和有偏估计方法
+ w. W: A- N& I  i) t* T
, O. ?5 Q% L4 \" i9 ?' ]在一些大型线性回归问题中,最小二乘估计不总令人满意,比如系数正负号与实际意义不符,这可能是因为回归自变量之间存在着近似线性关系——复共线性(Multicollinearity)6 p5 x/ U1 c! [6 {( G

' B8 @. P% }! H解决方法——牺牲无偏性,改用合适的有偏估计方法,以改善估计的稳定性
7 I% D/ T7 l9 _4 h' P1 O. \例如,岭估计——可以显著改善矩阵列复共线性时最小二乘估计量的均方误差,增强估计的稳定性。
- Q: m$ |6 o; I1 w. E% z1 n(P.S. 均方误差Mean Squared Errors:一个好的估计应该具有较小的均方误差): I& Q) F2 p8 }. j2 H' G% D# W
. H- i) E  b( s) e! y
再如,主成分估计——可以去掉一些复共线性9 c7 C% Y* t9 U; }1 S: Q2 [/ E
* s9 m$ I9 ]/ b* m; O& n
小结. {: U5 d$ P8 p6 Z& q$ R

) {& H" Y/ ]$ v+ [9 e( m" Y- I采用回归模型进行建模的可取步骤如下:
5 E9 y/ u; ]" T
6 U4 @1 W, `7 J) J$ [3 O建立回归模型& Y* R4 E; v+ P0 y
确立样本空间,对数据进行标准化处理,采用逐步回归法筛选自变量
+ W! R  l& ^; U7 O原文链接:https://blog.csdn.net/xxiangyusb/article/details/99762451
8 r. F2 L2 p3 e: y0 X8 d# W4 t' c

/ u+ X* v. r( n5 i' w




欢迎光临 数学建模社区-数学中国 (http://www.madio.net/) Powered by Discuz! X2.5