数学建模社区-数学中国

标题: 数学建模之回归分析 [打印本页]

作者: 杨利霞    时间: 2020-3-13 15:12
标题: 数学建模之回归分析

- X6 T: N* z, U5 t# V* W- O" M( \; B5 h9 g
数学建模之回归分析
* p% A. D& x: K# w$ `1 Q

& o" }" z* o, F% K) V! z, F( p应用场景
/ y& ^# V5 o4 s0 e4 v; [: V: D1. 建立回归模型
4 q$ b0 ~; i" s+ D! U* e* ^, z& f! |7 N1.1 筛选变量2 W' j3 Q# S2 [* I7 I
1.1.1 确定样本空间
: h1 W% ~3 `; s1.1.2 对数据进行标准化处理
; m/ Z4 f! q3 G1.1.3 变量筛选1 Z* u' l- g: X! S/ m: P0 L
1.1.4 调整复判定系数0 `$ W  w6 y/ j
1.2 最小二乘估计
' ~9 b8 \! c, ^! @" E! W5 ]2. 回归模型假设检验
8 |5 g. N. M4 S3. 回归参数假设检验和区间估计8 v/ S! o( W0 C/ [  @
4. 拟合效果分析& e4 ?, P& @. e5 n1 b6 D
4.1 残差的样本方差(MSE)
2 O( ~3 z0 v/ N7 d! h. R4.2 判定系数(拟合优度)
, {, A+ |* r( m9 s& K5. 利用回归模型进行预测. M6 ]' H6 X# {
其他
1 z' }( A" q6 _# `9 K  k9 s1 k偏相关系数(净相关系数)
3 Y* D4 Y, o* c+ h( e. R. n& T复共线性和有偏估计方法
  v$ a! [  g3 y) u, Y小结7 C' q1 g. v8 G! z( X
应用场景
7 Y5 l- @6 j* Q) o4 t. ^8 g
) R3 ]$ P$ i- E# k/ O5 m简单地说,回归分析是对拟合问题做的一种统计分析。
" X+ s( v2 p& e' C6 N( \- MP.S. 曲线拟合问题的特点是,根据得到的若干有关变量的一组数据,寻找因变量与(一个或几个)自变量之间一个函数,使这个函数对那组数据拟合得最好。通常。函数的形式可以由经验、先验知识或对数据的直接观察决定,要做的工作是由数据用最小二乘法计算函数中的待定系数。
) E7 {: x! z, n
! G1 y# b& f! `- e5 ]: v具体地说,回归分析在一组数据的基础上研究以下问题:
' E+ w. f( W) { 12.png
/ h2 F$ b- u& u- f7 h1. 建立回归模型. I! R  I( W/ ]8 J, }
1 [& q( n/ ]8 R0 p  e8 a
1.1 筛选变量* d$ P  j3 _% V( F7 U

+ n- S6 W3 o: \; _5 T' f  ?1.1.1 确定样本空间
( d) N) J! K5 I8 M. k) f+ _ 11.png ; ~- h% c7 K$ t" w

* ?* K" S# G) J, ^; Q* O3 l. k所构成的数据表可以写成一个n×m n \times mn×m维的矩阵。( @8 }  O: c6 r6 ]% O8 |9 x9 }$ J

) `5 E8 k6 L, j1.1.2 对数据进行标准化处理5 g& M1 |4 i6 B

! u+ M. ~  p" L" D(1)数据的中心化处理+ E7 O) h8 l! L/ W
实际上就是平移变化,
  u$ i  v& C8 j/ D! ?
5 ?& }8 u$ t' K$ I 10.png 0 m. y! S: R$ Q# o
这种处理,可以是样本的均值为0 00,同时它既不改变样本点的相互位置,也不改变变量间的相关性,但变换后,有许多技术上的便利。, i6 }5 p+ [& a+ x4 m
(2)数据的无量纲化处理# P3 v. t/ d7 R- `: S( O' N! G
在实际问题中,不同变量的测量单位往往是不同的。
' `+ d% T: j4 `# a/ ]* v2 T$ r7 C# Z为了消除变量的量纲效应,使每个变量都具有同等的表现力,数据分析中常用的消量纲的方法,是对不同的变量进行所谓的压缩处理——使每个变量的方差为1( ], l6 R# a+ |# Y4 E4 r4 \' g
即,
( y1 B8 x0 |5 A( Z( B3 @7 e+ s$ b/ t0 v, _
9.png
& R# Z% S$ K$ m" g9 o& W; M当然,也有其他消量纲的方法,此处不一一列举。
$ w- r5 I( z3 M" z  C; l: B(3)数据的标准化处理——对数据同时进行“中心化-压缩”处理- A  _/ _) ~2 J% Q- p% I
即,! m' q8 x+ U* t# M9 R6 A) V' Q
/ d' s$ B7 f* {' q9 J7 I8 |
8.png
5 s. t; Y* W4 H1.1.3 变量筛选
! [- i  V  D" T, g) s& u5 h0 L- R: o9 Q
——选择哪些变量作为因变量的解释变量:
, i1 j0 F- D* P; w: F1 l, ^4 e& e! ], Z
一方面,希望尽可能不遗漏重要的解释变量5 u# P$ F1 ~8 w$ Q$ M$ S; m  A" G
一方面,遵循参数节省原则(自变量数目过大时,模型计算复杂,且往往会扩大估计方差,降低模型精度),使自变量的个数尽可能少/ v" X$ T  p1 e& B
(1)穷举法
, {9 v! A* A$ s+ T- z( E列举出所有可能的潜在变量,再根据自变量的不同组合,选取合适的模型。9 I3 F5 ~& E. w# ~2 }
假设有m mm个潜在变量,则需要拟合与比较的方程个数为2m 2_m2
6 e+ d* D# u. @" A! Y$ b  Rm" ^- m( w$ Y& R+ b" p3 s
​       
4 |& ^# o6 L: g3 l ——当m mm较大时不现实8 G1 L% X: X8 |; |0 d' P+ _

9 I: O0 S) C9 @! _* c& E(2)向前选择变量法+ @; C2 F8 L: j  ]; E( R5 c7 q1 V  O" ?
6.png ) d6 m9 c) P: \2 \+ C9 o* v& u

8 q6 K/ C$ [) l: I
' ^  G/ Q; g4 Q' G" E& E) V+ g1 b- m' F* \0 `; m( e6 `
7.png / ]. B! s$ j: L1 c7 @% O# W
9 Y5 U' l9 D0 a4 ^8 V
(3)向后删除变量法
7 w9 n5 o  S( b" v8 G 4.png 6 H4 ~, m5 D5 l* }
(4)逐步回归法——最常用" r" M- k- r4 |0 `
5.png
2 i$ U8 f7 ^1 s, g' `  }8 Z* I8 M
1 d: u( i7 `7 P8 U& \; D1.1.4 调整复判定系数
1 k! A- N" L* G 3.png
  k( d/ y0 [6 j0 m1.2 最小二乘估计
9 ^& {! _! H9 _* I1 {. G
. \9 e3 b& n0 P' r4 |! f一元线性回归、多元线性回归——略。3 l; Z" ?8 N/ D9 k. N
" t# n& E' K8 G- X- v$ C/ z
2. 回归模型假设检验
  c7 K6 k& E+ q4 c: @( l" J5 O, p7 D
——检查自变量与因变量之间能否用一个线性关系模型表示(F FF检验)
. p% j2 o4 ~0 T& P  M
( z) e  K) ^2 U+ |1 i  b具体检验方法见书,此处不再赘述。
2 a; O; }0 M: o0 C% Q' Z& O5 B1 J6 Q6 ?- }; b
3. 回归参数假设检验和区间估计" v) i# F3 G: h$ y

9 X- K& j, ?. f  j——检查每一个自变量对因变量的影响是否显著(t tt 检验)# A" I8 \1 v! D$ B, Y2 S

$ L" Y6 p+ y! P3 g具体检验方法见书,此处不再赘述。) N5 B* `) P# e* W
3 E% |2 j" d1 f3 X
4. 拟合效果分析" d9 Z1 ^7 S9 l5 r
( T! B; G' k2 ~* s/ s
4.1 残差的样本方差(MSE)9 r) f7 ^% ~+ E; {3 l' h
2.png 2 W+ p* Z5 I7 n8 ?

) E$ B9 i* Z0 y0 _* O* b! i6 F4.2 判定系数(拟合优度)5 ^. c/ Q! v: L
& \: B+ D: H, u7 k! Z5 ~0 A% M
360截图165011039490135.png
/ }( c( p) [' O  \8 i; f  N' v+ z3 X! k. N% n2 ^5 b
5. 利用回归模型进行预测$ F  [. y, `2 P' e6 S

- V+ f& E6 l- h3 t0 W( w! Z( Z5 l! u- x6 A& v
. A* ]. d1 G, v) E/ q/ U
其他4 d, V. M6 O! `, b. v# K( c# e9 }
3 ?& H; J" c9 X) \. J4 ]8 B
偏相关系数(净相关系数)
% X1 G# T0 p6 R* e' M4 ?4 Z/ \6 m, g: X# o+ S+ v- T8 [
在研究两个变量之间的线性相关程度时,可考察这两个变量的简单相关系数。但在研究多个变量之间的线性相关程度时,单纯使用两两变量的简单相关系数往往具有虚假性。因为它只考虑了两个变量之间的相互作用,忽略了其他变量对这两个变量的影响。6 O, @( g4 v/ x- K

3 \# ]5 G: L8 g+ h' g! N" r, P复共线性和有偏估计方法
) T! ]( o/ P* h1 H( @6 t' g3 ^2 p6 x" j; x6 ^- Y: {- r
在一些大型线性回归问题中,最小二乘估计不总令人满意,比如系数正负号与实际意义不符,这可能是因为回归自变量之间存在着近似线性关系——复共线性(Multicollinearity)6 |& y* G6 C2 t  `. ?( _! j8 c

) q* R) i# _( D8 K. Z解决方法——牺牲无偏性,改用合适的有偏估计方法,以改善估计的稳定性1 t8 t) l' g4 o' b4 Z9 Q5 a2 E
例如,岭估计——可以显著改善矩阵列复共线性时最小二乘估计量的均方误差,增强估计的稳定性。
3 D9 R4 ]$ s6 w0 `4 r' @(P.S. 均方误差Mean Squared Errors:一个好的估计应该具有较小的均方误差)  F5 N7 c9 O" b7 ]7 F' k9 W# t1 u: [

7 Y# Z6 H' D: a1 n再如,主成分估计——可以去掉一些复共线性9 R: L2 U" U+ {' S0 ]
. e( x3 U- @5 A" G* x
小结" M% Z( N# C$ j: s* P9 m  P/ P
7 F; z. C3 @3 E1 y% m1 L6 ?5 L
采用回归模型进行建模的可取步骤如下:4 B; c# q9 m- R: |5 W. [" V( G2 B

& h- I% q5 V- G: @9 J建立回归模型/ ^: b; `5 X8 p! k, E. }
确立样本空间,对数据进行标准化处理,采用逐步回归法筛选自变量
# V3 A. o1 `' H7 g5 A! d原文链接:https://blog.csdn.net/xxiangyusb/article/details/99762451
5 o% n3 r7 A+ M4 V8 [* _- H0 b" X* m1 f& i' x* I* e# t. j4 {0 G* y2 X
6 {$ s$ W  B# G; k





欢迎光临 数学建模社区-数学中国 (http://www.madio.net/) Powered by Discuz! X2.5