- 在线时间
- 1630 小时
- 最后登录
- 2024-1-29
- 注册时间
- 2017-5-16
- 听众数
- 82
- 收听数
- 1
- 能力
- 120 分
- 体力
- 566760 点
- 威望
- 12 点
- 阅读权限
- 255
- 积分
- 175251
- 相册
- 1
- 日志
- 0
- 记录
- 0
- 帖子
- 5313
- 主题
- 5273
- 精华
- 3
- 分享
- 0
- 好友
- 163
TA的每日心情 | 开心 2021-8-11 17:59 |
|---|
签到天数: 17 天 [LV.4]偶尔看看III 网络挑战赛参赛者 网络挑战赛参赛者 - 自我介绍
- 本人女,毕业于内蒙古科技大学,担任文职专业,毕业专业英语。
 群组: 2018美赛大象算法课程 群组: 2018美赛护航培训课程 群组: 2019年 数学中国站长建 群组: 2019年数据分析师课程 群组: 2018年大象老师国赛优 |
4 H6 H; l( p S3 o$ K
& E" g7 V" `; u# ~( O数学建模之回归分析
7 w3 S$ p. [$ e+ ~- Q7 o. y. c; f( f) j
应用场景
' x+ C" ?) y1 d7 ?1 O8 S, b1. 建立回归模型
1 l% n9 l3 h8 n/ _3 V1.1 筛选变量
9 u' L0 I8 E, I; m! k% S1.1.1 确定样本空间
9 A0 M% p5 n8 v5 ~, W1.1.2 对数据进行标准化处理2 ]# V# `0 P; a
1.1.3 变量筛选- s7 n$ y7 K$ G/ R, q
1.1.4 调整复判定系数1 B) x: ~* z$ d( D3 |! V
1.2 最小二乘估计# |' f0 l( F O( x
2. 回归模型假设检验9 q9 E( l" ~! d( b7 p6 O3 ~# F
3. 回归参数假设检验和区间估计- H2 ?$ w- F9 R& r+ P a' v
4. 拟合效果分析
, f, ?8 L+ o4 ^4 {4.1 残差的样本方差(MSE)" B1 @4 l. T) [. l: ~/ S/ t
4.2 判定系数(拟合优度)
7 D7 c8 }! {% v$ Y; u" F8 T5. 利用回归模型进行预测7 F8 X6 Y9 h$ x0 H8 ^- L* N
其他 R6 c$ h/ G* m9 N4 @; ?: X
偏相关系数(净相关系数)
& U2 G2 }' u. r1 R* F! J复共线性和有偏估计方法
( K" U6 [ ^0 K, H+ c小结
1 i* F/ t* ~6 o& W6 M) m! `应用场景
1 j7 I" b- ^' w+ A7 N' h3 `
?6 ]* O* a2 H* @* J简单地说,回归分析是对拟合问题做的一种统计分析。
" t# h( z' x8 JP.S. 曲线拟合问题的特点是,根据得到的若干有关变量的一组数据,寻找因变量与(一个或几个)自变量之间一个函数,使这个函数对那组数据拟合得最好。通常。函数的形式可以由经验、先验知识或对数据的直接观察决定,要做的工作是由数据用最小二乘法计算函数中的待定系数。5 `9 W* R& [5 y/ ?2 o; f- G0 |
" S j& ^: J0 @0 f0 D
具体地说,回归分析在一组数据的基础上研究以下问题:
: h: B# e# E0 R) i
d, [: N( C6 m; ^7 W1. 建立回归模型" c9 h" Q) x4 n( |5 B8 q: c( D
3 h. l3 ]3 E! N3 t ~
1.1 筛选变量
; k7 _; h, Y- Z- b
% S3 m2 |9 G$ I, w8 j8 N1.1.1 确定样本空间
& i5 B6 v6 J( C$ N; C8 V) O
5 P$ L* {) ~6 p3 p' G1 Y3 }4 e9 I& d- U0 N. e& x$ a; L! ]
所构成的数据表可以写成一个n×m n \times mn×m维的矩阵。
, c9 p4 z$ Y% t) \1 w2 K# |
; @! S3 B4 U9 P( d1.1.2 对数据进行标准化处理
" I+ |8 O1 K4 s7 q: t
i" l1 w+ L# z, e- O! Y; ~# T4 c(1)数据的中心化处理
% b& {% F9 V& h7 W* M实际上就是平移变化,4 [. z# V/ _$ m3 o ^
& K1 o: g% K" U4 f/ ~
6 T' O& M; h" B
这种处理,可以是样本的均值为0 00,同时它既不改变样本点的相互位置,也不改变变量间的相关性,但变换后,有许多技术上的便利。, V& z' ^' S6 `; r
(2)数据的无量纲化处理7 \' _- H; j) Z: g
在实际问题中,不同变量的测量单位往往是不同的。
3 o, I F( w9 n% S: Q0 U为了消除变量的量纲效应,使每个变量都具有同等的表现力,数据分析中常用的消量纲的方法,是对不同的变量进行所谓的压缩处理——使每个变量的方差为1
: Z, A ]6 \( `2 V$ r4 @即,
! [6 v: K2 Z& H) z5 M: |5 o: t( T/ a# H0 n
; |" ]+ `9 o& C7 k2 A7 T# U当然,也有其他消量纲的方法,此处不一一列举。
, c7 D3 u& T+ t(3)数据的标准化处理——对数据同时进行“中心化-压缩”处理. H1 f/ j. t, z3 O* r
即,
3 h5 R8 L! l) j& r) |* j V3 b0 a, ]
$ y/ M. b& w+ E2 A1.1.3 变量筛选1 C8 i0 D/ [( M$ c4 O, Q5 \
7 s$ j, g( G1 X. q8 x- W' R Z——选择哪些变量作为因变量的解释变量:/ N( K& S0 T: y3 K4 h/ N! f
1 S+ Z- Q2 x2 s
一方面,希望尽可能不遗漏重要的解释变量1 O* h2 t0 P$ f; g3 x; R
一方面,遵循参数节省原则(自变量数目过大时,模型计算复杂,且往往会扩大估计方差,降低模型精度),使自变量的个数尽可能少0 g- `, l4 ?* G2 l2 T
(1)穷举法$ v# Y7 l/ P9 t7 J* Y
列举出所有可能的潜在变量,再根据自变量的不同组合,选取合适的模型。
/ Z$ ?. L1 Z* ]$ [4 f假设有m mm个潜在变量,则需要拟合与比较的方程个数为2m 2_m2 ; v* h) k9 E& P6 \8 {- n( n. H
m
- P5 h2 F) J3 L$ X7 P# E
2 ?; q2 K( y( Y* x ——当m mm较大时不现实
+ Q& g' {2 \( N4 B% ^- y* {
, y( P' d% z# s' F6 Y0 B; `(2)向前选择变量法0 a# z3 B' L4 P5 Y/ a$ E. R0 ]
& x% ^2 L2 ]- Z9 F$ u
: `. H9 C2 v" q& g) A9 f" r
9 `' f# z6 H9 S6 j
, b5 X$ J" w9 `4 o! J r' D' [5 Q
& ^8 z: o, I: S6 p8 y" e' g+ @0 K+ P( C/ L% V
(3)向后删除变量法
F, Z, o' r, ~8 ^- Z( T" W- P
8 d# n+ O; o/ ?6 |
(4)逐步回归法——最常用
' J$ @- Y2 O0 I0 t1 `$ t% F
" b* ^/ f9 w) F# A$ `4 I, \: Y
& i) M: E5 b$ k! \& l+ W+ C, j1.1.4 调整复判定系数+ h( v$ a2 ?' D$ {
& S% H3 Y# R) I6 A4 n; O m
1.2 最小二乘估计
, n+ i; z# W6 L2 n% X! S+ I
2 K1 }& z# D. N' g; _一元线性回归、多元线性回归——略。
4 @4 J1 o( l# m k4 k2 C& J1 Y p- x* i/ O, `% _
2. 回归模型假设检验
3 j* _) H a3 g4 r
8 i/ D' A: u: |0 U) @; l——检查自变量与因变量之间能否用一个线性关系模型表示(F FF检验)# d+ Z r* Y, g
+ }4 |- W: k- u具体检验方法见书,此处不再赘述。
* [* W5 l, _+ e" Y) [8 Q
- k; s" K/ _1 k! A+ }; L( W7 }# E3. 回归参数假设检验和区间估计7 E, M9 |( k" g) Y! p( M
7 c2 W5 @6 L: z) b2 e; x; R
——检查每一个自变量对因变量的影响是否显著(t tt 检验), G- I: ^' C7 b- z- R
5 x5 H8 _9 m1 ~5 X% l/ Z
具体检验方法见书,此处不再赘述。
* Y9 q$ z' ]. D2 H; A
3 E7 o( t, e9 c) f7 u c4. 拟合效果分析
1 n7 P* g0 W' O8 T+ `4 I3 c4 G, v: y6 I* v F- |7 C
4.1 残差的样本方差(MSE)2 J8 Z6 Q9 f+ e5 T: @
+ U" [# U: W, V& g; v1 I0 d0 f; ^
n6 e6 w' d! u) n4.2 判定系数(拟合优度)
4 g# I7 p. O8 @2 u
/ Q: X4 Z) C, f! S9 v5 t% |3 c
/ Z# I- ^9 B+ T# w
! s& G5 U* c% E& \1 G3 X5. 利用回归模型进行预测
+ q; E/ ?% Y. A![]()
+ t4 i4 t: {8 z1 X, w( x/ t1 @8 a# e( f! ?3 }
5 ^% ^0 v; j$ \) s9 s其他/ }5 i4 ~! Y2 L8 V0 b U
* v* X( u F( }偏相关系数(净相关系数)
+ u8 j# ~; N+ J
7 @9 @0 b W2 @2 U% B& O! e在研究两个变量之间的线性相关程度时,可考察这两个变量的简单相关系数。但在研究多个变量之间的线性相关程度时,单纯使用两两变量的简单相关系数往往具有虚假性。因为它只考虑了两个变量之间的相互作用,忽略了其他变量对这两个变量的影响。
" e. |2 s4 D. S" e% Z/ K1 U2 X
2 M A, W' }5 c6 ^" \2 v复共线性和有偏估计方法4 a! k* Z- {& S+ h
: x' s/ t6 ] \3 j" {7 b4 B2 T Q在一些大型线性回归问题中,最小二乘估计不总令人满意,比如系数正负号与实际意义不符,这可能是因为回归自变量之间存在着近似线性关系——复共线性(Multicollinearity)
$ Z! _# t( O& x1 s5 [' Z7 E
T% Z; H) z8 J9 W解决方法——牺牲无偏性,改用合适的有偏估计方法,以改善估计的稳定性! X3 r7 v2 \# H3 Z
例如,岭估计——可以显著改善矩阵列复共线性时最小二乘估计量的均方误差,增强估计的稳定性。
/ Y5 n! D. p W, ]" Z(P.S. 均方误差Mean Squared Errors:一个好的估计应该具有较小的均方误差)) n' J. R$ ~7 i1 \1 |. m7 C
" i# O! q0 s3 ?3 e0 Q% r& E
再如,主成分估计——可以去掉一些复共线性
# W$ R* v3 B& I- j+ s; M* x4 U* w* _. w2 F+ [) f% a
小结
* o( B" `- t5 D2 V' P6 ^
: _( i9 ?; W2 K/ h: G采用回归模型进行建模的可取步骤如下:
z" N7 A4 t: `
( I& n( m- U2 r4 I建立回归模型& q% y3 \8 ~) W3 v
确立样本空间,对数据进行标准化处理,采用逐步回归法筛选自变量6 w& G+ E/ _2 M0 A7 `0 r" w3 u% r( H/ A
原文链接:https://blog.csdn.net/xxiangyusb/article/details/99762451% L, I; u7 V3 n
: N, U8 T# Q" P4 {1 ]. v5 `
9 ^8 @% c) Y3 R1 b |
zan
|