- 在线时间
- 1630 小时
- 最后登录
- 2024-1-29
- 注册时间
- 2017-5-16
- 听众数
- 82
- 收听数
- 1
- 能力
- 120 分
- 体力
- 566735 点
- 威望
- 12 点
- 阅读权限
- 255
- 积分
- 175243
- 相册
- 1
- 日志
- 0
- 记录
- 0
- 帖子
- 5313
- 主题
- 5273
- 精华
- 3
- 分享
- 0
- 好友
- 163
TA的每日心情 | 开心 2021-8-11 17:59 |
|---|
签到天数: 17 天 [LV.4]偶尔看看III 网络挑战赛参赛者 网络挑战赛参赛者 - 自我介绍
- 本人女,毕业于内蒙古科技大学,担任文职专业,毕业专业英语。
 群组: 2018美赛大象算法课程 群组: 2018美赛护航培训课程 群组: 2019年 数学中国站长建 群组: 2019年数据分析师课程 群组: 2018年大象老师国赛优 |
5 n- [5 F9 y. W7 P) R2 _
1 l& O% s3 V; M' Q0 l数学建模之回归分析 % X# ^1 T8 G7 D' X, u* s c
4 e& t' t; M! F) j应用场景 q, q1 x: @. i9 J/ h- o# k
1. 建立回归模型# s0 g: Y4 p' t$ ^
1.1 筛选变量
7 [- r+ ]& k4 M: t9 H& g: t/ L1.1.1 确定样本空间
( X+ K) S4 O9 g" q: n2 X5 F5 l* Y1.1.2 对数据进行标准化处理
: K w( H5 s l6 r7 ?1.1.3 变量筛选
# O* Y* i: H+ d2 A$ x0 W1.1.4 调整复判定系数
' ~7 S& L+ r# H3 F0 S% ~: N. Z1.2 最小二乘估计4 _$ T* h7 G, V z; R. G
2. 回归模型假设检验
4 U& Y& U! ^: k' D! x1 a5 @9 ]( r3. 回归参数假设检验和区间估计' Y% C' q, C9 |' T: S
4. 拟合效果分析: o* N, ^; D1 ?' P" ?
4.1 残差的样本方差(MSE)
# W3 w% J9 |3 ]& ^( m5 {2 l* f4.2 判定系数(拟合优度); U* [- R. H8 ]" x, A$ V$ e5 }+ ]
5. 利用回归模型进行预测! }6 v: @; ^ A& c5 t1 ]7 C
其他
# w- `& t! }3 V, U, @; f偏相关系数(净相关系数): y: ?+ e4 Z. X
复共线性和有偏估计方法
1 D% K+ G% `1 P& h- `0 G小结
% v, J/ Q- [' Z应用场景! Z8 H7 ]7 o# K* {2 ]
2 ?+ {- `2 w$ f; u( ]
简单地说,回归分析是对拟合问题做的一种统计分析。 J! Q9 k5 p4 u& o1 z
P.S. 曲线拟合问题的特点是,根据得到的若干有关变量的一组数据,寻找因变量与(一个或几个)自变量之间一个函数,使这个函数对那组数据拟合得最好。通常。函数的形式可以由经验、先验知识或对数据的直接观察决定,要做的工作是由数据用最小二乘法计算函数中的待定系数。( Q1 m V! j# T, F2 m: Q
6 Y- y; U) h. h1 Q3 n+ d. i6 d
具体地说,回归分析在一组数据的基础上研究以下问题:' l$ |, u6 }; A, m8 g
& O8 U! G$ N. L9 f2 v1. 建立回归模型9 {0 G! X4 H, c P
2 T; o. u7 w# g% Q8 ~! B0 g* T1.1 筛选变量5 g, ^9 m" w/ f+ j( `# O
* V5 h, ^9 C9 v/ i( G5 J1 Q
1.1.1 确定样本空间
/ Q1 U: g% o+ T+ L6 Y, Y/ t! O, U) q
5 y( l$ {, D9 m: e
. z7 Y; a( {8 h5 A
所构成的数据表可以写成一个n×m n \times mn×m维的矩阵。7 r! ^0 N, s9 [6 X! F
& F4 z( Z( h! _
1.1.2 对数据进行标准化处理" v* e4 h6 y4 q' p) R; V+ g
, f* P( h0 A, a/ x: c( f, _+ \: A
(1)数据的中心化处理
; g4 r, B2 q7 {/ B- s实际上就是平移变化,
) @6 K5 |" V0 K7 V- S) r7 l7 ?1 x6 F1 P! d/ [- S+ f1 D/ Y
, O9 D5 z7 I2 k# m+ k0 f这种处理,可以是样本的均值为0 00,同时它既不改变样本点的相互位置,也不改变变量间的相关性,但变换后,有许多技术上的便利。( Q3 C, f' F5 S' d4 e# ~4 B- k
(2)数据的无量纲化处理
# ]; v! _/ `5 W1 ~; J' N在实际问题中,不同变量的测量单位往往是不同的。
& Z- U% C: s# M7 J g( F为了消除变量的量纲效应,使每个变量都具有同等的表现力,数据分析中常用的消量纲的方法,是对不同的变量进行所谓的压缩处理——使每个变量的方差为1
1 r. Y P1 G& f即,
+ @( b/ C8 W) _1 S# ~1 D; U+ \3 O( L
" H2 t+ i- v2 ]3 v; J
当然,也有其他消量纲的方法,此处不一一列举。: r; B4 u% n1 R5 [0 I. u
(3)数据的标准化处理——对数据同时进行“中心化-压缩”处理
& p( f: B* e- _6 ^. o7 V, h. r$ H- O7 w即,6 w Y# K$ Q4 S
6 K. P9 ^/ `0 U. T" i
- G7 A @& c; y5 U' I
1.1.3 变量筛选
1 Q1 r$ E1 Q8 Q4 D' h q& z( v7 `1 H: F% J
——选择哪些变量作为因变量的解释变量:
& W( g5 l1 j$ X7 A$ ~
: L3 e8 T# Q: g0 q5 ^' y一方面,希望尽可能不遗漏重要的解释变量. O. V) \- d* m
一方面,遵循参数节省原则(自变量数目过大时,模型计算复杂,且往往会扩大估计方差,降低模型精度),使自变量的个数尽可能少
8 `8 T T: \0 p' D(1)穷举法# l* s" r# r4 F I
列举出所有可能的潜在变量,再根据自变量的不同组合,选取合适的模型。
- j- d7 h1 k* i2 I# I) P+ {假设有m mm个潜在变量,则需要拟合与比较的方程个数为2m 2_m2 / W! H- Q+ {* L- G [6 K& K/ b
m' {$ {7 H6 M# H# M4 @9 @, r
; Y7 @; o2 n" z Q; c# R2 f- N: F3 j+ a
——当m mm较大时不现实
$ L! J# R, g/ A8 A
' d: V8 B* w: H$ B3 j(2)向前选择变量法
( Y( j% t6 S! [# m2 _- d+ H j
; X" `1 Z4 x! Q0 G G* N* r
4 m( x! f, n v; N1 q, R" q2 G) W' L" V# {
9 p4 P& m# y! k8 V( m3 s
$ ^# S+ D* u" w1 G% W9 x$ p0 J- H' x, ^: |
(3)向后删除变量法; d* t# r0 u0 N; D
7 `6 z. {& L: ~1 y j(4)逐步回归法——最常用4 i1 R: C- t E
! J0 Y8 ~ d0 N! G5 ?, Q+ d
1 i) D8 v- L% D$ ]9 }1.1.4 调整复判定系数) Z! [7 P N/ c( X6 Z4 x/ F
* A: }( P! |& m) Q6 R8 o/ I- z1.2 最小二乘估计
9 E. M& S' Q1 d4 e* b1 Y4 P9 z- l
' f: _1 X5 q8 U一元线性回归、多元线性回归——略。# {: @. x8 A2 W2 m/ V! ?$ J
" h: m+ {# }2 H. H9 D" v% ~
2. 回归模型假设检验
2 z- S6 P y2 Q3 w- t: E4 g7 ?( W8 v
——检查自变量与因变量之间能否用一个线性关系模型表示(F FF检验)
9 t! j% s+ f& V
/ q9 x6 p5 ~ l9 h具体检验方法见书,此处不再赘述。
7 q7 v! p7 _5 R$ S/ ?$ k6 W5 r
7 ~' g" Q# N5 Y/ b3. 回归参数假设检验和区间估计
& a& r; J: H/ Z, B+ o4 \* u3 m
& C; v2 z2 J0 {1 U/ y, q——检查每一个自变量对因变量的影响是否显著(t tt 检验)
4 B2 z. \8 j% t' V% C6 m/ ?& r
- p" F: |* h/ F4 B7 l& I具体检验方法见书,此处不再赘述。2 @5 r- K1 S- A$ D4 [& s4 T# T
' s# R1 ~( @; y0 R3 r/ |) f4. 拟合效果分析
# g/ f8 B# a* \) c
: V% d- A- S. T. t5 a4.1 残差的样本方差(MSE)
$ `. q: q2 p, J# s9 Z
5 J* l- k0 Z6 `, d+ h
! O# Y9 B3 x0 q
4.2 判定系数(拟合优度)
5 V* ~- q% j7 U* y6 `
9 n( S0 ?1 s) l) i# |' S$ ~1 c6 a
$ z: b! z4 m Y( D, a5 k6 [+ j3 ]" i
5. 利用回归模型进行预测
" I* ]% F5 e' s5 ^5 p# G. u![]()
# L! Y4 k+ y7 X+ P; V2 U0 z* d& {4 H& F, k
) B) {$ h& o- m1 X8 F
其他
0 `3 _/ y0 x: C1 B$ ~: I1 G
& ^& K0 i5 D: B! X偏相关系数(净相关系数)
2 N% v# c/ a) b5 R8 M% g+ W, P. M- _& }+ H9 X
在研究两个变量之间的线性相关程度时,可考察这两个变量的简单相关系数。但在研究多个变量之间的线性相关程度时,单纯使用两两变量的简单相关系数往往具有虚假性。因为它只考虑了两个变量之间的相互作用,忽略了其他变量对这两个变量的影响。
9 z! [+ J; g/ }5 `6 A5 B L& m
, X7 @' h; o1 A/ @4 W+ |+ s2 a复共线性和有偏估计方法
) P1 J7 U9 T* d8 @8 ]1 p) A, F. g5 h- x
在一些大型线性回归问题中,最小二乘估计不总令人满意,比如系数正负号与实际意义不符,这可能是因为回归自变量之间存在着近似线性关系——复共线性(Multicollinearity)3 `& Z6 y+ p! x2 \; ~( [
0 i8 N: Q+ B( k- T$ r
解决方法——牺牲无偏性,改用合适的有偏估计方法,以改善估计的稳定性
9 p- @; N- Z2 Q- M5 v0 L例如,岭估计——可以显著改善矩阵列复共线性时最小二乘估计量的均方误差,增强估计的稳定性。
' ]$ Q' \+ H2 G% b: D: J(P.S. 均方误差Mean Squared Errors:一个好的估计应该具有较小的均方误差)8 F* _$ P6 E1 y0 w
; D8 V( W$ p. h/ A- E, i: R
再如,主成分估计——可以去掉一些复共线性
* R0 Q) U: c `! m
2 ?3 r: M' {% U, _( ~; \7 Q小结0 `4 F( R0 |1 K1 y9 r `
8 Z2 Y( y4 x. \: W0 U- R采用回归模型进行建模的可取步骤如下:
2 n9 w* @. _9 K) @* E# h' H5 o
# M$ a' \% M* H" ~: E( c3 p建立回归模型$ w. a, r1 d$ T; C
确立样本空间,对数据进行标准化处理,采用逐步回归法筛选自变量
* `- R# `/ F9 i原文链接:https://blog.csdn.net/xxiangyusb/article/details/99762451; r6 ?- M) c* ]+ T
3 a u" N8 A; _2 o- m1 n
! K$ E, l) u7 c! }6 j6 v# R u5 s$ ` |
zan
|