- 在线时间
- 1630 小时
- 最后登录
- 2024-1-29
- 注册时间
- 2017-5-16
- 听众数
- 82
- 收听数
- 1
- 能力
- 120 分
- 体力
- 565539 点
- 威望
- 12 点
- 阅读权限
- 255
- 积分
- 174885
- 相册
- 1
- 日志
- 0
- 记录
- 0
- 帖子
- 5313
- 主题
- 5273
- 精华
- 3
- 分享
- 0
- 好友
- 163
TA的每日心情 | 开心 2021-8-11 17:59 |
|---|
签到天数: 17 天 [LV.4]偶尔看看III 网络挑战赛参赛者 网络挑战赛参赛者 - 自我介绍
- 本人女,毕业于内蒙古科技大学,担任文职专业,毕业专业英语。
 群组: 2018美赛大象算法课程 群组: 2018美赛护航培训课程 群组: 2019年 数学中国站长建 群组: 2019年数据分析师课程 群组: 2018年大象老师国赛优 |
) \ E- N7 Z/ i/ @( B3 K0 f0 E- J* w
/ D3 Z( I& d! {& O/ j- ^数学建模之回归分析
) Y- x6 Q# r. k* D5 k( m2 V' ~4 \5 k/ M: w, O
应用场景: G, i" Q U( c" K5 R1 c5 i5 P
1. 建立回归模型
8 d) W) l8 Q5 G. A4 S1.1 筛选变量
6 v' ?) ?% x% K0 X5 f1.1.1 确定样本空间
2 U1 e- T8 _& v" t1.1.2 对数据进行标准化处理
3 G! U+ `' |/ x" e8 [/ V1.1.3 变量筛选, \4 o/ w1 G7 }2 [. \9 ~6 I! }
1.1.4 调整复判定系数
( N, x8 _; s$ S1.2 最小二乘估计+ c' _- n! O8 D. E; Y
2. 回归模型假设检验' [) @9 T5 Q6 R
3. 回归参数假设检验和区间估计
! \, R; P% h( d3 |$ d6 M4 R4. 拟合效果分析6 T# y3 V- I8 v- v
4.1 残差的样本方差(MSE). D5 e& R; T0 M! u0 M3 J7 }
4.2 判定系数(拟合优度)3 D& e+ P! ^2 F. r" Y. l2 T
5. 利用回归模型进行预测
, a% a0 C6 e+ I) Z其他
" k8 m6 X$ Z* g8 {4 f4 u& f偏相关系数(净相关系数)8 i) q/ o0 m# ]( u2 _
复共线性和有偏估计方法8 M2 k* V o& x2 j% P' ]" W$ ~3 b
小结
9 m8 a+ F: O$ r: S& [( A2 d! r; f应用场景
/ E/ f. i; Z3 f, N* F2 G, X! ?- s6 j2 S
简单地说,回归分析是对拟合问题做的一种统计分析。
1 {, e' \0 I9 m4 ]: mP.S. 曲线拟合问题的特点是,根据得到的若干有关变量的一组数据,寻找因变量与(一个或几个)自变量之间一个函数,使这个函数对那组数据拟合得最好。通常。函数的形式可以由经验、先验知识或对数据的直接观察决定,要做的工作是由数据用最小二乘法计算函数中的待定系数。7 |& E* E$ ~2 C& B; D* w
2 o. m* l: U6 d( ?具体地说,回归分析在一组数据的基础上研究以下问题:
2 a! ^" c! o2 c0 Y. ?
" R# U" A0 l6 V+ Z6 {8 I1. 建立回归模型- v0 o1 S0 j: ]5 s0 v. F' v
: o1 O% ?4 k5 n5 O1 V6 X! U8 O1.1 筛选变量; z. b% b2 A9 r
/ Y+ ?! A: o, h$ O! k, B& U' [1 A" ^1.1.1 确定样本空间
6 h7 c5 w2 `9 F7 B
5 c' r+ J$ R' m% a7 X
' v7 |/ K2 I7 z9 a3 Q4 j j所构成的数据表可以写成一个n×m n \times mn×m维的矩阵。2 R1 p8 I% @* C8 X. Z
}9 J6 Q5 `/ u6 h1.1.2 对数据进行标准化处理
* A" R! ]& R' T
8 n$ r9 P9 a8 P% W(1)数据的中心化处理
* V) ^* V. X& p实际上就是平移变化,
0 E! c/ o8 e1 q7 X2 Q9 b6 |5 S
4 ~0 C2 s* m& }4 m
4 a! L( h# b7 B' `* X) w' m
这种处理,可以是样本的均值为0 00,同时它既不改变样本点的相互位置,也不改变变量间的相关性,但变换后,有许多技术上的便利。
. s$ r+ g. q7 c6 q# c! Y(2)数据的无量纲化处理* e' q. }8 U7 U1 T. Q
在实际问题中,不同变量的测量单位往往是不同的。
% a+ S/ ~$ I* z& `为了消除变量的量纲效应,使每个变量都具有同等的表现力,数据分析中常用的消量纲的方法,是对不同的变量进行所谓的压缩处理——使每个变量的方差为1; M' @5 c1 @8 ^) c
即,
1 p# w3 W% t4 G1 b6 v1 T% k1 m
+ q9 M- q; n7 w5 G
/ f# r; h& g8 @, Q当然,也有其他消量纲的方法,此处不一一列举。
: ]6 D5 O: `; A7 i(3)数据的标准化处理——对数据同时进行“中心化-压缩”处理
4 E3 o! k) v- k- m即,
; @( Q+ d: m3 X1 {+ T
0 V; ^% R B4 y1 t- Z5 w, O$ I2 A
6 |- [- s6 D( l' _4 M- V1.1.3 变量筛选
4 X: ~! u: E9 U+ K3 Z% {. u' [
0 J" N4 I# r. {. n `——选择哪些变量作为因变量的解释变量:* Y) t1 r$ t, y0 k
" B3 Q2 M `" t G- S" B一方面,希望尽可能不遗漏重要的解释变量
& x4 C! R1 |1 @; H k' L, `9 t0 r一方面,遵循参数节省原则(自变量数目过大时,模型计算复杂,且往往会扩大估计方差,降低模型精度),使自变量的个数尽可能少
$ p8 F4 M9 b1 O# M+ ~; H" o(1)穷举法; W% m2 H; M7 N4 B6 ?, I% Y
列举出所有可能的潜在变量,再根据自变量的不同组合,选取合适的模型。$ B. s; K/ i3 n9 g& [7 ]
假设有m mm个潜在变量,则需要拟合与比较的方程个数为2m 2_m2
8 L- }, M4 F Q3 m$ o6 Dm$ U+ i0 S! \+ e3 E! ^% W+ G
+ C3 ]$ {' A. a% ]9 e& R! w
——当m mm较大时不现实
M, {3 F- s( r, x! f1 g4 J' W' p; _$ J$ n
(2)向前选择变量法5 ^7 E& T* O8 B/ i5 m" V
# @ G2 w8 r; H& A; y; _5 H& Y1 w2 Q" b. k- y' X# T, j
5 ~5 D6 [4 P1 }; q: {, k$ U k& h0 L5 b3 a5 a1 }
1 N' |3 \) ~! ^
+ y& R) J, t+ b5 W* g) ^0 E: ^
(3)向后删除变量法
0 i4 T0 u& L) p1 A% `' U
8 p' c1 H# M+ b9 V; ^8 D, d0 J(4)逐步回归法——最常用5 a2 I+ t6 d0 i3 P( w( [9 H* S
/ T' Z+ o' q/ k! |; s7 @
. `# |' M5 _2 R& u. l) Y% a/ i1.1.4 调整复判定系数
" P/ ?$ t; p, \0 a: ^2 f$ l
3 ^, Z# g- @1 s! A: o2 P+ k1.2 最小二乘估计
& T0 y% I; Z0 _7 \, W* x+ a+ \( f' p: l
一元线性回归、多元线性回归——略。
* m" G( t, q2 `! v0 S& U1 _* c j& S |2 Q: t' {& v
2. 回归模型假设检验
4 G( r: F5 G* u2 u, z
" r4 |' ]$ a- ?, E8 O, j——检查自变量与因变量之间能否用一个线性关系模型表示(F FF检验)& X/ `$ E1 |) V0 v( l: y! U
# Y+ E. Y( O3 Z% S
具体检验方法见书,此处不再赘述。+ {+ p" m% ^- f: F
7 R6 L' l m B* o$ Q9 X8 Q0 r2 L
3. 回归参数假设检验和区间估计$ I' D5 r* F1 F
- o$ u/ P" {' P6 p
——检查每一个自变量对因变量的影响是否显著(t tt 检验)* s5 n( e# v$ T5 i/ L0 N
3 S3 \$ ~ M3 W
具体检验方法见书,此处不再赘述。, }& r0 y# J- t" G: |+ ^; {
' q2 T K8 M3 Q- j4. 拟合效果分析( X7 U0 [ Q' @1 X4 w
* d: h W" M4 |$ q
4.1 残差的样本方差(MSE)+ z6 l6 y6 n/ E& T# r
% _! U& n3 o/ X0 R" y$ h( g2 l
4 C! w* ~" q; W4.2 判定系数(拟合优度)4 A3 [- O( s3 u4 n) ?5 l
5 G' z. i/ C$ A) X; J
! t9 P( u [5 [5 u0 Q! G' U2 P* H( A, `
5. 利用回归模型进行预测
] U9 |: w2 j: A- o1 _![]()
G$ _& g7 T/ v% }5 }0 K
- r) J$ Q, i5 i5 k q8 K
0 q+ Z9 P9 g1 u其他
4 t# a+ K% y5 E% e. N" T8 Y* @; v
- h6 L- T/ M2 v' u% N& G偏相关系数(净相关系数)
" W5 a( T7 M* W; I8 j$ R0 Q3 `. F1 ?2 Z$ w+ V
在研究两个变量之间的线性相关程度时,可考察这两个变量的简单相关系数。但在研究多个变量之间的线性相关程度时,单纯使用两两变量的简单相关系数往往具有虚假性。因为它只考虑了两个变量之间的相互作用,忽略了其他变量对这两个变量的影响。; C$ K2 Y4 _2 T, P4 z
1 C! K, `# j* L- Z复共线性和有偏估计方法. l+ q+ d7 j. A4 U4 ?& v9 t
, S7 z3 P+ n- q1 v. w
在一些大型线性回归问题中,最小二乘估计不总令人满意,比如系数正负号与实际意义不符,这可能是因为回归自变量之间存在着近似线性关系——复共线性(Multicollinearity)0 b+ t9 W* P: }, ?4 V0 q, M
7 C/ H0 ?/ b0 f4 ]解决方法——牺牲无偏性,改用合适的有偏估计方法,以改善估计的稳定性1 b9 ~& P; i7 r, t
例如,岭估计——可以显著改善矩阵列复共线性时最小二乘估计量的均方误差,增强估计的稳定性。
! {: v4 \, F0 ?9 D& p(P.S. 均方误差Mean Squared Errors:一个好的估计应该具有较小的均方误差)/ y4 R' Y- W# s( u& I, z
1 V. k- Q+ O; `1 f1 Y再如,主成分估计——可以去掉一些复共线性$ z' d" A! G+ ?6 ?
% Q/ h- \6 S7 e- \, @
小结. ~/ Z3 |/ l: L. P. {4 E$ W
* ]. i( b& N6 O0 b# H# ]/ x采用回归模型进行建模的可取步骤如下:5 S3 P5 R* N/ a% }% N7 N4 c" J5 T2 U
+ _2 P& d' U/ H9 a" ^ P' x' o; }
建立回归模型( s \) B* a* i' o- E& `+ [" E
确立样本空间,对数据进行标准化处理,采用逐步回归法筛选自变量, l, p0 s! U4 O5 Y l
原文链接:https://blog.csdn.net/xxiangyusb/article/details/99762451/ |# R. D% a% [$ r7 f6 ?" h
' G! g& A0 [6 n2 S% F! }/ j" c- L0 q( r5 {, p' i# m
|
zan
|