- 在线时间
- 1630 小时
- 最后登录
- 2024-1-29
- 注册时间
- 2017-5-16
- 听众数
- 82
- 收听数
- 1
- 能力
- 120 分
- 体力
- 565547 点
- 威望
- 12 点
- 阅读权限
- 255
- 积分
- 174887
- 相册
- 1
- 日志
- 0
- 记录
- 0
- 帖子
- 5313
- 主题
- 5273
- 精华
- 3
- 分享
- 0
- 好友
- 163
TA的每日心情 | 开心 2021-8-11 17:59 |
|---|
签到天数: 17 天 [LV.4]偶尔看看III 网络挑战赛参赛者 网络挑战赛参赛者 - 自我介绍
- 本人女,毕业于内蒙古科技大学,担任文职专业,毕业专业英语。
 群组: 2018美赛大象算法课程 群组: 2018美赛护航培训课程 群组: 2019年 数学中国站长建 群组: 2019年数据分析师课程 群组: 2018年大象老师国赛优 |
5 a3 g) A2 i# K$ b. `
) t* {0 D( b4 p% H# f7 Z数学建模之回归分析
+ i: ^4 m5 t/ Q; ?. x3 g9 p3 ~ v2 ^1 Z* W9 A7 u7 A
应用场景
, h. k9 {. s. ^/ B1. 建立回归模型9 n2 q4 v& o9 s5 m
1.1 筛选变量' A5 q5 g0 a! G7 R2 b& S, k/ Q; u- Q
1.1.1 确定样本空间6 a3 I& N# p, ` E, [$ |
1.1.2 对数据进行标准化处理' D8 W; a9 _; e) p0 B: X
1.1.3 变量筛选3 q I) \( x: _/ m: h3 U5 o: ^
1.1.4 调整复判定系数( E7 F% U5 H5 O. w
1.2 最小二乘估计# b$ Z0 g7 |1 W/ t
2. 回归模型假设检验
- `7 l* h4 w5 W' [8 F2 }3. 回归参数假设检验和区间估计7 T0 T( h: J: B8 F, O
4. 拟合效果分析
) m1 s+ O8 v$ q2 O# R9 ]. a4.1 残差的样本方差(MSE) K; n! O% ~, ` `& R
4.2 判定系数(拟合优度)
6 w, M4 d' S& k2 o* E4 I5. 利用回归模型进行预测1 m8 `& V: l; y4 Q* |6 F
其他" M$ s8 U5 c# ~9 o, ]4 r
偏相关系数(净相关系数)' G, ]% t; A- n( r9 F+ E4 r
复共线性和有偏估计方法
; l: C0 g7 W' ~2 i( _' t& I小结6 J4 X& Q# Y, K
应用场景
* P( y! l% G) o+ c8 Y
Y- u- @5 d+ Q' O) V简单地说,回归分析是对拟合问题做的一种统计分析。
+ p, x2 D% G: T+ `# A% C0 y1 VP.S. 曲线拟合问题的特点是,根据得到的若干有关变量的一组数据,寻找因变量与(一个或几个)自变量之间一个函数,使这个函数对那组数据拟合得最好。通常。函数的形式可以由经验、先验知识或对数据的直接观察决定,要做的工作是由数据用最小二乘法计算函数中的待定系数。( C! l* | T# p$ \3 W
6 Y- ?2 g/ W1 C7 l5 h
具体地说,回归分析在一组数据的基础上研究以下问题:0 M6 v: Q, I; |1 W [! [
9 E5 e6 [ z, y. n9 Y* _ I$ e% P
1. 建立回归模型
4 h& a- s A; p/ D; N7 ^% [* j, o8 A
1.1 筛选变量
6 D& T6 M( u0 b% `# T a0 R9 k) }4 D( L
1.1.1 确定样本空间5 S, {. L* y. E# ]4 }: P7 N
- k* p! B6 a8 |3 u2 g
6 ]( t) b. n2 `! h+ l+ P! p
所构成的数据表可以写成一个n×m n \times mn×m维的矩阵。$ p+ u4 W4 b/ S7 l4 V
3 b! N! j1 L; V
1.1.2 对数据进行标准化处理# Y6 p7 s2 M2 f+ m& c1 W$ h- d
6 r/ m N( |6 y, t
(1)数据的中心化处理
6 `% o) b" N7 V实际上就是平移变化,
G6 P9 W6 H* J0 _/ Z) o
3 m& e4 Z& q. z! L% n" q: V
' u/ C, Z3 x( L: c这种处理,可以是样本的均值为0 00,同时它既不改变样本点的相互位置,也不改变变量间的相关性,但变换后,有许多技术上的便利。
' D4 |- { g9 U$ A' u, I6 H. V(2)数据的无量纲化处理" H* ]3 r5 M8 \
在实际问题中,不同变量的测量单位往往是不同的。
' i8 k3 q. Y! ~为了消除变量的量纲效应,使每个变量都具有同等的表现力,数据分析中常用的消量纲的方法,是对不同的变量进行所谓的压缩处理——使每个变量的方差为1
& s% a4 H/ P$ u, d4 i* P3 ?4 p- x即,
# F9 A% P. z( I- g% H& S" W& w7 p' o$ h h& D5 @$ N! P( E
4 b! U( e) D& d" O& m
当然,也有其他消量纲的方法,此处不一一列举。
# M6 k. _" ~" z9 [: ]% [. I8 _(3)数据的标准化处理——对数据同时进行“中心化-压缩”处理
+ Y; j4 r- J' _: ^* u即,
, \9 w0 v v* P* K3 m: `. `" D
% H/ ]: I' C3 E v
1.1.3 变量筛选9 S% Z9 J' O% i8 m0 A0 c* z2 h
# n4 r$ @ w- j1 ?——选择哪些变量作为因变量的解释变量:0 c5 c1 v" |. h0 v% V
5 s6 B1 G% P* l. u e" ^一方面,希望尽可能不遗漏重要的解释变量6 p% S# w/ f I2 r8 C
一方面,遵循参数节省原则(自变量数目过大时,模型计算复杂,且往往会扩大估计方差,降低模型精度),使自变量的个数尽可能少
# r3 Y# x- B7 {. o, J5 I% ?4 u" |(1)穷举法5 x2 O: q9 Z( R5 l
列举出所有可能的潜在变量,再根据自变量的不同组合,选取合适的模型。
* Z! \; [- ^# }) B- W9 i假设有m mm个潜在变量,则需要拟合与比较的方程个数为2m 2_m2 " u1 F& y m- x3 H8 X$ J
m9 g* N& v2 y' T
/ F+ u2 h4 l5 E9 Z2 A- B7 W4 W ——当m mm较大时不现实; u# q- ^3 N1 U0 v c1 S8 W
) I0 @8 ]% x: }0 C" k6 B6 G(2)向前选择变量法) I- }- t8 Q& \
; ?1 N' h& O( K1 _: a2 ^& Q
1 Q. {, H! X _* |- C# E' [" w8 q
* }: }' D- @( i. v& r1 q" a
" o, S k4 P9 J5 u
8 Z0 G$ k$ {& \5 d' J1 U* R(3)向后删除变量法5 u+ }1 t' Z$ t* V) x0 E( e6 m
# b! C+ t/ I: G
(4)逐步回归法——最常用( z4 x* k. s4 g
/ _' G- b: A6 t- p1 k
' C" E" @8 V; \" M1.1.4 调整复判定系数
9 r9 o" {. _/ L* U; N1 L1 {
* z9 o4 l, ]) P/ w
1.2 最小二乘估计/ G& y( {1 a9 X+ |
7 u6 Q1 L4 s; R8 v2 R- Y2 ?) y一元线性回归、多元线性回归——略。3 Q6 J9 W' Z1 N% ?5 c" T! ?/ f) u
' J: c& v, J/ B, t5 ^
2. 回归模型假设检验6 N8 b+ L' { ]) N; A
- x3 U2 i: d% y D, l# G) ?! t% k( }——检查自变量与因变量之间能否用一个线性关系模型表示(F FF检验)$ H( v& T9 Z, z- f
+ b. F0 p7 h6 e* X/ h* Q
具体检验方法见书,此处不再赘述。
& K" s6 t5 q5 u/ W9 O% S L. x" o, i/ ]
3. 回归参数假设检验和区间估计- f3 M/ Q; ^* v" X9 M
5 M" {& V6 r3 k2 K——检查每一个自变量对因变量的影响是否显著(t tt 检验)
5 ^/ z- B4 { y* {3 w. ^1 n( R1 L% x' h$ V0 H
具体检验方法见书,此处不再赘述。
; x. i6 X( ?1 ^/ T2 d& _ ~) k) J
$ u2 `2 o/ V7 J4 Z% W4. 拟合效果分析4 l$ u$ j' z6 | A8 p( U
" B9 r3 U c: Z) s4 P6 V( t W. e4.1 残差的样本方差(MSE)& r8 J% o% A @+ B% E
8 |; Z) Q1 r# V8 Z
& j* |, F+ _! p2 N! T
4.2 判定系数(拟合优度)# Y8 N/ k) |1 l( J3 ^
+ M) n5 I3 ~& A& ~1 q& [
) C& p' Y$ a3 Y- r
9 C& H9 R' Y/ s W: d5. 利用回归模型进行预测) i6 s; ^2 w2 |0 v7 r: o
![]()
: L5 L" m' W' [0 n
+ t+ N. i- r! i- _$ I$ o
' Q0 F& G1 j$ s2 D9 \其他
& \; I, f8 L# h
! g5 J. a' t5 [! T9 A偏相关系数(净相关系数)1 T, C% c, I O4 S7 ?- d1 b
( _+ Z0 U. K: K1 s0 S u在研究两个变量之间的线性相关程度时,可考察这两个变量的简单相关系数。但在研究多个变量之间的线性相关程度时,单纯使用两两变量的简单相关系数往往具有虚假性。因为它只考虑了两个变量之间的相互作用,忽略了其他变量对这两个变量的影响。
7 q. Q9 V3 J% U9 t+ l; M
j) l: H' l$ ^) u x- K9 p, e复共线性和有偏估计方法
) y. S5 n% ~2 |- m, d+ q7 \2 @& c. J
在一些大型线性回归问题中,最小二乘估计不总令人满意,比如系数正负号与实际意义不符,这可能是因为回归自变量之间存在着近似线性关系——复共线性(Multicollinearity)
Z1 x9 y. v2 l/ J( b6 {4 W2 x- h( J' @/ C' j4 \8 b
解决方法——牺牲无偏性,改用合适的有偏估计方法,以改善估计的稳定性4 k7 l$ G2 y5 b3 A V- L2 o
例如,岭估计——可以显著改善矩阵列复共线性时最小二乘估计量的均方误差,增强估计的稳定性。' W( t% \- U4 z7 b- r8 F ~! }+ H9 f/ K
(P.S. 均方误差Mean Squared Errors:一个好的估计应该具有较小的均方误差)
u- I; g/ u) ]5 A- g/ H5 F1 b4 N, H* ~! k! N0 ?5 a1 J7 b
再如,主成分估计——可以去掉一些复共线性
6 r) S; ?! o# |0 x$ O; @, m7 m, K" o+ L3 O) Q0 {/ _: o
小结
- T1 { a1 |4 p' m a' U C+ h: F6 Y
采用回归模型进行建模的可取步骤如下:
2 I7 G% X' F6 T0 T
1 i r0 k9 e! ]$ p; e% s! A) w" y建立回归模型
' [" ], P3 u) r' u- {+ @" J% O确立样本空间,对数据进行标准化处理,采用逐步回归法筛选自变量1 {/ u# t3 m6 a7 V
原文链接:https://blog.csdn.net/xxiangyusb/article/details/99762451- `, Q5 Q8 g; q* i# ] K$ q) X
! w" X! G8 h/ B6 _
/ r4 ?! l' |, n! f6 O' C |
zan
|