- 在线时间
- 1630 小时
- 最后登录
- 2024-1-29
- 注册时间
- 2017-5-16
- 听众数
- 82
- 收听数
- 1
- 能力
- 120 分
- 体力
- 566777 点
- 威望
- 12 点
- 阅读权限
- 255
- 积分
- 175256
- 相册
- 1
- 日志
- 0
- 记录
- 0
- 帖子
- 5313
- 主题
- 5273
- 精华
- 3
- 分享
- 0
- 好友
- 163
TA的每日心情 | 开心 2021-8-11 17:59 |
|---|
签到天数: 17 天 [LV.4]偶尔看看III 网络挑战赛参赛者 网络挑战赛参赛者 - 自我介绍
- 本人女,毕业于内蒙古科技大学,担任文职专业,毕业专业英语。
 群组: 2018美赛大象算法课程 群组: 2018美赛护航培训课程 群组: 2019年 数学中国站长建 群组: 2019年数据分析师课程 群组: 2018年大象老师国赛优 |
0 I- I$ q9 @" r8 e( m. i/ A9 B9 l9 X/ n! u1 B4 i$ @4 k2 W/ b) d
数学建模之回归分析
! ]% O9 m6 B3 J r6 z* Z& P
. _; p- n5 O( K0 \, J* S应用场景4 K' R9 z/ P8 O% g! X
1. 建立回归模型
- P& d' }; b1 t+ r; ~! H1.1 筛选变量. x# J& k6 C$ e
1.1.1 确定样本空间
6 P4 a6 |9 K! j7 N2 {( M0 y1.1.2 对数据进行标准化处理
! m+ F6 Y- D3 p' t7 N1.1.3 变量筛选
F# m9 e4 g5 w1 o. \$ l1.1.4 调整复判定系数
- U' f6 ?% j- g9 g3 z" X8 T9 [$ ~; x1.2 最小二乘估计+ [' L5 w' {( I, S& Y9 A
2. 回归模型假设检验# o9 c+ n( i3 z! z7 {" s- T
3. 回归参数假设检验和区间估计+ N" g1 ^& x. U4 j' h' a) @- Z
4. 拟合效果分析( _, f4 h: F; ~! g9 z& d
4.1 残差的样本方差(MSE)
) o# j& F) R; ]( z' K4.2 判定系数(拟合优度)7 k) l, _+ c+ z9 y
5. 利用回归模型进行预测
, s0 B- |$ x, X2 F0 a* I& |7 V. w3 T其他
p! i! j6 F* \& ^: {$ H偏相关系数(净相关系数)
6 D: n/ k, {# d' Y+ o/ t4 ]0 f# o复共线性和有偏估计方法( s: k( `. {" x* H' O: v2 Y
小结7 C$ L, K+ M7 s" ~$ ~' R
应用场景- q0 O. h( m' v8 P3 v
0 R/ s3 }5 x( w- ^ w" W
简单地说,回归分析是对拟合问题做的一种统计分析。
5 V* \2 x3 d% ~2 n" p$ c# ~3 TP.S. 曲线拟合问题的特点是,根据得到的若干有关变量的一组数据,寻找因变量与(一个或几个)自变量之间一个函数,使这个函数对那组数据拟合得最好。通常。函数的形式可以由经验、先验知识或对数据的直接观察决定,要做的工作是由数据用最小二乘法计算函数中的待定系数。
9 ~* Y3 f% A, T) z$ y: j5 [
2 `- a+ a( Y0 |9 r具体地说,回归分析在一组数据的基础上研究以下问题:
) [' j6 {& G6 c7 B! ~% w, v
# K/ h( o0 ]7 u: h. h+ ]
1. 建立回归模型0 w8 k* w6 b+ m. v( Y8 r' a. }
( f9 m' J, Q2 C4 r8 D/ q
1.1 筛选变量
2 C$ F y: f. f* j! T" A/ u9 ?. L# B5 W- a
5 p+ P2 X3 s5 k1.1.1 确定样本空间
* u& n6 u2 m$ n# `) {0 n, I- B( ~
# ~/ X, A j# R& N# ^3 z9 \: a9 h# E! K" @) N+ c/ C
所构成的数据表可以写成一个n×m n \times mn×m维的矩阵。1 b, @. `" T* E+ ^, X+ A& |
( Y% E4 v0 s5 c: E1.1.2 对数据进行标准化处理
" ?" }' @9 G I& }3 L9 p& `' E1 j* m" b6 }) o9 |* `9 ^* u& \% w+ I
(1)数据的中心化处理
7 b) B% M, r* ?实际上就是平移变化,
2 G! k# }+ r2 x$ G$ ?! ^) ]5 e5 Z% Y) N$ Q) d" o1 c: v9 n7 V. z
/ |2 f2 v- b) l. _这种处理,可以是样本的均值为0 00,同时它既不改变样本点的相互位置,也不改变变量间的相关性,但变换后,有许多技术上的便利。4 t$ z, g+ v7 h* v) u) o
(2)数据的无量纲化处理
2 Q4 b7 b) f( C3 |7 Q' u' Z在实际问题中,不同变量的测量单位往往是不同的。
& q* a7 X5 J" Q& ~* J% u) u0 g9 W6 h为了消除变量的量纲效应,使每个变量都具有同等的表现力,数据分析中常用的消量纲的方法,是对不同的变量进行所谓的压缩处理——使每个变量的方差为15 L" L( f- K2 H, _( O
即,
5 r/ [" y( F% u1 Z* J$ h' g+ e1 \& {5 A+ T C- z% O! }
0 p! e" U* C9 T1 j O6 R5 w
当然,也有其他消量纲的方法,此处不一一列举。/ x0 \+ e/ B. C2 `
(3)数据的标准化处理——对数据同时进行“中心化-压缩”处理2 j- ]) s! T) ]0 ?! x. P5 D+ Z
即,
4 l1 h; b# A3 `- z# Z4 q
' c5 {! `1 O4 L! B. G
5 v/ `- e; Z- k* G/ k9 m
1.1.3 变量筛选
! p6 ` g1 M" b, W3 W( D, _6 s: m
——选择哪些变量作为因变量的解释变量:
3 a; {2 \4 t% C" h$ B2 P \6 n
; p$ m' F$ u* v一方面,希望尽可能不遗漏重要的解释变量# y- P0 b" x9 u7 f' x
一方面,遵循参数节省原则(自变量数目过大时,模型计算复杂,且往往会扩大估计方差,降低模型精度),使自变量的个数尽可能少, k. I4 l9 |4 _
(1)穷举法6 Q, t$ m$ N5 H/ y
列举出所有可能的潜在变量,再根据自变量的不同组合,选取合适的模型。
+ ]! t. }+ J- a' r; l假设有m mm个潜在变量,则需要拟合与比较的方程个数为2m 2_m2
4 `; |* W2 @. V1 y+ c+ w* t6 gm4 F+ i, p s" c: v& i
! b9 }: v( O8 ^ ——当m mm较大时不现实5 I" P+ a8 C" I
/ q& ~2 p& i5 e(2)向前选择变量法
; e9 E4 Y; Y) \% ~* ?
; I4 T c0 N- F2 n3 ^
# U1 K8 X8 k5 H% ~# g+ M* L
" M% y2 ]0 c" D( n9 n8 i. Y3 f
; _' D: y* [+ h
. [/ Y4 e# h6 l4 }! @+ q
) r- j* S3 Y/ n6 }' b(3)向后删除变量法4 I& W( D2 N$ w4 n. _
0 U( v/ j: j% p% ]' C(4)逐步回归法——最常用
; d2 A5 ?! P6 I9 g6 n
- W' E8 H9 d. p, |3 ?
5 e5 P4 N/ |7 L' ^: Q& }. B1.1.4 调整复判定系数
, T) A# H& x0 r; }# o; s, j& {+ r
5 X7 G. ^( p2 o1.2 最小二乘估计$ X3 F7 q; r. |) v9 w: m
( [, v0 w' G* H8 P8 R( ^% U
一元线性回归、多元线性回归——略。
; e8 }4 u! l5 S0 t( T' l; b9 v: J0 n
2. 回归模型假设检验
# R7 ^' c3 w+ _
" r% a( ^+ Z9 a8 Y% R——检查自变量与因变量之间能否用一个线性关系模型表示(F FF检验)
$ F3 K6 u5 t, b1 O2 v8 ]7 X8 {' }5 c: J
具体检验方法见书,此处不再赘述。
1 I4 u& O( d1 X) t. o% E
4 M% N4 S; R: |% `2 {+ O3 }0 O3. 回归参数假设检验和区间估计
5 R( F0 j7 {) ^; Y0 ~: u* Z) ?& v' q$ L; s% D, o/ W
——检查每一个自变量对因变量的影响是否显著(t tt 检验)3 B- J/ Z9 q* k5 O4 O
6 b! s+ t. q- v
具体检验方法见书,此处不再赘述。
% K9 z8 |( a2 d6 d7 C& h2 l" q- j4 `2 P- z5 u
4. 拟合效果分析
4 i: ] _+ N, {2 F1 ^ K5 w7 \$ b7 g% L9 a# x! W9 h
4.1 残差的样本方差(MSE)% J9 q4 L. K& q+ F1 J2 n6 [2 Z! U E( u, f
2 r u2 }0 q- f$ U' L- E# R
1 j8 E. e2 h; v3 j( c
4.2 判定系数(拟合优度)
- C8 t+ L; T/ C
8 E. O$ j& z9 Q3 G
3 @1 E; `* u: d9 V0 R' K5 `
( u; g; t: p, q5 `3 k* `4 |
5. 利用回归模型进行预测
# H3 h1 ~) d& \2 y![]()
3 B) h# I$ u# P) g' P" H5 `5 A
, c, e) H0 k. a/ D: @
u/ |; ]7 m# E* l% Y其他
& Z1 a5 {" B, j" \2 p2 N
% @* t- s+ |, S. u- ~& B6 E. ~偏相关系数(净相关系数)
5 m% [+ R0 F8 ?% }6 x! d5 @. \8 w
在研究两个变量之间的线性相关程度时,可考察这两个变量的简单相关系数。但在研究多个变量之间的线性相关程度时,单纯使用两两变量的简单相关系数往往具有虚假性。因为它只考虑了两个变量之间的相互作用,忽略了其他变量对这两个变量的影响。
( \' z( ^0 t, H9 x3 B4 B$ W( E9 _
3 }$ }) h3 I! A% z& s$ }# {7 v( }复共线性和有偏估计方法
# E7 H1 v- e. a- v/ p8 R; b* A/ I3 \" W) e2 d
在一些大型线性回归问题中,最小二乘估计不总令人满意,比如系数正负号与实际意义不符,这可能是因为回归自变量之间存在着近似线性关系——复共线性(Multicollinearity)' C' a$ j4 M$ f# L+ \* @
) B4 d3 A* }- z, M5 B7 f) a解决方法——牺牲无偏性,改用合适的有偏估计方法,以改善估计的稳定性4 V: `! V/ i9 L3 ~
例如,岭估计——可以显著改善矩阵列复共线性时最小二乘估计量的均方误差,增强估计的稳定性。
6 T5 Y6 r0 w5 F: M# Y: h* S(P.S. 均方误差Mean Squared Errors:一个好的估计应该具有较小的均方误差): E: Q1 Y8 l4 M+ z7 m/ @3 z# o
& P; v2 \- u6 ~再如,主成分估计——可以去掉一些复共线性
# U; ?' W8 {7 O+ ~4 D- u0 ]# S/ \. s3 n7 k+ R- M4 I# H
小结/ i+ A* Y( U1 T4 a' J$ }7 H
! \7 }, R2 k8 r4 y$ U! W8 S6 M: L4 D9 ^. E
采用回归模型进行建模的可取步骤如下:4 P! u! U- [2 F- r: |
% C( V, B, X7 o9 d5 o% ?2 \6 w
建立回归模型
5 y# G0 s1 k( b确立样本空间,对数据进行标准化处理,采用逐步回归法筛选自变量
3 y. J/ u+ u- f) {5 l0 P) U原文链接:https://blog.csdn.net/xxiangyusb/article/details/99762451
' }3 P( ^3 `' u: j4 U) J6 E: Y7 s
6 d/ {# \5 k; r( y
4 _. G) _6 G! t) e% j% m- L |
zan
|