- 在线时间
- 1630 小时
- 最后登录
- 2024-1-29
- 注册时间
- 2017-5-16
- 听众数
- 82
- 收听数
- 1
- 能力
- 120 分
- 体力
- 566957 点
- 威望
- 12 点
- 阅读权限
- 255
- 积分
- 175310
- 相册
- 1
- 日志
- 0
- 记录
- 0
- 帖子
- 5313
- 主题
- 5273
- 精华
- 3
- 分享
- 0
- 好友
- 163
TA的每日心情 | 开心 2021-8-11 17:59 |
|---|
签到天数: 17 天 [LV.4]偶尔看看III 网络挑战赛参赛者 网络挑战赛参赛者 - 自我介绍
- 本人女,毕业于内蒙古科技大学,担任文职专业,毕业专业英语。
 群组: 2018美赛大象算法课程 群组: 2018美赛护航培训课程 群组: 2019年 数学中国站长建 群组: 2019年数据分析师课程 群组: 2018年大象老师国赛优 |
/ ?/ e" V) r: C0 B8 C4 x
" {9 x/ W9 `' u8 P [( F+ m( d数学建模之回归分析
) H# U8 S7 T/ G D: o) O% e8 j; ~* s; k1 W5 z w) N$ b
应用场景
: w9 k. C# }0 B6 T1. 建立回归模型6 b- V$ A& ~* D6 r1 Q, K& \
1.1 筛选变量% ?3 Z5 `6 d4 [) w5 |) w
1.1.1 确定样本空间& Y: R& ~* H. H" l
1.1.2 对数据进行标准化处理+ N+ x( Z; I& @8 _
1.1.3 变量筛选& E. T$ A+ @$ j
1.1.4 调整复判定系数/ T2 u/ q6 B; i* s
1.2 最小二乘估计
7 ^3 D7 S" ^5 J2. 回归模型假设检验
- o0 M/ G | b0 t3. 回归参数假设检验和区间估计0 k# G( M: Q" @2 H# X4 X5 l
4. 拟合效果分析
m' Y1 }- _: H. I/ ]' C( X4.1 残差的样本方差(MSE)
( {5 v$ U5 x! i9 J0 B4.2 判定系数(拟合优度)
5 K# e7 e, }8 \5. 利用回归模型进行预测
4 _; `( V. W- q3 |其他' R: k7 ^6 [. z) m
偏相关系数(净相关系数)% y7 z: n, z O+ ^0 q3 X4 C
复共线性和有偏估计方法
' v: v4 T6 Y2 T小结- U' s" l& R& `$ K; D8 V2 }
应用场景9 g j' i2 t3 o7 }4 x' H
* I) q' T7 c q+ g+ X简单地说,回归分析是对拟合问题做的一种统计分析。
. A S3 f8 H1 U( e1 dP.S. 曲线拟合问题的特点是,根据得到的若干有关变量的一组数据,寻找因变量与(一个或几个)自变量之间一个函数,使这个函数对那组数据拟合得最好。通常。函数的形式可以由经验、先验知识或对数据的直接观察决定,要做的工作是由数据用最小二乘法计算函数中的待定系数。
& A/ T, i0 Z) \2 e) o# ~2 F4 V- I* O- S' h5 d0 J. _
具体地说,回归分析在一组数据的基础上研究以下问题:
7 D! s. G- z' G: d6 r
' U0 ~& s) a3 l4 S _7 Z2 l
1. 建立回归模型
( i9 R( S0 R E B1 s7 b8 P7 c3 R' y, ]
1.1 筛选变量
( x9 S4 `; a( G2 I2 x, U1 ]) T( `# G% _7 x/ A. v. m: V& d
1.1.1 确定样本空间( }' q+ x+ a, y9 c- L
5 j" k( W( H; S' t: {2 `, f9 N: ~% @9 C6 A9 B9 C) J- k! |
所构成的数据表可以写成一个n×m n \times mn×m维的矩阵。
) l# h; b$ f( H9 F; p6 V! E/ ~' J
$ i6 o; u* q: d( F8 ~/ t1.1.2 对数据进行标准化处理
$ M. S1 B# ?. w1 `1 a; r8 [
/ F3 l; }8 V, Q4 r# l6 |# w(1)数据的中心化处理
' i9 H% I9 ~4 {& r9 ]& {实际上就是平移变化,( Q$ U5 p- L5 E: @
% \* s e2 q r+ P8 G
( K" U1 p" B) a w, ^) J
这种处理,可以是样本的均值为0 00,同时它既不改变样本点的相互位置,也不改变变量间的相关性,但变换后,有许多技术上的便利。
' u7 B) A9 D* {5 n* S8 S/ ]0 \(2)数据的无量纲化处理
8 z4 V( a: l6 I在实际问题中,不同变量的测量单位往往是不同的。/ x- g. m8 c7 u" w
为了消除变量的量纲效应,使每个变量都具有同等的表现力,数据分析中常用的消量纲的方法,是对不同的变量进行所谓的压缩处理——使每个变量的方差为15 y% f) ~1 e% S1 W: V8 t/ K n
即,' @/ \# G$ Q" U2 @1 o
$ ~* n) X2 x+ T
. M5 L& {: Q4 h" g当然,也有其他消量纲的方法,此处不一一列举。
) }% D4 Q, s4 T! e {(3)数据的标准化处理——对数据同时进行“中心化-压缩”处理
* l/ V# ? x3 z, T; g& j即,
" U7 E" A5 Q4 p9 s+ j
' k- H: w3 B) a2 F- F7 C8 v
/ h2 K, Z$ Q& M8 c
1.1.3 变量筛选- l6 s) I- h/ P3 n: o
. Q9 i. F B0 @- T( |* v+ v0 h
——选择哪些变量作为因变量的解释变量:
$ @6 O9 [! z* Z+ g! F& c! v
/ g' Y1 @0 Q6 }( [一方面,希望尽可能不遗漏重要的解释变量
+ f, ]" J, f+ M: O/ X T6 ?8 J8 }一方面,遵循参数节省原则(自变量数目过大时,模型计算复杂,且往往会扩大估计方差,降低模型精度),使自变量的个数尽可能少/ f0 j/ R; _# B8 q. t( z! A
(1)穷举法. [& j# u5 z0 p! U* G: [
列举出所有可能的潜在变量,再根据自变量的不同组合,选取合适的模型。
- T: \4 s* o0 F, Q# [; @. W- j假设有m mm个潜在变量,则需要拟合与比较的方程个数为2m 2_m2 # |' @* l) j( ? g6 P
m
, k& T2 v o3 e9 A- A7 e, \% Z
- ^: Q s8 U$ h- M ——当m mm较大时不现实# m4 S" i+ e' c W/ _, c6 S/ Y2 R
2 X7 U6 M8 p# c2 M9 }" T(2)向前选择变量法
: a9 |3 H* ]# |; C3 T5 K
4 i. R: d0 I3 }/ S: ^& t
t) x2 y0 w$ @5 @; ^! D: _4 |1 d. k
! l- h ]2 L. r# \: N! f
/ w Z9 O" {2 s4 G1 E3 Z: x; G t
+ [* h- |% v. I; m3 h: v! `
(3)向后删除变量法
( v% p/ G+ j8 _7 M0 z
4 o% X* w; V% T6 u8 f( ]& }% Z(4)逐步回归法——最常用
! W; F3 S G; Z& ]
- U$ @; N) x1 ^
d* G$ G! x9 _8 c" U- O6 d$ u
1.1.4 调整复判定系数
4 n( r! A2 U; Q$ i$ i
2 z4 j8 A. n% m* f/ S D
1.2 最小二乘估计& i' \; g7 g) D- v3 w0 C
1 m& M' K m- h. p8 ]
一元线性回归、多元线性回归——略。
# s; Q$ U9 |) B9 Q. ]/ K/ E x/ h% J9 B# U# V, [8 d
2. 回归模型假设检验
" u$ @( F. q! ^; r! k: O$ S+ b' x& q3 q: U1 P* _0 n
——检查自变量与因变量之间能否用一个线性关系模型表示(F FF检验)& S( L6 y* ]4 V1 n, _+ [
) A8 }9 E( d7 y: `具体检验方法见书,此处不再赘述。
0 E M9 O* x# [3 O! W5 a4 N. g: p1 z3 X5 n
3. 回归参数假设检验和区间估计
& r" S* T6 [. Q) v
# L3 w Y0 T9 t——检查每一个自变量对因变量的影响是否显著(t tt 检验). {( s; T& M w4 h: E0 R% r
: N% ~; A! Q9 j* ^1 X- c, v
具体检验方法见书,此处不再赘述。
9 g# L* v+ L* ~( |
3 L+ Q1 r G: y- s$ ?$ a* l6 W5 V4. 拟合效果分析
9 x# v$ k( g; x8 }. D( Q
' L3 ~% T- w4 O8 s4.1 残差的样本方差(MSE)
h- L) G" z! ~" B5 @7 E
4 O$ { [% t2 E' X6 ^. t8 u1 `
g: O. t: x( h5 a* \; h) A4 b4.2 判定系数(拟合优度)
5 V5 n9 Z% N4 R' I; _
9 Z+ _0 h) F) [# \' |8 R: r3 k
5 E4 Q# o4 s$ R- F! l M
* o9 P8 M* A6 C T8 i1 M+ q0 s4 D5. 利用回归模型进行预测
+ I" t: ^* r+ J. _ 2 S3 B& M6 N# p* z0 v
" D+ v7 y9 s$ x& X, B
6 w) b& o+ p# Z/ b1 |其他) \3 i% F6 D$ O, Q; b
4 @4 N" r9 E1 s# |
偏相关系数(净相关系数)
" U9 u$ \+ T; A# J
p1 m; y: s( |4 _, Z* N( h在研究两个变量之间的线性相关程度时,可考察这两个变量的简单相关系数。但在研究多个变量之间的线性相关程度时,单纯使用两两变量的简单相关系数往往具有虚假性。因为它只考虑了两个变量之间的相互作用,忽略了其他变量对这两个变量的影响。
9 ~( T/ |1 t% g; g1 Y" u; t' I% x
- @% J, U2 s, Q1 @1 s6 k复共线性和有偏估计方法 L8 D. \5 O1 x/ t
5 ^' G+ Y a( j( i在一些大型线性回归问题中,最小二乘估计不总令人满意,比如系数正负号与实际意义不符,这可能是因为回归自变量之间存在着近似线性关系——复共线性(Multicollinearity)
: p# l" C& H! W' ^ Q
1 G! z& o" S) h( `解决方法——牺牲无偏性,改用合适的有偏估计方法,以改善估计的稳定性
a5 L5 V0 |8 K6 V% X% h! |6 R" Y例如,岭估计——可以显著改善矩阵列复共线性时最小二乘估计量的均方误差,增强估计的稳定性。2 S8 ~' J D2 P& E6 W% W a
(P.S. 均方误差Mean Squared Errors:一个好的估计应该具有较小的均方误差)
. ?8 V' d0 h) u6 q7 m; Z. u: O: f+ W# V: t0 d; ]' S/ b1 z; k1 ?
再如,主成分估计——可以去掉一些复共线性) N* ], C# X( E3 H
8 w; }4 H0 o4 u) o
小结' [0 \! {1 z2 K+ O1 y# T! F! x
3 |9 k/ X" i$ B$ B. }1 f7 r+ F$ O
采用回归模型进行建模的可取步骤如下:
m+ e- O' x5 ~) _2 K% D _+ Z7 \1 _) Z0 u
建立回归模型
- f6 L$ _. v$ v! X. C2 A t确立样本空间,对数据进行标准化处理,采用逐步回归法筛选自变量
7 G$ o1 [; A2 o' E! z原文链接:https://blog.csdn.net/xxiangyusb/article/details/99762451
3 V- G+ [/ `$ M$ A- e3 J% o: d0 ]5 z& O. I
& A' R* N* p$ l# E7 ^
|
zan
|