在线时间 1630 小时 最后登录 2024-1-29 注册时间 2017-5-16 听众数 82 收听数 1 能力 120 分 体力 566758 点 威望 12 点 阅读权限 255 积分 175250 相册 1 日志 0 记录 0 帖子 5313 主题 5273 精华 3 分享 0 好友 163
TA的每日心情 开心 2021-8-11 17:59
签到天数: 17 天
[LV.4]偶尔看看III
网络挑战赛参赛者
网络挑战赛参赛者
自我介绍 本人女,毕业于内蒙古科技大学,担任文职专业,毕业专业英语。
群组 : 2018美赛大象算法课程
群组 : 2018美赛护航培训课程
群组 : 2019年 数学中国站长建
群组 : 2019年数据分析师课程
群组 : 2018年大象老师国赛优
- [! c1 y; {/ m; G( `9 G' T
- C: Y, {& I# E# Y: W% T 数学建模之回归分析
* c- T" i7 v6 q/ k5 L, \
' N/ F' G5 R3 S7 {4 z- j! b
应用场景9 O" W+ N4 i2 O% u% J
1. 建立回归模型. R3 @8 d' z$ m0 A
1.1 筛选变量# C+ L2 q3 T, Y9 D" O) [
1.1.1 确定样本空间+ a% P% K( W- l% S: w
1.1.2 对数据进行标准化处理
- c7 E: }- {/ F" A1 K# J$ ^2 H! F8 w 1.1.3 变量筛选
/ A" P# t9 C8 A; i 1.1.4 调整复判定系数; Y" `, ~2 t4 \5 A0 q$ h
1.2 最小二乘估计5 |9 _0 u9 ~' g
2. 回归模型假设检验
o: ~# g u! X 3. 回归参数假设检验和区间估计
4 m' M1 ^3 G, v, h' u 4. 拟合效果分析% \* ?- P5 W: b H& ?
4.1 残差的样本方差(MSE)
; @5 N5 X4 k' P: ^5 Z [ 4.2 判定系数(拟合优度)
- x$ e" ^( s+ l+ x) E# M! i 5. 利用回归模型进行预测% ~+ M0 O# n. ?8 [4 f4 |0 n& q" o
其他" }. i. r+ n+ d8 S
偏相关系数(净相关系数)
& ~- q1 m3 R% E/ F/ f 复共线性和有偏估计方法7 N' f( A. C4 p' Q
小结
: a* q# \' w: ~* t+ x0 R# M- M 应用场景
+ x: R3 m8 v" B% T b/ ] / Q3 W# O0 J" `9 P+ r2 ]$ t
简单地说,回归分析是对拟合问题做的一种统计分析。! g) |; C2 J( R+ x, D2 s; L
P.S. 曲线拟合问题的特点是,根据得到的若干有关变量的一组数据,寻找因变量与(一个或几个)自变量之间一个函数,使这个函数对那组数据拟合得最好。通常。函数的形式可以由经验、先验知识或对数据的直接观察决定,要做的工作是由数据用最小二乘法计算函数中的待定系数。
; c+ Q8 l: a8 a# a) h$ e L! I F
8 i7 s0 X- V( }# m 具体地说,回归分析在一组数据的基础上研究以下问题:: p$ ?; b; f. q; Y- G8 s, h
" T& X2 |% ~% u2 r" c6 C 1. 建立回归模型; E/ s+ _. f, z" u
* A- [0 p' Y4 Q- F
1.1 筛选变量6 o' x/ I# u$ N! G H5 G8 R
$ @) _1 t z6 o
1.1.1 确定样本空间
) y$ h- A+ z; w9 Q/ K/ V, k
1 G& `9 p- L. c' P" v - g. y; Q4 ^) B( I
所构成的数据表可以写成一个n×m n \times mn×m维的矩阵。 I$ o, \0 Z8 \9 D7 ^8 Z1 r
9 K+ ?3 W3 E- H$ l
1.1.2 对数据进行标准化处理! v4 t) w$ V4 e0 m: F) W _
- Q# n% H# p0 [! d! |' I, o (1)数据的中心化处理
" D; Y7 x! T5 H+ k" C1 u 实际上就是平移变化,
* B4 `7 o \1 L! Y. ?0 B M 5 Z2 e* {" |9 X8 b. |; z
( _* J0 e y& e- t
这种处理,可以是样本的均值为0 00,同时它既不改变样本点的相互位置,也不改变变量间的相关性,但变换后,有许多技术上的便利。
1 k" B$ b( i: Z$ e (2)数据的无量纲化处理3 A! G5 C! h: G5 K4 V
在实际问题中,不同变量的测量单位往往是不同的。' K, `) c1 Y3 j* |" e. _! H$ f
为了消除变量的量纲效应,使每个变量都具有同等的表现力,数据分析中常用的消量纲的方法,是对不同的变量进行所谓的压缩处理——使每个变量的方差为1
; [2 U" K2 p p9 Z0 c) M# A* I j 即,
4 k _/ a! J& z
/ M# R( w+ a. B& `7 M
2 _* X! o' [1 Y 当然,也有其他消量纲的方法,此处不一一列举。% W |" n! x0 {+ h4 \- e
(3)数据的标准化处理——对数据同时进行“中心化-压缩”处理3 L5 ]4 R K3 W4 ?! C7 ?
即,
, }1 L, a$ N, C& R2 I
) Z( C( q7 H/ ?& j
7 m$ n6 g; U; Y, E$ I# O; J* A2 [# J
1.1.3 变量筛选
8 a& }* } N5 j8 u2 g) l: o
5 t/ Q& I7 N1 O; D: ? ——选择哪些变量作为因变量的解释变量:% B3 B# a5 e* N1 ]6 o m* m
' j% n/ _& s$ {2 o 一方面,希望尽可能不遗漏重要的解释变量
: g7 | i: q' I+ {" @ 一方面,遵循参数节省原则(自变量数目过大时,模型计算复杂,且往往会扩大估计方差,降低模型精度),使自变量的个数尽可能少' o" j% O- v B7 o
(1)穷举法
' S a) ]8 O7 q: S! p% h4 P) x0 v 列举出所有可能的潜在变量,再根据自变量的不同组合,选取合适的模型。+ S5 S- I! q+ g; m
假设有m mm个潜在变量,则需要拟合与比较的方程个数为2m 2_m2
1 \: U$ l8 P* E5 m5 Y; ~* l m$ F9 m9 T. d' r
V, a$ H4 C7 h% A- p
——当m mm较大时不现实
/ V' A6 i7 b9 R- l$ k
" N7 a6 y. i, s/ v0 X (2)向前选择变量法" l+ X3 d; g5 I+ f/ ~6 X& E
_. D8 Z# F; W# @5 f3 N! M
' e, A8 W( L6 y! t! X8 U 2 r# j8 x9 D" s- Z* L4 L' ^4 F
: u& H1 X3 C6 M' c3 g( p6 \- c
' E( q" L7 ~% G1 x7 r" G( a
" S% R. ?8 ?% A2 u4 i0 y (3)向后删除变量法, g. d% D; q- y8 R e7 [
6 J6 ]5 [( x/ P8 D% L6 _$ Y
(4)逐步回归法——最常用+ T; k( r4 j$ I8 E. x6 H7 v4 v
$ A7 V0 N* z5 u0 r" a4 B
/ S2 \ D# U2 N% @$ U. T 1.1.4 调整复判定系数+ y3 @: z! y! l6 v2 o4 D% W
6 o8 U l" g* {4 B3 x; S5 L& Q 1.2 最小二乘估计
; Y6 C8 c( B$ H2 B' m ! a) F3 _& ]& e+ n: q" z
一元线性回归、多元线性回归——略。3 `1 A8 @) ^3 ~/ f) M" W
7 k3 U$ o }% A/ ? 2. 回归模型假设检验: |8 s8 _( f; W3 P- k) V# ]
/ z- k$ w. }9 ]- c0 h' [
——检查自变量与因变量之间能否用一个线性关系模型表示(F FF检验) h' k9 H( U$ F* Z6 h L' S1 Y
# U: u/ d! p7 V7 m( b9 B5 J
具体检验方法见书,此处不再赘述。
3 P8 c9 d$ G' N9 u' { 6 b! [. y& O( g, ^% y4 V
3. 回归参数假设检验和区间估计1 B' [( [. ?, g, ^
& `: ]1 q9 i$ I6 }/ i) I8 q5 F7 ]/ r ——检查每一个自变量对因变量的影响是否显著(t tt 检验)1 N8 e' r4 d9 t" R% G
- z0 H: W: b/ T 具体检验方法见书,此处不再赘述。0 p' u; i% f) m. x
7 h7 w' O2 Y, D# x7 }' a
4. 拟合效果分析
/ L' P \4 M8 `" T2 u 7 l: m4 X; r. C0 W
4.1 残差的样本方差(MSE)
& h6 ]2 K4 N, g( x) q1 ]) P
: W) p$ i% Q/ J
0 q4 W/ `4 v ?9 t7 R1 l
4.2 判定系数(拟合优度)
: |/ z; I1 \2 I8 _" G; a 3 i" F' L/ i( g9 `- b6 y o A
" e0 ~0 `% v& ~$ [6 n $ n' }7 L) a* z' V9 ~
5. 利用回归模型进行预测
9 d8 w* f% ?1 m2 x) k' d' w
3 ^1 y8 I& V0 P" w3 p- V) V
2 C% Q6 w' ]$ L! x& Z 4 ?5 P y6 M) y. E0 a, D! u5 K: F: t$ W7 m
其他, Q! Q3 `! \. m2 j7 g3 E2 R
1 G9 C) n" J1 C' N
偏相关系数(净相关系数)
5 ]: p& L* N3 _7 D, W1 e, b1 ~
$ ]* a& I7 T5 R) w& g' B- q. i 在研究两个变量之间的线性相关程度时,可考察这两个变量的简单相关系数。但在研究多个变量之间的线性相关程度时,单纯使用两两变量的简单相关系数往往具有虚假性。因为它只考虑了两个变量之间的相互作用,忽略了其他变量对这两个变量的影响。
' b7 Z2 ?' J6 \& o 3 \+ M) [4 `& u; O6 v0 U0 H
复共线性和有偏估计方法/ T4 U. G/ g. S) ^3 f' u
! O5 `* r7 {: X) w/ U
在一些大型线性回归问题中,最小二乘估计不总令人满意,比如系数正负号与实际意义不符,这可能是因为回归自变量之间存在着近似线性关系——复共线性(Multicollinearity)& ]6 B8 G K7 W ]) `
' R+ H! A9 U$ s K% Z/ \
解决方法——牺牲无偏性,改用合适的有偏估计方法,以改善估计的稳定性 L' v2 O. D5 Z" L g; g/ y' C
例如,岭估计——可以显著改善矩阵列复共线性时最小二乘估计量的均方误差,增强估计的稳定性。
, Q& I, y3 ?6 l (P.S. 均方误差Mean Squared Errors:一个好的估计应该具有较小的均方误差)
( v1 D4 H: _( g1 p # @/ d, _9 u( y" {8 s: c' J
再如,主成分估计——可以去掉一些复共线性
7 a/ C( S* _; m1 y; u, _: j% A
, z" [. A4 i0 g( t% B 小结9 Z5 i' @, C: t3 f
3 Y" K3 f% W: h* _ q0 p t 采用回归模型进行建模的可取步骤如下:) |9 S0 H9 e; T
* j K/ d# u; z( x" R2 r* I
建立回归模型1 t7 S! `) j4 t f I( E# q; ]
确立样本空间,对数据进行标准化处理,采用逐步回归法筛选自变量2 C, J/ w, ^" I: i1 H c
原文链接:https://blog.csdn.net/xxiangyusb/article/details/99762451 i2 Q+ _( C) G8 G" y& G
$ q4 d/ L3 E4 b1 K+ l7 |
2 O9 x5 H; n- O$ V, Y' Q b) R: r
zan