- 在线时间
- 1630 小时
- 最后登录
- 2024-1-29
- 注册时间
- 2017-5-16
- 听众数
- 82
- 收听数
- 1
- 能力
- 120 分
- 体力
- 566749 点
- 威望
- 12 点
- 阅读权限
- 255
- 积分
- 175248
- 相册
- 1
- 日志
- 0
- 记录
- 0
- 帖子
- 5313
- 主题
- 5273
- 精华
- 3
- 分享
- 0
- 好友
- 163
TA的每日心情 | 开心 2021-8-11 17:59 |
|---|
签到天数: 17 天 [LV.4]偶尔看看III 网络挑战赛参赛者 网络挑战赛参赛者 - 自我介绍
- 本人女,毕业于内蒙古科技大学,担任文职专业,毕业专业英语。
 群组: 2018美赛大象算法课程 群组: 2018美赛护航培训课程 群组: 2019年 数学中国站长建 群组: 2019年数据分析师课程 群组: 2018年大象老师国赛优 |
, `4 R! g3 p+ D+ c' o3 ]
, Q8 W* ~: N9 o. ^5 b4 c3 e数学建模之回归分析
* m' p; l7 ^1 E/ u" `4 ?8 O* @9 T$ c$ z6 r
应用场景* _" x/ {& P' p3 v
1. 建立回归模型
5 D# }, ?$ m# w: S$ N1.1 筛选变量
% Q, Y( G" j4 g l1.1.1 确定样本空间
; p6 }" Y- a9 U7 L1.1.2 对数据进行标准化处理: c8 ]! w# e; ^. M" b! J
1.1.3 变量筛选
( [1 U Y; t& X6 }' C( l3 M# O1.1.4 调整复判定系数
# e& u& D! Q1 F9 G* e1.2 最小二乘估计
- @( V" d" b, i: M2. 回归模型假设检验
2 B2 e: A* |- X3. 回归参数假设检验和区间估计! N! n8 c; P" W# E5 p" n2 \4 m
4. 拟合效果分析
2 v( s, e, ?& @5 i4.1 残差的样本方差(MSE)3 K3 m- ~# p9 O; j4 N
4.2 判定系数(拟合优度)
) U: k( I1 g: S% T5. 利用回归模型进行预测, O+ f- R: b1 _
其他6 @8 h- A4 @) L: B
偏相关系数(净相关系数)7 b1 b% R I+ y8 S/ o" G: L
复共线性和有偏估计方法$ p# d6 H' ~% }" X% A/ N0 D7 N/ J' N
小结2 w3 q; ]) o# Q3 z6 c
应用场景
8 J ]4 i& d8 h7 F- h
0 K: i2 c' h( V5 M简单地说,回归分析是对拟合问题做的一种统计分析。
* m, l9 _+ N( N1 z; q; {P.S. 曲线拟合问题的特点是,根据得到的若干有关变量的一组数据,寻找因变量与(一个或几个)自变量之间一个函数,使这个函数对那组数据拟合得最好。通常。函数的形式可以由经验、先验知识或对数据的直接观察决定,要做的工作是由数据用最小二乘法计算函数中的待定系数。/ [, x; V" U! ^
1 ?8 Z$ X7 @1 {# G( N
具体地说,回归分析在一组数据的基础上研究以下问题:
% l: W: X8 a, ]7 o1 E) V
+ P' i, a3 z% A+ I z, R8 I1. 建立回归模型
Q) c: }9 k0 d4 {$ b
) F* ?6 I% Q8 |9 b1.1 筛选变量
( v, ?5 _% L4 b% N$ b" K" K7 R$ B4 a2 O# M" [
1.1.1 确定样本空间
2 M! t t5 |) J# G+ C
5 m0 p4 l. c( b, W9 ^3 U
& [9 G' B S& ^$ V' m3 B8 D. F所构成的数据表可以写成一个n×m n \times mn×m维的矩阵。: ] O3 A# e4 o. Z3 a0 e6 ^
4 S, O0 O) J! Q# s; {! s1.1.2 对数据进行标准化处理+ D/ r' f9 ^( C
6 C8 c/ R/ F' Q5 p$ q(1)数据的中心化处理
: g5 Z5 m. x8 {7 ~2 `! e" c5 M实际上就是平移变化,. ?$ J* n9 u! A1 s- h* g; F8 X
H. V4 |) U# n4 K6 ^
5 n3 J8 U) z, n) ]5 H& L/ t这种处理,可以是样本的均值为0 00,同时它既不改变样本点的相互位置,也不改变变量间的相关性,但变换后,有许多技术上的便利。# Y. W3 q# W5 H% |8 {
(2)数据的无量纲化处理
4 [4 h0 ~' X5 q2 \在实际问题中,不同变量的测量单位往往是不同的。9 c# i% i8 T9 [% L9 M7 N! N
为了消除变量的量纲效应,使每个变量都具有同等的表现力,数据分析中常用的消量纲的方法,是对不同的变量进行所谓的压缩处理——使每个变量的方差为12 R( X3 m$ K3 f$ f6 v7 F6 N( x
即,
) d- n0 { V0 M; J- c
# r8 |1 \! H" i( P1 m" l
7 a/ ?4 S6 V" M6 Q; n8 [" _当然,也有其他消量纲的方法,此处不一一列举。
) _- E7 a- K9 Z(3)数据的标准化处理——对数据同时进行“中心化-压缩”处理
4 m' w! p; b4 w2 m即,. p. d! A6 ?+ P6 i% k
: _' p u' s4 P" I
% b# E( m- z3 [2 [8 f
1.1.3 变量筛选! I" b& @2 i/ J8 H L
3 C% U1 K( x, V) x——选择哪些变量作为因变量的解释变量:
# d6 u6 m: t$ g/ F# L: y1 K' C3 J
8 u1 a" ~# c6 P( |5 |6 O* F* [; |一方面,希望尽可能不遗漏重要的解释变量
6 g, J# d0 }) t! f6 L+ ~' D& d一方面,遵循参数节省原则(自变量数目过大时,模型计算复杂,且往往会扩大估计方差,降低模型精度),使自变量的个数尽可能少7 D5 [' M$ i A
(1)穷举法
1 X/ T1 _! I+ }# E列举出所有可能的潜在变量,再根据自变量的不同组合,选取合适的模型。! s( d" _5 x. B7 D4 j
假设有m mm个潜在变量,则需要拟合与比较的方程个数为2m 2_m2
* [# w) ?) s, k/ a `m/ ?. N: J! C) @# w) D
# L, ?# F- H& F0 e4 z' r
——当m mm较大时不现实+ S$ k5 O# g: K2 S4 m
0 i$ P$ x1 i! m( [(2)向前选择变量法
1 }/ p: T9 `0 ~% X0 t4 w
! J1 K1 n0 V( R7 B+ W9 d
' f0 V: G% A k9 y# v+ s
- V9 I4 U5 k$ r# [% q3 f5 o( i: J0 U. j1 `+ e
# R. e' Z% K* ]! i3 X/ |( ]2 h
# K5 i2 y( n% g3 w- b! x1 W(3)向后删除变量法
6 d2 B' J- o# e+ K/ Q
* S u$ J3 L0 U8 P0 [$ o(4)逐步回归法——最常用
+ B7 ?" J+ e( K4 u: ~
/ r' d' Q B4 ?7 E$ O4 w! K1 v
* O8 J. E" v. x5 T1.1.4 调整复判定系数: A0 P! G0 k* ~8 a o. l
4 U0 E, m* Z6 x1.2 最小二乘估计
/ ~& u8 ]2 Z* m/ Y, F
7 J7 m5 P; T+ T9 x! |8 R) A一元线性回归、多元线性回归——略。/ ^ G7 L9 d% V+ i5 f# h
2 A/ O+ ^( p( j
2. 回归模型假设检验
: g, u% U) C: [. A `! A) k
! X; x( f' p& C& `——检查自变量与因变量之间能否用一个线性关系模型表示(F FF检验)! a* R2 I0 k, M4 f4 e: v
0 k) H1 }: Y# T
具体检验方法见书,此处不再赘述。
/ ^( M) P, C% L( _' ^2 F' p3 l
# ~' U9 v& J: @# V3. 回归参数假设检验和区间估计9 R- n* u& f, Z5 e! @" b
6 [+ g& @8 ?7 |, _
——检查每一个自变量对因变量的影响是否显著(t tt 检验)
- C2 Q! x; X& V) \ e5 Z" M( h
/ v1 W8 {9 m u5 Q具体检验方法见书,此处不再赘述。
! \! ^2 f6 S: p( W3 ?/ l
, ~, t5 d( l! [! D, b9 ~$ e' f4. 拟合效果分析
6 w+ h7 g3 a; N; _8 E( ]1 k$ b2 M* K/ A0 u8 x" [
4.1 残差的样本方差(MSE)" P5 F) g9 l6 B9 N V
6 @2 T6 K; g8 ]
; W' W, _$ S* |# h8 Q4.2 判定系数(拟合优度)2 z' W; D/ `, T6 W3 G/ N; Z
0 f+ X+ n+ E" p
3 ^, X+ Y: i) X, i& p/ o
/ e9 v2 v, t* c% ~- e; l5. 利用回归模型进行预测8 p0 p- x8 M+ F
![]()
) ~( m S& g) J% z: d/ ]$ K+ R/ [$ J( _
h" D% y2 X1 w其他
- q; y" ]5 [ A8 Q% i, c8 b7 l/ f" _3 l
偏相关系数(净相关系数)% P* J1 D% R C+ u
( n! e: T( L/ r; q在研究两个变量之间的线性相关程度时,可考察这两个变量的简单相关系数。但在研究多个变量之间的线性相关程度时,单纯使用两两变量的简单相关系数往往具有虚假性。因为它只考虑了两个变量之间的相互作用,忽略了其他变量对这两个变量的影响。
1 Y7 @/ J3 \/ z7 I- s
, x* P+ x0 R# N0 F' s* C. V9 n复共线性和有偏估计方法
- d' _0 P8 z* s
; ?0 A0 X& L$ U( [) ^2 |- U在一些大型线性回归问题中,最小二乘估计不总令人满意,比如系数正负号与实际意义不符,这可能是因为回归自变量之间存在着近似线性关系——复共线性(Multicollinearity)" {8 p8 c* e( f
' Y! {+ W- ]* V3 j
解决方法——牺牲无偏性,改用合适的有偏估计方法,以改善估计的稳定性
- g- b! Z7 y$ K0 o: p3 f& U1 g1 w2 z例如,岭估计——可以显著改善矩阵列复共线性时最小二乘估计量的均方误差,增强估计的稳定性。5 n: `9 q; w H& Y5 W3 C
(P.S. 均方误差Mean Squared Errors:一个好的估计应该具有较小的均方误差)& Q# H( U) z/ K
. N) z& Y, a6 ?: p3 `% o1 v' I
再如,主成分估计——可以去掉一些复共线性
1 L9 x* _( \$ }& P3 b8 h- Y6 P- y! X5 a7 t
/ R# r. b* h2 D小结. d) W% [) F9 ?
9 I5 u: k6 {% a( Q j5 v
采用回归模型进行建模的可取步骤如下:
! _2 H% }; b: ]' f# x, [4 {
' ^! u1 B4 A1 L9 w) y建立回归模型
2 m# r! o9 [4 [2 l确立样本空间,对数据进行标准化处理,采用逐步回归法筛选自变量
/ K$ i. [ E$ R( t9 ?+ m* l- u原文链接:https://blog.csdn.net/xxiangyusb/article/details/99762451
# ~1 Z, r/ a6 |1 o' d
5 p: P' g6 U1 a* `$ J' C; r
6 V8 }; u1 \4 B |
zan
|