- 在线时间
- 1630 小时
- 最后登录
- 2024-1-29
- 注册时间
- 2017-5-16
- 听众数
- 82
- 收听数
- 1
- 能力
- 120 分
- 体力
- 566801 点
- 威望
- 12 点
- 阅读权限
- 255
- 积分
- 175263
- 相册
- 1
- 日志
- 0
- 记录
- 0
- 帖子
- 5313
- 主题
- 5273
- 精华
- 3
- 分享
- 0
- 好友
- 163
TA的每日心情 | 开心 2021-8-11 17:59 |
|---|
签到天数: 17 天 [LV.4]偶尔看看III 网络挑战赛参赛者 网络挑战赛参赛者 - 自我介绍
- 本人女,毕业于内蒙古科技大学,担任文职专业,毕业专业英语。
 群组: 2018美赛大象算法课程 群组: 2018美赛护航培训课程 群组: 2019年 数学中国站长建 群组: 2019年数据分析师课程 群组: 2018年大象老师国赛优 |
9 c6 @7 ^( |, e( ^2 A) j! }' S1 Y7 L! f6 j
数学建模之回归分析
* {* ~% x5 G/ C2 s' @
/ f/ q, F; x0 z应用场景
/ s: D5 x8 R) `1. 建立回归模型( y1 a% Q6 R& G7 a
1.1 筛选变量4 Q8 J8 ~. ~0 P" \8 w& O
1.1.1 确定样本空间
$ ]" S& K9 p3 {/ T1.1.2 对数据进行标准化处理( A3 R: p6 c1 A3 p4 E
1.1.3 变量筛选
/ M' S( T* g \: v1.1.4 调整复判定系数4 ]# \* S7 f- i# V; s ]9 I
1.2 最小二乘估计: ~! @& X6 l7 r8 d) P
2. 回归模型假设检验
3 ]: ?) u" j$ K. E& t. F3. 回归参数假设检验和区间估计
6 b; R+ k! s; J1 S4. 拟合效果分析
7 u* v# W$ b$ C7 i4.1 残差的样本方差(MSE)
0 B/ @* `* R- ~5 B2 y+ N4.2 判定系数(拟合优度)
: T" n. R$ c: H4 t" A& _5. 利用回归模型进行预测# E) w7 |: o" g3 ?7 D
其他
: B6 z3 p& ` u! t" u* g( w* H o' l偏相关系数(净相关系数)$ h$ m' \8 P+ q, ?6 `) e3 x
复共线性和有偏估计方法: C+ d7 f6 V5 L) O$ K" W# u
小结# B1 J" {! [3 a5 o! e/ R( s
应用场景5 Y: B z( e# I" e0 @
' y' _6 k& p) x$ Z4 S, a简单地说,回归分析是对拟合问题做的一种统计分析。3 ^ v% l1 I+ ~+ o! {
P.S. 曲线拟合问题的特点是,根据得到的若干有关变量的一组数据,寻找因变量与(一个或几个)自变量之间一个函数,使这个函数对那组数据拟合得最好。通常。函数的形式可以由经验、先验知识或对数据的直接观察决定,要做的工作是由数据用最小二乘法计算函数中的待定系数。
! h* ]! f/ h! t. E; I
; N3 @5 {4 k+ Q具体地说,回归分析在一组数据的基础上研究以下问题:% C6 t/ }9 V( U1 Z/ T
" o8 L& ^6 W, Y1. 建立回归模型# x! J# J( t, k- z) M
. A! O* A! U+ {. D/ X
1.1 筛选变量" I$ A! F% E* i `% E; H4 e' M$ ?4 m
; g9 k: U! L- U3 [; r1.1.1 确定样本空间
- w+ Q% Q0 O3 m& Q; z
$ t" V5 R/ Z9 ^' [
6 r; Z R& A4 w: c, T1 Q所构成的数据表可以写成一个n×m n \times mn×m维的矩阵。
1 n9 D0 i$ ?2 ~# h- G5 A& @- C* y. _
& m( R/ k$ K( K+ ^+ ~$ V+ P1.1.2 对数据进行标准化处理
. p7 t" E- ?" D0 u# h2 s4 j
X' a1 l3 B" M(1)数据的中心化处理
c5 o! m2 L* G/ k5 y1 Z! j实际上就是平移变化,
6 F B( X: [* F1 n& U( u( ?9 i+ b+ m& \" [( X; m% ~$ l
) i0 C, V* F2 [这种处理,可以是样本的均值为0 00,同时它既不改变样本点的相互位置,也不改变变量间的相关性,但变换后,有许多技术上的便利。
( F* l2 z0 B g* F5 f(2)数据的无量纲化处理
" \% A! q' ^1 s! b: o* @在实际问题中,不同变量的测量单位往往是不同的。
6 d! ~+ \( \+ b' h2 v. ^- x为了消除变量的量纲效应,使每个变量都具有同等的表现力,数据分析中常用的消量纲的方法,是对不同的变量进行所谓的压缩处理——使每个变量的方差为1
4 [! d+ R* f8 j& K/ c6 x% i e即,1 E' h9 h- v6 S! i7 ]& A* P/ g- R f
S9 U- l P: l% ]! K
6 n) Q6 B8 P: U& g: W
当然,也有其他消量纲的方法,此处不一一列举。
6 a" ]+ q5 K3 E/ H(3)数据的标准化处理——对数据同时进行“中心化-压缩”处理
2 K0 ~) K) C4 `% \0 k即,. F/ `/ C" t- R' l$ L4 r% v
6 d: k% m" m6 `/ R
5 Q- A/ d( y9 n2 W9 Q/ y1.1.3 变量筛选) I; P5 H, J. r# z9 r! W9 W
3 X9 {. n$ p v$ [; V) e: i0 R——选择哪些变量作为因变量的解释变量: v' @2 u8 |6 w! s
" _% x4 F* M# }% T一方面,希望尽可能不遗漏重要的解释变量- T) W' j) b( f4 Y: l+ F4 J5 i
一方面,遵循参数节省原则(自变量数目过大时,模型计算复杂,且往往会扩大估计方差,降低模型精度),使自变量的个数尽可能少" n. d& D8 V5 u- D4 t& B; [
(1)穷举法
1 Y' s' _, U& z4 b e列举出所有可能的潜在变量,再根据自变量的不同组合,选取合适的模型。: ~/ z& }8 C8 |: n0 Z2 N
假设有m mm个潜在变量,则需要拟合与比较的方程个数为2m 2_m2
8 y: W# Z, \8 P3 O$ ?/ z$ h% rm1 F# B% D" a- f- I2 a
S* T6 I; n0 ^& [ ——当m mm较大时不现实
/ k0 E# \7 F" n: _, g* P& k w: M3 z# N1 `5 p' T0 O
(2)向前选择变量法9 B$ T% |% U* Q" {% i6 R
/ p- D `: k+ L( Q% s4 ?, b5 i0 [, H
" o R' N8 T; }( _& r0 D
* `9 J0 b$ e: `5 G
3 }8 F- [6 g8 _" U0 g
4 r% [7 j3 n3 |: k8 \2 ~
6 W6 ~6 P4 g5 m3 t$ V(3)向后删除变量法
% l0 M" }9 m Y1 B# p3 ]- }) H9 I
( ^* Z9 A* \6 U' G6 ^ y
(4)逐步回归法——最常用
4 C' { S% v$ V6 j. ~
! a; A8 P6 A! J$ [6 B a# A- |
( `8 w" a4 d# Z H6 N6 S5 ^0 x1.1.4 调整复判定系数
) ?& ?) I& v$ h0 v
, W0 p/ _: t* ]- a
1.2 最小二乘估计' m/ J( u8 c" P* C5 C5 v( U& r
0 M5 l3 n) \+ \+ R6 @' V' z8 L% i一元线性回归、多元线性回归——略。
% v' X% b6 E3 |6 {& _# j/ s6 P, B6 {/ P! v* \
2. 回归模型假设检验5 i. A6 _; R! T& g& N7 e+ b/ a
+ |. X% J* M. l5 w v——检查自变量与因变量之间能否用一个线性关系模型表示(F FF检验)
( _/ i' J# ^- n- C. E8 ~
- c2 ?( ` P |; p; P$ q具体检验方法见书,此处不再赘述。
" ~& P o8 m, ]
- T/ l: K9 x4 ~. J2 @; Y& a3. 回归参数假设检验和区间估计
& i5 c" U8 f0 ?/ K/ j' [
/ Z6 s8 v9 W, N% {0 F* m) W! d——检查每一个自变量对因变量的影响是否显著(t tt 检验), w% q! p1 g, Q. n
# K; E3 D, r% ^6 K. B具体检验方法见书,此处不再赘述。9 W0 ]" P# y1 [. q o& T
! x5 q. w! k" i" u! U4. 拟合效果分析
, t' B# m; W5 k
; Z/ x i' q- {9 U: D9 P; b4.1 残差的样本方差(MSE)
4 M- A) T& q" `, ~$ O
" N6 h; A Z( O2 r# G0 t$ m
2 {" i* c3 A9 Q# g4.2 判定系数(拟合优度)
. }/ N4 j) ^$ U7 e9 w8 |: L, \7 Y- s
3 p7 `$ j1 }$ `$ P+ t. b% A: j7 N
* S1 @/ |6 ]7 j) e q7 j' B/ i
5. 利用回归模型进行预测6 e: }: F3 y8 n3 V5 w
" T7 a$ F5 h- o6 G4 l6 w
6 J* e U9 O% U2 q! u0 t+ W
. a' J g; l7 k! R
其他7 q, f3 A! ~# X* r7 D
" [, u% ~( O) f F- w: B! a偏相关系数(净相关系数)) L+ ^3 {+ i! s: N! q2 x
5 Q$ S6 C. a% s! [1 V' W在研究两个变量之间的线性相关程度时,可考察这两个变量的简单相关系数。但在研究多个变量之间的线性相关程度时,单纯使用两两变量的简单相关系数往往具有虚假性。因为它只考虑了两个变量之间的相互作用,忽略了其他变量对这两个变量的影响。
. C$ F0 w8 N. x. J# o( G$ J) s- `$ Z- y
复共线性和有偏估计方法
3 |/ r, s6 s- x* \' Z+ v2 u2 y" u* E3 q
在一些大型线性回归问题中,最小二乘估计不总令人满意,比如系数正负号与实际意义不符,这可能是因为回归自变量之间存在着近似线性关系——复共线性(Multicollinearity); |/ Z0 i" T# |9 L# Q2 |$ Q0 x
, {8 b: W+ H" u9 Z; j. l$ M5 H
解决方法——牺牲无偏性,改用合适的有偏估计方法,以改善估计的稳定性
8 |3 o' U6 D& n" x* m例如,岭估计——可以显著改善矩阵列复共线性时最小二乘估计量的均方误差,增强估计的稳定性。
3 _0 @, o: ?) K) a# Q5 w, i(P.S. 均方误差Mean Squared Errors:一个好的估计应该具有较小的均方误差)6 t9 y( N6 r8 [
& l' v* k6 s* ` S; w& I) U
再如,主成分估计——可以去掉一些复共线性) `; P1 H0 ^) }/ v" O, }( y
$ s5 R/ m5 G4 e4 N( V
小结
9 d/ h5 V- N# o9 L$ J2 R
# B0 M* ]( V0 U$ y: k采用回归模型进行建模的可取步骤如下:8 j* Q$ ?& V+ e& {3 y: c! r
9 n$ _2 K* U# w6 B+ h M
建立回归模型, t! @ \: ^6 i
确立样本空间,对数据进行标准化处理,采用逐步回归法筛选自变量5 N8 U5 g- e) \ l
原文链接:https://blog.csdn.net/xxiangyusb/article/details/99762451
3 w; N1 Z) ~, v8 a$ v
2 P+ m7 z4 _8 t6 J! A4 {) ~6 n4 ?* v: B
|
zan
|