- 在线时间
- 1630 小时
- 最后登录
- 2024-1-29
- 注册时间
- 2017-5-16
- 听众数
- 82
- 收听数
- 1
- 能力
- 120 分
- 体力
- 565548 点
- 威望
- 12 点
- 阅读权限
- 255
- 积分
- 174887
- 相册
- 1
- 日志
- 0
- 记录
- 0
- 帖子
- 5313
- 主题
- 5273
- 精华
- 3
- 分享
- 0
- 好友
- 163
TA的每日心情 | 开心 2021-8-11 17:59 |
|---|
签到天数: 17 天 [LV.4]偶尔看看III 网络挑战赛参赛者 网络挑战赛参赛者 - 自我介绍
- 本人女,毕业于内蒙古科技大学,担任文职专业,毕业专业英语。
 群组: 2018美赛大象算法课程 群组: 2018美赛护航培训课程 群组: 2019年 数学中国站长建 群组: 2019年数据分析师课程 群组: 2018年大象老师国赛优 |
+ {5 d% D, \9 z1 L* E+ v
+ `$ B) X6 F$ r3 k% H0 }数学建模之回归分析 ! G$ Z( [0 }% E# J1 m$ o$ w
$ t/ d0 n z8 L/ g7 k- V. F5 l
应用场景
" _* I# O+ O7 n2 d1. 建立回归模型
8 ? ~' b" V% ]2 l2 ]+ P4 T1.1 筛选变量$ N! m$ l& _- ?$ ~+ V8 T1 t5 V
1.1.1 确定样本空间* {2 M2 @7 z4 @- g7 h5 ]3 S4 y
1.1.2 对数据进行标准化处理# n! t( R7 p0 z2 N+ \: c
1.1.3 变量筛选9 h$ j, @7 s! z' t* H, g2 K/ G% z
1.1.4 调整复判定系数
# ]6 `! v- g) b0 |! Y1.2 最小二乘估计5 ^, I i& V& |, g. W" z% K
2. 回归模型假设检验
: z& N" x3 ^) J) Y5 N$ X3. 回归参数假设检验和区间估计! c- @6 i* e8 H; N! e. u1 s
4. 拟合效果分析
G8 P# D2 r3 R+ m5 _4.1 残差的样本方差(MSE)
" u0 [4 L8 L$ G4.2 判定系数(拟合优度)/ E, X+ x) G. Y- x* h
5. 利用回归模型进行预测
; }# g& \% G2 L, i其他% @; A# j* G4 H) i8 Y# [5 Y
偏相关系数(净相关系数)
( b- W0 S( i1 M复共线性和有偏估计方法
' {/ v& v' i5 z/ L) c小结. [6 u" W0 m7 F* @. p. q* S& o
应用场景6 U2 Z& K9 \% ^! g
% M3 p3 N T2 p/ }
简单地说,回归分析是对拟合问题做的一种统计分析。
6 \+ C, K3 A, b& B* g, \8 lP.S. 曲线拟合问题的特点是,根据得到的若干有关变量的一组数据,寻找因变量与(一个或几个)自变量之间一个函数,使这个函数对那组数据拟合得最好。通常。函数的形式可以由经验、先验知识或对数据的直接观察决定,要做的工作是由数据用最小二乘法计算函数中的待定系数。9 W6 ?4 J" q9 }1 i, A9 k1 j
2 \# R4 P3 c. [4 g具体地说,回归分析在一组数据的基础上研究以下问题:* B/ T7 J& }! j, ]$ L
X6 s4 {8 L6 V+ I& m1. 建立回归模型
8 z+ {4 M6 P% b- g( F6 i2 {7 V* j4 Z/ x4 u
1.1 筛选变量1 B- {/ X5 r3 Q
! R' X4 K* U/ J9 ?( u
1.1.1 确定样本空间, Y0 d: l" b9 n8 y2 e# ~8 A9 u
1 Y d# h; a+ `8 U$ K+ L" @2 q
' R) R7 D( { [0 R3 l1 C+ `
所构成的数据表可以写成一个n×m n \times mn×m维的矩阵。. F3 O0 t* l& ], n
# x4 B1 e: h! C, P
1.1.2 对数据进行标准化处理
! r. m$ B. T+ R% O) u D
1 P4 ?( ^$ _( r(1)数据的中心化处理
5 s! N4 p D& L& F实际上就是平移变化,' y& W, u4 a: T2 s# N: |! F
2 t1 `8 m, c) T- M
. G% U& n3 o, {1 T这种处理,可以是样本的均值为0 00,同时它既不改变样本点的相互位置,也不改变变量间的相关性,但变换后,有许多技术上的便利。
. [3 b$ k b# @, X- ~(2)数据的无量纲化处理
1 c. I% A& Z: B8 l4 u* Z) P在实际问题中,不同变量的测量单位往往是不同的。: m2 h( ?% |. I9 O7 Q$ n2 ?
为了消除变量的量纲效应,使每个变量都具有同等的表现力,数据分析中常用的消量纲的方法,是对不同的变量进行所谓的压缩处理——使每个变量的方差为1
! ] `2 T* a( c) k即,
) F% z- U ]; I# ^0 J' M
- o1 U3 o. O7 g7 `. E
7 e6 B* i% P5 [4 Q1 C3 v% D当然,也有其他消量纲的方法,此处不一一列举。
. P: t/ @' q/ r( k$ O9 E* L(3)数据的标准化处理——对数据同时进行“中心化-压缩”处理6 p: v. x6 b% m& `6 d% j+ C
即,* C; I" `* T1 W7 H
9 [4 U) k( Q! Z y" \4 {
9 a8 L" i5 x$ ]' J7 I
1.1.3 变量筛选
+ q% K# o0 _& x( r1 T1 n$ u, f, W( ?( e- ]
——选择哪些变量作为因变量的解释变量:
' ?0 u- c; U% A* ?: Q
$ n( f3 m2 N; T; s. w' r; y3 O一方面,希望尽可能不遗漏重要的解释变量2 S# ~9 M7 {9 o
一方面,遵循参数节省原则(自变量数目过大时,模型计算复杂,且往往会扩大估计方差,降低模型精度),使自变量的个数尽可能少9 Q+ V6 p7 J4 B1 s) j1 M
(1)穷举法
& p& v7 [% ]1 k9 _6 r1 y, f) G列举出所有可能的潜在变量,再根据自变量的不同组合,选取合适的模型。
4 s6 f% c6 g: ]5 W假设有m mm个潜在变量,则需要拟合与比较的方程个数为2m 2_m2 ; f- K: G+ n, s. N+ j& ~
m
5 ]$ Y; P4 i' L. r. n. Y
0 L/ ~$ |4 K& x ——当m mm较大时不现实
3 D# ?+ f3 g6 f" E, O! t s2 _* t* Z W1 a0 a/ {
(2)向前选择变量法
$ O. l0 Z7 o/ N+ J
c" n3 s3 e0 O% @1 X b( ]
@4 I% u! N* C& |/ o1 g% q2 E0 U
/ S) {/ p% f8 B/ ]
3 n) x! ]9 K+ m6 j( i
0 q2 A* B' ]/ U: E6 E
2 P/ Q! \9 j' l: ~& m" }2 J(3)向后删除变量法' y* }0 m+ Q: g: F9 v; c7 J
5 ]9 y4 F3 X! I& U$ p p7 K# Z(4)逐步回归法——最常用
$ d& N, s. Z# l D+ Y+ G
' v3 i$ i/ L3 z9 c% e. S
7 F& ]' v" N2 X1 {
1.1.4 调整复判定系数) ]- I2 R9 E, d. K( ^
: p8 N% N2 J3 l: v( Z6 ?1.2 最小二乘估计
; S" K: n, Y1 i8 l" A( E) \4 q& ^3 u9 ^5 v& X9 h/ ?
一元线性回归、多元线性回归——略。+ |* d: V& h! N& j m$ k
3 b G# e8 ^4 O$ c) e2 z% l2. 回归模型假设检验
; O0 t" u1 Q; W) |
6 i. c% C6 O2 X——检查自变量与因变量之间能否用一个线性关系模型表示(F FF检验)
6 |7 [$ g4 R* E8 L9 y* V, X. c9 L. R# I
具体检验方法见书,此处不再赘述。
* o% C' I9 f- ^! q" X7 S$ W3 d4 O/ A
z* V9 d- q; l4 x, t! R# O7 K3. 回归参数假设检验和区间估计
1 W( k! Z2 J. p& y$ G( U
) A0 u1 h6 ]# i/ i' k& g1 N——检查每一个自变量对因变量的影响是否显著(t tt 检验)
$ X F' K8 W7 f8 z) a) l2 Y+ P9 u. T' M1 G! N0 h% b
具体检验方法见书,此处不再赘述。+ z/ N' P7 p% [% G: G! g5 m! c
- i* v& P, b# w8 R3 o9 j& t5 {
4. 拟合效果分析
( ~8 V: X7 S8 u5 b! o5 E! c1 v; H" X5 V# R2 E
4.1 残差的样本方差(MSE)
/ k/ P- s! [! S8 V0 {
6 W8 u' A( V# j( ?( [
0 B: K X M Q3 V( _2 l; Z4.2 判定系数(拟合优度)
( ?/ W3 W. E+ m! S) E
1 @0 E& M( x6 s3 x
' L5 Y% M! m; ]# q
3 d& X2 y' J8 g+ ~5. 利用回归模型进行预测. T6 l) _' E( p8 q3 @: t
![]()
4 N' t; ^0 x4 D: L- S
# f; Q4 |1 o2 x) ?, B
5 l( B8 c) W2 O' ^# t8 b其他
: J) B$ }6 V9 ~* {. Z! h
* @" \! e- P h4 \* I; ]$ S' S! J偏相关系数(净相关系数)
3 s2 X3 S$ \' n: ]! E( Z& Z
* c6 R, c8 `9 Q在研究两个变量之间的线性相关程度时,可考察这两个变量的简单相关系数。但在研究多个变量之间的线性相关程度时,单纯使用两两变量的简单相关系数往往具有虚假性。因为它只考虑了两个变量之间的相互作用,忽略了其他变量对这两个变量的影响。
8 k/ ]. p$ v/ R+ h+ s& |: \) c! q, n; F/ ]
复共线性和有偏估计方法; {: [" j% W9 a& l8 ?
+ o( Y* F8 i' q
在一些大型线性回归问题中,最小二乘估计不总令人满意,比如系数正负号与实际意义不符,这可能是因为回归自变量之间存在着近似线性关系——复共线性(Multicollinearity)! c1 i1 g% v: N: v: ~* d/ s
* v; m& B0 G: W6 e. K- G
解决方法——牺牲无偏性,改用合适的有偏估计方法,以改善估计的稳定性
' H+ d) W$ |1 ^, V7 @2 [例如,岭估计——可以显著改善矩阵列复共线性时最小二乘估计量的均方误差,增强估计的稳定性。; Y2 D/ O1 Y& B7 [
(P.S. 均方误差Mean Squared Errors:一个好的估计应该具有较小的均方误差)
9 {3 d+ n% q* y& w9 ~1 `7 r0 `+ j$ z$ b/ T6 V5 \+ F" F( O
再如,主成分估计——可以去掉一些复共线性6 h5 ^2 Y2 y* w( K
# ~7 `+ D" A8 h* {. ~+ E: Z
小结, {3 q3 X3 w% b! l# Q/ {; h
, F; L3 z! x7 B, J采用回归模型进行建模的可取步骤如下:
. O2 X+ U/ L8 b" j& d1 n: \; l
建立回归模型! p# {0 _2 _9 d, r6 a. S# H
确立样本空间,对数据进行标准化处理,采用逐步回归法筛选自变量9 u% Z. ?2 ]9 I
原文链接:https://blog.csdn.net/xxiangyusb/article/details/99762451
{) ?: P- {% _9 a& D
* j E) x8 n; P4 e8 L
- b$ o5 {8 ]$ `% q+ k |
zan
|