- 在线时间
- 1630 小时
- 最后登录
- 2024-1-29
- 注册时间
- 2017-5-16
- 听众数
- 82
- 收听数
- 1
- 能力
- 120 分
- 体力
- 565576 点
- 威望
- 12 点
- 阅读权限
- 255
- 积分
- 174896
- 相册
- 1
- 日志
- 0
- 记录
- 0
- 帖子
- 5313
- 主题
- 5273
- 精华
- 3
- 分享
- 0
- 好友
- 163
TA的每日心情 | 开心 2021-8-11 17:59 |
|---|
签到天数: 17 天 [LV.4]偶尔看看III 网络挑战赛参赛者 网络挑战赛参赛者 - 自我介绍
- 本人女,毕业于内蒙古科技大学,担任文职专业,毕业专业英语。
 群组: 2018美赛大象算法课程 群组: 2018美赛护航培训课程 群组: 2019年 数学中国站长建 群组: 2019年数据分析师课程 群组: 2018年大象老师国赛优 |
; g1 D4 j* X( h' A2 c' [
% |. a7 [- z. V9 @$ F数学建模之回归分析 S7 o- s% H7 p& |
& g5 z L3 N$ ~7 O l* J
应用场景
6 I) a+ L& ]5 |& G8 ]0 [: T1. 建立回归模型
6 ~, W, k" A: ]/ L6 z4 z1.1 筛选变量
$ q" @1 r$ X# y) F# n( `1.1.1 确定样本空间0 s* o) h) Q7 |' S2 c9 @3 e
1.1.2 对数据进行标准化处理
' T8 p- Q: X2 M' J5 R1.1.3 变量筛选
- Y7 s8 _( B: m1.1.4 调整复判定系数
0 }" ~- A' F! s1 x% Z4 ]1.2 最小二乘估计
5 H) P) X! g1 y* i: M, i4 j, w2. 回归模型假设检验% @8 k5 _1 T5 D
3. 回归参数假设检验和区间估计' x/ m( F% V4 G) h' U5 x& x( a6 N
4. 拟合效果分析
5 z7 V. \6 |5 J' q) j4 }# B4.1 残差的样本方差(MSE), O3 Y/ c9 M3 F: g% z- k
4.2 判定系数(拟合优度)7 s- {- k1 [; K, S
5. 利用回归模型进行预测
5 Y, F; J# S6 T/ T9 }其他
; \5 l2 M5 u: H偏相关系数(净相关系数)- ~0 a+ E: ]! G& y% M% S9 [0 g
复共线性和有偏估计方法
2 e7 a7 Y3 H1 G4 H/ z% K' T0 @" R小结
9 t6 z$ h: l2 S8 ^0 \& h应用场景
$ T8 p4 k, y- \1 P V: j+ s
) K7 t6 d6 w6 c0 y. W/ y简单地说,回归分析是对拟合问题做的一种统计分析。
. r% S! {, A" F/ C$ ~$ U3 v& iP.S. 曲线拟合问题的特点是,根据得到的若干有关变量的一组数据,寻找因变量与(一个或几个)自变量之间一个函数,使这个函数对那组数据拟合得最好。通常。函数的形式可以由经验、先验知识或对数据的直接观察决定,要做的工作是由数据用最小二乘法计算函数中的待定系数。; F( U& |% \9 x& ]$ p7 _+ K
0 C# c& q4 N* ~
具体地说,回归分析在一组数据的基础上研究以下问题:
& p" _" w! W7 W& b
2 j" R Q1 e- e# C' q! v" f1. 建立回归模型; B2 d2 G. @; L9 d; J9 F
6 c, F+ d* L( ~8 X# H
1.1 筛选变量3 Y ?# y+ {( M$ p
9 V/ ^ H0 t4 D, M* X: D) m& l- f$ S1.1.1 确定样本空间
2 X8 P3 R" }; Q+ i/ I9 q
' M1 P2 i/ s6 @% g
x$ @, |7 s7 u1 [" F! V所构成的数据表可以写成一个n×m n \times mn×m维的矩阵。8 ?/ E2 I: p# ~0 A
' d J F6 f7 D+ T" Y" F2 n1.1.2 对数据进行标准化处理' V$ T, i5 O/ z9 P( P7 c' f) T2 ]4 P
! w/ z& |. ~' r- c, O6 ~! A
(1)数据的中心化处理; t# N5 T# P# H/ i8 v
实际上就是平移变化,. u! U6 K- j9 j: I" b& p
1 m* g/ z. @! ?0 ^
& t4 T* J1 o( j( c$ O7 ^+ n
这种处理,可以是样本的均值为0 00,同时它既不改变样本点的相互位置,也不改变变量间的相关性,但变换后,有许多技术上的便利。; `: N6 I$ p& _: R8 y6 H: A1 @7 @9 h
(2)数据的无量纲化处理
% _2 a* m' W5 _0 N' U, ?在实际问题中,不同变量的测量单位往往是不同的。
8 {4 e% c* O& t% k% h为了消除变量的量纲效应,使每个变量都具有同等的表现力,数据分析中常用的消量纲的方法,是对不同的变量进行所谓的压缩处理——使每个变量的方差为1# C* q- ?9 b) H
即,. z4 B+ Z+ V9 M; s/ P2 A
3 n9 U4 O+ T; j2 U& L( P1 j
- w0 o/ u: r( s0 Q6 I
当然,也有其他消量纲的方法,此处不一一列举。& ?3 f3 S# Z2 d0 S e/ |; G; ]; o
(3)数据的标准化处理——对数据同时进行“中心化-压缩”处理
: \" H2 z; ^7 Q8 c- Y即,$ Y5 S) g" L0 c2 A) }: }, Q
5 S* S; o- E1 k/ b" A% u+ n) ]
7 ^& k4 { V" u' J: L' G1.1.3 变量筛选
) v2 e l' V# |' U7 ?8 S
; x; P G3 P) v——选择哪些变量作为因变量的解释变量:7 m) n, I, D/ ~; ~6 d- f
7 C, U* h5 x9 M* j; M一方面,希望尽可能不遗漏重要的解释变量
3 j* v0 @) l* t3 k9 O$ A. s一方面,遵循参数节省原则(自变量数目过大时,模型计算复杂,且往往会扩大估计方差,降低模型精度),使自变量的个数尽可能少
) o3 R. @% O5 g; d5 j(1)穷举法9 L2 T/ {$ Y# M# r: I: {+ ^: R
列举出所有可能的潜在变量,再根据自变量的不同组合,选取合适的模型。* W% |5 o) e, V2 `2 G d" X4 E5 I
假设有m mm个潜在变量,则需要拟合与比较的方程个数为2m 2_m2
9 A4 G6 M+ P. x o; ]3 Zm6 y( Y4 E" G% y$ I4 C
. {# S A ?9 ^+ h% G. a& {2 Y
——当m mm较大时不现实
6 Y8 Q0 q+ h5 @- \/ T: T
8 x# A6 i3 X4 g! W/ ?0 X8 x(2)向前选择变量法. E# ]0 Q+ j' V! M, |
% a( I( G: O l' q# [5 e
* y( Y! C* b% q! _* b$ u
& W% y' u5 R5 m- b7 o
+ T; |! F7 B- }
' W/ B# s; R) J u* b J9 V+ d% M1 E* M7 v; b3 T2 R4 x
(3)向后删除变量法
% z% r) T* i# c* T- K1 ?* C
# ]* ~5 H% B, D1 N
(4)逐步回归法——最常用- l$ R. Z* }9 c% E9 V8 w$ o
5 A$ i- N, O) n4 y4 v
" c" N8 _. R, K* u8 F# A
1.1.4 调整复判定系数
# J# q- ?5 U! p1 D% t4 q
G; W/ ~0 f, C2 s1.2 最小二乘估计- ]& a+ g& I E3 w
# p# W( C' D9 i+ ?6 Z
一元线性回归、多元线性回归——略。$ {# T- v9 U4 B Y3 E, F
4 D% T' p' E& r) g1 S. q
2. 回归模型假设检验
0 w0 T g4 j- r9 r' b. s ? c& x
- T% h+ e! R; \6 X; x6 `0 k, a——检查自变量与因变量之间能否用一个线性关系模型表示(F FF检验)5 _) E, a7 ?" B, U
. R9 N/ y3 U3 k( j6 n2 F
具体检验方法见书,此处不再赘述。
) ~$ r3 {, B9 X& ~, P
4 |6 }+ c! r( U2 W$ \# ^3. 回归参数假设检验和区间估计 `" l2 p& j8 {4 E( _
# v5 e: _$ M' Q% V) n——检查每一个自变量对因变量的影响是否显著(t tt 检验)5 y' R# D! L' J7 a5 ~6 d
8 ?: O5 `8 w8 t% P" H具体检验方法见书,此处不再赘述。
( [3 o5 u8 O" z3 N, ?; B8 a. Q. D. v4 R+ ~
4. 拟合效果分析
& g# V9 B! m d: J- \. c3 U7 ?+ a3 F" M! n F) P- M1 b1 g
4.1 残差的样本方差(MSE)1 c2 ~3 x: G) U$ K# y: _9 X9 M3 k
5 x$ ~+ v/ |, [/ D6 x& W
0 l1 n4 w4 A. S8 o6 m4.2 判定系数(拟合优度)
! Y* S5 U. T- C* J4 h* t2 j
. O5 [/ |% e" |3 w( U# d
1 D; s: D) O0 C: A! `
g8 a4 Y/ I, q. @, ]* K5. 利用回归模型进行预测% \ o' G9 M' T: M1 T4 Z
, @! [( x( o) _# w
: r9 h9 R$ L5 `3 Q3 ^! L1 r" t
5 \5 J9 W$ H G0 Q% u6 s其他
! g- e- y# t4 @1 ?- U# z a1 ~, e' @; ^
偏相关系数(净相关系数)
1 `' W: C' Q2 r, i0 `( G7 `9 V4 v$ b) m$ t1 ~' i
在研究两个变量之间的线性相关程度时,可考察这两个变量的简单相关系数。但在研究多个变量之间的线性相关程度时,单纯使用两两变量的简单相关系数往往具有虚假性。因为它只考虑了两个变量之间的相互作用,忽略了其他变量对这两个变量的影响。
( i5 ?5 g: d$ [2 l
* C; `8 N' D$ q$ m, m2 f复共线性和有偏估计方法; M: ^4 _3 C) F: ?
+ j0 m% p; |3 [$ W
在一些大型线性回归问题中,最小二乘估计不总令人满意,比如系数正负号与实际意义不符,这可能是因为回归自变量之间存在着近似线性关系——复共线性(Multicollinearity): F5 c5 y: v7 R5 e8 _- D, _! `
+ ?6 B4 n% P) V5 z
解决方法——牺牲无偏性,改用合适的有偏估计方法,以改善估计的稳定性
# D* G. Y( G) {7 A例如,岭估计——可以显著改善矩阵列复共线性时最小二乘估计量的均方误差,增强估计的稳定性。
& J# U& a2 a+ V0 n( ~(P.S. 均方误差Mean Squared Errors:一个好的估计应该具有较小的均方误差)5 {" |1 w# q" b/ q4 r/ f) o% f
; B0 ~( \; L! X' y) Z" d再如,主成分估计——可以去掉一些复共线性- O$ ^) U/ x+ N! s0 @$ G
2 @4 c% Q* m1 w$ `
小结) n+ L P- W5 h- S
) K1 \+ v2 p# X+ H/ M% O# t; L1 T
采用回归模型进行建模的可取步骤如下:
$ g2 ?+ M2 ^& ^( o( C
# V8 i, e- X# R. R ~* Z3 i& C建立回归模型
7 F R' h% ^/ ~2 r+ N确立样本空间,对数据进行标准化处理,采用逐步回归法筛选自变量
4 T0 M2 y8 I' o% z- r) h原文链接:https://blog.csdn.net/xxiangyusb/article/details/99762451
, p: j7 T, Z0 g Q+ h8 I
5 P# `" L# x+ @4 ^" y3 F% m
( E0 [" g! C6 P: z3 Q, |) L |
zan
|