- 在线时间
- 1630 小时
- 最后登录
- 2024-1-29
- 注册时间
- 2017-5-16
- 听众数
- 82
- 收听数
- 1
- 能力
- 120 分
- 体力
- 565548 点
- 威望
- 12 点
- 阅读权限
- 255
- 积分
- 174887
- 相册
- 1
- 日志
- 0
- 记录
- 0
- 帖子
- 5313
- 主题
- 5273
- 精华
- 3
- 分享
- 0
- 好友
- 163
TA的每日心情 | 开心 2021-8-11 17:59 |
|---|
签到天数: 17 天 [LV.4]偶尔看看III 网络挑战赛参赛者 网络挑战赛参赛者 - 自我介绍
- 本人女,毕业于内蒙古科技大学,担任文职专业,毕业专业英语。
 群组: 2018美赛大象算法课程 群组: 2018美赛护航培训课程 群组: 2019年 数学中国站长建 群组: 2019年数据分析师课程 群组: 2018年大象老师国赛优 |
6 [% n I6 C( S4 `% ?- c6 D' ?; m1 K2 S! _" ~$ N! O4 _8 R/ @' @
数学建模之回归分析
9 @1 l* k) ?8 {' e& M
# j5 r% f5 U/ q1 E" j U应用场景+ G: [' o& ?! U" m8 O
1. 建立回归模型 z U3 [1 A9 Y/ z" s! X
1.1 筛选变量
# C2 ]- G, H+ o& }1.1.1 确定样本空间
2 a5 }8 v4 D' U! D8 I) u- @1.1.2 对数据进行标准化处理
7 n. `3 I1 ~! s. W1.1.3 变量筛选
- k# {. ]% C' P9 [# ~9 a1.1.4 调整复判定系数: L* Y# V7 g7 R' H/ x5 n
1.2 最小二乘估计1 L5 _: X: I: \1 |8 X
2. 回归模型假设检验& F! k- E2 ^9 V+ I
3. 回归参数假设检验和区间估计
0 j1 f0 [: G# f4. 拟合效果分析
3 q- `8 q) L6 Z! T- g' Z0 Q4.1 残差的样本方差(MSE)1 T) m e/ \% f m- C
4.2 判定系数(拟合优度) I. U2 Y5 s2 p9 G
5. 利用回归模型进行预测8 a4 Q: g* v K: M
其他0 f* E2 D" x6 Q* p0 M/ Y# W
偏相关系数(净相关系数): X4 A! c* z0 Y5 b! N8 c* s
复共线性和有偏估计方法( i5 @5 t' G9 t) Z# O, K
小结
. w0 ^/ u9 Q" O# S应用场景; ~4 r) N. {; [
: p: l* Q1 U1 M2 @5 V7 f简单地说,回归分析是对拟合问题做的一种统计分析。
6 A& T( F. r) S1 F+ m+ MP.S. 曲线拟合问题的特点是,根据得到的若干有关变量的一组数据,寻找因变量与(一个或几个)自变量之间一个函数,使这个函数对那组数据拟合得最好。通常。函数的形式可以由经验、先验知识或对数据的直接观察决定,要做的工作是由数据用最小二乘法计算函数中的待定系数。
+ q$ ]( x ] [- q8 U* o
* S; h* S) ?' |7 Y' X: @& G具体地说,回归分析在一组数据的基础上研究以下问题:/ V1 U/ M. Z5 Q: _# c. ^0 }+ \8 r0 s
! t6 I& C+ ]+ n, k: F1. 建立回归模型$ {0 p$ P8 w3 G0 S7 G; _3 B
+ U4 a3 g" z6 n) s
1.1 筛选变量
$ Z# f$ Z: C. d* c4 P' M, z2 c2 v! ~. d5 c4 x
1.1.1 确定样本空间: f X' P& C! g7 x8 h) M! }2 `* m
3 Q/ ?4 v, ?. F/ A2 r
0 y, |1 B3 V& I* j; D% E d( N所构成的数据表可以写成一个n×m n \times mn×m维的矩阵。$ ?8 m% Y! a2 {1 b0 d& Z: X$ a
3 P6 [3 F W+ G7 U1 t) H
1.1.2 对数据进行标准化处理
2 X/ k% F# K7 h H5 k/ @$ t6 e! R# m$ ^- Z1 e
(1)数据的中心化处理" Y- ^: s, o% t; i' [: f7 c& p
实际上就是平移变化,
# O: K) |( e. ]7 c0 U( ]
! {" ~8 `2 |$ j; H
/ F5 G G4 }+ [% Z" k- @. I( P+ ]
这种处理,可以是样本的均值为0 00,同时它既不改变样本点的相互位置,也不改变变量间的相关性,但变换后,有许多技术上的便利。2 s1 g# \( q8 H% b$ e
(2)数据的无量纲化处理
% n7 w; u' Z/ E; Y0 g+ ^) L- k在实际问题中,不同变量的测量单位往往是不同的。6 n" _+ h6 h/ N3 B0 v
为了消除变量的量纲效应,使每个变量都具有同等的表现力,数据分析中常用的消量纲的方法,是对不同的变量进行所谓的压缩处理——使每个变量的方差为1
8 c9 G/ M( U ?% R n% k8 F即,0 Z B! D; U0 F. \: g* L
" ^1 I' ^) P# b
; M% W' U+ K% H& r: D7 _4 z6 h8 T当然,也有其他消量纲的方法,此处不一一列举。
$ c+ y+ o: V( b; K(3)数据的标准化处理——对数据同时进行“中心化-压缩”处理
" ^8 {+ z, T$ g. ]3 K. k即,1 ~3 H4 l& Y& A) b; V
& e; ~0 M! O5 N. u. U% f
/ J5 N ?$ ?! Z5 j7 q4 E
1.1.3 变量筛选
. V" O5 ~7 m& c
% U D) ]1 e8 N% Y6 B) m- Z——选择哪些变量作为因变量的解释变量:
; L0 W8 K4 N: c7 z
+ ?$ w9 W: U$ f一方面,希望尽可能不遗漏重要的解释变量
5 V, @) J6 u. Y2 s3 n% _9 _一方面,遵循参数节省原则(自变量数目过大时,模型计算复杂,且往往会扩大估计方差,降低模型精度),使自变量的个数尽可能少
1 g: D& a- I6 G+ M(1)穷举法
9 G. T+ t$ ~' i- l! J# b) B, ?列举出所有可能的潜在变量,再根据自变量的不同组合,选取合适的模型。 C$ O! \/ v- r
假设有m mm个潜在变量,则需要拟合与比较的方程个数为2m 2_m2 / T# H0 k. K/ H3 q4 e
m* n S3 y, X( n
5 q. q( [- k6 N) g ——当m mm较大时不现实# h1 Y9 d# O6 b$ Z3 a: e
" P2 M( \: W5 w" T$ u" V1 y# i(2)向前选择变量法 B& V# x1 Z* }3 [9 D# ^* K3 ^( i
) d1 B& E: F9 D6 h6 W
8 g% }3 }9 W: {* u2 a
8 J5 N4 \! m6 x4 ^
$ X; ^1 a& e, b, z- T( n8 J
1 G- l6 I3 |& N. C1 T Y% d
, L E9 b& O: |. H7 f" j2 z(3)向后删除变量法/ ^+ e/ z8 v! B, L
+ t- K1 Q7 {& V6 y! R. `" d(4)逐步回归法——最常用2 G, k% ]* \; Z0 Z) [; a
7 T* J8 z& C1 h+ G- i2 `; Q* h+ _
; h: I) K/ }! T6 _ U1.1.4 调整复判定系数( v8 n" c" w0 l/ X f, p# Y
6 ?5 ?8 C4 p7 t+ s6 p" f, ]* A# i
1.2 最小二乘估计 \; P& u0 Z; w" F1 e' K
3 `2 n6 J x P% S! N1 [" i一元线性回归、多元线性回归——略。$ l" j2 N9 S2 k1 y
~0 d- N; Z9 H3 u( { K2. 回归模型假设检验( Y( c' u6 c* L( C9 j& x4 f
) Y- m, W, i- a( L8 F3 B/ C——检查自变量与因变量之间能否用一个线性关系模型表示(F FF检验)
* @- P; ?0 } O
# @2 C' R7 v/ T, q7 v0 W具体检验方法见书,此处不再赘述。
$ s. S4 F) ]7 j2 u; L+ X
/ V( w3 H% Y% U; I- W3. 回归参数假设检验和区间估计2 n- K4 I0 ~& v( h [
. N8 e. [0 B! W, ~3 S- w% I
——检查每一个自变量对因变量的影响是否显著(t tt 检验)$ h9 V/ ?: v3 i7 u) }
& Q5 a1 g+ j- T' Q) z1 F2 p具体检验方法见书,此处不再赘述。
; J. Y$ V+ d* S2 v5 w
2 b. d. W6 |/ g* `0 B; A. `. K% U4. 拟合效果分析$ Z( C4 G- H I- z
9 k1 g: a. M/ {( _) Z( {! z; t4.1 残差的样本方差(MSE)) C* _6 `% ~) @/ A3 u4 f1 a/ t: i
* q- j8 k. |7 w2 x: M
8 v, M' u" l z! }5 P% `4.2 判定系数(拟合优度)8 m! ^8 A U9 g5 l. V
. V3 h* F" L' O1 n. S; _
2 b# O4 @1 F7 ~+ I* z% k |
+ ~( e& x' z( U, ?; b! U/ _. d9 A/ z
5. 利用回归模型进行预测
$ O. J2 u9 p. U! L* x 5 M" i1 { o7 K" l/ h7 i q
/ P) {/ C, M) w. Z: i
3 L& M% e% L7 k- `1 Y
其他9 h7 Z+ q% [3 b5 }, P1 y
( i1 p5 X% K; l" n4 C1 ^! _
偏相关系数(净相关系数)
: @9 p( _5 \ E- d$ K
4 {* `# i4 L; ~" O: o在研究两个变量之间的线性相关程度时,可考察这两个变量的简单相关系数。但在研究多个变量之间的线性相关程度时,单纯使用两两变量的简单相关系数往往具有虚假性。因为它只考虑了两个变量之间的相互作用,忽略了其他变量对这两个变量的影响。
- J, l. h) Y2 g& {/ t4 t) c% U: c+ k% ~5 D# o; P- J z9 M ?
复共线性和有偏估计方法
6 X/ R/ _- J5 z; k" @3 l4 ^8 O
5 g4 T' P% m( J7 }) E; E在一些大型线性回归问题中,最小二乘估计不总令人满意,比如系数正负号与实际意义不符,这可能是因为回归自变量之间存在着近似线性关系——复共线性(Multicollinearity)
+ q$ y7 g: i0 k) t, V- P# J& O- e+ N/ B- {$ q8 [" s) X( M& d
解决方法——牺牲无偏性,改用合适的有偏估计方法,以改善估计的稳定性: W% {( Q- H. X9 n! U0 I- ]
例如,岭估计——可以显著改善矩阵列复共线性时最小二乘估计量的均方误差,增强估计的稳定性。
) B+ L' I0 `! E6 [! s(P.S. 均方误差Mean Squared Errors:一个好的估计应该具有较小的均方误差)
+ ~3 A* P$ O' X7 I" u( V; x
/ H/ J5 ?+ D2 r- v; c再如,主成分估计——可以去掉一些复共线性
' w% w* c4 ]8 M( f7 q4 w6 q% p% i' n' P; L( b( |
小结3 ]" T$ E9 y8 P6 x
5 i, w0 T& v$ h" N7 b" x
采用回归模型进行建模的可取步骤如下:5 M% p) c2 L$ i) {; O* A
0 C1 a) b3 e0 A+ `/ v/ Q# i* `9 s
建立回归模型
& g5 H6 U5 C# m& Z* ~$ w确立样本空间,对数据进行标准化处理,采用逐步回归法筛选自变量
3 c: o& G; R' L- F9 T原文链接:https://blog.csdn.net/xxiangyusb/article/details/997624510 Y* y8 t/ k' A1 R- ]
* q7 i! V' ]8 ^+ x6 W, k: H7 Q/ ?; g0 z# U) k g' k. B) r
|
zan
|