- 在线时间
- 1630 小时
- 最后登录
- 2024-1-29
- 注册时间
- 2017-5-16
- 听众数
- 82
- 收听数
- 1
- 能力
- 120 分
- 体力
- 565548 点
- 威望
- 12 点
- 阅读权限
- 255
- 积分
- 174887
- 相册
- 1
- 日志
- 0
- 记录
- 0
- 帖子
- 5313
- 主题
- 5273
- 精华
- 3
- 分享
- 0
- 好友
- 163
TA的每日心情 | 开心 2021-8-11 17:59 |
|---|
签到天数: 17 天 [LV.4]偶尔看看III 网络挑战赛参赛者 网络挑战赛参赛者 - 自我介绍
- 本人女,毕业于内蒙古科技大学,担任文职专业,毕业专业英语。
 群组: 2018美赛大象算法课程 群组: 2018美赛护航培训课程 群组: 2019年 数学中国站长建 群组: 2019年数据分析师课程 群组: 2018年大象老师国赛优 |
# ]$ T" r+ \9 b0 q; n c Y
% I: |' l3 a+ T/ a1 t数学建模之回归分析 / h) a9 J/ k3 }, v7 n& B% w0 W
1 I) P7 e) M5 C. h( f2 Z应用场景
; w8 L. z% |1 X3 P8 D4 Z1. 建立回归模型5 r6 f' k# ?; d5 j8 |) _
1.1 筛选变量$ v$ m1 N2 y/ T! W
1.1.1 确定样本空间
4 L6 K E. V& q/ t1.1.2 对数据进行标准化处理# N* r! g2 U0 C% W* A1 {
1.1.3 变量筛选
: W- ^7 B6 H. Z% M1.1.4 调整复判定系数. Q. o: a$ U; S+ }" c6 }
1.2 最小二乘估计
+ Q% R D$ W7 o2. 回归模型假设检验
& i9 h2 g$ |9 \8 @( ~5 k3. 回归参数假设检验和区间估计
n1 `% x: o; y% K+ h4. 拟合效果分析1 P5 Z1 Q& {# z! M. b3 M4 T
4.1 残差的样本方差(MSE)6 z: Q5 _7 J$ y: J5 Z5 V& u% W
4.2 判定系数(拟合优度)
, b3 g' Z) z1 W8 _' H3 Z6 M5. 利用回归模型进行预测
& M. k, c9 N7 w9 `其他& V, ~" M) H" h2 ~$ y1 g" n1 _ [
偏相关系数(净相关系数)
# S+ [( L" E2 W8 L# `, @复共线性和有偏估计方法
8 |$ W% z: U/ v$ ]1 ?小结9 r; z0 g1 |* [# f0 G8 v0 a
应用场景6 u) s. U( X0 I t) K/ q4 S5 L2 \
( r" A. [# m1 l$ Z6 r
简单地说,回归分析是对拟合问题做的一种统计分析。
4 S2 t3 z- q1 n. ]& G6 G& AP.S. 曲线拟合问题的特点是,根据得到的若干有关变量的一组数据,寻找因变量与(一个或几个)自变量之间一个函数,使这个函数对那组数据拟合得最好。通常。函数的形式可以由经验、先验知识或对数据的直接观察决定,要做的工作是由数据用最小二乘法计算函数中的待定系数。
- y* O2 G& e' c9 A, L0 Y$ X$ s3 L( s$ @2 V" J- z
具体地说,回归分析在一组数据的基础上研究以下问题:$ R! r, I) I% @, \
: R' J1 R, r+ ^ l
1. 建立回归模型
/ |, O4 |/ n9 s- `
& z: q' ~- Q& i& C, _! C% }1.1 筛选变量
% p- P. ? x8 r9 v' G+ \3 h* J, w# V
1.1.1 确定样本空间2 N Z# [9 E9 h* o P
R4 t+ j, D1 X3 F/ u9 A( d2 P* V7 L5 W
所构成的数据表可以写成一个n×m n \times mn×m维的矩阵。, t8 u4 F/ Z8 o" C2 ~
7 M) v4 ?5 ~3 R9 C, L1.1.2 对数据进行标准化处理
( t/ [ R+ s) ~# B! O) i8 a7 ?: i" k
(1)数据的中心化处理% t E5 J9 Z3 J
实际上就是平移变化,
6 b$ ]: I/ _: N# V0 c7 J: @
) }8 f) X, n" w- ]' x$ [
1 w, g6 T' k. ~+ [
这种处理,可以是样本的均值为0 00,同时它既不改变样本点的相互位置,也不改变变量间的相关性,但变换后,有许多技术上的便利。
, L$ s' B3 [: z; w7 n1 u B(2)数据的无量纲化处理1 y$ G. F6 `! L- B" t# _# p3 U
在实际问题中,不同变量的测量单位往往是不同的。' {. M+ k0 C8 [: h
为了消除变量的量纲效应,使每个变量都具有同等的表现力,数据分析中常用的消量纲的方法,是对不同的变量进行所谓的压缩处理——使每个变量的方差为19 @' ]2 D: X6 ^2 d7 I
即,
; ], H# V9 c) P: }+ Z4 g" j5 }2 C4 M/ Z( |% x7 A
6 o0 N$ q6 ^2 A* ~/ V) [4 P当然,也有其他消量纲的方法,此处不一一列举。2 P1 c0 _: s* r. ^) r
(3)数据的标准化处理——对数据同时进行“中心化-压缩”处理
' R7 [ {+ x- Q$ y% c; R' c- u4 v, M即,
0 N. g8 x! U$ v# m
' {% `" ]! L3 O% {
) M; N. v) O, z+ l
1.1.3 变量筛选
d5 I+ p7 V% w8 K/ u9 u
! k* B v; t. ~2 d* ^" m1 E——选择哪些变量作为因变量的解释变量:; Q: b0 n' m2 i; x7 B
' p6 _) ?& z2 W# E9 n' J
一方面,希望尽可能不遗漏重要的解释变量) _9 \+ K; E! T+ a3 C
一方面,遵循参数节省原则(自变量数目过大时,模型计算复杂,且往往会扩大估计方差,降低模型精度),使自变量的个数尽可能少
1 a) B, ?% P3 o3 Z- ?% Z(1)穷举法
0 w0 O' x3 J) E/ ~列举出所有可能的潜在变量,再根据自变量的不同组合,选取合适的模型。
0 x/ M9 P$ C( ^* f3 h假设有m mm个潜在变量,则需要拟合与比较的方程个数为2m 2_m2 ; C0 {/ D7 W, {8 Y" j
m
. a$ |) p ~- Z$ t3 ]
- j4 n2 j5 i% C- I ——当m mm较大时不现实
g9 {4 W3 r& A8 H
- D/ p7 d: E) t5 v* K, R- H. t1 {(2)向前选择变量法
$ a# R6 t: r4 x8 m) J
+ P8 R N2 ?% ^8 ?7 ]+ k' m
1 W! T) a+ E. @$ D a i# \! X
( X$ Z; r3 v- ?
* T, x2 @6 e6 g" l7 d/ h, G& E/ y) M- J- i3 C4 k! d, O n
(3)向后删除变量法
. [4 T" q* b* W5 R
( K0 ]3 }# [) A/ y3 y(4)逐步回归法——最常用
5 }1 d, a( K8 u7 }+ N, R
; x7 ~0 Z# b& N0 E
) I5 w$ S: h& ]9 U( o
1.1.4 调整复判定系数- m5 Y/ R( a+ Z8 h; p0 R% H
7 l2 `! I: U {6 a
1.2 最小二乘估计# z9 m x% v3 |1 ~
9 x8 |( h4 k% Y3 ?一元线性回归、多元线性回归——略。
' {# W4 Y6 e5 A5 X/ d4 g# n" v9 ?% d3 G# G
2. 回归模型假设检验
1 ]$ w9 e4 a: B/ ~. s& ?0 U1 l+ C4 |3 ?: k8 a) t, Z
——检查自变量与因变量之间能否用一个线性关系模型表示(F FF检验)- q: B# l) x, V; p3 W, L% b( b8 e
8 z1 f8 v. c4 V8 W. m6 J+ @& D3 K& U
具体检验方法见书,此处不再赘述。
! {1 n) X# [, I# f9 q9 P+ }; ?, m- P, @
3. 回归参数假设检验和区间估计
: e5 Y2 v9 |* {6 c/ d/ ~/ q5 x* |/ s
——检查每一个自变量对因变量的影响是否显著(t tt 检验)' v$ T+ w5 \. @5 [4 W
' M' U- r X0 }' _, }具体检验方法见书,此处不再赘述。
- A; {$ {, I8 [6 y; ]8 _4 }& U' a m% M8 z5 t. h
4. 拟合效果分析1 r; D o7 G+ _1 m
* @# `3 D7 b. O4.1 残差的样本方差(MSE)
/ m& i: B5 N& o, H, @
& Y; V) ^ L) p5 @0 _/ e6 z* e/ `* @ [
4.2 判定系数(拟合优度)8 w2 c6 |2 `) w
3 L+ r1 z0 J; |1 p! @
' ?7 ]( ?! `! T q1 w7 T( ^
% o# d) m' D! b3 s3 c" J% _% J5. 利用回归模型进行预测: r! P8 U/ f) R& g$ P3 x, A
![]()
: Y o( |* J( S' F/ r. n9 }
. o, Z1 Q5 W& ]
3 {' G0 q5 ~/ I( o4 D其他
7 H, V/ X) I2 E v4 l& o W4 A6 T
5 V, q5 `/ d+ y( v偏相关系数(净相关系数)
& Q2 L' o9 A* ~1 [/ O$ w3 t8 o
$ W: D n1 c' @5 p在研究两个变量之间的线性相关程度时,可考察这两个变量的简单相关系数。但在研究多个变量之间的线性相关程度时,单纯使用两两变量的简单相关系数往往具有虚假性。因为它只考虑了两个变量之间的相互作用,忽略了其他变量对这两个变量的影响。: v7 t1 r& I/ D# W5 E' P
! }, V% E+ y% l' d复共线性和有偏估计方法
1 y! S, ]* z# F; w9 e
" T7 f `& d' q# q6 }$ [2 r在一些大型线性回归问题中,最小二乘估计不总令人满意,比如系数正负号与实际意义不符,这可能是因为回归自变量之间存在着近似线性关系——复共线性(Multicollinearity)
2 v6 ^% m8 G% o1 [
$ `1 m3 W& ]+ |解决方法——牺牲无偏性,改用合适的有偏估计方法,以改善估计的稳定性, f( l) z6 o8 \ d' B3 r& L7 U
例如,岭估计——可以显著改善矩阵列复共线性时最小二乘估计量的均方误差,增强估计的稳定性。
2 C' |0 D. `( R4 C) G(P.S. 均方误差Mean Squared Errors:一个好的估计应该具有较小的均方误差)8 I. T+ E# p% Y. Q. E; H# e
7 I/ u) A8 R) t& F$ `- u5 ^
再如,主成分估计——可以去掉一些复共线性
+ q' d: |6 b9 U0 K6 s# }, q3 I' [& V" `6 P3 @9 V
小结
. @, ]4 {+ i4 d- ]
8 D. H4 P% |' Y3 J采用回归模型进行建模的可取步骤如下:
6 b, \0 v, H' G: U& K
' Y+ ~1 r, A& \" L9 H% d6 A3 u建立回归模型
1 `8 x( |: W9 s确立样本空间,对数据进行标准化处理,采用逐步回归法筛选自变量
. {) u$ y0 w, _' n8 ~3 `原文链接:https://blog.csdn.net/xxiangyusb/article/details/99762451
" l* C: L- O2 S5 p! G
% L$ x6 V8 P! C' t* t! x4 E: `# b3 S9 l4 c+ J3 T+ }: k
|
zan
|