- 在线时间
- 1630 小时
- 最后登录
- 2024-1-29
- 注册时间
- 2017-5-16
- 听众数
- 82
- 收听数
- 1
- 能力
- 120 分
- 体力
- 565551 点
- 威望
- 12 点
- 阅读权限
- 255
- 积分
- 174888
- 相册
- 1
- 日志
- 0
- 记录
- 0
- 帖子
- 5313
- 主题
- 5273
- 精华
- 3
- 分享
- 0
- 好友
- 163
TA的每日心情 | 开心 2021-8-11 17:59 |
|---|
签到天数: 17 天 [LV.4]偶尔看看III 网络挑战赛参赛者 网络挑战赛参赛者 - 自我介绍
- 本人女,毕业于内蒙古科技大学,担任文职专业,毕业专业英语。
 群组: 2018美赛大象算法课程 群组: 2018美赛护航培训课程 群组: 2019年 数学中国站长建 群组: 2019年数据分析师课程 群组: 2018年大象老师国赛优 |
$ ?8 H( V# i7 h8 n5 F. x J
/ l( [) G1 r; E% P! _. p数学建模之回归分析 3 `: X" k) N' X& J/ ?
2 a% ` ]! G$ i6 \
应用场景, p0 C9 l8 U+ |; V% t& t
1. 建立回归模型1 }6 n- {7 o6 v' l( q% v+ v- C
1.1 筛选变量
2 e. [9 A/ u$ c d1.1.1 确定样本空间
5 U: O4 e! p% l$ M1.1.2 对数据进行标准化处理7 o" ?1 c. ? m
1.1.3 变量筛选
( `2 v) p$ \5 ^; v4 Q; X1.1.4 调整复判定系数
" n- ^% G1 j% @/ x: f Q1 D1.2 最小二乘估计
; y4 G q& J2 }; H" f9 X2. 回归模型假设检验
* I5 m# u+ @8 V( ?1 A3. 回归参数假设检验和区间估计- Y; G9 B( z4 m& B' ?
4. 拟合效果分析
( A' L9 @% s) }9 [% G2 {$ O9 X! U2 i4.1 残差的样本方差(MSE)* ~6 z p2 n/ i( n6 i; }: \: l4 d
4.2 判定系数(拟合优度)
3 |) d" f/ d6 a) \9 }9 j5. 利用回归模型进行预测
9 g! f+ ^, h- w6 Q; M其他
" V y4 G- Z; Q1 F偏相关系数(净相关系数)! R6 W$ n* A! h5 x7 f, u" u. B3 L
复共线性和有偏估计方法
7 z8 y U* d: i) _3 Z' `1 g0 A小结% Z6 R+ {6 n+ c: \ Q/ {
应用场景
: [7 L% [9 o9 `9 U: j5 g# g+ j$ o, P) f5 A
简单地说,回归分析是对拟合问题做的一种统计分析。% a% n- J1 v" N7 x! P5 P% N/ \" G
P.S. 曲线拟合问题的特点是,根据得到的若干有关变量的一组数据,寻找因变量与(一个或几个)自变量之间一个函数,使这个函数对那组数据拟合得最好。通常。函数的形式可以由经验、先验知识或对数据的直接观察决定,要做的工作是由数据用最小二乘法计算函数中的待定系数。& W! ]( e; R2 R( T& D* ~
$ `/ d) _$ k3 C- ]/ v
具体地说,回归分析在一组数据的基础上研究以下问题:$ U" @( p- s* [9 D: R
) W }0 J, I" {! b# q1. 建立回归模型
2 x7 i4 @& K' Q# i
U" c' q6 L1 n; E* f, b* U1.1 筛选变量
: W( q- r% d$ v4 X9 f* H4 J$ ^
$ c/ v; f- H# i/ g. x: K$ P1.1.1 确定样本空间- ~9 `! h. @) ~
) A/ ]+ G; u& I1 D+ ]
7 ?+ c2 u6 l( X, B- I3 q, J t; Y) }所构成的数据表可以写成一个n×m n \times mn×m维的矩阵。- u& Z4 |4 ]$ ^+ ]* w3 H9 n
- w* P5 S% J+ A1.1.2 对数据进行标准化处理2 u3 t }8 F) M- y% H
8 `% P. ]' a# _; @% V N(1)数据的中心化处理" ~: g$ ~- d& |5 }9 d6 C
实际上就是平移变化,
2 X+ a( T8 ]2 [. B/ O1 |
$ A; q2 C) R" ]% c
% U' `) }+ ]' U; D) y+ ?
这种处理,可以是样本的均值为0 00,同时它既不改变样本点的相互位置,也不改变变量间的相关性,但变换后,有许多技术上的便利。
, a0 D2 G: o8 u4 \4 c9 V/ t(2)数据的无量纲化处理
5 O R3 Y, C0 S# D n7 n% k在实际问题中,不同变量的测量单位往往是不同的。
0 l6 | e: B% l! d2 L7 F, t为了消除变量的量纲效应,使每个变量都具有同等的表现力,数据分析中常用的消量纲的方法,是对不同的变量进行所谓的压缩处理——使每个变量的方差为1! W5 S7 Y7 H5 Q, Q5 k
即,1 m; z" ]4 e8 w
' }9 s* e' ~# Q9 h: r- @2 W
' }/ d, E" w0 a当然,也有其他消量纲的方法,此处不一一列举。
! Z+ g5 e: a" D. U; B(3)数据的标准化处理——对数据同时进行“中心化-压缩”处理
9 [( S4 S& f: ]即,8 g& L8 z2 p! A' s. x! N0 C" o
$ ]( C; M# H3 Q: N# S
' K0 V# B' g: n+ A1.1.3 变量筛选
$ _ C2 `: X2 p. t' I- ]6 k: b6 X2 `( |' w1 d
——选择哪些变量作为因变量的解释变量:7 S! p9 K" Q8 ?. N
# F9 b9 K8 ~' \* ?& u. \1 B! I一方面,希望尽可能不遗漏重要的解释变量1 L& h. f; k% u# A5 a! w
一方面,遵循参数节省原则(自变量数目过大时,模型计算复杂,且往往会扩大估计方差,降低模型精度),使自变量的个数尽可能少. w5 t8 S( {% d; Q" B+ ?; h" R
(1)穷举法( z0 {# |" C; f# r1 U
列举出所有可能的潜在变量,再根据自变量的不同组合,选取合适的模型。6 U5 r* x: h: a1 I
假设有m mm个潜在变量,则需要拟合与比较的方程个数为2m 2_m2
3 J2 l9 ?- r4 t) P* dm, N+ W9 d" n8 Z4 w" w
2 E9 L Q! G4 n3 t# e4 n ——当m mm较大时不现实
# ^# [& g' _' Q7 A5 x6 c- ~
# |, n5 C2 m& l% X5 b" t9 X5 q(2)向前选择变量法! z7 a3 [5 m4 U+ W' R
0 M$ h! C K3 W
5 }, B6 b0 z% B( ~2 W. \7 o* D. ?5 B9 l( G T
! r. k" z5 X# W+ Z0 i# J
, N p: F% q. L/ `8 \
) \5 g" p! y0 e' n# z(3)向后删除变量法! [2 X& P2 r2 a& w( S
, ?4 L' c# ]; z7 `- U
(4)逐步回归法——最常用8 X+ r1 `6 r0 h8 `& H3 z8 y
% T* @7 F1 @4 j% @
. a/ F% w# Q# Y0 m _. \
1.1.4 调整复判定系数
% @& `8 F7 ?5 Y7 c, r
5 c N% |9 E* y, O B5 {6 X
1.2 最小二乘估计
" L1 ^4 \ X9 j8 }# ]) `( J7 A: X9 U! `7 d W3 t: p- Z
一元线性回归、多元线性回归——略。! r0 R `7 z j# R% J7 t2 `" J
# r- o( J1 z2 H/ d( s3 ?
2. 回归模型假设检验: j& g7 `- L7 E
2 D# a/ o: w4 B+ _ k" B
——检查自变量与因变量之间能否用一个线性关系模型表示(F FF检验)
0 a( M+ x+ L& m7 ? R0 {5 p& [) E: G) c: v) r( [4 f: Z3 U. S4 r
具体检验方法见书,此处不再赘述。
& |: n, Y* x7 ?" `2 V$ a/ d4 o
8 @4 w3 n5 }5 `( d Q2 D3. 回归参数假设检验和区间估计" I5 h& r% D0 M$ F6 U- M$ J
8 ^8 N: V+ B4 u' p' k; [
——检查每一个自变量对因变量的影响是否显著(t tt 检验), G8 M6 ?0 [0 i: F3 F, m
" g9 ~$ T2 c/ e; `, |$ \: i* h
具体检验方法见书,此处不再赘述。
; X: o, D3 D$ t0 H% d+ ^8 [3 X5 B& _& C: H# [6 \
4. 拟合效果分析
( R4 ?1 @* C/ ?: W2 v* c5 G) r# b* b7 ~/ a3 E( f
4.1 残差的样本方差(MSE)
; j: D8 e! K: v$ @9 B
( k4 Z5 W6 R& T* P
8 Y6 b: p1 ~; z; d4.2 判定系数(拟合优度)
5 o6 E7 L: w2 r& R1 h& j) @; T$ {6 K: X8 _% d5 w P) O8 W2 c
6 U' y* r/ U& \1 k/ o
% j t6 Q) D. p0 a5. 利用回归模型进行预测3 G, s! g/ v1 T4 c
- q( P: U6 f8 z8 J; G6 B
' r8 H3 @1 z" Q* h$ I0 c) ~
" q2 S7 n) q& I3 z+ u, \其他) g0 F. L0 \$ W& u( |) X$ @
1 ]8 @+ g& u$ D( \# B" B偏相关系数(净相关系数); n# w: S6 x3 c
! I! @. B: c4 X, H7 k5 S. D
在研究两个变量之间的线性相关程度时,可考察这两个变量的简单相关系数。但在研究多个变量之间的线性相关程度时,单纯使用两两变量的简单相关系数往往具有虚假性。因为它只考虑了两个变量之间的相互作用,忽略了其他变量对这两个变量的影响。
0 F' T' R3 Y0 m5 I$ `- S" \' E$ {, b( Q; t4 [. t: ]9 x/ i
复共线性和有偏估计方法- Y j- P- F; u# v9 Y
8 U4 W J1 s: a- A; w' r5 T% I. s- c
在一些大型线性回归问题中,最小二乘估计不总令人满意,比如系数正负号与实际意义不符,这可能是因为回归自变量之间存在着近似线性关系——复共线性(Multicollinearity)! F. N; V1 ~9 L: K6 N' p+ s9 f8 \
. ]0 Y$ [+ h1 C4 G! [! P
解决方法——牺牲无偏性,改用合适的有偏估计方法,以改善估计的稳定性4 I8 T/ T4 s# V9 H4 O6 q1 U
例如,岭估计——可以显著改善矩阵列复共线性时最小二乘估计量的均方误差,增强估计的稳定性。
) ]- b8 j8 S* L& A- b(P.S. 均方误差Mean Squared Errors:一个好的估计应该具有较小的均方误差)/ |7 |6 D% c4 |! \# P1 X& s
- e+ X$ V$ a: j4 X0 _
再如,主成分估计——可以去掉一些复共线性
, O) k. q; B2 w2 m; J5 j1 C6 E k! a0 K' d9 `1 ~
小结
+ H) A: z/ ?, _" l; I% v; Y J# v% u. T w
采用回归模型进行建模的可取步骤如下:
# F7 J9 a/ H% e' ]
* J+ Q, c8 }: g建立回归模型/ _5 i. o K" v; @& u
确立样本空间,对数据进行标准化处理,采用逐步回归法筛选自变量
1 V+ z& P, U1 x$ P9 {& n1 i6 a原文链接:https://blog.csdn.net/xxiangyusb/article/details/99762451
! d! Z! t2 e) [" V2 ?. x5 k5 J5 o- v p
4 `& R$ i( f; _0 g
|
zan
|