数学建模社区-数学中国
标题:
2021年研究生数模B题论文记录
[打印本页]
作者:
杨利霞
时间:
2022-9-5 16:31
标题:
2021年研究生数模B题论文记录
2021年研究生数模B题论文记录
) a I. c; r: g4 E0 H3 c
( n& p; Z2 v/ d- s1 D4 d% I
2021年研究生数模B题论文记录
; Q- ?# {4 |7 l
1.常见数据处理方法:
! W: y$ l! E6 Z9 V6 _
2.相关性系数选择
) `5 x$ {! r* a( H9 X9 s' Q4 ?
3.聚类算法
1 [" f) \: |6 L' w( F
4.一种数据降维方式
: P2 z" Y2 {' V+ p3 R
5.预测模型
: C" `" D) y- S5 p
文章来源 2021年全国大学生研究生数学建模竞赛优秀论文集合,B题,文章编号:B21100130067
& f) C1 R- O( Y' H7 f% b4 n
- h; R- ^' |3 D) [* E
1.常见数据处理方法:
% B2 x: D8 p& U, o/ a, P& |5 m
针对缺失值,文章使用的是拉格朗日插值法,相较于平均值插值法,更加适用于有时间序列性质的数据,同时插值后的数据属于预测的一部分,文章中的观点是保留小数
3 A( S% j7 }( r9 N. J
针对异常值,一种是不符合实际意义的数据,需要通过文献查找进行删除,一方面可以通过箱线图进行判断,也可以使用3σ准则进行判断,3σ准则解释:
/ `# }# t# P6 B* c* U
5 o- Z' n4 O! U1 Y' _7 E+ A7 @7 `
2.相关性系数选择
& N! w% N# S# l
常见的有三种,皮尔森相关系数,肯德尔相关系数,斯皮尔曼相关系数,知乎解释
2 }* v% W f# r. z
( T/ m/ j$ f9 u% }
/ B$ T- X& @% O/ S6 I
( E3 S5 s- ]4 e( P
3.聚类算法
3 A, y! i8 I8 W# n s
文章中主要提到了两类,基于EM的GMM聚类,K-means聚类
% j% f# P( k# a
K-means聚类算法
& ^8 f* J: a% F
GMM聚类算法
+ J* x8 ^0 T8 u3 p( E
4 E' ^ V) _1 ?3 }# w
# f9 K+ V4 b' r3 G9 a9 X. Q; E& q
9 w, z! m. k, w& _+ S2 ~
4.一种数据降维方式
8 n/ R/ ^' p S3 m; }, V! r
论文中提到的将22维的数据进行降维处理,判断降维后的数据是否容易进行聚类,进而推论出高维是否容易聚类,提到的算法是t-SNE t-SNE算法
7 H6 n' M0 j9 l+ w, d; J" ^( u' u
; n4 a: U2 B. h s9 q4 ^
5 e8 e8 W2 i5 O# q
5.预测模型
0 k/ l' m9 N; C
文中使用的是XGBoost算法,论文中的第三问和第四问都是用的这个算法,使用时候,作者将数据进行纵向合并,数据集划分等操作,同时由于输入的维度过高,达到22维,而输出维度很低,还通过了输入特征与输出值的相关性,将维度进行降低,提出相关性不高的特征,最后图像看起来很好。XGBoost算法讲解
H9 `7 }% M! V6 u
6 b# |: d5 c, A5 {4 T
7 A, U& W: W7 O$ }2 F% v
————————————————
& ?. S, d. i! Y
版权声明:本文为CSDN博主「Philo`」的原创文章,遵循CC 4.0 BY-SA版权协议,转载请附上原文出处链接及本声明。
$ c1 W; I: d2 s
原文链接:https://blog.csdn.net/qq_44864833/article/details/126650997
# _% _- W& g$ p4 |9 I1 r: g% H
7 K. {- k Q; K [; \
5 w) Q$ l2 f: m: _5 L
欢迎光临 数学建模社区-数学中国 (http://www.madio.net/)
Powered by Discuz! X2.5