数学建模社区-数学中国
标题:
2021年研究生数模B题论文记录
[打印本页]
作者:
杨利霞
时间:
2022-9-5 16:31
标题:
2021年研究生数模B题论文记录
2021年研究生数模B题论文记录
# S# X/ X3 G+ {0 E' i3 j5 l( }1 \
3 g1 H# m. y$ \ `+ p
2021年研究生数模B题论文记录
/ S* K" `! F7 T' W3 ~; D
1.常见数据处理方法:
, i/ T0 b0 N w' `! V
2.相关性系数选择
. J% m, o- E$ q. d# A6 f+ F
3.聚类算法
( k7 J" Y1 o$ k* A2 b* e2 n' K2 b
4.一种数据降维方式
* q% B/ q* K# J
5.预测模型
3 ]; A0 \+ m7 r& s4 j& \6 [
文章来源 2021年全国大学生研究生数学建模竞赛优秀论文集合,B题,文章编号:B21100130067
+ S2 W f9 ]* l4 e/ b8 o
/ _% V5 W) ?) V* V+ Y
1.常见数据处理方法:
3 d- F: C( d. w4 q* w9 q( c
针对缺失值,文章使用的是拉格朗日插值法,相较于平均值插值法,更加适用于有时间序列性质的数据,同时插值后的数据属于预测的一部分,文章中的观点是保留小数
: i/ I" o- _( g
针对异常值,一种是不符合实际意义的数据,需要通过文献查找进行删除,一方面可以通过箱线图进行判断,也可以使用3σ准则进行判断,3σ准则解释:
8 I& F8 o* k! m" Z2 t
% }9 f' K. V- P2 D w. B5 i
2.相关性系数选择
% E* N" y! r4 g: ~' \
常见的有三种,皮尔森相关系数,肯德尔相关系数,斯皮尔曼相关系数,知乎解释
& R5 s4 x6 m2 M, [) C
8 S) E: J) S# {) r. l. h1 a* w8 @. Q& p
6 _1 p% a# t$ ?
/ `1 | \* g0 r5 J9 x3 y
3.聚类算法
2 S0 \) x; o0 J9 w( e
文章中主要提到了两类,基于EM的GMM聚类,K-means聚类
/ t* p( O+ v/ C. _
K-means聚类算法
! O9 V% j8 ~( i
GMM聚类算法
% k8 @' {( M2 D, [* @& h
( a- a1 z* L, q& {/ r
) L3 G7 M, P* ~$ L6 g- [6 R- Q
# P3 b' n6 N' |& i5 A: z
4.一种数据降维方式
- e* U% I5 ?* L; u9 Y# F
论文中提到的将22维的数据进行降维处理,判断降维后的数据是否容易进行聚类,进而推论出高维是否容易聚类,提到的算法是t-SNE t-SNE算法
- y, P% t) U( V8 U
- |5 G/ h" t5 y) g
5 C1 y0 @) _& L/ `
5.预测模型
% w+ A4 k$ s* c3 I% J$ U
文中使用的是XGBoost算法,论文中的第三问和第四问都是用的这个算法,使用时候,作者将数据进行纵向合并,数据集划分等操作,同时由于输入的维度过高,达到22维,而输出维度很低,还通过了输入特征与输出值的相关性,将维度进行降低,提出相关性不高的特征,最后图像看起来很好。XGBoost算法讲解
4 R2 B/ K/ m& R
! ~4 J( C; }$ u! F+ b, e1 W
( m: |$ e9 k+ G4 h1 f
————————————————
# c! s. k7 I- W% y" C
版权声明:本文为CSDN博主「Philo`」的原创文章,遵循CC 4.0 BY-SA版权协议,转载请附上原文出处链接及本声明。
* P+ Q* Z, ?) G' q) ^; B# \
原文链接:https://blog.csdn.net/qq_44864833/article/details/126650997
: b. ]0 c8 F' u9 C/ X7 Y
# z# y. [) e6 e+ M2 {+ C5 K8 x
- F* Z8 q8 D: U# P
欢迎光临 数学建模社区-数学中国 (http://www.madio.net/)
Powered by Discuz! X2.5