2021年研究生数模B题论文记录 6 K/ |- G( o4 O8 d" U 0 l' {$ ~4 a" l3 t* T; ^. d2021年研究生数模B题论文记录 6 `5 F0 [- s- ^2 @1.常见数据处理方法:1 z: q4 Y2 E" o) G3 H# x
2.相关性系数选择 ( R8 A' U1 q8 u4 L3.聚类算法 7 e" I& T L7 u2 F4.一种数据降维方式" \3 C4 G1 F6 k- I1 E s o
5.预测模型+ f0 h2 [' C+ d- T" U- H
文章来源 2021年全国大学生研究生数学建模竞赛优秀论文集合,B题,文章编号:B21100130067+ f6 e3 s3 | `
; i' d5 ~. x0 H0 y0 _! g c4 N0 @( _
1.常见数据处理方法:9 V- H) @8 R" E2 Q
针对缺失值,文章使用的是拉格朗日插值法,相较于平均值插值法,更加适用于有时间序列性质的数据,同时插值后的数据属于预测的一部分,文章中的观点是保留小数 C/ ?: k$ v! N M0 h
针对异常值,一种是不符合实际意义的数据,需要通过文献查找进行删除,一方面可以通过箱线图进行判断,也可以使用3σ准则进行判断,3σ准则解释:% h1 j- A4 `$ x, Z+ V: C2 l9 @
# s3 n7 g! y& d0 [' Y# ^7 h
2.相关性系数选择 0 U3 F7 z* n$ R# w常见的有三种,皮尔森相关系数,肯德尔相关系数,斯皮尔曼相关系数,知乎解释 $ ~3 \3 M/ C5 a' C 7 t8 |) {! j( @# W 3 K/ x9 a, I% U' J2 s - l0 S! \1 m/ B% D" a3 [( W3.聚类算法 & ^& t! g2 D0 s) g; o: ^ { w文章中主要提到了两类,基于EM的GMM聚类,K-means聚类 , l+ O' a& p( a/ `! S; QK-means聚类算法 9 X' M/ V- n4 c2 A" B) TGMM聚类算法3 v$ i( n1 |$ \* @" Q# ~6 n5 |; X2 Z
" G7 I4 e- g F; m # a: g/ \/ f3 w/ S% H5 s' M( |, J X/ L, N
4.一种数据降维方式* [% X" ]; k4 e n9 F$ O {9 u
论文中提到的将22维的数据进行降维处理,判断降维后的数据是否容易进行聚类,进而推论出高维是否容易聚类,提到的算法是t-SNE t-SNE算法* U, [( v N4 Y, B6 M% c1 T8 ^% E- s
3 y9 W3 d5 E3 ?8 j( z
( K. \8 N7 S3 _ T6 w5.预测模型 " q" ?. l. k- X7 X7 R文中使用的是XGBoost算法,论文中的第三问和第四问都是用的这个算法,使用时候,作者将数据进行纵向合并,数据集划分等操作,同时由于输入的维度过高,达到22维,而输出维度很低,还通过了输入特征与输出值的相关性,将维度进行降低,提出相关性不高的特征,最后图像看起来很好。XGBoost算法讲解4 R! }' X) y& ?' ^: \$ g4 Y
' w# U- w4 t7 M/ \( E1 ^+ ?5 a3 Z, S/ L / ~( G: h e# B" x" j) y————————————————% K7 b* C) R7 w0 z
版权声明:本文为CSDN博主「Philo`」的原创文章,遵循CC 4.0 BY-SA版权协议,转载请附上原文出处链接及本声明。4 v |2 C# }; j6 q9 e
原文链接:https://blog.csdn.net/qq_44864833/article/details/126650997 ' h. h2 w/ c6 M' Z* i 9 \0 i+ t% a/ P3 {3 z ! u' F0 I9 w+ h; Q0 P* O7 L