; _) s0 i0 e. n, X数学建模 ————统计问题之预测(一)# M3 D9 o7 J1 t) N5 V
该资料是笔者根据自身理解一点点写出来的,希望各位能尊重这一份来之不易的劳动成果。因个人水平有限,资料中难免会出现不足与错误,欢迎各位的批评指正。(笔者曾获得2015年全国大学生数学建模国家一等奖,2015研究生数学建模竞赛国家二等奖,2016年美国大学生数学建模竞赛M奖)% f+ O' G+ t7 J1 r+ L% R
: o! q- W, e; B统计算法总览" i, x, `& o2 Z# \9 ?4 E( ?
& N* Q3 j+ j& w, m. x 统计一词源于国情调查,一般来说包括三个含义:统计工作、统计资料和统计科学。其中统计工作是指的搜集、整理和分析客观事物总体数量方面的资料,统计资料则是由统计工作所获得的各项数字或文字资料,一般反映在图表、分析报告、统计年鉴里面,而统计科学则是指导统计工作的原理、原则和方法。$ S, u+ r$ \6 a: W! ]& |% O
因此,在数学建模比赛中统计问题一定要有文献资源和数据资源的搜集,并且这一部分内容也要反映在论文中,而整理通常来说是将搜集到的资料以图表的形式呈现在论文中,最后分析自然就是数据预处理和统计算法建模求解。: M+ o& z( D7 d) q4 O2 S' U6 y6 a
; L. A f# R" [& D" ~' Z4 A5 ~3 i8 M5 C1.预测! G) h* F% x3 ]" D2 f
, r+ Q s! y6 R. ]8 U 最后一个就是机器学习,即我们只需要搭好框架,数据特征则会由其自己挖掘,比较有名的有:支持向量机(SVM)、决策树、神经网络(深度学习)。这种算法的最终目的是模拟人脑的结构,它的好处就是在搭建好网络结构之后,通过对已有数据的学习,网络会自行提取数据特征,然后只要我们输入一个数据,网络将自行计算,然后输出它的预测值。这种方法的优点是方便,无需考虑数据规律和数据维度,而缺点则是要求数据量要大,少量样本的训练效果一般不具有适用性。8 v u a& f. O9 M! ~9 s9 o0 g- B
% {& e' [5 P( K5 @- v& |(5)模型检验0 x4 [6 i x; I% g/ H
" A! B( S Q% A9 S2 x( {( g
预测问题中尤其还要注意的是对结果的检验,通常使用残差和后验误差等作为概率统计的检验,也可以用均方误差MSE检验。 & T! W7 e# E- A4 M) C* s$ Y 5 b+ J1 B0 _! |9 a8 m 残差值反映了预测值和原始数据的相对差距:6 d6 c& l: }# n+ t2 j$ m6 `
: v( s7 @/ f& f/ ~0 v
6 ^+ `9 A6 i! ?- {; W- J7 Q
* E( Q+ ^3 L7 F) \- W& {
后验误差反映模型的精度: 2 q2 M) H8 E3 I+ ], ?# k- ^ q. n( o
3 L' c, n" R; G+ `* |$ Z; @& f- o4 _6 D% }7 }, r, ~" u- f
- ]7 D) R$ x* L# x3 r8 Y( ~ V! g" a + v8 U) _$ _5 u6 r0 @ 然后依据下表判断模型精度: - ]' `3 A6 m% M- B4 v6 J( Q, x9 L+ d$ k( u# p1 l5 Z
3 l: p' G% |/ S0 t
2 s; ?- z. @2 c6 ^: O
均方误差则是一个简单的误差效果: ' U& @: U+ H: ~: t$ j7 b0 k$ F. |) _% o
' t( i3 c4 R+ F' e: R4 k0 c* Q--------------------- $ w& M- ^) M% U- P# y7 f* k4 x5 W s