$ i" @8 M& Y; I6 y 数学建模 ————统计问题之预测(一)6 t3 }# E* M8 @* z W5 t
详细资料请下载附件 # u7 O) A8 S* |$ ]1 B! I 3 z6 W8 a; T2 ^3 @, Q/ \该资料是笔者根据自身理解一点点写出来的,希望各位能尊重这一份来之不易的劳动成果。因个人水平有限,资料中难免会出现不足与错误,欢迎各位的批评指正。(笔者曾获得2015年全国大学生数学建模国家一等奖,2015研究生数学建模竞赛国家二等奖,2016年美国大学生数学建模竞赛M奖) 2 ^ V+ W/ m3 o) g6 R9 Y7 f! k+ G3 o: V
统计算法总览 % y0 i# ^9 |8 N @ 5 _, f6 A7 k" L$ o) R w 统计一词源于国情调查,一般来说包括三个含义:统计工作、统计资料和统计科学。其中统计工作是指的搜集、整理和分析客观事物总体数量方面的资料,统计资料则是由统计工作所获得的各项数字或文字资料,一般反映在图表、分析报告、统计年鉴里面,而统计科学则是指导统计工作的原理、原则和方法。 / x. ?( ~5 Q. G& _( l ] 因此,在数学建模比赛中统计问题一定要有文献资源和数据资源的搜集,并且这一部分内容也要反映在论文中,而整理通常来说是将搜集到的资料以图表的形式呈现在论文中,最后分析自然就是数据预处理和统计算法建模求解。; F' X# u2 \7 U9 |) s
5 g% }* ~7 w0 I
1.预测" q( k, R) B' f! V+ R0 B# m
- C5 w* Z- B, z" @ P5 X2 o 预测,顾名思义,即根据先用数据规律推算接下来的数据。而预测按照算法可以分为四大类,一为回归分析,二为概率估计,三为时间序列,四为机器学习。( [& Z8 y$ I: Y* @+ y
. E* e) e, i* ~2 @, o7 a$ z
(1)回归分析 # l3 a% W* [" h" L: z, P 6 G5 }' \5 l$ u7 t6 f6 \5 u 对于回归分析,该类算法适用于求解单一输出的问题,在某种程度上可以叫做函数拟合,即利用一种函数去逼近原有数据 。我们在高中阶段学习的线性回归就属于一种预测方法,下面给出几种函数类型: / S4 V* V8 C" s8 _6 f9 {- P- W6 z2 k4 D( E" d4 V
多项式拟合: / E9 M3 h- f5 F, j6 ~7 n, ^2 T 4 o& P* l# G/ m1 @6 \7 k( W$ s& J X; m 非线性拟合: / `7 U1 d. D, x9 M* b. N" @& U$ L4 k& I+ T* D; F
多元拟合:5 L) I' \, V% l. z" P; a1 l
+ I. q# @1 l3 ~" z 如下图所示,该图像是利用了非线性函数对原有数据进行了逼近,有了函数自然也就可以根据输入计算出接下来的数据,所以回归分析也只适用于单输出问题。而回归分析的关键问题就是对某一函数模型的参数进行求解,matlab中有专门的拟合工具箱polyfit和lsqcurvefit: 9 t' A- k0 y+ ~: |9 c, B$ R. I$ G( C% g3 e
& z, _& G! u$ Y& @+ [
H% S9 n- y- ~9 T3 l4 j 这里给出matlab两种基础的回归分析代码:" o: e$ X, v6 p ?
7 J) `* }( u) u T ; j: R6 Z8 w0 Cclc;+ I5 E; c: n2 o: V& l$ r. ^- O
clear;1 ^) Q7 T+ b- Z8 ^% K8 F
close all; B y0 b- ]; [3 C3 M
%% 线性最小二乘拟合 : A, U1 k- C1 U3 Cx = 0 : 0.1 : 1;%输入 $ @; s6 R& y" G- y. [y = [-0.447 1.978 3.28 6.16 7.08 7.34 7.66 9.56 9.48 9.30 11.2];%输出 6 C7 q3 L4 x x1 e' uA = polyfit(x, y, 2);%设定多项式最高次为2,且输入输出长度要一致,并输出多项式系数A; n9 H8 B( x! `0 ]
z = polyval(A,x);%将多项式系数导入,即得到函数,然后输入数据x,得到输出数据z 8 U& W/ [, E3 T+ s3 Efigure(1)2 ^7 a7 R- ?6 r9 W2 a
plot(x, y, 'k+', x, z, 'r') %将原数据以“黑色十字”散点绘出,然后将函数以红色曲线绘出 ! q0 u2 X% A1 ktitle('线性最小二乘拟合'); 6 ~- d6 G# K5 F, ~" z# U ( Q' s1 t4 A- Z1 v+ C* l%% 非线性最小二乘回归9 y& s! W0 Q) n
f = inline('a(1)*x+a(2)*x.^2.*exp(-a(3)*x)+a(4)','a','x');%定义一个非线性函数,变量为系数a和自变量x : Y! @2 }# d* J# B0 a3 |" ~( _a = lsqcurvefit(f, [1;2;2;2], x, y);%设定系数a的初值为1 2 2 2,然后开始求解;3 F2 j* B# c+ l. z* o0 j v
figure(2) * O- Q% @! O6 K; i2 a) M- |$ cplot(x, y, 'k+', x, f(a,x), 'r') %将原数据以“黑色十字”散点绘出,然后将函数以红色曲线绘出 % s7 }9 Y2 x F: h5 p" c/ p# ytitle('非线性最小二乘拟合');2 A4 [0 t- g6 z: I
- X& u& \2 | _/ t
# S% D a0 T5 T n
效果如下: 3 x+ x; `$ E' [# m; T9 Q* L1 H
) l. n v7 S* _, t2 K (2)概率估计& {! {1 \- h- b# E* q
/ y6 p8 q" c% N: O1 I% y( j' o 而对于概率估计,其中的代表是马尔科夫链算法,即先给数据划分状态,然后将数据的分布规律用状态转移来解释。最后对于当时数据的状态,利用根据状态间的转移概率可以求得未来的状态概率分布,自然也能求得下一状态的预测值。 6 {& \' N% s) R $ q, n8 g" Q* a$ d# u 比方说,我只去A,B,C,D四个食堂吃饭,现在告诉你我吃饭的记录,现在就需要计算我在这四个食堂中的转移概率,如我去食堂A吃过后再去四个食堂吃饭的概率是多少?通过这些转移概率不断推算我下一个要去的食堂,再根据四个转移概率得到最大可能去的食堂。但是这只是离散问题的预测,对于连续问题,自然也就需要将连续数据划分为若干个离散的状态,在使用此方法。" f% _0 q, ?7 I
$ d% E Q7 G' E# g4 |, `5 K 此方法对于初学者来说掌握会比较困难,不过如果能成功使用会为论文添色不少,有兴趣的同学可以自行查找资料了解。(《数学建模算法与应用》一书上有讲解)) z }0 a( C: @6 n* P4 o" E8 D
( i, H+ ~! w0 G2 l
(3)时间序列 3 q) s/ |2 [" U; q3 t" U7 [* g% Y6 F6 U# c" ?% k2 d/ } F
第三类称其为时间序列,因为输入是按顺序的离散值,大多数情况下就是时间,针对此类问题,由于输入以稳定步长增长的,所以不用考虑输入,直接研究输出的变化规律,这一点类似于高中学的数列,比方说有名的斐波那契数组:1,1,2,3,5...,它的数据特征是f(n+2)=f(n)+f(n+1),现在我们要求后面的数就直接利用该数据特征就行了,当然也可以求出其通项公式,有兴趣的同学可以求着试试。 + }( g i9 |* t l& u2 x3 O0 f$ e6 A* h+ h; k* }+ [
而时间序列方面的算法其实就是猜测数据前后存在着什么关系,比如说:一次移动平均算法就是猜测每一个数据 与最近的部分数据的均值存在着某种关系,指数平滑法就是猜测每个数据都跟之前的历史数据的加权平均存在着某种关系。这些算法都可以算作是时间序列算法,不过以上算法都是对数据特征简单的猜测,而对于更复杂的数据特征则可能会用到微分方程,利用微分方程,即可以直接预测,还能用于灰色系统,从而将无规则数据转化为有规律的生成序列。 % Y% E2 B: u4 ~3 }8 c ] 5 O+ f" z! _5 Y) A9 S0 z4 ]- @(4)机器学习0 G* f& d! r) @
; R. u/ p$ [( |0 u1 n4 X! D( M
最后一个就是机器学习,即我们只需要搭好框架,数据特征则会由其自己挖掘,比较有名的有:支持向量机(SVM)、决策树、神经网络(深度学习)。这种算法的最终目的是模拟人脑的结构,它的好处就是在搭建好网络结构之后,通过对已有数据的学习,网络会自行提取数据特征,然后只要我们输入一个数据,网络将自行计算,然后输出它的预测值。这种方法的优点是方便,无需考虑数据规律和数据维度,而缺点则是要求数据量要大,少量样本的训练效果一般不具有适用性。1 S) N6 J1 D9 t
6 s- g+ v1 Q$ U) Y& y$ O
(5)模型检验 9 p( C7 H' D9 d2 P: b" p# J+ w5 s/ t9 v. T
预测问题中尤其还要注意的是对结果的检验,通常使用残差和后验误差等作为概率统计的检验,也可以用均方误差MSE检验。+ A% u" y4 T4 n( ~! ]& r
# A. e4 e9 J9 I' q; }' I! S 残差值反映了预测值和原始数据的相对差距: # x. w" S: j6 \$ _- ? x$ o6 h! y7 D# g; r A* m( t/ `; ~
1 b% ^0 X5 G! z4 v( W1 d
* z+ s9 X% V' f8 l0 [: b
后验误差反映模型的精度: ) p+ E+ j$ q3 r2 V0 y w' I / U+ W: t: {) Q4 p+ c : G; m1 e0 d& B7 T# j. c! _0 }/ _% ^- h' f* S
" C# Q( H, a. M; u ! J* J1 q A% q 然后依据下表判断模型精度: 1 f1 }8 g. c3 U4 N q0 F: W3 Z N
" ^! x3 L3 o( |! S
0 P! G1 q2 Z* F% l: l
均方误差则是一个简单的误差效果:3 J3 I$ Y" i0 n
4 d7 o7 k) W1 P; T) M1 @
--------------------- + \# Y) K2 t- h
; ^8 l! @/ D5 D% o
3 V8 s- N+ ?3 S. X
( r' M. }0 x6 _3 g, m