数学建模社区-数学中国
标题:
python实现 ARIMA 模型 及逐行解释
[打印本页]
作者:
2744557306
时间:
2024-3-20 10:01
标题:
python实现 ARIMA 模型 及逐行解释
ARIMA(Autoregressive Integrated Moving Average)模型是一种常用的时间序列分析方法,用于对时间序列数据建模和预测。它通过结合自回归(AR)和滑动平均(MA)模型的特性,并对序列进行差分(Integration,即I)来建立模型。
& E( T8 M* X5 {* |9 a# T
ARIMA模型的三个主要参数是p、d和q,分别对应于自回归、差分和滑动平均的阶数。
7 `$ i8 y3 t( C9 K9 k
6 j* G* w3 I7 U7 n2 ~
1.自回归(AR):自回归部分使用先前时间点的观测值来预测当前值。p参数表示自回归的阶数,即使用多少个先前时间点的值作为预测输入。
) S7 h* Y e7 D3 u$ ]" n! G/ b0 y0 w" d
2.差分(I):差分是对时间序列进行一阶或多阶的差分操作,可以消除序列的非平稳性。d参数表示差分的阶数,默认为1阶差分。
. B6 f: ~; |& c" w
3.滑动平均(MA):滑动平均部分使用先前的误差值来预测当前值。q参数表示滑动平均的阶数,即使用多少个先前的误差值作为预测输入。
4 g6 u8 A$ M$ x! @: g) K1 L2 T% L: `/ r! d
* \; U m" W" U! U5 {. a- \
ARIMA模型的一般表示形式为ARIMA(p, d, q),其中p、d和q是非负整数。它可以很好地处理具有线性趋势和季节性的时间序列数据。
1 K2 `5 h7 P+ R4 o' I
- N4 q( h0 f8 q) ^6 a
! Q6 b4 d% j" D& Y7 o! ?1 m2 B
4.确定时间序列数据的平稳性,如平稳性检验、观察序列的趋势和季节性等。
% B; ? r% W" @ p) X
5.如果时间序列不平稳,进行差分操作以实现平稳性。
, m% H9 I3 f5 X: J6 L6 p
6.通过观察ACF和PACF图来确定p和q的合适取值范围。
$ j$ I6 ] _6 j4 |
7.根据AIC等准则,以不同的p、d、q值建立多个ARIMA模型。
7 @6 v( h* } n2 m6 o w
8.对每个模型进行参数估计和模型拟合。
/ h9 E) o( i+ m7 c0 f H9 I( p2 d
9.使用拟合的模型进行预测,并对模型的拟合效果进行评估。
1 j5 G/ C( |, I$ O& D9 X6 z2 n
2 w1 y& Z W$ p2 X. l9 n0 [# w
ARIMA模型是时间序列分析领域中常用的模型之一,它可以用于预测未来趋势、季节性和周期性等时间序列数据的变化。在实际应用中,ARIMA模型可以被用于经济预测、股票市场分析、天气预测等各种领域。
2 ~& W0 q5 ]# C0 U9 N6 \
希望这个介绍对你有帮助。如果你还有任何问题,请随时提问。
. O; f3 U! `2 c1 a- R
import numpy as np
+ Q, w, B2 O% U# Y. x% V
import pandas as pd
' a$ v/ k% n+ o2 X# P3 N
from statsmodels.tsa.arima_model import ARIMA
& n7 h0 _7 q4 C) l* O$ h& D
from statsmodels.graphics.tsaplots import plot_acf, plot_pacf
7 t7 {7 R8 J' i! H, N
import matplotlib.pyplot as plt
+ q& Q' x. h. ?* p4 k$ L- U- @- \3 y
- G P: a/ C2 _2 Q% w
这几行代码导入了所需的库,包括NumPy(用于数值计算)、Pandas(用于数据处理和分析)、statsmodels库中的ARIMA模型类和绘制时间序列图的函数,以及matplotlib用于绘图。
) x! x N. i5 m) }
df = pd.DataFrame({
$ _2 ~# v6 a) ~9 N$ X7 O1 I
'year': [i for i in range(1980, 2011)],
7 L. g8 C7 s# }6 R% K) v
'val': [0.82989428, 0.85951092, 0.87668916, 0.86670716, 0.932052,
0 E6 m- f G' r; L% a
1.04826364, 1.3111932, 1.63756228, 2.0641074, 1.91268276,
1 [5 V& X3 M H" k8 _
2.03544572, 2.17721128, 2.38968344, 2.75059208, 3.0906664,
0 |3 V, K/ Z; ^6 w4 b
3.42664028, 3.83064908, 3.97190864, 3.83160036, 4.143101,
1 o# `, j% _# I2 R7 C3 v
4.566551, 4.47541, 4.462796, 4.384829, 4.796861,
2 v4 k. o- R" t1 m& ^
5.046211, 5.098759, 5.196519, 5.166843, 5.174744,
3 r/ p8 I% d8 P( [) p; s
5.440894],
9 _: t8 o& [* A1 w2 }! d3 O& j
})
5 t$ U' I u8 N' w8 S. c/ {
- m9 G+ X9 F* S% m0 s
这段代码定义了一个名为df的Pandas DataFrame,其中包含了两列数据:'year'和'val'。'year'列包含了从1980年到2010年的年份数据,'val'列包含了与每个年份对应的值。
4 H5 h0 y2 ^. Z# n' j7 I
df['val_diff1'] = df['val'].diff()
4 Z7 }9 _- i% K9 J+ J. g0 u
plt.plot(df['year'], df['val'], label='origin')
: B3 J# k8 c- K- X' e* y C
plt.plot(df['year'], df['val_diff1'], label='diff1')
$ M( K, U" P1 n) d+ `
plt.legend()
. `5 n$ {# G! ?9 O: m+ q/ A% P
! z" j/ X! B/ `1 [% R' U- r
这段代码将计算'val'列的一阶差分,并将结果存储在一个新的'valdiff1'列中。然后使用matplotlib绘制了两条线:一条是原始'val'列的线,另一条是差分后的'valdiff1'列的线。plt.legend()函数用于显示图例。
% S, @9 j( Q( O# y, y2 q
plot_acf(df['val_diff1'][1:])
8 z, a: [) r% u
! W' D7 X0 r0 ]2 F4 }
这行代码使用plot_acf函数绘制了一阶差分后的序列('val_diff1'列)的自相关函数(ACF)图。ACF图用于展示序列在不同滞后阶数的相关性。
4 P& {. A: P6 N$ H: T3 v% X
plot_pacf(df['val_diff1'][1:], lags=14)
8 o( n' U" c0 v9 M% k" n
+ K) r) e) {/ ?7 l& b
这行代码使用plot_pacf函数绘制了一阶差分后的序列('val_diff1'列)的偏自相关函数(PACF)图。PACF图用于展示序列在不同滞后阶数的偏相关性,同时指定了lags=14参数,表示只展示14个滞后阶数的PACF值。
4 e" B7 l5 c4 @9 ^ e, p) Q
str_list = []
W5 D6 Q: Y4 D4 B9 J# d8 t2 K& @( T
for p in range(1, 4):
" L9 R6 g& u0 P
for q in range(0, 4):
( Q t6 m1 @2 y& i `
model = ARIMA(df['val'], order=(p, 1, q))
5 K% |' J J% r$ v0 ]# A
res = model.fit(disp=0)
4 N0 N$ T" I8 F$ N9 p2 Z; {4 N
str_list.append('p = {}, q = {}, aic = {}'.format(p, q, res.aic))
[- P& b0 Y: C6 W9 p+ k6 J6 G
for each in str_list:
9 P. } F* k4 ~ E/ ^4 x' w+ h
print(each)
. k% I g3 u1 b% g( v
8 j% p @# H2 }; E. \; J
这段代码使用嵌套的for循环,遍历p和q的取值范围,分别为1到3和0到3。在每次循环中,创建了一个ARIMA模型对象,并将p、1(表示一阶差分)、q作为参数传递给order参数。然后使用拟合方法(fit)将模型拟合到'val'列的数据中,得到拟合后的模型对象(res)。同时,计算并记录了模型的AIC值,并将其添加到字符串列表str_list中。最后,使用循环打印出每个p和q值对应的模型的AIC值。
5 m& p7 O4 g9 E+ A
model = ARIMA(df['val'], order=(2, 1, 0))
* P2 I) ~0 b3 V# o: v x
res = model.fit(disp=0)
?- [; F% k2 `: e
res.summary()
s8 d9 Y- [$ S9 V# \
' Q' y+ t J5 d* W3 d; G0 \! W ~6 f
这部分代码创建了一个ARIMA模型对象,使用p=2、d=1(一阶差分)、q=0来进行参数配置。然后利用拟合方法将模型拟合到'val'列的数据中,得到拟合后的模型对象(res)。接下来,调用summary()方法打印出拟合后的模型的详细摘要信息,包括模型系数、标准误差、p值等。
- L, b5 y3 C* U) B+ e. n+ H
res.plot_predict(end=40)
- D0 j- E0 v2 K, d5 d/ C8 A$ J0 e
4 n$ W& |. r( C, s4 d
这行代码使用拟合后的模型(res)的plot_predict方法生成了一个预测图表。指定了end=40参数,表示要预测40个时间点。这个图表显示了原始数据和模型对未来值的预测。
( u: a: `. J% @( |6 [
希望这些解释可以帮助你理解代码的每一行。如果还有进一步的问题,请随时提问。
+ }. Q7 C0 h2 ^" T
% z) G( O! v* t! A) O
3 H* m/ U9 v9 p5 I6 F0 l
24.arima.py
2024-3-20 10:00 上传
点击文件名下载附件
下载积分: 体力 -2 点
1.51 KB, 下载次数: 0, 下载积分: 体力 -2 点
售价:
2 点体力
[
记录
] [
购买
]
欢迎光临 数学建模社区-数学中国 (http://www.madio.net/)
Powered by Discuz! X2.5