QQ登录

只需要一步,快速开始

 注册地址  找回密码
查看: 2458|回复: 0
打印 上一主题 下一主题

python实现 ARIMA 模型 及逐行解释

[复制链接]
字体大小: 正常 放大

1189

主题

4

听众

2934

积分

该用户从未签到

跳转到指定楼层
1#
发表于 2024-3-20 10:01 |只看该作者 |倒序浏览
|招呼Ta 关注Ta
ARIMA(Autoregressive Integrated Moving Average)模型是一种常用的时间序列分析方法,用于对时间序列数据建模和预测。它通过结合自回归(AR)和滑动平均(MA)模型的特性,并对序列进行差分(Integration,即I)来建立模型。
* c6 a$ G! _% L! JARIMA模型的三个主要参数是p、d和q,分别对应于自回归、差分和滑动平均的阶数。) q3 R$ }8 U& b& u7 a
) b+ Y7 f2 @6 I" R
1.自回归(AR):自回归部分使用先前时间点的观测值来预测当前值。p参数表示自回归的阶数,即使用多少个先前时间点的值作为预测输入。
% F; H7 }, i. ?, m- F, v2.差分(I):差分是对时间序列进行一阶或多阶的差分操作,可以消除序列的非平稳性。d参数表示差分的阶数,默认为1阶差分。
+ ^: u7 {( q6 O2 a# `3.滑动平均(MA):滑动平均部分使用先前的误差值来预测当前值。q参数表示滑动平均的阶数,即使用多少个先前的误差值作为预测输入。# j/ h' a. D' Y1 }8 k5 o/ ~: k8 j+ F
8 G4 e/ ?) W7 h- p* |) K' v
ARIMA模型的一般表示形式为ARIMA(p, d, q),其中p、d和q是非负整数。它可以很好地处理具有线性趋势和季节性的时间序列数据。  S9 Y' ~) g* H7 L6 k9 M
( Q1 J% T9 W' k9 V8 i

& O: [1 m5 a) ?6 Z7 q& K, N4.确定时间序列数据的平稳性,如平稳性检验、观察序列的趋势和季节性等。
- k) E; {9 p0 Q4 [: D5.如果时间序列不平稳,进行差分操作以实现平稳性。' X  I0 ^2 x( `. F5 g+ m
6.通过观察ACF和PACF图来确定p和q的合适取值范围。  h; ?/ {; h  K7 P- Q
7.根据AIC等准则,以不同的p、d、q值建立多个ARIMA模型。( d  X8 W; c! Q; W' x" t
8.对每个模型进行参数估计和模型拟合。
$ Q  ?9 Z$ C4 a: \2 d- z9.使用拟合的模型进行预测,并对模型的拟合效果进行评估。! t- T6 V- S6 r' _

9 o  b% S* b0 Y9 e0 _ARIMA模型是时间序列分析领域中常用的模型之一,它可以用于预测未来趋势、季节性和周期性等时间序列数据的变化。在实际应用中,ARIMA模型可以被用于经济预测、股票市场分析、天气预测等各种领域。- a& N  t9 I! [
希望这个介绍对你有帮助。如果你还有任何问题,请随时提问。
4 q( i! M8 O" a$ ?6 N, I1 g! rimport numpy as np
! u0 }# G% g% `) E+ V. |2 T$ cimport pandas as pd& |+ m: X! C0 I: i& v/ t
from statsmodels.tsa.arima_model import ARIMA
: B0 d* g3 W7 E& r* S  Hfrom statsmodels.graphics.tsaplots import plot_acf, plot_pacf
! n1 b& r( ?- G) X9 Pimport matplotlib.pyplot as plt! |5 I# N- B' X9 U9 l
6 W( L; M/ l/ d* L  j. q
这几行代码导入了所需的库,包括NumPy(用于数值计算)、Pandas(用于数据处理和分析)、statsmodels库中的ARIMA模型类和绘制时间序列图的函数,以及matplotlib用于绘图。. s+ u$ `* w( r: {: W
df = pd.DataFrame({+ d3 j, W# r$ _; U
    'year': [i for i in range(1980, 2011)],
8 Y; {* Y7 D4 J( G1 ^# E    'val': [0.82989428, 0.85951092, 0.87668916, 0.86670716, 0.932052,- b9 @6 R2 u8 _6 J+ v4 c* |  D$ q, }
            1.04826364, 1.3111932, 1.63756228, 2.0641074, 1.91268276,
! e' f3 d' ^. A, B& p0 K7 d1 T            2.03544572, 2.17721128, 2.38968344, 2.75059208, 3.0906664,' g& J. {( o/ o  h9 m! @
            3.42664028, 3.83064908, 3.97190864, 3.83160036, 4.143101,
% ]$ l" B# c+ s  f/ \            4.566551, 4.47541, 4.462796, 4.384829, 4.796861,
# F9 a" H7 u1 b$ y$ o4 t; l% H$ t            5.046211, 5.098759, 5.196519, 5.166843, 5.174744,3 T, k) ?2 p1 f' b5 A4 O6 W3 p
            5.440894],( l7 W3 U) N  d/ O, u! x
})
2 ^  F/ c8 [! {7 Q9 I  K/ }% ^3 }7 i6 S5 u  q9 ~
这段代码定义了一个名为df的Pandas DataFrame,其中包含了两列数据:'year'和'val'。'year'列包含了从1980年到2010年的年份数据,'val'列包含了与每个年份对应的值。
* N2 z* t4 A7 L/ T) odf['val_diff1'] = df['val'].diff()- [3 K8 _, V2 |. d( o7 q  x0 ?
plt.plot(df['year'], df['val'], label='origin')8 u$ j- s+ e6 x1 J+ ]5 R) Y
plt.plot(df['year'], df['val_diff1'], label='diff1')
& }* c4 e- W) b+ [4 I) X# {plt.legend()+ g+ T; G5 G' V) S# C# w
# O, k3 |2 E: w! {8 ?; |& x
这段代码将计算'val'列的一阶差分,并将结果存储在一个新的'valdiff1'列中。然后使用matplotlib绘制了两条线:一条是原始'val'列的线,另一条是差分后的'valdiff1'列的线。plt.legend()函数用于显示图例。( W# r6 ?2 b2 H* f* A8 e% W$ G/ M4 ~* I
plot_acf(df['val_diff1'][1:])
5 C& A- }+ R6 j2 Y. ~& `
. x$ @5 l7 c2 K2 \* t5 p! |这行代码使用plot_acf函数绘制了一阶差分后的序列('val_diff1'列)的自相关函数(ACF)图。ACF图用于展示序列在不同滞后阶数的相关性。
% H6 H; p0 {' [2 `1 h0 j$ Mplot_pacf(df['val_diff1'][1:], lags=14)6 L* v  t% v1 M1 i2 d9 V
/ n) ~  A; X3 S) b' f8 }9 g
这行代码使用plot_pacf函数绘制了一阶差分后的序列('val_diff1'列)的偏自相关函数(PACF)图。PACF图用于展示序列在不同滞后阶数的偏相关性,同时指定了lags=14参数,表示只展示14个滞后阶数的PACF值。1 O& }# Z" E3 V$ g- o( \" k* T
str_list = []( V3 F: w+ H3 @( g
for p in range(1, 4):
/ f6 \/ l! l) i7 f. h6 g# V! o    for q in range(0, 4):
. c. o1 o7 o3 C  [7 Y. @9 Y8 S; K        model = ARIMA(df['val'], order=(p, 1, q))* [. t* l& }& X' T0 B8 @
        res = model.fit(disp=0)0 d6 e) y; ?/ {
        str_list.append('p = {}, q = {}, aic = {}'.format(p, q, res.aic))6 p5 J" v* q8 V# [9 K# B* @
for each in str_list:
1 M( a( v3 }; q7 i4 J) f" {    print(each)
! h2 `. {) ]4 b  z: U% |6 j+ I7 Y$ F& ?0 ]( g' w; i
这段代码使用嵌套的for循环,遍历p和q的取值范围,分别为1到3和0到3。在每次循环中,创建了一个ARIMA模型对象,并将p、1(表示一阶差分)、q作为参数传递给order参数。然后使用拟合方法(fit)将模型拟合到'val'列的数据中,得到拟合后的模型对象(res)。同时,计算并记录了模型的AIC值,并将其添加到字符串列表str_list中。最后,使用循环打印出每个p和q值对应的模型的AIC值。: _; k  q/ l, k7 J2 Q# d9 J+ z0 Q
model = ARIMA(df['val'], order=(2, 1, 0))
$ O' h; r$ r/ |) l+ G, o* L1 Fres = model.fit(disp=0)4 E% r9 G5 B- {
res.summary()' D( j+ G  f2 Z" J3 U
; x6 E; [  x# b7 M0 O
这部分代码创建了一个ARIMA模型对象,使用p=2、d=1(一阶差分)、q=0来进行参数配置。然后利用拟合方法将模型拟合到'val'列的数据中,得到拟合后的模型对象(res)。接下来,调用summary()方法打印出拟合后的模型的详细摘要信息,包括模型系数、标准误差、p值等。1 B% M$ z! R6 B7 s
res.plot_predict(end=40)
% z+ M+ I& w- e( _
3 O) w6 a+ [" {/ Y/ m8 s! o这行代码使用拟合后的模型(res)的plot_predict方法生成了一个预测图表。指定了end=40参数,表示要预测40个时间点。这个图表显示了原始数据和模型对未来值的预测。
* V. }( Q& e, N希望这些解释可以帮助你理解代码的每一行。如果还有进一步的问题,请随时提问。6 U3 m3 K# X. T* G9 L

9 V- r4 `) N- B# X9 k  E; [2 H& \& o7 A4 P$ N. Y* [( f! _9 q  P

24.arima.py

1.51 KB, 下载次数: 0, 下载积分: 体力 -2 点

售价: 2 点体力  [记录]  [购买]

zan
转播转播0 分享淘帖0 分享分享0 收藏收藏0 支持支持0 反对反对0 微信微信
您需要登录后才可以回帖 登录 | 注册地址

qq
收缩
  • 电话咨询

  • 04714969085
fastpost

关于我们| 联系我们| 诚征英才| 对外合作| 产品服务| QQ

手机版|Archiver| |繁體中文 手机客户端  

蒙公网安备 15010502000194号

Powered by Discuz! X2.5   © 2001-2013 数学建模网-数学中国 ( 蒙ICP备14002410号-3 蒙BBS备-0002号 )     论坛法律顾问:王兆丰

GMT+8, 2026-8-6 14:42 , Processed in 0.742829 second(s), 55 queries .

回顶部