QQ登录

只需要一步,快速开始

 注册地址  找回密码
查看: 4457|回复: 1
打印 上一主题 下一主题

使用LSTM预测空气质量pm2.5

[复制链接]
字体大小: 正常 放大

1178

主题

15

听众

1万

积分

  • TA的每日心情
    开心
    2023-7-31 10:17
  • 签到天数: 198 天

    [LV.7]常住居民III

    自我介绍
    数学中国浅夏
    跳转到指定楼层
    1#
    发表于 2021-10-15 10:53 |只看该作者 |倒序浏览
    |招呼Ta 关注Ta
    使用LSTM预测时间序列数据" A. ]1 V1 T% A# I

    & ?" P+ x0 k* m9 |$ A% L8 H$ J

    : m) d# x- q9 L- e- w文章目录* K9 z4 l# r& E# W
    背景/ _7 o  f, L+ I/ `/ }, o
    结论
    ) l( K, T* e% y代码
    % O8 {: ~9 a* m3 U6 }. T& k% c4 p8 o. C- @实验结果
    - V/ V5 T2 B$ J7 Q* ARNN和DNN的区别
    : I! g" |: Y# V  C8 x  e- {RNN和LSTM的区别# a9 \' H8 x& @; Y9 H0 F
    背景( W" l2 ~, y2 P
    复现 @“使用Keras进行LSTM实战” https://blog.csdn.net/u012735708/article/details/82769711 中的实验
    8 e& E. Y; V% y, O/ C/ d! C6 X, y熟悉用LSTM模型训练5 Z8 E2 Z. R6 e( z- T' q
    验证将时序数据 转化为分类问题后,预测是否有效果4 k9 W6 b* Z! j" A6 U
    对比SimpleRNN与LSTM模型 哪个效果最好?$ ]3 m, Q9 y1 R8 H  V
    验证LSTM相比于Dense()模型 是否有提升?, g& r. U2 D* U" k; f  V; W# o
    对比使用前3天的数据 和使用前1天的数据 哪个效果最好?
    ) C% J6 T3 ?" q+ u* e0 W  e0 n结论
    ' F5 }4 Y6 s1 M8 ~, k8 F使用前3天的数据预测当天的空气质量的效果 没有 比只用前一天的数据 好  M) r4 B8 c# w2 W0 |& L
    使用LSTM的效果优于SimpleRNN
    9 Q0 ?% I3 Z5 ]6 E7 n代码3 I( w3 {  I, Q' A0 ]7 ^
    from pandas import read_csv7 e- I9 A, {! a; H# F* v
    from datetime import datetime
    ' n) B- m+ R' k: h8 T$ Yimport pandas as pd/ \. x# v& W7 m" Q$ n
    from pandas import DataFrame, }; u4 G2 H. @
    from sklearn.preprocessing import LabelEncoder,MinMaxScaler
    : L6 {1 F' o/ x7 ?3 hfrom sklearn.metrics import mean_squared_error
    , C5 ?5 U8 Q6 I( [4 g) wfrom keras.models import Sequential
    2 z! n8 X* c3 n, F" ]: c" Mfrom keras.layers import Dense, Dropout
    7 E" b6 p) c+ a( Pfrom keras.layers import LSTM3 i9 U+ }3 f, E' C" [. ?, [' s
    from keras.layers.recurrent import SimpleRNN
    & t+ v  z# {5 [+ ffrom numpy import concatenate8 ~- }# c1 H8 Y# R# [3 O
    from math import sqrt
    ; v  S0 I% E! R1 ]. {$ P0 _6 b) P1 x/ Z' T2 Z. B8 K1 f
    ' `( s. ^( b' {  M
    : E& b$ k! g  ~8 Z! j

    7 ~. B1 o, ~! k0 R9 S: o# load data
    ) k+ p$ s% v2 W* t- N- _def parse(x):: ~6 W3 u* {" f0 m
            return datetime.strptime(x, '%Y %m %d %H')
    1 |. J5 k* G! D- c ) j* h+ L$ k) D: O: k. E# z
    def read_raw():
    $ m2 R2 T' f+ _& p- U    dataset = pd.read_csv('raw.csv',  parse_dates = [['year', 'month', 'day', 'hour']], index_col=0, date_parser=parse)
    5 M+ q3 ^: O% J! }) f6 C0 }# H    dataset.drop('No', axis=1, inplace=True)7 _, P! |( z. I( i3 f3 `3 L9 C! W- ^
        # manually specify column names. x6 Y; u, c% J* S* ^
        dataset.columns = ['pollution', 'dew', 'temp', 'press', 'wnd_dir', 'wnd_spd', 'snow', 'rain']
    ; r! S- I: m! O  O6 @  f    dataset.index.name = 'date'
    9 Z0 M1 v3 T& ^    # mark all NA values with 03 c' }: ^& L  \0 Q# o5 T
        dataset['pollution'].fillna(0, inplace=True)3 g" T' s) g, @" g, q" L* A. ?- P
        # drop the first 24 hours2 W* }# J, d' E  `6 c
        dataset = dataset[24:]. @; G* B" N" z. ]" t; k
        # summarize first 5 rows
    : h$ o/ a2 I+ i8 d) s' t  ?    print(dataset.head(5))
    . f0 f! @+ ^8 d* R5 M! C% L    # save to file1 r% k) y/ V0 ~; g
        dataset.to_csv('pollution.csv')) s$ t/ I! w0 o! X+ z, c& b1 L& l

    1 C9 U0 m- M+ d
    * ?* P5 y0 [( K% j2 ^) V; j
    + W6 I) Q0 z; }& u2 e

    7 _( t/ @* A( Y9 E# convert series to supervised learning
    1 |& T# s! g, d3 g0 m8 i9 ]def series_to_supervised(data, n_in=1, n_out=1, dropnan=True):8 A" \' F3 ]8 }& [' V4 K
        n_vars = 1 if type(data) is list else data.shape[1]
    $ B& a+ d8 p: j0 O& v8 M    df = DataFrame(data)* b& r# w9 \% K2 [% [3 y
        cols, names = list(), list()
    5 f1 O7 s5 d$ t) m1 h* p    # input sequence (t-n, ... t-1)
    / o' a2 m9 S( w7 p/ C$ f    for i in range(n_in, 0, -1):1 Q% Z. j% \7 p+ p
            cols.append(df.shift(i))/ M1 |9 z1 _2 C) r6 c& b' m7 s' Y; N
            names += [('var%d(t-%d)' % (j+1, i)) for j in range(n_vars)]
    - C+ r9 o9 w, a$ S5 I% L    # forecast sequence (t, t+1, ... t+n)
    & Z" |* a+ ^9 ^& g# O    for i in range(0, n_out):
    * ]% v- g. z, @2 N9 K; }3 L- X        cols.append(df.shift(-i))
    ' q) N+ R. f2 F$ v, S/ k        if i == 0:! m) {$ N6 }) ^2 e( C2 u8 I* k
                names += [('var%d(t)' % (j+1)) for j in range(n_vars)]
    ! L- M  Z* }7 P- c: x3 ~        else:/ s5 ~7 L* F3 _  ~2 t
                names += [('var%d(t+%d)' % (j+1, i)) for j in range(n_vars)]: E2 j0 u; I$ O% y2 R3 _
        # put it all together
    & `; y% x, q: D3 z% u+ ?    agg = pd.concat(cols, axis=1)* E- C* {  V( k4 ]% S+ |! \
        agg.columns = names: t7 {/ N+ n" J3 D& _6 n* G$ X4 f
        # drop rows with NaN values7 P  @1 E* m4 K% b) q7 h2 Q; @3 k
        if dropnan:3 B; `3 ~. H' {+ _& P
            agg.dropna(inplace=True)
    1 i2 j2 j1 S; x. a    return agg; j/ `/ k: n9 U

    / |" a; W9 d5 Z# load dataset
    + g1 a9 M( ^$ c5 |dataset = read_csv('pollution.csv', header=0, index_col=0)' p2 g% O6 ~' s: L
    values = dataset.values
    2 p4 l; |. q& w5 t. m, ?) `* @
    ! e, m" b! T/ N9 M
    0 ~' l* @# S# |. B
    # integer encode direction
    ; r& w* |* ?; Z8 e9 s. x: qencoder = LabelEncoder(). u/ U+ h8 B) J! T
    print(values[:,4])9 Y) I: q% m0 q3 n. A8 {' c
    values[:,4] = encoder.fit_transform(values[:,4])
    : j& R) {3 N9 \+ f* a( ?; k# ensure all data is float) J9 @8 T6 _& y; J& Q3 h+ J; |
    values = values.astype('float32')
    2 I" w% G( X- g6 ?. I- E# normalize features
    2 l; z5 q# s6 D! \scaler = MinMaxScaler(feature_range=(0, 1))# y) p/ C: w0 n( @6 ]4 r
    scaled = scaler.fit_transform(values)3 d! Q2 h8 S" S5 ~+ u% ]. ~
    # frame as supervised learning/ X; V/ |  l! O# ?: P% x/ X  {
    reframed = series_to_supervised(scaled, 1, 1)
    3 c' r3 F) @1 Q8 J! C; K#reframed = series_to_supervised(scaled, 3, 1) #用前3天的数据,预测当天的数据
    6 P9 @' f. o; ]4 K. p7 U: U0 C! g$ b3 aprint("columns:", reframed.columns)
    # g; F( }- m& P5 b, {( K; w# drop columns we don't want to predict) b9 j% w# e8 J) ]- ?# g' D% X
    reframed.drop(reframed.columns[[9,10,11,12,13,14,15]], axis=1, inplace=True) #用前1天的数据,预测当天的数据
    1 |1 Y+ K' h2 L; j; X: D#reframed.drop(reframed.columns[[25,26,27,28,29,30,31]], axis=1, inplace=True)#用前3天的数据,预测当天的数据
    / k6 C7 t* l" q1 `1 R4 Dprint(reframed.head())
    # f/ r6 [& X! i4 M5 K8 F7 kprint("new columns:", reframed.columns)
    . w: n% g3 |* D" a" p$ z# split into train and test sets
    - z, Q/ C. F% r$ `+ h' h5 k: Ovalues = reframed.values+ k$ h9 P1 E7 P: L# \7 _5 u' ]8 s
    n_train_hours = 365 * 248 C4 f/ E1 J* t+ y$ G. u
    train = values[:n_train_hours, :]/ {: m) B+ y( R$ l
    test = values[n_train_hours:, :], ]1 l% L+ I" z7 F& C- ?# u
    # split into input and outputs
    3 g+ k$ l8 H  J( O  G6 strain_X, train_y = train[:, :-1], train[:, -1]) A8 X/ U) @1 O, K+ r
    test_X, test_y = test[:, :-1], test[:, -1]3 j2 N# y% h  X8 @- V; G  j
    # reshape input to be 3D [samples, timesteps, features]% `; E( `" x- @# ?3 z$ ^1 @/ o+ E
    #使用Dense()模型时不用变换- }. K  I1 o7 y: \& g
    train_X = train_X.reshape((train_X.shape[0], 1, train_X.shape[1]))
    8 f; A" M- E2 D. r! L; x* F8 ?( }+ utest_X = test_X.reshape((test_X.shape[0], 1, test_X.shape[1]))
    ( u; N8 d" e3 H- iprint(train_X.shape, train_y.shape, test_X.shape, test_y.shape)
    8 U( }- _& _# o' I2 h$ t# design network
    0 O9 ^4 ]( y3 Nmodel = Sequential()# i" A: Y' q  t2 r
    #model.add(LSTM(50, input_shape=(train_X.shape[1], train_X.shape[2])))
      S2 v- r2 Z* O5 ~' u#model.add(Dense(50, activation='relu', input_dim = 8))& m" q- P. M% R+ b" b
    model.add(SimpleRNN(50, input_shape=(train_X.shape[1], train_X.shape[2])))
    % ], g3 Q2 R2 S: b& Y9 ^* Ymodel.add(Dense(1))  p) E' ?$ t: I/ D6 ?: _( R
    model.compile(loss='mae', optimizer='adam')1 T- y7 S* z0 t$ P/ e
    # fit network
    ! B! |2 p7 l1 r( chistory = model.fit(train_X, train_y, epochs=50, batch_size=72, validation_data=(test_X, test_y), verbose=2, shuffle=False)4 g5 v9 f1 ?, y+ ?& x
    # make a prediction
    ( u: a( M4 t$ U4 Q) eyhat = model.predict(test_X)
    " M- \6 V* `# ^* Yprint("yhat shape:", yhat.shape)
    3 a% |/ N6 R( F% C: O'''1 z( s4 o2 V$ b2 Z
    计算在测试集上的均方差
    6 x: A) d5 T& N* ~2 R  _, Mtest_X = test_X.reshape((test_X.shape[0], test_X.shape[2]))
    * L' t0 s; h1 }" X2 r6 k. H2 C' Xprint("test_X shape:", test_X.shape)% Y3 z8 c! V  r! ^4 z

    5 d, m  b2 Q( w2 l5 g, L" D
      K. k, d8 q# w/ y
    # invert scaling for forecast2 B' y/ t2 G' s; n2 w, G
    inv_yhat = concatenate((yhat, test_X[:, 1:]), axis=1)" t& Y2 B0 h6 m# _/ L* B
    inv_yhat = scaler.inverse_transform(inv_yhat)6 L+ n8 L( W# j8 c$ |% T) S1 ?
    inv_yhat = inv_yhat[:,0]
    . I1 m$ ~' r/ S* x  Z6 l' j# invert scaling for actual8 D" H* T* ^' z1 J
    test_y = test_y.reshape((len(test_y), 1))
    ! D/ g: a, v% g% l3 r4 R: @inv_y = concatenate((test_y, test_X[:, 1:]), axis=1)+ P! O1 y, R" O. T9 L" ~
    print("inv_y:", inv_y[:10])4 ~2 W& G6 P8 @+ M
    print("inv_y shape:", inv_y.shape)
    ! ?2 S7 a0 a5 }, z, m8 r' g; L
    , F. p6 f0 b/ o& m
    % I' s& L" C8 o8 r' o: E$ l6 V1 w
    inv_y = scaler.inverse_transform(inv_y)
    8 g% {8 D% o2 D) q0 L" Jprint(inv_y, "*"*30)2 d* y+ T- x9 a+ ~
    % ]* R) G& a8 O
    8 h2 S( i  ]* U  h% {, U4 Z( b
    inv_y = inv_y[:,0]
    . p' E& [* _9 U5 A. x# calculate RMSE9 K4 c1 l* E- b5 F
    rmse = sqrt(mean_squared_error(inv_y, inv_yhat))
    & A+ X( t, _! {, |" a& yprint(inv_y[:100], inv_yhat[:100])
    : Q2 c$ g- u& e) Qprint('Test RMSE: %.3f' % rmse)$ p: ^2 Y( ]- ~* Z1 G+ |
    % T! g$ A1 D. g9 q/ l
    & ^/ c& V+ E- h
    '''
    1 m5 E, N% D% M3 [  z1 u8 a实验结果0 U  @$ w. R( h0 Y, o
    实验1:用前一天的天气数据,预测某一天的空气质量
    - t# \# u: E7 K; Z. m使用LSTM模型: X4 t* Z3 Y' _6 n$ h% J
    结果:
    4 F9 X% B2 w3 d4 |( O$ ZEpoch 49/50
    . q# q4 y8 s$ |% v: x; P0s - loss: 0.0144 - val_loss: 0.0133
    + Q2 V, \- D1 E* B$ W6 ]5 u0 oEpoch 50/50: G1 A) R0 G7 `6 a1 v" U
    0s - loss: 0.0144 - val_loss: 0.0133( E; N7 P/ f5 {0 y- v* z
    . _/ Z% @3 ^2 {  H6 q
    $ j4 D  L/ y4 C1 x( F) K  @
    实验2:用前3天的天气数据,预测某一天的空气质量
    , m3 r* [$ S$ i8 V% e2 q# v) k6 w使用LSTM模型
    3 D9 |4 E+ J/ Y3 y7 }; w4 O! `3 M* E) Y/ q: i1 p: j/ T

    & M1 j, S* s/ z% t1 G( ]结果:
    2 ?: ~5 m5 j; H5 nEpoch 49/50
    4 w. @4 [1 v! [: A( A. w6 r( m0s - loss: 0.0147 - val_loss: 0.0149
    # ~6 ]8 p4 O- o9 y8 t) yEpoch 50/50
    ! o  K1 r+ @- I( v+ u, {0s - loss: 0.0147 - val_loss: 0.0150/ ]$ \# y' T$ h& s7 r

    ! W+ ~( [  D6 v9 g

    & x9 t# u/ H9 g; L实验3:用前一天的天气数据,预测某一天的空气质量
    6 R0 `$ C" B; x1 \% }* h使用普通的全连接模型 Dense()7 k4 o" ]$ p: C4 T
    结果:8 x! f$ }  ]) o
    Epoch 49/502 a1 |1 Y5 w2 ^6 r1 k
    0s - loss: 0.0144 - val_loss: 0.0146, r; c5 f! C- g4 \
    Epoch 50/50
    " T# w- Q- ]; l% W$ ]+ v- F0s - loss: 0.0148 - val_loss: 0.0151
    0 e, c  d- n- y% ]$ V7 N; o9 s& @- G+ [2 b* g; I# t1 o  N/ k8 n

    8 b% c8 P5 c8 @$ l2 p( O实验4:用前三天的天气数据,预测某一天的空气质量  D' W7 |; k/ ]7 _, L* E
    使用普通的全连接模型 Dense()0 }% p) c- x0 D+ ~
    结果:
    ) N  L/ U1 l" @% M# ]' WEpoch 49/50
    " @4 H4 A: q7 ]0 }! w* g0s - loss: 0.0150 - val_loss: 0.0165
    2 \1 ~3 ]. G: F, n0 W$ [Epoch 50/504 T+ z) H0 ~+ M4 N3 L& X, b
    0s - loss: 0.0148 - val_loss: 0.0141
    0 C) ^6 O% L0 t, ]
    # B' F1 s+ a  Q0 `# h& c% o

    + X/ [% p! x$ v8 u4 o# G实验5:用前一天的天气数据,预测某一天的空气质量3 ~8 t" R3 S  E( S0 h: ]
    使用SimpleRNN
    " [# k) I( v$ R3 _* MEpoch 49/50, r, `5 e* i3 _! I; w4 _3 ^
    0s - loss: 0.0160 - val_loss: 0.0140( p7 Z8 W: `6 i# T6 c! ?% N
    Epoch 50/50
    4 u- N8 `2 N8 s/ K/ h! v; y& U0s - loss: 0.0147 - val_loss: 0.0150& R1 Z3 c# c$ h& {/ N" ]! b

    : d0 u" F5 U- a" ^1 g
    $ l: z+ ~/ k: ]0 H% ^8 l2 _  |' `
    实验6:用前三天的天气数据,预测某一天的空气质量* l# B* @* o( t1 ]/ A& R" b" Z
    使用SimpleRNN. X" k, x0 S6 W, G; B0 v
    Epoch 49/50) ?0 F6 D1 N5 h: h4 Q9 L& d
    0s - loss: 0.0164 - val_loss: 0.02336 G8 K6 _& D8 g" m  H# f0 @. ~. D
    Epoch 50/50
    ; E9 a! o$ X5 e+ a0 O) S0s - loss: 0.0166 - val_loss: 0.02277 J# ]9 T, N: T! w. {+ |7 N3 w
    RNN和DNN的区别

    RNN中的循环是指一个序列当前的输出与前面的输出也有关系。也就是说,网络会对前面的信息进行记忆并应用于当前输出的计算中,即隐层之间的节点不再是无连接的而是有连接的,并且隐层的输入不仅包括输入层的输出还包括上一时刻隐层的输出。


    - P' W0 N4 K3 Y1 x& h! Z% |

    6 j" W7 x7 l) K, }
    % P2 k7 V( |" |7 m6 K; B
    RNN和LSTM的区别
    " J4 v2 P4 g0 v) |5 ~LSTM的内部结构通过门控状态来控制传输状态,记住需要长时间记忆的,忘记不重要的信息;而不像普通的RNN那样只能够“呆萌”地仅有一种记忆叠加方式。对很多需要“长期记忆”的任务来说,尤其好用。
    ' c! A7 ]4 q$ [$ Z/ ?, f  [2 w# X9 j' C! G
    , r! V6 i: y" K& l' b$ Y
    但也因为引入了很多内容,导致参数变多,也使得训练难度加大了很多。因此很多时候我们往往会使用效果和LSTM相当但参数更少的GRU来构建大训练量的模型。
    " X8 P# y3 @1 z' K. }( i' t, R. D# G  h" Q
    ) j  _# w+ e, X$ t4 {4 w
    请关注数学中国微博和数学中国公众号,如有疑问联系数学中国工作人员
    ) i7 [; U' ]7 ~- x8 K/ m
    " K& n% q3 B4 {% Y. o9 i
    ) a' ^' L9 l) I3 P( a" y. s
    zan
    转播转播0 分享淘帖0 分享分享0 收藏收藏0 支持支持0 反对反对0 微信微信
    sjlxdn        

    1

    主题

    2

    听众

    155

    积分

    升级  27.5%

  • TA的每日心情
    无聊
    2022-2-19 17:40
  • 签到天数: 30 天

    [LV.5]常住居民I

    国际赛参赛者

    回复

    使用道具 举报

    您需要登录后才可以回帖 登录 | 注册地址

    qq
    收缩
    • 电话咨询

    • 04714969085
    fastpost

    关于我们| 联系我们| 诚征英才| 对外合作| 产品服务| QQ

    手机版|Archiver| |繁體中文 手机客户端  

    蒙公网安备 15010502000194号

    Powered by Discuz! X2.5   © 2001-2013 数学建模网-数学中国 ( 蒙ICP备14002410号-3 蒙BBS备-0002号 )     论坛法律顾问:王兆丰

    GMT+8, 2026-10-10 03:23 , Processed in 0.574936 second(s), 56 queries .

    回顶部