QQ登录

只需要一步,快速开始

 注册地址  找回密码
查看: 4136|回复: 0
打印 上一主题 下一主题

预测房价:回归问题——R语言

[复制链接]
字体大小: 正常 放大

1178

主题

15

听众

1万

积分

  • TA的每日心情
    开心
    2023-7-31 10:17
  • 签到天数: 198 天

    [LV.7]常住居民III

    自我介绍
    数学中国浅夏
    跳转到指定楼层
    1#
    发表于 2021-10-29 10:50 |只看该作者 |正序浏览
    |招呼Ta 关注Ta
    预测房价:回归问题——R语言+ t8 p" _/ t# D) O( x
    在回归问题中,我们的目标是预测连续值的输出,如价格或概率。将此与分类问题进行对比,分类的目标是预测离散标签(例如,图片包含苹果或橙色)。
    3 ]& {1 }3 a1 g6 \" U  u; H
    ' k9 [4 U5 o/ o: D  l. \问题描述3 x& K0 f* ?2 b, m) E* ?3 a
    我们将要预测20世纪70年代中期波士顿郊区房屋价格的中位数,已知当时郊区的一些数据点,比如犯罪率、当地房产税率等。
    ! y9 B2 _5 K" E5 O本次用到的数据集包含的数据点相对较少,只有506个,分为404个训练样本和102个测试样本。输入数据的每个特征(比如犯罪率)都有不同的取值范围。例如,有些特征是比例,取值范围0 ~ 1;有的取值范围为1 ~ 12;还有的取值范围0 ~ 100,等等。
    % h) G# u. s: K数据特征:
    8 }7 f2 L* p2 V9 U! r人均犯罪率。/ y0 [0 V* d# |$ W+ s
    占地面积超过25,000平方英尺的住宅用地比例。
    0 ^: P$ ]- e, W* H; ^每个城镇非零售业务的比例。7 G( b, o7 ~) I" l
    Charles River虚拟变量(如果管道限制河流则= 1;否则为0)。" e. e0 \; d2 j( h% z" F; X
    一氧化氮浓度(每千万份)。
    ( u' b" d. I0 W每栋住宅的平均房间数。0 V( n  z8 X: T5 t* Q, `2 k/ O8 `- I7 |
    1940年以前建造的自住单位比例。! y( `" r9 o  R* v( x5 ^4 {$ t& ]
    到波士顿五个就业中心的加权距离。
    3 G- f7 j# O+ e. x& I径向高速公路的可达性指数。4 J- g; C' _! T( g% t. S
    每10,000美元的全额物业税率。
    ' U4 Z4 O$ ^8 ~, ~6 ~/ l1 r城镇的学生与教师比例。
    ( m5 Q% L* _. e$ J1000 (Bk - 0.63)* 2其中Bk是城镇黑人的比例。! D* D3 M' W! y  B% O
    人口比例较低的百分比。
    ; v& m) A- R. {) X7 I) [; }1. 加载波士顿房价数据5 h+ W. h  {/ x! J0 I
    library(keras)- l: y& Y& V! E5 N, [. c

      e8 i; r0 I0 d- p1 Zboston_housing <- dataset_boston_housing()
    1 G7 ~* v1 |0 e& {8 j) P' Y/ T) |- R
    c(train_data, train_labels) %<-% boston_housing$train& U- y9 a/ i, e- H
    c(test_data, test_labels) %<-% boston_housing$test
    ; v3 M& e0 j! M6 ~  o$ g4 R4 I. z" ^

    每个样本有13个数值特征,目标是房屋价格的中位数,单位千美元。

    2. 准备数据

    数据标准化

    将取值范围差异很大的数据输入到神经网络中,这是有问题的。网络可能会自适应这种取值范围不同的数据,但学习肯定变得更加苦难。对于这种数据,普遍采用的最佳实践是对每个特征做标准化。

    - Z7 E1 v! E4 t1 K8 w1 @) I( |0 ^
    # Test data is *not* used when calculating the mean and std.
    , b& d- ?% c- `( C( k. _; U
    * E' v  y2 L: d# Normalize training data
    ! P" C/ z$ P& q5 k, {train_data <- scale(train_data)
    ! ^* F2 }2 {* }9 P7 W% |* k, l9 `- ~3 k' |. _. w
    # Use means and standard deviations from training set to normalize test set+ n6 g( N/ \$ h' i/ i2 g
    col_means_train <- attr(train_data, "scaled:center") * Z6 Y& v! [% Y6 X. ?) M
    col_stddevs_train <- attr(train_data, "scaled:scale")
    , T( O( |- `8 W  Vtest_data <- scale(test_data, center = col_means_train, scale = col_stddevs_train)
    4 A; {2 T4 d- g/ u5 i6 v% W' j' P  k0 |# }* N3 _; e; s
    3. 构建网络

    创建模型

    6 O- t# w: j3 `3 M% ^: C$ U
    build_model <- function() {
    ! Q( Q: q, R8 R' C# D" {
    + S$ n6 y2 i3 O# }0 E0 |/ R  model <- keras_model_sequential() %>%) y  }7 D2 K/ q' s# d$ `0 C
        layer_dense(units = 64, activation = "relu",, c: ]- a2 H6 {% c5 X7 k2 E6 |
                    input_shape = dim(train_data)[2]) %>%
    " M( E# J) t/ L# k+ j1 ^; S    layer_dense(units = 64, activation = "relu") %>%
    0 ?7 X( t; g' m    layer_dense(units = 1)  k( f/ p, u1 g, K  R

    . W1 h9 F: `" _) g& T( c" S) e  model %>% compile(! U% f+ d9 m0 B% V) @8 I) b3 n
        loss = "mse",* D$ y$ Q" \9 }2 p2 j9 j) i
        optimizer = optimizer_rmsprop(),  s& ]  S9 E9 |% f
        metrics = list("mean_absolute_error")
    , N, V/ a6 c6 i" t' `) w4 G, ?( A0 i  )9 {5 Y; \' W# ]
    2 T+ h7 ^) X8 C$ A/ Q8 d# S) ]
      model' R3 [7 ^! k3 }, A$ e. V# h" @
    }
    $ H- B8 i/ a6 g0 A! L8 B- R+ X5 j9 M4 P; {! y- s+ w+ P
    model <- build_model()
    9 s* y! y8 ^! w( P4 U5 Emodel %>% summary()1 a- H  ]( A( X: K

    6 j* d$ a/ @# Z% k

    网络的最后一层只有一个单元,没有激活,是一个线性函数。这是标量回归(标量回归是预测单一连续值得回归)得典型设置。添加激活函数将会限制输出范围。

    4. 训练模型
    % o6 ]  W( \+ y# q5 a! Q# Display training progress by printing a single dot for each completed epoch.
    1 |' {( p- L( k( |4 eprint_dot_callback <- callback_lambda(
    1 {1 v: ~* A, P! r" T  on_epoch_end = function(epoch, logs) {1 {3 ~- c  x4 v; f
        if (epoch %% 80 == 0) cat("\n"), i6 i& n! w8 C" z9 c$ j2 a9 D
        cat(".")5 s; i" b- `% ]1 i3 }6 ]4 G8 G  {( F
      }
      A: {. i5 |1 x) V)   
      }8 l7 l  D' z; u: [* b) N7 F# ~/ H/ y8 K5 M( v
    epochs <- 500
    ! \2 y; c1 e8 U1 _( n" A5 w* v! e6 v- D
    # Fit the model and store training stats
    % q" G* x8 M  Zhistory <- model %>% fit(1 H$ R  }! w& V/ [1 l) h
      train_data,9 a% u) t2 N3 H6 H' O! w, R
      train_labels,
    * B! {) l7 m$ K5 i; V& b  epochs = epochs,/ Z9 p4 ]% N1 Z5 m4 `
      validation_split = 0.2,
    2 k* N0 p  F( O, a' b4 q! {  verbose = 0,& f* Y" g) r* L% O; |
      callbacks = list(print_dot_callback)  O1 n3 ]( {8 H" s
    )
    6 s7 f- o  h8 a
    , U! D/ c) u# |$ Q4 o( jlibrary(ggplot2)
    ; s" q6 ?# }9 d+ g& ]1 x" w* r; B9 \9 h+ G1 F, p; }
    plot(history, metrics = "mean_absolute_error", smooth = FALSE) +
    ( w& c+ t. W/ b  coord_cartesian(ylim = c(0, 5))* P" L/ }: n1 @! |0 w9 m  N
    2 q& g8 r& w) j4 O0 G

    9 d) I, t2 d' F; S% F' y8 ?! H5 {# T
    小结; j& u. @# g/ V6 L
    1)回归常用的损失函数是均方误差(MSE)。/ A& `# d) \& z+ x
    2)常见的回归指标是平均绝对误差(MAE)。
    * J; M: A/ b2 S) X0 `3)如果输入数据的特征具有不同的取值范围,应该先进行预处理,对每个特征单独进行缩放。
    4 I' ^# h2 q, r5 t4)如果可用训练数据很少,最好使用隐藏层较少(通常只有1~2个)的小型网络,以避免严重的过拟合。: `( |# ?+ V( u0 \& h' v
    2 W, s- W3 Z7 x9 Q' V" j7 N

    % ]* `/ l( x- y
    " g7 }+ \- ]; C7 f/ o( P
    zan
    转播转播0 分享淘帖0 分享分享0 收藏收藏0 支持支持0 反对反对0 微信微信
    您需要登录后才可以回帖 登录 | 注册地址

    qq
    收缩
    • 电话咨询

    • 04714969085
    fastpost

    关于我们| 联系我们| 诚征英才| 对外合作| 产品服务| QQ

    手机版|Archiver| |繁體中文 手机客户端  

    蒙公网安备 15010502000194号

    Powered by Discuz! X2.5   © 2001-2013 数学建模网-数学中国 ( 蒙ICP备14002410号-3 蒙BBS备-0002号 )     论坛法律顾问:王兆丰

    GMT+8, 2026-7-22 18:44 , Processed in 0.261199 second(s), 51 queries .

    回顶部