QQ登录

只需要一步,快速开始

 注册地址  找回密码
查看: 4121|回复: 0
打印 上一主题 下一主题

预测房价:回归问题——R语言

[复制链接]
字体大小: 正常 放大

1178

主题

15

听众

1万

积分

  • TA的每日心情
    开心
    2023-7-31 10:17
  • 签到天数: 198 天

    [LV.7]常住居民III

    自我介绍
    数学中国浅夏
    跳转到指定楼层
    1#
    发表于 2021-10-29 10:50 |只看该作者 |倒序浏览
    |招呼Ta 关注Ta
    预测房价:回归问题——R语言
    0 B7 Z! K3 n5 O/ \6 i3 V7 t在回归问题中,我们的目标是预测连续值的输出,如价格或概率。将此与分类问题进行对比,分类的目标是预测离散标签(例如,图片包含苹果或橙色)。! q: h* A# n! F, w
    7 Q1 k1 @9 Q" S. V' _+ v+ D: J
    问题描述' R$ z6 G4 u. _$ p
    我们将要预测20世纪70年代中期波士顿郊区房屋价格的中位数,已知当时郊区的一些数据点,比如犯罪率、当地房产税率等。) l8 M/ h0 t/ p$ O. f. J
    本次用到的数据集包含的数据点相对较少,只有506个,分为404个训练样本和102个测试样本。输入数据的每个特征(比如犯罪率)都有不同的取值范围。例如,有些特征是比例,取值范围0 ~ 1;有的取值范围为1 ~ 12;还有的取值范围0 ~ 100,等等。
    + ^: D" J8 H# J/ g数据特征:
    ; `/ |/ D- H$ K5 v6 [0 E人均犯罪率。
    . E1 I3 X$ I5 j# ?7 H. s& I占地面积超过25,000平方英尺的住宅用地比例。2 O& K& R7 y  h# P9 z0 A8 ]
    每个城镇非零售业务的比例。
    - G# N4 ^8 X. f/ Z9 dCharles River虚拟变量(如果管道限制河流则= 1;否则为0)。- Q7 i- c5 G# H7 t4 L$ I6 f! C
    一氧化氮浓度(每千万份)。
    3 A) N9 ]1 `; D每栋住宅的平均房间数。6 z  b9 b) T- A7 t* ~3 [* @
    1940年以前建造的自住单位比例。! p5 y3 Z+ ~+ h' b4 ]* o8 [2 l
    到波士顿五个就业中心的加权距离。
    7 \( g$ M6 ~  _, x! `. w& q径向高速公路的可达性指数。4 g0 Y: A; F! K! g! h6 x
    每10,000美元的全额物业税率。
    ( ^0 ?( p3 Q8 ?& z1 J% o# D城镇的学生与教师比例。0 s/ W3 D% ], Z5 x' w
    1000 (Bk - 0.63)* 2其中Bk是城镇黑人的比例。! W6 U( H& c: m( n
    人口比例较低的百分比。
    : c: K# p4 h2 ?3 [; m, L1. 加载波士顿房价数据
    7 g0 |. f) N% R% b9 f+ Tlibrary(keras)$ @% F/ s4 p0 U

    : M9 K) D8 U1 a* @, Mboston_housing <- dataset_boston_housing()) g% W6 e' r2 j6 v( q) W  b- M

    % R0 D9 [3 _: h: C  @& nc(train_data, train_labels) %<-% boston_housing$train5 c2 E4 O9 z+ Y2 O
    c(test_data, test_labels) %<-% boston_housing$test
    3 A1 r6 y2 c& r0 I# Z3 n# \1 w& a; ]. c" T# D8 d: @

    每个样本有13个数值特征,目标是房屋价格的中位数,单位千美元。

    2. 准备数据

    数据标准化

    将取值范围差异很大的数据输入到神经网络中,这是有问题的。网络可能会自适应这种取值范围不同的数据,但学习肯定变得更加苦难。对于这种数据,普遍采用的最佳实践是对每个特征做标准化。


    ! R5 r6 a+ G9 c4 W" {+ }( e# Test data is *not* used when calculating the mean and std.2 ~2 G- ~9 s- l7 P( K

    - _" t) l4 j( M$ n1 z" I" }! U# Normalize training data
    ) P# z3 t$ a) R0 F. vtrain_data <- scale(train_data) + Q$ N# w/ i8 |
    6 P1 P  r8 _/ `
    # Use means and standard deviations from training set to normalize test set
    : y% W. r) y- v* Wcol_means_train <- attr(train_data, "scaled:center")
    8 D; Y$ x* f9 \! h  `7 t3 u0 M& N. J! zcol_stddevs_train <- attr(train_data, "scaled:scale")
    ( c5 L. d. ?0 p/ J4 o3 C& v* xtest_data <- scale(test_data, center = col_means_train, scale = col_stddevs_train)
    9 y2 l8 q1 y3 Q4 [) G/ m( T- ~# B% y# A; m- T
    3. 构建网络

    创建模型

    / B/ I- J7 J( a. `
    build_model <- function() {, s/ g: Q6 P3 R

    ( D. |5 K5 N# |3 b( `  model <- keras_model_sequential() %>%
    5 R/ g- P& R* l5 t% P9 V" U    layer_dense(units = 64, activation = "relu",
    9 Y2 d7 b1 H! r5 p! q8 I                input_shape = dim(train_data)[2]) %>%
    0 S8 h3 v9 q& z7 z% ^    layer_dense(units = 64, activation = "relu") %>%' S* R- X- G" i/ b, n. R' L
        layer_dense(units = 1)
    7 F/ J- q" e& y9 z  i8 V% q  A% h1 G; I. j- d
      model %>% compile(8 z+ n: Q3 m3 e* X2 s& r
        loss = "mse",
    & m" G* M0 G: T' O, p. O5 g' ~! Z    optimizer = optimizer_rmsprop(),
    3 x% p( s1 \! S: R* Q    metrics = list("mean_absolute_error")1 d4 C2 A( D; u
      )
    * D. Q7 D$ {; G! D4 j9 M2 P. ^+ D2 C7 C! C* Y$ _
      model
    ) {# V# N8 f8 c: f2 ?. U" r}& S: J$ M" }/ b
    ; R- W; E7 a3 W4 [8 R- \! o
    model <- build_model()  V7 D: I+ Q) o7 R5 p' @
    model %>% summary()' e8 v( P0 F4 c. b3 H

    7 B: \# S7 c$ a5 @) O  A  ^5 E

    网络的最后一层只有一个单元,没有激活,是一个线性函数。这是标量回归(标量回归是预测单一连续值得回归)得典型设置。添加激活函数将会限制输出范围。

    4. 训练模型( g( U% z3 E6 i  z9 o! f. i
    # Display training progress by printing a single dot for each completed epoch.# }& P2 V6 N1 Y! B
    print_dot_callback <- callback_lambda(3 [; C8 l$ e$ z3 V8 f9 L
      on_epoch_end = function(epoch, logs) {8 I, B' h- }/ _
        if (epoch %% 80 == 0) cat("\n")9 Q1 F7 G7 |- Z( y- t- \
        cat(".")
    9 n! T/ \3 c* ?3 b7 v' p# W0 W# O  }
    8 T- O4 K' g6 D" Q9 f)    6 |# d; b" \& W3 f9 |1 h; Y5 o

    % H3 _+ s) g9 h$ F" R7 G1 {; tepochs <- 500+ s& v" V0 X9 p6 @, d. e: Z, o- m
    * F3 X) H+ {; F, w$ k
    # Fit the model and store training stats" D. A4 X# ^& e, `, W
    history <- model %>% fit(
    , F; X$ P3 r& `1 C* }( \  train_data,1 W2 L$ a; q! h7 n
      train_labels,
    4 b) i. f, s) A5 j- \' i' A  epochs = epochs,
    ) b4 l/ D9 x$ y7 T( h  validation_split = 0.2,
    9 g$ _0 V0 ?- |# X  ]  verbose = 0,
    - i/ |0 D% B9 x7 ^7 W# I. _  callbacks = list(print_dot_callback), g4 y& s6 h! U4 w
    )
    ! j7 c+ ]9 J- K. s2 _& x% A! z. g( }4 n: _1 k+ C' f
    library(ggplot2)
    1 H: ~8 Q& V* D2 T4 I1 n7 R8 A, _( `) U7 Z
    plot(history, metrics = "mean_absolute_error", smooth = FALSE) +
    4 j  T% V+ A; J. Q9 Y  coord_cartesian(ylim = c(0, 5))/ f' _( M* {/ t4 r, Q5 |4 \

    * }6 u4 d* q5 k9 |1 p1 {$ d
    . Z( a7 m$ l0 X) X, `& B; h0 Q9 U! B
    小结# t- g9 ?. B' |9 S* ^) o
    1)回归常用的损失函数是均方误差(MSE)。# t3 e  o& M/ _
    2)常见的回归指标是平均绝对误差(MAE)。
    + v: u& _7 ~+ ~0 t2 i3 v3)如果输入数据的特征具有不同的取值范围,应该先进行预处理,对每个特征单独进行缩放。
    3 _: W% ]" p3 j# C0 G4)如果可用训练数据很少,最好使用隐藏层较少(通常只有1~2个)的小型网络,以避免严重的过拟合。% G5 R% ^% a7 t: D4 Q# ^
    # L7 g4 t2 ?$ D0 {) J4 ~, p

    9 O* V% q1 K" K/ U
    1 N+ D5 Y" e1 \5 O
    zan
    转播转播0 分享淘帖0 分享分享0 收藏收藏0 支持支持0 反对反对0 微信微信
    您需要登录后才可以回帖 登录 | 注册地址

    qq
    收缩
    • 电话咨询

    • 04714969085
    fastpost

    关于我们| 联系我们| 诚征英才| 对外合作| 产品服务| QQ

    手机版|Archiver| |繁體中文 手机客户端  

    蒙公网安备 15010502000194号

    Powered by Discuz! X2.5   © 2001-2013 数学建模网-数学中国 ( 蒙ICP备14002410号-3 蒙BBS备-0002号 )     论坛法律顾问:王兆丰

    GMT+8, 2026-7-21 09:24 , Processed in 0.310832 second(s), 51 queries .

    回顶部