QQ登录

只需要一步,快速开始

 注册地址  找回密码
查看: 4192|回复: 0
打印 上一主题 下一主题

预测房价:回归问题——R语言

[复制链接]
字体大小: 正常 放大

1178

主题

15

听众

1万

积分

  • TA的每日心情
    开心
    2023-7-31 10:17
  • 签到天数: 198 天

    [LV.7]常住居民III

    自我介绍
    数学中国浅夏
    跳转到指定楼层
    1#
    发表于 2021-10-29 10:50 |只看该作者 |倒序浏览
    |招呼Ta 关注Ta
    预测房价:回归问题——R语言
    3 l5 a4 T9 `/ K- p在回归问题中,我们的目标是预测连续值的输出,如价格或概率。将此与分类问题进行对比,分类的目标是预测离散标签(例如,图片包含苹果或橙色)。
    $ G( ~: e2 l* z, P1 {2 [0 s
    1 B4 p. a& l2 A, G3 L1 F问题描述, e! l2 X' m$ g+ j: G% y
    我们将要预测20世纪70年代中期波士顿郊区房屋价格的中位数,已知当时郊区的一些数据点,比如犯罪率、当地房产税率等。
    5 Z( M( `3 t# L* c/ O) s7 Z本次用到的数据集包含的数据点相对较少,只有506个,分为404个训练样本和102个测试样本。输入数据的每个特征(比如犯罪率)都有不同的取值范围。例如,有些特征是比例,取值范围0 ~ 1;有的取值范围为1 ~ 12;还有的取值范围0 ~ 100,等等。) f4 F' B9 T  `: O
    数据特征:1 L% h0 O& {( O) V! o, _: F! d: r
    人均犯罪率。9 I5 C% T" |: r1 @, `9 ^
    占地面积超过25,000平方英尺的住宅用地比例。# L2 h$ O/ X1 x0 y. |, U. T: |& m2 R
    每个城镇非零售业务的比例。  ~, C5 S6 x) q/ Y
    Charles River虚拟变量(如果管道限制河流则= 1;否则为0)。
    ( u/ s7 Y8 b7 P7 F. n" U3 K4 A% n6 [) |一氧化氮浓度(每千万份)。8 _: V) w9 @, b# X% l" O) g2 F1 P9 i
    每栋住宅的平均房间数。
    / u0 [: ^/ H3 ]1940年以前建造的自住单位比例。4 _& Q# \! E+ t1 G) j
    到波士顿五个就业中心的加权距离。. R1 @9 @. M7 M6 q
    径向高速公路的可达性指数。
    2 I1 }/ C7 r+ a9 |每10,000美元的全额物业税率。2 a$ s. ^7 C, L$ J3 B# j0 O
    城镇的学生与教师比例。4 i1 Q2 B* B/ ^: h, a5 S
    1000 (Bk - 0.63)* 2其中Bk是城镇黑人的比例。: G7 ]" d& v) W, W" M" h; W0 L
    人口比例较低的百分比。' A* B& A. W3 [; r$ x$ q9 r
    1. 加载波士顿房价数据
    : l+ N& T; U$ u  G9 X9 w( V+ T* \library(keras)
    9 D/ x% [, i7 H: b  p7 W( b2 J3 [3 A* z" y# f$ b3 g" M' }
    boston_housing <- dataset_boston_housing()
    $ @1 ^9 A  r% P5 r5 C% A$ ?/ O* d$ w
    c(train_data, train_labels) %<-% boston_housing$train' {2 X/ i* w& X! o" F; J# _
    c(test_data, test_labels) %<-% boston_housing$test
    " T/ v, g) g% @
      d. Z" J9 _8 e5 R- }6 Q5 w

    每个样本有13个数值特征,目标是房屋价格的中位数,单位千美元。

    2. 准备数据

    数据标准化

    将取值范围差异很大的数据输入到神经网络中,这是有问题的。网络可能会自适应这种取值范围不同的数据,但学习肯定变得更加苦难。对于这种数据,普遍采用的最佳实践是对每个特征做标准化。

    8 ^/ B2 W9 |0 }! m: L
    # Test data is *not* used when calculating the mean and std.3 m& V8 l1 _5 R8 p7 c

    6 `: O! y8 ^3 Q# Normalize training data
    9 x4 O& V5 ]; Xtrain_data <- scale(train_data) , F. Y4 O6 v% t/ z0 q0 i
    # U( Y, O2 i1 ^4 w# N
    # Use means and standard deviations from training set to normalize test set9 U4 ?) Z! E" t5 C) P
    col_means_train <- attr(train_data, "scaled:center")
    / e" C% {% X2 q" R$ |3 X. Hcol_stddevs_train <- attr(train_data, "scaled:scale"): I" Y4 I# Z7 e8 Z3 W4 k
    test_data <- scale(test_data, center = col_means_train, scale = col_stddevs_train)
    + |) K+ U1 v6 W
    ! N' g& M( s6 n" L" a* j! |3. 构建网络

    创建模型

    , j% u. l# b3 y9 A) T5 A
    build_model <- function() {
    2 B7 ^( [3 W* |+ b5 _
    1 O' N- i7 f) U# H2 L, M  model <- keras_model_sequential() %>%
    ( I6 F! M% j# a9 H* r: k8 Y. K    layer_dense(units = 64, activation = "relu",
    - Q" S! }: a4 W; ~: E                input_shape = dim(train_data)[2]) %>%4 b' Q5 r% a2 v# y! }& _' M$ q
        layer_dense(units = 64, activation = "relu") %>%: m: p3 L6 q( Z5 j; {- C
        layer_dense(units = 1)
    + i7 X* ~0 w) d* h3 ]" N
    + y( H9 I9 w" }) z9 `9 m& H  model %>% compile(7 _3 s/ U7 ~' Q4 B
        loss = "mse",
    0 h. D- G! m, E- y) _) E6 e7 V    optimizer = optimizer_rmsprop(),1 M# _- r5 c; A9 i6 O) c6 R
        metrics = list("mean_absolute_error")0 J& m* E8 U# j  m  }7 _4 g
      )6 Y4 Q. ^" Y1 g; }) T

    # k% c3 G0 g% d  f. i4 B4 p  model! i. D3 `& U! O8 [' O# E
    }" t% n. C6 ?' t* P7 F

    + Q7 c5 g" O6 `5 Mmodel <- build_model()/ n" a4 M1 h* H; `- |- \
    model %>% summary()$ I5 T5 A* Z, l6 C

    / Y. j, `- y. U1 L+ d3 r; L

    网络的最后一层只有一个单元,没有激活,是一个线性函数。这是标量回归(标量回归是预测单一连续值得回归)得典型设置。添加激活函数将会限制输出范围。

    4. 训练模型0 y0 n* M  I# M# `( P! p
    # Display training progress by printing a single dot for each completed epoch.
    8 A9 _/ R( Z0 v0 w9 H( dprint_dot_callback <- callback_lambda(
    7 {5 Y6 x1 U4 z. i% U8 l  on_epoch_end = function(epoch, logs) {- ~0 r7 D# J1 G& o8 b
        if (epoch %% 80 == 0) cat("\n")
      }& h8 V# v/ i4 J    cat(".")) e8 i0 H/ _3 R+ T
      }/ l" t* y( l( r+ ~' x+ u
    )    ; ]' D* ~" D+ l8 R
    3 O- Y2 P) y, D
    epochs <- 500( D, F& Q; ?5 J% g

    ! t) R( n/ X% v1 [  B6 f+ d! s# Fit the model and store training stats' C% C$ l, L* e& O" P& f
    history <- model %>% fit(! d$ }! @" X$ i- B
      train_data,
    ! R- }0 c( U5 O2 g/ C  train_labels,( S# w  l. j  F$ T5 ~" C% y* W1 |
      epochs = epochs,
    & x' z( r  K0 }7 h8 X0 ~* }2 ~! v  validation_split = 0.2,4 a* L5 ?$ ?4 k! z9 w, d! `5 u
      verbose = 0,
    ( b) t8 n4 o; L" G. Z  callbacks = list(print_dot_callback)/ ]  E6 O/ q  T; t
    )4 _- i/ U: {3 q3 I

    8 p+ b8 V8 H2 @8 U: @# @. Jlibrary(ggplot2)
    - k; t6 `1 R+ F+ ], D* G- i& a, ^
    plot(history, metrics = "mean_absolute_error", smooth = FALSE) +
    / V" R8 R  s" x- a  coord_cartesian(ylim = c(0, 5))4 t8 x: y) d; k: W8 V6 f( P( F

    3 u( O: x7 t* R; T2 f$ s4 h, X3 [# S
    ! h1 _0 a4 _! }& Q$ u( d7 L
    - Z( A7 f9 }  m4 _小结
    . V0 p( F& Q+ \* s5 a! n/ X& J  y  y1)回归常用的损失函数是均方误差(MSE)。! m: g$ p3 d$ d+ e1 G. a! y
    2)常见的回归指标是平均绝对误差(MAE)。) t' W" i. @0 y9 _& ^; ]
    3)如果输入数据的特征具有不同的取值范围,应该先进行预处理,对每个特征单独进行缩放。$ H8 J' q8 y" U. X$ F
    4)如果可用训练数据很少,最好使用隐藏层较少(通常只有1~2个)的小型网络,以避免严重的过拟合。! t# O* b  V2 Y3 m' J8 p

    4 B9 p( O! ]7 j' P( M( Z- D( c) E/ i; |& v* b. r1 s8 O1 B; n

    0 y$ r% _* C5 _) h2 O$ C+ t
    zan
    转播转播0 分享淘帖0 分享分享0 收藏收藏0 支持支持0 反对反对0 微信微信
    您需要登录后才可以回帖 登录 | 注册地址

    qq
    收缩
    • 电话咨询

    • 04714969085
    fastpost

    关于我们| 联系我们| 诚征英才| 对外合作| 产品服务| QQ

    手机版|Archiver| |繁體中文 手机客户端  

    蒙公网安备 15010502000194号

    Powered by Discuz! X2.5   © 2001-2013 数学建模网-数学中国 ( 蒙ICP备14002410号-3 蒙BBS备-0002号 )     论坛法律顾问:王兆丰

    GMT+8, 2026-8-25 20:19 , Processed in 0.418646 second(s), 50 queries .

    回顶部