QQ登录

只需要一步,快速开始

 注册地址  找回密码
查看: 4134|回复: 0
打印 上一主题 下一主题

预测房价:回归问题——R语言

[复制链接]
字体大小: 正常 放大

1178

主题

15

听众

1万

积分

  • TA的每日心情
    开心
    2023-7-31 10:17
  • 签到天数: 198 天

    [LV.7]常住居民III

    自我介绍
    数学中国浅夏
    跳转到指定楼层
    1#
    发表于 2021-10-29 10:50 |只看该作者 |倒序浏览
    |招呼Ta 关注Ta
    预测房价:回归问题——R语言
    $ _/ ^  L! [) ?7 I+ \4 i( ^# ?在回归问题中,我们的目标是预测连续值的输出,如价格或概率。将此与分类问题进行对比,分类的目标是预测离散标签(例如,图片包含苹果或橙色)。7 W  E( S* J6 q7 P
    ; w' v) Z/ z: M/ {& |- g7 L
    问题描述
    9 p/ F. r! X6 W3 A! ?" r! M我们将要预测20世纪70年代中期波士顿郊区房屋价格的中位数,已知当时郊区的一些数据点,比如犯罪率、当地房产税率等。5 K' K9 r/ ?4 T' g
    本次用到的数据集包含的数据点相对较少,只有506个,分为404个训练样本和102个测试样本。输入数据的每个特征(比如犯罪率)都有不同的取值范围。例如,有些特征是比例,取值范围0 ~ 1;有的取值范围为1 ~ 12;还有的取值范围0 ~ 100,等等。
    0 x: j% t7 V3 ]1 R: p+ b数据特征:5 c1 ^% B- w- c1 [7 P1 _
    人均犯罪率。
    ; S: [0 i2 H, o! t9 {' e/ C3 U* X占地面积超过25,000平方英尺的住宅用地比例。
      A- I( k" g" v# u( A) P! z每个城镇非零售业务的比例。
    . _+ {$ p$ L" X7 J, y& o( f/ zCharles River虚拟变量(如果管道限制河流则= 1;否则为0)。, p  v. {6 U( I
    一氧化氮浓度(每千万份)。
    . i$ ~# S6 V7 B9 @每栋住宅的平均房间数。
    : n1 o) l1 M: M1940年以前建造的自住单位比例。
    7 G7 J0 L2 r# H! D/ T6 x& |, [/ N到波士顿五个就业中心的加权距离。
    * V1 V% W9 i9 O( L# y径向高速公路的可达性指数。
    1 i  @; Y& z9 i  J每10,000美元的全额物业税率。
    0 g* M2 H# ~, L城镇的学生与教师比例。
    ( a5 z7 j) A9 R  o, ]% P1000 (Bk - 0.63)* 2其中Bk是城镇黑人的比例。0 u- h, _# ~: {+ |, J
    人口比例较低的百分比。
    0 c5 h, M; |; ^* G& q% f1. 加载波士顿房价数据
    - |" a6 e2 M* U9 z3 }) ]2 ]library(keras), w- [' n0 {% E+ x
    $ p( q6 P/ [% D' z
    boston_housing <- dataset_boston_housing()
    * e% r) C7 c7 k2 d* @' {6 O6 B+ O, _+ m( L) G5 l3 E9 T
    c(train_data, train_labels) %<-% boston_housing$train4 B0 R, w0 T* {1 L# }1 |: `
    c(test_data, test_labels) %<-% boston_housing$test% J, g  Y0 x' h

    ! l; Z- c: B6 ^) H- E6 I

    每个样本有13个数值特征,目标是房屋价格的中位数,单位千美元。

    2. 准备数据

    数据标准化

    将取值范围差异很大的数据输入到神经网络中,这是有问题的。网络可能会自适应这种取值范围不同的数据,但学习肯定变得更加苦难。对于这种数据,普遍采用的最佳实践是对每个特征做标准化。


    ' b/ w9 D) H- v# Test data is *not* used when calculating the mean and std.( M" V9 }" m2 m7 E$ x

    1 B  D! _, c2 g6 N$ G- m# Normalize training data# D/ ?0 t& |6 i" [4 a0 K& \
    train_data <- scale(train_data) + d  ^6 d$ I% b; V+ f$ j
      p. y. G) Y# C
    # Use means and standard deviations from training set to normalize test set8 _1 n, C: r- p/ w# a$ L
    col_means_train <- attr(train_data, "scaled:center") ' I7 c) B6 i( `
    col_stddevs_train <- attr(train_data, "scaled:scale"), x) `* P- \. J7 L9 W
    test_data <- scale(test_data, center = col_means_train, scale = col_stddevs_train)
    , h. l, ~* J1 ]7 e$ r6 |) ]1 ~  F$ @9 w
    $ M' I5 z! ^) a0 @! [! q) V3. 构建网络

    创建模型

    . O$ o: z' \3 i' J
    build_model <- function() {
    6 B4 C6 I$ s- P/ w
    8 {3 ~' H( ~! f# y3 U; k( j, R2 r2 s6 }  model <- keras_model_sequential() %>%
    - i6 t: }. r; j. J( S    layer_dense(units = 64, activation = "relu",
    3 z  \- c9 z% w6 e7 \( C' V                input_shape = dim(train_data)[2]) %>%- Y5 V  O7 y6 r: O2 m( ?
        layer_dense(units = 64, activation = "relu") %>%
      Z/ _$ O% e+ h. {* i. g    layer_dense(units = 1)" q6 f! O$ S+ Z' a
    & _1 G& N2 O% a+ E: {
      model %>% compile(
    + ]- A9 @5 g% N0 n9 W    loss = "mse",5 k, C1 {+ d. J6 X& F
        optimizer = optimizer_rmsprop(),
    , {. e' g4 z9 k% B8 j    metrics = list("mean_absolute_error")2 T3 n" `9 o1 R' _; G. [
      )
    ! N, T/ t" O$ C6 r) _0 p0 C) H8 h5 F! r: l; Q) O
      model
    7 j  P) w, c9 ~- V3 @7 G}( g  k' g; r- r1 O! Q# W/ j4 n9 F

    8 S, I4 F  Z' X' Z- O6 ~model <- build_model(): [3 V  E" ~( S3 R" k
    model %>% summary()
    * W1 ?; B" n' A" u$ E
    7 F) C) A( `5 e

    网络的最后一层只有一个单元,没有激活,是一个线性函数。这是标量回归(标量回归是预测单一连续值得回归)得典型设置。添加激活函数将会限制输出范围。

    4. 训练模型
    4 d5 E2 G7 V) a& B; `& C# Display training progress by printing a single dot for each completed epoch.9 g: P, Y- i  l8 c% N" ]' |
    print_dot_callback <- callback_lambda(
    . i* j9 g! t* y$ J  on_epoch_end = function(epoch, logs) {
    " K6 l3 M- K1 i$ |, C    if (epoch %% 80 == 0) cat("\n")
    - F* I1 b4 J: v' \& @5 X) M: L    cat(".")  ?  z* q, d' X% q
      }$ z6 A$ b5 ^: Y8 W6 }
    )   
    ! D9 t: e+ \/ c$ z$ |3 N8 O
    6 J8 |, K) y& eepochs <- 5003 k% h# s  u) L, T) O

    ; Z9 B5 o8 A! f. `$ G* o  Z# Fit the model and store training stats
      F2 f* T3 `1 {6 C7 Qhistory <- model %>% fit(
    / a. Q" B; Y; {, d8 m  train_data,
    , q) d* X$ ], R2 h' G  train_labels,# d7 a. o, \0 M/ ~
      epochs = epochs,+ h( v0 t! g7 |& e* j
      validation_split = 0.2,1 K" s, R" e0 {
      verbose = 0,: {1 K1 p: c: K7 c
      callbacks = list(print_dot_callback)
    ! ~. L$ {* i* O: ?* v, p: _)
    5 e6 M( C0 ]3 \) |7 o. ^. M' b  w1 s+ B$ V
    library(ggplot2)
    ; h0 ~6 {$ o" H
    " H1 L! J' ^& S2 d3 d. Z" {8 kplot(history, metrics = "mean_absolute_error", smooth = FALSE) +
    ' \. N9 Z! M8 w/ [, \7 |2 E6 j  coord_cartesian(ylim = c(0, 5)): ^, i2 Y' R3 L* T4 a

    5 \: b0 u! v3 q1 V1 @1 o! ?7 d* M# c' {* R0 ]0 o6 j

    - Y) b( O3 S: G9 ]7 \4 J& {* W小结
    ' Q0 a) v% h/ t: I7 s) \1)回归常用的损失函数是均方误差(MSE)。: p; p$ n* I9 ~
    2)常见的回归指标是平均绝对误差(MAE)。3 N4 M4 A4 p8 z6 v# c
    3)如果输入数据的特征具有不同的取值范围,应该先进行预处理,对每个特征单独进行缩放。( z; \. b) x' d, v# b$ ]5 ~
    4)如果可用训练数据很少,最好使用隐藏层较少(通常只有1~2个)的小型网络,以避免严重的过拟合。* q- d* w, K" _8 T# L9 J
    2 ^- j* x5 p5 J

    * @) h1 W  A  c& E" T- I/ K
    4 m4 T. U. k# _0 M3 ]
    zan
    转播转播0 分享淘帖0 分享分享0 收藏收藏0 支持支持0 反对反对0 微信微信
    您需要登录后才可以回帖 登录 | 注册地址

    qq
    收缩
    • 电话咨询

    • 04714969085
    fastpost

    关于我们| 联系我们| 诚征英才| 对外合作| 产品服务| QQ

    手机版|Archiver| |繁體中文 手机客户端  

    蒙公网安备 15010502000194号

    Powered by Discuz! X2.5   © 2001-2013 数学建模网-数学中国 ( 蒙ICP备14002410号-3 蒙BBS备-0002号 )     论坛法律顾问:王兆丰

    GMT+8, 2026-7-22 13:26 , Processed in 0.368292 second(s), 51 queries .

    回顶部