QQ登录

只需要一步,快速开始

 注册地址  找回密码
查看: 4130|回复: 0
打印 上一主题 下一主题

预测房价:回归问题——R语言

[复制链接]
字体大小: 正常 放大

1178

主题

15

听众

1万

积分

  • TA的每日心情
    开心
    2023-7-31 10:17
  • 签到天数: 198 天

    [LV.7]常住居民III

    自我介绍
    数学中国浅夏
    跳转到指定楼层
    1#
    发表于 2021-10-29 10:50 |只看该作者 |正序浏览
    |招呼Ta 关注Ta
    预测房价:回归问题——R语言  ^( l* V# t4 P- H4 |3 M$ w- g
    在回归问题中,我们的目标是预测连续值的输出,如价格或概率。将此与分类问题进行对比,分类的目标是预测离散标签(例如,图片包含苹果或橙色)。. b) u5 X2 f5 ~# D# U* ~

    4 B) [' y. K. i$ P0 v. ^问题描述# P- Z; B) ~/ G; \8 \
    我们将要预测20世纪70年代中期波士顿郊区房屋价格的中位数,已知当时郊区的一些数据点,比如犯罪率、当地房产税率等。
    ' [7 C. I+ Y8 C, r7 L本次用到的数据集包含的数据点相对较少,只有506个,分为404个训练样本和102个测试样本。输入数据的每个特征(比如犯罪率)都有不同的取值范围。例如,有些特征是比例,取值范围0 ~ 1;有的取值范围为1 ~ 12;还有的取值范围0 ~ 100,等等。
    2 z' V- |; Q5 ~3 |, \! A数据特征:. X& k- D6 K) \" j( [* f4 z
    人均犯罪率。' n. \! _2 b) d# l8 M
    占地面积超过25,000平方英尺的住宅用地比例。+ J; X, ?8 e& G; }
    每个城镇非零售业务的比例。
    ; ^2 O+ F; D, JCharles River虚拟变量(如果管道限制河流则= 1;否则为0)。% t0 `% x; P1 K7 U, J- N  D
    一氧化氮浓度(每千万份)。
    7 n! a- C  Y4 m9 P1 U/ [每栋住宅的平均房间数。' A- i8 f5 `! E& Q4 U4 n" {* _' N
    1940年以前建造的自住单位比例。5 b3 A" y( @9 F7 W$ g- y- R8 I- J
    到波士顿五个就业中心的加权距离。& j& Y5 E7 \! S; i8 M6 f
    径向高速公路的可达性指数。. j9 t: Q8 @& Q6 h  Y2 h
    每10,000美元的全额物业税率。
    # M5 r1 ]( u5 m城镇的学生与教师比例。
    6 |$ Y+ F( L1 w2 F" ~1000 (Bk - 0.63)* 2其中Bk是城镇黑人的比例。5 z# t1 q; s$ N- V- u* {
    人口比例较低的百分比。/ a( p- r( F% h! U; A2 ?( j; t
    1. 加载波士顿房价数据
    / g+ `0 z) j1 ]' t1 z' rlibrary(keras)9 y& g: N! G* |, s& O9 u
    / Z' ~9 v5 u$ Y5 v! o! `$ O3 m
    boston_housing <- dataset_boston_housing()
    7 O$ g& t3 a: f9 f3 B. y- `' O' c; V. e, Q- w' X
    c(train_data, train_labels) %<-% boston_housing$train
    1 D& B: m- K) V. W) n: J/ Cc(test_data, test_labels) %<-% boston_housing$test
    $ r& F/ h, N9 L" O2 y, k: E7 r, j7 I" w2 C

    每个样本有13个数值特征,目标是房屋价格的中位数,单位千美元。

    2. 准备数据

    数据标准化

    将取值范围差异很大的数据输入到神经网络中,这是有问题的。网络可能会自适应这种取值范围不同的数据,但学习肯定变得更加苦难。对于这种数据,普遍采用的最佳实践是对每个特征做标准化。


    5 H; m$ x* t6 M1 q6 S2 d# Test data is *not* used when calculating the mean and std.+ o8 ^- y/ Y$ N) R4 d$ L. W) U

    4 G1 D# N! b% J# Normalize training data- N; \8 X3 ?' V  N2 ]+ d- K7 ]
    train_data <- scale(train_data) - T% C6 T4 v2 {  G

    3 a3 N: F0 Y( ~( Q& k) r# U. ?6 c# Use means and standard deviations from training set to normalize test set$ Q) i; V( G5 x
    col_means_train <- attr(train_data, "scaled:center") 8 I+ s7 X" y: O4 E9 R- ]" U
    col_stddevs_train <- attr(train_data, "scaled:scale")" l! U2 c( X( i4 T) W4 u7 |
    test_data <- scale(test_data, center = col_means_train, scale = col_stddevs_train)0 l9 {" A- A# k0 s5 R8 ?5 J6 R/ {6 S

    . O5 q7 U/ m: I( @( b3. 构建网络

    创建模型


    5 C9 d. n( }8 N, U9 abuild_model <- function() {
    4 a- C: _& q2 v; H0 K/ _  U& F( n  v. S+ v
      model <- keras_model_sequential() %>%
    ; |; _8 Q4 m3 x1 E# h+ X* V' P    layer_dense(units = 64, activation = "relu",
    & y( _4 }! K) D* F8 V$ n                input_shape = dim(train_data)[2]) %>%
    5 @- O+ m, k) `  N5 a    layer_dense(units = 64, activation = "relu") %>%$ B8 t8 q: I6 E0 Q( D# c
        layer_dense(units = 1)5 V# L  U% ]+ B* a! z
    8 Z/ u9 Q: l* O
      model %>% compile(* k! _8 ?, C) b. a) p5 ]+ b+ A7 ?! K
        loss = "mse",
    , _. i7 t* Z7 h: F) t    optimizer = optimizer_rmsprop(),
    7 I. D) ], t- w* x: h0 b: y    metrics = list("mean_absolute_error")
    : ~# H1 l6 q$ t! ?' F1 H  )5 M# h5 i( k7 i, u  _( ]
    : X* {) |% G1 [% |3 P) _: W6 _  X
      model
    9 n7 _& D6 G; V$ H% S; ^/ R}
    ; U# ]. C& Y1 v5 t; k. U( s) \
      @# H1 Z; E/ K. qmodel <- build_model()
    8 G5 ]( f  i( Tmodel %>% summary()& S8 y1 k+ I+ g
      T1 r1 K; p3 ?9 U( ^7 W. K+ Q

    网络的最后一层只有一个单元,没有激活,是一个线性函数。这是标量回归(标量回归是预测单一连续值得回归)得典型设置。添加激活函数将会限制输出范围。

    4. 训练模型
    % g1 \; ^1 G. m  g# Display training progress by printing a single dot for each completed epoch.
    $ d/ j% c& D. R( pprint_dot_callback <- callback_lambda(
    7 ?# O1 u' Y6 v( q2 [  on_epoch_end = function(epoch, logs) {; X9 B) E& [# I3 D' M+ [
        if (epoch %% 80 == 0) cat("\n")0 H; m/ @/ x) N; T) d" s7 @4 D9 b
        cat(".")
    : k4 `1 Z" \2 c1 e, l# G  }
    / T- a/ O* F# i)   
    - s8 U. P, p) V5 s" {: \' x( _* A3 D# C0 F+ _9 Y) t" c1 W
    epochs <- 500- ]6 M# G% W: U5 T( _* g

    : i' q: [1 A" f8 K% J; q% q1 u9 a# Fit the model and store training stats
    & C3 D. c" `( F+ m1 W- Fhistory <- model %>% fit(# u7 |  P0 Z, H$ X
      train_data,- s: `6 v+ l& ~* z! O) o% k3 t/ B
      train_labels,
    : y  w8 Q7 t9 P6 i$ ]2 w& B- C1 E  epochs = epochs,
    / W% j( s+ d0 Q: _0 d  validation_split = 0.2,% p3 b* d+ j( Z7 M
      verbose = 0,
    ' y; \3 {0 w, k, _5 t  callbacks = list(print_dot_callback)8 i5 V. ], E) d0 ^  |5 d
    )$ z' d: q$ q# K; c' v3 b
    , N% z6 w3 P0 l% U7 u* w
    library(ggplot2)
    7 ?# @4 i! E" s/ }/ |; p; f* m% i$ d+ d5 c) p* Q" K1 d& b
    plot(history, metrics = "mean_absolute_error", smooth = FALSE) +
    9 D8 T, t* [! v, b6 i# N  coord_cartesian(ylim = c(0, 5))
    - r, o" z/ V- N/ e4 ^4 x- T+ J- ^0 u) N0 W# T
    9 b* g) a3 N; p$ o) i

    4 q) t3 d1 w, X5 i4 F小结
    8 W% d! N" n; o6 k, u1)回归常用的损失函数是均方误差(MSE)。3 Y# @+ V8 N0 a5 f2 I
    2)常见的回归指标是平均绝对误差(MAE)。
    % J8 G! r3 I7 @4 P8 |/ n$ k6 P3)如果输入数据的特征具有不同的取值范围,应该先进行预处理,对每个特征单独进行缩放。
    + L8 G$ N( P9 w: h4)如果可用训练数据很少,最好使用隐藏层较少(通常只有1~2个)的小型网络,以避免严重的过拟合。
    # X. l: r5 v4 {' `& b% Q5 B9 X. @- z, X8 ?) t  O' }

    1 F% c, q  Y7 }; \# z7 J( P
    * A* b! l8 P' N
    zan
    转播转播0 分享淘帖0 分享分享0 收藏收藏0 支持支持0 反对反对0 微信微信
    您需要登录后才可以回帖 登录 | 注册地址

    qq
    收缩
    • 电话咨询

    • 04714969085
    fastpost

    关于我们| 联系我们| 诚征英才| 对外合作| 产品服务| QQ

    手机版|Archiver| |繁體中文 手机客户端  

    蒙公网安备 15010502000194号

    Powered by Discuz! X2.5   © 2001-2013 数学建模网-数学中国 ( 蒙ICP备14002410号-3 蒙BBS备-0002号 )     论坛法律顾问:王兆丰

    GMT+8, 2026-7-22 09:01 , Processed in 1.669043 second(s), 51 queries .

    回顶部