- 在线时间
- 481 小时
- 最后登录
- 2026-8-23
- 注册时间
- 2023-7-11
- 听众数
- 4
- 收听数
- 0
- 能力
- 0 分
- 体力
- 7858 点
- 威望
- 0 点
- 阅读权限
- 255
- 积分
- 2946
- 相册
- 0
- 日志
- 0
- 记录
- 0
- 帖子
- 1177
- 主题
- 1192
- 精华
- 0
- 分享
- 0
- 好友
- 1
该用户从未签到
 |
数据集:使用加利福尼亚房价数据集。 ]- u, X" j2 ]; t% s5 p
任务:构建一个模型预测加利福尼亚地区的房价。
, K7 W9 d$ k& y8 u8 I) @' R2 B挑战:尝试不同的预处理方法(标准化、归一化等)和特征选择技术来改进模型性能。
6 Z- h: {" X' j& L! V线性回归是一种预测数值型数据的经典统计方法,它假设目标值和特征之间存在线性关系。在房价预测任务中,我们可以使用线性回归模型来预测基于多个特征(如房屋大小、位置、年龄等)的房价。以下是使用加利福尼亚房价数据集进行房价预测的示例代码,以及如何应用不同的预处理方法和特征选择技术来改进模型性能。' q0 S F% Q& e
0 m1 @- I) c6 P
加载和预处理数据
0 z: I, Z r# z首先,我们从scikit-learn中加载加利福尼亚房价数据集,并进行基本的数据预处理。 - from sklearn.datasets import fetch_california_housing
- ; w* q1 f- ~9 X4 j! Q! @$ U
- - f9 L! _' U$ ?1 v9 o: y% |! R
- from sklearn.model_selection import train_test_split\\" h( A9 Q C' b3 e\\" W: @5 S
- 1 z5 }# i( n0 n
- from sklearn.preprocessing import StandardScaler& Q- C( w+ }3 V9 s. a
- ; n9 B0 f/ i5 h4 C. f
- from sklearn.linear_model import LinearRegression5 b0 A- ?4 E7 G( T* J
- ; T9 W: V, ?- o& B0 ~+ ^. A0 j
- from sklearn.metrics import mean_squared_error4 f& ^; @& [' u$ _& V ]
- 9 ]7 f& y# k% z
-
- & S5 {$ X# o# y: x0 s* u
- 4 D2 w9 ~2 N8 ^2 |
- # 加载数据集
- 5 [3 v C* G; Y. h: F4 h8 K
- * a3 n# X2 h: f/ {' C3 L
- housing = fetch_california_housing()
- 7 V: I' E& [2 o# D* i* ^( r
- : E+ o% ^& g9 L( c+ V3 r
- X, y = housing.data, housing.target
- : h. |# V% {( T
- . P$ `1 k, q% ], y
-
- % z7 x* r$ r; a- B. p. ]) T6 E, g
- 1 e' A w. p- m! y1 ?
- # 划分训练集和测试集* j6 \3 q. ^% M @
- ; W! z- q0 x7 x6 w- R+ Y
- X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.2, random_state=42)\\" s% ]8 Y( }4 o+ a7 B4 E+ b
- 6 r( n) D5 J/ b) e) v
- % ?. |7 T( C I
- $ Z\\" [% N\\" O2 O
- # 数据预处理:标准化
- 4 x8 j7 E, ^) q7 y4 _6 }; g7 I
- : D5 a2 L& ^- Y) t3 B! R8 A+ `1 l
- scaler = StandardScaler()
- 8 j' w5 ^5 w' X) C& C$ W2 |) m
- ; f* ^3 {' E' d; J$ S! b3 c3 k3 \
- X_train_scaled = scaler.fit_transform(X_train). c0 K/ O, K3 Q. g3 A8 Z
- + H5 }) h7 g0 m7 \! a
- X_test_scaled = scaler.transform(X_test)
构建和训练线性回归模型- # 创建线性回归模型# w# ?/ S! W* r2 X0 X
- model = LinearRegression()2 g6 [7 N0 n4 t$ b3 z4 E
- ! T x& B6 Y, ], k* [% `6 c) Z
- # 训练模型
( ^* N, b- o8 S2 N. U6 X' ` - model.fit(X_train_scaled, y_train)
) y _. B0 \: Q, W - - f3 R3 ^7 [: b) G+ w6 }. z6 W: k# P
- # 预测测试集2 N8 ` H5 _3 b1 a- M4 U4 ~
- y_pred = model.predict(X_test_scaled)# z% }) j7 t0 P8 e( ?! M. E7 @\" S
-
2 H! p; f: ^- }0 d- w - # 评估模型* x4 Z! S% J: p0 a
- mse = mean_squared_error(y_test, y_pred): r5 r- U8 u7 h8 T z3 d4 Z! Q$ j# t4 B
- print(f"Mean Squared Error: {mse}")
复制代码 挑战:尝试不同的预处理方法和特征选择5 ]2 q; Q% {& V" y, f9 u* ~
预处理方法:除了标准化,你还可以尝试归一化(MinMaxScaler)、对数转换等方法,看看它们如何影响模型的性能。- Q. T2 y+ C, j$ w
特征选择:可以使用不同的特征选择方法(如SelectKBest, SelectFromModel)来选择最有影响力的特征,这有助于模型专注于最重要的信息,提高预测准确性。- from sklearn.feature_selection import SelectKBest, f_regression+ p) l\" y5 x+ }. ^% W; ~+ _
- / s! J, _% L- i1 s. l0 k
- # 特征选择
) Z: n( e3 { h; Y - selector = SelectKBest(score_func=f_regression, k=5)
1 {1 J7 v$ w\" J5 j - X_train_selected = selector.fit_transform(X_train_scaled, y_train)
& F6 ? \. k( f( a% V\" f - X_test_selected = selector.transform(X_test_scaled)
' n0 i& P' V% P8 L\" U5 M\" A7 h - 8 f, B* D: q8 L0 I% ]( _ R/ `
- # 使用选择的特征重新训练模型1 b R2 A. b& M5 u6 D
- model.fit(X_train_selected, y_train)
' t8 |$ e3 q2 K; ?\" l - y_pred_selected = model.predict(X_test_selected)& m) F, s* V6 J% ^/ f% a f
-
: M$ r6 C# Q! _ - # 评估
& P8 | X8 e* X% _( Z- t - mse_selected = mean_squared_error(y_test, y_pred_selected)
; }2 F' r$ e# F0 r9 F, b - print(f"Mean Squared Error with selected features: {mse_selected}")
复制代码 8 U! O3 _/ q$ k
|
zan
|