文章目录, a o# U! i# i- v" B5 }
一、具体实现步骤 y1 T8 d# J7 I% o; c$ j1. 导入Iris鸢尾花数据集 + _9 t2 H) v8 G6 t2. 提取花瓣数据* a1 y, Z* L! Z. k
3. 拆分数据/ }* K( w ] E) J- A, I
4. 训练模型/ t" C1 y i& {
二、可视化结果展示4 Z7 j/ N) y( t6 {
1. 训练集1 R3 A& v3 ?1 ?. ^" c9 O
2. 测试集 " j& E% \+ q$ q" W% [, ~9 s. ]三、相关知识点讲解. G) [: C/ k, i. ^5 X7 R' y
1. train_test_split()函数1 M- p- |3 A* W1 L( e5 J
2. LinearRegression()函数 * J: D8 a1 ?8 n& E" \2 R" l# E/ ~- |, @3. 散点图与折线统计图的绘制 1 i% p0 q" [: F, j) N这篇文章中,我们要通过鸢尾花的花瓣长度预测花瓣宽度# {1 c7 x* {. O3 [7 G G
, r% s6 c8 c8 f0 M/ `2 p& g$ N P/ R7 y' Z9 O# i, l8 L5 B
环境:Python3.6.5, \5 Z. F% E# f# s% d2 K/ ^
编译器:jupyter notebook , }" N* U2 Q! _0 o; Q* r" A4 A9 A% \3 L3 o% P0 k
一、具体实现步骤 5 I2 { D! G4 a2 ^; F1. 导入Iris鸢尾花数据集 , O5 V4 t& s7 s9 aIris鸢尾花数据集共有150条记录,分别是:/ h0 k) ]' F1 X q3 O) A
50条山鸢尾 (Iris-setosa)8 y) z r7 e! i6 O) Q: f
50条变色鸢尾(Iris-versicolor)6 b I; W9 P2 B) [4 c9 y5 V8 l
50条维吉尼亚鸢尾(Iris-virginica)7 J7 Z1 ]- D3 |% o
url = "https://archive.ics.uci.edu/ml/machine-learning-databases/iris/iris.data" 0 E `8 x p7 L7 u2 o7 {! ~; k7 H
names = ['花萼-length', '花萼-width', '花瓣-length', '花瓣-width', 'class'] $ Q2 S& c! x9 N$ n9 l4 ~2 p) d
dataset = pd.read_csv(url, names=names) 4 ] V) ]' T3 e3 \" h' c " S1 c' d. l! {1 x- T+ r4 x: t2. 提取花瓣数据 5 [" B' ?% H3 m' [: n2 }# L下面我们提取数据集中花瓣宽度与花瓣长度数据,将花瓣数据分为训练数据与测试数据,训练数据用于训练线性回归模型,测试数据用于检测我们的模型的准确率。 + q) I! Y. @2 o/ t( m) z* X" r9 X. y Y' ]# _5 o: L5 H6 z' Z
$ ?( [3 ^ \2 M最终我们要达到的效果是:输入花瓣宽度,通过模型预测花瓣宽度。 7 H# _; Q$ N, L5 W5 Q1 t 9 n1 y, {/ b. O4 O6 v " s% \8 u* J, W7 I4 nX = dataset["花瓣-length"], W' Q+ c/ \0 d: d# C
Y = dataset["花瓣-width"]2 `5 \( t. A/ E. X: [
X = X.reshape(len(X),1) ! G1 w+ R- `4 p3 Q; ?: DY = Y.reshape(len(Y),1)# o2 M; e E, m, L
# w K" l+ ^6 |6 P U3. 拆分数据$ H+ t" S3 o5 Y+ N' h
将数据集拆分数据集成训练集、测试集# r S) Z, H4 i, c [6 d
7 H6 D( R! X/ u9 Y
# R; d/ M( f) X% w$ C( N6 Tfrom sklearn.model_selection import train_test_split + z% g* m3 u8 e9 F& x/ @8 sX_train, X_test, Y_train, Y_test = train_test_split(X, Y, test_size=0.2, random_state=0) 5 F4 a: m& _8 e7 L& O3 y6 ~2 l3 c* G" N' L& C0 M
4. 训练模型7 I+ Y: a7 c y- p
这里我们需要将我们的训练数据喂给模型进行训练。 ' ^3 k; h9 h, j; W& P6 C: s- @& F/ v% W/ c
9 { A$ u$ {7 [, Q: O2 u
from sklearn.linear_model import LinearRegression i- u7 n6 D1 M' s7 I# Z$ zregressor = LinearRegression() 3 f/ `" z" h* O+ t% U& zregressor = regressor.fit(X_train, Y_train) $ X+ d. ]0 j8 T! v8 T* G% Q s 2 B! j7 I' B1 G0 X% Q/ P二、可视化结果展示4 P1 {$ L5 O9 f0 J+ E5 U
1. 训练集 8 O$ y; p, W8 h: f" l T将训练集中每一朵花的花瓣数据与线性回归模型预测的结果放到同一张统计图中。 4 i! N" G2 V# ?3 E" w X0 h , g1 j- _ Q4 I0 u- P' O ~9 V$ \- s% ?; {6 D. X3 c
import matplotlib.pyplot as plt $ q- C' L% i8 J: ~1 V 5 h: C: ~4 b Z5 J7 f4 K, I# v; ^7 _9 l2 }/ p! a
plt.scatter(X_train, Y_train, color='red') 1 t, ~4 d; H8 C5 U* Uplt.plot(X_train, regressor.predict(X_train), color='green')0 C5 a8 r' z5 i
plt.xlabel("Iris-length") 2 r- ]' v3 T# r, {
plt.ylabel("Iris-width") 1 N' K7 C0 s# S! v, z5 v) `plt.title("This is train dataset-kzb") * J( V& B. F! p5 c: j) Eplt.show() 3 u6 [; ]8 P$ l- f! X, @, p, f7 P% k; W
红色的点是训练数据集中的花瓣数据,我们不难看出花瓣长度与宽度是一个线性关系,绿色的线是我们模型拟合的结果。+ i! r Q4 z; l% o( h 6 U& V9 f! U) C$ g8 t- l ' ~. y5 i2 r) N. S* d . p1 H( T9 x5 l8 W4 V4 v2. 测试集. t3 J; O, ]$ `6 L
将测试集中每一朵花的花瓣数据与线性回归模型预测的结果放到同一张统计图中。6 d0 ^! j4 W8 [+ z& I1 Z: S