QQ登录

只需要一步,快速开始

 注册地址  找回密码
查看: 3524|回复: 0
打印 上一主题 下一主题

[其他资源] K-近邻算法分类和回归

[复制链接]
字体大小: 正常 放大
杨利霞        

5273

主题

82

听众

17万

积分

  • TA的每日心情
    开心
    2021-8-11 17:59
  • 签到天数: 17 天

    [LV.4]偶尔看看III

    网络挑战赛参赛者

    网络挑战赛参赛者

    自我介绍
    本人女,毕业于内蒙古科技大学,担任文职专业,毕业专业英语。

    群组: 2018美赛大象算法课程

    群组: 2018美赛护航培训课程

    群组: 2019年 数学中国站长建

    群组: 2019年数据分析师课程

    群组: 2018年大象老师国赛优

    跳转到指定楼层
    1#
    发表于 2022-9-5 15:43 |只看该作者 |倒序浏览
    |招呼Ta 关注Ta

    ; G5 s4 ]& k, D5 l0 A/ \K-近邻算法分类和回归3 y, r* |* L5 z% e- I" Z) N7 Y" g2 v
    K近邻算法的主要思想是用离测试集数据点最近的训练集点(称为其邻居)的输出来估计测试集数据点的输出,参数K代表用多少个邻居来估计。超参数K通常设置为奇数来防止平局现象。! ?# H% {( j+ S, i( Z8 z5 V4 m3 `

    8 [' q/ N; s$ J. b! I7 W) K; q7 B其中对邻居的判定:我们可以用欧几里得距离来衡量距离来确定其K个邻居。
    ' r. ?( l; g; u; _- T
    " M5 H( j- T: e- ]7 {' h* ~1 SK近邻算法是一种惰性学习和非参数模型。当训练数据数量庞大,同时你对响应变量和解释变量之间的关系所知甚少时,非参数模型会非常有用。KNN 模型只基于一个假设:互相接近的实例拥有类似的响应变量值。非参数模型提供的灵活性并不总是可取的,当训练数据很缺乏或者你对响应变量和解释变量之间的关系有所了解时,对响应变量和解释变量之间关系做假设的模型就很有用。; R4 X; B: V# \% \

    0 X- H" L' [2 F0 W" V* gKNN模型分类:: [: r6 O* S* y& C
    下面我们看一个分类的例子和代码实现来了解一下K近邻算法:: P+ x. G& ~) V' |+ X: v

    8 u; g: \9 \2 a
    , }& J7 S6 Q6 i  m8 B" {" O: z& e: h* ?( W8 e8 H4 X) n( Z; K7 d" x
    上表是我们的训练集,下面先对数据进行可视化1 B- v8 Q  h4 K8 J+ q

    $ C0 F7 ~5 j- Iimport numpy as np
    ! ?* b7 R* n- `8 H1 J0 F, j8 z8 gfrom matplotlib import pyplot as plt+ [# g4 s2 m# \6 a6 n3 q/ {( t& i
    import sklearn1 X4 E4 ?" r' O! S% g  @" s

    4 a( ]6 Z( }9 E# HX_train = np.array([ # 身高体重& Y/ C# ~3 d5 G4 e; [$ F- R
        [158, 64],
    , ^. z2 A. |; e& I    [170, 86],
    . R5 v5 t. I# ~    [183, 84],: Y9 \3 E9 E, z5 q) N% e- T5 ]1 m
        [191, 80],
    6 G" a, o1 U3 o3 k- G% x: F2 ?    [155, 49],
    5 q8 k& L" R% Q9 a* W$ g: T2 Z    [163, 59],3 M, o% K' v; S0 n3 B1 G# [
        [180, 67],
    & ]; Y; L; H3 R5 L- z5 [2 p* h    [158, 54],
    % ?% G) {2 I0 k. t5 \- t- J# A7 N    [170, 67]])" |0 W  q. \4 Z
    y_train = ['male']*4 + ['female']*5 # 性别! g$ Z) G: j7 N$ F  d' Q) @/ \
    9 M) n. v  y. d% \  Y
    #绘制图像& f( D; t  I( ^9 L! G8 m  s
    plt.figure()
    5 M% N* Z2 Y4 h, Zplt.title('Human Height and Weights by Sex')
    3 \6 r' q. y$ b# H$ kplt.xlabel('Height in cm')
    ! N, u( ]; g5 `. @! lplt.ylabel('Weight in kg')
    % ~/ F9 c1 D) Q2 O' z9 k- ]for i, x in enumerate(X_train):
    % f7 D) T3 f& N, a( A) K: l+ }1 F8 Y    plt.scatter(x[0],x[1],c='k',marker='x' if y_train == 'male' else 'D')
    * W! a; k1 b* ~' k4 Y. Y7 Lplt.grid()$ O; ]* I8 }3 R* d8 o# n2 f- S
    plt.show()! C5 f. w$ m3 E( z# L! `
    4 \, N  a: V7 i' U6 @# m
    结果:
    ; j2 L7 q( r. o! k4 T0 Z# ]& p$ W# ]

    3 P  P% Q$ d, z2 |
    1 t0 \# K* R: u4 f& \0 x9 d 我们使用欧几里得距离公式来衡量距离:
    ( U. e* O( L8 s5 `; r
    * f9 d0 f8 c4 d( ^5 X- E8 T; q& j
    1 B8 a: r# ^) S
    9 n9 H1 F9 g3 }: F* s4 Z& E  S8 a$ k+ }" I5 i- i

    9 x. R9 Q# P) G& _' X  C6 P 我们设置参数K=3,来寻找3个距离最近的训练实例
    ; n2 S3 R3 H; W2 Q
    + }( t8 d* @) X- I: d% x+ ~下面代码实现K近邻算法进行分类:
    ; A$ g) U2 Q) R+ @  r, c) G! E7 G* y- T$ L( z
    x = np.array([[155, 70]]); q0 Y9 C% z# M
    distances = np.sqrt(np.sum((X_train - x)**2, axis=1)) # 计算距离$ D2 G1 n) n5 c! Z# O+ ]& J
    6 n  J+ {8 U- M' z% U
    nearest_neighbor_indices = distances.argsort()[:3] # 找出前三个距离最小的下标
    ( G% }# A4 d5 K, k0 g8 c. j) H( v7 `/ anearest_neighbor_genders = np.take(y_train, nearest_neighbor_indices) # 得到下标对应的标签
    0 H0 l, e7 Y, [6 e
    - O$ {6 N1 R2 _3 Kfrom collections import Counter7 S7 ?# o: ^( A' I, p
    b = Counter(np.take(y_train, distances.argsort()[:3])) #得到三个结果标签中最频繁的标签得到结果female
    6 K. j0 t! J  d. T6 \- r! q9 C1 c% a* w$ Z& ?2 B
    print(b.most_common(1)[0][0]) # female
    ' E3 f7 X; q2 t( R* o因此,从上述代码可以得到K近邻算法进行分类就是找到离样本点最近的K个实例,再取K个实例的标签中出现次数最多的那个作为我们的结果。
    - I. j6 q0 i% W  L; }
    2 y* V5 O5 R2 i* v) E" L7 d上述K近邻算法在scikit-learn中也有对应的函数:# u: ~7 @. R3 u* U

    / I; z# p' b$ ]# }  \6 {6 ofrom sklearn.preprocessing import LabelBinarizer+ X* q$ K$ G2 W
    from sklearn.neighbors import KNeighborsClassifier, R$ \. k7 Y2 t
    + d4 ]) P$ {+ \( Q( Q( u- B- I
    lb = LabelBinarizer() # 创建将标签二值数值化的类实例& C; A: [3 B6 ^
    y_train_binarized = lb.fit_transform(y_train) # 将标签二值数值化$ ~0 O5 Q. P  |( ^& p. a2 K
    print(y_train_binarized)
    0 l2 V. y, D  U' z; S& \% z  k# q+ H4 s" p4 G
    K = 3
    0 v" e* W3 [4 `# [" s- lclf = KNeighborsClassifier(n_neighbors=K) # 创建K近邻分类器实例
    4 f8 @9 [: Y8 o) uclf.fit(X_train, y_train_binarized.reshape(-1, 1)) # 对训练集进行训练
    6 J1 D1 j9 a/ w5 I" P% M3 sprediction_binarized = clf.predict(np.array([155, 70]).reshape(1,-1))[0] # 对测试样本点进行预测
    % X2 S3 `  v# y( x2 Uprediction_label = lb.inverse_transform(prediction_binarized) # 将预测结果从数字转换为标签- C8 ~, ]! E+ m& u5 x
    print(prediction_label) # array(['female'], dtype='<U6')
    % d- q0 r9 P6 N9 S' PKNN回归:2 c+ h+ y8 o7 B0 G
    K近邻算法进行回归和K近邻思想一致,只不过在得到了K个邻居后,分类是取邻居中出现次数最多的那个,而回归是取其他的操作来预测输出值(比如取平均)" Q0 J+ ?# n+ d) m" q
    % o/ i, l8 G" c
    对应的代码在scikit-learn中其实也很简单
    . M) N8 p/ C. P- |7 y* K
    ! x& z/ w$ n; S, jfrom sklearn.neighbors import KNeighborsRegressor
    2 o, R4 _: d& s/ G" |) w6 c$ V! G( nK = 3' B7 ^* t) j9 W7 ^" `3 p. j- u
    clf = KNeighborsRegressor(n_neighbors=K)( p" g; m  C$ Y: ^- u0 a" B
    clf.fit(X_train, y_train)
    9 I7 B9 [  Z& i" h. W+ Zpredictions = clf.predict(X_test)9 u) \8 `! m' J( ?
    特征缩放
    6 V# U1 ^& X7 i下面我们谈谈一个提升算法精确度的小细节。假设还是上面的数据,我们现在要做回归,给定身高和性别标签来预测体重。如果我们的训练数据集包含一个身高170cm的男性和身高160cm的女性。如果我们的测试集数据为身高为164cm的男性,你觉得其预测结果会接近170cm的男性还是身高160cm的女性呢?我们可能相信测试实例更接近男性实例,因为对预测体重来说,性别差异可能会比 6cm 的身高差距更重要。但是如果我们以毫米为单位表示身高,测试实例更接近于身高1600mm 的女性。如果我们以米为单位表示身高,测试实例更接近于身高 1.7m 的男性。(记住我们以欧几里得距离来衡量)0 G1 B% u; J0 U  p

      C0 f, d# i# @4 Z; c因此,我们的特征缩放的作用就出来了(其实就相当于深度学习对数据集预处理中的Normalize)" N6 }1 K% q5 W4 \9 i; W
    , I6 n& Q7 @( ?0 Y; q* x& b: _+ n
    将所有实例特征值减去均值来将其居中。其次将每个实例特征值除以特征的标准差对其进行缩放。均值为 0,方差为 1 的数据称为标准化数据。1 q# @' t2 @: m1 M, a
    ————————————————
    % t/ j# D( |; g版权声明:本文为CSDN博主「王大队长」的原创文章,遵循CC 4.0 BY-SA版权协议,转载请附上原文出处链接及本声明。5 Q1 v* O* P, D/ J
    原文链接:https://blog.csdn.net/qq_55621259/article/details/126695549* e3 ~; J+ O9 Q& v: O! H
      a6 B* L+ C6 T2 B

    + ?+ A( l0 n4 E' B( A
    zan
    转播转播0 分享淘帖0 分享分享0 收藏收藏0 支持支持0 反对反对0 微信微信
    您需要登录后才可以回帖 登录 | 注册地址

    qq
    收缩
    • 电话咨询

    • 04714969085
    fastpost

    关于我们| 联系我们| 诚征英才| 对外合作| 产品服务| QQ

    手机版|Archiver| |繁體中文 手机客户端  

    蒙公网安备 15010502000194号

    Powered by Discuz! X2.5   © 2001-2013 数学建模网-数学中国 ( 蒙ICP备14002410号-3 蒙BBS备-0002号 )     论坛法律顾问:王兆丰

    GMT+8, 2026-10-8 09:44 , Processed in 0.624393 second(s), 50 queries .

    回顶部