QQ登录

只需要一步,快速开始

 注册地址  找回密码
查看: 3506|回复: 0
打印 上一主题 下一主题

[其他资源] 【机器学习】无监督学习的概念,使用无监督学习发现数据的特点

[复制链接]
字体大小: 正常 放大
杨利霞        

5273

主题

82

听众

17万

积分

  • TA的每日心情
    开心
    2021-8-11 17:59
  • 签到天数: 17 天

    [LV.4]偶尔看看III

    网络挑战赛参赛者

    网络挑战赛参赛者

    自我介绍
    本人女,毕业于内蒙古科技大学,担任文职专业,毕业专业英语。

    群组: 2018美赛大象算法课程

    群组: 2018美赛护航培训课程

    群组: 2019年 数学中国站长建

    群组: 2019年数据分析师课程

    群组: 2018年大象老师国赛优

    跳转到指定楼层
    1#
    发表于 2022-9-14 16:37 |只看该作者 |倒序浏览
    |招呼Ta 关注Ta
    【机器学习】无监督学习的概念,使用无监督学习发现数据的特点
    # {: C4 P1 A: |7 b9 z
    1 |" [! a' F7 V/ L, ~+ U8 d- O到目前位置,我们主要把注意力集中在监督学习的问题上,数据集中的每个数据点都有一个已知的标签或者目标值。然而如果面对没有已知的输出结果,或者没有人监督学习算法,我们要怎么做。5 g! X8 b, T; C: m5 Z

    3 ]6 o* {3 |; J3 A! R  ^7 Z/ e这就是无监督学习 。4 |, u4 B5 q; B3 t$ T4 l
    4 b: j" X; F' v( F* M6 z8 }
    在无监督、非监督学习中了,学习过程仅使用输入数据,没有更多的指导信息,要求从这些数据中提取知识。我们已经讨论了非监督学习众多形式的一种降维。另一个普及的领域就是聚类分析。他的目的是吧数据分为相似元素组成的不同区域中。/ j- X0 D% X" @+ j# a2 }" F
    % L* b% o# Z3 y  M( u3 ^4 @
    在本章中,我们想要理解不同的聚类算法如何从简单到,无标记的数据集中提取特征。这些结构特征,可以用于特征处理,图像处理,甚至是作为无监督学习任务的预处理步骤。
    4 @7 o; n' H5 l5 f作为一个具体的例子,我们将对图像进行聚类,将色彩空间降到16位数。
    6 ]9 p  {+ ^! o1 Y/ ]. R1 o8 a
    : I  t5 P' d2 O* A& r解决的问题
    % P" R0 q2 W3 T- n7 d; F$ a4 I8 j1.K-means聚类和期望最大化是什么?如何在opencv中实现这些算法。/ R9 R* Q* a# C/ L$ W8 {
    2.如何在层次树中使用聚类算法。他带来的好处有哪些。3 X3 z- @: b) s
    3.如何使用无监督学习,进行预处理,图像处理,分类。
    " y$ f9 G- c$ Z# d* `/ }
    + L! z( b- s" }* r5 R* P0 j1 理解无监督学习- }$ H& W2 C9 S! b6 M. j9 v# ?
    无监督学习可能有很多形式,但是他们的目标总是把原始数据转化为更加丰富,更加有意义的表示,这么做可以让人们更容易理解,也可以更方便的使用机器学习算法进行解析。7 G$ Z% j" {' d/ r0 O7 N3 S% n# A: J, D
    无监督学习的应用包括一下应用:5 T/ s9 J6 R) T% v# r5 T5 B
    1降维:他接受一个许多特征的高维度数据表示,尝试对这些数据进行压缩,以使其主要特征,可以使用少量的携带高信息量的数据来表示。
    % r9 ?# K& [8 ^) ^, ~1 ^2因子分析:用于找到导致被观察的到的数据的隐含因素或者未观察到的方面。
    % s0 L) V* m5 _6 r8 N. z+ o/ M5 I3聚类分析:8 N+ {( g  x/ _& T1 W- A4 g! |
    尝试把数据分成相似元素组成的不同组。9 D" k2 {( {6 ~5 v/ [& x' k

    - V' P' w, ~0 o无监督学习主要的挑战就是,如何确定一个算法是否出色,或者学习到什么有用内容,通常评估一个无监督学习算法结果的唯一方式是手动检查,并确定结果是否有意义。
      U/ D0 b: |1 B+ D* g
    7 |( K+ t5 o3 I( }; t* }话虽然如此,但是非监督学习,可以非常有,比如作为预处理或者特征提取的步骤。8 v% M% K$ T# l/ u' Z2 Y8 u, @2 J

    ! y5 j$ z# e6 N2理解K-means聚类
    ; P/ r! p8 e5 fOpencv 提供最有用的聚类算法是k-means,因为它会从一个没有标记的多维度数据集中搜寻预设的K个聚类结果。
    ) ?) E, \8 t- F
    * y: h* ^9 X; {7 i0 h/ j0 g它通过两个简单的假设来完成最佳聚类了。6 R' |  k+ E4 T4 L: m$ g8 N
    1 每个聚类中心都是属于该类别的所有数据点的算术平均值
    ) p. Y. O, a1 X" ~7 D2 聚类中的每一个点相对其他聚类中心,更靠近本类别的中心。* t/ r/ f2 Y, r8 U- s

    . d; w- u/ ]7 B/ ~2.1 实现第一个kmeans例子% o9 G2 E+ _2 A% q! N
    首先,生成一个包含四个不同点集合的数据集。为了强调这是一个非监督的方法,我门在可视化将忽略哪些标签。使用matplotlib进行可视化。2 F2 q$ C: |: t

    ' f# @. J9 i/ B! ?; m+ d" m3 q0 M6 nimport matplotlib.pyplot as plt
    0 s' n9 p( @* o9 H, bimport pylab
    8 G/ l+ D$ o1 h2 O' l0 B8 k, [' h3 V. Kfrom sklearn.datasets._samples_generator import make_blobs& q( J4 t! U1 T, [
    / [6 N& P4 w2 Y; }5 E
    plt.style.use('ggplot')
    7 r! m% y" }0 V: ox,y=make_blobs(n_samples=300,centers=4,cluster_std=1.0,random_state=10)
    $ p0 [1 a! g* a9 `plt.scatter(x[:,0],x[:,1],s=100)
    4 e5 U6 t2 D' K, ppylab.show()
    5 s! c& y% V- p; E1 c
    6 H3 c$ U( l" n5 F& ^- ?# Z4 P: O" m8 L# J  G
    1
    # f+ x4 y9 @6 a# l$ B; _8 t1 O* I4 F2 s" u26 o; G  E- y5 O* Q
    3
    . x4 D: w" Q! {, L# t" |4/ N8 X0 p, x! k2 `. U
    5
    1 r# p/ c* D3 \6' g. U( X6 K, i- w( \% T5 @
    7
    - Z2 m9 O8 x4 _9 U1 c; e8
    $ y: N7 N. i& ~/ U9
    6 C+ D" p: ^9 w0 y4 T10
    " p5 d; W7 M+ G6 ~1 W
    ) k' C* M+ v3 z$ w3 ~我们创建一个四个不同区域的聚类,centers=4,一共300节点。
    8 O. T  |" ^4 X: b% \: Z0 M" |% r; U如上程序生成图像所示结果。
    . i6 y  p2 g2 h! j3 e尽管没有给数据分配目标标签,但直接使用肉眼还是可以看出来一共是四类。! Q8 F& i7 G4 o$ f* s# e( l" f
    kmeans就可以通过算法办到,无需任何关于目标的标签或者潜在的数据分布的信息。
    3 g6 O1 g+ H2 u+ h4 ^$ z8 A当然尽管,kmeans在opencv中是一个统计模型,不能调用api中的train和predict。相反,使用cv2.kmeans可以直接使用这个算法。。为了使用这个模型,我们需要指定一些参数,比如终止条件,和初始化标志。! N( Q2 T/ m; U/ e$ M; d

    . L3 i) D) R5 r1 V我们让算法误差小于1.0(cv2.TERM_CRITERIA_EPS),或者已经 执行了十次迭代(cv2.TERM_CITTERIA_MAX_ITER)时候终止。
    - N+ c+ k* Y/ a1 P1 t/ T' P( {  I9 J7 j* }) F. a

    ) N3 m& H# g# u, y& |* }" Q
    / N7 Z6 }  a. T' [7 l/ r' pimport matplotlib.pyplot as plt8 Z" U8 U* W1 s4 y: n# H; Z
    import pylab- ]$ l4 d* M4 ^  t
    from sklearn.datasets._samples_generator import make_blobs
    4 C: W' \) y. L3 l2 j3 ?  Qimport cv2' ^  Z7 T4 V  \: ~& d3 Z- n' V. R4 [# \
    import numpy as np
    / L/ b# w. \  C$ h0 _$ K$ U% P* a3 R8 k  \3 i( R
    plt.style.use('ggplot'); I3 c* s/ C! t
    x,y=make_blobs(n_samples=300,centers=4,cluster_std=1.0,random_state=10)
    ) B4 O1 W, R1 R) Wplt.scatter(x[:,0],x[:,1],s=100)- F$ J) X+ ^. _* H; O
    % ~% Z8 ^) t- f. O9 r  C* s

    " ^  y7 {4 n  G* X! I3 i6 c' Fcriteria=(cv2.TERM_CRITERIA_EPS+cv2.TERM_CRITERIA_MAX_ITER,10,1.0)
    6 q2 V. M1 l1 E; [flags=cv2.KMEANS_RANDOM_CENTERS
    # k; @3 L2 \/ k" Ccompactness,labels,centers=cv2.kmeans(x.astype(np.float32),4,None,criteria,10,flags)
    ( {" t0 r! x# P' Xprint(compactness)/ R/ p. C- `0 j6 h. a) a

    6 D" l. ?% n9 @4 {! O  a: I8 ~plt.scatter(x[:,0],x[:,1],c=labels,s=50,cmap='viridis')
    % r7 Z4 p: ^, t% b2 dplt.scatter(centers[:,0],centers[:,1],c='black',s=200,alpha=0.5); D, ~; j% `- {/ }
    # z. \2 L4 V3 C, a5 @
    pylab.show()
    ' m: \6 ?0 Q  l* D
    - j+ F$ E$ A  l0 E- Z! J: i
    , T% w& _- {' e, J+ c/ \' \" Z. {8 C$ t- W& z- V
    $ D# _& ~  W6 D# [+ h# I
    ( c* J5 @. O; j1 q  s
    0 c4 K  W$ j* q9 x( d
    & @8 O# N  l  M5 m6 d
    1
    0 D1 ]. I& `9 w( _2 [- D' ?# V6 f2
    2 T6 T0 w) k, D0 x% Z- x34 R$ n2 i& x  H( X
    4
    1 {3 L, d. c$ `5
    : f) u& |4 Y' O9 E# y6
      [) c, e" I- M. G) a7( x) }9 _+ w  G
    8
    ' ~' n+ D% S! v! h9" s) t' O& d) E9 X
    10# K" W' L, g2 V
    11
    / L% }6 B* z' b: T12% t: Z& @' C8 H: b
    13
    * q" Q' }0 j0 Y) h- R7 {6 i14
    5 C3 i& H) U: g- a" g% Z4 ]15$ R" a6 V, Z5 S0 r* V0 o/ `
    16
    - J- Z6 Z- u0 l; j( C+ I" O17
    # B/ L: i3 N( Q& y( V18) t! p- z; B1 R% p& Y. S
    19
    8 l5 O- j3 F* f7 n% ]& t20
    . K6 c' u5 v" X8 j' X" @2 a21
    ( t6 P6 \0 }9 u5 E+ L22
    ) W9 ~' Q! ?# c. }, K! E232 m: ~+ z/ c8 \! \8 ]2 w; ~  o) U
    24
    " g* o+ J; f  c/ E6 T1 C9 B25: [+ w) z* O- w1 E; a+ P+ d; W
    26
    3 k9 r7 a3 X, |) ?3 o  J/ p  G上面程序结果可以产生图2的效果。
    2 U2 q4 y$ K4 [" r9 b+ c  ^1 `$ a
    # o  o. |+ T  E# Iprint(compactness)这个变量,表示每个点到它聚类中心的距离平方和。较高紧凑都表明所有的点更靠近他们的聚类中心,较低 的紧凑度表明不同的聚类可能无法的很好区分。
    + \) B4 [& ~" c7 U  H
    9 ^* q$ H) l1 ]5 T# P" @6 V3 l当然,这个是非常依赖于x中的真实值。如果点与点之间最初的距离比较大,那我们就很难得到一个非常小的紧凑度。因此,把数据画出来,并按照聚类标签分配不同颜色,可以显示更多信息。
    2 M, W) [# Q& ^5 r5 t9 k% g  t  E2 P- h; N  n: G; ]
    3理解kmeans
    : L* Q/ \, c/ ^% w; v3 d8 i. w2 |kmeans是聚类众多常见期望最大化中一个具体的例子。简单来说,算法处理的过程如下所示:. i+ ^- \& ]+ ?: B
    1.从一些随机的聚类中心开始
    . L9 H  b1 ^% ^4 E2.一种重复直到收敛" t) h# {# S1 u5 P1 [1 z
    " {% o# i" ^5 G$ s( Q1 ^- X# v6 n
    期望步骤:把所有的数据点分配到离他们最近的聚类中心。
    9 N+ q1 L0 d, m- S; l; r/ F$ Y6 I最大化步骤:通过取出聚类中所有点的平均来更新聚类中心。7 w8 ~8 O' d% @6 {: {: ^

    5 |4 p( ]; M8 k" X) z1 M0 @它涉及到一个定义聚类中心位置的适应性函数最大化的过程。对于kmeans最大化是计算一个聚类中所有数据点的算数平均得到。0 Y: \% }' q9 u% s, `! r
    ————————————————" q$ f  _  v5 S% U7 K
    版权声明:本文为CSDN博主「紫钺-高山仰止」的原创文章,遵循CC 4.0 BY-SA版权协议,转载请附上原文出处链接及本声明。$ H4 v4 f7 l9 e2 F  e2 M2 L% U
    原文链接:https://blog.csdn.net/qq_43158059/article/details/1267890008 a& \: s5 l9 n: v2 W6 W
    1 P4 P& k; M, j8 T! `# I. v

    # q' r9 Y# G* w2 ~" Q' j
    zan
    转播转播0 分享淘帖0 分享分享0 收藏收藏0 支持支持0 反对反对0 微信微信
    您需要登录后才可以回帖 登录 | 注册地址

    qq
    收缩
    • 电话咨询

    • 04714969085
    fastpost

    关于我们| 联系我们| 诚征英才| 对外合作| 产品服务| QQ

    手机版|Archiver| |繁體中文 手机客户端  

    蒙公网安备 15010502000194号

    Powered by Discuz! X2.5   © 2001-2013 数学建模网-数学中国 ( 蒙ICP备14002410号-3 蒙BBS备-0002号 )     论坛法律顾问:王兆丰

    GMT+8, 2026-10-9 03:18 , Processed in 0.418177 second(s), 50 queries .

    回顶部