QQ登录

只需要一步,快速开始

 注册地址  找回密码
查看: 3507|回复: 0
打印 上一主题 下一主题

[其他资源] 【机器学习】无监督学习的概念,使用无监督学习发现数据的特点

[复制链接]
字体大小: 正常 放大
杨利霞        

5273

主题

82

听众

17万

积分

  • TA的每日心情
    开心
    2021-8-11 17:59
  • 签到天数: 17 天

    [LV.4]偶尔看看III

    网络挑战赛参赛者

    网络挑战赛参赛者

    自我介绍
    本人女,毕业于内蒙古科技大学,担任文职专业,毕业专业英语。

    群组: 2018美赛大象算法课程

    群组: 2018美赛护航培训课程

    群组: 2019年 数学中国站长建

    群组: 2019年数据分析师课程

    群组: 2018年大象老师国赛优

    跳转到指定楼层
    1#
    发表于 2022-9-14 16:37 |只看该作者 |倒序浏览
    |招呼Ta 关注Ta
    【机器学习】无监督学习的概念,使用无监督学习发现数据的特点. z: e; m2 z: `/ ~0 R
    4 y, g2 o* z7 S2 R/ U9 E
    到目前位置,我们主要把注意力集中在监督学习的问题上,数据集中的每个数据点都有一个已知的标签或者目标值。然而如果面对没有已知的输出结果,或者没有人监督学习算法,我们要怎么做。
    * {0 |- i3 @) P4 ~) p- r2 t+ u. G0 r2 o
    这就是无监督学习 。8 X% _7 z4 p% \6 m; }
    % k+ d4 w' [: U$ u( V# x. J
    在无监督、非监督学习中了,学习过程仅使用输入数据,没有更多的指导信息,要求从这些数据中提取知识。我们已经讨论了非监督学习众多形式的一种降维。另一个普及的领域就是聚类分析。他的目的是吧数据分为相似元素组成的不同区域中。
    7 R- c7 l" C3 u4 g8 Q! ~# F! w3 T7 k0 ^9 _; v3 Z( n9 s; d
    在本章中,我们想要理解不同的聚类算法如何从简单到,无标记的数据集中提取特征。这些结构特征,可以用于特征处理,图像处理,甚至是作为无监督学习任务的预处理步骤。1 j! ~& H! p* k, e7 f6 v/ F
    作为一个具体的例子,我们将对图像进行聚类,将色彩空间降到16位数。
    + q& n" D' y8 }. Y1 c' k' p. B- n( j6 C$ x
    解决的问题/ P  Z7 t* B5 |5 y) o$ b
    1.K-means聚类和期望最大化是什么?如何在opencv中实现这些算法。
    6 n% F3 c) d6 r, H' P2.如何在层次树中使用聚类算法。他带来的好处有哪些。( b! V$ H5 g0 M: J3 o2 R
    3.如何使用无监督学习,进行预处理,图像处理,分类。
    . ^( i1 f) E6 X# U$ D/ n( h
    $ |3 V  o! O% Q5 W; |1 理解无监督学习5 g8 h% |& P% x. A# F* F4 M6 B1 o# s
    无监督学习可能有很多形式,但是他们的目标总是把原始数据转化为更加丰富,更加有意义的表示,这么做可以让人们更容易理解,也可以更方便的使用机器学习算法进行解析。
    * A" \/ Y+ |) k9 r6 l无监督学习的应用包括一下应用:
    1 v) @( x( e1 S- r1降维:他接受一个许多特征的高维度数据表示,尝试对这些数据进行压缩,以使其主要特征,可以使用少量的携带高信息量的数据来表示。' ~; Y; _/ A/ m( a% a; ~6 s, ]
    2因子分析:用于找到导致被观察的到的数据的隐含因素或者未观察到的方面。) ?8 X9 ]+ U# h! h
    3聚类分析:
    / c3 S; E8 F0 F尝试把数据分成相似元素组成的不同组。
      x5 A0 k2 X4 E- }/ V* ^  Y6 o, d0 D; K$ \7 N- P
    无监督学习主要的挑战就是,如何确定一个算法是否出色,或者学习到什么有用内容,通常评估一个无监督学习算法结果的唯一方式是手动检查,并确定结果是否有意义。9 f* P, a; J, |3 I9 R1 x3 v
    4 [/ M' @. U& z
    话虽然如此,但是非监督学习,可以非常有,比如作为预处理或者特征提取的步骤。2 u# M. `: {; s, e
    7 s" r6 |. V$ F7 i' ?& M: o
    2理解K-means聚类" c" I7 T; s9 v' i  N4 K
    Opencv 提供最有用的聚类算法是k-means,因为它会从一个没有标记的多维度数据集中搜寻预设的K个聚类结果。
    . g+ q8 p- f+ J0 [3 I- @3 `
    , }# [! Q8 J+ s: ]它通过两个简单的假设来完成最佳聚类了。
    - X* G+ `0 Y7 L& w( F1 每个聚类中心都是属于该类别的所有数据点的算术平均值& i3 {* ?. _6 i
    2 聚类中的每一个点相对其他聚类中心,更靠近本类别的中心。* g$ K7 \5 q5 F: P8 C

    / M- y6 Q+ i; N1 y! b' h& M% z8 q2.1 实现第一个kmeans例子/ V! ?, A, z) H  ~! S$ ]
    首先,生成一个包含四个不同点集合的数据集。为了强调这是一个非监督的方法,我门在可视化将忽略哪些标签。使用matplotlib进行可视化。% ~/ @- r( r/ {7 i* M4 W
    , s+ S  a8 Y. e. G( g
    import matplotlib.pyplot as plt
    1 ~, l7 s* W0 ?3 L+ z$ q: j9 Zimport pylab
    $ K" e1 r& f' X4 Lfrom sklearn.datasets._samples_generator import make_blobs, H, n4 F) u$ m3 u

    . R0 T2 l4 q6 v1 C" t9 Dplt.style.use('ggplot')
    7 x3 D; G( o$ R6 ~x,y=make_blobs(n_samples=300,centers=4,cluster_std=1.0,random_state=10)4 }  _  Y9 i2 G5 ]" e& ?: W" X% F) u
    plt.scatter(x[:,0],x[:,1],s=100)8 F0 P+ m" X, v; s( m4 n* P
    pylab.show()6 D9 f* u* U8 q4 r0 Z. I! u

    + x7 L& ^+ ~5 A2 q4 K3 c$ p5 k' U+ [9 q6 D+ }
    1
    + n; R. V$ U/ s" P  [; U7 [2* f  k. E' V/ S+ S3 a/ w
    3
    $ s8 |0 ]/ _. j# ~+ }. \* R, ]4$ @# T2 j1 Q' \, c
    5
    * ~) C* H6 p  O: x5 M67 N: A& _! e0 I0 \
    7) H2 K$ x. b# i- v& M
    8
    % L1 O! g$ a$ y0 C92 a& N9 N5 {9 D* e. L* r
    10; V  E$ H- _+ V; N2 b: H
    + e  ?- m/ V8 R4 q
    我们创建一个四个不同区域的聚类,centers=4,一共300节点。  |: R2 x+ Y4 l# V) u. [$ i
    如上程序生成图像所示结果。
    & j$ H  f- q6 _% _0 T6 Q尽管没有给数据分配目标标签,但直接使用肉眼还是可以看出来一共是四类。6 f. C' h7 E3 O1 J; r  D2 W
    kmeans就可以通过算法办到,无需任何关于目标的标签或者潜在的数据分布的信息。
    / y1 q- ]& }& P" @9 f6 p当然尽管,kmeans在opencv中是一个统计模型,不能调用api中的train和predict。相反,使用cv2.kmeans可以直接使用这个算法。。为了使用这个模型,我们需要指定一些参数,比如终止条件,和初始化标志。
    3 L& K$ F! F$ a5 ?% W. v/ C5 M5 K' m9 B
    我们让算法误差小于1.0(cv2.TERM_CRITERIA_EPS),或者已经 执行了十次迭代(cv2.TERM_CITTERIA_MAX_ITER)时候终止。
    * F9 S+ T5 E( w3 ^9 o* P3 g' E0 n# z' T

    3 r# L" {( V3 D- o4 y, H
    - [3 u4 F" B* p" ?$ ^, Gimport matplotlib.pyplot as plt
    , ?3 d2 l7 O- y* o. Rimport pylab8 y# P+ h" T% t9 m
    from sklearn.datasets._samples_generator import make_blobs
    7 [7 u, l, I2 z/ k# t" A' ]! L$ Dimport cv2
    ' E& O5 y# s" K" M1 L+ F1 N3 M6 Q2 nimport numpy as np
    . L+ L. h( [0 _7 H) t- [8 R. C  _$ B2 ]2 S
    plt.style.use('ggplot')6 q6 n! y8 u. n" [  ?$ ^; m8 f
    x,y=make_blobs(n_samples=300,centers=4,cluster_std=1.0,random_state=10)7 t3 J2 ]+ F' a  q8 U; j+ [+ Q
    plt.scatter(x[:,0],x[:,1],s=100)
    9 z2 K: O: J/ \! c0 d2 l
      l, [3 X& w2 g, k
    6 [: \3 L  z, ^/ x9 Dcriteria=(cv2.TERM_CRITERIA_EPS+cv2.TERM_CRITERIA_MAX_ITER,10,1.0)
    5 ^$ {0 E6 j: G- t6 W7 F0 K- a, sflags=cv2.KMEANS_RANDOM_CENTERS
    ' w# X+ H% S6 V3 Q) ]compactness,labels,centers=cv2.kmeans(x.astype(np.float32),4,None,criteria,10,flags)
    ( N1 ^: |, ]; Q: H8 bprint(compactness)
    1 D; T/ w0 I' d( E7 A! |8 f: q+ h7 d7 b2 [
    plt.scatter(x[:,0],x[:,1],c=labels,s=50,cmap='viridis')
    : f8 v: [# A. \  F. Vplt.scatter(centers[:,0],centers[:,1],c='black',s=200,alpha=0.5)9 x' G1 f: q* S; R4 }. N
    ' G! @4 X& [) t9 Y4 c
    pylab.show()
    1 \6 }$ n5 v( y2 s9 z
    8 k9 f! U  T1 G1 c: Q0 K; K
    ; ?  G8 l0 s& T7 E- `* R* ^7 ?5 c" d2 F1 Z5 W& s

    2 \) e1 b3 _& \
    4 k% L7 w1 m0 x0 i; B# Y
    " \& `! r, C2 W. K* Z: Z
      x4 A4 ]+ ^5 z. W- @# g1
    ; t: k1 _: G3 E( H4 t- v4 |+ L2
    3 j8 C( B( {2 t4 p, W' Z( J3
    % ?  S/ `& i$ J45 K+ K: m. c5 k
    5
    . ?+ [& o* l, z0 K2 u( r$ J% P# C6: O4 m4 h" L6 U
    7
    1 f4 b" n! W' C0 d' K+ O: z! H8% h! p8 D9 d1 y+ _6 A- k
    9
    4 q2 A6 w- k/ e10
    ; w0 t7 |- u1 }, T) x11
    # R0 |  W, h) O. e12( w7 H: r1 r4 ~: W
    13
    3 P1 R( k3 _' e& k/ \. w- r  ~- L149 p$ F; }3 W  O( c5 X  b
    151 l7 }- Q2 Q" A% N& ~& p
    16
      t% |. y7 X; [( C( w3 A% B17
    ! v! E6 X$ e* ~) i' C18
    0 O  }, Q. _3 o5 G19
    ' Q9 g1 {% {( s200 Y9 U1 S  Q! G0 ]6 W: O
    21
    $ ?2 _4 ^* K* ~; x22% ^8 P9 Z1 P, f; [
    23
    9 M* r: h& Z. t0 e% d, c248 s7 x" C2 N6 [2 g/ F
    250 `0 B. [, s7 }8 T8 J3 L/ V
    26+ c+ i  N4 R% J; ]2 I) W/ y0 z
    上面程序结果可以产生图2的效果。$ @) k( f7 S; o" g
    * H* y, n2 k7 x; h. I
    print(compactness)这个变量,表示每个点到它聚类中心的距离平方和。较高紧凑都表明所有的点更靠近他们的聚类中心,较低 的紧凑度表明不同的聚类可能无法的很好区分。2 I0 W( g) e" T/ S. M% m- m$ i- p
    3 C9 ?' \% g, L$ j
    当然,这个是非常依赖于x中的真实值。如果点与点之间最初的距离比较大,那我们就很难得到一个非常小的紧凑度。因此,把数据画出来,并按照聚类标签分配不同颜色,可以显示更多信息。
    $ L/ l; D& i4 k9 q9 k/ t# N" @! D  R( y8 ?' T3 Q7 X
    3理解kmeans" q7 x5 t7 H" r0 b5 P9 I$ v
    kmeans是聚类众多常见期望最大化中一个具体的例子。简单来说,算法处理的过程如下所示:
    3 ]2 C' y1 C6 Z1 s  w1.从一些随机的聚类中心开始# l8 T0 g- }6 k/ n5 z6 P# j
    2.一种重复直到收敛9 Z: P! k* B. s7 T) A$ o
    1 e( H' j8 v9 V6 h
    期望步骤:把所有的数据点分配到离他们最近的聚类中心。. N+ M0 E$ w! ~
    最大化步骤:通过取出聚类中所有点的平均来更新聚类中心。1 T5 U" ?$ y2 ^8 s

    0 t' v2 I$ n6 T3 I它涉及到一个定义聚类中心位置的适应性函数最大化的过程。对于kmeans最大化是计算一个聚类中所有数据点的算数平均得到。# D1 t) Q- |" o- ^7 R; \$ Y/ G4 e
    ————————————————
    / n$ ~1 r9 N. F9 i) o5 @1 _版权声明:本文为CSDN博主「紫钺-高山仰止」的原创文章,遵循CC 4.0 BY-SA版权协议,转载请附上原文出处链接及本声明。
    ; C4 {5 \7 q( I' s% N+ Q原文链接:https://blog.csdn.net/qq_43158059/article/details/126789000+ T% {# W/ f# ?/ v

    & A% X1 [/ {7 _7 V% |) {- s5 {# }) N! _3 @
    zan
    转播转播0 分享淘帖0 分享分享0 收藏收藏0 支持支持0 反对反对0 微信微信
    您需要登录后才可以回帖 登录 | 注册地址

    qq
    收缩
    • 电话咨询

    • 04714969085
    fastpost

    关于我们| 联系我们| 诚征英才| 对外合作| 产品服务| QQ

    手机版|Archiver| |繁體中文 手机客户端  

    蒙公网安备 15010502000194号

    Powered by Discuz! X2.5   © 2001-2013 数学建模网-数学中国 ( 蒙ICP备14002410号-3 蒙BBS备-0002号 )     论坛法律顾问:王兆丰

    GMT+8, 2026-10-9 09:38 , Processed in 0.341991 second(s), 51 queries .

    回顶部