QQ登录

只需要一步,快速开始

 注册地址  找回密码
查看: 3446|回复: 0
打印 上一主题 下一主题

[其他资源] 【机器学习】无监督学习的概念,使用无监督学习发现数据的特点

[复制链接]
字体大小: 正常 放大
杨利霞        

5273

主题

82

听众

17万

积分

  • TA的每日心情
    开心
    2021-8-11 17:59
  • 签到天数: 17 天

    [LV.4]偶尔看看III

    网络挑战赛参赛者

    网络挑战赛参赛者

    自我介绍
    本人女,毕业于内蒙古科技大学,担任文职专业,毕业专业英语。

    群组2018美赛大象算法课程

    群组2018美赛护航培训课程

    群组2019年 数学中国站长建

    群组2019年数据分析师课程

    群组2018年大象老师国赛优

    跳转到指定楼层
    1#
    发表于 2022-9-14 16:37 |只看该作者 |正序浏览
    |招呼Ta 关注Ta
    【机器学习】无监督学习的概念,使用无监督学习发现数据的特点- |& T, M) W2 E; I' I) B
    8 Y' N. o+ {" d4 ]# o3 Z; A
    到目前位置,我们主要把注意力集中在监督学习的问题上,数据集中的每个数据点都有一个已知的标签或者目标值。然而如果面对没有已知的输出结果,或者没有人监督学习算法,我们要怎么做。2 |/ o! k8 k* w% ~$ N, Z

    + M3 f4 S2 _) c- T" h4 j% Q这就是无监督学习 。
    # X& h+ \/ P$ X' f( i: U0 v8 G" X( l1 P% ]# D; _6 d* b$ y8 \; K
    在无监督、非监督学习中了,学习过程仅使用输入数据,没有更多的指导信息,要求从这些数据中提取知识。我们已经讨论了非监督学习众多形式的一种降维。另一个普及的领域就是聚类分析。他的目的是吧数据分为相似元素组成的不同区域中。
    4 c8 e! _  c7 B2 U, H. L( M" a+ e6 j" ~5 p% ]
    在本章中,我们想要理解不同的聚类算法如何从简单到,无标记的数据集中提取特征。这些结构特征,可以用于特征处理,图像处理,甚至是作为无监督学习任务的预处理步骤。
    0 G+ ^- {$ D- r8 Y% O作为一个具体的例子,我们将对图像进行聚类,将色彩空间降到16位数。
    * y1 b+ r) y* \6 n3 B
    ' t+ M8 X! a" A. M: @. I解决的问题
    1 }  M* f! o; a/ M1.K-means聚类和期望最大化是什么?如何在opencv中实现这些算法。
    7 [1 x' C/ F+ M& d2.如何在层次树中使用聚类算法。他带来的好处有哪些。
    0 w- F4 e6 u8 F8 v" o) K' F* Z3.如何使用无监督学习,进行预处理,图像处理,分类。) P. X; [- e+ q1 q
    ' l% {) F& d( d5 [
    1 理解无监督学习
    " C* Q# Y- {/ T7 `8 E无监督学习可能有很多形式,但是他们的目标总是把原始数据转化为更加丰富,更加有意义的表示,这么做可以让人们更容易理解,也可以更方便的使用机器学习算法进行解析。
      f/ Q: S) F0 ~1 M; U无监督学习的应用包括一下应用:
      o* h9 \' Z% r$ l9 v1 v* {. S1降维:他接受一个许多特征的高维度数据表示,尝试对这些数据进行压缩,以使其主要特征,可以使用少量的携带高信息量的数据来表示。1 z- n: u# M) v* a
    2因子分析:用于找到导致被观察的到的数据的隐含因素或者未观察到的方面。
    0 z7 F6 v: m8 A6 x# b3 v3聚类分析:5 I9 S/ o9 H& T7 L; l- E, E: d6 D
    尝试把数据分成相似元素组成的不同组。4 \; {* ^. Q3 m5 [, J5 H0 s

    0 F3 J. w% J+ X( k" H- X无监督学习主要的挑战就是,如何确定一个算法是否出色,或者学习到什么有用内容,通常评估一个无监督学习算法结果的唯一方式是手动检查,并确定结果是否有意义。8 j+ E" a- M, m4 a3 M0 s
    ; e4 q$ P* i  G& o) U1 c* A
    话虽然如此,但是非监督学习,可以非常有,比如作为预处理或者特征提取的步骤。
    # V0 R* G: @" g6 z
    7 b$ f. [% ~8 k/ n! `. i, [2理解K-means聚类1 c: `2 l) L/ ~1 [8 Q9 z6 {- X5 p
    Opencv 提供最有用的聚类算法是k-means,因为它会从一个没有标记的多维度数据集中搜寻预设的K个聚类结果。& u% S6 a6 ?" p, Q! L/ t
    ' F1 t, N8 T* I0 T- {: n
    它通过两个简单的假设来完成最佳聚类了。( K8 T% x; u. P* z$ f
    1 每个聚类中心都是属于该类别的所有数据点的算术平均值9 {5 M5 W7 b5 u0 i! k
    2 聚类中的每一个点相对其他聚类中心,更靠近本类别的中心。6 o/ H( x/ K' G! t: i8 }" C; z

    2 C+ A5 o1 z9 A3 v' R1 g1 [2.1 实现第一个kmeans例子3 ~3 I  \9 |3 E- \
    首先,生成一个包含四个不同点集合的数据集。为了强调这是一个非监督的方法,我门在可视化将忽略哪些标签。使用matplotlib进行可视化。
    / J8 r" E( I2 w- M; }) p0 D+ z$ ^1 f' g$ i' G# W
    import matplotlib.pyplot as plt
    ( L4 W" z5 p) S) M0 @6 |import pylab
    8 l3 h) n' h' {2 r# A( T& Vfrom sklearn.datasets._samples_generator import make_blobs
    7 m, n! |3 }! v
    $ W1 y: Z: x/ _+ W. Cplt.style.use('ggplot')
    : ~" S: i- m  c8 _$ N$ o) D# z# mx,y=make_blobs(n_samples=300,centers=4,cluster_std=1.0,random_state=10)
    ; \; p4 y$ r, w; ~( l+ uplt.scatter(x[:,0],x[:,1],s=100)
    . u. D% t* G# L7 G; ]pylab.show()4 @  o% z- ^7 v2 C+ Q7 W: I

    , I! z1 S. Q) Z8 F* {- E2 v
    9 f7 J/ S& x( k# v* }' T- `8 d$ e1
    7 Z) F# @( B5 O2
    % e; Z9 \# w' T8 `6 U3' ~; k: P  F/ K
    4
    8 _" ?& K& O  w* L5 w+ f% e5
    7 b8 q  Q$ T* C7 l- a, h/ y61 i9 ~, n2 {9 k( c5 U
    7
    ! {  `9 G3 g3 E9 Z) N8  u$ k0 \4 f9 y7 I6 E8 t$ r
    96 t$ l; w3 i, F  G
    10/ d9 L/ M0 d6 C  s. B3 m* {
    ; V! }: f# N" i7 e& R: z) q
    我们创建一个四个不同区域的聚类,centers=4,一共300节点。. k0 N& Y9 H7 N9 H* K% x
    如上程序生成图像所示结果。9 E  S# ?+ K/ z% r
    尽管没有给数据分配目标标签,但直接使用肉眼还是可以看出来一共是四类。
      p! v" u& s, A, Q1 kkmeans就可以通过算法办到,无需任何关于目标的标签或者潜在的数据分布的信息。
    7 l$ j5 z4 @: i; x当然尽管,kmeans在opencv中是一个统计模型,不能调用api中的train和predict。相反,使用cv2.kmeans可以直接使用这个算法。。为了使用这个模型,我们需要指定一些参数,比如终止条件,和初始化标志。6 c0 e" g6 D8 ]0 \1 R' n
    7 E3 h/ O( p0 j5 y0 z+ D7 s- E9 l1 \
    我们让算法误差小于1.0(cv2.TERM_CRITERIA_EPS),或者已经 执行了十次迭代(cv2.TERM_CITTERIA_MAX_ITER)时候终止。: @( w5 I& x" H1 t/ D' c! k
    , V1 }4 U. N+ y4 {9 ?! l' p3 R! M% _
    ) j) ?  |% Y9 A( M2 [
    , u$ B5 u5 {# E# z7 S6 v6 o
    import matplotlib.pyplot as plt6 Z! s  E* M8 E" X
    import pylab7 S% H: Z9 l9 o: l( o# p
    from sklearn.datasets._samples_generator import make_blobs
    . c) @' j/ k$ |) e5 E. Mimport cv2
    - q+ _* ]# A4 b3 O- D4 P% C  T# Qimport numpy as np
    7 \3 G9 m! V6 y" K* g* W5 ^" ^2 w( w' o! z  I  a
    plt.style.use('ggplot')
    " H1 E- g! Z7 f. ~1 G6 N( Rx,y=make_blobs(n_samples=300,centers=4,cluster_std=1.0,random_state=10)- F6 z( q( v. {. l- e" A# H
    plt.scatter(x[:,0],x[:,1],s=100)
    0 l3 l8 ^. Q5 b( y2 Q) S# _( }3 w+ a6 x- e6 i

    2 E$ h! |$ o' @9 U  W4 P. m2 j1 }, ]criteria=(cv2.TERM_CRITERIA_EPS+cv2.TERM_CRITERIA_MAX_ITER,10,1.0)
      ]3 @4 C, O; Gflags=cv2.KMEANS_RANDOM_CENTERS
      ^: Z) C, G4 y" Z2 l' Ocompactness,labels,centers=cv2.kmeans(x.astype(np.float32),4,None,criteria,10,flags)
    6 r5 U" L7 `4 [8 eprint(compactness)/ f( A; R( U; S! b7 r
    * v( P" c  T) V/ K7 S5 p( B
    plt.scatter(x[:,0],x[:,1],c=labels,s=50,cmap='viridis')0 {. p- J+ p5 k+ s: Y2 S( o
    plt.scatter(centers[:,0],centers[:,1],c='black',s=200,alpha=0.5)
    3 F9 U: l4 D2 g! w4 s( @  P
    - t2 {, N9 }! F" A0 X# i6 G; T" Rpylab.show()/ H, s9 ^# U6 K

    ' V9 B3 @" z4 V: }) N% x/ k9 O2 d- i; I3 L* n" ]5 _/ u
    2 P# [, W. C& x7 G- f; R6 M4 x

    ) J, R% B( y7 G! @3 K: b6 t) D1 d- H2 C: Z7 j; y6 w" x

    ' |+ E0 b, J# n+ ?. O9 w9 [: @
    % V# A% [; E, H2 v7 |0 q. n; m17 m2 @) ~' i9 o' b
    2
      h$ x9 R6 B; g" O) v- J3- Y1 V1 {' w' k# y
    4# `8 M7 |/ T% h" O4 H& o
    5; n9 e% D3 z% e
    6* Q$ h/ s; p1 w& X- R5 e
    7% h5 c+ ^% Q7 O6 d) H; |
    8/ P4 w5 M! @! }( }3 ?( V  M
    9
    7 u4 s4 P  l5 `1 c! }10
    / A0 \$ N# g6 i1 e# F11
    $ b, C& A0 s- S12
      m$ p0 w2 k! k" @: o  D, j# R13
    4 k) u8 v, p* O; P1 ?14
    % C7 H6 f( i* o3 O( W8 h( r$ `+ [15
    ' e8 c5 J1 W  s. ?7 m* R161 }' f, _" ]* J5 Q% S' T
    172 k) z7 {- z, S. I" H; M
    185 Z- c% p' S- \& Z: r
    197 B2 m; g. I: ]. T! r
    20# f2 t# A6 @5 Q3 b+ Z
    21. g4 _+ ]- f8 V9 _" _/ _& _
    22  A9 s% I8 M  j- g6 X
    231 Y4 S4 Y, v3 V' x& t
    24
    : n$ U: j) a# I. \25
    3 J7 s/ T- g" q& f$ M) B/ @26
    1 ^) Z* t6 V/ b上面程序结果可以产生图2的效果。) m; z/ l% B! Z

    4 Y' n: E9 |: ?& _% M7 Lprint(compactness)这个变量,表示每个点到它聚类中心的距离平方和。较高紧凑都表明所有的点更靠近他们的聚类中心,较低 的紧凑度表明不同的聚类可能无法的很好区分。' z, v3 n0 X, r9 A) T. G& A9 r
    ! d$ u4 i2 X# Y0 ~# G" G! n
    当然,这个是非常依赖于x中的真实值。如果点与点之间最初的距离比较大,那我们就很难得到一个非常小的紧凑度。因此,把数据画出来,并按照聚类标签分配不同颜色,可以显示更多信息。! r, c% u: J- a2 M

    7 q* p+ Z0 X7 y( G  ?2 ~* L2 S3理解kmeans
    - e  E; a4 k. U) E8 akmeans是聚类众多常见期望最大化中一个具体的例子。简单来说,算法处理的过程如下所示:& W5 t7 a+ @' R$ n, ~8 |- V. T) j
    1.从一些随机的聚类中心开始. t0 k  j7 v- ~
    2.一种重复直到收敛
    + D  `) ~) D) x3 t. Q
    2 B0 z8 o4 w% I$ S期望步骤:把所有的数据点分配到离他们最近的聚类中心。
    6 V5 x. u) M7 j5 W/ K8 C最大化步骤:通过取出聚类中所有点的平均来更新聚类中心。- ?6 ^0 l  s5 T- u, n( [) Z

    $ o' e2 i2 m7 |4 J( Z, ~. r# @$ D- t它涉及到一个定义聚类中心位置的适应性函数最大化的过程。对于kmeans最大化是计算一个聚类中所有数据点的算数平均得到。  g# O& r; r& E6 b
    ————————————————8 i" |: r0 o0 D: b+ }
    版权声明:本文为CSDN博主「紫钺-高山仰止」的原创文章,遵循CC 4.0 BY-SA版权协议,转载请附上原文出处链接及本声明。9 @4 i% U- l# u6 F) z3 i
    原文链接:https://blog.csdn.net/qq_43158059/article/details/126789000; Z. I7 W5 S, @" v9 V
    + j  x, Y5 D3 L

    - c1 ]; A( p0 S/ U7 G7 i  s
    zan
    转播转播0 分享淘帖0 分享分享0 收藏收藏0 支持支持0 反对反对0 微信微信
    您需要登录后才可以回帖 登录 | 注册地址

    qq
    收缩
    • 电话咨询

    • 04714969085
    fastpost

    关于我们| 联系我们| 诚征英才| 对外合作| 产品服务| QQ

    手机版|Archiver| |繁體中文 手机客户端  

    蒙公网安备 15010502000194号

    Powered by Discuz! X2.5   © 2001-2013 数学建模网-数学中国 ( 蒙ICP备14002410号-3 蒙BBS备-0002号 )     论坛法律顾问:王兆丰

    GMT+8, 2026-8-24 04:54 , Processed in 0.491668 second(s), 51 queries .

    回顶部