QQ登录

只需要一步,快速开始

 注册地址  找回密码
查看: 3501|回复: 0
打印 上一主题 下一主题

[其他资源] 【机器学习】无监督学习的概念,使用无监督学习发现数据的特点

[复制链接]
字体大小: 正常 放大
杨利霞        

5273

主题

82

听众

17万

积分

  • TA的每日心情
    开心
    2021-8-11 17:59
  • 签到天数: 17 天

    [LV.4]偶尔看看III

    网络挑战赛参赛者

    网络挑战赛参赛者

    自我介绍
    本人女,毕业于内蒙古科技大学,担任文职专业,毕业专业英语。

    群组: 2018美赛大象算法课程

    群组: 2018美赛护航培训课程

    群组: 2019年 数学中国站长建

    群组: 2019年数据分析师课程

    群组: 2018年大象老师国赛优

    跳转到指定楼层
    1#
    发表于 2022-9-14 16:37 |只看该作者 |倒序浏览
    |招呼Ta 关注Ta
    【机器学习】无监督学习的概念,使用无监督学习发现数据的特点  z0 B' k$ f4 Z1 @4 I

    ; H6 W$ _. Z* o5 h# o到目前位置,我们主要把注意力集中在监督学习的问题上,数据集中的每个数据点都有一个已知的标签或者目标值。然而如果面对没有已知的输出结果,或者没有人监督学习算法,我们要怎么做。% \1 R7 F; \* J, g( C* p3 e

    ; S% ~( N( y$ E3 O* d# i) d这就是无监督学习 。' `" E! g; r& ?9 d$ C

    * C, J2 D5 ^: H% H# Y- a" z* m在无监督、非监督学习中了,学习过程仅使用输入数据,没有更多的指导信息,要求从这些数据中提取知识。我们已经讨论了非监督学习众多形式的一种降维。另一个普及的领域就是聚类分析。他的目的是吧数据分为相似元素组成的不同区域中。1 V. {2 e* @, N7 ?! S0 r1 ^
    + `$ i4 l* y- _4 m# `# e
    在本章中,我们想要理解不同的聚类算法如何从简单到,无标记的数据集中提取特征。这些结构特征,可以用于特征处理,图像处理,甚至是作为无监督学习任务的预处理步骤。* G0 [4 p3 O& V2 {) Y) N$ q/ P
    作为一个具体的例子,我们将对图像进行聚类,将色彩空间降到16位数。  k3 T2 Q# `5 c6 j  Q5 n
    ' Q5 N: Y0 J" h9 Q/ B
    解决的问题% w# H3 p; w" Z* E6 P4 E
    1.K-means聚类和期望最大化是什么?如何在opencv中实现这些算法。
    ' ?6 a0 k; s9 G9 r& n2.如何在层次树中使用聚类算法。他带来的好处有哪些。
    1 u) l) X$ {! J% {' D$ S" M5 d3.如何使用无监督学习,进行预处理,图像处理,分类。% e. k4 p1 N: y) ?8 g; p. _
    . P  s1 T# y2 w. A7 ]) J5 v
    1 理解无监督学习& k0 N! a1 \! J2 Y: K% L
    无监督学习可能有很多形式,但是他们的目标总是把原始数据转化为更加丰富,更加有意义的表示,这么做可以让人们更容易理解,也可以更方便的使用机器学习算法进行解析。
    , V2 a: W0 B( z% C无监督学习的应用包括一下应用:
    0 \1 E; k! n9 L: {1 u1降维:他接受一个许多特征的高维度数据表示,尝试对这些数据进行压缩,以使其主要特征,可以使用少量的携带高信息量的数据来表示。
    5 O7 [- U# Z* P% N2因子分析:用于找到导致被观察的到的数据的隐含因素或者未观察到的方面。
    6 K2 F! x3 y% [* [/ C3聚类分析:
      I3 g: _' ?  w1 a5 v尝试把数据分成相似元素组成的不同组。* X- J. [. a2 j" e) O
    % Z# |! u# J* H3 k, `% S% Q
    无监督学习主要的挑战就是,如何确定一个算法是否出色,或者学习到什么有用内容,通常评估一个无监督学习算法结果的唯一方式是手动检查,并确定结果是否有意义。
    ! s- V- n1 A7 N& f7 Y
    ' \3 h6 s! ?  z: G6 x9 y! K话虽然如此,但是非监督学习,可以非常有,比如作为预处理或者特征提取的步骤。: A4 a/ `& ^1 }8 c- s+ h6 s+ B
    , [! B# y) c0 S' Q* V& K
    2理解K-means聚类
    ' ?+ N9 v+ k3 IOpencv 提供最有用的聚类算法是k-means,因为它会从一个没有标记的多维度数据集中搜寻预设的K个聚类结果。
    / i) Y" C3 E/ Y
    # G+ Y$ G+ e. U: A) k它通过两个简单的假设来完成最佳聚类了。. R7 _( W: k7 q( d0 K
    1 每个聚类中心都是属于该类别的所有数据点的算术平均值, ^0 R0 z/ U+ N4 q0 y3 E( i; m' \1 t
    2 聚类中的每一个点相对其他聚类中心,更靠近本类别的中心。
    # L7 f4 k* d* p  E, }0 A
    7 O0 v4 B7 p9 m2 L7 h" i) a, p2.1 实现第一个kmeans例子0 s! M& n# r" X, @3 S0 k. g( l- _
    首先,生成一个包含四个不同点集合的数据集。为了强调这是一个非监督的方法,我门在可视化将忽略哪些标签。使用matplotlib进行可视化。
    " C; X. }9 t9 \; M& v# c
    7 p( o; o) P4 H8 Ximport matplotlib.pyplot as plt
    % T! O9 B. Q+ y; H+ k* zimport pylab1 y  O$ C3 M% H* ~$ @& v
    from sklearn.datasets._samples_generator import make_blobs* C9 G; ?" u& g* I1 Z0 a

    : H9 e% D  G+ Y3 d& \( w1 g. @( oplt.style.use('ggplot')
    ' `! N4 ~5 K, \7 ?1 }x,y=make_blobs(n_samples=300,centers=4,cluster_std=1.0,random_state=10)5 h' j3 O. b/ W0 q' o/ ]
    plt.scatter(x[:,0],x[:,1],s=100)
    2 R- |& `" E7 I' ?0 X! N, [pylab.show()
    3 N3 _7 ^) |# t/ q/ @" e; ?6 c; C! p  x! V8 A* i6 }0 m
    % b3 t7 H& [- }
    1  q# ]1 k7 [) l8 r: N
    2
    % [) e. q) G2 I! H3
    + N; D( H. |* |! N0 @4
    # `  X( N. q/ D5
    # R5 n2 J4 i7 U5 V; F) ~61 g9 E% P+ B+ D
    7
    * p9 W3 {  S0 L* b8 z" v- \: B8
    2 B4 {$ z* d5 Y90 n. O( l  P) \0 R" p5 Y/ O: z
    109 e7 [$ [  W' m) \
    1 ~/ B0 V: W; g2 I
    我们创建一个四个不同区域的聚类,centers=4,一共300节点。
    " a* [/ K+ Z  S7 L. S/ X如上程序生成图像所示结果。
    7 k: h. e4 ?- c# K9 P( C6 u; R4 `5 u尽管没有给数据分配目标标签,但直接使用肉眼还是可以看出来一共是四类。
    5 _6 E& o( n' t% o4 jkmeans就可以通过算法办到,无需任何关于目标的标签或者潜在的数据分布的信息。
    1 A/ g5 _1 _# }- }当然尽管,kmeans在opencv中是一个统计模型,不能调用api中的train和predict。相反,使用cv2.kmeans可以直接使用这个算法。。为了使用这个模型,我们需要指定一些参数,比如终止条件,和初始化标志。
    , f) R2 M# o/ S0 ~
    / w4 q7 b' ~2 f( P+ A* i( M我们让算法误差小于1.0(cv2.TERM_CRITERIA_EPS),或者已经 执行了十次迭代(cv2.TERM_CITTERIA_MAX_ITER)时候终止。
    ; U1 g5 M3 Z7 s% ^8 x1 @
    % s5 y3 a8 E! z8 m
    4 G6 W" i8 z) H9 d& j5 ^" h1 E
    ( K! _* H% F2 h4 A& S( ]( qimport matplotlib.pyplot as plt) x" G' u3 G* _& x  j' G
    import pylab
    + Y! Y3 C# m1 x4 \( _/ q2 H' ufrom sklearn.datasets._samples_generator import make_blobs
    ' z1 E3 C  h* {; `3 ]' pimport cv2
    2 A( I$ b! L9 C, _$ S3 Iimport numpy as np
    : T7 @) ^& h! u' r! [4 d/ |3 p; r5 F3 Q! o6 g
    plt.style.use('ggplot')' x4 M" e; J+ d$ C# m
    x,y=make_blobs(n_samples=300,centers=4,cluster_std=1.0,random_state=10)
    4 p0 e' y8 h5 R  z9 K; Q9 D3 hplt.scatter(x[:,0],x[:,1],s=100)" B; i2 ~- K+ v( D3 _5 O

    : \  H& C/ [" g1 u2 N5 k! f5 t, Y- o+ R4 I% Q
    criteria=(cv2.TERM_CRITERIA_EPS+cv2.TERM_CRITERIA_MAX_ITER,10,1.0)( P' @. v( U( e) B
    flags=cv2.KMEANS_RANDOM_CENTERS, o% [" j2 s8 E) h0 m( U' b6 C7 R
    compactness,labels,centers=cv2.kmeans(x.astype(np.float32),4,None,criteria,10,flags)' @+ x; N; J* y
    print(compactness)' d" ^/ i) V* ~
    ' M) {3 v) z* y
    plt.scatter(x[:,0],x[:,1],c=labels,s=50,cmap='viridis')
    . E& T- Z* I: {/ n; L% Wplt.scatter(centers[:,0],centers[:,1],c='black',s=200,alpha=0.5)1 N4 h. r8 ~, z5 }$ v; V
    , b, g* \) ^: {1 W- F$ C( z0 p
    pylab.show()
    ( z6 ^! U+ L% Z' l/ |8 }
      K6 t5 d) H: U; n( ?' p* _  Y+ b* N4 X
    / T+ N% G# Q4 k- N
    ( J+ V+ R+ e" ~* f2 Q' _5 ?6 z( R% X% r/ `* w: W8 |

    % t" ?& H  P8 L
    2 q' r2 ]: ^+ i% F: H6 a# u  [9 m, R2 s+ Q9 O* m2 g
    15 n' t4 k$ L8 f4 S# z5 T9 D
    2. C, P0 V+ S$ b
    3/ `7 S* }/ L9 u9 X" h
    4- ]" w7 h$ ^! [' \  a% G
    5
    + `# a. P4 B* Y6 i- _: W6
    : y/ d& l( z& z8 }! Q7
    3 [$ i9 q9 y2 |. d) \8( d% f4 I( i8 n1 [  q
    99 E! O7 W$ e) ~4 t0 I' a
    10# y3 K9 A* m. w- h7 I& s& u0 r1 B
    11
    / o6 Q4 X( ]. N12" S. h5 H* _& p. m
    13
    3 b, B- P3 F( ^# u& z14
    8 u5 ^% K5 z# x15
    " ]* }, F( h# k' L: f16- v; @. _5 E! E% W0 s/ q+ {. U+ z
    170 O8 v" C$ W* b: P) a. ]' X
    18
    2 R0 i: o- F$ c5 H5 _19" [3 `% Y4 |" c+ C+ K' c* O) X
    20) K6 t6 z, v$ H* B7 z
    21
    ( |/ M/ V) y# g3 p( P22# w, m- y9 I% g! V5 ~
    23
    ! \1 }8 N+ S5 r9 X$ I24
    : e2 H0 s3 N- F1 q+ g- r' P; C25
    ) ^$ h" h, q$ l26
    / n9 F+ Q2 j0 c' R1 d上面程序结果可以产生图2的效果。
    ' E) y) s/ J, m6 i8 l7 M0 Y! n& n4 z, L, M
    print(compactness)这个变量,表示每个点到它聚类中心的距离平方和。较高紧凑都表明所有的点更靠近他们的聚类中心,较低 的紧凑度表明不同的聚类可能无法的很好区分。. Q1 M: ~; _. r6 O; A, x( H

    , M8 Q2 v9 F" S当然,这个是非常依赖于x中的真实值。如果点与点之间最初的距离比较大,那我们就很难得到一个非常小的紧凑度。因此,把数据画出来,并按照聚类标签分配不同颜色,可以显示更多信息。
    0 x5 \" [& b  i; n1 W, c4 N  m' h( d# i
    3理解kmeans
    5 N# O7 S) B6 C+ w. P8 V2 D+ Qkmeans是聚类众多常见期望最大化中一个具体的例子。简单来说,算法处理的过程如下所示:. R3 ~2 Q7 v5 D; y3 c
    1.从一些随机的聚类中心开始( h* y! b/ u4 A: z
    2.一种重复直到收敛
    / }7 ^& s1 G% _' u3 L  I/ p
    , C# j- e8 j# {. s期望步骤:把所有的数据点分配到离他们最近的聚类中心。7 @4 L0 x, r. S( m- m
    最大化步骤:通过取出聚类中所有点的平均来更新聚类中心。& L/ S) d9 l6 k; w& A% [  G

    % m) {9 u/ H& |* q, \它涉及到一个定义聚类中心位置的适应性函数最大化的过程。对于kmeans最大化是计算一个聚类中所有数据点的算数平均得到。4 S7 t& F; w0 D1 D4 n$ f2 V
    ————————————————3 N* O8 D1 t1 P  o: [
    版权声明:本文为CSDN博主「紫钺-高山仰止」的原创文章,遵循CC 4.0 BY-SA版权协议,转载请附上原文出处链接及本声明。/ Q0 Q# L: r  W7 c1 H" ]# E
    原文链接:https://blog.csdn.net/qq_43158059/article/details/126789000. I1 T5 }( ^- ~

    , n  j# m$ H* x! `( ~* _+ Y" c# c$ ~/ D5 v8 L
    zan
    转播转播0 分享淘帖0 分享分享0 收藏收藏0 支持支持0 反对反对0 微信微信
    您需要登录后才可以回帖 登录 | 注册地址

    qq
    收缩
    • 电话咨询

    • 04714969085
    fastpost

    关于我们| 联系我们| 诚征英才| 对外合作| 产品服务| QQ

    手机版|Archiver| |繁體中文 手机客户端  

    蒙公网安备 15010502000194号

    Powered by Discuz! X2.5   © 2001-2013 数学建模网-数学中国 ( 蒙ICP备14002410号-3 蒙BBS备-0002号 )     论坛法律顾问:王兆丰

    GMT+8, 2026-10-8 06:29 , Processed in 0.416550 second(s), 50 queries .

    回顶部