QQ登录

只需要一步,快速开始

 注册地址  找回密码
查看: 3445|回复: 0
打印 上一主题 下一主题

[其他资源] 【机器学习】无监督学习的概念,使用无监督学习发现数据的特点

[复制链接]
字体大小: 正常 放大
杨利霞        

5273

主题

82

听众

17万

积分

  • TA的每日心情
    开心
    2021-8-11 17:59
  • 签到天数: 17 天

    [LV.4]偶尔看看III

    网络挑战赛参赛者

    网络挑战赛参赛者

    自我介绍
    本人女,毕业于内蒙古科技大学,担任文职专业,毕业专业英语。

    群组2018美赛大象算法课程

    群组2018美赛护航培训课程

    群组2019年 数学中国站长建

    群组2019年数据分析师课程

    群组2018年大象老师国赛优

    跳转到指定楼层
    1#
    发表于 2022-9-14 16:37 |只看该作者 |倒序浏览
    |招呼Ta 关注Ta
    【机器学习】无监督学习的概念,使用无监督学习发现数据的特点
    : W4 q& E) Y9 m1 x0 l
    # y( A4 R, v; |( X8 @/ E到目前位置,我们主要把注意力集中在监督学习的问题上,数据集中的每个数据点都有一个已知的标签或者目标值。然而如果面对没有已知的输出结果,或者没有人监督学习算法,我们要怎么做。
    ! j- D) A4 o/ W( I* }+ Z3 m' z# y3 \6 k  \2 x* S
    这就是无监督学习 。+ |5 t( N6 {3 g: r3 T+ v

    " M; z5 T* _- l+ G& f0 m( [在无监督、非监督学习中了,学习过程仅使用输入数据,没有更多的指导信息,要求从这些数据中提取知识。我们已经讨论了非监督学习众多形式的一种降维。另一个普及的领域就是聚类分析。他的目的是吧数据分为相似元素组成的不同区域中。: b) f. @. t3 |( k

    3 X5 f4 r% s/ ^  K% P在本章中,我们想要理解不同的聚类算法如何从简单到,无标记的数据集中提取特征。这些结构特征,可以用于特征处理,图像处理,甚至是作为无监督学习任务的预处理步骤。
    " G8 ^& [- B( h; e! O8 d, y作为一个具体的例子,我们将对图像进行聚类,将色彩空间降到16位数。) P2 p: A. h  v1 B) E1 I: u

    ' R- S9 U- a5 p' X- X解决的问题/ X/ A0 o7 V. Y" \( C  [
    1.K-means聚类和期望最大化是什么?如何在opencv中实现这些算法。
    - }+ T5 V. {2 S$ v2.如何在层次树中使用聚类算法。他带来的好处有哪些。% T9 p; u+ q; T* d& }: _$ B
    3.如何使用无监督学习,进行预处理,图像处理,分类。
    / T' o. H  h" M5 N' K# F
    ) `+ K- r: V# k7 S) w( e& h5 L1 理解无监督学习
    " S, X. M: `5 D! W' n无监督学习可能有很多形式,但是他们的目标总是把原始数据转化为更加丰富,更加有意义的表示,这么做可以让人们更容易理解,也可以更方便的使用机器学习算法进行解析。
    , B" M8 s* G/ M) X/ ~! b5 A9 \9 u% k1 F无监督学习的应用包括一下应用:
    - H: ^* v0 b) p1降维:他接受一个许多特征的高维度数据表示,尝试对这些数据进行压缩,以使其主要特征,可以使用少量的携带高信息量的数据来表示。
    - {+ k8 u# A* @, ^1 `& Q, {2因子分析:用于找到导致被观察的到的数据的隐含因素或者未观察到的方面。
    * J. Z/ ~2 L" y0 ]7 _3聚类分析:* U: \5 d! d# }% a
    尝试把数据分成相似元素组成的不同组。
    * ?# O3 M) ^( @6 z7 {
    $ G6 j2 T4 i" Q3 Q' w( g- n无监督学习主要的挑战就是,如何确定一个算法是否出色,或者学习到什么有用内容,通常评估一个无监督学习算法结果的唯一方式是手动检查,并确定结果是否有意义。
    + ]4 S- D# D. t0 {8 o: S8 J
    & p1 M4 v4 n: i' F9 M话虽然如此,但是非监督学习,可以非常有,比如作为预处理或者特征提取的步骤。$ h7 G1 B0 j4 ~/ E* S

    1 [3 |0 L  O  |: x2 q" l4 s2理解K-means聚类% ^! ^/ |" c& y  z! {" f/ ]4 t* F
    Opencv 提供最有用的聚类算法是k-means,因为它会从一个没有标记的多维度数据集中搜寻预设的K个聚类结果。
    3 [1 M2 g. n& n* X: a6 T; k0 f8 _' j8 t- b9 L7 O
    它通过两个简单的假设来完成最佳聚类了。
    $ d5 T0 j1 [- U" [) l  O% V1 每个聚类中心都是属于该类别的所有数据点的算术平均值
    * [+ |) D' a1 `( |  s6 }1 B2 聚类中的每一个点相对其他聚类中心,更靠近本类别的中心。4 Y3 z) t/ T( A5 b! O
    6 e" O! K) d9 d4 q$ J
    2.1 实现第一个kmeans例子" z. @. u  L3 V  m7 `# G
    首先,生成一个包含四个不同点集合的数据集。为了强调这是一个非监督的方法,我门在可视化将忽略哪些标签。使用matplotlib进行可视化。
    : V2 i, R' @5 e' J
    % B$ L1 U/ D9 u' p" yimport matplotlib.pyplot as plt
    0 U0 J2 J* `9 `, s& i6 `import pylab
      f2 |5 L1 e: `" w! C5 e- ^% `5 [0 cfrom sklearn.datasets._samples_generator import make_blobs, ~- \: F* [2 i2 H

    : `5 L$ T8 _& B4 T" h. xplt.style.use('ggplot')
    ; [$ f" x* V/ Q) M/ i. h' Xx,y=make_blobs(n_samples=300,centers=4,cluster_std=1.0,random_state=10)
    ! G* W. T! t' }plt.scatter(x[:,0],x[:,1],s=100)
    ! O& F& _$ n$ E) Ipylab.show()
      F4 e. z+ Q9 Q0 S- g  H1 D8 K! o- _4 K
    ( N! x0 R2 D9 d% f" }) Q
    1$ b. P7 m* R6 s
    2- \1 e% U3 g4 y0 g0 W$ C% M, n
    3& p: Y5 l& f5 J/ j: k4 e" b
    4
    ' [4 `7 ]# [* g* Z/ B; w- ~* F51 e1 z2 t' Z: U: ?6 j
    6" F8 d: u; p& E$ n
    7+ q) M* \2 ^: K
    8
    8 c! S( J* D! G2 d" h; T" J9
    3 q- {# |0 G: l3 @10! K1 @0 I& p$ [
    # a6 A" }1 [7 b! Y# b8 C0 w$ i
    我们创建一个四个不同区域的聚类,centers=4,一共300节点。
    6 y9 O& ?- j2 u5 ?如上程序生成图像所示结果。
    5 u& n* Z) b% Z. q: m尽管没有给数据分配目标标签,但直接使用肉眼还是可以看出来一共是四类。( \, H4 s. y$ i2 J  u+ q; v3 C
    kmeans就可以通过算法办到,无需任何关于目标的标签或者潜在的数据分布的信息。0 s3 V4 E/ h; y3 Z% c
    当然尽管,kmeans在opencv中是一个统计模型,不能调用api中的train和predict。相反,使用cv2.kmeans可以直接使用这个算法。。为了使用这个模型,我们需要指定一些参数,比如终止条件,和初始化标志。& i1 \/ ?4 G- A4 `9 o9 w- B4 D7 I: [

    ; Q8 p0 t& B7 X% C: X+ R我们让算法误差小于1.0(cv2.TERM_CRITERIA_EPS),或者已经 执行了十次迭代(cv2.TERM_CITTERIA_MAX_ITER)时候终止。
    . C  {+ q& j4 n, ~. x- Y4 `- z9 F9 g3 k' R+ o( G% ]# }
    ( |# c* g. [# b1 C, W
    3 z/ X6 N$ j" P8 R2 t* {. N: h$ f
    import matplotlib.pyplot as plt; m. z) c7 ~5 U/ C. O0 c
    import pylab
      W- ^: T+ h6 g$ s" M5 dfrom sklearn.datasets._samples_generator import make_blobs
      O' y) B- z) [1 Ximport cv22 W# \$ ^& b" b# l  B5 q( O- {
    import numpy as np, [6 j( \% S' ~7 l% A  g# I
    2 Y3 c7 k9 {" ?+ t# D1 z
    plt.style.use('ggplot'); l4 B5 o1 ]" g  q  i$ r, T
    x,y=make_blobs(n_samples=300,centers=4,cluster_std=1.0,random_state=10)  i, q, W/ a- A0 C$ z! g1 J
    plt.scatter(x[:,0],x[:,1],s=100)- y  b2 c4 a8 w9 O
    3 [4 ~* r! S4 Q4 g- W

    + i+ |' C' @1 E3 Q& D* C# w0 _criteria=(cv2.TERM_CRITERIA_EPS+cv2.TERM_CRITERIA_MAX_ITER,10,1.0)/ R, ]# ~) n8 a0 Q  c* W, ~7 B7 }
    flags=cv2.KMEANS_RANDOM_CENTERS
    . {9 w$ c+ l: u  pcompactness,labels,centers=cv2.kmeans(x.astype(np.float32),4,None,criteria,10,flags)1 K# }% `' {( M+ B0 ?2 l, ~
    print(compactness)  G6 n) A9 j; N; b2 y0 `
    # @. T+ k( x2 Z, C- T
    plt.scatter(x[:,0],x[:,1],c=labels,s=50,cmap='viridis')- e/ |- Y! w. F
    plt.scatter(centers[:,0],centers[:,1],c='black',s=200,alpha=0.5)3 a5 t! K% Q8 k9 f

      R: [& T6 i7 y% N5 ^pylab.show()
    . X) o! ?# t2 o9 h6 G0 {4 S
    $ r) q$ P9 P  g* d/ F; O
    5 q+ @2 j' \$ Q2 r9 S, b& P: a, h" i* t5 Y
    # P, R- w# j0 k0 S
    8 K3 }0 i" S8 d' F$ u* I( F6 ~& [
    9 }9 l3 x1 X& M1 Y- K3 \2 L  ^
    7 \% K5 X- S+ T4 m! P, y/ a
    1
      u2 F: R" e2 w7 ]2
    % G' o: V/ v  r, h% w" i" ?3
    9 t# N% b% t- T) M3 h1 H* J) B4
    ' {3 Z) X$ L$ N& a0 A( P  w2 H5) s/ O" ]  \# s8 k- ?0 d! C
    6% y' U4 _1 g9 @
    7
    . [/ p9 z/ @7 Y8- q; m: M+ v- U
    9
    5 f$ {% L9 {/ s9 C, G; c105 R) ~" t; ]) V; T( p& c. ~& E1 @
    11
    . ]+ A; D1 D* {* A7 T7 r127 J: E9 U2 U6 Q  k
    13
    0 U0 A5 ?) D9 Y7 g5 T14+ R7 n3 Y: r0 ?" I4 u+ ~+ [9 [4 z
    155 s, n9 ]) e7 o0 n7 i$ |0 G( \
    168 P7 N& |0 P& V* o4 g8 _' n0 w8 _
    177 S7 G4 G+ |0 H. l' X9 z
    18) @) \* ?# }( b$ D; l
    19
    & C# j1 M2 I' s; l9 d# P( G20
      k9 j8 R" ]2 t1 U) ^1 U218 l% ~& O! D% w) `0 ?7 k: |
    22
    4 |( j* x% w- n23
    8 O  j  G$ B) d, }' n% q24
    & _0 D# U& p8 q/ |  n. c25
    + Y- G) w4 d$ m266 _  k6 B$ d- c5 P+ O8 X9 x
    上面程序结果可以产生图2的效果。
    0 R+ y+ \" y( k8 Q3 Q+ L1 F
    + h* s; d! |% k' D6 }8 N+ Rprint(compactness)这个变量,表示每个点到它聚类中心的距离平方和。较高紧凑都表明所有的点更靠近他们的聚类中心,较低 的紧凑度表明不同的聚类可能无法的很好区分。. ~8 Z1 H7 d9 e  e  n+ h

    7 J% T% ~/ n( t5 C6 @" A; N当然,这个是非常依赖于x中的真实值。如果点与点之间最初的距离比较大,那我们就很难得到一个非常小的紧凑度。因此,把数据画出来,并按照聚类标签分配不同颜色,可以显示更多信息。3 ]0 A! z7 \7 X7 F; h2 q( z

    7 N% Q/ ~& r5 z- i! C1 N  k3 d3理解kmeans
    9 J( j3 M" F4 R- M+ s! M9 |kmeans是聚类众多常见期望最大化中一个具体的例子。简单来说,算法处理的过程如下所示:# t3 [/ _' }- F* Q2 ~, L# z
    1.从一些随机的聚类中心开始
    : V4 O; ]8 S; a7 T2.一种重复直到收敛
    4 W! d0 \+ X' q; x  G1 w
    # ]6 j7 h; h) B/ X' ?期望步骤:把所有的数据点分配到离他们最近的聚类中心。4 x9 `: u6 Z  f% l
    最大化步骤:通过取出聚类中所有点的平均来更新聚类中心。7 X4 I7 E5 E/ y# N8 ^* y

    / i8 T' r9 D0 h7 g( k! |0 G% R它涉及到一个定义聚类中心位置的适应性函数最大化的过程。对于kmeans最大化是计算一个聚类中所有数据点的算数平均得到。  |# x6 m0 u5 C8 s9 |1 r" P9 W
    ————————————————
    0 P+ v. z0 e; `" O2 r: V版权声明:本文为CSDN博主「紫钺-高山仰止」的原创文章,遵循CC 4.0 BY-SA版权协议,转载请附上原文出处链接及本声明。# k1 C/ E+ P7 s$ y5 `
    原文链接:https://blog.csdn.net/qq_43158059/article/details/126789000
    8 L, H9 q' ]3 c" w( [6 x0 }6 `* ~" a& n- D
      S0 X. e  X% N+ g. X
    zan
    转播转播0 分享淘帖0 分享分享0 收藏收藏0 支持支持0 反对反对0 微信微信
    您需要登录后才可以回帖 登录 | 注册地址

    qq
    收缩
    • 电话咨询

    • 04714969085
    fastpost

    关于我们| 联系我们| 诚征英才| 对外合作| 产品服务| QQ

    手机版|Archiver| |繁體中文 手机客户端  

    蒙公网安备 15010502000194号

    Powered by Discuz! X2.5   © 2001-2013 数学建模网-数学中国 ( 蒙ICP备14002410号-3 蒙BBS备-0002号 )     论坛法律顾问:王兆丰

    GMT+8, 2026-8-24 04:30 , Processed in 0.563855 second(s), 50 queries .

    回顶部