QQ登录

只需要一步,快速开始

 注册地址  找回密码
查看: 3447|回复: 0
打印 上一主题 下一主题

[其他资源] 【机器学习】无监督学习的概念,使用无监督学习发现数据的特点

[复制链接]
字体大小: 正常 放大
杨利霞        

5273

主题

82

听众

17万

积分

  • TA的每日心情
    开心
    2021-8-11 17:59
  • 签到天数: 17 天

    [LV.4]偶尔看看III

    网络挑战赛参赛者

    网络挑战赛参赛者

    自我介绍
    本人女,毕业于内蒙古科技大学,担任文职专业,毕业专业英语。

    群组2018美赛大象算法课程

    群组2018美赛护航培训课程

    群组2019年 数学中国站长建

    群组2019年数据分析师课程

    群组2018年大象老师国赛优

    跳转到指定楼层
    1#
    发表于 2022-9-14 16:37 |只看该作者 |倒序浏览
    |招呼Ta 关注Ta
    【机器学习】无监督学习的概念,使用无监督学习发现数据的特点7 W1 c9 j' T3 W
    # y+ S6 S) a4 F7 j- A: D! X
    到目前位置,我们主要把注意力集中在监督学习的问题上,数据集中的每个数据点都有一个已知的标签或者目标值。然而如果面对没有已知的输出结果,或者没有人监督学习算法,我们要怎么做。
    - X% @5 l$ ?1 `, {* x2 H2 v8 G+ d6 [4 f' v0 I1 W0 o
    这就是无监督学习 。/ L9 s8 Z/ l3 E; j4 O
    4 q/ i$ T3 ]$ Q' m: F
    在无监督、非监督学习中了,学习过程仅使用输入数据,没有更多的指导信息,要求从这些数据中提取知识。我们已经讨论了非监督学习众多形式的一种降维。另一个普及的领域就是聚类分析。他的目的是吧数据分为相似元素组成的不同区域中。
    2 Z7 |- L3 I* m' p# v6 I( F
    9 t. g8 Q! W5 U0 E在本章中,我们想要理解不同的聚类算法如何从简单到,无标记的数据集中提取特征。这些结构特征,可以用于特征处理,图像处理,甚至是作为无监督学习任务的预处理步骤。
      V) M2 I  T/ N, Y1 \作为一个具体的例子,我们将对图像进行聚类,将色彩空间降到16位数。+ s7 J7 g* U! @
    2 I& h8 Y' d6 M* N* I+ s
    解决的问题+ r: X# w0 u- Q+ U- }; ]( z
    1.K-means聚类和期望最大化是什么?如何在opencv中实现这些算法。
    3 q) e8 T) n! ]1 c" Y- l2.如何在层次树中使用聚类算法。他带来的好处有哪些。8 d. C% R' ~0 b$ x% t
    3.如何使用无监督学习,进行预处理,图像处理,分类。
    ; r; b, z$ L2 [' i* w& k( \+ o  `" Z
    1 理解无监督学习
    ! x( |( _0 L0 z4 O8 Y0 a% Y- j无监督学习可能有很多形式,但是他们的目标总是把原始数据转化为更加丰富,更加有意义的表示,这么做可以让人们更容易理解,也可以更方便的使用机器学习算法进行解析。
    " M8 k+ K) z; y* @3 E/ U无监督学习的应用包括一下应用:9 A; O: t/ w3 e. m, D- s# \
    1降维:他接受一个许多特征的高维度数据表示,尝试对这些数据进行压缩,以使其主要特征,可以使用少量的携带高信息量的数据来表示。+ \$ b7 i  W; Y: b% X- f& c
    2因子分析:用于找到导致被观察的到的数据的隐含因素或者未观察到的方面。6 ^; g) V( E. S$ h
    3聚类分析:9 `/ }& S6 Q& B4 Z3 m
    尝试把数据分成相似元素组成的不同组。
    ) e$ U8 g: S% m" W8 k/ |
    / @7 Y  u1 i* Z& X2 [6 B% E. Z, ]无监督学习主要的挑战就是,如何确定一个算法是否出色,或者学习到什么有用内容,通常评估一个无监督学习算法结果的唯一方式是手动检查,并确定结果是否有意义。
    5 p: r8 z) M  Z7 l: ~4 z8 m8 n+ P* E7 K+ H& i/ W) _7 y! g3 [
    话虽然如此,但是非监督学习,可以非常有,比如作为预处理或者特征提取的步骤。9 _  u& R9 W. a9 n2 N5 ^* H% S$ s
    0 Y4 X$ c1 e2 N2 l' y) j
    2理解K-means聚类' ]) n5 }, h, _. s
    Opencv 提供最有用的聚类算法是k-means,因为它会从一个没有标记的多维度数据集中搜寻预设的K个聚类结果。/ C" Y$ ^: I# ]" [8 r+ l- X. x

      h, z6 I6 Q+ d. x3 t' y9 p# h它通过两个简单的假设来完成最佳聚类了。. t' s6 q  [- r1 i. f
    1 每个聚类中心都是属于该类别的所有数据点的算术平均值
    ( ?  f$ \5 o2 x4 i0 k- P2 R8 ]2 聚类中的每一个点相对其他聚类中心,更靠近本类别的中心。
    & p" Z$ I4 w/ {' U1 A  `
    1 h0 }4 W( ]- T8 }4 c+ E2.1 实现第一个kmeans例子
    " M" w' {7 C: n4 S4 O首先,生成一个包含四个不同点集合的数据集。为了强调这是一个非监督的方法,我门在可视化将忽略哪些标签。使用matplotlib进行可视化。. z) y* i' Z9 |

      d* \" U! D/ l' v2 i' p- ]import matplotlib.pyplot as plt
    2 \# N& k' `. O5 [8 W7 d/ Himport pylab
    ; m( z( b) _# W/ yfrom sklearn.datasets._samples_generator import make_blobs
    5 T' d. R8 m8 J
    , Q4 w  I* n4 ]& y& L' N) O! v  @plt.style.use('ggplot')
    7 h+ a% M) G. {) o& B& {x,y=make_blobs(n_samples=300,centers=4,cluster_std=1.0,random_state=10)1 Z! D3 P& p, ?2 j
    plt.scatter(x[:,0],x[:,1],s=100)
    5 \8 |5 Y, [4 f' i9 _pylab.show()! p: w6 t" w  v& @

    $ z0 M% ~7 J8 ^
    8 I" ?/ V, |0 ^2 b1
    - ~9 C& V0 F$ R7 L/ K. _) D5 S: m5 ?2
      W! G, K2 U1 h0 m4 e3" d) G% y0 R9 @7 X! h; J1 b
    4% [, a9 k. q8 W
    5& H0 h- T7 T, R  z
    6+ v' P  l, x$ H0 u8 ^! u4 R
    7
    + B% ~, n# d2 z. |+ q/ P8
    ' l4 _3 t: v+ V+ ?) x3 J- }9; O! y0 B4 }& R
    10: W3 x, B( x  I# q- e* O$ J

    + Y& {. R$ A& K; y我们创建一个四个不同区域的聚类,centers=4,一共300节点。) d7 I5 ~% y, o! @- O0 @7 f
    如上程序生成图像所示结果。4 L6 D2 W: j2 K. N0 F
    尽管没有给数据分配目标标签,但直接使用肉眼还是可以看出来一共是四类。1 S/ l4 r* h0 Y- `2 n3 g1 e+ `
    kmeans就可以通过算法办到,无需任何关于目标的标签或者潜在的数据分布的信息。% a9 N# r9 Q8 w9 L' @
    当然尽管,kmeans在opencv中是一个统计模型,不能调用api中的train和predict。相反,使用cv2.kmeans可以直接使用这个算法。。为了使用这个模型,我们需要指定一些参数,比如终止条件,和初始化标志。
    1 L( y5 R, w; D+ {0 h1 ~
    * L8 F) k3 d  d- a% t2 z6 T我们让算法误差小于1.0(cv2.TERM_CRITERIA_EPS),或者已经 执行了十次迭代(cv2.TERM_CITTERIA_MAX_ITER)时候终止。) w' k9 |% M# Z: ~8 j) {" {
    0 I) H( g" M7 {- g0 _

    ' Y- Z# o6 c4 \) ^2 Y! v& b, {) \- L5 h$ d  H& |' L$ N
    import matplotlib.pyplot as plt7 v, g3 L# q/ S  a4 a' M* G9 r
    import pylab
    5 h0 D2 i6 N& R3 ]" s4 |. u, |6 Xfrom sklearn.datasets._samples_generator import make_blobs
    ; j6 b! E5 _( timport cv2( @. R) P) U7 a) e; N
    import numpy as np4 ~7 i/ p( j; b  }* q  s/ E

    ( M6 }. u$ \, R1 N) bplt.style.use('ggplot')
    6 q; _, Y, E( S# Q- Bx,y=make_blobs(n_samples=300,centers=4,cluster_std=1.0,random_state=10)
    + E) U; p4 S3 S+ D& w. w4 }, o+ d* Wplt.scatter(x[:,0],x[:,1],s=100)& K) i, ?0 x, D+ z4 n
    ( S* ~# G, I) `# }+ [* X5 S& M
    . t* V( N+ i6 w4 I2 N( ]. Q. _
    criteria=(cv2.TERM_CRITERIA_EPS+cv2.TERM_CRITERIA_MAX_ITER,10,1.0)1 E. X2 Z$ q5 `. l1 K" Z, I% I6 _
    flags=cv2.KMEANS_RANDOM_CENTERS
    2 x7 Y8 ^6 a( |% T& ~compactness,labels,centers=cv2.kmeans(x.astype(np.float32),4,None,criteria,10,flags)
    4 u* Z7 O; }: E" E" Z4 `print(compactness)
    ! R6 u" j$ d4 D$ G. h+ g( G
    ' c  V, _# n* g/ L% I+ h; M0 hplt.scatter(x[:,0],x[:,1],c=labels,s=50,cmap='viridis')
    " I! V* T5 L1 K, n% l- a7 N$ i; F! aplt.scatter(centers[:,0],centers[:,1],c='black',s=200,alpha=0.5)
    ' Q) J1 G- `: f! z! s
    ; m' ^$ |% p3 H! C  K* G; Opylab.show()" a  o9 s1 Z. K; j( A0 {; J
    3 F8 m1 G# @' _# a: M
    7 W1 \: Y2 ]; T* G! ?. @
    " @* [, S& ?8 M) f3 U" G$ Z0 K7 e  M
    & Q  s- O2 c! T

    ( |' b, x# z2 x9 ]0 v6 R( U% Q8 i, r+ t3 L: Q. {

    ' ~/ w8 y9 w& a5 ~9 D8 v1
    ' `/ n! W- K* ~( {5 B9 H* `1 f2
    . k1 j% X8 l1 A3 Z/ J; w33 L0 k" |, @# @# z/ Z9 S
    40 t, ~4 [& W' w+ _4 D
    5% P, \2 o3 K! k: y$ a& L
    6
      p6 o" Q% ^3 Q7
    " {& v1 V  A* J5 J* b# h8
    $ [. p9 u  C! A/ J1 B; H- ]$ d/ c9+ }7 ], c" g" U) }2 c2 [
    10
    9 Q$ F! q" o  u* V9 O0 _! B$ k2 q11
    # v1 W# k4 G/ \, ]5 o( a12
    / w' Q* C  M1 H8 h: e13
    . H) K& ]$ }2 w4 E  q+ B( f, F$ C4 |142 O7 I4 I" H8 I& }
    151 ^% m- c$ h! B
    16" A' V" N* W! m" j0 l5 M( ?/ I' |
    17: Z; k4 f: b# T) c
    18
    2 X# F6 T' B9 E2 b19
    6 {( M+ d( q' g, q20
    - }5 c3 A" _) F8 Z211 c, Q' y, B, U' b
    22
    9 h- _$ @8 Y+ v3 I9 [/ Z- X23
      m1 j4 u8 K; U& Q  i242 K! F) T3 \, d4 ]* Q: h3 c: m3 m
    25
    6 k. S/ ^7 B# \: l( Q26
    % c; t" R. M, M* ~' v4 ]5 z上面程序结果可以产生图2的效果。2 M- Y, ^4 `6 C3 |# f% a

    2 ?% C0 |, @  s( b, ]2 Y! Fprint(compactness)这个变量,表示每个点到它聚类中心的距离平方和。较高紧凑都表明所有的点更靠近他们的聚类中心,较低 的紧凑度表明不同的聚类可能无法的很好区分。
    ; b4 d5 o4 l3 Q# l
    ' M3 s) _% M. Z9 Y6 R当然,这个是非常依赖于x中的真实值。如果点与点之间最初的距离比较大,那我们就很难得到一个非常小的紧凑度。因此,把数据画出来,并按照聚类标签分配不同颜色,可以显示更多信息。
    ' i8 i! M& j" l7 f4 D# ?0 t& V% H& Z- d& n' ]. b
    3理解kmeans) C4 I% ?; @- D; w: r
    kmeans是聚类众多常见期望最大化中一个具体的例子。简单来说,算法处理的过程如下所示:4 e$ ^( D3 k, D  U' s( i! Z
    1.从一些随机的聚类中心开始
    " t! ?! N/ t* ?0 M0 A) T- @2.一种重复直到收敛
    . b. |' X! O1 c2 M4 Z1 D# R. D% K2 i2 b$ j
    期望步骤:把所有的数据点分配到离他们最近的聚类中心。8 R, `/ C+ ?$ t: W
    最大化步骤:通过取出聚类中所有点的平均来更新聚类中心。9 r' r: @0 X* y. ?, @$ x3 x5 J; z0 }

    - W% N7 ]' X$ N它涉及到一个定义聚类中心位置的适应性函数最大化的过程。对于kmeans最大化是计算一个聚类中所有数据点的算数平均得到。. v5 ^4 p. f9 W" l( [* [
    ————————————————! k; e8 \: e3 m; a% i* i: ^/ X
    版权声明:本文为CSDN博主「紫钺-高山仰止」的原创文章,遵循CC 4.0 BY-SA版权协议,转载请附上原文出处链接及本声明。: q% d4 j( W+ r% h1 @7 m
    原文链接:https://blog.csdn.net/qq_43158059/article/details/1267890002 B' q) W3 m  m" q& l1 F; Y3 g
    + D+ @; I3 j  ]% R3 J* o  v
    ; B; m8 u5 b& _) N2 n
    zan
    转播转播0 分享淘帖0 分享分享0 收藏收藏0 支持支持0 反对反对0 微信微信
    您需要登录后才可以回帖 登录 | 注册地址

    qq
    收缩
    • 电话咨询

    • 04714969085
    fastpost

    关于我们| 联系我们| 诚征英才| 对外合作| 产品服务| QQ

    手机版|Archiver| |繁體中文 手机客户端  

    蒙公网安备 15010502000194号

    Powered by Discuz! X2.5   © 2001-2013 数学建模网-数学中国 ( 蒙ICP备14002410号-3 蒙BBS备-0002号 )     论坛法律顾问:王兆丰

    GMT+8, 2026-8-24 06:04 , Processed in 2.259724 second(s), 50 queries .

    回顶部