QQ登录

只需要一步,快速开始

 注册地址  找回密码
查看: 3505|回复: 0
打印 上一主题 下一主题

[其他资源] 【机器学习】无监督学习的概念,使用无监督学习发现数据的特点

[复制链接]
字体大小: 正常 放大
杨利霞        

5273

主题

82

听众

17万

积分

  • TA的每日心情
    开心
    2021-8-11 17:59
  • 签到天数: 17 天

    [LV.4]偶尔看看III

    网络挑战赛参赛者

    网络挑战赛参赛者

    自我介绍
    本人女,毕业于内蒙古科技大学,担任文职专业,毕业专业英语。

    群组: 2018美赛大象算法课程

    群组: 2018美赛护航培训课程

    群组: 2019年 数学中国站长建

    群组: 2019年数据分析师课程

    群组: 2018年大象老师国赛优

    跳转到指定楼层
    1#
    发表于 2022-9-14 16:37 |只看该作者 |正序浏览
    |招呼Ta 关注Ta
    【机器学习】无监督学习的概念,使用无监督学习发现数据的特点. h9 c) N/ v9 z: D( z
    8 L6 A6 H# K% Q
    到目前位置,我们主要把注意力集中在监督学习的问题上,数据集中的每个数据点都有一个已知的标签或者目标值。然而如果面对没有已知的输出结果,或者没有人监督学习算法,我们要怎么做。
    + W0 i% i" O" O* y3 P6 m
    # A% Z: E0 `! h+ b6 l# S. f& o这就是无监督学习 。
    : H2 K# \5 C$ b  e% o3 M7 j
    ; x; L) N3 Y8 _8 P) _" y在无监督、非监督学习中了,学习过程仅使用输入数据,没有更多的指导信息,要求从这些数据中提取知识。我们已经讨论了非监督学习众多形式的一种降维。另一个普及的领域就是聚类分析。他的目的是吧数据分为相似元素组成的不同区域中。( V: o/ s6 j, V, R! c; x

    * H3 U, V# ?  l9 \( y; U$ ?在本章中,我们想要理解不同的聚类算法如何从简单到,无标记的数据集中提取特征。这些结构特征,可以用于特征处理,图像处理,甚至是作为无监督学习任务的预处理步骤。
    ) R8 h4 s/ ]* o& U( A  z0 D6 t5 M作为一个具体的例子,我们将对图像进行聚类,将色彩空间降到16位数。
    ' ~$ L- {8 q7 r' ^$ V9 s- i7 L# l, Q, n
    解决的问题
    , e! c# C9 {' e! ?1.K-means聚类和期望最大化是什么?如何在opencv中实现这些算法。
    ! m4 m' [; X6 U, K2.如何在层次树中使用聚类算法。他带来的好处有哪些。
    ' ]) ~7 B4 P. v+ N" |* n3.如何使用无监督学习,进行预处理,图像处理,分类。8 I" D/ g# y: W* n8 Z2 f' b
    . ^  P" b/ H' y7 G2 S8 G
    1 理解无监督学习
    6 ?4 W# M: [: d. V, I/ W2 k3 O! l无监督学习可能有很多形式,但是他们的目标总是把原始数据转化为更加丰富,更加有意义的表示,这么做可以让人们更容易理解,也可以更方便的使用机器学习算法进行解析。
    + @) L, Q- g! t+ s无监督学习的应用包括一下应用:
    8 W2 F+ N* X& M6 ]: ~( z1降维:他接受一个许多特征的高维度数据表示,尝试对这些数据进行压缩,以使其主要特征,可以使用少量的携带高信息量的数据来表示。1 B0 t6 J4 D5 ]6 ~# X
    2因子分析:用于找到导致被观察的到的数据的隐含因素或者未观察到的方面。
      S9 T$ b1 l) v5 M: L3聚类分析:
    % J6 o! n8 e% ]8 t4 c, K4 b. E尝试把数据分成相似元素组成的不同组。
    4 Q! X  h3 Q! ^$ w9 }% F  v  L7 q
    0 T# C* u  \! j  m% m3 ^- v- o无监督学习主要的挑战就是,如何确定一个算法是否出色,或者学习到什么有用内容,通常评估一个无监督学习算法结果的唯一方式是手动检查,并确定结果是否有意义。& C  ~' Y, v# \

    * B5 J! \# @3 l, L1 U4 N话虽然如此,但是非监督学习,可以非常有,比如作为预处理或者特征提取的步骤。
    + O* y4 e: ~4 W0 Y7 H! i% X: M2 \# v3 q4 _. m4 g1 K. K
    2理解K-means聚类
    ( i, C* n6 |0 [5 gOpencv 提供最有用的聚类算法是k-means,因为它会从一个没有标记的多维度数据集中搜寻预设的K个聚类结果。1 x3 H! d# p( ~; [# s; i
    $ f& _) x8 ?; x8 O- F" }
    它通过两个简单的假设来完成最佳聚类了。
    ' h7 E+ w" @, r/ y, e  q1 每个聚类中心都是属于该类别的所有数据点的算术平均值; ]( c  p, w; y  \
    2 聚类中的每一个点相对其他聚类中心,更靠近本类别的中心。) C5 \& h- \: N. u8 Q4 ~2 E
    - I6 N0 }: F0 q8 c
    2.1 实现第一个kmeans例子
    " p& D- H& v' ~4 A9 K, `" F首先,生成一个包含四个不同点集合的数据集。为了强调这是一个非监督的方法,我门在可视化将忽略哪些标签。使用matplotlib进行可视化。( h9 e) F( ?" O" J' I+ U
    ; N* ~7 @# H, [! A
    import matplotlib.pyplot as plt$ a, A* }# g' L* q% S( U3 n
    import pylab1 I5 I* O6 e4 h* z* h
    from sklearn.datasets._samples_generator import make_blobs% X; j: [) w  ^  h5 Q8 ?

    4 B1 r+ \+ B1 U% y& X# xplt.style.use('ggplot')$ [3 L3 u+ w9 _3 ~" P6 a' a
    x,y=make_blobs(n_samples=300,centers=4,cluster_std=1.0,random_state=10)  {! z1 ]; H) C6 N) c0 P/ o6 b
    plt.scatter(x[:,0],x[:,1],s=100)
    ! _: D+ c9 ?3 e- h+ Ppylab.show()& a- N" z4 F* ?* Y* N1 v
    6 F* L' Y& Y$ \5 p
    8 \5 c; P/ P* ]! ]: n: g% P$ G
    1) i, w" w$ C0 l1 K9 G
    2
    , k; |4 V' G8 O( M$ v3
    . Q. N7 I4 J5 e/ f4
    + J6 P2 {4 t. ^; d# h5 \! s5* {9 S! c1 o9 t
    6& F1 e+ @# Z, _- V  L
    7/ Y! g& n2 z3 L4 T& g( J5 }! b, [
    8% H5 S. n6 ]$ L% h
    9
    . Z9 y1 i0 `" |" E10
    1 [. |7 W( d$ `6 U
    , @. X- W4 B! \( V9 J; A! K我们创建一个四个不同区域的聚类,centers=4,一共300节点。
    ) y% G: \1 I6 M2 Z) e; K如上程序生成图像所示结果。" n6 P. L' {, J
    尽管没有给数据分配目标标签,但直接使用肉眼还是可以看出来一共是四类。
    ; z' J/ q" P$ Y% i% d) ^) fkmeans就可以通过算法办到,无需任何关于目标的标签或者潜在的数据分布的信息。" ^& S# D9 P% i- [3 `
    当然尽管,kmeans在opencv中是一个统计模型,不能调用api中的train和predict。相反,使用cv2.kmeans可以直接使用这个算法。。为了使用这个模型,我们需要指定一些参数,比如终止条件,和初始化标志。4 F$ N, ?. Y+ ?' X  x1 ~
    ' r: R1 U9 v( v' M' U
    我们让算法误差小于1.0(cv2.TERM_CRITERIA_EPS),或者已经 执行了十次迭代(cv2.TERM_CITTERIA_MAX_ITER)时候终止。8 X0 F2 g" f0 K# [2 u2 N

    / Z8 f! w4 V/ d  B$ K
    % m. \' D) F  q2 i
    " }5 N6 m* K; X  N5 ?3 @& D* \import matplotlib.pyplot as plt, `' Y( ^4 d7 F: i. k
    import pylab$ @- @8 n9 J% ]0 M0 q
    from sklearn.datasets._samples_generator import make_blobs
    2 K; Z+ ]9 B* h3 Y& n1 eimport cv25 E% ?& e- n5 A" }1 g4 I6 X9 b+ o5 G
    import numpy as np
    ; b. p8 p  c8 S
      Z0 \5 z, H8 j! A$ aplt.style.use('ggplot'), b% g* A, ~3 z
    x,y=make_blobs(n_samples=300,centers=4,cluster_std=1.0,random_state=10)
    * {/ {2 @% Z! z! E# S1 }plt.scatter(x[:,0],x[:,1],s=100)% s; `2 F, U" y- ?# g; a3 J

    5 H8 Q2 H. E" g1 J
    4 R& C  M! o. a$ `" R4 ?1 rcriteria=(cv2.TERM_CRITERIA_EPS+cv2.TERM_CRITERIA_MAX_ITER,10,1.0)4 T( k' b, Y4 k
    flags=cv2.KMEANS_RANDOM_CENTERS; d6 I. k- v. _( ]/ Z0 e- x1 }
    compactness,labels,centers=cv2.kmeans(x.astype(np.float32),4,None,criteria,10,flags)
    1 x# @1 s% v! aprint(compactness)
    " b1 K6 w+ k" m
    + i, g* ^7 }3 [% r# Kplt.scatter(x[:,0],x[:,1],c=labels,s=50,cmap='viridis')
    0 _. a/ _: f& u, h0 o5 bplt.scatter(centers[:,0],centers[:,1],c='black',s=200,alpha=0.5)
    : R# `% a' x3 S+ W' L1 h
    ) A' e/ K9 z4 X$ y0 D7 xpylab.show()
    ( i: n$ F. d& Q& w
    % P, ~3 m) W$ q# Y/ x. E* |$ O4 Z' C0 C, K9 m2 {6 q( \* X
    : ^; L% y6 O, c( H( i, `
    0 G1 w* [7 K* P
    ) z3 O  T; w/ N' w. L

    " d6 @- ]  _/ S" P% e  H/ `0 V. V/ \/ r$ l
    1' N. N. N/ L, Z, v; M
    2
    # ?6 k2 n; D% n' D33 V* M& \+ _, ?
    4
    4 w" e5 M& v- e  E0 t1 T& A" y) Q5
    $ B: Q$ ]- d% z" W& O- U$ K6+ x$ K  V  Y6 M+ h5 v! L! N6 K
    7
    & h$ j& \. ?/ w5 l# x4 Z4 Y$ J80 o/ K6 V: X3 k# o, e
    9
    2 Z: p& ^; i8 E8 B10
    6 z9 Y! ?2 F* `5 `  P" i( y; Y11
    5 Z/ ]. Q5 _% z# g0 @1 w) @9 ^' S& n) H120 j+ Z0 Z. a/ S7 o( g8 X! w- G
    138 G" b" T* {' m5 i& Y6 g
    140 p6 o+ q% T" C  D1 k" m) u4 a' r
    15
    " n7 x6 S. |. ?3 Q# \3 i16
    4 t. b" y2 l: X' |17
    0 W; _: y% T4 ^0 [8 r) s180 D4 S5 e* ?8 H! M5 z7 p
    19
    8 N- _' w# u: e# M! W$ G4 P% b20$ ^: b7 P  Y$ Y; D# X4 u3 R- g
    215 E2 r" U& k+ z, ^/ Q
    223 ?+ j4 B$ ^  B3 B0 W
    23
    ( K* W( @. b& J24- |% D* c. T2 \+ o4 x
    259 D1 z: j2 R) p
    264 c2 n5 `; H. Y7 `
    上面程序结果可以产生图2的效果。
    ! R! A3 v4 s1 ?& p; p, l- Y1 }1 N0 E6 ?- \4 `1 y
    print(compactness)这个变量,表示每个点到它聚类中心的距离平方和。较高紧凑都表明所有的点更靠近他们的聚类中心,较低 的紧凑度表明不同的聚类可能无法的很好区分。9 `4 n% h, O* F' D+ J7 C

    ; F( V1 N8 Z8 L4 F+ ?+ Q$ H当然,这个是非常依赖于x中的真实值。如果点与点之间最初的距离比较大,那我们就很难得到一个非常小的紧凑度。因此,把数据画出来,并按照聚类标签分配不同颜色,可以显示更多信息。+ e4 S# }; {9 V& f' V/ C6 K
      R7 ?4 a2 _6 R& D
    3理解kmeans
    + I! A8 e/ c/ V- Hkmeans是聚类众多常见期望最大化中一个具体的例子。简单来说,算法处理的过程如下所示:
      q/ V) T! c5 }" |* {1.从一些随机的聚类中心开始
    + I; N- Q; a- W4 Y0 \* E* w2.一种重复直到收敛, N2 j. C/ R# K5 J" y' s
    4 I) V/ M& C' Y* i" p
    期望步骤:把所有的数据点分配到离他们最近的聚类中心。6 i* U& x( ~/ O/ U
    最大化步骤:通过取出聚类中所有点的平均来更新聚类中心。9 y" L, p1 _7 s1 z% e

    4 ?% a7 m1 T+ m它涉及到一个定义聚类中心位置的适应性函数最大化的过程。对于kmeans最大化是计算一个聚类中所有数据点的算数平均得到。
    # y, b4 ~8 [+ y# U9 l————————————————0 r# ]. b# J# M& J
    版权声明:本文为CSDN博主「紫钺-高山仰止」的原创文章,遵循CC 4.0 BY-SA版权协议,转载请附上原文出处链接及本声明。) ]7 r% S$ y1 p+ ^3 H7 I& j. G
    原文链接:https://blog.csdn.net/qq_43158059/article/details/126789000! Q3 i8 g& h. ^- `
    $ j+ }, u9 ]7 ~" h) p
    & Z* @) h, v! b/ |% l. |
    zan
    转播转播0 分享淘帖0 分享分享0 收藏收藏0 支持支持0 反对反对0 微信微信
    您需要登录后才可以回帖 登录 | 注册地址

    qq
    收缩
    • 电话咨询

    • 04714969085
    fastpost

    关于我们| 联系我们| 诚征英才| 对外合作| 产品服务| QQ

    手机版|Archiver| |繁體中文 手机客户端  

    蒙公网安备 15010502000194号

    Powered by Discuz! X2.5   © 2001-2013 数学建模网-数学中国 ( 蒙ICP备14002410号-3 蒙BBS备-0002号 )     论坛法律顾问:王兆丰

    GMT+8, 2026-10-9 02:33 , Processed in 0.359468 second(s), 51 queries .

    回顶部