数学建模社区-数学中国
标题:
【机器学习】无监督学习的概念,使用无监督学习发现数据的特点
[打印本页]
作者:
杨利霞
时间:
2022-9-14 16:37
标题:
【机器学习】无监督学习的概念,使用无监督学习发现数据的特点
【机器学习】无监督学习的概念,使用无监督学习发现数据的特点
; `1 c4 p' Z* h
9 N# F; A2 X; |, x* S* q. d* o
到目前位置,我们主要把注意力集中在监督学习的问题上,数据集中的每个数据点都有一个已知的标签或者目标值。然而如果面对没有已知的输出结果,或者没有人监督学习算法,我们要怎么做。
! |, { t0 d" t9 ~2 K. Y
5 K' n& `3 M$ a% B8 O- f( W9 }
这就是无监督学习 。
* G% b5 A9 J5 w$ v$ P
' g# W9 ^* b6 h! R; B, h
在无监督、非监督学习中了,学习过程仅使用输入数据,没有更多的指导信息,要求从这些数据中提取知识。我们已经讨论了非监督学习众多形式的一种降维。另一个普及的领域就是聚类分析。他的目的是吧数据分为相似元素组成的不同区域中。
& ~" m# S4 k2 b8 `
7 k! z' [* o2 @/ ?
在本章中,我们想要理解不同的聚类算法如何从简单到,无标记的数据集中提取特征。这些结构特征,可以用于特征处理,图像处理,甚至是作为无监督学习任务的预处理步骤。
: S' ?: r* C4 h7 T" v$ V& y
作为一个具体的例子,我们将对图像进行聚类,将色彩空间降到16位数。
3 e& ^9 [; q2 u. X' |6 R
8 B0 b7 O$ R/ M6 q7 J3 m* Y7 K& x- w5 A
解决的问题
7 X2 \$ \5 p9 e2 H5 h1 }! w. ]
1.K-means聚类和期望最大化是什么?如何在opencv中实现这些算法。
6 v% L4 x) R) s8 @
2.如何在层次树中使用聚类算法。他带来的好处有哪些。
3 V! L2 P M+ |( S
3.如何使用无监督学习,进行预处理,图像处理,分类。
/ ?% Z/ `4 W) @. _# E
% X' i6 | v! A, }
1 理解无监督学习
( m' Z, \/ I% I9 \4 g1 s$ P5 M- @
无监督学习可能有很多形式,但是他们的目标总是把原始数据转化为更加丰富,更加有意义的表示,这么做可以让人们更容易理解,也可以更方便的使用机器学习算法进行解析。
' b! `' l! d9 g6 ]' X
无监督学习的应用包括一下应用:
; z/ w7 @4 ?6 K4 G' ~8 b
1降维:他接受一个许多特征的高维度数据表示,尝试对这些数据进行压缩,以使其主要特征,可以使用少量的携带高信息量的数据来表示。
% x5 I( h* V0 G% [! W7 c
2因子分析:用于找到导致被观察的到的数据的隐含因素或者未观察到的方面。
6 b9 Z; [5 k) j9 |
3聚类分析:
9 V% t$ ?! [& x- f2 X# \
尝试把数据分成相似元素组成的不同组。
1 z3 o6 u' f) v5 a
4 m( i/ m# |9 @: p+ J$ c3 C6 q( ?
无监督学习主要的挑战就是,如何确定一个算法是否出色,或者学习到什么有用内容,通常评估一个无监督学习算法结果的唯一方式是手动检查,并确定结果是否有意义。
: U& n4 A' ]% u: D- f
. Q9 k6 g, R; }7 [5 ~
话虽然如此,但是非监督学习,可以非常有,比如作为预处理或者特征提取的步骤。
! S( ~/ ] h/ v( m1 s
/ c7 ^1 B4 d! C1 k: l3 n4 T' G3 Y
2理解K-means聚类
& E6 u1 M, P8 o M5 m
Opencv 提供最有用的聚类算法是k-means,因为它会从一个没有标记的多维度数据集中搜寻预设的K个聚类结果。
% P' s$ U& V7 f8 K! c/ N
# L+ c3 L2 X* x( G8 _
它通过两个简单的假设来完成最佳聚类了。
- ?# I/ r" L$ h% _
1 每个聚类中心都是属于该类别的所有数据点的算术平均值
* L* s; [1 F% I1 ~7 ]
2 聚类中的每一个点相对其他聚类中心,更靠近本类别的中心。
' i" M% r% l1 p+ ^
+ R) U' K, Q7 q: A
2.1 实现第一个kmeans例子
- H# D7 b" S; T) Z& b1 z) A
首先,生成一个包含四个不同点集合的数据集。为了强调这是一个非监督的方法,我门在可视化将忽略哪些标签。使用matplotlib进行可视化。
5 }+ ^& x4 m i) ~* o: i+ N
" v1 P0 C _' m8 E+ t
import matplotlib.pyplot as plt
* z) X. B n) b0 A2 m8 `: k& ^
import pylab
+ h. ?1 f: i' U
from sklearn.datasets._samples_generator import make_blobs
: y: T! k; `; q+ w4 f2 E" l) ~
& L1 j! K4 ^4 u u) x9 ^/ @% ~3 P
plt.style.use('ggplot')
8 w3 ^. i( L' p# B+ E: }
x,y=make_blobs(n_samples=300,centers=4,cluster_std=1.0,random_state=10)
6 f( c6 C4 j+ g0 r' \2 F
plt.scatter(x[:,0],x[:,1],s=100)
/ n0 v9 N4 V9 s" K
pylab.show()
4 Z. P" M/ p+ {0 o2 L
6 K% F ^' i9 A
7 d$ w4 |! O [1 z4 d k+ _1 Z2 @
1
% a/ o" i; ^% W7 V+ I
2
- S, t: j- z0 L1 T
3
2 b. g. a: E; n8 @" x! E* d
4
$ ^3 S- y$ o0 z9 T+ j" ^% N' i7 E
5
9 U- P1 R6 j" F) c) n
6
2 N* ?( h" x1 O, b
7
( r& d9 R4 _7 ~5 `7 N# g
8
5 Z: n8 s: p0 b/ H: p
9
, g) f4 Q8 _8 D
10
, w" V3 p1 |- n" r) |6 E9 y
9 I( _9 `* y8 i' h
我们创建一个四个不同区域的聚类,centers=4,一共300节点。
9 n @5 [7 T8 x' F6 d# N
如上程序生成图像所示结果。
+ R! m; E( N# D
尽管没有给数据分配目标标签,但直接使用肉眼还是可以看出来一共是四类。
Z& k% S8 U( S; N) X% X8 Y
kmeans就可以通过算法办到,无需任何关于目标的标签或者潜在的数据分布的信息。
1 x! V) j) T9 w
当然尽管,kmeans在opencv中是一个统计模型,不能调用api中的train和predict。相反,使用cv2.kmeans可以直接使用这个算法。。为了使用这个模型,我们需要指定一些参数,比如终止条件,和初始化标志。
9 }! j6 C6 o$ L: ~9 R# @# {( v
$ O2 ?" i# [3 V' B7 ]7 O( L
我们让算法误差小于1.0(cv2.TERM_CRITERIA_EPS),或者已经 执行了十次迭代(cv2.TERM_CITTERIA_MAX_ITER)时候终止。
% K1 C6 j2 J9 B3 ]
4 y, `2 A! X2 ?3 t* t ?7 e. {: w
( n( O. t2 U! r6 C. n. Z/ t
0 _8 q3 f( l0 K ?; ?1 X; p
import matplotlib.pyplot as plt
4 Z' v/ \# f- V6 t5 Z$ k2 I
import pylab
1 h7 V9 s0 V& J' Q) c" e
from sklearn.datasets._samples_generator import make_blobs
4 M. N6 j+ L) N; n; e' ^
import cv2
6 w. }6 S- G. B
import numpy as np
* a c! s: `+ |
- T5 A# |3 M* {% @' X* ~
plt.style.use('ggplot')
. G8 t0 H' Q. Q( e+ k% q
x,y=make_blobs(n_samples=300,centers=4,cluster_std=1.0,random_state=10)
3 [& W& T: V; e
plt.scatter(x[:,0],x[:,1],s=100)
0 n' Z; m+ q; s! a5 {
5 S1 t9 U, ?9 Q4 z4 \- S8 ^1 m9 Q" ^
" a' K7 S) t/ T
criteria=(cv2.TERM_CRITERIA_EPS+cv2.TERM_CRITERIA_MAX_ITER,10,1.0)
1 m; @: ^4 E x4 A% w
flags=cv2.KMEANS_RANDOM_CENTERS
6 q+ M, _6 Y* U$ B
compactness,labels,centers=cv2.kmeans(x.astype(np.float32),4,None,criteria,10,flags)
% J" J9 _* N. L, {" v
print(compactness)
4 S5 j' L( {5 e/ Q& u
3 r" K$ L4 B6 m
plt.scatter(x[:,0],x[:,1],c=labels,s=50,cmap='viridis')
1 j |6 f4 ^- } d& l- {1 {
plt.scatter(centers[:,0],centers[:,1],c='black',s=200,alpha=0.5)
+ e! h6 ?+ E& m2 q
5 l. g1 h; \- i7 ?5 y% B
pylab.show()
* D' g9 p% l3 a) p2 K4 z4 Y8 s0 x
+ J4 \) A; U9 O9 d' p2 k
3 J( Q0 w' Y) i/ Z7 H5 c
# h3 K6 q2 e- ?
9 ?1 ?, W1 `6 z6 l/ A6 d
: |+ D5 h. A' s. q4 C" T8 U4 s9 p
3 W n1 ]( }/ u2 e2 K& p
0 E t% R. X; l0 k+ v, @. G
1
, }9 G8 h0 Q3 E1 O
2
2 i6 ^; A1 `8 a/ D7 j8 ?
3
' l! B8 }5 ?# [6 y# M
4
) D: k* o: f/ ^: g I9 m
5
) B( V5 F% b3 R
6
v0 e$ m. T3 ?2 X- o+ ~: ^
7
' F% j& h* L0 }
8
' h0 y1 ]1 j1 {4 n9 K
9
% t! t/ z+ U. U4 e, E" j* Z. k/ K
10
5 t) x5 U: @, x- G' z7 n+ ^) R4 @
11
9 H) d9 r( h1 g' l
12
: W5 Q4 c8 R+ J i" C: H& |
13
: K- v" E) A2 v) Y
14
& G- x6 V7 v$ \" T/ k
15
$ H2 F3 }+ r3 B* J9 l9 i5 E7 a9 i3 R
16
. B: i6 r c7 r$ y/ L7 Y
17
$ l6 N8 P4 ~+ d
18
7 a. Z# V1 d; z+ {! s) ]1 Y/ u
19
B9 ~; s6 n3 E
20
- `2 j1 U3 F7 U* R
21
9 Q( W: ` n1 a6 T. [1 t& t: |
22
5 m2 h H& c/ Y! n$ g/ M0 W; L( `7 j& A
23
- p/ T' e5 C5 f; y
24
4 P* x$ r) Y' e% m
25
. @0 B z" p& l
26
4 t. s& d8 o) o, d* J* P# A
上面程序结果可以产生图2的效果。
2 M; T8 Q: u! k1 d/ a1 @2 q+ h1 L
6 I7 Y& a1 I6 \' S" P' d$ D
print(compactness)这个变量,表示每个点到它聚类中心的距离平方和。较高紧凑都表明所有的点更靠近他们的聚类中心,较低 的紧凑度表明不同的聚类可能无法的很好区分。
6 G* L( ]8 V+ D; I! U
$ d" O8 O, j+ g0 p2 V
当然,这个是非常依赖于x中的真实值。如果点与点之间最初的距离比较大,那我们就很难得到一个非常小的紧凑度。因此,把数据画出来,并按照聚类标签分配不同颜色,可以显示更多信息。
2 u; Z! u+ ]+ X7 A L- d" O6 A
) p) i0 [# X% d% _3 s. }6 n+ [" f
3理解kmeans
# T. {' G1 n5 z0 ^
kmeans是聚类众多常见期望最大化中一个具体的例子。简单来说,算法处理的过程如下所示:
7 U) \2 h" P: R8 h7 O
1.从一些随机的聚类中心开始
7 ^( J9 m* C4 D+ t4 O
2.一种重复直到收敛
4 O! W7 Q& H, d7 M$ r; |' P
' o0 q- I4 j( W& ]' Q" G3 I
期望步骤:把所有的数据点分配到离他们最近的聚类中心。
( H0 m# \4 B& L0 Z3 ?: l8 i+ f
最大化步骤:通过取出聚类中所有点的平均来更新聚类中心。
+ o( Y7 q; X/ l) U% B$ t
# D) W o" i: K
它涉及到一个定义聚类中心位置的适应性函数最大化的过程。对于kmeans最大化是计算一个聚类中所有数据点的算数平均得到。
+ |; v0 X; z$ f# C7 g, A- ^$ l
————————————————
* O3 S. `/ L5 M" {) [+ I
版权声明:本文为CSDN博主「紫钺-高山仰止」的原创文章,遵循CC 4.0 BY-SA版权协议,转载请附上原文出处链接及本声明。
7 p% Z! o- A+ t6 p' E
原文链接:https://blog.csdn.net/qq_43158059/article/details/126789000
' D7 F b* I6 }% C2 v! D+ ]
7 i4 A. N6 }7 }7 w: _9 o) a+ d
5 r7 x4 x. l" k2 R& k" B4 L$ j
欢迎光临 数学建模社区-数学中国 (http://www.madio.net/)
Powered by Discuz! X2.5