在本文中,主要学习一下STING聚类算法。 / Z8 @$ G" e+ h! y5 O( ]% ~9 k0 ^, d5 ~% ?4 f
(1) STING:统计信息网格 ) {3 @1 b) z; s! i4 K2 I # X* ~/ j1 b: g, N6 ? STING是一种基于网格的多分辨率的聚类技术,它将输入对象的空间区域划分成矩形单元,空间可以用分层和递归方法进行划分。这种多层矩形单元对应不同的分辨率,并且形成了一个层次结构:每个高层单元被划分成低一层的单元。关于每个网格单元的属性的统计信息(如均值,最大值和最小值)被作为统计参数预先计算和存储。对于查询处理和其他数据分析任务,这些统计参数是有效的。) \; U6 N7 m; K( ]
' U) b8 e: t* l: [
STING算法: , A7 H7 E6 P9 z a4 n# ^* H * x5 |; V1 M* Q+ O3 R. V2 t (1) 针对不同的分辨率,通常有多个级别的矩形单元。 ) c2 Z( Q6 q# |5 b+ v f5 @ / C0 B! Q- c2 W* r4 h (2) 这些单元形成了一个层次结构,高层的每个单元被划分成多个底一层的单元。 # \. n7 K% c+ t . o. O% b6 z. h3 R# ~" L* i' ~ (3) 关于每个网格单元属性的统计信息(例如平均值,max,min)被预先计算和存储,这些统计信息用于回答查询。(统计信息是进行查询使用的) $ B: \+ }9 y* }* v1 b1 F; x4 V 8 e+ `. b" b: Q) R9 ?$ |" ~ 网格中常用的参数: ( ], M3 C! `$ O/ [' H! |* g4 T/ o2 u9 p v7 l, I9 y$ S& i0 S
(1) count 网格中对象数目 2 ^" x7 ^9 E, Y; c0 ] - ]# B+ F5 }% j- S# g x' t (2) mean网格中所有值的平均值8 y9 O8 v& a7 G% g
, Q( B" o/ X- h3 l' m9 f b/ Z (3) stdev网格中属性值的标准偏差 % D+ s2 L0 I, }. ^ ' W. C% K- b) L. |- L- H4 @7 p% x8 a (4) min 网格中属性值的最小值$ s3 D; ~) e2 h% m6 f l! g" _
0 ^2 \0 E0 v: S7 _$ Q3 T (5) max 网格中属性值的最大值, v* n, Z# ]9 ]4 j
, X8 Y3 g2 c" j+ K; D: B% t
(6) distribution 网格中属性值符合的分布类型。如正态分布,均匀分布! g {) u8 t# X. d7 [
w* G- \: y) X/ v' x9 w
STING聚类的层次结构:) T" l* {4 K: h
0 Q4 t! U6 R9 @& b+ S. q
通过上面两幅图,我们可以清晰的理解,STING的层次结构,上一层与下一层的关系。 $ j% Z# [$ | K5 ~* H . n/ p s+ r3 n7 D0 m7 h8 ^ 注意:当数据加载到数据库时。最底层的单元参数直接由数据计算,若分布类型知道,可以用户直接指定。而较高层的单元的分布类型可以基于它对应的低层单元多数的分布类型,用一个阈值过滤过程的合取来计算,若底层分布类型彼此不同,那么高层分布类型为none6 o- f: u( l4 i! _6 b
: @$ q3 |" ]+ R2 d
STING查询算法步骤:- C: j: W5 ^+ }/ `" o1 n
0 z1 l, z$ G R8 [6 w/ ` (1) 从一个层次开始" b3 p9 C: K& ` z5 X
/ q& I! Q4 i0 D! M `( B (2) 对于这一个层次的每个单元格,我们计算查询相关的属性值。 ; r! o! x6 ]2 X( }4 l y4 y2 I" D! b
(3) 从计算的属性值以及约束条件下,我们将每一个单元格标记成相关或者不想关。(不相关的单元格不再考虑,下一个较低层的处理就只检查剩余的相关单元) & ?* D! r( \4 q' c& l3 f' _ U5 N' |0 j
(4) 如果这一层是底层,那么转(6),否则转(5); u; p1 Y2 ?+ a+ B1 c o, {% R
4 X2 i8 u h n
(5) 我们由层次结构转到下一层,依照步骤2进行) g% I7 t0 i# a! C6 ~) y
4 m3 C/ N0 G; e) E/ p
(6) 查询结果得到满足,转到步骤8,否则(7) ( J; c+ v; ?* O8 x, r( H7 ~6 h: R: R/ ~" A
(7) 恢复数据到相关的单元格进一步处理以得到满意的结果,转到步骤(8). \6 W8 h2 h+ e2 A1 P3 g! x
* C' b! H' U9 {1 Z$ z% X
(8) 停止1 y8 s4 V) E) A L% r
1 V: t! w; |) @ V
到这儿,STING算法应该基本就差不多了,其核心思想就是:根据属性的相关统计信息进行划分网格,而且网格是分层次的,下一层是上一层的继续划分。在一个网格内的数据点即为一个簇。 , }) A$ C. T( o: v, z. P# I6 b) n6 T" f% X/ c. n
同时,STING聚类算法有一个性质:如果粒度趋向于0(即朝向非常底层的数据),则聚类结果趋向于DBSCAN聚类结果。即使用计数count和大小信息,使用STING可以近似的识别稠密的簇。 ) Z: B: L9 |5 s q6 j4 ]3 q4 _) P( d7 Z/ G: b' m- F4 G- M
STING算法的优点: 8 I: y: g Q; @1 B- B / H t5 H# n! Y: R4 o0 }% q' K8 H (1) 基于网格的计算是独立于查询的,因为存储在每个单元的统计信息提供了单元中数据汇总信息,不依赖于查询。 0 e/ ?6 _7 d ~% k" U+ | v. K9 o' D1 G6 R+ {+ P# H+ V) p* M1 m e" A
(2) 网格结构有利于增量更新和并行处理。 1 u2 Y; d+ g3 s! d& Y0 X; d' L" c" K! k! n9 b; U1 i
(3) 效率高。STING扫描数据库一次开计算单元的统计信息,因此产生聚类的时间复杂度为O(n),在层次结构建立之后,查询处理时间为)O(g),其中g为最底层网格单元的数目,通常远远小于n。 1 |+ ]1 ~1 ^. d" u |: b: D# a, g
缺点: % Q5 H7 I) Y" S/ A. {' w* P$ f8 N# I, ~6 w" N
(1) 由于STING采用了一种多分辨率的方法来进行聚类分析,因此STING的聚类质量取决于网格结构的最底层的粒度。如果最底层的粒度很细,则处理的代价会显著增加。然而如果粒度太粗,聚类质量难以得到保证。 8 h: u3 `! ]# W. w8 X; T4 _/ F/ P4 _8 |" F0 s. ]! B
(2) STING在构建一个父亲单元时没有考虑到子女单元和其他相邻单元之间的联系。所有的簇边界不是水平的,就是竖直的,没有斜的分界线。降低了聚类质量。- K" s9 ]7 x/ ^* o7 n( N: e2 w$ W9 G
: W' Q6 e p! N& e- n
' V/ C! T3 |- u+ _4 j