标题: 数据挖掘算法——常用分类算法总结 [打印本页] 作者: 杨利霞 时间: 2021-4-9 11:20 标题: 数据挖掘算法——常用分类算法总结 数据挖掘算法——常用分类算法总结 6 P# k9 d- i1 H6 C2 b. f- N9 p' H K# I9 H
常用分类算法总结 2 J, R% ]& y6 F) S9 A分类算法 , H v; e0 V3 p9 k3 N- |2 N" vNBC算法" @* ^* G4 k: h% ]% K/ N
LR算法 6 b" i. K/ _# Y* oSVM算法0 y& y6 _# A* n3 c C, M2 P& h
ID3算法 / _( m) {2 R% CC4.5 算法! l& Y! O, J" _7 }* j1 k4 S+ ~& d# S
C5.0算法 - m* \; v: R# J: I/ \KNN 算法 ; Q- `! Y9 T2 W3 ]7 V+ ?* |: T- ^6 _1 [" YANN 算法/ [2 q# i8 B8 @0 X! X. c& B9 d
分类算法$ e* v5 J; I4 [' Q
分类是在一群已经知道类别标号的样本中,训练一种分类器,让其能够对某种未知的样本进行分类。分类算法属于一种有监督的学习。分类算法的分类过程就是建立一种分类模型来描述预定的数据集或概念集,通过分析由属性描述的数据库元组来构造模型。分类的目的就是使用分类对新的数据集进行划分,其主要涉及分类规则的准确性、过拟合、矛盾划分的取舍等。分类算法分类效果如图所示。 8 B9 e' K% s& ~: K' S# l % \( g- I/ U: D$ I% k常用的分类算法包括:NBC(Naive Bayesian Classifier,朴素贝叶斯分类)算法、LR(Logistic Regress,逻辑回归)算法、ID3(Iterative Dichotomiser 3 迭代二叉树3 代)决策树算法、C4.5 决策树算法、C5.0 决策树算法、SVM(Support Vector Machine,支持向量机)算法、KNN(K-Nearest Neighbor,K 最近邻近)算法、ANN(Artificial Neural Network,人工神经网络)算法等。 8 {/ ]! ^+ P4 l4 w" O# p5 C, h' t9 k, a( o! t2 N
NBC算法 7 f" r6 k& ?; b8 xNBC 模型发源于古典数学理论,有着坚实的数学基础。该算法是基于条件独立性假设的一种算法,当条件独立性假设成立时,利用贝叶斯公式计算出其后验概率,即该对象属于某一类的概率,选择具有最大后验概率的类作为该对象所属的类。9 B5 b0 {0 ?: g
NBC算法的优点/ w5 \' I$ x8 I! b7 f
3 i* P# C) u, N
NBC算法逻辑简单,易于实现; 6 Z z. P' k% E7 |- NNBC算法所需估计的参数很少; ) C/ A4 W9 [5 w% oNBC 算法对缺失数据不太敏感;4 e) F7 U6 P+ E6 _9 K4 J
NBC 算法具有较小的误差分类率;5 h! t3 o$ {! W
NBC 算法性能稳定,健壮性比较好;' e4 r$ A8 w# N7 |2 X( P
NBC算法的缺点6 L! [3 l+ r& g& ?, P
1.在属性个数比较多或者属性之间相关性较大时,NBC 模型的分类效果相对较差; " H! i4 c: d/ E7 |8 f2.算法是基于条件独立性假设的,在实际应用中很难成立,故会影响分类效果 }; L$ D/ R' e$ q0 _
$ g) O; y1 R. i( {% Z0 h+ p" {LR算法" | H' S5 o H; e6 L
LR 回归是当前业界比较常用的机器学习方法,用于估计某种事物的可能性。它与多元线性回归同属一个家族,即广义线性模型。简单来说多元线性回归是直接将特征值和其对应的概率进行相乘得到一个结果,逻辑回归则是在这样的结果上加上一个逻辑函数。在此选择LR 作为回归分析模型的代表进行介绍。& s, l; {9 ^! S- p: O/ ?$ y
LR算法的优点 2 _" X/ x0 A* T) l' D1.对数据中小噪声的鲁棒性好;& E- j4 G/ t9 |0 u" J
2.LR 算法已被广泛应用于工业问题中;- [9 `; q! {2 ~( g
3.多重共线性并不是问题,它可结合正则化来解决。 $ p) f. h+ G9 c* Z& j9 V 1 {- i1 Y1 p5 d: F! }" FLR算法的缺点* P9 R1 v# u t
1.对于非线性特征,需要转换 w1 ?" d! [! L6 H
2.当特征空间很大时,LR的性能并不是太好 3 W- b+ @1 S. h% V7 `% D. M8 G8 W8 B/ d 7 M) t7 X3 N- p0 U, MSVM算法! J: s) F& t8 _& j
SVM 算法是建立在统计学习理论基础上的机器学习方法,为十大数据挖掘算法之一。通过学习算法,SVM 可以自动寻找出对分类有较好区分能力的支持向量,由此构造出的分类器可以最大化类与类的间隔,因而有较好的适应能力和较高的分准率。SVM 算法的目的在于寻找一个超平面H,该超平面可以将训练集中的数据分开,且与类域边界的沿垂直于该超平面方向的距离最大,故SVM 法亦被称为最大边缘算法。 1 }" H b/ ? N- J# i% ~( Z3 x, F* q! _3 r
SVM算法的优点% f3 d8 x' x% N" m" n
1.SVM 模型有很高的分准率; d# Q, G7 Z8 A t2 U7 Z
2. SVM 模型有很高的泛化性能; 2 w$ [, i8 h; R0 D4 L3. SVM 模型能很好地解决高维问题;3 q3 ]! V: r+ }* G
4. SVM 模型对小样本情况下的机器学习问题效果好。5 L' T) N: _9 n; q. } Y( ?
+ S9 ~1 R5 Q( ]6 i8 y/ b
SVM算法的缺点9 E2 _; g/ x' @' S1 c6 ?/ x
1.SVM 模型对缺失数据敏感;. K* n) C6 `! T" W I3 {4 s. V. g
2.对非线性问题没有通用解决方案,得谨慎选择核函数来处理。& S6 M- d6 N5 `; x0 y8 k
3 e, G4 M7 D7 q
ID3算法 5 N' s3 B3 @/ qID3 算法是一种基于决策树的分类算法,该算法是以信息论为基础,以信息熵和信息增益为衡量标准,从而实现对数据的归纳分类。信息增益用于度量某个属性对样本集合分类的好坏程度。ID3 算法的时间复杂度为O(n*|D|*log|D|)。# y6 H1 b6 ?: V- o" O& e% q
& c* G! z4 z2 V' }, T" H
ID3算法的优点 8 t6 c0 w6 d% j8 p$ v9 ~( ]" N1 b: _! h
ID3 算法建立的决策树规模比较小; 0 z$ @( p& x* b; c查询速度快。 $ z5 Z- v2 T Y$ K( E" [7 RID3算法的缺点0 s: S U. b, F
1.不适合处理连续数据; 0 e! O ?5 M& u2.难以处理海量数据集;# {8 z8 K8 J( a6 W$ A6 \- B" a( g
3.建树时偏选属性值较大的进行分离,而有时属性值较大的不一定能反应更多的数据信息。$ m+ g/ b& Y! b3 o" o7 S
3 ]0 t2 r) n1 t* h; V4 o5 {3 |7 RC4.5 算法 # T7 E6 a- b7 ~5 E. cC4.5 算法是ID3 算法的修订版,采用信息增益率来加以改进,选取有最大增益率的分割变量作为准则,避免ID3 算法过度的适配问题。! j. b, k# A2 A, z4 [
, m( i/ ^, ?& o
C4.5算法优点4 J5 o( Y6 ~* J
1.C4.5 继承了ID3 优点;+ I6 U9 z( s1 `
2.在树构造过程中进行剪枝;" V4 }* D8 z a* ~2 _
3.能对不完整数据进行处理; $ y3 K+ l! i, Y; m3 ]) b; Y: W8 ^4.能够完成对连续属性的离散化处理; ) x8 h7 N$ f$ X) p! F* d5.产生的分类规则易于理解,准确率较高; 2 x: ^( q# N% Q" F' ?5 t1 Y" K6.用增益率来选择属性,克服了用增益选择属性时偏向选择取值多的属性。' V4 L* e0 r a) z& R* p4 n. c' Z* |8 ~
0 Q9 K+ ~2 E* O
C4.5 算法缺点 ! `7 j/ f0 \+ a& j1.构造树时,需要对数据集进行多次的顺序扫描和排序,因而导致算法的低效;" `& j O+ s( |& u5 _3 K2 B5 m, R
2.只适合于能驻留于内存的数据集,当训练集达到内存无法容纳时程序无法运行。5 g& r6 N' p* n& P9 ^1 p
$ |+ u3 _: C' lC4.5 用于遥感分类过程中,首先依据通常的方式建立第一个模型。随后建立的第二个模型聚焦于被第一个模型错误分类的记录。以此类推,最后应用整个模型集对样本进行分类,使用加权投票过程把分散的预测合并成综合预测。Boosting 技术对于噪声不大的数据,通常通过建立的多模型来减少错误分类的影响,提高分类精度。0 t& w( i% ]. i+ K' r2 g. O3 P. H+ N