- 在线时间
- 1630 小时
- 最后登录
- 2024-1-29
- 注册时间
- 2017-5-16
- 听众数
- 82
- 收听数
- 1
- 能力
- 120 分
- 体力
- 566754 点
- 威望
- 12 点
- 阅读权限
- 255
- 积分
- 175249
- 相册
- 1
- 日志
- 0
- 记录
- 0
- 帖子
- 5313
- 主题
- 5273
- 精华
- 3
- 分享
- 0
- 好友
- 163
TA的每日心情 | 开心 2021-8-11 17:59 |
|---|
签到天数: 17 天 [LV.4]偶尔看看III 网络挑战赛参赛者 网络挑战赛参赛者 - 自我介绍
- 本人女,毕业于内蒙古科技大学,担任文职专业,毕业专业英语。
 群组: 2018美赛大象算法课程 群组: 2018美赛护航培训课程 群组: 2019年 数学中国站长建 群组: 2019年数据分析师课程 群组: 2018年大象老师国赛优 |
& _/ A4 `$ k. E& F; l6 k% ]
各类机器学习算法的优缺点和适用场景汇总& s: S& Z) X L; N2 Z- f2 F
目录) w9 Q+ v% {: L% h
朴素贝叶斯分类器(NB:naive Bayes classifiers)& h' t* N/ E* C1 S2 K w: h5 ]/ ~1 V
半朴素贝叶斯分类器(SNB:semi-naive Bayes classifiers)/ P0 D! E% j4 A7 S
贝叶斯网(信念网)* ~6 T8 Y, E9 G5 R+ ^) h9 [6 Z
决策树(decision tree)8 ?5 Z! |9 j0 u& c1 p1 y
支持向量机(SVM) g7 W7 ?! G0 s5 i) H. ~" O- q1 j
神经网络
/ R& I$ ] G+ W3 w词向量(word2vec)
- O# _$ G+ G d; ^0 \5 _2 Gk近邻分类(kNN)" p$ q0 h( o# \! P5 r3 O& l
线性模型+ D# d" B4 k. H) W v- ], O
高斯混合聚类与k均值(k-means)及其变种(k-means++、ISODATA、Kernel K-means)的对比4 ?, n0 V% k/ t0 `
关于学习算法的性能实验结果
0 q' S2 x8 B- \/ \# d. X% h( P朴素贝叶斯分类器(NB:naive Bayes classifiers). T4 E* Q( V- {% Q. w
顾名思义,其适用于分类任务、并且假设每个属性独立地对分类结果发生影响,然而现实中各个因素往往并不独立,那是否就无法解决问题呢?: g7 L$ ~; D5 q3 z8 x! a
事实上并非如此,相反,朴素贝叶斯分类器在很多情况下都能获得相当好的性能,一种解释是:无需精准概率值即可导致正确分类结果;另一种解释是:若属性间依赖对所有类别影响相同,或依赖关系的影响能相互抵消,则属性条件独立性假设在降低计算开销的同时,不会对性能产生负面影响。
& v* W2 e8 r+ p9 d0 m) W" f [( G: f, Y/ |! @
优点: U. ~- V& C6 O& m$ j/ B
1、计算量较小
9 u; @, K$ O m+ R# I* p: t$ u2、支持懒惰学习、增量学习, M* w8 i# t* ?2 R& w% W/ \
3、对缺失数据不太敏感& ^" O b4 h' {3 k, K8 V& x, B
4、推断即查表,速度极快。' \, ~ [5 F# M
缺点:
, J& Y5 z, o( U+ r5 _5 e1、没有考虑属性间依赖. T/ G: l R8 H
2、通过类先验概率产生模型
, B" L: n8 g5 e6 _- O
* W: x6 i0 q6 P5 }半朴素贝叶斯分类器(SNB:semi-naive Bayes classifiers), U. O/ \2 J' u* T3 V( E) p
相比NB的不考虑依赖,SNB则是考虑了一个(独依赖估计策略:ODE)或多个(多依赖估计策略:kDE)属性依赖
$ L! m" j C3 C) T: O2 N5 Z优点:% K7 `7 b6 D( V" M8 V
1、考虑了一个或多个比较强的属性依赖关系,泛化性能可能得到提升, z7 V4 m4 k$ q; _
2、计算开销不大- S3 J/ C( k/ W; x0 {, Y; ~& W
3、同样支持懒惰学习、增量学习. x( E( o& k5 Q/ V" _2 f
缺点:
' w h, x* I5 \9 t/ {5 B/ d1、通过类先验概率产生模型+ M1 u" z* ?( s; j
2 y/ B3 E, t- ^* a贝叶斯网(信念网)" l% y7 u5 T3 q V% Q, Q# M! Q
贝叶斯网借助有向无环图刻画属性之间的依赖关系,通过吉布斯采样或者变分推断等方式来近似推断后验概率。, F0 E: { G7 n h; ?
优点:
0 t) R+ W8 B2 M" a+ ?1、更加完整地考虑了属性间依赖关系,泛化性能将进一步提升; `# _! o a0 }$ ^
2、近似估算后验概率% d3 b: k/ b( B6 k
3、可用于推测属性缺失的样本
* i$ ^, o4 f8 d% @9 P4、良好的可解释性
' D `% {; K' @5、常用于语音识别、机器翻译等& o* v* j X) j5 A
缺点:
4 H* A' w( o( W5 [' B6 U1、结构学习NP难,通过评分搜索方法缓解0 \4 j( Q5 D+ g# I c# ~+ p* N5 u
2、推断算法的收敛速度较慢7 w; @7 Y3 r7 |1 s- D. p3 s
( ^* w+ O3 Y! Q7 @1 |
决策树(decision tree)
' z# T( }4 Q( Z; l! G决策树通过信息纯度(信息增益、增益率、基尼指数等)来决定结点的生成,通过剪枝来缩小决策树的尺寸以及缓解过拟合。是一种非参数学习算法。
0 n" E/ ^) P4 E- M* O优点:
7 }4 @! z& m" `5 }- t" {1、计算量较小$ D! j4 [$ Q& ?2 s4 a
2、清晰表达属性的重要程度9 Z: K" p# F5 f% O9 K$ a: u
3、可增量学习对模型进行部分重构) V! I/ F5 g: B0 M6 v, [
4、不需要任何领域知识和参数假设
$ G8 S, J5 w4 d* @# @9 ~, \* _# d5、适合高维数据
6 L# r/ q) D, h" J# Q6、随机森林是基于决策树的集成学习策略,随机森林鲜有短板4 z9 S: A9 @" w. Y: ~
缺点:" J3 o$ L; t2 C8 b B; C
1、没有考虑属性间依赖
2 [* e# v6 A2 p- h( T2、容易过拟合,通过剪枝缓解
( }8 t5 E& R1 p* S& M3、不可用于推测属性缺失的样本
) C' v+ s6 a g7 n$ e* o
' ^2 J; i2 S5 @' {" L支持向量机(SVM)2 B& }. S1 z4 N: Y, E) o) ~; `
基于训练集D在样本空间中找到一个划分超平面,将不同类别的样本分开,是一种针对二分类设计的算法,但稍加改造为支持向量回归即可用于回归学习。
: B0 f& P. \" K* m优点:
+ ?. o Q( v4 A# n/ B- r u1、可解决小样本的机器学习任务
, V! }& E! f; W4 S% S2、可解决高维问题7 G* H. z5 }+ b1 H
3、可通过核方法解决非线性问题
* K6 x- [' t- K$ D- n/ k缺点:
- Q; }' f# Y' O1、对缺失数据敏感: V1 W6 X6 e% P C% k R$ X C
2、对于非线性问题,核函数方法选择一直是个未决问题
% B9 w, f6 ?% ^* \* B$ S+ n
+ S; U6 m/ p0 b6 E% c* d神经网络
7 F R% B) W: ?0 }优点:
8 e/ J6 W& k, _* v! G1 a# L$ }1、分类的准确度极高
* p% H3 t- l4 m1 I2、可解决复杂的非线性问题% n+ h6 p) P: a& i. l
3、对噪声神经有较强的鲁棒性和容错能力
8 x& }) _# X5 O; P4、并行分布处理能力强,分布存储及学习能力强
; i+ e! L# r. s+ N0 v2 j5、常用于图像识别4 V# K$ ^& o! i; I) a+ X4 A
6、数据量越大,表现越好& x; _, P" t# ^- J6 K
缺点:7 ~; c9 y( S' N T6 b6 o
1、黑箱模型,难以解释8 j( Z% A$ I0 w. X/ L" P
2、需要初始化以及训练大量参数,如网络结构、权值、阈值,计算复杂- D8 B# D: L0 O9 |
3、误差逆传播的损失# L% c/ w& k0 f" a. K9 U5 `
4、容易陷入局部最小
- @; k" A5 P/ m* j- L9 Y+ @# e. B# k7 S( x \; ?- z: l5 c
词向量(word2vec)+ x0 j' E8 h& F7 |) R
将文章的每句话当成一行,将每个词用符号隔开(如使用中文分词工具jieba),根据上下文,可以找出相似词义的词。
! k3 v u5 Y( D m比如:我 喜欢 你,我 爱 你,我 讨厌 你。根据上下文我和你,可以找到喜欢的相似词,有爱和讨厌。
) i0 b! G8 J- y2 w- q再一般地如:1 2 3 X 4 5 6,1 2 3 Y 4 5 6。根据上下文1 2 3和4 5 6,可以找到X和Y相似。
( y/ C. w+ P7 G$ V2 Lgensim是一个很好用的Python NLP的包,不光可以用于使用word2vec,还有很多其他的API可以用。它封装了google的C语言版的word2vec。
& y) W; j% M; r4 D$ |' ?7 C) X) J. h* s9 Y) d. P, u
k近邻分类(kNN)( ?6 J! l- [' [ m% L& r# O7 v: _
基于某种距离度量找出训练集中与其最靠近的k个训练样本,或者指定距离e之内的训练样本,分类任务中通过投票法(以及加权投票等)将出现最多的类别标记作为预测结果,回归任务中则使用平均法(以及加权平均等)
' p! e+ K1 E( |+ M" w4 k& E优点:
2 \, T3 K* j$ y# `1、思想简单,易于理解,易于实现,无需估计参数,无需训练;! ^+ r, Z, {3 T! A/ n
2、适合对稀有事件进行分类;
* L- y# [/ P2 ^* d! k0 Z3、特别适用于多分类问题
; ?) M, h& B3 R3 P缺点:
# h0 n9 `- }2 q) [8 u$ C1、需要计算出待测样本与所有样本的距离,计算量大; c: q+ N3 X8 j0 a" A: x
2、样本不平衡时影响大
& Q0 x) G. M1 U. e3、适用的特征维度低
# o, h0 g( ]) ^5 U; t |( n+ a
5 s$ r1 C- i) K( q8 H: {) {. y线性模型" X% g. l# v2 J1 M- }9 H
优点:
7 c( v% x1 W7 z3 p1、算法简单,编程方便& f9 \- g0 b& ]3 m, N& {
2、计算简单,决策速度快% R5 c) o1 |2 K" W
缺点:% f5 v- B! p Q( v
1、拟合效果较差
8 E. C' k* G3 |! {- e& m( H# E q* R9 p
高斯混合聚类与k均值(k-means)及其变种(k-means++、ISODATA、Kernel K-means)的对比
/ H5 `8 F! h( I7 q% }9 J: e9 Kk-means是高斯混合聚类在混合成分方差相等、且每个样本仅指派给一个混合成分时的特例,因此k-means计算简单,但效果不如高斯混合聚类
+ q2 t$ @1 t9 |5 C( K6 R# i6 p由于计算太过复杂,高斯混合聚类并不常用,推荐使用k-means++(与k-means随机选定不同,k-means++初始选定的几个样本距离尽量远,这样能更快得出分簇结果)等k-means变种。
3 g; O6 v) Y; l0 t! p
+ a& l/ F* S) n% C' Z关于学习算法的性能实验结果
4 [/ V# ^) P0 x/ ?5 {+ F# }点击查看原文
1 Z) N* l; u0 V8 ]+ Y$ `6 V: P( x* c
14年的时候有人做过一个实验[1],比较在不同数据集上(121个),不同的分类器(179个)的实际效果。
) N- g! \8 }) a6 Z$ `: S5 P3 K1 m论文题为:Do we Need Hundreds of Classifiers to Solve Real World Classification Problems?1 c- m2 Q; t: M- W' g* p' N+ i
没有最好的分类器,只有最合适的分类器。- \9 {# G. P* O8 w2 X
1、随机森林平均来说最强,但也只在9.9%的数据集上拿到了第一,优点是鲜有短板。0 S6 Z& }3 x) N
2、SVM的平均水平紧随其后,在10.7%的数据集上拿到第一。
X# _ A/ V1 Z9 j2 C3、神经网络(13.2%)和boosting(~9%)表现不错。
$ t2 J e' g, \: T+ Z4、数据维度越高,随机森林就比AdaBoost强越多,但是整体不及SVM[2]。
+ F% ~; d& A, v0 e2 ~ _5、数据量越大,神经网络就越强。
' ]5 s/ a; j8 Y. P0 M————————————————
k( ^# b: ?' y! }9 V版权声明:本文为CSDN博主「路飞的纯白世界」的原创文章,遵循CC 4.0 BY-SA版权协议,转载请附上原文出处链接及本声明。
; ^7 Z; F" Q0 Y$ G7 l9 D+ c原文链接:https://blog.csdn.net/u010921136/article/details/90668382
0 Z2 X' v6 [* i' R. c$ M* Q
8 \* Z* c4 D2 }6 e) w/ }& F0 ?. E- m! t5 s: C6 d$ C- m2 }6 l
|
zan
|