- 在线时间
- 1630 小时
- 最后登录
- 2024-1-29
- 注册时间
- 2017-5-16
- 听众数
- 82
- 收听数
- 1
- 能力
- 120 分
- 体力
- 566739 点
- 威望
- 12 点
- 阅读权限
- 255
- 积分
- 175245
- 相册
- 1
- 日志
- 0
- 记录
- 0
- 帖子
- 5313
- 主题
- 5273
- 精华
- 3
- 分享
- 0
- 好友
- 163
TA的每日心情 | 开心 2021-8-11 17:59 |
|---|
签到天数: 17 天 [LV.4]偶尔看看III 网络挑战赛参赛者 网络挑战赛参赛者 - 自我介绍
- 本人女,毕业于内蒙古科技大学,担任文职专业,毕业专业英语。
 群组: 2018美赛大象算法课程 群组: 2018美赛护航培训课程 群组: 2019年 数学中国站长建 群组: 2019年数据分析师课程 群组: 2018年大象老师国赛优 |
, E. d. |2 O9 `$ L& a; w各类机器学习算法的优缺点和适用场景汇总
. q' ]& g' c, ~) O+ ]- H目录1 E3 \4 y4 G' ^
朴素贝叶斯分类器(NB:naive Bayes classifiers)" N0 P9 e' Y, g3 s4 ]6 M
半朴素贝叶斯分类器(SNB:semi-naive Bayes classifiers). e c7 g6 Y$ d6 W
贝叶斯网(信念网)/ ?) B5 ^; K; X3 X# h' Z
决策树(decision tree)
+ i4 Z2 g9 m7 u0 } Y) G9 R支持向量机(SVM)1 o5 ~. J0 t& ]. T! T
神经网络
" `( z, ]3 [. `1 g. L1 _! Z词向量(word2vec)
* N& x3 O# o* `' Mk近邻分类(kNN)
: g9 m0 B/ ?" T! Q( v线性模型. Z! |$ T" r1 M8 K) a5 `7 h% V. U
高斯混合聚类与k均值(k-means)及其变种(k-means++、ISODATA、Kernel K-means)的对比
+ t. J0 n, ?& l/ `- N- Y* v6 M关于学习算法的性能实验结果
* B5 e- }$ @: ~( c4 ]朴素贝叶斯分类器(NB:naive Bayes classifiers)5 G5 h# L' M1 R8 L* H
顾名思义,其适用于分类任务、并且假设每个属性独立地对分类结果发生影响,然而现实中各个因素往往并不独立,那是否就无法解决问题呢?
0 J' ]/ @' I e( `" [( j" h, _+ [事实上并非如此,相反,朴素贝叶斯分类器在很多情况下都能获得相当好的性能,一种解释是:无需精准概率值即可导致正确分类结果;另一种解释是:若属性间依赖对所有类别影响相同,或依赖关系的影响能相互抵消,则属性条件独立性假设在降低计算开销的同时,不会对性能产生负面影响。
8 E( w0 q' q: `/ c& w0 w0 s( T) t! H u+ c4 ]
优点:
2 H. w- J) H4 g8 Z4 T1、计算量较小7 J0 z' I5 n$ y, i( a ?
2、支持懒惰学习、增量学习; V6 C$ b4 U4 V ?# R) g
3、对缺失数据不太敏感
+ y; e0 [1 s1 o/ W4、推断即查表,速度极快。; t( Z z2 r; W+ f, l( [
缺点:
W, ] B. z+ d7 b1、没有考虑属性间依赖
$ W* s1 h+ i: X X" C3 S* n. a2、通过类先验概率产生模型
: E! i! ^( U$ I0 u, `0 F8 I4 p* n% I, o/ f. V' v4 j' c
半朴素贝叶斯分类器(SNB:semi-naive Bayes classifiers)
- W) i) T: n, Z7 o" ` b相比NB的不考虑依赖,SNB则是考虑了一个(独依赖估计策略:ODE)或多个(多依赖估计策略:kDE)属性依赖0 y! J6 H8 A% }
优点:1 { W: u3 V4 C. f
1、考虑了一个或多个比较强的属性依赖关系,泛化性能可能得到提升
# h, k& T9 I" U( U& [' P& Z' \! h7 O2、计算开销不大
7 n4 o: \" Y6 e8 x! A; c3、同样支持懒惰学习、增量学习1 Z3 W8 C- X( ?7 [6 z
缺点:
- B" }8 B5 y! X0 U1、通过类先验概率产生模型
; c2 v: a# _. [) @5 Y/ T6 u5 D" Z! M$ D' n6 l# b
贝叶斯网(信念网)* o7 D# `' L5 }5 V1 s- T
贝叶斯网借助有向无环图刻画属性之间的依赖关系,通过吉布斯采样或者变分推断等方式来近似推断后验概率。
5 H0 Q- o: a k* v4 X( f/ A+ Q优点: D) h2 t0 B! H8 J1 o
1、更加完整地考虑了属性间依赖关系,泛化性能将进一步提升
' J6 C& _5 t7 c; l0 y2、近似估算后验概率& y4 b2 N% V- l& p2 t( U
3、可用于推测属性缺失的样本6 x0 r' h& F' r$ T$ D$ z4 g
4、良好的可解释性4 m: `! j! _6 V: i6 U8 e
5、常用于语音识别、机器翻译等, j& g6 [- p" }( V
缺点:
* o. {9 I0 y" v9 ^6 P5 k) d1、结构学习NP难,通过评分搜索方法缓解
# D5 `: i& c6 g3 d1 s2、推断算法的收敛速度较慢
" b& c1 Y# p7 w. l) ^/ Z I6 ?9 \8 D* h# r' ?# c$ M% P
决策树(decision tree)
( e$ b, w2 _6 y, p$ j' K& E* I决策树通过信息纯度(信息增益、增益率、基尼指数等)来决定结点的生成,通过剪枝来缩小决策树的尺寸以及缓解过拟合。是一种非参数学习算法。8 T- M; x* y$ M& ~
优点:3 E+ P9 Z R* h; ~" O
1、计算量较小( u+ q# Q* J. h& p* @* ~
2、清晰表达属性的重要程度/ Z9 K+ O5 @$ D, J
3、可增量学习对模型进行部分重构
1 m8 ]0 ^" O% `5 l _7 b3 l4、不需要任何领域知识和参数假设
8 x1 C2 i! k( L v Q8 {& p3 {5、适合高维数据5 w( o/ k6 k. R/ e: ~" T, j. T0 s
6、随机森林是基于决策树的集成学习策略,随机森林鲜有短板
" ?* W1 e2 l& D缺点:
2 c/ Y+ [# a2 ^7 r" v/ _1、没有考虑属性间依赖# P2 w. f' ~6 c. J9 ~7 k+ g3 F7 x" x
2、容易过拟合,通过剪枝缓解4 u1 j. u% C0 f6 C
3、不可用于推测属性缺失的样本5 m Z: b: d; {& _! s
. v* r7 c E; n! H! p" _+ I支持向量机(SVM)
% f2 L* q! s V7 C/ x4 W基于训练集D在样本空间中找到一个划分超平面,将不同类别的样本分开,是一种针对二分类设计的算法,但稍加改造为支持向量回归即可用于回归学习。
: E0 U: _6 k1 L( k优点:. x, {7 p- _/ Q8 s! E2 B
1、可解决小样本的机器学习任务0 O) F6 H" j* S2 D. k+ Y# Z; J
2、可解决高维问题: h" J7 v/ f, o: Q# G
3、可通过核方法解决非线性问题
7 j- @4 ]9 t' m8 l; H( {( i, X+ n/ O+ E缺点:
. j8 X( D8 N% t, _1、对缺失数据敏感* f! s6 W6 R9 b6 i
2、对于非线性问题,核函数方法选择一直是个未决问题* V! \6 ^5 q+ a' x1 T4 h
9 U: o: \! [; b0 s神经网络
4 d0 P8 x k+ w- s' A优点:
: f3 P( |: g/ s+ Z1、分类的准确度极高
, U8 {, _1 O/ M p6 ^; _/ ~2、可解决复杂的非线性问题; A- D8 Z! K* M, C
3、对噪声神经有较强的鲁棒性和容错能力
3 \" ?* h% I6 Z2 U% Y4、并行分布处理能力强,分布存储及学习能力强
$ K, p+ ]3 o$ ^% Z5、常用于图像识别
! r0 E9 t1 N( w5 ~" h* x% J2 ^6、数据量越大,表现越好
' t! L }) g. J6 N: O8 `缺点:
# ~* N. t _! I+ s3 J1、黑箱模型,难以解释
b) r& h. T/ b2、需要初始化以及训练大量参数,如网络结构、权值、阈值,计算复杂
' f* Z! ?/ o A, g3、误差逆传播的损失% V; S8 I! U6 Y: o% _/ `; A
4、容易陷入局部最小
5 |: `& J0 } `6 `4 b$ j; ?
1 q, _. K9 J: v+ p7 @ j词向量(word2vec)+ o' u* R# Y* z7 `) ~
将文章的每句话当成一行,将每个词用符号隔开(如使用中文分词工具jieba),根据上下文,可以找出相似词义的词。
* s* ?+ p+ P2 ~4 W8 u- v* A" H, }比如:我 喜欢 你,我 爱 你,我 讨厌 你。根据上下文我和你,可以找到喜欢的相似词,有爱和讨厌。
! a1 y8 u0 Q& }, Z3 z再一般地如:1 2 3 X 4 5 6,1 2 3 Y 4 5 6。根据上下文1 2 3和4 5 6,可以找到X和Y相似。) X4 L% X0 n$ n6 W5 t. s
gensim是一个很好用的Python NLP的包,不光可以用于使用word2vec,还有很多其他的API可以用。它封装了google的C语言版的word2vec。
3 y. \) B; V: V0 g& G( R F: ?; O. H) s8 R( T( q, U
k近邻分类(kNN)
9 A b2 e% {/ ]; C2 b; P基于某种距离度量找出训练集中与其最靠近的k个训练样本,或者指定距离e之内的训练样本,分类任务中通过投票法(以及加权投票等)将出现最多的类别标记作为预测结果,回归任务中则使用平均法(以及加权平均等); I* n/ L. M! v* k. {( Z. O
优点:
( C* ^7 f# V; V; R- W; `1、思想简单,易于理解,易于实现,无需估计参数,无需训练;
/ z& g3 _# K* g1 Y8 \4 x3 o2、适合对稀有事件进行分类;
* D( R! C: o+ e1 [: O3、特别适用于多分类问题$ ?- |8 e1 \3 X- v" p4 y% @
缺点:7 k2 V% Y! U4 q+ @ I3 m7 P
1、需要计算出待测样本与所有样本的距离,计算量大% X& Z, y- @; I" d
2、样本不平衡时影响大/ N8 S+ ?+ P# l. Q8 I1 T3 l
3、适用的特征维度低
" w3 B9 V7 j1 b; T% a1 Y& b
1 I" P/ j& V5 l3 R; i线性模型
7 ]; V1 |+ R4 w优点:' |( D! v; y6 D) l
1、算法简单,编程方便
) E& ~" u, [( z( d1 o2、计算简单,决策速度快
0 k( s: |/ Z+ z" ^$ ]: i缺点:
. ^9 n" |0 p/ I( G. a5 k1、拟合效果较差# I% t; L1 o5 C) H) u
5 ~3 h+ V. K* ^& ~
高斯混合聚类与k均值(k-means)及其变种(k-means++、ISODATA、Kernel K-means)的对比" F# c/ r: ~* w% M) q. {
k-means是高斯混合聚类在混合成分方差相等、且每个样本仅指派给一个混合成分时的特例,因此k-means计算简单,但效果不如高斯混合聚类$ v- r/ \( }, K$ _2 o& |' F
由于计算太过复杂,高斯混合聚类并不常用,推荐使用k-means++(与k-means随机选定不同,k-means++初始选定的几个样本距离尽量远,这样能更快得出分簇结果)等k-means变种。3 N# J7 O3 J& _1 s: H1 Q
/ P% b/ a8 M6 d* I; O
关于学习算法的性能实验结果
3 @( p& D/ O4 g% |. R点击查看原文1 @+ m% c5 o. {3 W- I/ K& O
: l; f" l6 W) `! f* J8 ^
14年的时候有人做过一个实验[1],比较在不同数据集上(121个),不同的分类器(179个)的实际效果。
8 @$ y( Y$ o2 G" f( T$ p论文题为:Do we Need Hundreds of Classifiers to Solve Real World Classification Problems?
+ ]5 T1 A- E' p8 p0 |: E没有最好的分类器,只有最合适的分类器。9 ^* O4 G; ]3 ]+ s
1、随机森林平均来说最强,但也只在9.9%的数据集上拿到了第一,优点是鲜有短板。( @' E5 h9 b( [) D) }4 |8 \
2、SVM的平均水平紧随其后,在10.7%的数据集上拿到第一。- e3 n. W4 e+ u9 Z1 a* n' j& A1 J3 W
3、神经网络(13.2%)和boosting(~9%)表现不错。
9 v5 \- ^+ y' d" Q, P4、数据维度越高,随机森林就比AdaBoost强越多,但是整体不及SVM[2]。
3 A8 @8 V0 ~6 |+ L+ k9 \( p5、数据量越大,神经网络就越强。
, F' J4 ?/ U) ?; x+ Q————————————————! n$ c4 R# i" z6 }; H$ r
版权声明:本文为CSDN博主「路飞的纯白世界」的原创文章,遵循CC 4.0 BY-SA版权协议,转载请附上原文出处链接及本声明。
* z4 b8 C6 w9 N L7 Y1 z5 `原文链接:https://blog.csdn.net/u010921136/article/details/90668382
6 S! _' `; M: g4 ~% a& _5 h. o( W2 e- D
u4 j' }' R7 p, R; r |
zan
|