QQ登录

只需要一步,快速开始

 注册地址  找回密码
查看: 2081|回复: 0
打印 上一主题 下一主题

各类机器学习算法的优缺点和适用场景汇总

[复制链接]
字体大小: 正常 放大
杨利霞        

5273

主题

82

听众

17万

积分

  • TA的每日心情
    开心
    2021-8-11 17:59
  • 签到天数: 17 天

    [LV.4]偶尔看看III

    网络挑战赛参赛者

    网络挑战赛参赛者

    自我介绍
    本人女,毕业于内蒙古科技大学,担任文职专业,毕业专业英语。

    群组2018美赛大象算法课程

    群组2018美赛护航培训课程

    群组2019年 数学中国站长建

    群组2019年数据分析师课程

    群组2018年大象老师国赛优

    跳转到指定楼层
    1#
    发表于 2021-4-10 11:24 |只看该作者 |倒序浏览
    |招呼Ta 关注Ta

    , E. d. |2 O9 `$ L& a; w各类机器学习算法的优缺点和适用场景汇总
    . q' ]& g' c, ~) O+ ]- H目录1 E3 \4 y4 G' ^
    朴素贝叶斯分类器(NB:naive Bayes classifiers)" N0 P9 e' Y, g3 s4 ]6 M
    半朴素贝叶斯分类器(SNB:semi-naive Bayes classifiers). e  c7 g6 Y$ d6 W
    贝叶斯网(信念网)/ ?) B5 ^; K; X3 X# h' Z
    决策树(decision tree)
    + i4 Z2 g9 m7 u0 }  Y) G9 R支持向量机(SVM)1 o5 ~. J0 t& ]. T! T
    神经网络
    " `( z, ]3 [. `1 g. L1 _! Z词向量(word2vec)
    * N& x3 O# o* `' Mk近邻分类(kNN)
    : g9 m0 B/ ?" T! Q( v线性模型. Z! |$ T" r1 M8 K) a5 `7 h% V. U
    高斯混合聚类与k均值(k-means)及其变种(k-means++、ISODATA、Kernel K-means)的对比
    + t. J0 n, ?& l/ `- N- Y* v6 M关于学习算法的性能实验结果
    * B5 e- }$ @: ~( c4 ]朴素贝叶斯分类器(NB:naive Bayes classifiers)5 G5 h# L' M1 R8 L* H
    顾名思义,其适用于分类任务、并且假设每个属性独立地对分类结果发生影响,然而现实中各个因素往往并不独立,那是否就无法解决问题呢?
    0 J' ]/ @' I  e( `" [( j" h, _+ [事实上并非如此,相反,朴素贝叶斯分类器在很多情况下都能获得相当好的性能,一种解释是:无需精准概率值即可导致正确分类结果;另一种解释是:若属性间依赖对所有类别影响相同,或依赖关系的影响能相互抵消,则属性条件独立性假设在降低计算开销的同时,不会对性能产生负面影响。
    8 E( w0 q' q: `/ c& w0 w0 s( T) t! H  u+ c4 ]
    优点:
    2 H. w- J) H4 g8 Z4 T1、计算量较小7 J0 z' I5 n$ y, i( a  ?
    2、支持懒惰学习、增量学习; V6 C$ b4 U4 V  ?# R) g
    3、对缺失数据不太敏感
    + y; e0 [1 s1 o/ W4、推断即查表,速度极快。; t( Z  z2 r; W+ f, l( [
    缺点:
      W, ]  B. z+ d7 b1、没有考虑属性间依赖
    $ W* s1 h+ i: X  X" C3 S* n. a2、通过类先验概率产生模型
    : E! i! ^( U$ I0 u, `0 F8 I4 p* n% I, o/ f. V' v4 j' c
    半朴素贝叶斯分类器(SNB:semi-naive Bayes classifiers)
    - W) i) T: n, Z7 o" `  b相比NB的不考虑依赖,SNB则是考虑了一个(独依赖估计策略:ODE)或多个(多依赖估计策略:kDE)属性依赖0 y! J6 H8 A% }
    优点:1 {  W: u3 V4 C. f
    1、考虑了一个或多个比较强的属性依赖关系,泛化性能可能得到提升
    # h, k& T9 I" U( U& [' P& Z' \! h7 O2、计算开销不大
    7 n4 o: \" Y6 e8 x! A; c3、同样支持懒惰学习、增量学习1 Z3 W8 C- X( ?7 [6 z
    缺点:
    - B" }8 B5 y! X0 U1、通过类先验概率产生模型
    ; c2 v: a# _. [) @5 Y/ T6 u5 D" Z! M$ D' n6 l# b
    贝叶斯网(信念网)* o7 D# `' L5 }5 V1 s- T
    贝叶斯网借助有向无环图刻画属性之间的依赖关系,通过吉布斯采样或者变分推断等方式来近似推断后验概率。
    5 H0 Q- o: a  k* v4 X( f/ A+ Q优点:  D) h2 t0 B! H8 J1 o
    1、更加完整地考虑了属性间依赖关系,泛化性能将进一步提升
    ' J6 C& _5 t7 c; l0 y2、近似估算后验概率& y4 b2 N% V- l& p2 t( U
    3、可用于推测属性缺失的样本6 x0 r' h& F' r$ T$ D$ z4 g
    4、良好的可解释性4 m: `! j! _6 V: i6 U8 e
    5、常用于语音识别、机器翻译等, j& g6 [- p" }( V
    缺点:
    * o. {9 I0 y" v9 ^6 P5 k) d1、结构学习NP难,通过评分搜索方法缓解
    # D5 `: i& c6 g3 d1 s2、推断算法的收敛速度较慢
    " b& c1 Y# p7 w. l) ^/ Z  I6 ?9 \8 D* h# r' ?# c$ M% P
    决策树(decision tree)
    ( e$ b, w2 _6 y, p$ j' K& E* I决策树通过信息纯度(信息增益、增益率、基尼指数等)来决定结点的生成,通过剪枝来缩小决策树的尺寸以及缓解过拟合。是一种非参数学习算法。8 T- M; x* y$ M& ~
    优点:3 E+ P9 Z  R* h; ~" O
    1、计算量较小( u+ q# Q* J. h& p* @* ~
    2、清晰表达属性的重要程度/ Z9 K+ O5 @$ D, J
    3、可增量学习对模型进行部分重构
    1 m8 ]0 ^" O% `5 l  _7 b3 l4、不需要任何领域知识和参数假设
    8 x1 C2 i! k( L  v  Q8 {& p3 {5、适合高维数据5 w( o/ k6 k. R/ e: ~" T, j. T0 s
    6、随机森林是基于决策树的集成学习策略,随机森林鲜有短板
    " ?* W1 e2 l& D缺点:
    2 c/ Y+ [# a2 ^7 r" v/ _1、没有考虑属性间依赖# P2 w. f' ~6 c. J9 ~7 k+ g3 F7 x" x
    2、容易过拟合,通过剪枝缓解4 u1 j. u% C0 f6 C
    3、不可用于推测属性缺失的样本5 m  Z: b: d; {& _! s

    . v* r7 c  E; n! H! p" _+ I支持向量机(SVM)
    % f2 L* q! s  V7 C/ x4 W基于训练集D在样本空间中找到一个划分超平面,将不同类别的样本分开,是一种针对二分类设计的算法,但稍加改造为支持向量回归即可用于回归学习。
    : E0 U: _6 k1 L( k优点:. x, {7 p- _/ Q8 s! E2 B
    1、可解决小样本的机器学习任务0 O) F6 H" j* S2 D. k+ Y# Z; J
    2、可解决高维问题: h" J7 v/ f, o: Q# G
    3、可通过核方法解决非线性问题
    7 j- @4 ]9 t' m8 l; H( {( i, X+ n/ O+ E缺点:
    . j8 X( D8 N% t, _1、对缺失数据敏感* f! s6 W6 R9 b6 i
    2、对于非线性问题,核函数方法选择一直是个未决问题* V! \6 ^5 q+ a' x1 T4 h

    9 U: o: \! [; b0 s神经网络
    4 d0 P8 x  k+ w- s' A优点:
    : f3 P( |: g/ s+ Z1、分类的准确度极高
    , U8 {, _1 O/ M  p6 ^; _/ ~2、可解决复杂的非线性问题; A- D8 Z! K* M, C
    3、对噪声神经有较强的鲁棒性和容错能力
    3 \" ?* h% I6 Z2 U% Y4、并行分布处理能力强,分布存储及学习能力强
    $ K, p+ ]3 o$ ^% Z5、常用于图像识别
    ! r0 E9 t1 N( w5 ~" h* x% J2 ^6、数据量越大,表现越好
    ' t! L  }) g. J6 N: O8 `缺点:
    # ~* N. t  _! I+ s3 J1、黑箱模型,难以解释
      b) r& h. T/ b2、需要初始化以及训练大量参数,如网络结构、权值、阈值,计算复杂
    ' f* Z! ?/ o  A, g3、误差逆传播的损失% V; S8 I! U6 Y: o% _/ `; A
    4、容易陷入局部最小
    5 |: `& J0 }  `6 `4 b$ j; ?
    1 q, _. K9 J: v+ p7 @  j词向量(word2vec)+ o' u* R# Y* z7 `) ~
    将文章的每句话当成一行,将每个词用符号隔开(如使用中文分词工具jieba),根据上下文,可以找出相似词义的词。
    * s* ?+ p+ P2 ~4 W8 u- v* A" H, }比如:我 喜欢 你,我 爱 你,我 讨厌 你。根据上下文我和你,可以找到喜欢的相似词,有爱和讨厌。
    ! a1 y8 u0 Q& }, Z3 z再一般地如:1 2 3 X 4 5 6,1 2 3 Y 4 5 6。根据上下文1 2 3和4 5 6,可以找到X和Y相似。) X4 L% X0 n$ n6 W5 t. s
    gensim是一个很好用的Python NLP的包,不光可以用于使用word2vec,还有很多其他的API可以用。它封装了google的C语言版的word2vec。
    3 y. \) B; V: V0 g& G( R  F: ?; O. H) s8 R( T( q, U
    k近邻分类(kNN)
    9 A  b2 e% {/ ]; C2 b; P基于某种距离度量找出训练集中与其最靠近的k个训练样本,或者指定距离e之内的训练样本,分类任务中通过投票法(以及加权投票等)将出现最多的类别标记作为预测结果,回归任务中则使用平均法(以及加权平均等); I* n/ L. M! v* k. {( Z. O
    优点:
    ( C* ^7 f# V; V; R- W; `1、思想简单,易于理解,易于实现,无需估计参数,无需训练;
    / z& g3 _# K* g1 Y8 \4 x3 o2、适合对稀有事件进行分类;
    * D( R! C: o+ e1 [: O3、特别适用于多分类问题$ ?- |8 e1 \3 X- v" p4 y% @
    缺点:7 k2 V% Y! U4 q+ @  I3 m7 P
    1、需要计算出待测样本与所有样本的距离,计算量大% X& Z, y- @; I" d
    2、样本不平衡时影响大/ N8 S+ ?+ P# l. Q8 I1 T3 l
    3、适用的特征维度低
    " w3 B9 V7 j1 b; T% a1 Y& b
    1 I" P/ j& V5 l3 R; i线性模型
    7 ]; V1 |+ R4 w优点:' |( D! v; y6 D) l
    1、算法简单,编程方便
    ) E& ~" u, [( z( d1 o2、计算简单,决策速度快
    0 k( s: |/ Z+ z" ^$ ]: i缺点:
    . ^9 n" |0 p/ I( G. a5 k1、拟合效果较差# I% t; L1 o5 C) H) u
    5 ~3 h+ V. K* ^& ~
    高斯混合聚类与k均值(k-means)及其变种(k-means++、ISODATA、Kernel K-means)的对比" F# c/ r: ~* w% M) q. {
    k-means是高斯混合聚类在混合成分方差相等、且每个样本仅指派给一个混合成分时的特例,因此k-means计算简单,但效果不如高斯混合聚类$ v- r/ \( }, K$ _2 o& |' F
    由于计算太过复杂,高斯混合聚类并不常用,推荐使用k-means++(与k-means随机选定不同,k-means++初始选定的几个样本距离尽量远,这样能更快得出分簇结果)等k-means变种。3 N# J7 O3 J& _1 s: H1 Q
    / P% b/ a8 M6 d* I; O
    关于学习算法的性能实验结果
    3 @( p& D/ O4 g% |. R点击查看原文1 @+ m% c5 o. {3 W- I/ K& O
    : l; f" l6 W) `! f* J8 ^
    14年的时候有人做过一个实验[1],比较在不同数据集上(121个),不同的分类器(179个)的实际效果。
    8 @$ y( Y$ o2 G" f( T$ p论文题为:Do we Need Hundreds of Classifiers to Solve Real World Classification Problems?
    + ]5 T1 A- E' p8 p0 |: E没有最好的分类器,只有最合适的分类器。9 ^* O4 G; ]3 ]+ s
    1、随机森林平均来说最强,但也只在9.9%的数据集上拿到了第一,优点是鲜有短板。( @' E5 h9 b( [) D) }4 |8 \
    2、SVM的平均水平紧随其后,在10.7%的数据集上拿到第一。- e3 n. W4 e+ u9 Z1 a* n' j& A1 J3 W
    3、神经网络(13.2%)和boosting(~9%)表现不错。
    9 v5 \- ^+ y' d" Q, P4、数据维度越高,随机森林就比AdaBoost强越多,但是整体不及SVM[2]。
    3 A8 @8 V0 ~6 |+ L+ k9 \( p5、数据量越大,神经网络就越强。
    , F' J4 ?/ U) ?; x+ Q————————————————! n$ c4 R# i" z6 }; H$ r
    版权声明:本文为CSDN博主「路飞的纯白世界」的原创文章,遵循CC 4.0 BY-SA版权协议,转载请附上原文出处链接及本声明。
    * z4 b8 C6 w9 N  L7 Y1 z5 `原文链接:https://blog.csdn.net/u010921136/article/details/90668382
    6 S! _' `; M: g4 ~% a& _5 h. o( W2 e- D

      u4 j' }' R7 p, R; r
    zan
    转播转播0 分享淘帖0 分享分享0 收藏收藏0 支持支持0 反对反对0 微信微信
    您需要登录后才可以回帖 登录 | 注册地址

    qq
    收缩
    • 电话咨询

    • 04714969085
    fastpost

    关于我们| 联系我们| 诚征英才| 对外合作| 产品服务| QQ

    手机版|Archiver| |繁體中文 手机客户端  

    蒙公网安备 15010502000194号

    Powered by Discuz! X2.5   © 2001-2013 数学建模网-数学中国 ( 蒙ICP备14002410号-3 蒙BBS备-0002号 )     论坛法律顾问:王兆丰

    GMT+8, 2026-9-8 20:00 , Processed in 0.397173 second(s), 51 queries .

    回顶部