QQ登录

只需要一步,快速开始

 注册地址  找回密码
查看: 2084|回复: 0
打印 上一主题 下一主题

各类机器学习算法的优缺点和适用场景汇总

[复制链接]
字体大小: 正常 放大
杨利霞        

5273

主题

82

听众

17万

积分

  • TA的每日心情
    开心
    2021-8-11 17:59
  • 签到天数: 17 天

    [LV.4]偶尔看看III

    网络挑战赛参赛者

    网络挑战赛参赛者

    自我介绍
    本人女,毕业于内蒙古科技大学,担任文职专业,毕业专业英语。

    群组2018美赛大象算法课程

    群组2018美赛护航培训课程

    群组2019年 数学中国站长建

    群组2019年数据分析师课程

    群组2018年大象老师国赛优

    跳转到指定楼层
    1#
    发表于 2021-4-10 11:24 |只看该作者 |倒序浏览
    |招呼Ta 关注Ta

    + }* N- ]% x; v* r各类机器学习算法的优缺点和适用场景汇总) |1 Q8 Y! N! s+ s7 U
    目录# |" o  h! ^1 F( O- o1 P
    朴素贝叶斯分类器(NB:naive Bayes classifiers)
    ; o! p1 Q, ^# j5 g  L4 ~半朴素贝叶斯分类器(SNB:semi-naive Bayes classifiers)! Z0 Q' o3 y! P* {
    贝叶斯网(信念网)
    + K6 k* h0 e& j$ p$ v% R决策树(decision tree)4 e  H; d" k7 V& z8 m
    支持向量机(SVM)
    - i6 z9 ?* ?3 O& ?7 _9 g3 N% q/ O神经网络. E8 S8 X3 g& }/ o5 k
    词向量(word2vec)0 }2 T1 g1 E, f* ]' r8 y
    k近邻分类(kNN)7 C( |- E( T% a$ L
    线性模型
    8 O& g% C1 F8 d' w* w6 A高斯混合聚类与k均值(k-means)及其变种(k-means++、ISODATA、Kernel K-means)的对比
    - [# a! Q: Y. F% ?0 J1 u关于学习算法的性能实验结果
    , D1 ~  H, E1 x+ e+ Z( ~5 E0 j2 o( Y1 a朴素贝叶斯分类器(NB:naive Bayes classifiers)/ h% ]- }" m8 W& y& u, A
    顾名思义,其适用于分类任务、并且假设每个属性独立地对分类结果发生影响,然而现实中各个因素往往并不独立,那是否就无法解决问题呢?
    0 h( G3 b0 @0 T7 y事实上并非如此,相反,朴素贝叶斯分类器在很多情况下都能获得相当好的性能,一种解释是:无需精准概率值即可导致正确分类结果;另一种解释是:若属性间依赖对所有类别影响相同,或依赖关系的影响能相互抵消,则属性条件独立性假设在降低计算开销的同时,不会对性能产生负面影响。
    * u4 J" m6 {4 l$ F% C* s: X$ a- j- |7 w8 h# S: A; B. I
    优点:
    ' W: Y6 \) s" n( M0 U3 S# G1、计算量较小
    / Z! ^& I5 M# h/ y* N2、支持懒惰学习、增量学习
    ) J* w6 x1 l9 C1 \/ T- S3 Q3、对缺失数据不太敏感
    9 F1 i; s9 W: E% J4、推断即查表,速度极快。- z- H, W9 ~. J- A- X+ e
    缺点:! ~- \. p- H9 V# m
    1、没有考虑属性间依赖
    # c# w$ f1 U! @" P/ u# {2、通过类先验概率产生模型
    2 ~& i5 x9 s' N0 q3 f  l. l: \! k/ k; g+ [. E1 e; B- i! S" z2 ]
    半朴素贝叶斯分类器(SNB:semi-naive Bayes classifiers)4 s2 w# j/ I) e' w, r
    相比NB的不考虑依赖,SNB则是考虑了一个(独依赖估计策略:ODE)或多个(多依赖估计策略:kDE)属性依赖
    4 B$ R. F3 R8 B8 E  f8 V2 n  f, z优点:
    4 I: o& ^* x% n' h" I1、考虑了一个或多个比较强的属性依赖关系,泛化性能可能得到提升
    - h; r# r9 E* |2、计算开销不大
    ( U2 V3 _* H1 n  u- h( Q. t3 r3、同样支持懒惰学习、增量学习
    8 }5 P8 u) U5 S8 s  d  _缺点:3 ]' I5 K' ^0 j
    1、通过类先验概率产生模型
    % p+ u1 x, g- b
    " w7 v; r' R" w; E- b& C5 j/ ^) i贝叶斯网(信念网)/ e7 W0 J$ W6 b! @5 E4 B# f3 L
    贝叶斯网借助有向无环图刻画属性之间的依赖关系,通过吉布斯采样或者变分推断等方式来近似推断后验概率。( m. t' D5 G1 ~5 x+ a- ~
    优点:
    ) i/ X8 x1 y. Z2 B0 E1、更加完整地考虑了属性间依赖关系,泛化性能将进一步提升0 W0 A. a  t9 C0 C8 H! v; c0 J
    2、近似估算后验概率' W8 O: H' e6 J+ g% W
    3、可用于推测属性缺失的样本  L' e' y# \, V/ x
    4、良好的可解释性
    $ g6 f4 p% ]( i; ?8 M. n; z8 T& f5、常用于语音识别、机器翻译等
    % x8 ~3 i5 _# V) }  e缺点:1 n" _; g" S, C' b1 d: ]5 T
    1、结构学习NP难,通过评分搜索方法缓解3 C! d( c" a6 b. J" t
    2、推断算法的收敛速度较慢
      y- o0 D8 R  R/ K/ ^% J0 t" K/ f
    + a3 Z$ d! X0 x$ u决策树(decision tree)' V% {- I$ ]) c1 \+ S$ }! S* x. R
    决策树通过信息纯度(信息增益、增益率、基尼指数等)来决定结点的生成,通过剪枝来缩小决策树的尺寸以及缓解过拟合。是一种非参数学习算法。. @3 l* q7 ?& Q% g$ s
    优点:3 [7 [% b2 k7 z
    1、计算量较小. P: D6 a1 p! H1 t, G" r6 a4 g
    2、清晰表达属性的重要程度- }9 G( e! U: Z7 o) [/ n
    3、可增量学习对模型进行部分重构& H( C; |: j* p$ j
    4、不需要任何领域知识和参数假设
    / f3 n+ D' X$ {5 S# D5、适合高维数据: c) M& y( c6 S4 g4 v
    6、随机森林是基于决策树的集成学习策略,随机森林鲜有短板. m4 h# q5 k& v6 d2 ?
    缺点:
    : g0 [- _$ V& R9 @. H" A1、没有考虑属性间依赖* g0 R" g+ z- s
    2、容易过拟合,通过剪枝缓解3 ^. o, C# y; v9 P
    3、不可用于推测属性缺失的样本5 h6 H: h, D$ C7 i! V
    3 m( m- f1 Y5 \
    支持向量机(SVM)
    - w' H$ w# D+ K# j0 j1 x基于训练集D在样本空间中找到一个划分超平面,将不同类别的样本分开,是一种针对二分类设计的算法,但稍加改造为支持向量回归即可用于回归学习。
    - X* t) O# F8 c6 [优点:" B. f7 y. Y# `  X- U( P
    1、可解决小样本的机器学习任务
    ( c$ y0 e" Q  K: d1 z0 ]2、可解决高维问题
    8 n0 t/ `  ]! J& |4 ^5 V3、可通过核方法解决非线性问题
    + @1 b: R/ H' O' G7 p1 h; |缺点:. h* S7 e. `/ e. d$ x/ s
    1、对缺失数据敏感
    / T' T8 O7 h  J/ T2、对于非线性问题,核函数方法选择一直是个未决问题
    $ S2 A8 f6 @+ ]
    4 r- `) D6 E1 L+ E" L* C( h神经网络
    7 E: \, S  R/ X& \0 D优点:
    1 t% c7 E$ T/ s6 T/ W: S1、分类的准确度极高
    * {( z4 c5 q9 o# }9 K2、可解决复杂的非线性问题
    / d9 m7 {3 q6 p0 Q- O$ }3、对噪声神经有较强的鲁棒性和容错能力
      ~5 a! Y+ k4 Z' X0 a# z4、并行分布处理能力强,分布存储及学习能力强8 s9 G9 J+ X* b' |6 p
    5、常用于图像识别. M2 e0 e' d. N  ~1 m, q
    6、数据量越大,表现越好5 M9 q( t2 m' @: @+ e4 i& }
    缺点:& D: K6 N* m3 t, I" a. J% Z( Y  p
    1、黑箱模型,难以解释/ f0 W* _- k, ]! q
    2、需要初始化以及训练大量参数,如网络结构、权值、阈值,计算复杂0 x% t- T  u( m/ z) E8 }
    3、误差逆传播的损失% W$ E5 o3 G( S2 l. a* b
    4、容易陷入局部最小
    + M; z( N  Z7 H( l! T0 K3 p& T" I$ L: G: I4 ^  v
    词向量(word2vec)
    " g$ x' y9 C5 O+ W7 ^9 W$ _将文章的每句话当成一行,将每个词用符号隔开(如使用中文分词工具jieba),根据上下文,可以找出相似词义的词。. c. z1 q$ ?- J# |: I
    比如:我 喜欢 你,我 爱 你,我 讨厌 你。根据上下文我和你,可以找到喜欢的相似词,有爱和讨厌。
    " A$ B& o% i1 A* H0 p, o再一般地如:1 2 3 X 4 5 6,1 2 3 Y 4 5 6。根据上下文1 2 3和4 5 6,可以找到X和Y相似。# C' d6 v1 {- b+ r0 K
    gensim是一个很好用的Python NLP的包,不光可以用于使用word2vec,还有很多其他的API可以用。它封装了google的C语言版的word2vec。
    , b3 r! n$ @2 q3 T! J5 d) @; p  ]' Y& h# a# M8 M
    k近邻分类(kNN)4 q5 z) i) I+ u; R1 \% g: }  b. x
    基于某种距离度量找出训练集中与其最靠近的k个训练样本,或者指定距离e之内的训练样本,分类任务中通过投票法(以及加权投票等)将出现最多的类别标记作为预测结果,回归任务中则使用平均法(以及加权平均等)" ?( H( q8 ~9 K/ H: I
    优点:* a0 [5 ^5 q. a- P
    1、思想简单,易于理解,易于实现,无需估计参数,无需训练;) s  N7 q$ Z& N3 I) x; [
    2、适合对稀有事件进行分类;
    + w7 Q! h: c/ E6 Y/ @3、特别适用于多分类问题
    & Q0 T7 m# w( _' \4 H& f' e& M缺点:' |- e( P" {8 ]% U
    1、需要计算出待测样本与所有样本的距离,计算量大1 ~7 r! W! @# V. O5 m+ _6 i
    2、样本不平衡时影响大" C9 u* j! E) c6 E
    3、适用的特征维度低
    ( @9 Z  g$ ~: Z$ p. S9 K) V6 c5 Z3 p
    线性模型
    - s" ^* g0 `1 n9 ~: X) h' |- `优点:1 _  H* X) I, l1 ]
    1、算法简单,编程方便
    / v' @; s/ y! k4 x) Z" M1 {9 E+ E8 Q2、计算简单,决策速度快' B% }4 B5 v/ b1 \6 s' |$ f0 D
    缺点:& R" [" @  Q$ o! \9 \
    1、拟合效果较差& u  o7 R9 S; b# u, G7 Q. T
    % z$ X2 E3 A# G; p- k& y: t
    高斯混合聚类与k均值(k-means)及其变种(k-means++、ISODATA、Kernel K-means)的对比
    + {: V- C) K5 o! T" J$ _8 _k-means是高斯混合聚类在混合成分方差相等、且每个样本仅指派给一个混合成分时的特例,因此k-means计算简单,但效果不如高斯混合聚类. b4 O6 W) J* G  E) i6 }2 c! f
    由于计算太过复杂,高斯混合聚类并不常用,推荐使用k-means++(与k-means随机选定不同,k-means++初始选定的几个样本距离尽量远,这样能更快得出分簇结果)等k-means变种。
    # }; [  p. W) u2 d' O4 p
    6 p& l3 n7 S: F4 e! f* U/ f0 ~+ u关于学习算法的性能实验结果. h. T4 v" P# Q, L
    点击查看原文
    - F! v5 a3 @6 N- P- Z% f4 g
    6 l. l7 k  p  o+ p0 K' `2 t9 q- m14年的时候有人做过一个实验[1],比较在不同数据集上(121个),不同的分类器(179个)的实际效果。
    " b0 w- Z2 m2 P  z1 F3 s* A论文题为:Do we Need Hundreds of Classifiers to Solve Real World Classification Problems?! p) [* x' w* X) e
    没有最好的分类器,只有最合适的分类器。. |7 }7 @: C& F/ Y
    1、随机森林平均来说最强,但也只在9.9%的数据集上拿到了第一,优点是鲜有短板。
    ' a4 k* e1 F; Y0 k6 C2、SVM的平均水平紧随其后,在10.7%的数据集上拿到第一。1 p* X& S3 S& ~2 j8 D" w; e
    3、神经网络(13.2%)和boosting(~9%)表现不错。
    * f% g7 \% Q( p3 _* z8 }4 u8 T4、数据维度越高,随机森林就比AdaBoost强越多,但是整体不及SVM[2]。
    ! l# z! ?$ C) f% ?$ N; P0 f( @; u5、数据量越大,神经网络就越强。
    - E  t# l' ?7 T( r4 A5 w9 ~' ?————————————————
    + Q, c, j6 K* h版权声明:本文为CSDN博主「路飞的纯白世界」的原创文章,遵循CC 4.0 BY-SA版权协议,转载请附上原文出处链接及本声明。
    0 H4 g1 ^& X% P原文链接:https://blog.csdn.net/u010921136/article/details/906683820 D2 D2 w2 |' u6 V2 I! G

    , y! f, |+ B; Z+ P
    6 H& \8 e# l' R" @+ t
    zan
    转播转播0 分享淘帖0 分享分享0 收藏收藏0 支持支持0 反对反对0 微信微信
    您需要登录后才可以回帖 登录 | 注册地址

    qq
    收缩
    • 电话咨询

    • 04714969085
    fastpost

    关于我们| 联系我们| 诚征英才| 对外合作| 产品服务| QQ

    手机版|Archiver| |繁體中文 手机客户端  

    蒙公网安备 15010502000194号

    Powered by Discuz! X2.5   © 2001-2013 数学建模网-数学中国 ( 蒙ICP备14002410号-3 蒙BBS备-0002号 )     论坛法律顾问:王兆丰

    GMT+8, 2026-9-9 11:45 , Processed in 0.362291 second(s), 50 queries .

    回顶部