QQ登录

只需要一步,快速开始

 注册地址  找回密码
查看: 2049|回复: 0
打印 上一主题 下一主题

各类机器学习算法的优缺点和适用场景汇总

[复制链接]
字体大小: 正常 放大
杨利霞        

5273

主题

82

听众

17万

积分

  • TA的每日心情
    开心
    2021-8-11 17:59
  • 签到天数: 17 天

    [LV.4]偶尔看看III

    网络挑战赛参赛者

    网络挑战赛参赛者

    自我介绍
    本人女,毕业于内蒙古科技大学,担任文职专业,毕业专业英语。

    群组2018美赛大象算法课程

    群组2018美赛护航培训课程

    群组2019年 数学中国站长建

    群组2019年数据分析师课程

    群组2018年大象老师国赛优

    跳转到指定楼层
    1#
    发表于 2021-4-10 11:24 |只看该作者 |倒序浏览
    |招呼Ta 关注Ta
      R  h7 n# R5 \: ^" N* }" a# ]7 j
    各类机器学习算法的优缺点和适用场景汇总: w7 |8 f6 y$ ^' F. K0 N$ P
    目录
    5 c% ^; d5 _7 o3 ]朴素贝叶斯分类器(NB:naive Bayes classifiers)% I" b5 v7 ]! x" o0 Y
    半朴素贝叶斯分类器(SNB:semi-naive Bayes classifiers)
    . |3 v' j. j' d4 n% M贝叶斯网(信念网)( G9 V% D: k* R# J
    决策树(decision tree)0 ^! t7 Z/ g1 g& R
    支持向量机(SVM)
    6 ~' F1 R0 i7 L  n1 G( F9 n神经网络$ n" d( Z; x6 S$ R& d
    词向量(word2vec)
      {1 `- F  G; D% uk近邻分类(kNN)
    ' k5 W  S9 r! d0 c6 ~8 p3 w  ?线性模型
    " O5 P* _2 X6 K/ r* }) T" x高斯混合聚类与k均值(k-means)及其变种(k-means++、ISODATA、Kernel K-means)的对比
    / E4 h" R* ?6 G7 p6 b( ]+ }; {关于学习算法的性能实验结果8 l/ G1 {& g1 {% I5 A1 W  S8 H7 {
    朴素贝叶斯分类器(NB:naive Bayes classifiers)3 V. S; d! J1 W2 B/ s2 Z$ \
    顾名思义,其适用于分类任务、并且假设每个属性独立地对分类结果发生影响,然而现实中各个因素往往并不独立,那是否就无法解决问题呢?
    : E6 Z& K: b/ n5 S事实上并非如此,相反,朴素贝叶斯分类器在很多情况下都能获得相当好的性能,一种解释是:无需精准概率值即可导致正确分类结果;另一种解释是:若属性间依赖对所有类别影响相同,或依赖关系的影响能相互抵消,则属性条件独立性假设在降低计算开销的同时,不会对性能产生负面影响。
    " A/ Y& C: U2 `. T4 M
    5 c. ?5 [( A; s8 ~; \- e: Q( Z优点:2 Z+ s6 Z, F" ^4 t, Q  z  }
    1、计算量较小
    6 @* F' m7 b7 }0 g* x" w2、支持懒惰学习、增量学习
    6 i, d: v6 U3 l8 Y3、对缺失数据不太敏感
    0 c+ J: `* A& d$ i8 p+ w( d7 K4、推断即查表,速度极快。+ I% ^# ]  T7 e* f, i$ S
    缺点:' W% R, V  V& O' S5 v2 h+ \+ I
    1、没有考虑属性间依赖6 b( t( J4 ]- ~
    2、通过类先验概率产生模型
    8 G' g0 k9 H: t. ?/ j
    % C! b( H" `. l5 Y1 H! ?; S; L半朴素贝叶斯分类器(SNB:semi-naive Bayes classifiers)
    ! p6 I/ a: o& R* u3 A; `& _相比NB的不考虑依赖,SNB则是考虑了一个(独依赖估计策略:ODE)或多个(多依赖估计策略:kDE)属性依赖. Z6 d& C  m* l! m- G( E/ E7 v* E: P
    优点:
    " N. c# \0 }! ^1、考虑了一个或多个比较强的属性依赖关系,泛化性能可能得到提升# P7 r' m0 u& d8 s" V2 [5 Z) D
    2、计算开销不大/ G$ R* \4 M$ c8 R2 L) q0 r
    3、同样支持懒惰学习、增量学习/ b! J- b3 }  p+ O8 `
    缺点:
    8 }$ [8 `  U# P7 c& u0 C) x1、通过类先验概率产生模型
    4 \4 y/ Z7 p% s
    7 ^2 M+ {5 f- G7 K( @9 ~贝叶斯网(信念网)
    9 s* v7 F+ o% _( `8 z( H9 p4 t贝叶斯网借助有向无环图刻画属性之间的依赖关系,通过吉布斯采样或者变分推断等方式来近似推断后验概率。
      _& J+ W/ [3 v优点:$ Q; j8 t5 @* p1 W
    1、更加完整地考虑了属性间依赖关系,泛化性能将进一步提升, {6 W! _( j: j) R
    2、近似估算后验概率
      P9 {5 _, d8 P: B% `3、可用于推测属性缺失的样本
    8 ]0 N& V) l4 {# ~$ y0 \2 m4、良好的可解释性, ]5 P2 f1 j% |
    5、常用于语音识别、机器翻译等
    - l& ]+ Q) P2 H* @9 r9 p: _缺点:
    / Y" S. L" C5 A/ s1、结构学习NP难,通过评分搜索方法缓解
    , E; _) p+ L) C% B, [2、推断算法的收敛速度较慢
    6 |8 F& j# r+ U4 ^
    : Z1 h' X) s" B' l# h6 [. p4 a决策树(decision tree): `& w2 j0 f; G& n# T% e! m: ]  j  z
    决策树通过信息纯度(信息增益、增益率、基尼指数等)来决定结点的生成,通过剪枝来缩小决策树的尺寸以及缓解过拟合。是一种非参数学习算法。
    + Z# _3 e3 U" Z. m- F优点:% u- y9 C! a% l( [" Z
    1、计算量较小3 \: x, p/ h) b) J; i
    2、清晰表达属性的重要程度
    # y, I( Y* J( q# `( i5 ?( x& ^3、可增量学习对模型进行部分重构* a5 Z1 y. ]2 O! {) h
    4、不需要任何领域知识和参数假设
    : F( [. p1 M0 t2 R5、适合高维数据
    & C: ~/ ?9 b1 q3 n2 `0 Z. Y9 B1 ^( Y6、随机森林是基于决策树的集成学习策略,随机森林鲜有短板+ y  ^8 t* Q1 U. Y7 q: P5 }- n
    缺点:8 n4 L: i9 s5 R" w: p  D
    1、没有考虑属性间依赖, ^' T# n" N  @- \: D
    2、容易过拟合,通过剪枝缓解' d  a% l: Q/ e- e2 k
    3、不可用于推测属性缺失的样本; N  ?$ X. T8 K0 w; _6 P9 g: K" z- W7 i

    6 h  [* v& l. M7 m1 R) [支持向量机(SVM)% n/ \/ o% H' s( G1 D+ |
    基于训练集D在样本空间中找到一个划分超平面,将不同类别的样本分开,是一种针对二分类设计的算法,但稍加改造为支持向量回归即可用于回归学习。" d* |( V; h! d' ~
    优点:/ W9 d  s3 b2 F4 ?- G& A) z- ?
    1、可解决小样本的机器学习任务
    # T) ~1 I2 ^; N; X1 ?2 A: {2、可解决高维问题5 Y6 _3 L. `2 X' n! w' X$ v" g+ C7 n
    3、可通过核方法解决非线性问题4 I8 [8 t. q$ q5 g& V% T
    缺点:
    / r+ n3 t  s4 E7 W- o- w1、对缺失数据敏感
    2 D3 z: T% d5 S2、对于非线性问题,核函数方法选择一直是个未决问题# A* T9 h" H0 u  K# J2 g/ }+ D9 F" q( K
    ( k' [1 }3 R$ X$ w7 p/ Y
    神经网络
    ) p' _, E: B7 l0 C优点:
      K6 q, ?# Q4 K9 J$ D1、分类的准确度极高5 e" I3 W  I* h& _7 h
    2、可解决复杂的非线性问题3 F! _5 B4 B8 ]7 ~
    3、对噪声神经有较强的鲁棒性和容错能力9 }3 Y* R# ~3 q5 `" Z1 u
    4、并行分布处理能力强,分布存储及学习能力强
    $ ~: k) f! f/ c+ @; `5、常用于图像识别
    ) ^5 H; I% E3 R4 U8 t  l" d6、数据量越大,表现越好% m) t4 P7 J! @; G$ G
    缺点:1 d! f' W( ]& i7 R% I! ]
    1、黑箱模型,难以解释; V( Z" e6 p$ @5 I
    2、需要初始化以及训练大量参数,如网络结构、权值、阈值,计算复杂, ^0 e' O3 N/ Y0 b& u& p  L0 ]
    3、误差逆传播的损失' l' t$ v8 [8 Q) l. p+ ^. q
    4、容易陷入局部最小
    0 s+ C3 t/ D; u/ {! D5 F! L% f. b# V2 [! o
    词向量(word2vec)! v1 H5 F6 m* x, C
    将文章的每句话当成一行,将每个词用符号隔开(如使用中文分词工具jieba),根据上下文,可以找出相似词义的词。) X( u% c  U9 @
    比如:我 喜欢 你,我 爱 你,我 讨厌 你。根据上下文我和你,可以找到喜欢的相似词,有爱和讨厌。
    5 W* P! u) ^& T7 p# f! E再一般地如:1 2 3 X 4 5 6,1 2 3 Y 4 5 6。根据上下文1 2 3和4 5 6,可以找到X和Y相似。
    8 O0 s* c! L1 i6 x& W6 wgensim是一个很好用的Python NLP的包,不光可以用于使用word2vec,还有很多其他的API可以用。它封装了google的C语言版的word2vec。
    " [; C* X# e' Y6 H* l) V3 C2 R6 F* u  J! N8 Z& N
    k近邻分类(kNN)
    & ~1 r; _- h" @: Z6 ]/ L/ a  a基于某种距离度量找出训练集中与其最靠近的k个训练样本,或者指定距离e之内的训练样本,分类任务中通过投票法(以及加权投票等)将出现最多的类别标记作为预测结果,回归任务中则使用平均法(以及加权平均等)# b5 L+ |" w4 c  D! K7 d9 {$ S
    优点:
    ' E. i+ B  Q9 B! k/ H+ A1、思想简单,易于理解,易于实现,无需估计参数,无需训练;
    1 ]9 [' O3 m0 r9 x2、适合对稀有事件进行分类;
    2 e6 }% w. E6 Y& T- [3、特别适用于多分类问题6 A+ I, d  T% P
    缺点:7 V, t* Y; O3 i+ b% g* Q
    1、需要计算出待测样本与所有样本的距离,计算量大7 @0 y2 J5 q7 ]# |3 M
    2、样本不平衡时影响大1 ?, U# R' w) G8 N8 k- G; g
    3、适用的特征维度低
    1 ?3 [6 J, {" d: \. o$ M& J  X3 k8 W8 `3 p
    线性模型' ^' K  y* f; V& K- {  `4 Q
    优点:
    1 Y0 r1 I" x8 ]5 n% g# @, z& H; y1、算法简单,编程方便! n( v2 N; I+ ^' B& F) }* J
    2、计算简单,决策速度快
    * S, m6 K5 h% W; r9 l缺点:
    8 Q; w, s# _- Y- E1、拟合效果较差! v# Y1 G6 E3 G& r; p% T

    1 S9 H  H0 H# Z' S, w高斯混合聚类与k均值(k-means)及其变种(k-means++、ISODATA、Kernel K-means)的对比# i5 w8 l; ?% z
    k-means是高斯混合聚类在混合成分方差相等、且每个样本仅指派给一个混合成分时的特例,因此k-means计算简单,但效果不如高斯混合聚类* _: B4 n5 G. t: q. G/ Y+ }
    由于计算太过复杂,高斯混合聚类并不常用,推荐使用k-means++(与k-means随机选定不同,k-means++初始选定的几个样本距离尽量远,这样能更快得出分簇结果)等k-means变种。
    5 h5 H1 U( b4 Y+ Q3 h
    9 o. d2 x4 p) S! _! H3 t" k2 f关于学习算法的性能实验结果
    6 E% _9 _: b; G1 W  R; W( p8 u点击查看原文
    * @5 ]9 Y# `; l/ C1 S; Z5 H; n$ i
    14年的时候有人做过一个实验[1],比较在不同数据集上(121个),不同的分类器(179个)的实际效果。
    * U  Y/ C" V; C5 i. W论文题为:Do we Need Hundreds of Classifiers to Solve Real World Classification Problems?
    $ ]4 R5 C" G/ Q# q+ u没有最好的分类器,只有最合适的分类器。8 d8 f1 r7 x4 Q% U; B
    1、随机森林平均来说最强,但也只在9.9%的数据集上拿到了第一,优点是鲜有短板。
    9 n- t2 M, `1 P0 @( _2、SVM的平均水平紧随其后,在10.7%的数据集上拿到第一。
    ; L' R. G" \$ s# a" y  X1 |3 Q1 H3、神经网络(13.2%)和boosting(~9%)表现不错。7 _/ }8 J$ u1 ~" {5 k- T- ~
    4、数据维度越高,随机森林就比AdaBoost强越多,但是整体不及SVM[2]。
    + _7 G& ?$ {$ |$ j% V5、数据量越大,神经网络就越强。3 T0 r8 o/ k4 O$ p
    ————————————————
    & Q5 w$ W/ J- V, E8 Q版权声明:本文为CSDN博主「路飞的纯白世界」的原创文章,遵循CC 4.0 BY-SA版权协议,转载请附上原文出处链接及本声明。
    5 W; B: n, [) ^" P: p% \& M! X$ [原文链接:https://blog.csdn.net/u010921136/article/details/90668382+ m  y1 k% J0 x3 ?9 }; U  ~/ E" X$ {

    1 P& m$ h9 e. @9 D  n
    4 o* ]- e( ~# ?8 Y# z4 m2 a
    zan
    转播转播0 分享淘帖0 分享分享0 收藏收藏0 支持支持0 反对反对0 微信微信
    您需要登录后才可以回帖 登录 | 注册地址

    qq
    收缩
    • 电话咨询

    • 04714969085
    fastpost

    关于我们| 联系我们| 诚征英才| 对外合作| 产品服务| QQ

    手机版|Archiver| |繁體中文 手机客户端  

    蒙公网安备 15010502000194号

    Powered by Discuz! X2.5   © 2001-2013 数学建模网-数学中国 ( 蒙ICP备14002410号-3 蒙BBS备-0002号 )     论坛法律顾问:王兆丰

    GMT+8, 2026-7-25 04:07 , Processed in 0.340447 second(s), 50 queries .

    回顶部