QQ登录

只需要一步,快速开始

 注册地址  找回密码
查看: 2046|回复: 0
打印 上一主题 下一主题

各类机器学习算法的优缺点和适用场景汇总

[复制链接]
字体大小: 正常 放大
杨利霞        

5273

主题

82

听众

17万

积分

  • TA的每日心情
    开心
    2021-8-11 17:59
  • 签到天数: 17 天

    [LV.4]偶尔看看III

    网络挑战赛参赛者

    网络挑战赛参赛者

    自我介绍
    本人女,毕业于内蒙古科技大学,担任文职专业,毕业专业英语。

    群组2018美赛大象算法课程

    群组2018美赛护航培训课程

    群组2019年 数学中国站长建

    群组2019年数据分析师课程

    群组2018年大象老师国赛优

    跳转到指定楼层
    1#
    发表于 2021-4-10 11:24 |只看该作者 |倒序浏览
    |招呼Ta 关注Ta
    : [; x! l0 E, O/ ~2 l
    各类机器学习算法的优缺点和适用场景汇总
    ! ]; c8 I' x/ ]7 w7 N目录, \% P# h4 M" i
    朴素贝叶斯分类器(NB:naive Bayes classifiers)
      ~" [+ ~/ C, K. P0 K1 s8 Q半朴素贝叶斯分类器(SNB:semi-naive Bayes classifiers)
    ) i: U' _; u. F/ o  P, _& i3 q贝叶斯网(信念网)
    4 t5 m9 A! W6 e+ j& N% M! R5 t& f决策树(decision tree)  G: U' r3 X6 I' ?! J
    支持向量机(SVM)
    ' A1 w' A# D$ G神经网络
    1 o; l9 }# i# o; Q4 B7 b词向量(word2vec)
    5 v8 R  k4 Q# @3 p# Fk近邻分类(kNN)
    " N- ]% E, ]7 d0 I6 s$ m( B& z$ v线性模型
    . X( }! T- N* O; M3 ^. R高斯混合聚类与k均值(k-means)及其变种(k-means++、ISODATA、Kernel K-means)的对比( u0 s3 ^& |+ s: N5 X- N
    关于学习算法的性能实验结果/ k/ `5 E* h5 g% L9 U0 ]8 x2 c
    朴素贝叶斯分类器(NB:naive Bayes classifiers). O5 ?% A5 n) X9 W7 o5 U
    顾名思义,其适用于分类任务、并且假设每个属性独立地对分类结果发生影响,然而现实中各个因素往往并不独立,那是否就无法解决问题呢?% R# n; Z2 B* [# \, u
    事实上并非如此,相反,朴素贝叶斯分类器在很多情况下都能获得相当好的性能,一种解释是:无需精准概率值即可导致正确分类结果;另一种解释是:若属性间依赖对所有类别影响相同,或依赖关系的影响能相互抵消,则属性条件独立性假设在降低计算开销的同时,不会对性能产生负面影响。% H) ?5 Y: D; g

    , z6 V6 w8 |- a- k1 Q优点:
    9 ~( N9 {. x# J1、计算量较小0 p+ F! B* R: b, {' d* Y
    2、支持懒惰学习、增量学习- m: W# b: D$ m5 H7 r, P8 ?4 p
    3、对缺失数据不太敏感
    - T7 q  @$ r. M/ o6 P) d. J4、推断即查表,速度极快。& h# Y1 l4 F* n9 d' ~
    缺点:: l/ K0 X! U- l6 P+ g
    1、没有考虑属性间依赖
    0 t5 y% i+ Q9 K2、通过类先验概率产生模型
    ) b$ W! x* H( G/ ]: @
    $ E' W8 Z+ Z3 n6 I: N. U$ m半朴素贝叶斯分类器(SNB:semi-naive Bayes classifiers)- S+ i+ J7 H( d, ?
    相比NB的不考虑依赖,SNB则是考虑了一个(独依赖估计策略:ODE)或多个(多依赖估计策略:kDE)属性依赖
    ! G; t4 l, Z( j! Q5 T; q+ |优点:
    1 ~" Z" G1 T4 \4 T1 z1、考虑了一个或多个比较强的属性依赖关系,泛化性能可能得到提升0 @: a1 t  n. V4 ~, I
    2、计算开销不大  h  ~% X( [. u( r5 }5 }
    3、同样支持懒惰学习、增量学习
    $ {( H: Q+ q: {: R) o0 P- R缺点:+ P+ o1 N% m* _! K( g" o
    1、通过类先验概率产生模型
    ( ]. w  s5 u+ O" @& Y6 g. _
    0 s" p  u) G7 T2 o, A+ m贝叶斯网(信念网)
    : _% o. C  S, G0 C1 J7 g# G7 W贝叶斯网借助有向无环图刻画属性之间的依赖关系,通过吉布斯采样或者变分推断等方式来近似推断后验概率。
    : y; `# Q$ x6 h/ a" l  W优点:; {% B" |1 n5 u0 U. S
    1、更加完整地考虑了属性间依赖关系,泛化性能将进一步提升& D& x9 M8 x3 m3 w. ~, q; u) G
    2、近似估算后验概率0 t7 O- i# V1 \! q# [; e* C$ R% v0 D
    3、可用于推测属性缺失的样本4 p# w2 `- F8 `. Y" z
    4、良好的可解释性4 \! r/ n$ ]  A; U! N3 O. n- S0 }
    5、常用于语音识别、机器翻译等) I7 r) i. K5 N5 c  c, C* N
    缺点:* a) b  U% @3 G* |
    1、结构学习NP难,通过评分搜索方法缓解5 w2 v; ]8 s5 N( f. q0 i" ?
    2、推断算法的收敛速度较慢
    0 N: a6 P' x) M! k
    : P& T* W0 e2 h决策树(decision tree)
    2 C5 m  t# f* N/ E决策树通过信息纯度(信息增益、增益率、基尼指数等)来决定结点的生成,通过剪枝来缩小决策树的尺寸以及缓解过拟合。是一种非参数学习算法。" G* e( H* G: W: @; [. t
    优点:
    : B* w! T/ W. ^1 l2 G1、计算量较小
    9 _: |  ^! F8 G6 g2、清晰表达属性的重要程度
    - o# [5 o  r/ N8 |( W, h9 o# w: ^* U3、可增量学习对模型进行部分重构% x' p: g. s* p. w
    4、不需要任何领域知识和参数假设. \( C) _, _' F; j. r
    5、适合高维数据
      I: Q' k; T- t" d8 `1 S% M6 e$ q3 N6、随机森林是基于决策树的集成学习策略,随机森林鲜有短板0 g: m6 z: h4 o( I  L
    缺点:) i7 ~" w1 w, g9 ~/ D5 ?
    1、没有考虑属性间依赖
    5 j. b6 H7 J7 U( x& |2、容易过拟合,通过剪枝缓解$ v2 q& n6 i; d4 h# L
    3、不可用于推测属性缺失的样本
    4 R& F9 J( B! C5 f; a  i' [
    1 C- l$ E( ~5 }( |1 N支持向量机(SVM)+ \1 L" k: j; g# O  n; w8 U. W
    基于训练集D在样本空间中找到一个划分超平面,将不同类别的样本分开,是一种针对二分类设计的算法,但稍加改造为支持向量回归即可用于回归学习。  K3 k) f$ {; T8 G; g. Z$ V' i
    优点:
    8 U# O  D& f) z: S4 t1、可解决小样本的机器学习任务8 Q! j# ~- u- E+ o! _) R* D
    2、可解决高维问题3 }" P, x6 D( E" X9 J2 z9 l1 @" f
    3、可通过核方法解决非线性问题6 q+ F" W' [% S/ V
    缺点:$ I( G* ~4 i' p* R3 y
    1、对缺失数据敏感
    ) ~' P0 R3 r4 h5 @* c! G. k" P2、对于非线性问题,核函数方法选择一直是个未决问题2 F/ K" L( G! ^0 u, Q6 t: x
    , W$ g# }6 S: ?+ p; Z& D
    神经网络
    7 z  y' T) W0 J) H8 q. k3 a0 _优点:' k/ P: F: O9 h4 ^& I
    1、分类的准确度极高4 a; d2 C, |2 X! B, c" J. T
    2、可解决复杂的非线性问题
    7 Y, I2 @, D( f2 U" }3、对噪声神经有较强的鲁棒性和容错能力
    8 h+ w/ _' Y% D4 V1 X6 C4、并行分布处理能力强,分布存储及学习能力强
    4 `. p% A' o2 m1 s! `" J4 E5、常用于图像识别. n8 a- y+ ^9 H0 m+ I7 v$ L! k& ?
    6、数据量越大,表现越好
    # c: j  R9 v! ^( F7 s缺点:7 G+ |/ P) V7 p, |8 f
    1、黑箱模型,难以解释7 S% O8 Q. U* j' W+ H) I
    2、需要初始化以及训练大量参数,如网络结构、权值、阈值,计算复杂% Y% k( x& x  p3 Y
    3、误差逆传播的损失: e' `0 t4 j% u$ m" x6 [
    4、容易陷入局部最小
    - O1 Z* d8 g& g+ d5 H3 z$ I, I+ y! L0 z2 V  _& {
    词向量(word2vec)( I8 O! {  b4 T" {  h7 A
    将文章的每句话当成一行,将每个词用符号隔开(如使用中文分词工具jieba),根据上下文,可以找出相似词义的词。
    ' F# L" a+ W9 e* Q6 C比如:我 喜欢 你,我 爱 你,我 讨厌 你。根据上下文我和你,可以找到喜欢的相似词,有爱和讨厌。
    : t9 R+ @/ _4 R" ?- l, ~再一般地如:1 2 3 X 4 5 6,1 2 3 Y 4 5 6。根据上下文1 2 3和4 5 6,可以找到X和Y相似。
    0 J, L  B# l8 ?# i" q' mgensim是一个很好用的Python NLP的包,不光可以用于使用word2vec,还有很多其他的API可以用。它封装了google的C语言版的word2vec。
    , b! B5 J/ `+ v# P; ~2 P1 U5 J2 L) i1 U4 j7 d
    k近邻分类(kNN)8 n% Z3 m% r& s- ^% ~% L
    基于某种距离度量找出训练集中与其最靠近的k个训练样本,或者指定距离e之内的训练样本,分类任务中通过投票法(以及加权投票等)将出现最多的类别标记作为预测结果,回归任务中则使用平均法(以及加权平均等)
    ) y) ?* J7 u$ M* K* k( z& j  d" W优点:
    7 B6 _+ ?6 \4 q3 E( |2 C1、思想简单,易于理解,易于实现,无需估计参数,无需训练;5 F% H4 f* e7 @$ E' n3 E
    2、适合对稀有事件进行分类;4 ]0 F+ ~* I7 L# C5 [. C! B
    3、特别适用于多分类问题
    ( L. ~9 D0 C# p% _0 Q5 ~1 U+ x& y缺点:
    7 I3 `3 z! ^! N1、需要计算出待测样本与所有样本的距离,计算量大0 v+ b* B% E# y% h9 v7 {
    2、样本不平衡时影响大
    & s9 T  {. `% g) v. S5 _$ f6 E3、适用的特征维度低  B2 l  X, g; x* K( D7 ?
    - v0 w! _2 q9 `9 J
    线性模型
    ) i7 D1 }4 [. X* G. g* S+ U: v8 [% H优点:! o% E5 g4 y/ y, _% ]$ b1 i
    1、算法简单,编程方便. _$ a" p' [7 V  R( V
    2、计算简单,决策速度快' @- P- X! }  ]: L
    缺点:
    5 P9 ]) q# }/ x% U5 w+ ?0 h9 T! {1、拟合效果较差0 t( M9 k2 V" k8 i1 Y5 q
    " A: Y" U1 ?! P& p
    高斯混合聚类与k均值(k-means)及其变种(k-means++、ISODATA、Kernel K-means)的对比' ~( X& h/ A" K. t
    k-means是高斯混合聚类在混合成分方差相等、且每个样本仅指派给一个混合成分时的特例,因此k-means计算简单,但效果不如高斯混合聚类+ u! W- r+ v, s) J, z2 r% f: [
    由于计算太过复杂,高斯混合聚类并不常用,推荐使用k-means++(与k-means随机选定不同,k-means++初始选定的几个样本距离尽量远,这样能更快得出分簇结果)等k-means变种。
    + h! ^9 e0 H9 W! R) {% `6 r6 V! d" G# F5 O
    关于学习算法的性能实验结果8 D7 x; Y& e! {) h  S( V
    点击查看原文
    # l! a$ `2 K' k  X2 Y
    1 W; K2 Y( c8 j14年的时候有人做过一个实验[1],比较在不同数据集上(121个),不同的分类器(179个)的实际效果。5 D9 L: U! i! ^; |% v) v
    论文题为:Do we Need Hundreds of Classifiers to Solve Real World Classification Problems?( G$ h! r9 l, L
    没有最好的分类器,只有最合适的分类器。
    ) Z* q! t+ X" ]" Z1、随机森林平均来说最强,但也只在9.9%的数据集上拿到了第一,优点是鲜有短板。
    ( X' R& e' W; S2 R+ I' d5 t# f+ _8 ^2、SVM的平均水平紧随其后,在10.7%的数据集上拿到第一。
    4 B! r' F+ i9 i! M" M7 `  R. D3、神经网络(13.2%)和boosting(~9%)表现不错。
    9 X, K1 L0 |8 b) G5 {+ r4、数据维度越高,随机森林就比AdaBoost强越多,但是整体不及SVM[2]。# n0 q# t# D, e: O' Y1 X
    5、数据量越大,神经网络就越强。
    " s7 x8 Z: @5 q2 t————————————————8 [/ x. _4 l0 a
    版权声明:本文为CSDN博主「路飞的纯白世界」的原创文章,遵循CC 4.0 BY-SA版权协议,转载请附上原文出处链接及本声明。
      r+ C+ `) J. j! T原文链接:https://blog.csdn.net/u010921136/article/details/90668382
    ! V& H* ]  k! q% i$ ]$ y9 x4 A+ n+ n5 j3 M9 W6 Z9 }. p- P

      }, M. F; ^# k' Y. t
    zan
    转播转播0 分享淘帖0 分享分享0 收藏收藏0 支持支持0 反对反对0 微信微信
    您需要登录后才可以回帖 登录 | 注册地址

    qq
    收缩
    • 电话咨询

    • 04714969085
    fastpost

    关于我们| 联系我们| 诚征英才| 对外合作| 产品服务| QQ

    手机版|Archiver| |繁體中文 手机客户端  

    蒙公网安备 15010502000194号

    Powered by Discuz! X2.5   © 2001-2013 数学建模网-数学中国 ( 蒙ICP备14002410号-3 蒙BBS备-0002号 )     论坛法律顾问:王兆丰

    GMT+8, 2026-7-24 22:33 , Processed in 0.741707 second(s), 50 queries .

    回顶部