QQ登录

只需要一步,快速开始

 注册地址  找回密码
查看: 2048|回复: 0
打印 上一主题 下一主题

各类机器学习算法的优缺点和适用场景汇总

[复制链接]
字体大小: 正常 放大
杨利霞        

5273

主题

82

听众

17万

积分

  • TA的每日心情
    开心
    2021-8-11 17:59
  • 签到天数: 17 天

    [LV.4]偶尔看看III

    网络挑战赛参赛者

    网络挑战赛参赛者

    自我介绍
    本人女,毕业于内蒙古科技大学,担任文职专业,毕业专业英语。

    群组2018美赛大象算法课程

    群组2018美赛护航培训课程

    群组2019年 数学中国站长建

    群组2019年数据分析师课程

    群组2018年大象老师国赛优

    跳转到指定楼层
    1#
    发表于 2021-4-10 11:24 |只看该作者 |倒序浏览
    |招呼Ta 关注Ta

    # ~) t  t$ u: F' O* ^各类机器学习算法的优缺点和适用场景汇总
    " `5 G$ h+ R. c$ S( G; F2 O- p目录
    3 ^2 `: A+ W5 f, ^9 H朴素贝叶斯分类器(NB:naive Bayes classifiers)! b1 C  ?, u% p' s2 q& n) L
    半朴素贝叶斯分类器(SNB:semi-naive Bayes classifiers)3 o* S7 C6 @, ?- h% p& e  s: d
    贝叶斯网(信念网)! ]  P9 i- Z) ~
    决策树(decision tree)
    , k% d8 D  j0 B: A' V) B: V支持向量机(SVM): Z8 ?+ f8 K' S; B% t
    神经网络
    # l  _* l% t% r7 C8 ~* Z词向量(word2vec)& c3 \) s) |, ]+ i" l1 C! `" j1 r0 J
    k近邻分类(kNN)
    6 {5 n+ c. m. P  M/ K线性模型
    # i6 i% R7 r; s$ s# L高斯混合聚类与k均值(k-means)及其变种(k-means++、ISODATA、Kernel K-means)的对比) c5 E& k* ?) L5 o
    关于学习算法的性能实验结果
    0 A7 T" ^8 c! s3 K$ J" t朴素贝叶斯分类器(NB:naive Bayes classifiers)- |% s7 D8 F/ v" @
    顾名思义,其适用于分类任务、并且假设每个属性独立地对分类结果发生影响,然而现实中各个因素往往并不独立,那是否就无法解决问题呢?8 U2 X6 ]3 G' m
    事实上并非如此,相反,朴素贝叶斯分类器在很多情况下都能获得相当好的性能,一种解释是:无需精准概率值即可导致正确分类结果;另一种解释是:若属性间依赖对所有类别影响相同,或依赖关系的影响能相互抵消,则属性条件独立性假设在降低计算开销的同时,不会对性能产生负面影响。0 R- r9 E$ L# M5 E& T

    2 [" L( C% e4 L( @* g优点:
    & D1 S6 x, b9 T( q! @1、计算量较小7 o: \1 d% A3 C+ Q3 U
    2、支持懒惰学习、增量学习9 u+ _9 b; E  Y6 |. C
    3、对缺失数据不太敏感) ^* ?1 ^0 l* Y% F0 k
    4、推断即查表,速度极快。
    % C# x' A8 P( J8 v& m8 W, [- c缺点:
    " F% w3 P* h8 Q; Z+ t1、没有考虑属性间依赖
    5 K5 U7 V; u# `- n1 q' |2、通过类先验概率产生模型6 h. M# t$ c; O( j' c
    : J: B- C8 ]8 z1 C
    半朴素贝叶斯分类器(SNB:semi-naive Bayes classifiers)
    : \. }. }/ j5 {) M1 K相比NB的不考虑依赖,SNB则是考虑了一个(独依赖估计策略:ODE)或多个(多依赖估计策略:kDE)属性依赖
      k* x# v, c0 V9 q  q! ~% [6 c, S优点:
    7 v) e, B+ y! J. p1、考虑了一个或多个比较强的属性依赖关系,泛化性能可能得到提升
    + a( Q6 E7 B7 I6 |2 N; @2、计算开销不大
    " Q' w1 b0 `8 o- w$ f9 G3、同样支持懒惰学习、增量学习8 H3 _/ ?7 Z" q! [3 t6 h
    缺点:
    8 A  v  `9 \6 ]# b4 a2 b1、通过类先验概率产生模型5 D* G7 B  I0 S/ \* p- F' r
    9 V8 Y' l/ Z: w# Y9 v
    贝叶斯网(信念网)( K) A8 t7 F" \
    贝叶斯网借助有向无环图刻画属性之间的依赖关系,通过吉布斯采样或者变分推断等方式来近似推断后验概率。
    ' ~! Q9 y- B8 ]优点:- i0 ]7 b9 w; e, I3 [% M8 P3 F; y
    1、更加完整地考虑了属性间依赖关系,泛化性能将进一步提升' r; q+ l+ n4 D2 S. [7 X
    2、近似估算后验概率
    / Q1 h% d/ m3 l" E  t3、可用于推测属性缺失的样本
    7 Y2 W% S  y& H; T4 {4 H2 X! v4、良好的可解释性- y4 p1 e2 ^# S3 S
    5、常用于语音识别、机器翻译等! u1 i' `3 d6 l( }
    缺点:
    7 l+ r& d5 Z$ U0 O. ^9 y' x8 t1、结构学习NP难,通过评分搜索方法缓解
    . D" }; I# g3 N' K2、推断算法的收敛速度较慢* @' X/ D2 Q3 a1 N* ]
    ' _8 i1 p- L5 ?9 V
    决策树(decision tree)4 T( H% ]/ g7 v! {# r0 V
    决策树通过信息纯度(信息增益、增益率、基尼指数等)来决定结点的生成,通过剪枝来缩小决策树的尺寸以及缓解过拟合。是一种非参数学习算法。
    , h. I5 c. H' g# }# z优点:
    . V* B' L8 ^% M- p# W9 X6 E1、计算量较小
    ; f" ~4 k7 \+ v6 Q% X& V) A2、清晰表达属性的重要程度
    ( G) m2 T& {0 s3 B4 |' Y. ]3、可增量学习对模型进行部分重构
    % d$ A" Y$ x# u2 j% w4、不需要任何领域知识和参数假设, s  h. O# I  N8 }" J( c& R: A
    5、适合高维数据
    2 G, i7 v$ w, L0 N3 u9 y6、随机森林是基于决策树的集成学习策略,随机森林鲜有短板
    ) M; o3 z+ e- d& f$ c缺点:
    9 H6 D4 u& s( J1、没有考虑属性间依赖: @$ Q' B7 q8 Q7 ^/ @( m5 C
    2、容易过拟合,通过剪枝缓解
    9 d/ \& _7 p( q; C7 _3、不可用于推测属性缺失的样本
    / o5 R' C: t3 D# U$ a; T6 \
    , |+ @, y5 ?9 O4 T/ b支持向量机(SVM)6 G% S) J& _/ e$ v& P( Y" E
    基于训练集D在样本空间中找到一个划分超平面,将不同类别的样本分开,是一种针对二分类设计的算法,但稍加改造为支持向量回归即可用于回归学习。* ^' [. i) k2 p* Z5 V1 ~$ r$ \; K
    优点:
    3 V7 V6 G/ \, j* K( X' q  `1、可解决小样本的机器学习任务/ }: \7 `) `( q% l, W; M: E0 N
    2、可解决高维问题
    7 A$ G0 q9 U# L  C9 K7 z4 ^' D4 G3、可通过核方法解决非线性问题
    # |" Z# I+ a( M9 g  `缺点:
    7 i9 |: K* p2 k; x1、对缺失数据敏感5 X# T* x1 Z; K
    2、对于非线性问题,核函数方法选择一直是个未决问题
    ' B2 M7 U5 F! \7 H' g( T' `4 z$ c6 V! @# R
    神经网络1 ]$ D3 e% S9 s6 x# a; s- K  U* u
    优点:
    6 o3 `7 Z6 h8 L6 l2 G) }1、分类的准确度极高
    " B# B6 E- m# U  d/ c2、可解决复杂的非线性问题3 s" S% P5 f7 l& e# l0 ^* R, f! a/ U
    3、对噪声神经有较强的鲁棒性和容错能力
    & v+ _) h1 v7 {0 y7 ]" H4、并行分布处理能力强,分布存储及学习能力强% B0 ~; O7 _+ }
    5、常用于图像识别
    + r( s- ?5 r; u4 M; j3 {. {6、数据量越大,表现越好
    ) O/ h! z2 K2 n" q5 c缺点:
    ( a* t+ e6 ?! D& W7 t  v1、黑箱模型,难以解释! d- g" U& |0 X  K' l+ I
    2、需要初始化以及训练大量参数,如网络结构、权值、阈值,计算复杂
    ) N* h% x. \6 b; Q0 r. E3、误差逆传播的损失
    ! O% l: h4 @, i4、容易陷入局部最小9 {6 h3 }6 ]0 n( A

    6 Z% {0 M  L+ G7 V7 b* R词向量(word2vec)
    ' [8 z6 e2 Z1 E1 ?0 E将文章的每句话当成一行,将每个词用符号隔开(如使用中文分词工具jieba),根据上下文,可以找出相似词义的词。2 k8 `0 H) x$ O
    比如:我 喜欢 你,我 爱 你,我 讨厌 你。根据上下文我和你,可以找到喜欢的相似词,有爱和讨厌。
    ' D- X/ X8 h, G* Y再一般地如:1 2 3 X 4 5 6,1 2 3 Y 4 5 6。根据上下文1 2 3和4 5 6,可以找到X和Y相似。! P) u  }7 L0 e" |* f
    gensim是一个很好用的Python NLP的包,不光可以用于使用word2vec,还有很多其他的API可以用。它封装了google的C语言版的word2vec。
    1 y! C1 s' C! E& }% j: U
    , E* h4 U) {: q% b( M2 T* Fk近邻分类(kNN)
    ; r# ]' A3 D6 D% q; l基于某种距离度量找出训练集中与其最靠近的k个训练样本,或者指定距离e之内的训练样本,分类任务中通过投票法(以及加权投票等)将出现最多的类别标记作为预测结果,回归任务中则使用平均法(以及加权平均等)
    ) @) S1 E" }: {8 v0 O$ X1 C; P. j优点:; q/ j% `0 n3 X! s1 z; j
    1、思想简单,易于理解,易于实现,无需估计参数,无需训练;3 _! D' B: B1 }+ ]# j2 a1 @8 q
    2、适合对稀有事件进行分类;
    # Y5 o7 I' `- s3、特别适用于多分类问题0 v0 W2 J0 o2 q: F: n/ {
    缺点:
    + R, l( C* y; _# l, @( z3 q1、需要计算出待测样本与所有样本的距离,计算量大* d, U. g" M8 ^- O7 D
    2、样本不平衡时影响大
    : S0 j' T0 N1 x% {( t* c3、适用的特征维度低# k/ \0 ~8 j9 [

    ; g, [, V3 W) d6 F, S5 x3 w9 ^线性模型" k9 W& `/ i& j; u# ?/ @. L% k
    优点:) {5 j& M0 D' b! D' G  c* v
    1、算法简单,编程方便/ @- \: S3 G: J7 ]
    2、计算简单,决策速度快& B8 E* }# n) n! B/ H. y  K
    缺点:" G: }. g+ h" @
    1、拟合效果较差' {8 t0 N0 p9 I  X

    & ^& L7 e6 u1 a$ f) a高斯混合聚类与k均值(k-means)及其变种(k-means++、ISODATA、Kernel K-means)的对比
    ' L# A1 n) L2 Fk-means是高斯混合聚类在混合成分方差相等、且每个样本仅指派给一个混合成分时的特例,因此k-means计算简单,但效果不如高斯混合聚类2 ?! K/ E/ @  q8 V) D1 e
    由于计算太过复杂,高斯混合聚类并不常用,推荐使用k-means++(与k-means随机选定不同,k-means++初始选定的几个样本距离尽量远,这样能更快得出分簇结果)等k-means变种。% u0 n& v2 e1 Y1 L- c* H
    2 z- j0 Z8 `+ y. K# h
    关于学习算法的性能实验结果
    6 a4 k2 F& x4 J# ^: `" `$ T点击查看原文
    5 s  M& e* G  ~# i6 {  m2 ]9 l
    3 ]) E. W0 }9 M( r* g14年的时候有人做过一个实验[1],比较在不同数据集上(121个),不同的分类器(179个)的实际效果。0 f& R" y' ]+ j
    论文题为:Do we Need Hundreds of Classifiers to Solve Real World Classification Problems?
    , p9 ~. z9 `0 [8 ?没有最好的分类器,只有最合适的分类器。
    3 j* P5 C6 C( M1、随机森林平均来说最强,但也只在9.9%的数据集上拿到了第一,优点是鲜有短板。
    5 f$ z5 M0 t4 X2、SVM的平均水平紧随其后,在10.7%的数据集上拿到第一。9 Q0 m! [" T1 ~/ K
    3、神经网络(13.2%)和boosting(~9%)表现不错。
    1 ~7 c. n; Z( F6 @: Q4、数据维度越高,随机森林就比AdaBoost强越多,但是整体不及SVM[2]。
    . o0 Y; u5 ~) C! U0 b% U! p5、数据量越大,神经网络就越强。. e: O; d5 N6 p+ I7 D
    ————————————————
    " w3 X% B1 }+ p- L版权声明:本文为CSDN博主「路飞的纯白世界」的原创文章,遵循CC 4.0 BY-SA版权协议,转载请附上原文出处链接及本声明。
    5 n  p" e) h" k% v5 N# I7 E% U' }* B原文链接:https://blog.csdn.net/u010921136/article/details/90668382/ S, e; r3 y8 Z; {* l) t
    4 C$ s2 Y5 I8 K5 s5 r9 ]' g; _3 F

    0 p9 i/ Y. C  c+ e6 p
    zan
    转播转播0 分享淘帖0 分享分享0 收藏收藏0 支持支持0 反对反对0 微信微信
    您需要登录后才可以回帖 登录 | 注册地址

    qq
    收缩
    • 电话咨询

    • 04714969085
    fastpost

    关于我们| 联系我们| 诚征英才| 对外合作| 产品服务| QQ

    手机版|Archiver| |繁體中文 手机客户端  

    蒙公网安备 15010502000194号

    Powered by Discuz! X2.5   © 2001-2013 数学建模网-数学中国 ( 蒙ICP备14002410号-3 蒙BBS备-0002号 )     论坛法律顾问:王兆丰

    GMT+8, 2026-7-25 01:50 , Processed in 3.547506 second(s), 51 queries .

    回顶部