QQ登录

只需要一步,快速开始

 注册地址  找回密码
查看: 2078|回复: 0
打印 上一主题 下一主题

各类机器学习算法的优缺点和适用场景汇总

[复制链接]
字体大小: 正常 放大
杨利霞        

5273

主题

82

听众

17万

积分

  • TA的每日心情
    开心
    2021-8-11 17:59
  • 签到天数: 17 天

    [LV.4]偶尔看看III

    网络挑战赛参赛者

    网络挑战赛参赛者

    自我介绍
    本人女,毕业于内蒙古科技大学,担任文职专业,毕业专业英语。

    群组2018美赛大象算法课程

    群组2018美赛护航培训课程

    群组2019年 数学中国站长建

    群组2019年数据分析师课程

    群组2018年大象老师国赛优

    跳转到指定楼层
    1#
    发表于 2021-4-10 11:24 |只看该作者 |倒序浏览
    |招呼Ta 关注Ta
    $ u( l) I/ p! e/ t
    各类机器学习算法的优缺点和适用场景汇总
    ! a9 x7 u7 e4 L8 R, v" R- V目录
    6 J6 G: A2 L5 [  g# O* t  f2 K, ~2 {朴素贝叶斯分类器(NB:naive Bayes classifiers)* E0 `$ x1 \1 [! S, F: q/ Y
    半朴素贝叶斯分类器(SNB:semi-naive Bayes classifiers)
    - r8 s, ?# O7 o1 N6 [贝叶斯网(信念网)
    9 @8 J7 a5 W1 X: G0 J决策树(decision tree)/ T# }3 N- i, }: {  G" I
    支持向量机(SVM)8 ]1 h- A$ h/ J9 {) r' h8 Z
    神经网络( \% }- c+ m5 w  u
    词向量(word2vec)
    3 w. s& q8 D! H& mk近邻分类(kNN)5 A9 c1 k$ U9 [
    线性模型
    ; e+ _! f$ m4 |  p$ x高斯混合聚类与k均值(k-means)及其变种(k-means++、ISODATA、Kernel K-means)的对比
    - X: e) b6 O6 f+ A1 G2 p关于学习算法的性能实验结果; c9 f; e, @" J$ x0 M
    朴素贝叶斯分类器(NB:naive Bayes classifiers)
    + p4 N* c% `/ G7 J5 B顾名思义,其适用于分类任务、并且假设每个属性独立地对分类结果发生影响,然而现实中各个因素往往并不独立,那是否就无法解决问题呢?$ [! Z/ K5 A5 J3 A, a( x7 @, _! ~
    事实上并非如此,相反,朴素贝叶斯分类器在很多情况下都能获得相当好的性能,一种解释是:无需精准概率值即可导致正确分类结果;另一种解释是:若属性间依赖对所有类别影响相同,或依赖关系的影响能相互抵消,则属性条件独立性假设在降低计算开销的同时,不会对性能产生负面影响。' K* d! z. H( s6 s4 u

    ' i8 j( R. j. m优点:
    % i* Y  q8 d, Z# S  }; y* c7 R1、计算量较小" ~8 }1 B; f: ]; p
    2、支持懒惰学习、增量学习
    # Y3 e. U$ i+ r9 d3、对缺失数据不太敏感
    : ]( \* ~( B3 Z4、推断即查表,速度极快。; c+ x9 \; |6 v$ J: l3 N* s  k: W- {! X
    缺点:
      j4 A& t% m" a" ~" G1 Y7 W1、没有考虑属性间依赖- }5 Z# |1 `" y
    2、通过类先验概率产生模型" H4 p& ^3 v5 {# z2 N
    . q9 {9 K8 w8 I& _# S& E
    半朴素贝叶斯分类器(SNB:semi-naive Bayes classifiers)# M" o  |$ ]/ F
    相比NB的不考虑依赖,SNB则是考虑了一个(独依赖估计策略:ODE)或多个(多依赖估计策略:kDE)属性依赖
    / n- x, q' M' @/ R) j6 J' q优点:
    % a* H0 P  w' n( B1、考虑了一个或多个比较强的属性依赖关系,泛化性能可能得到提升
    / W% ]+ p) N! s7 E5 d: V2、计算开销不大
    9 p+ q4 I1 b- f# D" i2 s3、同样支持懒惰学习、增量学习4 a. |& R: b5 F# D: m3 Y6 ^5 ^
    缺点:
    ; j5 V, S: q% R8 ?* I. w1、通过类先验概率产生模型
    7 E" `* Y, U( c: E5 q8 H- ~
    ' u) J# x% \) F+ A$ Y) J" B贝叶斯网(信念网)1 O/ e2 W( c" N: f
    贝叶斯网借助有向无环图刻画属性之间的依赖关系,通过吉布斯采样或者变分推断等方式来近似推断后验概率。
    7 D+ x2 C  e1 |/ ~& u$ I优点:% K2 ~. l5 Q# q. N6 u! i2 A
    1、更加完整地考虑了属性间依赖关系,泛化性能将进一步提升
    * a0 s4 O9 a, f) ~6 }9 }2 s9 R2、近似估算后验概率- M6 [8 D. w  a+ }3 {7 E! k5 o
    3、可用于推测属性缺失的样本# g+ r& P, q7 x. @7 ~$ C/ f
    4、良好的可解释性
    - A5 ]' ~3 T0 r* ~2 P5、常用于语音识别、机器翻译等
    8 H& A5 u% P7 p9 O" k! I9 _缺点:
    2 \, D4 f' P; O: _  `: F1、结构学习NP难,通过评分搜索方法缓解) y3 C8 Y4 \  ?; G' ^8 T5 l3 K4 D7 j
    2、推断算法的收敛速度较慢) [/ N* X6 v. i+ [. P1 K. c  k( T

    ( v0 F: i$ q+ [) o" `3 v决策树(decision tree), d1 g- |, T* Q, ]# X. K
    决策树通过信息纯度(信息增益、增益率、基尼指数等)来决定结点的生成,通过剪枝来缩小决策树的尺寸以及缓解过拟合。是一种非参数学习算法。$ F+ \" i& ~- n$ z
    优点:
    0 a) a6 X: G2 ~) ?1、计算量较小3 I3 t: g. n. E5 s# L  T% g. F
    2、清晰表达属性的重要程度4 W8 [9 C: d( ]0 ?2 `2 C8 D
    3、可增量学习对模型进行部分重构3 ]: `( w; {1 X$ ]6 R# K' r
    4、不需要任何领域知识和参数假设
    6 }1 m3 G0 O; }: a5、适合高维数据: O  D; H% @9 s; w& ^2 y, y
    6、随机森林是基于决策树的集成学习策略,随机森林鲜有短板
    2 P  l3 n8 c2 u& _/ P0 ^" S缺点:
    % V; W1 o" M2 }4 u1 J& r1、没有考虑属性间依赖
    . g7 g0 [8 T8 H. p8 H6 }) s2、容易过拟合,通过剪枝缓解
    $ X4 ^2 b) T% Z! Y3、不可用于推测属性缺失的样本: C+ T5 U) r0 \; g2 E

    4 K8 z) a% X" e支持向量机(SVM)
    * o9 C" f" I$ V9 e9 a" T' V基于训练集D在样本空间中找到一个划分超平面,将不同类别的样本分开,是一种针对二分类设计的算法,但稍加改造为支持向量回归即可用于回归学习。
    8 e+ J  C& I* |8 q优点:7 M( T2 y- Z& K# n: \! n& D$ T; o
    1、可解决小样本的机器学习任务- P- K: S! W+ Q7 F
    2、可解决高维问题
    4 `! i: W1 l9 ?' P1 |+ ^3、可通过核方法解决非线性问题
    - W# c& `1 z3 T- K- N. F6 [缺点:3 G6 ^3 p9 h5 l% F  w) w
    1、对缺失数据敏感
    8 c4 L3 K( S6 k' }( G& E* m# u6 o2、对于非线性问题,核函数方法选择一直是个未决问题. w. B4 z( f7 L8 [

    9 _7 v+ L1 L; J/ v: x1 S. s$ E: v% @神经网络6 O7 N  _4 m; |1 f6 O% M
    优点:
    8 s; t" ^/ Q! v6 t1、分类的准确度极高
    + o* ~, v- ]6 y( L! i2、可解决复杂的非线性问题7 h, c  @) l  i( J: k2 k
    3、对噪声神经有较强的鲁棒性和容错能力
    ) ]1 r: X- ]2 x7 w$ _/ w* @4、并行分布处理能力强,分布存储及学习能力强! @& J$ ^$ i/ }! [) Y* ^
    5、常用于图像识别: t/ ]4 c, D% R
    6、数据量越大,表现越好  L( h) h: T$ K/ i* u5 c
    缺点:* I4 b  B# X) g) [: x+ \
    1、黑箱模型,难以解释
    6 a9 J( S' T, C$ {2、需要初始化以及训练大量参数,如网络结构、权值、阈值,计算复杂
    3 {% M; x+ R- [# R% G/ h3、误差逆传播的损失# f: R, x+ [. t5 }# p: i; u6 f
    4、容易陷入局部最小
    1 v9 o; i0 u- X0 `$ v; @2 Q$ p, R' ~6 I- J9 P- f5 z/ _
    词向量(word2vec)# z. ^; [0 l  |' p
    将文章的每句话当成一行,将每个词用符号隔开(如使用中文分词工具jieba),根据上下文,可以找出相似词义的词。  Z# N' ~$ ?, m! w  v- U8 s
    比如:我 喜欢 你,我 爱 你,我 讨厌 你。根据上下文我和你,可以找到喜欢的相似词,有爱和讨厌。) u$ p0 b( j( `7 q' [
    再一般地如:1 2 3 X 4 5 6,1 2 3 Y 4 5 6。根据上下文1 2 3和4 5 6,可以找到X和Y相似。
    * U* T5 q' L5 `' r4 M& q+ L% F3 Lgensim是一个很好用的Python NLP的包,不光可以用于使用word2vec,还有很多其他的API可以用。它封装了google的C语言版的word2vec。
    * t' `$ F7 z4 [( I! C
    0 F1 M9 N8 d- d% |7 C) X0 m+ n- ~$ Qk近邻分类(kNN)! J& k8 h* z+ S  K
    基于某种距离度量找出训练集中与其最靠近的k个训练样本,或者指定距离e之内的训练样本,分类任务中通过投票法(以及加权投票等)将出现最多的类别标记作为预测结果,回归任务中则使用平均法(以及加权平均等)
    6 {6 B/ D+ }* b0 |! F, b" O! R优点:
    4 E: \! `5 u( a1、思想简单,易于理解,易于实现,无需估计参数,无需训练;
    * k  }1 }! t9 S3 v. \2、适合对稀有事件进行分类;
    ( f! r5 L0 M0 |$ n! E2 @3、特别适用于多分类问题
    3 V5 w& @- e4 M( b+ `; C$ o0 p缺点:
    / u. p, `$ M3 H) ^( ?6 ^' O# s/ W3 l1、需要计算出待测样本与所有样本的距离,计算量大
    0 t2 C/ p7 g% e& J2、样本不平衡时影响大
    & R* Z/ E, {1 x% x( w3、适用的特征维度低$ F8 }  p9 Q) A4 o, d, R9 x

    2 \* E4 N& u; o  k0 _线性模型
    4 Y9 q  Q3 w9 z: p% L( h优点:+ T  `$ D1 S' y) T' W
    1、算法简单,编程方便
    / ~" Z' `3 h( Q" }( R  f7 S2、计算简单,决策速度快5 A- F6 h5 k0 S0 }5 e1 Y7 u3 g0 e+ h
    缺点:- |' e+ ^5 j- j6 _
    1、拟合效果较差
    # u0 ]( S- u  F2 c6 o! W2 ?) n, H# [
    7 E1 N% r' {1 u4 E& S- Z' q高斯混合聚类与k均值(k-means)及其变种(k-means++、ISODATA、Kernel K-means)的对比5 U. {" v% b" s, c; {
    k-means是高斯混合聚类在混合成分方差相等、且每个样本仅指派给一个混合成分时的特例,因此k-means计算简单,但效果不如高斯混合聚类# g5 Q: H$ n' N4 W& }1 n. T
    由于计算太过复杂,高斯混合聚类并不常用,推荐使用k-means++(与k-means随机选定不同,k-means++初始选定的几个样本距离尽量远,这样能更快得出分簇结果)等k-means变种。
    ! E  D" x5 B  _5 f6 r
    - v9 P" L3 k3 \3 H) l  O关于学习算法的性能实验结果
    ( A; r/ ]8 c6 ?点击查看原文
    1 u' n* ^6 K# |+ Z. [5 n0 V* G6 q/ z4 c# @# B' H& N: q3 h  G
    14年的时候有人做过一个实验[1],比较在不同数据集上(121个),不同的分类器(179个)的实际效果。8 J5 ]+ u1 @* ~5 ?0 L4 J; H/ R9 ?
    论文题为:Do we Need Hundreds of Classifiers to Solve Real World Classification Problems?  F3 S- M$ ^* G! [5 i2 r
    没有最好的分类器,只有最合适的分类器。+ I/ u1 z. T0 c3 S- X, }! _) D0 S$ o
    1、随机森林平均来说最强,但也只在9.9%的数据集上拿到了第一,优点是鲜有短板。
    ) H4 m, v) e7 J; j3 I: \2、SVM的平均水平紧随其后,在10.7%的数据集上拿到第一。/ H' D7 U3 i2 K! h# ~3 ?& X2 v
    3、神经网络(13.2%)和boosting(~9%)表现不错。/ \% q9 P6 z! ~; G
    4、数据维度越高,随机森林就比AdaBoost强越多,但是整体不及SVM[2]。, l2 m$ q2 [3 E( d
    5、数据量越大,神经网络就越强。# M! P, R% h5 l* r1 r2 Z; \; Q
    ————————————————
    ( c2 \* o! i; I! M5 z8 d6 k1 I6 N版权声明:本文为CSDN博主「路飞的纯白世界」的原创文章,遵循CC 4.0 BY-SA版权协议,转载请附上原文出处链接及本声明。
    - a( h3 j0 l6 D" O原文链接:https://blog.csdn.net/u010921136/article/details/90668382
    4 ~- j% H1 N2 Q
    1 P: h" M1 l0 Q: P6 {2 R
    - Q$ B' f" k0 I$ }# a
    zan
    转播转播0 分享淘帖0 分享分享0 收藏收藏0 支持支持0 反对反对0 微信微信
    您需要登录后才可以回帖 登录 | 注册地址

    qq
    收缩
    • 电话咨询

    • 04714969085
    fastpost

    关于我们| 联系我们| 诚征英才| 对外合作| 产品服务| QQ

    手机版|Archiver| |繁體中文 手机客户端  

    蒙公网安备 15010502000194号

    Powered by Discuz! X2.5   © 2001-2013 数学建模网-数学中国 ( 蒙ICP备14002410号-3 蒙BBS备-0002号 )     论坛法律顾问:王兆丰

    GMT+8, 2026-9-8 07:50 , Processed in 0.383545 second(s), 50 queries .

    回顶部