QQ登录

只需要一步,快速开始

 注册地址  找回密码
查看: 2052|回复: 0
打印 上一主题 下一主题

各类机器学习算法的优缺点和适用场景汇总

[复制链接]
字体大小: 正常 放大
杨利霞        

5273

主题

82

听众

17万

积分

  • TA的每日心情
    开心
    2021-8-11 17:59
  • 签到天数: 17 天

    [LV.4]偶尔看看III

    网络挑战赛参赛者

    网络挑战赛参赛者

    自我介绍
    本人女,毕业于内蒙古科技大学,担任文职专业,毕业专业英语。

    群组2018美赛大象算法课程

    群组2018美赛护航培训课程

    群组2019年 数学中国站长建

    群组2019年数据分析师课程

    群组2018年大象老师国赛优

    跳转到指定楼层
    1#
    发表于 2021-4-10 11:24 |只看该作者 |倒序浏览
    |招呼Ta 关注Ta
    * i* k* Z" _5 _+ I) A" Y# B. a
    各类机器学习算法的优缺点和适用场景汇总
    4 Q$ u( J6 a/ K# T: b% [( A目录
    1 V8 `& i5 T6 o朴素贝叶斯分类器(NB:naive Bayes classifiers)! j1 Y& Q2 E! S5 v1 G
    半朴素贝叶斯分类器(SNB:semi-naive Bayes classifiers)
    9 N: @: P1 o, F* F0 {# r贝叶斯网(信念网)3 ?3 E# z, r+ o# o1 D
    决策树(decision tree), p$ W; a+ ]' a: V4 B& \
    支持向量机(SVM)
    2 z* k& [# I$ ^) z' w神经网络
    ) C8 }! E( o* e$ s词向量(word2vec)
    * w: ^% E/ C7 |k近邻分类(kNN)0 i0 _7 t; a# u) J6 P) p
    线性模型2 h* X& h8 F$ T, I* n8 m' O
    高斯混合聚类与k均值(k-means)及其变种(k-means++、ISODATA、Kernel K-means)的对比
    . F" ^2 _- t; [; R关于学习算法的性能实验结果/ n% y% g9 `2 a
    朴素贝叶斯分类器(NB:naive Bayes classifiers)# ^, o0 N" s2 \7 W5 `. |6 ~5 O6 ]; u
    顾名思义,其适用于分类任务、并且假设每个属性独立地对分类结果发生影响,然而现实中各个因素往往并不独立,那是否就无法解决问题呢?: Y* ~& l, m6 T2 L# C5 ?" X3 B
    事实上并非如此,相反,朴素贝叶斯分类器在很多情况下都能获得相当好的性能,一种解释是:无需精准概率值即可导致正确分类结果;另一种解释是:若属性间依赖对所有类别影响相同,或依赖关系的影响能相互抵消,则属性条件独立性假设在降低计算开销的同时,不会对性能产生负面影响。
    ) p( r0 l" p' F5 L3 T$ b
    - {/ H- h: H; _8 u; G; e优点:
    ; r2 ]7 ^' w  P1、计算量较小3 w  ~- ^% u$ N/ V/ ~1 w
    2、支持懒惰学习、增量学习
    ) ~! |/ z. @0 M; Y, J3、对缺失数据不太敏感
    / @1 q8 ~& {5 ^% N& W: \4、推断即查表,速度极快。
    ; h# A1 S9 W, H: F) T* Z+ V缺点:
    7 [- k5 a4 P# p$ L6 J, j/ |1、没有考虑属性间依赖  t( |& Y- e; R7 S% b
    2、通过类先验概率产生模型  y* e7 [' T3 L; x8 ]- d8 a5 A

    4 K- [1 r. l; Q  N半朴素贝叶斯分类器(SNB:semi-naive Bayes classifiers)7 T* L" T( h3 h7 o+ J; B9 y
    相比NB的不考虑依赖,SNB则是考虑了一个(独依赖估计策略:ODE)或多个(多依赖估计策略:kDE)属性依赖, _5 K" Z3 t5 F6 x; h
    优点:
    - H- x( z6 h7 q9 f1、考虑了一个或多个比较强的属性依赖关系,泛化性能可能得到提升( ]5 E& T3 {  Y8 ]) I4 w$ i
    2、计算开销不大/ g% _# Q% l) C5 q9 P: X
    3、同样支持懒惰学习、增量学习
    9 y( \3 b7 q% {. v0 _, s2 a缺点:0 H$ q4 s2 x6 H! k6 G8 `
    1、通过类先验概率产生模型) W3 @# H  y; i- x7 i, _6 z$ P
    # ~: u6 U. N: o6 C- Y
    贝叶斯网(信念网)
    ) N/ ~% a  p& ?# [1 m贝叶斯网借助有向无环图刻画属性之间的依赖关系,通过吉布斯采样或者变分推断等方式来近似推断后验概率。
    " q2 o& t; a( X0 P  T; k& H优点:. O4 |! w3 b) w  R  C) K
    1、更加完整地考虑了属性间依赖关系,泛化性能将进一步提升
    6 c4 M9 c; `! ]9 O. `2、近似估算后验概率# T# l* n' v9 {: H3 E
    3、可用于推测属性缺失的样本8 V1 V  V+ P) G6 L  c- ?
    4、良好的可解释性; A' S& L6 v7 t; f0 v; k; U+ h* C
    5、常用于语音识别、机器翻译等$ c3 t2 y; [( K
    缺点:
    1 M/ C+ I" Z$ ]1 b. A1、结构学习NP难,通过评分搜索方法缓解
    & c+ |) V0 M; H* Z4 U0 D+ v2、推断算法的收敛速度较慢
    ) k3 F& D2 o$ ?# x9 F) ]& L
    9 k" o1 `. u, n. p决策树(decision tree): s+ o* h% X4 N) J
    决策树通过信息纯度(信息增益、增益率、基尼指数等)来决定结点的生成,通过剪枝来缩小决策树的尺寸以及缓解过拟合。是一种非参数学习算法。/ S4 }. ~9 K1 g' S2 P% E1 a5 n
    优点:5 p, ~% P) U8 b7 u
    1、计算量较小/ F6 ~: ^6 d, `$ w" C% f
    2、清晰表达属性的重要程度2 d) u4 d& t6 [' {" u
    3、可增量学习对模型进行部分重构* p  [( l. C% }" v0 s7 ^; W8 _6 E
    4、不需要任何领域知识和参数假设
    ) T9 m5 b$ R0 g5、适合高维数据
    % z+ h* S+ X# F6、随机森林是基于决策树的集成学习策略,随机森林鲜有短板
    $ K0 Z% X; |4 I; _6 @# n2 |缺点:
    ) x" {) L5 v% d$ z( Q1、没有考虑属性间依赖% k( z' g3 s0 w* o2 X; v* {! B
    2、容易过拟合,通过剪枝缓解
    * |6 f( K. G+ C0 u; K. D4 B2 r9 c3、不可用于推测属性缺失的样本# \- ^& b( L* G+ J- I
    , }' Z% i( c( E; U. e, R. ~4 _+ b
    支持向量机(SVM)
    : K* U' c* s4 e# \7 q3 _, `( t; `基于训练集D在样本空间中找到一个划分超平面,将不同类别的样本分开,是一种针对二分类设计的算法,但稍加改造为支持向量回归即可用于回归学习。
    6 ^) E: `  S( e& |优点:
    ' z# {" w& {% S2 ^7 B( ^8 ]1、可解决小样本的机器学习任务* q: D# @. {: y# d3 [  i9 j
    2、可解决高维问题
    * x5 b$ p( E4 i  B+ v2 v3、可通过核方法解决非线性问题
    2 S/ V8 q/ @, ~/ X+ @# R1 X缺点:' ?1 v! ^0 f3 n9 I5 Y. ]
    1、对缺失数据敏感# `' D' g# n, E4 w# D, P. q1 Y
    2、对于非线性问题,核函数方法选择一直是个未决问题
    - _! N& s; X5 b7 s7 \6 ~" `
    % D* @- u. c7 a9 M: V2 ~神经网络
    ) q2 A& b' G5 a8 k3 q! h. ^. c优点:! r. \7 v/ g- e$ V6 ^
    1、分类的准确度极高
    5 H3 F/ k1 e. J8 y$ T# O2、可解决复杂的非线性问题
    . u% `; U( P5 F/ d' ?1 ^3、对噪声神经有较强的鲁棒性和容错能力: p/ @- W2 i9 k! y
    4、并行分布处理能力强,分布存储及学习能力强5 {" i* O6 E4 G8 S* `. K
    5、常用于图像识别' L6 Q& k  x! n  v: p, p; _
    6、数据量越大,表现越好
    7 k9 s3 k) H! v4 O9 j8 ?, R9 _缺点:3 S9 V6 m# _# ?' _* I, \
    1、黑箱模型,难以解释
    , q  g, d( `; |* ~# q3 d2、需要初始化以及训练大量参数,如网络结构、权值、阈值,计算复杂
    + w9 J  A& }& Z7 C3 y$ Z3、误差逆传播的损失
    ' }( u6 {1 Y4 W/ Y4、容易陷入局部最小
    : q' n8 q% }3 [$ M. _8 k2 c% X( i' Q. n6 x# ^
    词向量(word2vec)
    + Z8 {$ @% Z$ g% Z* V将文章的每句话当成一行,将每个词用符号隔开(如使用中文分词工具jieba),根据上下文,可以找出相似词义的词。
    : ^4 i+ `* }  S, V0 P0 [: T比如:我 喜欢 你,我 爱 你,我 讨厌 你。根据上下文我和你,可以找到喜欢的相似词,有爱和讨厌。
    7 g& k5 A& C# Z; I. |! b" m5 t: i再一般地如:1 2 3 X 4 5 6,1 2 3 Y 4 5 6。根据上下文1 2 3和4 5 6,可以找到X和Y相似。$ n- j7 Z, l- y# ]. j' `  Y3 }4 ]
    gensim是一个很好用的Python NLP的包,不光可以用于使用word2vec,还有很多其他的API可以用。它封装了google的C语言版的word2vec。9 [& F- I- ?8 D
    - d1 `( F4 Q. }. i2 u9 M' q& ~' K
    k近邻分类(kNN)0 ]" e, j. T/ ~/ x  A( X
    基于某种距离度量找出训练集中与其最靠近的k个训练样本,或者指定距离e之内的训练样本,分类任务中通过投票法(以及加权投票等)将出现最多的类别标记作为预测结果,回归任务中则使用平均法(以及加权平均等)
    - p  g7 q* I: b0 l0 e6 l1 N- \; ^  K优点:
    , O) c4 l4 D7 m3 W1、思想简单,易于理解,易于实现,无需估计参数,无需训练;" }6 V5 X, P; p. r
    2、适合对稀有事件进行分类;
    * e3 C. H; P4 S3、特别适用于多分类问题& f) B: D" N5 A* H( [. I" v
    缺点:0 B5 b  ?2 z# k) J
    1、需要计算出待测样本与所有样本的距离,计算量大
    $ `8 ?+ V& |  O7 Y# m* H# v2、样本不平衡时影响大
    5 ^1 {8 L  I/ [+ s+ E. N3、适用的特征维度低2 I+ {5 [- R! B$ _# B+ o" Q

    7 E" q3 f0 V5 c2 @, {8 e线性模型5 u' r9 j- t; b, U: w  W1 J5 _
    优点:
    $ h+ ~' e+ R: F1、算法简单,编程方便
    9 A0 ?6 c3 x( J: ^$ q2、计算简单,决策速度快- m; u# o: o6 o9 @
    缺点:% r2 z" M; K1 |; C
    1、拟合效果较差
    ( V3 {7 S- E$ Y5 f
    4 G. ~3 b7 {1 H5 B6 n+ q高斯混合聚类与k均值(k-means)及其变种(k-means++、ISODATA、Kernel K-means)的对比
    ' U( T( [  ?+ [* w9 Tk-means是高斯混合聚类在混合成分方差相等、且每个样本仅指派给一个混合成分时的特例,因此k-means计算简单,但效果不如高斯混合聚类
    . p6 Z8 x5 l# u, ?1 \; F) X  n由于计算太过复杂,高斯混合聚类并不常用,推荐使用k-means++(与k-means随机选定不同,k-means++初始选定的几个样本距离尽量远,这样能更快得出分簇结果)等k-means变种。  {4 l' G# D5 g  ^1 R% D4 g' e

    8 l9 p7 B, c+ D4 v7 Z' \关于学习算法的性能实验结果) C8 G. T# K* T4 g  D* [
    点击查看原文
    : l) L, R, Y! Z
    8 c; j, e$ j' C+ E7 m0 b" p14年的时候有人做过一个实验[1],比较在不同数据集上(121个),不同的分类器(179个)的实际效果。
    / q. S2 T& `1 F9 E论文题为:Do we Need Hundreds of Classifiers to Solve Real World Classification Problems?1 O, D% K/ L# h! v# H( d5 U
    没有最好的分类器,只有最合适的分类器。  v6 N8 M  ]9 j% E, \
    1、随机森林平均来说最强,但也只在9.9%的数据集上拿到了第一,优点是鲜有短板。) s+ g) a2 S! [' m0 Z+ E' @
    2、SVM的平均水平紧随其后,在10.7%的数据集上拿到第一。6 ~# ?- M5 f8 E& C
    3、神经网络(13.2%)和boosting(~9%)表现不错。
    6 L, e4 T9 x* x$ E4 o& [4、数据维度越高,随机森林就比AdaBoost强越多,但是整体不及SVM[2]。
    9 n6 p6 J) J  h5、数据量越大,神经网络就越强。  @- {" {/ E8 R9 P
    ————————————————
    . h( q$ d5 {' D2 w' T% _1 O版权声明:本文为CSDN博主「路飞的纯白世界」的原创文章,遵循CC 4.0 BY-SA版权协议,转载请附上原文出处链接及本声明。
    $ F' q% h& ]9 e6 i原文链接:https://blog.csdn.net/u010921136/article/details/90668382
    / U. ]$ r2 p" @! i, y" I8 i+ @: ^
    # ?% b. ]$ [' X; \, w$ O. w  }/ [* ~
    ) [, Z' c; M5 C; C! |! \
    zan
    转播转播0 分享淘帖0 分享分享0 收藏收藏0 支持支持0 反对反对0 微信微信
    您需要登录后才可以回帖 登录 | 注册地址

    qq
    收缩
    • 电话咨询

    • 04714969085
    fastpost

    关于我们| 联系我们| 诚征英才| 对外合作| 产品服务| QQ

    手机版|Archiver| |繁體中文 手机客户端  

    蒙公网安备 15010502000194号

    Powered by Discuz! X2.5   © 2001-2013 数学建模网-数学中国 ( 蒙ICP备14002410号-3 蒙BBS备-0002号 )     论坛法律顾问:王兆丰

    GMT+8, 2026-7-25 18:41 , Processed in 0.841098 second(s), 50 queries .

    回顶部