QQ登录

只需要一步,快速开始

 注册地址  找回密码
查看: 2085|回复: 0
打印 上一主题 下一主题

各类机器学习算法的优缺点和适用场景汇总

[复制链接]
字体大小: 正常 放大
杨利霞        

5273

主题

82

听众

17万

积分

  • TA的每日心情
    开心
    2021-8-11 17:59
  • 签到天数: 17 天

    [LV.4]偶尔看看III

    网络挑战赛参赛者

    网络挑战赛参赛者

    自我介绍
    本人女,毕业于内蒙古科技大学,担任文职专业,毕业专业英语。

    群组2018美赛大象算法课程

    群组2018美赛护航培训课程

    群组2019年 数学中国站长建

    群组2019年数据分析师课程

    群组2018年大象老师国赛优

    跳转到指定楼层
    1#
    发表于 2021-4-10 11:24 |只看该作者 |倒序浏览
    |招呼Ta 关注Ta

    # U: o% y! j" Z/ v各类机器学习算法的优缺点和适用场景汇总
    % N/ w2 c1 [& E) w# G2 u& y5 q目录
    $ y9 G1 D0 H8 t朴素贝叶斯分类器(NB:naive Bayes classifiers)
    $ u. ~9 K% Y0 Q# m半朴素贝叶斯分类器(SNB:semi-naive Bayes classifiers)
      k2 A' r# [" `) s1 ]贝叶斯网(信念网)
    7 ]! T% i5 x7 g' u' L* N决策树(decision tree)
    ! p* u, _; `' C2 _3 l支持向量机(SVM)) R9 R) a' r+ t  r; k
    神经网络/ ^+ z7 r) d$ V, I9 K! E) p2 t
    词向量(word2vec)9 F& G/ ^7 {' Q1 t& Z0 F0 N* i
    k近邻分类(kNN). j1 W9 a4 p1 Z% _! b
    线性模型' ~0 U3 a* N" u. H3 d
    高斯混合聚类与k均值(k-means)及其变种(k-means++、ISODATA、Kernel K-means)的对比
    2 m+ V2 V4 H) O* _关于学习算法的性能实验结果
    * I& M1 x- F8 F朴素贝叶斯分类器(NB:naive Bayes classifiers)
    + C# t& R3 x! @9 {9 Q3 ]; m顾名思义,其适用于分类任务、并且假设每个属性独立地对分类结果发生影响,然而现实中各个因素往往并不独立,那是否就无法解决问题呢?9 b: R# ~7 O  n( }9 z- v
    事实上并非如此,相反,朴素贝叶斯分类器在很多情况下都能获得相当好的性能,一种解释是:无需精准概率值即可导致正确分类结果;另一种解释是:若属性间依赖对所有类别影响相同,或依赖关系的影响能相互抵消,则属性条件独立性假设在降低计算开销的同时,不会对性能产生负面影响。* |$ d8 z' S: D% A! {: ?8 \
    3 T; N% n) p* P
    优点:
    4 o2 m# T; f; t+ {, h/ l1、计算量较小# [* `4 d' o* J
    2、支持懒惰学习、增量学习
    6 @3 t; @  P1 F3、对缺失数据不太敏感2 b8 R  j2 m, `5 w1 c7 i3 E
    4、推断即查表,速度极快。# C* ^& A0 j1 ^3 L& s
    缺点:
    , i! L4 P& R, K$ m* ^( D! k5 k1、没有考虑属性间依赖! Y5 E' ?4 o. G! ~+ B  E" U
    2、通过类先验概率产生模型9 [* }: f3 T# }
    , T% g4 E4 F% U/ P  Z
    半朴素贝叶斯分类器(SNB:semi-naive Bayes classifiers)
    & t; E; h. w& K3 K3 {5 Z# q+ k& ]相比NB的不考虑依赖,SNB则是考虑了一个(独依赖估计策略:ODE)或多个(多依赖估计策略:kDE)属性依赖& C% n! J6 S3 d: Q/ c
    优点:" S% [7 H  I3 k% n
    1、考虑了一个或多个比较强的属性依赖关系,泛化性能可能得到提升
    # @" m% h0 _1 L) J2、计算开销不大
    1 J' d$ I- T# d  O3、同样支持懒惰学习、增量学习0 g; T2 m1 [0 p6 N* \0 `' S! D, _
    缺点:
    $ N  [4 j. [' g( \1、通过类先验概率产生模型+ ?2 n8 i6 K) Q6 v" L1 l

    $ B$ ^4 x0 m3 q! Z" y贝叶斯网(信念网)
    2 X! g" v" {% E; W贝叶斯网借助有向无环图刻画属性之间的依赖关系,通过吉布斯采样或者变分推断等方式来近似推断后验概率。
    0 I! L) `6 x& |/ W  h1 @优点:
    ' X" q# q0 I3 m) u2 u( b- j0 u0 w1、更加完整地考虑了属性间依赖关系,泛化性能将进一步提升% b7 x" H% o1 ~; `
    2、近似估算后验概率
    - }$ L& L; R; c" R/ F9 a3、可用于推测属性缺失的样本6 k3 V7 n- C  ^4 t! z1 r. r
    4、良好的可解释性7 \8 U: \8 Y1 K  P
    5、常用于语音识别、机器翻译等
    : n/ ^1 }# |, j' _4 V- g缺点:
    ' C" \/ o; _0 L1 |  v" {& p: }) {1、结构学习NP难,通过评分搜索方法缓解
    * @: l+ e7 \% A$ i$ @! c2、推断算法的收敛速度较慢
    3 y2 e( {2 ?, x9 V/ e/ \& X
    - z1 J# Z; R3 U8 i) o, q# ]+ e$ w决策树(decision tree)
    6 Z8 ^4 V' @3 H9 ?  s1 G1 z* `决策树通过信息纯度(信息增益、增益率、基尼指数等)来决定结点的生成,通过剪枝来缩小决策树的尺寸以及缓解过拟合。是一种非参数学习算法。
    , b9 T8 C9 u. V" S# J- M优点:4 O# x5 n+ V' ]* o
    1、计算量较小
    5 {- T! X. j3 A9 y8 e9 T% W2、清晰表达属性的重要程度/ K3 T$ T+ `/ I* ?: C3 U+ T4 |  {
    3、可增量学习对模型进行部分重构; E7 _" W9 M  Q$ }% ?
    4、不需要任何领域知识和参数假设
    2 A! N. I" l! K9 ^6 W5、适合高维数据
    0 s, Z0 |. u# N3 o% `6、随机森林是基于决策树的集成学习策略,随机森林鲜有短板7 I5 H3 _7 y; E9 y
    缺点:
    ! B, P! X1 [% S+ Y1、没有考虑属性间依赖
    8 h& O2 i  g$ v7 q2、容易过拟合,通过剪枝缓解! Z. L  ?1 J3 P$ X8 m- T
    3、不可用于推测属性缺失的样本
    / H9 d1 o0 Z  T+ g- \
    ! |/ q3 i$ U/ f2 q: c1 r- h% T支持向量机(SVM)
    + D2 W( G, e* F基于训练集D在样本空间中找到一个划分超平面,将不同类别的样本分开,是一种针对二分类设计的算法,但稍加改造为支持向量回归即可用于回归学习。
    - f$ W+ e$ z: ~/ O, }, X: ^优点:+ w+ t  \' v8 {! q
    1、可解决小样本的机器学习任务
    ( }+ X% H4 I  |& I/ G/ a, v; w2、可解决高维问题
    ' [6 ?6 o0 A8 s3、可通过核方法解决非线性问题8 r; Z$ A" {/ g2 C9 H+ V" v
    缺点:
    8 W# P$ O  R9 i1、对缺失数据敏感
      O2 Z2 B; m2 y* ~: }' T- b2、对于非线性问题,核函数方法选择一直是个未决问题
    % v' \6 J$ P5 w! ^8 P7 X, x2 T9 j7 c& M! Y6 }
    神经网络2 B; z) ~' W" V- ]+ d
    优点:+ Q, C% S: w% f6 ^  {3 Q# N0 O( |
    1、分类的准确度极高) w4 w( d( _! z2 [3 M, Z( D4 M
    2、可解决复杂的非线性问题* h3 ]/ T/ `" z1 L  e( z% T
    3、对噪声神经有较强的鲁棒性和容错能力
    ! u/ c- ?0 q: a4 b% E( M1 o4、并行分布处理能力强,分布存储及学习能力强
    ; m1 R7 P0 ~8 e7 A* {5、常用于图像识别" [% ?: s3 a$ \+ l
    6、数据量越大,表现越好
    " S8 U4 m$ F$ ]% @7 u! q, D缺点:
    2 N" Y! @$ p# s5 g" W8 W4 |/ N! b1、黑箱模型,难以解释' I  `; T- |" D2 J1 q% g5 o
    2、需要初始化以及训练大量参数,如网络结构、权值、阈值,计算复杂
    ( h9 X/ M1 ]/ h) V" ~% E5 K5 }3、误差逆传播的损失
    ' Q. ^4 M1 k7 L) v' _4、容易陷入局部最小
    7 g0 G! B2 w+ h; h" D* ^. S. @, `/ x7 g- d- Q+ C
    词向量(word2vec). e4 A& ?$ ]5 o/ w
    将文章的每句话当成一行,将每个词用符号隔开(如使用中文分词工具jieba),根据上下文,可以找出相似词义的词。
    " R$ o" Q, k  u+ M比如:我 喜欢 你,我 爱 你,我 讨厌 你。根据上下文我和你,可以找到喜欢的相似词,有爱和讨厌。- B/ N6 R+ u5 \1 |
    再一般地如:1 2 3 X 4 5 6,1 2 3 Y 4 5 6。根据上下文1 2 3和4 5 6,可以找到X和Y相似。3 G1 Q5 e1 \. c
    gensim是一个很好用的Python NLP的包,不光可以用于使用word2vec,还有很多其他的API可以用。它封装了google的C语言版的word2vec。2 X6 A2 B, Q! [* Y* x1 l2 E, b

    * g+ s" c/ }3 Q- Wk近邻分类(kNN)
    $ |. F1 a0 O7 s. o基于某种距离度量找出训练集中与其最靠近的k个训练样本,或者指定距离e之内的训练样本,分类任务中通过投票法(以及加权投票等)将出现最多的类别标记作为预测结果,回归任务中则使用平均法(以及加权平均等)6 v. f9 f' w$ N$ r9 j
    优点:+ @1 U/ ?; S9 ]6 S
    1、思想简单,易于理解,易于实现,无需估计参数,无需训练;
    " g. _7 ?/ S: Q; H% v, u" f; i2、适合对稀有事件进行分类;
    ' L: b- Q6 `* w0 o/ J% g" ?3、特别适用于多分类问题9 m. H/ @" d8 }; @4 z
    缺点:
    ( \2 O4 V& {& [; N1、需要计算出待测样本与所有样本的距离,计算量大
    ; ^/ `* g3 I$ d7 E' d% ?2、样本不平衡时影响大
    * o2 V: f3 C, E8 K$ o2 q" I3、适用的特征维度低, S3 U5 k- ~7 r! Z9 k
    ' G! y2 J6 j' S$ t7 r( a
    线性模型% b# z( K- I# Z" e& n# o; O5 X9 w: N/ C
    优点:3 h2 d7 r1 E5 o- H5 c
    1、算法简单,编程方便
    # ]5 b. V! y, q- I; e% e7 g+ x2、计算简单,决策速度快# j3 h2 }4 F. m
    缺点:% f$ E0 m' b, A5 c& d: x: z/ m
    1、拟合效果较差
      C% H  x! g( K: z- J8 h$ v7 z
    0 p# L* m3 w% ~高斯混合聚类与k均值(k-means)及其变种(k-means++、ISODATA、Kernel K-means)的对比& H$ j, S7 @+ n! A( j, H
    k-means是高斯混合聚类在混合成分方差相等、且每个样本仅指派给一个混合成分时的特例,因此k-means计算简单,但效果不如高斯混合聚类" x, x( a, A) k3 P9 f& }4 Q% k
    由于计算太过复杂,高斯混合聚类并不常用,推荐使用k-means++(与k-means随机选定不同,k-means++初始选定的几个样本距离尽量远,这样能更快得出分簇结果)等k-means变种。
    - |+ f: j% K9 I, A
    " q& n" h9 L7 {  k! T关于学习算法的性能实验结果
    + \# X# a* ~# w1 v点击查看原文
    * H, x5 [, u  n* ~9 F5 e; w3 v9 u! B* f! \  C9 |$ @  G
    14年的时候有人做过一个实验[1],比较在不同数据集上(121个),不同的分类器(179个)的实际效果。7 W9 v, j* |6 D. A3 {" V
    论文题为:Do we Need Hundreds of Classifiers to Solve Real World Classification Problems?# ]/ o& w9 i4 ]2 W
    没有最好的分类器,只有最合适的分类器。) ]# L1 J, y6 w- q$ z0 R- I
    1、随机森林平均来说最强,但也只在9.9%的数据集上拿到了第一,优点是鲜有短板。
    , }* [  a+ n" A7 a2、SVM的平均水平紧随其后,在10.7%的数据集上拿到第一。5 }" X% L7 {7 _/ _  q+ K* F
    3、神经网络(13.2%)和boosting(~9%)表现不错。) R" x, I9 v  W, G7 J4 ~; _6 K
    4、数据维度越高,随机森林就比AdaBoost强越多,但是整体不及SVM[2]。. Z- V9 A5 T2 l: M
    5、数据量越大,神经网络就越强。) h$ U. w' I3 I
    ————————————————* p/ d: z! [( v9 m3 R8 v
    版权声明:本文为CSDN博主「路飞的纯白世界」的原创文章,遵循CC 4.0 BY-SA版权协议,转载请附上原文出处链接及本声明。
    1 v% w0 |! a$ W9 M* K* [; |* y原文链接:https://blog.csdn.net/u010921136/article/details/90668382
    " @' \6 `# i- s+ d9 ]1 O/ Q! L3 a1 X1 o: e* H; w/ g* z  R8 w- q5 J

    2 [: j6 m" A1 a/ M" B3 C
    zan
    转播转播0 分享淘帖0 分享分享0 收藏收藏0 支持支持0 反对反对0 微信微信
    您需要登录后才可以回帖 登录 | 注册地址

    qq
    收缩
    • 电话咨询

    • 04714969085
    fastpost

    关于我们| 联系我们| 诚征英才| 对外合作| 产品服务| QQ

    手机版|Archiver| |繁體中文 手机客户端  

    蒙公网安备 15010502000194号

    Powered by Discuz! X2.5   © 2001-2013 数学建模网-数学中国 ( 蒙ICP备14002410号-3 蒙BBS备-0002号 )     论坛法律顾问:王兆丰

    GMT+8, 2026-9-9 15:59 , Processed in 0.452398 second(s), 50 queries .

    回顶部