QQ登录

只需要一步,快速开始

 注册地址  找回密码
查看: 2087|回复: 0
打印 上一主题 下一主题

各类机器学习算法的优缺点和适用场景汇总

[复制链接]
字体大小: 正常 放大
杨利霞        

5273

主题

82

听众

17万

积分

  • TA的每日心情
    开心
    2021-8-11 17:59
  • 签到天数: 17 天

    [LV.4]偶尔看看III

    网络挑战赛参赛者

    网络挑战赛参赛者

    自我介绍
    本人女,毕业于内蒙古科技大学,担任文职专业,毕业专业英语。

    群组2018美赛大象算法课程

    群组2018美赛护航培训课程

    群组2019年 数学中国站长建

    群组2019年数据分析师课程

    群组2018年大象老师国赛优

    跳转到指定楼层
    1#
    发表于 2021-4-10 11:24 |只看该作者 |倒序浏览
    |招呼Ta 关注Ta
    / {% h4 o  h7 g
    各类机器学习算法的优缺点和适用场景汇总
    6 V) E( C5 y7 x) ]目录+ L2 K- e+ a6 M7 T- v0 u5 M7 i
    朴素贝叶斯分类器(NB:naive Bayes classifiers)  ?0 b7 [: B5 A# @% m. H8 i- m
    半朴素贝叶斯分类器(SNB:semi-naive Bayes classifiers)
    : ]6 K5 b2 a4 d2 R贝叶斯网(信念网)  l5 Y# u( A7 G8 C' D8 I, {
    决策树(decision tree)* f3 w, E7 h7 P5 \
    支持向量机(SVM)
    0 U- G) P; m+ W9 Y. h9 V神经网络/ R5 |- B; l7 g2 L0 I/ p0 Q! N
    词向量(word2vec)- k/ `6 v( F# c1 N0 Y$ G: r
    k近邻分类(kNN)
    , j( _& ]* L" I7 j" l( w9 x+ [! V线性模型: ?8 e' z: Y2 A) ?7 i. o3 k
    高斯混合聚类与k均值(k-means)及其变种(k-means++、ISODATA、Kernel K-means)的对比
    7 h5 I- ]: @8 Y- S; Y3 p1 p5 F关于学习算法的性能实验结果
    + F' ?2 @; y7 K: t3 F* z7 v' n9 z朴素贝叶斯分类器(NB:naive Bayes classifiers)2 U  u! S  {/ O. h9 j# a
    顾名思义,其适用于分类任务、并且假设每个属性独立地对分类结果发生影响,然而现实中各个因素往往并不独立,那是否就无法解决问题呢?
    1 {- r' }8 F- g1 L5 T* h事实上并非如此,相反,朴素贝叶斯分类器在很多情况下都能获得相当好的性能,一种解释是:无需精准概率值即可导致正确分类结果;另一种解释是:若属性间依赖对所有类别影响相同,或依赖关系的影响能相互抵消,则属性条件独立性假设在降低计算开销的同时,不会对性能产生负面影响。+ B/ y$ i( N7 }8 K4 n

    ' v! p' c( n% l2 |6 i6 I优点:8 d6 V+ z% F% R4 \! x0 m( z7 ?9 t+ i
    1、计算量较小
    # `! q6 q5 S* K+ |7 P) t0 q1 k2、支持懒惰学习、增量学习" N+ s6 ~2 v! ]& c
    3、对缺失数据不太敏感8 a3 P& S0 F+ h4 i5 l
    4、推断即查表,速度极快。0 X3 w' ~  a% d$ e3 i
    缺点:
    9 u& {; D4 [/ A. x1、没有考虑属性间依赖
    : c: @% ^6 W; c; |2、通过类先验概率产生模型
    0 b8 T. k# K* q( ~
    $ @: {5 L2 H) i) G- x% A3 q8 m; a半朴素贝叶斯分类器(SNB:semi-naive Bayes classifiers)
    + P, I, E) X' ~' V; v, e2 P相比NB的不考虑依赖,SNB则是考虑了一个(独依赖估计策略:ODE)或多个(多依赖估计策略:kDE)属性依赖& N7 x* m) _. r
    优点:
    ( c1 D9 J% N$ R/ Q1、考虑了一个或多个比较强的属性依赖关系,泛化性能可能得到提升
    ' @8 W: `$ I! V5 k* q! L6 U2 H2、计算开销不大1 W! k, y1 k# S' D0 X
    3、同样支持懒惰学习、增量学习: e% ~  H: D; N5 F" G% b
    缺点:1 S  W* S4 i7 k3 f! g2 y4 h' j
    1、通过类先验概率产生模型
    4 v! n( J8 [2 ^( G2 }% x  T, T' R" q& k' _1 a
    贝叶斯网(信念网)  i$ f! K2 b! M# f5 Q3 w
    贝叶斯网借助有向无环图刻画属性之间的依赖关系,通过吉布斯采样或者变分推断等方式来近似推断后验概率。
    " f8 b. A4 V( `& P) n" r优点:
    $ m3 \9 C1 P, T) |7 `  }1、更加完整地考虑了属性间依赖关系,泛化性能将进一步提升2 V  r. d* Q% A* u+ Q# V+ ]- A
    2、近似估算后验概率# ~0 }' I- q- B: X) u7 S7 v$ g- h
    3、可用于推测属性缺失的样本
    , l) G1 _: D( K* k6 x$ `- X3 P4、良好的可解释性8 d+ a" }* e, \& a' o
    5、常用于语音识别、机器翻译等0 @/ `" Y# n6 ^# l7 ?: i3 E
    缺点:
    4 x+ p6 V* N" T$ h* G1、结构学习NP难,通过评分搜索方法缓解
    ) d0 x6 r1 W# K+ ^1 p2、推断算法的收敛速度较慢6 b4 H. `) g' H+ c
    & x7 ~# [. A- M9 {: g1 n1 H
    决策树(decision tree)! S  a3 D/ v. L; V
    决策树通过信息纯度(信息增益、增益率、基尼指数等)来决定结点的生成,通过剪枝来缩小决策树的尺寸以及缓解过拟合。是一种非参数学习算法。
    * u  I9 F  {; e; H! R优点:7 B5 z' Y& ^& b: s
    1、计算量较小2 A) |! N/ k$ }/ j8 x8 X. e) p
    2、清晰表达属性的重要程度
    9 i+ `" \# n; R% F! k. f3、可增量学习对模型进行部分重构
    $ S( O' y+ F) P! I) K4、不需要任何领域知识和参数假设# s# I+ O; d2 k# M5 ~  v+ t
    5、适合高维数据& t7 D) u) e3 L+ J
    6、随机森林是基于决策树的集成学习策略,随机森林鲜有短板" P# k+ j0 T& [+ B; S
    缺点:$ S2 C8 D; r# p3 O
    1、没有考虑属性间依赖- v1 u8 l( h/ Y0 k$ ?, T
    2、容易过拟合,通过剪枝缓解! A8 R  \/ Y7 Y6 z; V2 H
    3、不可用于推测属性缺失的样本
    4 l7 q  H6 h* t0 m. I9 ~
    7 n. g0 d. u# R: r支持向量机(SVM)3 a$ N  a+ h3 ~# e0 l' Y8 f9 g
    基于训练集D在样本空间中找到一个划分超平面,将不同类别的样本分开,是一种针对二分类设计的算法,但稍加改造为支持向量回归即可用于回归学习。
    / c3 D! W+ o" }$ \优点:8 n& t5 d$ {1 }# A) w
    1、可解决小样本的机器学习任务
    + Y- `; z  V! g3 {: d5 H) ]2、可解决高维问题, D9 S* U6 R( C# ^3 R7 ?( G
    3、可通过核方法解决非线性问题
    % `6 T! ?% w5 S& e1 Q$ f' s! P缺点:7 M8 S' `; o  U: E$ s/ l# L
    1、对缺失数据敏感; @% @7 P, B5 `6 M. w; G; i! y
    2、对于非线性问题,核函数方法选择一直是个未决问题% p# ]' J0 U# l) H; T

    ( [3 Q1 s* |$ r0 `/ j神经网络1 q  o; r+ Q0 r2 `8 Y
    优点:8 V+ R& V8 I8 I! O$ M& f, ]) x- ~" X
    1、分类的准确度极高
    & t% t$ L% M+ H2、可解决复杂的非线性问题
    4 m" \( X/ t0 t- E3、对噪声神经有较强的鲁棒性和容错能力, x/ R. E; Y/ L  P4 r
    4、并行分布处理能力强,分布存储及学习能力强
    9 B7 b6 |7 n, k! n7 |+ l# Q3 `+ \5、常用于图像识别+ r6 T  \" V3 X. t, c4 u! k1 E3 `% H
    6、数据量越大,表现越好
    * C% L1 ~* h% u* b缺点:4 B9 B" X6 e) W1 X; x
    1、黑箱模型,难以解释% i. L9 y% h2 D/ _  ^
    2、需要初始化以及训练大量参数,如网络结构、权值、阈值,计算复杂$ h& A. S6 J8 {4 {
    3、误差逆传播的损失
    ( c* g% J4 y" F; I4、容易陷入局部最小2 D! R) a7 s* {

    & C5 r4 w4 r: |- f: s8 S. @4 d词向量(word2vec)* L8 O2 Q# ^* X: h" B2 n2 V
    将文章的每句话当成一行,将每个词用符号隔开(如使用中文分词工具jieba),根据上下文,可以找出相似词义的词。
    6 a0 m5 z1 _; H5 X- D比如:我 喜欢 你,我 爱 你,我 讨厌 你。根据上下文我和你,可以找到喜欢的相似词,有爱和讨厌。
    7 u# d9 i0 \, W! N# h再一般地如:1 2 3 X 4 5 6,1 2 3 Y 4 5 6。根据上下文1 2 3和4 5 6,可以找到X和Y相似。+ P! C# t' J2 h$ B( v) |( b
    gensim是一个很好用的Python NLP的包,不光可以用于使用word2vec,还有很多其他的API可以用。它封装了google的C语言版的word2vec。
    8 x' ]: R+ o! s7 w, Y$ f5 U. j" z  i* [' e, H- O4 U* M
    k近邻分类(kNN)( X5 k7 i$ ?9 P' ]7 \0 b$ Y- T1 S
    基于某种距离度量找出训练集中与其最靠近的k个训练样本,或者指定距离e之内的训练样本,分类任务中通过投票法(以及加权投票等)将出现最多的类别标记作为预测结果,回归任务中则使用平均法(以及加权平均等)
    : E! g2 F8 s5 t% x/ f1 n! D优点:: R1 l3 p; {5 D3 f
    1、思想简单,易于理解,易于实现,无需估计参数,无需训练;
    ! o; z9 }0 S. y+ _* @- g1 F; _2、适合对稀有事件进行分类;
    5 r9 B7 d7 g5 Y/ X" F$ F/ P3、特别适用于多分类问题& @3 X: E' o7 ]6 `: w
    缺点:
    - g+ T) i6 N% e* p  u7 c% y1、需要计算出待测样本与所有样本的距离,计算量大9 P' N5 ?* z- [. p5 j) M2 O6 K7 g
    2、样本不平衡时影响大9 m; w& ?& w3 O& i
    3、适用的特征维度低
      c- o9 A: A( S" P' }1 v
    & k4 y" Z9 x! z: N  Q线性模型* e0 }; U; g# U
    优点:/ B0 C+ F, i8 m% I1 Y
    1、算法简单,编程方便0 l6 j& I, b" K3 M
    2、计算简单,决策速度快6 a* }( ^# E4 ~* A; c
    缺点:
    ' x# A4 n& r6 c1 [1、拟合效果较差
    ! y4 w3 L5 y9 `9 l0 n- E" A" V2 r2 a! M- _2 i
    高斯混合聚类与k均值(k-means)及其变种(k-means++、ISODATA、Kernel K-means)的对比
    + B6 P3 K1 @( t% A4 f( v  Jk-means是高斯混合聚类在混合成分方差相等、且每个样本仅指派给一个混合成分时的特例,因此k-means计算简单,但效果不如高斯混合聚类: V9 J+ V7 `$ ?
    由于计算太过复杂,高斯混合聚类并不常用,推荐使用k-means++(与k-means随机选定不同,k-means++初始选定的几个样本距离尽量远,这样能更快得出分簇结果)等k-means变种。
    . d# M% {5 q2 p1 L( a0 |* j
    : ?' m8 A1 H- ^; I8 j2 q, {关于学习算法的性能实验结果
      m' @4 a- N5 I, e5 x3 ^点击查看原文
    " J7 ]2 X5 U- w& N* v$ l/ I, |1 }7 t% B" U  w" l0 l; r" i. o
    14年的时候有人做过一个实验[1],比较在不同数据集上(121个),不同的分类器(179个)的实际效果。- x6 V, P0 U; O& @$ ]* F! t6 f4 F
    论文题为:Do we Need Hundreds of Classifiers to Solve Real World Classification Problems?3 |8 g9 }% G5 |$ y2 s7 {+ ^7 f
    没有最好的分类器,只有最合适的分类器。
    , P6 H) i) n8 ?" K2 D9 L6 D1、随机森林平均来说最强,但也只在9.9%的数据集上拿到了第一,优点是鲜有短板。/ k+ _6 @; @( k% F# y
    2、SVM的平均水平紧随其后,在10.7%的数据集上拿到第一。
    ( v9 v: H8 ~, {2 |3 S5 }# b5 [3、神经网络(13.2%)和boosting(~9%)表现不错。1 e* ]: n4 p. X  e) n% t. }+ s
    4、数据维度越高,随机森林就比AdaBoost强越多,但是整体不及SVM[2]。3 H1 v4 t; u1 F2 \1 G; I$ k- Y
    5、数据量越大,神经网络就越强。
    4 k6 \$ W/ q5 Q% S+ k) m- |0 T————————————————
    " a" p8 F5 {$ j! W版权声明:本文为CSDN博主「路飞的纯白世界」的原创文章,遵循CC 4.0 BY-SA版权协议,转载请附上原文出处链接及本声明。- q0 I  t5 A1 W$ O$ r  s2 O
    原文链接:https://blog.csdn.net/u010921136/article/details/906683829 P; [  H4 }6 p4 \9 Q" d

    6 C/ ~- z2 f( T; l9 B% Q
    . g( h4 ~. N& q) D7 Y) c) |* H$ l' N
    zan
    转播转播0 分享淘帖0 分享分享0 收藏收藏0 支持支持0 反对反对0 微信微信
    您需要登录后才可以回帖 登录 | 注册地址

    qq
    收缩
    • 电话咨询

    • 04714969085
    fastpost

    关于我们| 联系我们| 诚征英才| 对外合作| 产品服务| QQ

    手机版|Archiver| |繁體中文 手机客户端  

    蒙公网安备 15010502000194号

    Powered by Discuz! X2.5   © 2001-2013 数学建模网-数学中国 ( 蒙ICP备14002410号-3 蒙BBS备-0002号 )     论坛法律顾问:王兆丰

    GMT+8, 2026-9-10 03:45 , Processed in 0.433528 second(s), 50 queries .

    回顶部