QQ登录

只需要一步,快速开始

 注册地址  找回密码
查看: 2050|回复: 0
打印 上一主题 下一主题

各类机器学习算法的优缺点和适用场景汇总

[复制链接]
字体大小: 正常 放大
杨利霞        

5273

主题

82

听众

17万

积分

  • TA的每日心情
    开心
    2021-8-11 17:59
  • 签到天数: 17 天

    [LV.4]偶尔看看III

    网络挑战赛参赛者

    网络挑战赛参赛者

    自我介绍
    本人女,毕业于内蒙古科技大学,担任文职专业,毕业专业英语。

    群组2018美赛大象算法课程

    群组2018美赛护航培训课程

    群组2019年 数学中国站长建

    群组2019年数据分析师课程

    群组2018年大象老师国赛优

    跳转到指定楼层
    1#
    发表于 2021-4-10 11:24 |只看该作者 |正序浏览
    |招呼Ta 关注Ta

    ) X8 a% c; _% y( ]各类机器学习算法的优缺点和适用场景汇总
    # S0 C7 R* X8 i! ]* o- F1 M目录6 A- Z1 c% G3 z. W) t) k
    朴素贝叶斯分类器(NB:naive Bayes classifiers)2 S9 x- G) Y8 P( ~6 z! t: k& H
    半朴素贝叶斯分类器(SNB:semi-naive Bayes classifiers)! u# ~6 ~: Z' ^" u2 m+ U/ F/ l2 V
    贝叶斯网(信念网)  N) S; @. ?) R1 V* K0 s
    决策树(decision tree)
    # |8 `, g* {( _0 |! G5 c支持向量机(SVM)
    # i, ^8 b$ _, H! I0 ~神经网络
    7 v( @* Q3 [9 h2 }4 H6 ~2 [! j词向量(word2vec)# v6 l" m  D4 I# |3 D9 P, f
    k近邻分类(kNN)2 d3 f# ?. C9 m# F+ |0 L
    线性模型  N" ]" A  o# j* S$ y
    高斯混合聚类与k均值(k-means)及其变种(k-means++、ISODATA、Kernel K-means)的对比
    : [; y6 R5 G" c$ ^+ _3 c# T关于学习算法的性能实验结果
    9 u9 }1 r8 H4 ?0 N! ^- a$ ?- ^2 O朴素贝叶斯分类器(NB:naive Bayes classifiers), C2 B$ Q: E0 ?9 R) R# u( H
    顾名思义,其适用于分类任务、并且假设每个属性独立地对分类结果发生影响,然而现实中各个因素往往并不独立,那是否就无法解决问题呢?0 z  }/ i- B1 F6 _
    事实上并非如此,相反,朴素贝叶斯分类器在很多情况下都能获得相当好的性能,一种解释是:无需精准概率值即可导致正确分类结果;另一种解释是:若属性间依赖对所有类别影响相同,或依赖关系的影响能相互抵消,则属性条件独立性假设在降低计算开销的同时,不会对性能产生负面影响。0 a6 B4 g8 p2 k4 F. v1 [. M
    6 o' _5 B8 c9 j( A' j$ j: [# q( B
    优点:: D, q* c! [/ ~! y
    1、计算量较小3 O: u+ C- Q) U( z2 P- a& v3 B
    2、支持懒惰学习、增量学习; r4 X0 N7 ?; l( ~
    3、对缺失数据不太敏感
    + D7 T& [, u/ r: x9 b5 H4、推断即查表,速度极快。2 N8 a, G5 e7 ]* `% J3 P' M* J
    缺点:7 l) y& M4 u" N
    1、没有考虑属性间依赖
    ! D  r; v9 G& `  a2、通过类先验概率产生模型
    * O% n9 m8 j# |9 U. M, |
    % [# y9 V! L9 R% U# u) {% p4 {半朴素贝叶斯分类器(SNB:semi-naive Bayes classifiers)
    2 A. @7 ]0 U* Z- v! _6 L相比NB的不考虑依赖,SNB则是考虑了一个(独依赖估计策略:ODE)或多个(多依赖估计策略:kDE)属性依赖/ v" u$ f5 h1 M
    优点:
    4 u/ `, B# \$ [, J! ?1、考虑了一个或多个比较强的属性依赖关系,泛化性能可能得到提升, Z# `0 T- {; a* u$ O
    2、计算开销不大3 `1 r: y3 |2 W
    3、同样支持懒惰学习、增量学习
      h4 t+ z/ p2 ]! ?  }缺点:
    + c5 X- X. i$ G# {1、通过类先验概率产生模型
    % S0 }4 e/ E/ Y) G8 }$ Z1 I1 [' M2 V- y+ r  A. U4 @
    贝叶斯网(信念网)
    " b+ B& N- r% h! H, K+ ?贝叶斯网借助有向无环图刻画属性之间的依赖关系,通过吉布斯采样或者变分推断等方式来近似推断后验概率。
    ; V6 F$ H& G+ ]优点:9 c/ G' ~& t, b4 z9 I
    1、更加完整地考虑了属性间依赖关系,泛化性能将进一步提升
    ) z* _) m' {+ x3 [: t7 q2、近似估算后验概率1 G; _; K! u6 `( s8 d, w
    3、可用于推测属性缺失的样本+ W  K5 n) @7 u
    4、良好的可解释性- h$ p: t+ {1 X$ v
    5、常用于语音识别、机器翻译等4 M4 `# K6 _. r
    缺点:" H  U( L) H8 y' D
    1、结构学习NP难,通过评分搜索方法缓解
    8 _8 b, w: V6 C" L( g8 l2、推断算法的收敛速度较慢: P) N! d8 ?# j' `: O
    - x- J& k# G( l0 f% G1 b
    决策树(decision tree)
    9 E2 i- z5 h, a4 y决策树通过信息纯度(信息增益、增益率、基尼指数等)来决定结点的生成,通过剪枝来缩小决策树的尺寸以及缓解过拟合。是一种非参数学习算法。
    ; I1 S1 z$ Y+ t) P$ n优点:
    7 L6 Z( ^: z# v$ k) q& d1、计算量较小) @( m8 B1 }" _/ B# a, u
    2、清晰表达属性的重要程度* |0 T# l3 {' X  [; S+ t7 ^
    3、可增量学习对模型进行部分重构
    - L8 |5 y/ X6 H0 X- B$ O2 a& R4、不需要任何领域知识和参数假设5 u8 ?2 s+ j: \# t+ g$ W
    5、适合高维数据
      S# w' z, c. ?# ]) G6 ~4 K6、随机森林是基于决策树的集成学习策略,随机森林鲜有短板
    8 H$ y6 Y; X2 b1 ~7 R# L7 l: ~缺点:
    3 x; `% L- Y& M7 I! Q/ }6 M1、没有考虑属性间依赖
    / T! b( j5 \0 E, C' l& _2、容易过拟合,通过剪枝缓解
    & @# v. Y% @6 |3、不可用于推测属性缺失的样本
    6 n; F; x% [/ U: l7 v
    & Q( v8 `' {" l& b0 S支持向量机(SVM)/ S, Q6 |; e. u5 x( _& E
    基于训练集D在样本空间中找到一个划分超平面,将不同类别的样本分开,是一种针对二分类设计的算法,但稍加改造为支持向量回归即可用于回归学习。0 [3 j, k: g* s2 P( P- X7 y
    优点:& i9 T7 N2 Q: G" g5 w
    1、可解决小样本的机器学习任务! ]) ^8 S0 h" I+ i5 e& t
    2、可解决高维问题0 _: Y: C, l; r4 W& O: f- a
    3、可通过核方法解决非线性问题3 [+ n: M1 \! ?# I% C  |
    缺点:/ e' M1 y  G* v3 b
    1、对缺失数据敏感
    ) j1 s. M4 l9 ^; k3 \# i2、对于非线性问题,核函数方法选择一直是个未决问题7 W$ Z6 Q9 ], R' x8 b
    # I7 _8 E& l0 W3 ]
    神经网络  e8 C6 g" I) W8 R. n
    优点:
    " U4 {/ b; I: z. F, K5 W1、分类的准确度极高
    ( v, a4 C9 ]6 W) ~3 ?2、可解决复杂的非线性问题
    ( a" D9 T6 e! A! f/ o. ?3、对噪声神经有较强的鲁棒性和容错能力. Z3 K% ~3 k. b5 L; q6 c5 V
    4、并行分布处理能力强,分布存储及学习能力强3 [* O. L4 m. v9 k' e+ {' h
    5、常用于图像识别
    3 z% G, k1 ?2 _! ~$ P8 J6、数据量越大,表现越好, d3 D$ e* m; A  o: s2 G
    缺点:
    " [# d& [2 w, P' A) L8 a6 H1、黑箱模型,难以解释
    # O$ V+ P! l5 W% f4 N2、需要初始化以及训练大量参数,如网络结构、权值、阈值,计算复杂
    4 \, K. @- ]6 l8 y* ~# y; S3、误差逆传播的损失
    - q4 r8 Q" {# ^/ C) P; f/ X0 P; o: A4、容易陷入局部最小
    3 W3 q+ a9 t  M# r% R$ O2 L: p! l( v: r- @- T3 F: o: X3 g% g
    词向量(word2vec)
    " D- d9 u  z- @( \7 r: r0 P8 M/ S将文章的每句话当成一行,将每个词用符号隔开(如使用中文分词工具jieba),根据上下文,可以找出相似词义的词。
    ; p1 v# w4 l- B4 v% ^比如:我 喜欢 你,我 爱 你,我 讨厌 你。根据上下文我和你,可以找到喜欢的相似词,有爱和讨厌。
    3 E: i- @/ |7 z6 G, |( G2 Y' t再一般地如:1 2 3 X 4 5 6,1 2 3 Y 4 5 6。根据上下文1 2 3和4 5 6,可以找到X和Y相似。! j8 j9 J9 j2 I5 K, p$ d
    gensim是一个很好用的Python NLP的包,不光可以用于使用word2vec,还有很多其他的API可以用。它封装了google的C语言版的word2vec。2 O; k# r% ]! m" {9 x: }: }
    8 @+ D% H+ R7 V) m+ ?) m* z6 `
    k近邻分类(kNN)
    9 z, x  t! [, l$ @6 n5 @基于某种距离度量找出训练集中与其最靠近的k个训练样本,或者指定距离e之内的训练样本,分类任务中通过投票法(以及加权投票等)将出现最多的类别标记作为预测结果,回归任务中则使用平均法(以及加权平均等)
    . r5 e" G& H" N" a' g9 E9 P; n优点:; U+ Q, x: Q" @2 N* m, @
    1、思想简单,易于理解,易于实现,无需估计参数,无需训练;
    0 `" d# N) I2 {6 y" M% s; H2、适合对稀有事件进行分类;9 x6 I3 N" j$ m' t& A$ ]
    3、特别适用于多分类问题- r5 W. ]) \$ c6 B, {* `
    缺点:5 e( H  ~4 i( e5 _2 N
    1、需要计算出待测样本与所有样本的距离,计算量大2 r( m! R0 {+ R
    2、样本不平衡时影响大8 s) k2 X- e" h- W# L2 r* \/ Q0 j  N
    3、适用的特征维度低
    ; `+ ?, r( n; V3 l
    0 V$ N' F! d' e+ w( n' v线性模型
    9 @& ?! P4 k( [% Z5 V优点:
    7 t# ?- K% B: H; O1、算法简单,编程方便
    9 a" k; {) h: R. i2、计算简单,决策速度快2 |1 V$ _* E: z
    缺点:
    7 j1 T( [4 J5 B( V( k; \1、拟合效果较差
    " k2 g4 R1 A5 E7 |1 n/ I8 U6 }) o
    & u7 Y( u. F5 A1 N$ k6 E高斯混合聚类与k均值(k-means)及其变种(k-means++、ISODATA、Kernel K-means)的对比9 ~+ B: P8 q/ L6 U" R
    k-means是高斯混合聚类在混合成分方差相等、且每个样本仅指派给一个混合成分时的特例,因此k-means计算简单,但效果不如高斯混合聚类
    9 S" x1 N0 l$ @! n1 j; l由于计算太过复杂,高斯混合聚类并不常用,推荐使用k-means++(与k-means随机选定不同,k-means++初始选定的几个样本距离尽量远,这样能更快得出分簇结果)等k-means变种。" \8 k2 |& B# F( ^/ c5 L* [0 }

    ' K2 \* M; K; y7 d; N  O关于学习算法的性能实验结果  c& ^& Y: k$ W; p1 q  p
    点击查看原文
    1 Q" I. [% O) k! c
    5 T) M* r2 L2 l14年的时候有人做过一个实验[1],比较在不同数据集上(121个),不同的分类器(179个)的实际效果。
    0 Q7 w- b  U7 B" D. @; g9 ?论文题为:Do we Need Hundreds of Classifiers to Solve Real World Classification Problems?& ^9 v( Y, ]; b- o! _0 _# V, y' p
    没有最好的分类器,只有最合适的分类器。& @+ w- }( H/ M0 k; A% b$ O# y
    1、随机森林平均来说最强,但也只在9.9%的数据集上拿到了第一,优点是鲜有短板。- q7 d( b4 i/ k2 n- o# x
    2、SVM的平均水平紧随其后,在10.7%的数据集上拿到第一。$ g, y7 m' q+ @% z
    3、神经网络(13.2%)和boosting(~9%)表现不错。- L4 U$ E6 I6 a0 o2 x; ^
    4、数据维度越高,随机森林就比AdaBoost强越多,但是整体不及SVM[2]。; _# V2 j8 t1 v, |0 ~
    5、数据量越大,神经网络就越强。
    6 G; m/ G% |: ~: c————————————————
    : f& z( E6 Y2 j& F0 g! r版权声明:本文为CSDN博主「路飞的纯白世界」的原创文章,遵循CC 4.0 BY-SA版权协议,转载请附上原文出处链接及本声明。% j3 Z1 n9 L8 t/ H
    原文链接:https://blog.csdn.net/u010921136/article/details/906683828 q7 k; k( @. ~  P, H/ Y. f: T
    5 ^% T  Z& n5 r+ S! L* z' E1 |
    , Q8 p- u& ^' ~! k5 l* m
    zan
    转播转播0 分享淘帖0 分享分享0 收藏收藏0 支持支持0 反对反对0 微信微信
    您需要登录后才可以回帖 登录 | 注册地址

    qq
    收缩
    • 电话咨询

    • 04714969085
    fastpost

    关于我们| 联系我们| 诚征英才| 对外合作| 产品服务| QQ

    手机版|Archiver| |繁體中文 手机客户端  

    蒙公网安备 15010502000194号

    Powered by Discuz! X2.5   © 2001-2013 数学建模网-数学中国 ( 蒙ICP备14002410号-3 蒙BBS备-0002号 )     论坛法律顾问:王兆丰

    GMT+8, 2026-7-25 06:29 , Processed in 0.403176 second(s), 52 queries .

    回顶部