QQ登录

只需要一步,快速开始

 注册地址  找回密码
查看: 2080|回复: 0
打印 上一主题 下一主题

各类机器学习算法的优缺点和适用场景汇总

[复制链接]
字体大小: 正常 放大
杨利霞        

5273

主题

82

听众

17万

积分

  • TA的每日心情
    开心
    2021-8-11 17:59
  • 签到天数: 17 天

    [LV.4]偶尔看看III

    网络挑战赛参赛者

    网络挑战赛参赛者

    自我介绍
    本人女,毕业于内蒙古科技大学,担任文职专业,毕业专业英语。

    群组2018美赛大象算法课程

    群组2018美赛护航培训课程

    群组2019年 数学中国站长建

    群组2019年数据分析师课程

    群组2018年大象老师国赛优

    跳转到指定楼层
    1#
    发表于 2021-4-10 11:24 |只看该作者 |倒序浏览
    |招呼Ta 关注Ta
    1 h5 [  w$ X# U; `+ s+ Z
    各类机器学习算法的优缺点和适用场景汇总
    / a+ z1 U6 E0 y目录- u6 O# o; e( a
    朴素贝叶斯分类器(NB:naive Bayes classifiers)9 C5 g) t) z2 W. T
    半朴素贝叶斯分类器(SNB:semi-naive Bayes classifiers)
    % |' S, D) B8 m7 r5 D: H贝叶斯网(信念网)! o! L6 c# a* ~
    决策树(decision tree)+ e0 ~1 G, s4 N: y
    支持向量机(SVM)0 u, S# M0 {" V
    神经网络
    % H  ?2 R8 }9 B! j% I% h- X4 m词向量(word2vec)
    4 F! }3 M/ F. a. K% Rk近邻分类(kNN)
    " W! s6 T3 L+ h# y* E9 G; A% G% b+ L0 g线性模型, K+ a! S7 [) r, M/ }7 \6 q
    高斯混合聚类与k均值(k-means)及其变种(k-means++、ISODATA、Kernel K-means)的对比
    ' a$ M" s7 A7 [8 V& B3 |$ E& _关于学习算法的性能实验结果
      p9 ^+ G5 k2 K0 M. I" d$ D7 n9 ?/ Y朴素贝叶斯分类器(NB:naive Bayes classifiers)9 `6 o/ ~4 [$ r  [
    顾名思义,其适用于分类任务、并且假设每个属性独立地对分类结果发生影响,然而现实中各个因素往往并不独立,那是否就无法解决问题呢?6 A# q0 O" `" K* s
    事实上并非如此,相反,朴素贝叶斯分类器在很多情况下都能获得相当好的性能,一种解释是:无需精准概率值即可导致正确分类结果;另一种解释是:若属性间依赖对所有类别影响相同,或依赖关系的影响能相互抵消,则属性条件独立性假设在降低计算开销的同时,不会对性能产生负面影响。
    ) V5 D9 T- a! e# J+ p8 ^: }. Z9 b; E7 h
    优点:7 e' P) A, J' |2 E
    1、计算量较小. B# i1 c2 i/ p6 M" B" g
    2、支持懒惰学习、增量学习# ?3 ?7 n8 m  i$ G
    3、对缺失数据不太敏感3 H6 E7 G8 _4 s, v: j3 O
    4、推断即查表,速度极快。8 ?, `6 f( _) X9 m* T+ k( F
    缺点:, Z1 A* F, a5 U* n% D  Z
    1、没有考虑属性间依赖
    & s$ d" R' q2 o- |" W& R9 F7 o2、通过类先验概率产生模型; h* _( l6 t7 O& {
    , m" G: y, o) a/ A) g9 v! X
    半朴素贝叶斯分类器(SNB:semi-naive Bayes classifiers)
    4 J" o3 }9 U) j% {2 H+ f" [6 z) q相比NB的不考虑依赖,SNB则是考虑了一个(独依赖估计策略:ODE)或多个(多依赖估计策略:kDE)属性依赖
    6 d5 U+ L5 c: \( A4 {$ o1 u优点:
    5 c6 i. r" J- [( L. U3 T1、考虑了一个或多个比较强的属性依赖关系,泛化性能可能得到提升8 l9 S% \* i% d" i
    2、计算开销不大
    5 t4 J- K% g, {" [7 ?  o3、同样支持懒惰学习、增量学习3 |  H7 W5 h: ~* I3 n6 b
    缺点:
    8 {4 j3 H$ }# N8 Y/ a( a; {& i1、通过类先验概率产生模型
    / w' [4 a4 A& J: @2 C# z
    / T$ A8 c. F7 a8 Z' a. l贝叶斯网(信念网)
    % Y6 p& Q+ Z$ j) M6 N贝叶斯网借助有向无环图刻画属性之间的依赖关系,通过吉布斯采样或者变分推断等方式来近似推断后验概率。
    4 `. j  N( c3 u, ], D优点:  W! X- N0 ?, [$ d! R# r( @# t
    1、更加完整地考虑了属性间依赖关系,泛化性能将进一步提升
    ! R* j" }2 x0 t' ?, F2 J% x8 L. `2、近似估算后验概率' w7 F2 _8 `2 Z( F# J6 R; F! ^6 _
    3、可用于推测属性缺失的样本6 v8 u4 ]& j% D4 f, c# t" E3 S# D2 ]
    4、良好的可解释性
    ' [$ B! W- [/ d& n) [5 m1 o5、常用于语音识别、机器翻译等
    ; S' f6 k1 K6 [+ ?缺点:
    " y! [  j! W- F8 f& M5 I# K1 j& U1、结构学习NP难,通过评分搜索方法缓解5 {$ i* L+ s1 J9 X( o$ R
    2、推断算法的收敛速度较慢
    2 R% r' u( v0 V& N2 V0 p1 F) l7 D& Y) ~3 e6 P
    决策树(decision tree)- q; Z& n+ P+ Q8 z+ J+ \
    决策树通过信息纯度(信息增益、增益率、基尼指数等)来决定结点的生成,通过剪枝来缩小决策树的尺寸以及缓解过拟合。是一种非参数学习算法。+ z/ C9 K2 y- b: w% b2 \  M( H$ I
    优点:8 J. S: V. j6 Y5 r9 p
    1、计算量较小
    * a0 g) R7 ?5 d& ]: X2、清晰表达属性的重要程度6 m( t& D& a+ t# R( A" L
    3、可增量学习对模型进行部分重构
    4 c9 \; c& ~. `6 {4、不需要任何领域知识和参数假设
    . |6 M9 H1 g: d$ ^+ L- z1 p5、适合高维数据
    4 b3 M6 u# e; c1 u3 E1 z+ M6、随机森林是基于决策树的集成学习策略,随机森林鲜有短板9 W9 N% x5 r- r1 ]# L+ x' a  {
    缺点:
    2 R3 z' o* Y+ P9 E" A1、没有考虑属性间依赖0 b; x  i6 b  j) H7 Y3 m9 H
    2、容易过拟合,通过剪枝缓解
    : B4 N6 T2 R" d) C$ x) ^3 Z3、不可用于推测属性缺失的样本% d# x! }, |7 O9 W

    ' D' O( L! w1 e( {% R支持向量机(SVM)
    " x! L& ~" M4 |( e基于训练集D在样本空间中找到一个划分超平面,将不同类别的样本分开,是一种针对二分类设计的算法,但稍加改造为支持向量回归即可用于回归学习。
    4 p0 c0 N1 }0 U6 V8 G优点:
    - e( d" l5 A% m1、可解决小样本的机器学习任务" h: J0 T% |! k" h9 u; [% y# Y
    2、可解决高维问题
    9 Z$ E7 D7 t3 u. C: t3、可通过核方法解决非线性问题
    6 @! X  |7 W' O( U# i缺点:
    - ]/ z. w8 O9 U+ o1 M1、对缺失数据敏感
    8 W* I8 |+ }  S: h( ?% }& a0 L2、对于非线性问题,核函数方法选择一直是个未决问题; J  F8 @' ~9 V: \0 X
    + r* w* ^, D0 a- b* ~9 E
    神经网络
    5 j5 c) U& X( O) D1 s1 w优点:
    7 }, h) w8 w- `0 @5 s8 p( A( @1、分类的准确度极高
    ; v6 W( F; I4 y$ B/ q! \2、可解决复杂的非线性问题
    * l2 @' p4 _! I' A2 h3、对噪声神经有较强的鲁棒性和容错能力
    & k$ A0 X$ M( o+ {$ q4、并行分布处理能力强,分布存储及学习能力强
    ; Q/ I! Z/ w" U* W5 ^; g3 r5、常用于图像识别
    ! d: G  w& k$ h4 K1 C4 e6、数据量越大,表现越好, B4 p! M) B. m) t' J
    缺点:# v& i; S0 q4 S5 e+ I/ v: g6 _
    1、黑箱模型,难以解释1 N2 S/ Q+ U' O* w- ^5 _5 t, x- S7 ~
    2、需要初始化以及训练大量参数,如网络结构、权值、阈值,计算复杂
    + c) z4 _* A& z( g  x& z- s3、误差逆传播的损失
    2 v3 d0 C% i8 c4、容易陷入局部最小
    * @' b  [8 h" Y  X8 A- L- W9 w# S- F. M6 s: }
    词向量(word2vec)
    : N3 P  Z/ ~. A  X4 A将文章的每句话当成一行,将每个词用符号隔开(如使用中文分词工具jieba),根据上下文,可以找出相似词义的词。
    , n; c+ Z* h6 J6 R  O" w比如:我 喜欢 你,我 爱 你,我 讨厌 你。根据上下文我和你,可以找到喜欢的相似词,有爱和讨厌。* g: g) N- t, @- z5 H
    再一般地如:1 2 3 X 4 5 6,1 2 3 Y 4 5 6。根据上下文1 2 3和4 5 6,可以找到X和Y相似。
    9 x9 C9 f( O3 V8 R6 igensim是一个很好用的Python NLP的包,不光可以用于使用word2vec,还有很多其他的API可以用。它封装了google的C语言版的word2vec。7 O3 `. T$ _$ f6 o

    ( z) m' ~! n2 `k近邻分类(kNN)
    2 }  g. Z  Z) l基于某种距离度量找出训练集中与其最靠近的k个训练样本,或者指定距离e之内的训练样本,分类任务中通过投票法(以及加权投票等)将出现最多的类别标记作为预测结果,回归任务中则使用平均法(以及加权平均等)
    ) c. O. |7 |7 P) {6 x优点:
    + Y$ k$ {! r! \! M1、思想简单,易于理解,易于实现,无需估计参数,无需训练;9 W! f( M- H/ p3 j7 Y% F2 p+ Y
    2、适合对稀有事件进行分类;' A/ Y1 |% \# `$ q
    3、特别适用于多分类问题
    2 ~( x2 ~& k: D. Y) x' L; v* T缺点:
    , }: g/ G. y% r, s1 ~$ }3 s  K1 D1、需要计算出待测样本与所有样本的距离,计算量大
    9 {$ |9 e6 Y8 t$ @2、样本不平衡时影响大
    8 d+ R/ _) d* i7 X* ?3、适用的特征维度低
    / ~2 y- N* U- B. E  v' j
    # I3 T0 o) A' m) d+ s! o% A9 z2 M线性模型% K& _* W4 P/ a+ z
    优点:
    0 H: E: M: `2 H% W6 b) m/ W! E- i1、算法简单,编程方便' p& `# ]) K% f) S% k2 C
    2、计算简单,决策速度快/ Q# Y! z1 y; c$ v9 P6 ]6 ?8 o" a
    缺点:9 x5 k7 j, H/ {! x
    1、拟合效果较差
    4 O5 `* ?0 Z" \0 E1 V/ C& H5 B3 K6 M' r6 a: C
    高斯混合聚类与k均值(k-means)及其变种(k-means++、ISODATA、Kernel K-means)的对比
    ' z+ _8 H# a4 O3 Z4 \k-means是高斯混合聚类在混合成分方差相等、且每个样本仅指派给一个混合成分时的特例,因此k-means计算简单,但效果不如高斯混合聚类
    8 \) @, `) d. z+ s" q- r由于计算太过复杂,高斯混合聚类并不常用,推荐使用k-means++(与k-means随机选定不同,k-means++初始选定的几个样本距离尽量远,这样能更快得出分簇结果)等k-means变种。
    6 V  y) Q' Z" N! C
    . E! Z+ W9 Q7 Z1 W关于学习算法的性能实验结果6 r! s. y* D. h! n5 S! F4 {5 ?8 ?
    点击查看原文; ^1 Y# g1 f  l9 p
    / b. s  ~' u0 a8 H+ C" N8 `* H5 U* b
    14年的时候有人做过一个实验[1],比较在不同数据集上(121个),不同的分类器(179个)的实际效果。1 Y, N1 f; O/ m/ r) L7 @
    论文题为:Do we Need Hundreds of Classifiers to Solve Real World Classification Problems?
    " [% @7 D& J7 S没有最好的分类器,只有最合适的分类器。/ U4 `' g* l. G$ ~) n0 l9 p- A
    1、随机森林平均来说最强,但也只在9.9%的数据集上拿到了第一,优点是鲜有短板。
    2 d) ^. o% ^" ]4 X' h# k2、SVM的平均水平紧随其后,在10.7%的数据集上拿到第一。
    & \3 C1 X) C0 o9 h7 ]0 a% ^" H9 Z3、神经网络(13.2%)和boosting(~9%)表现不错。- O( o  Q& T( R2 y( B0 {4 b% Q
    4、数据维度越高,随机森林就比AdaBoost强越多,但是整体不及SVM[2]。
    $ Q7 m+ _* _6 c; l5、数据量越大,神经网络就越强。+ v* `* }, C6 c, J& `) U
    ————————————————
    3 B0 ~& a8 n. i- K+ @版权声明:本文为CSDN博主「路飞的纯白世界」的原创文章,遵循CC 4.0 BY-SA版权协议,转载请附上原文出处链接及本声明。/ d  c: @1 N  l( X  f: X: A
    原文链接:https://blog.csdn.net/u010921136/article/details/90668382
    ! m; B9 @) @* F1 k, |
    # R4 M# O3 x) e- g# q3 e# H( {7 _$ `4 n  ]
    zan
    转播转播0 分享淘帖0 分享分享0 收藏收藏0 支持支持0 反对反对0 微信微信
    您需要登录后才可以回帖 登录 | 注册地址

    qq
    收缩
    • 电话咨询

    • 04714969085
    fastpost

    关于我们| 联系我们| 诚征英才| 对外合作| 产品服务| QQ

    手机版|Archiver| |繁體中文 手机客户端  

    蒙公网安备 15010502000194号

    Powered by Discuz! X2.5   © 2001-2013 数学建模网-数学中国 ( 蒙ICP备14002410号-3 蒙BBS备-0002号 )     论坛法律顾问:王兆丰

    GMT+8, 2026-9-8 19:54 , Processed in 0.444229 second(s), 51 queries .

    回顶部