- 在线时间
- 1630 小时
- 最后登录
- 2024-1-29
- 注册时间
- 2017-5-16
- 听众数
- 82
- 收听数
- 1
- 能力
- 120 分
- 体力
- 567260 点
- 威望
- 12 点
- 阅读权限
- 255
- 积分
- 175401
- 相册
- 1
- 日志
- 0
- 记录
- 0
- 帖子
- 5313
- 主题
- 5273
- 精华
- 3
- 分享
- 0
- 好友
- 163
TA的每日心情 | 开心 2021-8-11 17:59 |
|---|
签到天数: 17 天 [LV.4]偶尔看看III 网络挑战赛参赛者 网络挑战赛参赛者 - 自我介绍
- 本人女,毕业于内蒙古科技大学,担任文职专业,毕业专业英语。
 群组: 2018美赛大象算法课程 群组: 2018美赛护航培训课程 群组: 2019年 数学中国站长建 群组: 2019年数据分析师课程 群组: 2018年大象老师国赛优 |
* B% z! O! K1 i g* } H# c1.机器学习概念及相关术语解释3 l/ M8 u" m9 b7 Q
: u) Q9 z: Y4 N# g5 p; w4 g. f
一丶 机器学习概念: f; u( ]/ J; @2 s. g2 t$ m, @' d
概述: 机器学习是人工智能具有智能的必要技术手段,人工智能的核心,机器学习是致力于研究如何通过CPU和GPU(图形图像处理器)的计算,利用经验或数据来改善计算机系统自身的性能
1 T& k4 x ?" X) ~8 Q, v
7 \$ t' c3 E: I2 C总结: 机器学习模型=数据+算法" p# j, X p4 z, H* e( g8 s
1 P, v0 F8 H& a& y, S* N$ ]如果有新的数据,我们只需要带入到Model中就可以输出预测值) l: |/ A. o0 _
& P+ d- g$ v' J e- F; J& p什么不是机器学习?) \# O& f# E% R
+ O8 t& \1 r+ \/ {5 y+ t" i比如对于计算问题丶已经知道结果等不是机器学习问题(比如: 统计成绩搞的同学的topN)
: f+ B# f* J& Q& L% b7 I) ?7 N机器学习其实就是需要有一个预测的过程
0 C5 ]4 t8 V# e3 g! o) g5 G% Y H( t0 M0 A
机器学习概念补充:) X- o! Y; m* G" t) N; G4 ]
s6 D ~& ?. q. s1.说明: X: 特征或属性 Y:类别标签类或预测的值
& U$ Z0 @ G+ Z" |* U# j! w+ g7 V; i9 z% t( E' ]
训练集和测试集: 通常要将数据集分为两部分,训练集用来模型的训练,测试集用来模型测试模型的好坏程度.# a* \5 a# E& w4 r& s& |
模型的好坏: 训练误差(模型预测在训练集上的Y值误差)丶测试误差(模型预测在测试集上Y值的误差)丶准确率(分对的/全部)丶错误率(1-正确率)
3 }! l4 n; g" W9 O, _! i二丶两种学习方式" U& `3 u* B; T8 X$ e# k+ i% ~
基于规则的学习: 主要是通过基于专家发现的规则,指定规则,只需要新数据带入规则进行判断即可& D! P2 N( q" u+ x- a
基于模型的学习: x:特征数据 --> f(函数-模型) --> Y(结果数据),基于模型就可以直接预测分析得到结果数据' p8 a$ T+ D" W) x
三丶术语/ z* q% W) @0 u# P( H2 d
3.1机器学习分类的几种概念3 S6 d; V. E! R7 e! i6 N; s
2 ^# G+ k' C7 @; j8 ^
监督学习: 训练集数据有类别标记9 S q" G- ^2 l7 ~- J5 _) w
无监督学习:训练集数据没有类别标记
! `: R9 q& K7 u0 k8 r8 ^! J半监督学习: 有类别标记的训练集+无标记的训练集3 y: Y# A4 ^, A& `
强化学习: 常见的应用场景包括动态系统以及机器人控制等; m: C( |0 S) z
监督学习:8 u/ S7 a9 u/ V/ t9 a
' S4 P( X4 y# Z; `
分类:预测值是否为连续值,不是连续值的预测的话,是分类, E/ a' V3 H( _7 \ u
回归:预测值是连续值的话,是回归
3 G8 n: F5 D/ C# K/ s6 f7 p非监督学习:
: Y0 g0 A# j8 y$ U7 P$ w. A# D
0 k! B1 F: T' S- Y& S聚类:通过相似性度量,组内的相似性是极高的,组内的相异性是极高的,进行分类
/ v2 z8 V* d3 E; V/ [8 t降维-通过算法进行降维的话,Z1和Z2的物理含义是不明确的$ k4 e2 g% [: c5 X% Z% \2 {
– 特征选择: 从原有的特征中选择比较重要的特征—x1,x2,x3==>Z1,Z2/ @$ u. u3 T! C; M: n
半监督学习:) n: t, E4 S5 W" o2 r
7 d9 r/ L* A1 O) z
1.基于聚类的假设8 w/ C0 v2 f% g* ]2 I4 v8 ~
–有类别标记的数据+没有类别标记的数据,将有类别标记的数据,去掉标签列,
2 {' m4 A; w4 J- y$ L此时所有的数据均没标签,对全部数据进行聚类,聚类之后,有类别标记的数据和没有类别标记的数据,有可能被分到不同的组或簇中,将所有的,有类别标记的数据,根据机器学习常用的处理方法–投票原则,根据少数服从多数的原则进行表决,将没有带类别标签的数据加上类别标签4 O- ]" M) y# F- N; H
2.利用所有样本再进行模型训练( T4 y# N: a" ^, r
强化学习:
) I" I' [6 b/ x1 X
' O* p+ K o4 `# `7 n解决连续决策的问题丶围棋丶无人驾驶汽车等问题/ u5 v5 `$ z t% }2 P
3.2机器学习三要素0 B# l, n4 ]9 l6 B9 _0 o! m# T/ p
4 z6 S r1 u! s V( G0 Z4 Q/ \1 C
模型: 决策函数丶条件概率分布
! ~; v- u7 H8 P" W- O: V算法: 解析解和最优解(梯度下降法和牛顿法)( t* `8 ~4 `+ H) D% t9 p, i
策略: (损失函数)评判一个模型的好坏8 A0 C2 d3 f# B9 e6 _8 j
3.3其他
& K! B v+ M, H8 Z0 o% @+ n1 i# I1 L+ E. y( T: p
降维: 将多维数据降成低维度数据,不过降过的维度不能使用具体的物理含义表示
- X( l2 J1 f4 A% y; u, y9 n抽样: 有行抽样和列抽样,如果模型发生欠拟合和过拟合,可以使用抽样方法很好的解决
: r+ x5 g4 h! j" D) g交叉验证: 交叉验证就是将拿到的训练数据,分为训练和验证集。以下图为例:将数据分成4份,其中一份作为验证集。然后经过4次(组)的测试,每次都更换不同的验证集。即得到4组模型的结果,取平均值作为最终结果。又称4折交叉验证; a2 h8 h* @) B5 x
过拟合: 模型对于训练集效果很好,对于测试集效果较差 原因:模型过于复杂 W* a6 z0 E/ U; r% T$ P3 q2 J
欠拟合:模型对于训练集和测试集效果都很差 原因: 模型太过简单% n9 y7 T2 j, S v, N- ^
模型选择的基本原则-奥卡姆剃刀原则:在具有相同泛化误差的模型中,选择较为简单的模型,防止过拟合# M( t# ~" o$ v/ ~ |1 J$ q
特征向量: 将属性或特征,通常使用向量来进行表示
5 y& l y1 i8 J5 `& }: Z6 g8 N. [. n训练集: 数据集划分的一部分,来用于模型或者算法的训练# ^2 ^5 ^. _3 j
测试集: 数据集划分的一部分,来用于对已经训练好的模型进行测试模型的误差好坏
/ k: ^6 Z0 S# U3 i1 R6 K( \! s$ \/ J/ X+ ]7 S' s4 K- f5 G
- h9 t7 {. _! t. l5 m/ n- f四丶分类和回归问题
) C' @: J S' H2 @2 g& |7 [4.1说明0 v' i7 M' t7 F4 R' }0 O
2 B: F8 U7 [, r, m+ L如果预测值是连续值对应的问题是回归问题
8 M) i! _5 ^) ]# k; T U& L如果预测值是离散值对应的问题的分类问题
3 R' C1 T3 S9 L4.2类别型变量处理
. K V, D& k% \: j比如天气: 晴天丶阴天丶雨天0 c: ^' V Q7 s4 L! ^
lable encoder: 标签编码" Q/ B) |( a5 o0 Z5 N
1 z# S2 c' L9 E+ l% x; D$ I晴天丶阴天丶雨天" x) G( F& p- g* O, {
0--------1--------23 `8 m5 b: m/ @- a$ _
2 O! }' a1 z2 K
ont-hot encoder: 独热编码(二进制方式)6 }% ^+ T, [$ ~1 W9 p, K, G
- R$ u: ~& z( p9 }- w
晴天 丶 阴天丶 雨天2 y2 v n7 V3 W% i2 C8 ]
1---------0----------0- R- l O$ o2 v6 A4 F
0---------1----------0- N3 S4 z" j0 c
0---------0----------14 M0 s. _) O1 Y+ A
* T# H% ^, y- e1 u# R2 G8 J8 ?
总结:通常使用label encoder(标签编码)
& g' ] t9 F+ Q, O/ [/ D$ P1 h) |————————————————; ^* h; d+ r+ m# u6 R( m6 B
版权声明:本文为CSDN博主「First_____」的原创文章,遵循CC 4.0 BY-SA版权协议,转载请附上原文出处链接及本声明。
. w) G% ~9 j2 Y' ~. @/ W原文链接:https://blog.csdn.net/First_____/article/details/126717523
- N6 p6 P6 n6 h, `. n. {( I, z% O3 T( N4 \' D: E# a+ X4 l4 [
6 y9 i0 l% @. h: v' x' }, i
8 T- h* u5 f8 G+ ?7 ?6 ~/ x* k5 J: N1 } |
zan
|