- 在线时间
- 1630 小时
- 最后登录
- 2024-1-29
- 注册时间
- 2017-5-16
- 听众数
- 82
- 收听数
- 1
- 能力
- 120 分
- 体力
- 565760 点
- 威望
- 12 点
- 阅读权限
- 255
- 积分
- 174951
- 相册
- 1
- 日志
- 0
- 记录
- 0
- 帖子
- 5313
- 主题
- 5273
- 精华
- 3
- 分享
- 0
- 好友
- 163
TA的每日心情 | 开心 2021-8-11 17:59 |
|---|
签到天数: 17 天 [LV.4]偶尔看看III 网络挑战赛参赛者 网络挑战赛参赛者 - 自我介绍
- 本人女,毕业于内蒙古科技大学,担任文职专业,毕业专业英语。
 群组: 2018美赛大象算法课程 群组: 2018美赛护航培训课程 群组: 2019年 数学中国站长建 群组: 2019年数据分析师课程 群组: 2018年大象老师国赛优 |
$ y- y9 {( i& R+ k \ p2 v! `
1.机器学习概念及相关术语解释" r* N6 O. g2 T
6 y1 h+ @% |, N" t& ~
一丶 机器学习概念* {/ W) H. j) S# I
概述: 机器学习是人工智能具有智能的必要技术手段,人工智能的核心,机器学习是致力于研究如何通过CPU和GPU(图形图像处理器)的计算,利用经验或数据来改善计算机系统自身的性能
% o4 _% y5 q- x4 e
2 G1 z5 n4 n- h, M总结: 机器学习模型=数据+算法
" G. a+ g- i7 g) d9 O ]
; E+ m: {. j' w, T如果有新的数据,我们只需要带入到Model中就可以输出预测值9 I1 s" G) A F' \; s, }
* `% d9 i/ G# K/ I8 ?
什么不是机器学习?5 T6 n4 {; O- h& V, D: P+ i
& W3 O; l, o! Z7 k( O, k比如对于计算问题丶已经知道结果等不是机器学习问题(比如: 统计成绩搞的同学的topN)) x" f* a' b9 A+ A" _) j
机器学习其实就是需要有一个预测的过程7 s, y0 c' ]0 A6 b* M
# K I8 ~' t7 _, C1 J1 p机器学习概念补充:
9 Y* ~9 {4 L E7 E* S; ?3 A! l+ Z# U
: s7 Z) ?6 S) H4 S3 u. S# K& O# t1.说明: X: 特征或属性 Y:类别标签类或预测的值, J' Q/ J: v( {" A
1 F$ W3 R, ^/ x9 U- l5 J训练集和测试集: 通常要将数据集分为两部分,训练集用来模型的训练,测试集用来模型测试模型的好坏程度.. @) t; F J9 o; f) q* W0 H! c
模型的好坏: 训练误差(模型预测在训练集上的Y值误差)丶测试误差(模型预测在测试集上Y值的误差)丶准确率(分对的/全部)丶错误率(1-正确率)5 N" y) ~6 u1 {
二丶两种学习方式
4 b$ L9 a8 v( |- N7 P% ~基于规则的学习: 主要是通过基于专家发现的规则,指定规则,只需要新数据带入规则进行判断即可
4 [/ }% U# |. y1 n/ O. K基于模型的学习: x:特征数据 --> f(函数-模型) --> Y(结果数据),基于模型就可以直接预测分析得到结果数据" L! y; d& x* Y8 W1 M+ g
三丶术语
. u, ^0 L4 b+ g! J+ c* s& e$ w3.1机器学习分类的几种概念
5 d8 Z1 I% [4 J, N" @( K
5 W( A3 J2 D* c% l/ d v6 L监督学习: 训练集数据有类别标记
5 s' a+ W, p' v. D9 w4 U2 a无监督学习:训练集数据没有类别标记6 T i7 E: ^) p) }/ D
半监督学习: 有类别标记的训练集+无标记的训练集1 b* J4 |! v% m, y1 v
强化学习: 常见的应用场景包括动态系统以及机器人控制等! Q7 p% S( S4 U$ ?7 q! c' A! z, E P
监督学习:+ o! }" G# l- c# o# A, I
2 x# ^3 l/ K7 R A8 t9 h分类:预测值是否为连续值,不是连续值的预测的话,是分类/ n' u0 l' a8 R A+ m N
回归:预测值是连续值的话,是回归
`, i+ S& B& Q% B- K4 X非监督学习:/ l/ B- J, G9 j2 y0 b7 |
1 I2 i- k* T$ o$ b/ P6 |& l5 _; a
聚类:通过相似性度量,组内的相似性是极高的,组内的相异性是极高的,进行分类2 p3 S4 T# F. |6 m
降维-通过算法进行降维的话,Z1和Z2的物理含义是不明确的0 _4 K$ ~7 t' W( c3 i2 @4 `! H
– 特征选择: 从原有的特征中选择比较重要的特征—x1,x2,x3==>Z1,Z2, ?/ R$ J/ a& E
半监督学习:* l, Y$ G `& H& X* N; n( k
1 H) ~ G- y2 n4 W V% R# ]1.基于聚类的假设1 n" ^1 t7 K) t0 L) [
–有类别标记的数据+没有类别标记的数据,将有类别标记的数据,去掉标签列,5 N7 ^7 G9 R7 G& t7 J, C4 P
此时所有的数据均没标签,对全部数据进行聚类,聚类之后,有类别标记的数据和没有类别标记的数据,有可能被分到不同的组或簇中,将所有的,有类别标记的数据,根据机器学习常用的处理方法–投票原则,根据少数服从多数的原则进行表决,将没有带类别标签的数据加上类别标签
# j; N4 z: r3 A) p! @2.利用所有样本再进行模型训练
! p$ u E4 ]+ C强化学习:
4 o' ^# i7 q; f+ e/ @1 G% D) ~9 A( {& ]0 P
解决连续决策的问题丶围棋丶无人驾驶汽车等问题
* n/ h1 Y1 Z( e* P0 S& g6 W3.2机器学习三要素
( s0 C; u% u/ ~/ I: o% i3 v/ w& C0 s# N: ?4 g
模型: 决策函数丶条件概率分布$ y: o @5 Y+ v0 l( q4 ^
算法: 解析解和最优解(梯度下降法和牛顿法)
4 ~% g4 M7 x+ G1 f/ Y* q: E# ^策略: (损失函数)评判一个模型的好坏
2 I7 s8 w' O% c3.3其他) W& v9 |& f: ]" Y8 Z
) p5 g) m, F+ n1 ?! L0 p( i
降维: 将多维数据降成低维度数据,不过降过的维度不能使用具体的物理含义表示& n5 e1 J: E' y' X5 p) n" o
抽样: 有行抽样和列抽样,如果模型发生欠拟合和过拟合,可以使用抽样方法很好的解决" @. f2 B, w2 C
交叉验证: 交叉验证就是将拿到的训练数据,分为训练和验证集。以下图为例:将数据分成4份,其中一份作为验证集。然后经过4次(组)的测试,每次都更换不同的验证集。即得到4组模型的结果,取平均值作为最终结果。又称4折交叉验证
4 L0 ^. z! `" y# \' }" g过拟合: 模型对于训练集效果很好,对于测试集效果较差 原因:模型过于复杂$ i/ `# s1 g/ q" w. m, ^8 ~: S
欠拟合:模型对于训练集和测试集效果都很差 原因: 模型太过简单
! p. N! Z) n9 j( V' u模型选择的基本原则-奥卡姆剃刀原则:在具有相同泛化误差的模型中,选择较为简单的模型,防止过拟合 p& O- u: C+ A) S. R
特征向量: 将属性或特征,通常使用向量来进行表示
2 {' Z5 U& d* ?! O' B/ X; C训练集: 数据集划分的一部分,来用于模型或者算法的训练0 p- s' c7 B! ~0 q0 f2 [, @2 t1 y. \
测试集: 数据集划分的一部分,来用于对已经训练好的模型进行测试模型的误差好坏
1 B$ H7 S2 G+ S2 ]
8 u6 }! g% W" m5 E
: z- V' \, \7 W; L4 j四丶分类和回归问题! j! ?) K. a/ w/ |/ o" `! k& `* i/ f
4.1说明1 t9 b6 { x* @- b& |0 K
, j) M" J- ~ s' x' L6 i如果预测值是连续值对应的问题是回归问题
1 `( K3 X t! `6 T/ M U1 i如果预测值是离散值对应的问题的分类问题
+ C( m8 u' i; J) x b% E4 F* [4.2类别型变量处理) n. [* |/ _( m* a0 a# h
比如天气: 晴天丶阴天丶雨天 k& X/ e" Y4 {& f' l8 T4 R, V
lable encoder: 标签编码
7 {3 n( B0 N8 K! t; w! i; W Y/ |& r) M. I/ c! j% s" N; b
晴天丶阴天丶雨天/ X& B' Z; E* X( i0 L. \ ^( b* E
0--------1--------2* [4 h" F+ c0 I: E: J4 g
6 A |5 ~) e% k: C. _; vont-hot encoder: 独热编码(二进制方式)
0 K/ V; o1 j& f5 {" |$ Q8 d" Q: p8 q3 V$ Q& D
晴天 丶 阴天丶 雨天
! p$ ?- {( ^( q" M. u1---------0----------03 G1 `6 t/ z3 V
0---------1----------0
0 Z/ A- E/ r( A: |2 r0---------0----------1$ i6 [ i$ t( N( h% {
3 h8 j) y, B0 Q4 A8 ~- W, ^
总结:通常使用label encoder(标签编码)$ _# k/ n4 i) e" K8 R7 d4 O
————————————————
. _" k l; l: g; d9 l7 m* L版权声明:本文为CSDN博主「First_____」的原创文章,遵循CC 4.0 BY-SA版权协议,转载请附上原文出处链接及本声明。
$ ?: a5 O9 z. D# o5 t原文链接:https://blog.csdn.net/First_____/article/details/126717523- O3 p4 L% T$ B* m' p
" k/ { i: o4 K3 y. |* o
$ c# S) y- R) e# X$ ] z
8 b$ Z+ Z+ l: A |
zan
|