- 在线时间
- 1630 小时
- 最后登录
- 2024-1-29
- 注册时间
- 2017-5-16
- 听众数
- 82
- 收听数
- 1
- 能力
- 120 分
- 体力
- 569152 点
- 威望
- 12 点
- 阅读权限
- 255
- 积分
- 175968
- 相册
- 1
- 日志
- 0
- 记录
- 0
- 帖子
- 5313
- 主题
- 5273
- 精华
- 3
- 分享
- 0
- 好友
- 163
TA的每日心情 | 开心 2021-8-11 17:59 |
|---|
签到天数: 17 天 [LV.4]偶尔看看III 网络挑战赛参赛者 网络挑战赛参赛者 - 自我介绍
- 本人女,毕业于内蒙古科技大学,担任文职专业,毕业专业英语。
 群组: 2018美赛大象算法课程 群组: 2018美赛护航培训课程 群组: 2019年 数学中国站长建 群组: 2019年数据分析师课程 群组: 2018年大象老师国赛优 |
r* H0 d1 n8 v3 l1.机器学习概念及相关术语解释* ]; J3 h* ]) P
3 T* a# s7 | N1 V3 B8 F
一丶 机器学习概念
/ R$ p: M$ p9 ?" S- c5 Z5 B) w概述: 机器学习是人工智能具有智能的必要技术手段,人工智能的核心,机器学习是致力于研究如何通过CPU和GPU(图形图像处理器)的计算,利用经验或数据来改善计算机系统自身的性能8 w/ E/ {) V! i
- w7 m$ c2 X; {) x1 ]$ j
总结: 机器学习模型=数据+算法0 A' T: U. W5 Q7 t- B" l
3 f* L! @$ c6 J- e
如果有新的数据,我们只需要带入到Model中就可以输出预测值& A2 [/ m8 H$ B( Z8 f( E
( H% t* _5 r/ p9 s$ Y! B' O; v' r什么不是机器学习?
7 W" x( Z, L9 x$ _% c* J" C! D, j1 o' F. u x9 o9 v
比如对于计算问题丶已经知道结果等不是机器学习问题(比如: 统计成绩搞的同学的topN)7 u0 N4 a8 M; T3 _# r8 r9 N0 c
机器学习其实就是需要有一个预测的过程+ d0 a% r5 V* q
+ f9 U& D# G2 w$ r' e
机器学习概念补充:
( m9 |( s5 F3 q& q) G
* R4 R; V8 ]% @: h% D1.说明: X: 特征或属性 Y:类别标签类或预测的值
9 \& n) R. g/ X/ B
6 ]/ J/ J/ g6 j i& \训练集和测试集: 通常要将数据集分为两部分,训练集用来模型的训练,测试集用来模型测试模型的好坏程度.
1 [; @5 Y6 v& X0 Y- \0 X模型的好坏: 训练误差(模型预测在训练集上的Y值误差)丶测试误差(模型预测在测试集上Y值的误差)丶准确率(分对的/全部)丶错误率(1-正确率). y! @, S6 A3 }: ^
二丶两种学习方式
. l; z3 g- [* G1 R3 D, Y基于规则的学习: 主要是通过基于专家发现的规则,指定规则,只需要新数据带入规则进行判断即可) y- @4 l6 q7 v. i+ i
基于模型的学习: x:特征数据 --> f(函数-模型) --> Y(结果数据),基于模型就可以直接预测分析得到结果数据1 X" n/ Z5 P7 w# S
三丶术语
2 L/ C$ z9 t3 ?& D& j. ^3.1机器学习分类的几种概念. v7 G* J* J0 R" l" h: ?5 n Z
6 {1 K# J- k8 _5 Z( k7 X4 i
监督学习: 训练集数据有类别标记
9 U# \- f, W% n% E1 w7 q$ \8 i: R无监督学习:训练集数据没有类别标记! I. {( Z! _4 A/ `+ z
半监督学习: 有类别标记的训练集+无标记的训练集 I2 M4 Y7 M( M- ~" `
强化学习: 常见的应用场景包括动态系统以及机器人控制等! S# L" k( h7 y* g4 C* g
监督学习:, ]1 f2 K: e8 f
& j5 Z( e; N: }# C& x9 i+ ~
分类:预测值是否为连续值,不是连续值的预测的话,是分类5 b, v1 }0 _) R' B, B9 D
回归:预测值是连续值的话,是回归
) x/ F! |8 X' G非监督学习:
. d C& C- U Z) Y6 o' H$ \* }4 x# ~1 I" `
聚类:通过相似性度量,组内的相似性是极高的,组内的相异性是极高的,进行分类- W; T4 B. g; p# ?# p' f: ]- g5 G7 Q
降维-通过算法进行降维的话,Z1和Z2的物理含义是不明确的
/ q6 C8 K" y: @8 Q# b2 H6 z– 特征选择: 从原有的特征中选择比较重要的特征—x1,x2,x3==>Z1,Z24 Y5 ^8 v8 N g
半监督学习:
6 e, y( ~# Z: \: H0 l% z/ {) O8 X( r+ b: R( e1 k
1.基于聚类的假设; R5 [( B4 Y( ~4 k% P( A4 F( M5 O% A
–有类别标记的数据+没有类别标记的数据,将有类别标记的数据,去掉标签列,% y/ s0 s$ g& i& j
此时所有的数据均没标签,对全部数据进行聚类,聚类之后,有类别标记的数据和没有类别标记的数据,有可能被分到不同的组或簇中,将所有的,有类别标记的数据,根据机器学习常用的处理方法–投票原则,根据少数服从多数的原则进行表决,将没有带类别标签的数据加上类别标签
4 k) E. B- u) F2.利用所有样本再进行模型训练
8 c3 G. }$ I" s* w+ ]3 I" v ~强化学习:, n( v. Y0 }! Z
( y& G+ H4 s3 q* V解决连续决策的问题丶围棋丶无人驾驶汽车等问题/ s5 M0 D/ |3 a3 n
3.2机器学习三要素
0 A# O6 ? I7 [, z2 s* o3 v3 @" t4 A A+ R) h' e6 S4 Z
模型: 决策函数丶条件概率分布
0 G+ n# x1 y" ?6 A) C% h算法: 解析解和最优解(梯度下降法和牛顿法)7 a) |2 g/ U, H& [, y
策略: (损失函数)评判一个模型的好坏
0 I$ [; Z& H3 N0 a3.3其他
( w3 c8 |' J1 @3 W% Z6 V( [8 H$ O, p3 K4 N4 |, y, `. i
降维: 将多维数据降成低维度数据,不过降过的维度不能使用具体的物理含义表示+ D8 u) Y/ K( P9 W: g E
抽样: 有行抽样和列抽样,如果模型发生欠拟合和过拟合,可以使用抽样方法很好的解决$ N" n& D7 O7 g: k
交叉验证: 交叉验证就是将拿到的训练数据,分为训练和验证集。以下图为例:将数据分成4份,其中一份作为验证集。然后经过4次(组)的测试,每次都更换不同的验证集。即得到4组模型的结果,取平均值作为最终结果。又称4折交叉验证
& y+ x% V( L* Y3 N2 n过拟合: 模型对于训练集效果很好,对于测试集效果较差 原因:模型过于复杂
! L f1 O7 y8 ], N' v欠拟合:模型对于训练集和测试集效果都很差 原因: 模型太过简单
" J2 h d4 y0 e* q4 ~' v( t9 l) M9 K模型选择的基本原则-奥卡姆剃刀原则:在具有相同泛化误差的模型中,选择较为简单的模型,防止过拟合2 s+ a0 K1 h, U9 B8 A4 U! F' m: B3 F, x( e' G
特征向量: 将属性或特征,通常使用向量来进行表示
- e, b8 n" ?$ C0 e) B, _& R, Z! H训练集: 数据集划分的一部分,来用于模型或者算法的训练
6 w7 B4 x- e0 p测试集: 数据集划分的一部分,来用于对已经训练好的模型进行测试模型的误差好坏0 N' M9 I! Q7 h0 A+ g/ N, W
$ |& ?. a- D9 k' d. X& y
8 b) h8 v9 r9 c( m* ]四丶分类和回归问题
! K' P" I, K, D& V! V" ^3 b. d$ h4.1说明5 l/ T; e9 V3 e# X0 K) ?! H8 \
4 r! R1 f% A2 h如果预测值是连续值对应的问题是回归问题7 ~9 N! R3 H3 h- d [7 u
如果预测值是离散值对应的问题的分类问题+ e3 S- E& p9 F' E+ g$ d R
4.2类别型变量处理
, R* b: } z( M# \/ `比如天气: 晴天丶阴天丶雨天8 }+ V: W7 ^3 j7 W
lable encoder: 标签编码$ X# L5 G' O! {% @" m, F4 x
5 b4 E' F3 W( f" P
晴天丶阴天丶雨天
; w9 |- s4 j" J- l8 W0--------1--------2
7 a5 V/ I* F9 w8 c. H2 X0 X
& Q$ L/ x, I b( R5 @+ Aont-hot encoder: 独热编码(二进制方式)
9 K' J/ i- I* d: \" G+ W M4 q% x8 n; u
晴天 丶 阴天丶 雨天
; R9 F# L( S& u$ p% N1---------0----------0
) q/ n/ }5 K) c; p7 C* ^8 y0---------1----------0
( ^ r, L: ^' P0---------0----------1
5 G5 K8 [' `# F
0 ]7 M- a% s8 Y. _9 G8 H总结:通常使用label encoder(标签编码)
& |, ?5 I4 N Y! i7 F) S————————————————1 t/ l* a1 L( x/ v
版权声明:本文为CSDN博主「First_____」的原创文章,遵循CC 4.0 BY-SA版权协议,转载请附上原文出处链接及本声明。
- i1 W/ E, Z' i) Q0 I原文链接:https://blog.csdn.net/First_____/article/details/126717523
- E$ L ~: J7 ~7 V; q2 v+ U' Q# f
# T. m0 k+ ]2 l S9 {+ ]: F
- i' Y+ N0 G4 J+ U4 U$ G$ b8 M
6 k8 R$ X- _. x& K; U) q3 ~$ M& b |
zan
|