- 在线时间
- 1630 小时
- 最后登录
- 2024-1-29
- 注册时间
- 2017-5-16
- 听众数
- 82
- 收听数
- 1
- 能力
- 120 分
- 体力
- 565773 点
- 威望
- 12 点
- 阅读权限
- 255
- 积分
- 174955
- 相册
- 1
- 日志
- 0
- 记录
- 0
- 帖子
- 5313
- 主题
- 5273
- 精华
- 3
- 分享
- 0
- 好友
- 163
TA的每日心情 | 开心 2021-8-11 17:59 |
|---|
签到天数: 17 天 [LV.4]偶尔看看III 网络挑战赛参赛者 网络挑战赛参赛者 - 自我介绍
- 本人女,毕业于内蒙古科技大学,担任文职专业,毕业专业英语。
 群组: 2018美赛大象算法课程 群组: 2018美赛护航培训课程 群组: 2019年 数学中国站长建 群组: 2019年数据分析师课程 群组: 2018年大象老师国赛优 |
9 R8 ^! a6 b P3 B: `
1.机器学习概念及相关术语解释
5 ?4 B9 T8 H6 Z# }3 m/ d/ I: N! D- P* q: }4 A; I
一丶 机器学习概念
) ^* J @2 ~9 ~概述: 机器学习是人工智能具有智能的必要技术手段,人工智能的核心,机器学习是致力于研究如何通过CPU和GPU(图形图像处理器)的计算,利用经验或数据来改善计算机系统自身的性能* j4 B1 |2 C( w# t( u5 m: P3 ] f
# C3 ~1 ]6 q e5 p/ d# s3 K总结: 机器学习模型=数据+算法
; e7 D* O/ t* N! p) B) R: r
9 H, ~8 }9 A& k如果有新的数据,我们只需要带入到Model中就可以输出预测值
% n7 _2 t6 _; d$ d$ P3 t9 j7 g' D1 x0 y: W' S
什么不是机器学习?
1 E- e4 V; [* Q, U1 p; G; h1 W, B6 ^2 B) g/ D
比如对于计算问题丶已经知道结果等不是机器学习问题(比如: 统计成绩搞的同学的topN)- Q% s: h3 ?9 ^+ ^
机器学习其实就是需要有一个预测的过程
" ^2 F8 v* A1 m- T" R; U) u' i8 U0 r5 g
机器学习概念补充:
' A; K; t8 H4 {
7 |; ^- u, N; ]$ M: Z4 Y* @* c: D1.说明: X: 特征或属性 Y:类别标签类或预测的值
( |) {# Y3 U" X! `, T
7 o1 _" w) g0 k% q4 x训练集和测试集: 通常要将数据集分为两部分,训练集用来模型的训练,测试集用来模型测试模型的好坏程度. r7 v: @5 d5 E d- N
模型的好坏: 训练误差(模型预测在训练集上的Y值误差)丶测试误差(模型预测在测试集上Y值的误差)丶准确率(分对的/全部)丶错误率(1-正确率)! b1 Z; P" {/ p8 b0 b
二丶两种学习方式* M! ]- b' Z" T- O3 X. m: g( Q
基于规则的学习: 主要是通过基于专家发现的规则,指定规则,只需要新数据带入规则进行判断即可
- B5 L' `* m7 _( I! H g5 G( H3 S9 C% B基于模型的学习: x:特征数据 --> f(函数-模型) --> Y(结果数据),基于模型就可以直接预测分析得到结果数据
' ]) L8 k& z: f/ f三丶术语
* \1 Z) e' V1 q3 S$ Q3.1机器学习分类的几种概念8 M7 h+ D- {5 `9 w
' _# B5 B5 X' y) w1 R$ X3 l7 ?' r监督学习: 训练集数据有类别标记
( P, `7 R9 a6 V+ @( I) z3 _无监督学习:训练集数据没有类别标记
! a7 p) K, r7 U* D半监督学习: 有类别标记的训练集+无标记的训练集
% q2 ?9 [0 e4 e5 X! J. D) K# H强化学习: 常见的应用场景包括动态系统以及机器人控制等
: J4 M6 y4 u5 i$ j监督学习:
) J8 ?; t: u# i1 b
, d! c# L0 Z! ^/ @7 d2 V分类:预测值是否为连续值,不是连续值的预测的话,是分类+ T# e2 a0 A8 F$ A" u' P
回归:预测值是连续值的话,是回归) j- `7 @' D7 Q0 u% @4 E( Q
非监督学习:
: V; h& f" e" N& m- N
, l5 `, R5 t8 e0 ]+ q聚类:通过相似性度量,组内的相似性是极高的,组内的相异性是极高的,进行分类
, k+ x* j2 {9 b- P& V( o降维-通过算法进行降维的话,Z1和Z2的物理含义是不明确的( w) }% g" F- J) W! p# x) u! B
– 特征选择: 从原有的特征中选择比较重要的特征—x1,x2,x3==>Z1,Z2* q y( t W) D& F ^% u9 W
半监督学习:
6 h4 i( k5 ^. w7 {8 r. |7 t6 C9 y6 U: w7 C+ z" V E
1.基于聚类的假设
9 \ d. C; P3 R) |–有类别标记的数据+没有类别标记的数据,将有类别标记的数据,去掉标签列,( [/ v- f! r# y) u' C
此时所有的数据均没标签,对全部数据进行聚类,聚类之后,有类别标记的数据和没有类别标记的数据,有可能被分到不同的组或簇中,将所有的,有类别标记的数据,根据机器学习常用的处理方法–投票原则,根据少数服从多数的原则进行表决,将没有带类别标签的数据加上类别标签* H' _7 H' y3 _) k$ f! e: r
2.利用所有样本再进行模型训练+ r- ]; I" h$ w( P
强化学习:: W7 q$ `) I7 S/ C1 f
2 d/ Z6 G4 [2 j$ e& R' X
解决连续决策的问题丶围棋丶无人驾驶汽车等问题/ v8 Z' W8 V; K$ Z+ _
3.2机器学习三要素
' o+ w3 ?+ _& ]
' L% \/ Z0 l- j: C2 o/ k模型: 决策函数丶条件概率分布: Z8 y) g+ T) Z8 {. u L8 F
算法: 解析解和最优解(梯度下降法和牛顿法)! _ n1 w) }% ^ z( M9 \
策略: (损失函数)评判一个模型的好坏% j% w& Y9 G( [4 O" S
3.3其他
. `0 b8 b0 p! r. k* e& `, o& Y1 v/ f9 C# `$ W1 h b# z$ H
降维: 将多维数据降成低维度数据,不过降过的维度不能使用具体的物理含义表示1 v! e. g8 k/ Y% S+ l/ y
抽样: 有行抽样和列抽样,如果模型发生欠拟合和过拟合,可以使用抽样方法很好的解决
' h0 `: ]$ n& Q8 q5 v1 T交叉验证: 交叉验证就是将拿到的训练数据,分为训练和验证集。以下图为例:将数据分成4份,其中一份作为验证集。然后经过4次(组)的测试,每次都更换不同的验证集。即得到4组模型的结果,取平均值作为最终结果。又称4折交叉验证
0 O0 @' E: R' g9 q1 W过拟合: 模型对于训练集效果很好,对于测试集效果较差 原因:模型过于复杂0 t: {, n! E: Q
欠拟合:模型对于训练集和测试集效果都很差 原因: 模型太过简单8 H# _' ~" u) S3 e9 s/ q* F
模型选择的基本原则-奥卡姆剃刀原则:在具有相同泛化误差的模型中,选择较为简单的模型,防止过拟合
8 x# h' m3 W* F2 M+ o; O2 x' t特征向量: 将属性或特征,通常使用向量来进行表示( A8 i( |) D6 z5 v3 |# Z
训练集: 数据集划分的一部分,来用于模型或者算法的训练
5 W5 a+ {. c1 ?9 v8 @# {测试集: 数据集划分的一部分,来用于对已经训练好的模型进行测试模型的误差好坏. j/ M6 {. X" n" Z
* q! b! T! W' G0 w& k
! i& |: w9 K) r$ |
四丶分类和回归问题) Z5 X9 S: c! W& Y( D+ D( L
4.1说明# G& v5 I. q! Q* w; t
% B4 G% E2 W8 g" n如果预测值是连续值对应的问题是回归问题 Q7 D% A" \4 H* R$ y3 R& Z) ]
如果预测值是离散值对应的问题的分类问题3 O! X$ H- W+ Q1 ~! {* R& g
4.2类别型变量处理
+ b3 q1 l8 i$ o! O1 x比如天气: 晴天丶阴天丶雨天
* u. ]; b1 @3 I6 ~% L& {" ~8 nlable encoder: 标签编码
( S% E7 Z6 V8 x) X9 c% ^ D
* h$ Y5 G* ~3 k/ U晴天丶阴天丶雨天% J6 O" J& I3 }2 x5 a) U( N
0--------1--------28 u% `5 n8 F$ I9 W# V4 U0 x
* z' Q5 N6 R; I6 A- K5 E7 g
ont-hot encoder: 独热编码(二进制方式)3 ]& `; T0 [" S$ J7 n8 b2 r
: @: L! a( J0 E. P, O
晴天 丶 阴天丶 雨天3 h7 [- W0 F! `+ a2 l p1 }# }
1---------0----------0
( @8 [3 c, s* z c0---------1----------06 E$ Y8 v+ l- g4 ]9 S+ q# g* h4 h
0---------0----------15 X N/ X! u& n
/ ]# I6 N- W- k3 Y总结:通常使用label encoder(标签编码)
+ B- J' ]! ?9 r" j( ]) B0 W2 o. _————————————————
- e8 w6 D+ T/ v% R2 W3 Z版权声明:本文为CSDN博主「First_____」的原创文章,遵循CC 4.0 BY-SA版权协议,转载请附上原文出处链接及本声明。
+ q$ e0 o: R/ V原文链接:https://blog.csdn.net/First_____/article/details/1267175238 m" x5 n2 K) |1 v& J8 U: L
% L, A8 t8 I M
9 [. E+ ^' P. l! S* E8 s
5 S3 W/ J/ J2 U' [3 ?3 J |
zan
|