- 在线时间
- 1630 小时
- 最后登录
- 2024-1-29
- 注册时间
- 2017-5-16
- 听众数
- 82
- 收听数
- 1
- 能力
- 120 分
- 体力
- 569152 点
- 威望
- 12 点
- 阅读权限
- 255
- 积分
- 175968
- 相册
- 1
- 日志
- 0
- 记录
- 0
- 帖子
- 5313
- 主题
- 5273
- 精华
- 3
- 分享
- 0
- 好友
- 163
TA的每日心情 | 开心 2021-8-11 17:59 |
|---|
签到天数: 17 天 [LV.4]偶尔看看III 网络挑战赛参赛者 网络挑战赛参赛者 - 自我介绍
- 本人女,毕业于内蒙古科技大学,担任文职专业,毕业专业英语。
 群组: 2018美赛大象算法课程 群组: 2018美赛护航培训课程 群组: 2019年 数学中国站长建 群组: 2019年数据分析师课程 群组: 2018年大象老师国赛优 |
( E! H H2 Q; E9 E; L+ H1.机器学习概念及相关术语解释/ v+ `: j% x( I' z: z) \4 H9 b
. B4 F6 c4 V7 u2 i& Z. I
一丶 机器学习概念
: x* G3 }# b7 g w& F$ l概述: 机器学习是人工智能具有智能的必要技术手段,人工智能的核心,机器学习是致力于研究如何通过CPU和GPU(图形图像处理器)的计算,利用经验或数据来改善计算机系统自身的性能
W6 c7 _4 X) d; r3 C, m8 K$ @1 ?' l% w. ]' L( J/ q' b/ A
总结: 机器学习模型=数据+算法
( B: Z) a6 n( Q7 f
! Q- D# F+ R0 Q* Z( T8 v7 b+ x/ w如果有新的数据,我们只需要带入到Model中就可以输出预测值
0 c/ j/ z) |; I
7 a% }) n& j7 N4 h8 u( ]什么不是机器学习?
) f/ ?& T: N+ R, I
8 q- y1 j5 d& G8 d" b( r比如对于计算问题丶已经知道结果等不是机器学习问题(比如: 统计成绩搞的同学的topN)4 \+ K! h- j: q3 z) q4 E- o
机器学习其实就是需要有一个预测的过程
' K# q8 W6 ]' }/ E/ H% k3 l
7 L- g: a, L/ b* f机器学习概念补充:
7 |0 ^' C2 }/ s) z' y
1 U4 ?6 C- W- U/ Z: Y1.说明: X: 特征或属性 Y:类别标签类或预测的值6 o4 ]. {0 V. z$ S& ~, |4 C- r$ b
+ }* S( ^+ Y# H3 F- U" d
训练集和测试集: 通常要将数据集分为两部分,训练集用来模型的训练,测试集用来模型测试模型的好坏程度.
6 m1 ]6 b6 T4 d0 q模型的好坏: 训练误差(模型预测在训练集上的Y值误差)丶测试误差(模型预测在测试集上Y值的误差)丶准确率(分对的/全部)丶错误率(1-正确率)7 i7 D/ J: f; s1 c7 E0 @$ O1 f
二丶两种学习方式
}* C: I' \; U( N基于规则的学习: 主要是通过基于专家发现的规则,指定规则,只需要新数据带入规则进行判断即可$ r+ I5 Y$ G( V5 h% `. { u
基于模型的学习: x:特征数据 --> f(函数-模型) --> Y(结果数据),基于模型就可以直接预测分析得到结果数据) h9 N+ \9 q/ A b1 V8 Q/ J
三丶术语$ Q) g, p$ a$ x! F" |
3.1机器学习分类的几种概念
; k: [; R; p- i5 ?5 h/ S: R/ b( O+ @8 r5 H: U h, V
监督学习: 训练集数据有类别标记
0 z- `5 F' ]5 \0 U9 m" G+ ~+ v. i* K3 G无监督学习:训练集数据没有类别标记
7 c. [6 g- w, R z, v半监督学习: 有类别标记的训练集+无标记的训练集
% l) R" Y; P# `2 v强化学习: 常见的应用场景包括动态系统以及机器人控制等
2 C0 f$ |5 [; S% ^) R监督学习:! H* E( B1 m: s# d
4 m, [- \ p9 _& e* g ~* _- H
分类:预测值是否为连续值,不是连续值的预测的话,是分类, l/ i4 I7 a8 H0 A
回归:预测值是连续值的话,是回归( E B ~9 N' T
非监督学习:& J7 i O: x3 D1 d" \4 y5 {
2 D! R/ U9 i" i5 W
聚类:通过相似性度量,组内的相似性是极高的,组内的相异性是极高的,进行分类
- I2 g& m& J6 M3 @- z降维-通过算法进行降维的话,Z1和Z2的物理含义是不明确的& N3 o; B1 k2 i' Y1 H- Y
– 特征选择: 从原有的特征中选择比较重要的特征—x1,x2,x3==>Z1,Z24 V0 P+ I. _2 {/ d0 J0 W
半监督学习:
* r$ X, P5 x9 c& J& z( N% [, M6 I; f3 Z p
1.基于聚类的假设
& j9 |" L* ^" D* z! y3 P–有类别标记的数据+没有类别标记的数据,将有类别标记的数据,去掉标签列,/ `0 d6 N% M5 k' G6 y7 m0 [/ n
此时所有的数据均没标签,对全部数据进行聚类,聚类之后,有类别标记的数据和没有类别标记的数据,有可能被分到不同的组或簇中,将所有的,有类别标记的数据,根据机器学习常用的处理方法–投票原则,根据少数服从多数的原则进行表决,将没有带类别标签的数据加上类别标签7 b( a8 j! H3 h$ \1 S& s+ p
2.利用所有样本再进行模型训练! d$ @- T3 Q* z9 N
强化学习:3 |# P4 d. w( v4 O( z
0 Y$ B8 W! O9 `, U" n
解决连续决策的问题丶围棋丶无人驾驶汽车等问题, n: B& O2 k* J0 d
3.2机器学习三要素" ~+ f! B8 D/ [6 l5 `( _
* l5 U! @, @. N2 v; ~; t$ ]模型: 决策函数丶条件概率分布
$ u# c( H5 P& |# A% j算法: 解析解和最优解(梯度下降法和牛顿法): r t+ {" X5 n8 W' k6 }. W$ R
策略: (损失函数)评判一个模型的好坏
6 l- @% l" {# s& q) b* v, Y3.3其他5 Z) M3 c/ r% X( e% w
0 E" r; \$ L8 ^. N+ J降维: 将多维数据降成低维度数据,不过降过的维度不能使用具体的物理含义表示
0 W2 u0 Q% r. u抽样: 有行抽样和列抽样,如果模型发生欠拟合和过拟合,可以使用抽样方法很好的解决1 f7 w# j8 o* j
交叉验证: 交叉验证就是将拿到的训练数据,分为训练和验证集。以下图为例:将数据分成4份,其中一份作为验证集。然后经过4次(组)的测试,每次都更换不同的验证集。即得到4组模型的结果,取平均值作为最终结果。又称4折交叉验证
! W8 A3 J7 I# J( t! B/ ]4 n* ^过拟合: 模型对于训练集效果很好,对于测试集效果较差 原因:模型过于复杂
6 I. m s2 e& I欠拟合:模型对于训练集和测试集效果都很差 原因: 模型太过简单
! F! v1 p, i$ c; J1 B模型选择的基本原则-奥卡姆剃刀原则:在具有相同泛化误差的模型中,选择较为简单的模型,防止过拟合! W7 n2 F5 ~# u; i3 _0 I+ D! ~
特征向量: 将属性或特征,通常使用向量来进行表示
0 Z4 q+ S1 Y) N6 r" H% y, N训练集: 数据集划分的一部分,来用于模型或者算法的训练
" n) @" m, W- H" c. e测试集: 数据集划分的一部分,来用于对已经训练好的模型进行测试模型的误差好坏
/ A) ^9 O3 V! j) D" o% A" r
6 T( B$ z1 I* Q6 Z! Q1 Z% B# H6 Z9 a4 R: O
四丶分类和回归问题9 d$ x, O$ Q9 L0 Y1 x
4.1说明
$ i. ~, `: k4 l$ s7 w8 X
+ n- m5 R0 Z+ {0 x如果预测值是连续值对应的问题是回归问题9 F" ~- B+ l+ J( o; d/ d
如果预测值是离散值对应的问题的分类问题; e. w! u* |# u$ ~- W
4.2类别型变量处理
, M9 e/ x; H0 j" U% g比如天气: 晴天丶阴天丶雨天* q, ~0 r f! J5 { s
lable encoder: 标签编码! V% n9 Z" d* [: p7 E6 ]" V
8 n- e& t7 |5 U+ a- Q晴天丶阴天丶雨天, @' |- B7 I; w3 W* u _) u2 F
0--------1--------2
( U- s) p9 V0 v3 Y& q2 D0 X2 A' b; l1 y
ont-hot encoder: 独热编码(二进制方式)
9 @0 o3 ]8 F. w& ?& L2 t3 k# n; h3 f; F! W: g! S5 W& R
晴天 丶 阴天丶 雨天; Q ] ~6 ~ W+ S
1---------0----------0
, a( ^& U a7 z6 M0---------1----------0
% T: P6 |/ E7 H9 }# w% C! i0---------0----------1' O6 b) _! L) d0 x
0 a4 t1 ]$ n A+ k" `' E! K8 E总结:通常使用label encoder(标签编码)" h0 u1 t' h, Z$ j" n/ n, m
————————————————# {7 V) s: j v- p
版权声明:本文为CSDN博主「First_____」的原创文章,遵循CC 4.0 BY-SA版权协议,转载请附上原文出处链接及本声明。
4 B$ Q3 r6 j/ w: m: ?5 _6 @原文链接:https://blog.csdn.net/First_____/article/details/126717523
$ j; b3 p# i, h( J
' l- m. A* y y/ i$ L- @
% G1 P" ?; v- g$ {
* h$ b2 y7 h" `1 U |
zan
|