- 在线时间
- 1630 小时
- 最后登录
- 2024-1-29
- 注册时间
- 2017-5-16
- 听众数
- 82
- 收听数
- 1
- 能力
- 120 分
- 体力
- 567244 点
- 威望
- 12 点
- 阅读权限
- 255
- 积分
- 175396
- 相册
- 1
- 日志
- 0
- 记录
- 0
- 帖子
- 5313
- 主题
- 5273
- 精华
- 3
- 分享
- 0
- 好友
- 163
TA的每日心情 | 开心 2021-8-11 17:59 |
|---|
签到天数: 17 天 [LV.4]偶尔看看III 网络挑战赛参赛者 网络挑战赛参赛者 - 自我介绍
- 本人女,毕业于内蒙古科技大学,担任文职专业,毕业专业英语。
 群组: 2018美赛大象算法课程 群组: 2018美赛护航培训课程 群组: 2019年 数学中国站长建 群组: 2019年数据分析师课程 群组: 2018年大象老师国赛优 |
( i8 A" d( i, |; n7 b1.机器学习概念及相关术语解释
9 G! R- t! g/ P; x: F
3 p0 n) K# A( o( d0 {: o+ S一丶 机器学习概念
! M- w4 i+ K4 j% o/ @概述: 机器学习是人工智能具有智能的必要技术手段,人工智能的核心,机器学习是致力于研究如何通过CPU和GPU(图形图像处理器)的计算,利用经验或数据来改善计算机系统自身的性能7 V0 C. a: ?7 o; t$ U8 |
: a. U; Y9 S# T3 f4 G( S
总结: 机器学习模型=数据+算法! p. ]) W' y# ~2 K4 r
5 v. f; k7 X6 L1 R' g |3 G
如果有新的数据,我们只需要带入到Model中就可以输出预测值 \6 z) s: m, q# `: _5 z/ m
. q) S, ` }9 r9 }; r
什么不是机器学习?/ E! G& l/ g# q a
, F9 R- I+ {: n" A比如对于计算问题丶已经知道结果等不是机器学习问题(比如: 统计成绩搞的同学的topN)
/ P) X! m M- b' w3 T7 s机器学习其实就是需要有一个预测的过程
& R% _9 b/ e% f7 w8 |. m0 Q% V/ |( k1 o
机器学习概念补充:3 f7 J. q: F& y7 r2 e) A0 O* d/ [% _ H
! j# M2 m* e" U" c$ Z$ q1.说明: X: 特征或属性 Y:类别标签类或预测的值3 E+ R4 [9 J( V6 e. P' p- V2 C
8 k, S+ M9 [2 A# x/ e训练集和测试集: 通常要将数据集分为两部分,训练集用来模型的训练,测试集用来模型测试模型的好坏程度.
1 ]2 L4 V: t6 C7 L" d& }, \模型的好坏: 训练误差(模型预测在训练集上的Y值误差)丶测试误差(模型预测在测试集上Y值的误差)丶准确率(分对的/全部)丶错误率(1-正确率)
' u5 p3 C! `0 E% `: g2 r二丶两种学习方式: B1 i" A. R4 I: E Z
基于规则的学习: 主要是通过基于专家发现的规则,指定规则,只需要新数据带入规则进行判断即可
: E. }' ^6 [: Y. D$ ]基于模型的学习: x:特征数据 --> f(函数-模型) --> Y(结果数据),基于模型就可以直接预测分析得到结果数据
( \3 ~! K8 y3 j% b; e三丶术语8 t, m* e& O$ j' k) ^
3.1机器学习分类的几种概念
8 h$ v0 k& \2 F8 s3 ]+ K
: L- k4 f# {, Y2 U" u$ s监督学习: 训练集数据有类别标记; e. F3 s, r0 o: F# C0 u9 U
无监督学习:训练集数据没有类别标记
6 [5 I8 S0 j8 v+ I" G8 W半监督学习: 有类别标记的训练集+无标记的训练集4 ~* C7 A( Y: k8 s9 f' u B
强化学习: 常见的应用场景包括动态系统以及机器人控制等 }4 F0 m% Z* ]# Q& d$ q: V0 `4 }
监督学习:
' s8 Z0 W8 @9 @3 W
/ e f2 c3 I" ~分类:预测值是否为连续值,不是连续值的预测的话,是分类
5 E/ b5 R9 ^. M' U) L/ W回归:预测值是连续值的话,是回归
0 P p$ \/ D$ E! P. r非监督学习:
/ O5 U& |: A I
3 B' n0 J% g {/ ]" L聚类:通过相似性度量,组内的相似性是极高的,组内的相异性是极高的,进行分类
. l4 f: l7 v7 k5 U$ H7 \降维-通过算法进行降维的话,Z1和Z2的物理含义是不明确的. v: q$ v9 n: a+ j1 J+ }, _
– 特征选择: 从原有的特征中选择比较重要的特征—x1,x2,x3==>Z1,Z2
" `' u0 m: O. k* l, c半监督学习:4 U7 W2 x1 S* _9 i, J; N" o% {
& k- x; c/ X8 b7 c6 F% {7 r1.基于聚类的假设
4 Y- y2 b- l5 ?# y$ f–有类别标记的数据+没有类别标记的数据,将有类别标记的数据,去掉标签列,
6 q( |# c# ~: p H5 L) Z$ N# f) [此时所有的数据均没标签,对全部数据进行聚类,聚类之后,有类别标记的数据和没有类别标记的数据,有可能被分到不同的组或簇中,将所有的,有类别标记的数据,根据机器学习常用的处理方法–投票原则,根据少数服从多数的原则进行表决,将没有带类别标签的数据加上类别标签
) h. r. t1 U- f A y- r2.利用所有样本再进行模型训练5 _; L5 h2 ^% P U6 Z/ C
强化学习:
$ B; U# i# \9 ]5 `. ^/ U! w% \; J, a3 S
解决连续决策的问题丶围棋丶无人驾驶汽车等问题& ]' }4 W; K% } N
3.2机器学习三要素- O/ f4 }# z7 E; ?2 J4 l' H
# p! q$ q# Y5 F# j p6 n! x3 B3 C5 `模型: 决策函数丶条件概率分布
$ O, b: f" m! q% z7 Q; b& J算法: 解析解和最优解(梯度下降法和牛顿法)5 C5 \4 L- i5 K" S+ G6 q! t3 j! {2 k
策略: (损失函数)评判一个模型的好坏4 v, x0 }' ~; s5 O: P8 B0 [+ C) D
3.3其他3 }4 ^4 F! d- p) x7 N: {+ C! P$ t
' f- W6 q/ m8 {9 ]
降维: 将多维数据降成低维度数据,不过降过的维度不能使用具体的物理含义表示8 m4 g0 I7 s- v
抽样: 有行抽样和列抽样,如果模型发生欠拟合和过拟合,可以使用抽样方法很好的解决' Y8 j( E+ u, t+ g* v
交叉验证: 交叉验证就是将拿到的训练数据,分为训练和验证集。以下图为例:将数据分成4份,其中一份作为验证集。然后经过4次(组)的测试,每次都更换不同的验证集。即得到4组模型的结果,取平均值作为最终结果。又称4折交叉验证
- Y6 s8 e0 @: B0 S& L1 b过拟合: 模型对于训练集效果很好,对于测试集效果较差 原因:模型过于复杂7 Y, I E; N2 y, U4 y* G- ]* k' n
欠拟合:模型对于训练集和测试集效果都很差 原因: 模型太过简单
3 r5 X9 X& b- K f# s9 U模型选择的基本原则-奥卡姆剃刀原则:在具有相同泛化误差的模型中,选择较为简单的模型,防止过拟合) [$ v* j3 N- ^/ \, @5 p1 R
特征向量: 将属性或特征,通常使用向量来进行表示, L* B5 h1 [2 S) t
训练集: 数据集划分的一部分,来用于模型或者算法的训练, c3 k! R5 @% `+ V9 P2 c2 L
测试集: 数据集划分的一部分,来用于对已经训练好的模型进行测试模型的误差好坏* D2 O1 P Z- C9 e; [. u
! h/ ]! M0 c, e
- J' S: e) U, u6 z7 K
四丶分类和回归问题 E; \9 V6 X9 c( o4 j2 W
4.1说明
1 X0 J$ K! Q0 `! E6 F! @5 a- K7 T* |6 ^6 X3 a4 l
如果预测值是连续值对应的问题是回归问题
2 V( B; {3 Q6 i' V1 [# D! N' G如果预测值是离散值对应的问题的分类问题
: N& U6 r2 [- t5 y z% K0 F8 ~4.2类别型变量处理
# ]! O: Z/ ^+ r比如天气: 晴天丶阴天丶雨天& Q. \# G3 [7 z6 U' H
lable encoder: 标签编码; W& \. y# E5 b6 r' T/ X2 r) o. Z( ]
! O9 X! r0 B6 M; X) f; B3 @1 A
晴天丶阴天丶雨天* ?& H( R( M- z, [
0--------1--------2+ T6 p) y! o5 G, V+ ~0 a
6 v4 t) \" k, [! D8 i! Ront-hot encoder: 独热编码(二进制方式)
0 B$ {, w. W0 k5 {6 p. Q
9 ~7 o, d! ?: Y. r+ ^" {晴天 丶 阴天丶 雨天+ X& O8 E2 U$ z# I
1---------0----------0. ~) ]: v( a$ W0 y2 L: t- i
0---------1----------0
, o2 o6 d4 v; X% A9 Y. C) }* K0---------0----------1
) G0 y& B* ]1 G) |# x( N9 y
% j# n# y6 n9 V总结:通常使用label encoder(标签编码)
/ |- |0 p1 g, r3 b. i: Y& @3 o9 G O————————————————' }) p6 w8 c% A4 I0 K# |' U3 r
版权声明:本文为CSDN博主「First_____」的原创文章,遵循CC 4.0 BY-SA版权协议,转载请附上原文出处链接及本声明。$ W' Z, U; [& k: r
原文链接:https://blog.csdn.net/First_____/article/details/126717523* V8 E; z* `. |. Z# F# H
' `, |; ^6 ?* e# O$ O) n8 X% [! t6 l' X7 x# o, _6 U
( x7 x( I' z+ {8 ]& } |
zan
|