- 在线时间
- 1630 小时
- 最后登录
- 2024-1-29
- 注册时间
- 2017-5-16
- 听众数
- 82
- 收听数
- 1
- 能力
- 120 分
- 体力
- 569152 点
- 威望
- 12 点
- 阅读权限
- 255
- 积分
- 175968
- 相册
- 1
- 日志
- 0
- 记录
- 0
- 帖子
- 5313
- 主题
- 5273
- 精华
- 3
- 分享
- 0
- 好友
- 163
TA的每日心情 | 开心 2021-8-11 17:59 |
|---|
签到天数: 17 天 [LV.4]偶尔看看III 网络挑战赛参赛者 网络挑战赛参赛者 - 自我介绍
- 本人女,毕业于内蒙古科技大学,担任文职专业,毕业专业英语。
 群组: 2018美赛大象算法课程 群组: 2018美赛护航培训课程 群组: 2019年 数学中国站长建 群组: 2019年数据分析师课程 群组: 2018年大象老师国赛优 |
$ K1 A/ }4 r$ Q/ W1 K7 V# ]
1.机器学习概念及相关术语解释7 [7 }% `/ C( j% `) U4 M* x
0 z; e+ I- K' k一丶 机器学习概念
9 |, V$ I( D# L& r概述: 机器学习是人工智能具有智能的必要技术手段,人工智能的核心,机器学习是致力于研究如何通过CPU和GPU(图形图像处理器)的计算,利用经验或数据来改善计算机系统自身的性能* ^4 z. ~3 K, d- m* ] V! e9 {
% G+ ^# U! k1 N" J9 i# y- Y总结: 机器学习模型=数据+算法
0 h p, V9 E( H3 T0 x
% N- v3 l) b3 y' G0 I: s如果有新的数据,我们只需要带入到Model中就可以输出预测值* _, _* B; h3 I O
* d$ n; I. |4 K% B
什么不是机器学习?, p, I/ @& y3 f e: N: ^5 C9 @
, Q8 {8 w0 ?3 I" I( A. ]) q比如对于计算问题丶已经知道结果等不是机器学习问题(比如: 统计成绩搞的同学的topN)
0 [+ I: K. p; y3 `( V机器学习其实就是需要有一个预测的过程
: a v U+ ^* G6 ^7 _& M1 ^
4 w) Y$ P3 ~9 m! p, F6 B8 [机器学习概念补充:
& W' b$ N) P$ c5 H& u# |# y/ j$ `, ]4 w- g! a3 P) D/ a9 e3 }' q; e1 H! {
1.说明: X: 特征或属性 Y:类别标签类或预测的值
: Y1 Y9 V4 ?4 A; X' Y* F( }; b/ c1 O4 T' j' I8 Z
训练集和测试集: 通常要将数据集分为两部分,训练集用来模型的训练,测试集用来模型测试模型的好坏程度.+ T/ u D0 u4 A; E9 e9 n+ h+ A3 ]- V
模型的好坏: 训练误差(模型预测在训练集上的Y值误差)丶测试误差(模型预测在测试集上Y值的误差)丶准确率(分对的/全部)丶错误率(1-正确率)
7 V* P: U# k0 F- V3 m) ^% D8 r4 m& K二丶两种学习方式
8 [0 b# z0 k! m" i, Z基于规则的学习: 主要是通过基于专家发现的规则,指定规则,只需要新数据带入规则进行判断即可& s1 G8 y: h0 i# `* e5 S
基于模型的学习: x:特征数据 --> f(函数-模型) --> Y(结果数据),基于模型就可以直接预测分析得到结果数据
! K8 u- n/ c9 P三丶术语
9 D8 x P; p* w5 j; P3.1机器学习分类的几种概念
3 |: \0 P( W2 N& M* a
# Z* |# p6 \1 W4 `监督学习: 训练集数据有类别标记
/ [$ E3 V5 A1 Y% [1 {& H无监督学习:训练集数据没有类别标记4 d, `6 F1 ]" R; z% @
半监督学习: 有类别标记的训练集+无标记的训练集
( \. E' W1 H6 I强化学习: 常见的应用场景包括动态系统以及机器人控制等
; d; k) c( t; V% q监督学习:3 M' {5 }. \! s, N4 U
, h& f8 K. g! Z; w6 |分类:预测值是否为连续值,不是连续值的预测的话,是分类 _. C4 L0 f- z- w
回归:预测值是连续值的话,是回归
- u( k, e% O( | _! ^) g' e非监督学习:
4 ?8 S$ _: X3 [. o' q( N( e. H( Y8 S6 g3 b) m$ O( ?
聚类:通过相似性度量,组内的相似性是极高的,组内的相异性是极高的,进行分类+ t" T! _: i+ r, I; _
降维-通过算法进行降维的话,Z1和Z2的物理含义是不明确的. C2 G2 E1 g* e. t5 J- [. |
– 特征选择: 从原有的特征中选择比较重要的特征—x1,x2,x3==>Z1,Z2/ d& Y4 z8 b: C1 T, t6 j0 L. m, G
半监督学习:
" F% |1 n; ?1 b& f& t# D* v# X) v2 Q7 b% c K2 g+ A7 I( [
1.基于聚类的假设" Q+ Y5 j+ d+ O: V8 w$ Z, X! y
–有类别标记的数据+没有类别标记的数据,将有类别标记的数据,去掉标签列,
- r( q% k# {7 A9 z. N此时所有的数据均没标签,对全部数据进行聚类,聚类之后,有类别标记的数据和没有类别标记的数据,有可能被分到不同的组或簇中,将所有的,有类别标记的数据,根据机器学习常用的处理方法–投票原则,根据少数服从多数的原则进行表决,将没有带类别标签的数据加上类别标签3 g7 s% j$ }+ _
2.利用所有样本再进行模型训练
( V0 V7 }& q4 w! c- j1 k) O2 K; P强化学习:
+ N2 p, L' a3 K0 G6 @0 w9 n2 D
解决连续决策的问题丶围棋丶无人驾驶汽车等问题# s7 @9 \# H2 _+ [/ Z+ B" e, }
3.2机器学习三要素
9 s) P. _5 A" C5 `% _# _! s4 {2 f6 l: U6 b6 T6 o( V3 z1 u
模型: 决策函数丶条件概率分布" l3 w& F: G" b8 r" y: U8 a; E3 R3 W7 T
算法: 解析解和最优解(梯度下降法和牛顿法)6 F- A) F7 L& Z8 _9 p6 S7 N# I
策略: (损失函数)评判一个模型的好坏8 @$ K1 s0 L- C$ y4 l0 f
3.3其他
# N, A# i; E/ B8 w
) R0 P% o. B7 Y5 W降维: 将多维数据降成低维度数据,不过降过的维度不能使用具体的物理含义表示
4 {1 X7 b7 a# ^; [ k" p抽样: 有行抽样和列抽样,如果模型发生欠拟合和过拟合,可以使用抽样方法很好的解决& Y7 C( j! I$ _+ ^6 I# H1 z
交叉验证: 交叉验证就是将拿到的训练数据,分为训练和验证集。以下图为例:将数据分成4份,其中一份作为验证集。然后经过4次(组)的测试,每次都更换不同的验证集。即得到4组模型的结果,取平均值作为最终结果。又称4折交叉验证 }; p9 l1 Q7 ^- V# o7 Y# |
过拟合: 模型对于训练集效果很好,对于测试集效果较差 原因:模型过于复杂
& z" n$ h9 [- t7 m- s欠拟合:模型对于训练集和测试集效果都很差 原因: 模型太过简单
/ Q( r& j2 \2 G7 L0 @模型选择的基本原则-奥卡姆剃刀原则:在具有相同泛化误差的模型中,选择较为简单的模型,防止过拟合
; e1 R' f3 [' z( w特征向量: 将属性或特征,通常使用向量来进行表示* k& c1 @/ ^& @4 L: p
训练集: 数据集划分的一部分,来用于模型或者算法的训练
5 P, \* t- C2 Y4 S$ p' O测试集: 数据集划分的一部分,来用于对已经训练好的模型进行测试模型的误差好坏
( y, h: p* b( X
3 V4 r& n/ k2 f. `8 o# E- B( K8 ^/ _5 O* I4 E
四丶分类和回归问题
7 ~" Q! K9 l6 q, x- v; O4.1说明" J" o: {* c$ |1 [
. h3 I8 U `( p- ~/ t如果预测值是连续值对应的问题是回归问题) h2 S: A8 t0 }8 W0 x( e
如果预测值是离散值对应的问题的分类问题5 ~% j* H x8 H* ]
4.2类别型变量处理) i$ H) n7 d/ {; u
比如天气: 晴天丶阴天丶雨天' K1 L3 n, k; w
lable encoder: 标签编码( x _0 {4 h$ g1 e4 k5 }7 x
: B% M) m6 S V) V' K
晴天丶阴天丶雨天. r. D7 `, l- Q+ Y
0--------1--------2, l; d( j( [8 V9 X6 d3 ?
8 N- [; e8 a A: i' v) mont-hot encoder: 独热编码(二进制方式)
" _# t" Q0 h/ W O8 `: `5 f3 X; P" K
晴天 丶 阴天丶 雨天( {& `; Z+ C3 V+ S! C
1---------0----------0
" G4 B5 M3 k* D) w0---------1----------0
7 g; k) T1 Y$ ^, t; P0---------0----------19 @' J9 ?4 g N$ e$ G
- b* J ]7 L2 Q总结:通常使用label encoder(标签编码)
3 R3 Z! X$ {2 y# u/ h6 C————————————————
9 _6 v6 A+ _( W7 q0 d. M; u版权声明:本文为CSDN博主「First_____」的原创文章,遵循CC 4.0 BY-SA版权协议,转载请附上原文出处链接及本声明。 V3 D4 q& x) O
原文链接:https://blog.csdn.net/First_____/article/details/126717523. {& L( z2 m: @! T' B& a9 Z( }% t
s. ~& h1 J& C, @3 D9 F4 I
# c# V: N" }4 F8 J
+ ^2 ]- x8 Z3 u+ a: ]& ~% i* U" p |
zan
|