- 在线时间
- 1630 小时
- 最后登录
- 2024-1-29
- 注册时间
- 2017-5-16
- 听众数
- 82
- 收听数
- 1
- 能力
- 120 分
- 体力
- 565754 点
- 威望
- 12 点
- 阅读权限
- 255
- 积分
- 174949
- 相册
- 1
- 日志
- 0
- 记录
- 0
- 帖子
- 5313
- 主题
- 5273
- 精华
- 3
- 分享
- 0
- 好友
- 163
TA的每日心情 | 开心 2021-8-11 17:59 |
|---|
签到天数: 17 天 [LV.4]偶尔看看III 网络挑战赛参赛者 网络挑战赛参赛者 - 自我介绍
- 本人女,毕业于内蒙古科技大学,担任文职专业,毕业专业英语。
 群组: 2018美赛大象算法课程 群组: 2018美赛护航培训课程 群组: 2019年 数学中国站长建 群组: 2019年数据分析师课程 群组: 2018年大象老师国赛优 |
0 N5 \- O+ R+ m- d g( w) \" a
1.机器学习概念及相关术语解释
' M' \1 m) x" s
6 {2 H" q2 J9 \, n5 z/ `7 v- N( {一丶 机器学习概念2 ~( n0 O' L7 X$ k
概述: 机器学习是人工智能具有智能的必要技术手段,人工智能的核心,机器学习是致力于研究如何通过CPU和GPU(图形图像处理器)的计算,利用经验或数据来改善计算机系统自身的性能6 e* F7 y1 w( y* X0 @1 r9 D
9 o0 Z: k; m6 G9 D& g
总结: 机器学习模型=数据+算法4 @" o7 X" o; V% _' `
9 R0 x4 a. _: S: Z. |" o& b如果有新的数据,我们只需要带入到Model中就可以输出预测值6 U, u% u* u: E T4 q
, x( k# y+ p6 z9 ?- q M, q
什么不是机器学习?
2 s$ e3 @% T' v1 M0 V+ i% P6 O* j+ D* D
比如对于计算问题丶已经知道结果等不是机器学习问题(比如: 统计成绩搞的同学的topN)
9 |( L( Q5 X# k机器学习其实就是需要有一个预测的过程* S/ G" z, }$ D2 k9 i
1 s1 B0 O: w& m1 i* J* f x4 U4 o机器学习概念补充:5 P7 i( I7 B4 P
/ l0 j6 u U: G" w& @% Z+ m! X
1.说明: X: 特征或属性 Y:类别标签类或预测的值
; J/ ~; P+ J2 @7 M1 i7 ~) Z. J: d" }" X" i& u5 u! J' V( Y
训练集和测试集: 通常要将数据集分为两部分,训练集用来模型的训练,测试集用来模型测试模型的好坏程度.
: f9 P k& l; i( B# D2 x/ q模型的好坏: 训练误差(模型预测在训练集上的Y值误差)丶测试误差(模型预测在测试集上Y值的误差)丶准确率(分对的/全部)丶错误率(1-正确率)
1 z1 r7 Q$ C! U6 W s9 j二丶两种学习方式8 J7 z7 r0 Q9 v9 O$ v; c- c
基于规则的学习: 主要是通过基于专家发现的规则,指定规则,只需要新数据带入规则进行判断即可8 C' I2 l* G* W8 K; R) T# b
基于模型的学习: x:特征数据 --> f(函数-模型) --> Y(结果数据),基于模型就可以直接预测分析得到结果数据
2 A: }% r: {, S- R( d, z三丶术语
1 k8 I0 j# J0 l% Y) \3.1机器学习分类的几种概念! T/ w5 q2 n9 ?
* G1 s" ~& C+ E: e5 x监督学习: 训练集数据有类别标记
& `6 X3 e! C2 g: p: ]7 Z. p5 ?无监督学习:训练集数据没有类别标记
9 D+ r4 z9 |% h! k" [. j半监督学习: 有类别标记的训练集+无标记的训练集% `5 w& H- m% D6 }1 m0 B0 ?4 Y
强化学习: 常见的应用场景包括动态系统以及机器人控制等1 H2 e4 i1 A4 V V& o# {" E! q7 U- i
监督学习:, C. Y9 h: I: J1 Q W6 D
* [6 y1 R% W! y, F分类:预测值是否为连续值,不是连续值的预测的话,是分类
2 E* n9 F2 O0 U- m9 ?7 \回归:预测值是连续值的话,是回归
" C- u8 o7 D9 k7 t* v! o9 a5 @! I非监督学习:/ y3 t. _2 f8 e8 m" o0 N7 k' `% S9 W( }
7 o; n& E: u2 y2 X( h6 F% K聚类:通过相似性度量,组内的相似性是极高的,组内的相异性是极高的,进行分类
5 @5 N l; V1 |( Z0 ]; X降维-通过算法进行降维的话,Z1和Z2的物理含义是不明确的
* \' a7 h8 E' E: t$ X* d– 特征选择: 从原有的特征中选择比较重要的特征—x1,x2,x3==>Z1,Z2# l" h7 \( X1 p& L& ~
半监督学习:
( z7 j# x% I$ c" o; ?* e- u+ f
9 k) [( c" i1 T; S( l1.基于聚类的假设
4 i7 t$ o J% p" x \–有类别标记的数据+没有类别标记的数据,将有类别标记的数据,去掉标签列,
0 `1 r5 a6 ~9 b& ?# `此时所有的数据均没标签,对全部数据进行聚类,聚类之后,有类别标记的数据和没有类别标记的数据,有可能被分到不同的组或簇中,将所有的,有类别标记的数据,根据机器学习常用的处理方法–投票原则,根据少数服从多数的原则进行表决,将没有带类别标签的数据加上类别标签6 @. ~1 J! q: w5 j
2.利用所有样本再进行模型训练
* C6 w3 I* f& n0 r9 e7 M' ^强化学习:( [5 Z. y* I5 D# D, c
+ y% i/ H9 }; e5 A' X- D, g
解决连续决策的问题丶围棋丶无人驾驶汽车等问题
3 y+ B& z: V7 \5 a( `; t- f c+ G3.2机器学习三要素
2 a! W) b% f% c4 C' J2 T) N6 ~" l4 `0 D
模型: 决策函数丶条件概率分布( d8 x- g* x0 J8 P- F: ]5 y
算法: 解析解和最优解(梯度下降法和牛顿法)
3 e' v% p' j" B6 m. f策略: (损失函数)评判一个模型的好坏+ R2 \9 K- h" A# S4 O% D
3.3其他5 e2 ` | E5 U# r- n7 T
/ V/ ]8 k, ` n: j) E
降维: 将多维数据降成低维度数据,不过降过的维度不能使用具体的物理含义表示
5 e. H; W/ F! h7 S1 R: M; E6 |$ [! I! m' p抽样: 有行抽样和列抽样,如果模型发生欠拟合和过拟合,可以使用抽样方法很好的解决
- M7 [0 @' k; C) f# z! N2 S交叉验证: 交叉验证就是将拿到的训练数据,分为训练和验证集。以下图为例:将数据分成4份,其中一份作为验证集。然后经过4次(组)的测试,每次都更换不同的验证集。即得到4组模型的结果,取平均值作为最终结果。又称4折交叉验证; k6 D; V1 L! x- q
过拟合: 模型对于训练集效果很好,对于测试集效果较差 原因:模型过于复杂; r+ Q5 L: [$ E7 z- R9 _9 ^2 A
欠拟合:模型对于训练集和测试集效果都很差 原因: 模型太过简单
( c6 W& q. R2 ^# j$ o2 t模型选择的基本原则-奥卡姆剃刀原则:在具有相同泛化误差的模型中,选择较为简单的模型,防止过拟合
, M3 d, _) ^$ b/ N特征向量: 将属性或特征,通常使用向量来进行表示8 E+ n3 i5 P9 w. o( q9 S
训练集: 数据集划分的一部分,来用于模型或者算法的训练& A; g* O' G) {- \$ q6 L8 G. e, f
测试集: 数据集划分的一部分,来用于对已经训练好的模型进行测试模型的误差好坏
; F5 v) U/ u/ E7 ]- s6 G3 T6 U) S' X' `3 l/ }
: o9 j: Z) J- ~$ W
四丶分类和回归问题
: ]/ f. `/ ]' c0 A* `5 D4.1说明
2 }4 Y2 _( ~0 ]: Y$ M; Z+ y: ^, q6 B% ]2 o
如果预测值是连续值对应的问题是回归问题' S, \# ~4 ~# M- f; A+ ?* J
如果预测值是离散值对应的问题的分类问题
a j4 S$ m3 R- ^+ J4.2类别型变量处理9 S4 d* k: @8 x H
比如天气: 晴天丶阴天丶雨天
6 D* N4 W$ E" w) E5 A" wlable encoder: 标签编码
2 s, ^: ~; x2 y
& U4 d: S5 Q2 V8 W7 l晴天丶阴天丶雨天
5 i7 q1 Z# M1 I0--------1--------2
6 N% r6 j# ]4 c# d# v r& R! j) T' O) E
ont-hot encoder: 独热编码(二进制方式)$ z ?8 d, _! I% s7 ?0 i y
1 O" H3 f2 Z: p3 ]) M: X% M0 {6 C
晴天 丶 阴天丶 雨天4 q- o4 E/ w9 S5 e9 o' u; t
1---------0----------0
4 O/ W# N* A2 [' V4 ^2 Y6 R7 O5 ^$ Z0---------1----------0 u0 N6 l$ n- f! M
0---------0----------1 H* L2 O- M5 Q7 E
; c1 \; I1 {! `- X& [1 L# h2 ^
总结:通常使用label encoder(标签编码). c1 H! [$ A6 V1 `$ j8 V- w( u
————————————————, a: x: N, G+ C7 ?
版权声明:本文为CSDN博主「First_____」的原创文章,遵循CC 4.0 BY-SA版权协议,转载请附上原文出处链接及本声明。6 C4 j1 D* n! S0 \
原文链接:https://blog.csdn.net/First_____/article/details/126717523* W( X* @5 V: O- t% z: W
8 f% i' R( X# D! ?! @' w( C; r+ r+ a% S: M T* G& H/ l6 P! H' C
2 }) T% x; e# F; c7 n
|
zan
|