- 在线时间
- 1630 小时
- 最后登录
- 2024-1-29
- 注册时间
- 2017-5-16
- 听众数
- 82
- 收听数
- 1
- 能力
- 120 分
- 体力
- 565771 点
- 威望
- 12 点
- 阅读权限
- 255
- 积分
- 174954
- 相册
- 1
- 日志
- 0
- 记录
- 0
- 帖子
- 5313
- 主题
- 5273
- 精华
- 3
- 分享
- 0
- 好友
- 163
TA的每日心情 | 开心 2021-8-11 17:59 |
|---|
签到天数: 17 天 [LV.4]偶尔看看III 网络挑战赛参赛者 网络挑战赛参赛者 - 自我介绍
- 本人女,毕业于内蒙古科技大学,担任文职专业,毕业专业英语。
 群组: 2018美赛大象算法课程 群组: 2018美赛护航培训课程 群组: 2019年 数学中国站长建 群组: 2019年数据分析师课程 群组: 2018年大象老师国赛优 |
7 D. T+ d \0 p" A( @
1.机器学习概念及相关术语解释 C, |! d. o' |5 w0 b/ \0 R
3 @* ~" P5 P" x一丶 机器学习概念
1 r0 M0 q1 v$ L- `: i概述: 机器学习是人工智能具有智能的必要技术手段,人工智能的核心,机器学习是致力于研究如何通过CPU和GPU(图形图像处理器)的计算,利用经验或数据来改善计算机系统自身的性能3 V& n; |2 @: L! L5 e2 n. N
& ]" u) b' k4 o
总结: 机器学习模型=数据+算法* p+ X. S9 M( P1 Q& A( b4 K
6 B/ B8 x/ `! w( m0 S* W
如果有新的数据,我们只需要带入到Model中就可以输出预测值
& T6 ^/ b' i1 b' ~& w) K$ V2 t* R G- s$ [! I' _
什么不是机器学习?
* X1 s6 f' g0 D3 h2 S' k% p6 i3 Z6 K
比如对于计算问题丶已经知道结果等不是机器学习问题(比如: 统计成绩搞的同学的topN)
! F$ u/ |) N2 @3 v& n: G) t* R" e" ]4 V机器学习其实就是需要有一个预测的过程
* E( _: e5 y. x# l3 e* s: K* P3 y- A8 B# J: d+ `$ j3 A
机器学习概念补充:
# M) N( H" E' V" j# F3 o3 V. R& N
1.说明: X: 特征或属性 Y:类别标签类或预测的值2 c. {* o8 r& c( L
/ e0 s8 i; C5 h- V5 K- h% t) M训练集和测试集: 通常要将数据集分为两部分,训练集用来模型的训练,测试集用来模型测试模型的好坏程度.) P3 t- F( z) ~. ]( `$ X
模型的好坏: 训练误差(模型预测在训练集上的Y值误差)丶测试误差(模型预测在测试集上Y值的误差)丶准确率(分对的/全部)丶错误率(1-正确率)1 R" i! s4 D8 ?, [0 b
二丶两种学习方式- [% y0 d* q) U6 C. c# e
基于规则的学习: 主要是通过基于专家发现的规则,指定规则,只需要新数据带入规则进行判断即可. |( f! K6 R- y0 W
基于模型的学习: x:特征数据 --> f(函数-模型) --> Y(结果数据),基于模型就可以直接预测分析得到结果数据2 C0 `+ `& u: I& p
三丶术语
2 u- D/ ^" _4 x3 x: e3.1机器学习分类的几种概念
3 \0 f6 O4 T; H* T6 n
+ v9 X9 `7 F5 v+ b$ t监督学习: 训练集数据有类别标记5 C; [+ T$ w0 w5 q5 P) q# z
无监督学习:训练集数据没有类别标记 M5 q. g1 H' a7 N# R
半监督学习: 有类别标记的训练集+无标记的训练集5 s: a$ V; Q& Y- y
强化学习: 常见的应用场景包括动态系统以及机器人控制等. G* q8 s6 _# s
监督学习:
4 C$ h: ^- _" \& J6 e
* Z' B3 _7 n5 Z分类:预测值是否为连续值,不是连续值的预测的话,是分类
8 k/ [7 e1 w3 `回归:预测值是连续值的话,是回归% W' [4 s5 X) |$ d. ]
非监督学习:
3 ~1 z4 ^6 O2 c( ~; e4 q
/ t# A$ f, [5 j; h) Q! T聚类:通过相似性度量,组内的相似性是极高的,组内的相异性是极高的,进行分类
: J, ?, r( j- J( A: ?0 ]8 I降维-通过算法进行降维的话,Z1和Z2的物理含义是不明确的
5 k* ?0 m! f7 x. J5 e' B– 特征选择: 从原有的特征中选择比较重要的特征—x1,x2,x3==>Z1,Z2
% f4 U0 ^1 [+ A' _: u A1 t8 W半监督学习:
& K5 N- ?, I4 p' Z) q3 m( ] N! o1 [* J# l
1.基于聚类的假设
- k' v% f2 g7 I$ E! K9 H–有类别标记的数据+没有类别标记的数据,将有类别标记的数据,去掉标签列,
3 q/ z; l1 O1 x8 x5 M此时所有的数据均没标签,对全部数据进行聚类,聚类之后,有类别标记的数据和没有类别标记的数据,有可能被分到不同的组或簇中,将所有的,有类别标记的数据,根据机器学习常用的处理方法–投票原则,根据少数服从多数的原则进行表决,将没有带类别标签的数据加上类别标签
6 d1 r/ x' K9 Z9 a' z' x( [+ c2.利用所有样本再进行模型训练. K; v) l' m6 o0 G
强化学习:: X9 \" t N" @7 Q2 [- ^* M" F. K
. T9 {- g0 Q" {; \
解决连续决策的问题丶围棋丶无人驾驶汽车等问题
3 k/ N! v) w6 N! {1 u Q; z3.2机器学习三要素
7 w5 N3 s" Z# x. U" m, i* b! {* m+ K4 X, F' a
模型: 决策函数丶条件概率分布' k, Q* G- R. k9 u0 }( D
算法: 解析解和最优解(梯度下降法和牛顿法)0 J" H5 w) f/ ^$ H' ]0 d2 g
策略: (损失函数)评判一个模型的好坏+ A6 ^/ t g* z
3.3其他- |5 M! W% M4 e6 E# A" u
) [5 y: a& P, S9 r. y降维: 将多维数据降成低维度数据,不过降过的维度不能使用具体的物理含义表示
2 R; N7 u, }; S3 W, V' h抽样: 有行抽样和列抽样,如果模型发生欠拟合和过拟合,可以使用抽样方法很好的解决% [: E) A! b% Y J
交叉验证: 交叉验证就是将拿到的训练数据,分为训练和验证集。以下图为例:将数据分成4份,其中一份作为验证集。然后经过4次(组)的测试,每次都更换不同的验证集。即得到4组模型的结果,取平均值作为最终结果。又称4折交叉验证9 C1 @! t- z& Y2 N. U6 Y( y
过拟合: 模型对于训练集效果很好,对于测试集效果较差 原因:模型过于复杂% r% y+ w! s6 e" q
欠拟合:模型对于训练集和测试集效果都很差 原因: 模型太过简单
4 d1 |# O; o2 p* s- Q: A) p W模型选择的基本原则-奥卡姆剃刀原则:在具有相同泛化误差的模型中,选择较为简单的模型,防止过拟合
/ G) i$ v) b6 S: m6 B特征向量: 将属性或特征,通常使用向量来进行表示
8 @- m$ @! ?! _% f7 I) d训练集: 数据集划分的一部分,来用于模型或者算法的训练$ F' @( R5 }# `* @) o
测试集: 数据集划分的一部分,来用于对已经训练好的模型进行测试模型的误差好坏3 d' p( |# h3 i
: @/ ^( Z) }2 z9 E, c0 n. N
7 h2 K8 n% O+ J( Z0 P6 c; L6 {四丶分类和回归问题
7 B! [0 k9 b y# y, [# y4.1说明
+ o% B# u' G0 L
& p0 O& v+ C5 s) _如果预测值是连续值对应的问题是回归问题
, C9 g* m2 H% p Z5 B如果预测值是离散值对应的问题的分类问题
5 t7 R' j# |4 N4 B( ~4.2类别型变量处理2 A6 } r2 e+ w* H {% p. v
比如天气: 晴天丶阴天丶雨天/ \$ K0 h% r1 Q3 D
lable encoder: 标签编码7 \9 z8 w& P: W2 i6 o+ L% r* J8 x
1 U/ p7 f* @; y$ \. p
晴天丶阴天丶雨天7 _& b! v e/ M7 B" U \/ H+ ]
0--------1--------22 b; v& O c0 _% `+ B$ v( w
: W; m2 b% [7 V/ D! m, d# kont-hot encoder: 独热编码(二进制方式)
4 @1 F S8 w' ?: I7 O6 |7 r5 V. u, M, p! f- m7 q7 F/ g1 ]( \- I' V3 X
晴天 丶 阴天丶 雨天
^" u2 d" h! _# h4 S4 z& n1---------0----------0" L+ s9 v& c+ u) v ^! a
0---------1----------0
, G7 _- k+ a. P0---------0----------1
& K, u% A q3 b& @( r
; v0 C1 |( T! V. h0 j: r总结:通常使用label encoder(标签编码)
+ J6 e) {7 e" D2 Y7 ^————————————————
" f( I, C- U8 ]0 z版权声明:本文为CSDN博主「First_____」的原创文章,遵循CC 4.0 BY-SA版权协议,转载请附上原文出处链接及本声明。3 b, G0 ` J$ r( J& Q0 l
原文链接:https://blog.csdn.net/First_____/article/details/126717523+ c; B5 i8 w& S @
" W O: ~) \* a. M( S1 p3 j1 r
$ T+ f: r2 O9 W, C. E
) l# N6 u0 P+ m9 b9 z1 ~: m. i
|
zan
|