- 在线时间
- 1630 小时
- 最后登录
- 2024-1-29
- 注册时间
- 2017-5-16
- 听众数
- 82
- 收听数
- 1
- 能力
- 120 分
- 体力
- 565615 点
- 威望
- 12 点
- 阅读权限
- 255
- 积分
- 174907
- 相册
- 1
- 日志
- 0
- 记录
- 0
- 帖子
- 5313
- 主题
- 5273
- 精华
- 3
- 分享
- 0
- 好友
- 163
TA的每日心情 | 开心 2021-8-11 17:59 |
|---|
签到天数: 17 天 [LV.4]偶尔看看III 网络挑战赛参赛者 网络挑战赛参赛者 - 自我介绍
- 本人女,毕业于内蒙古科技大学,担任文职专业,毕业专业英语。
 群组: 2018美赛大象算法课程 群组: 2018美赛护航培训课程 群组: 2019年 数学中国站长建 群组: 2019年数据分析师课程 群组: 2018年大象老师国赛优 |
9 M8 c; T; q4 q1 y0 z, F; W1.机器学习概念及相关术语解释
! {; y0 o! f& O* A' l& n
" Z* x2 S" a6 m* ]$ H4 o) u# h一丶 机器学习概念
/ c7 \2 b0 e9 [$ Y概述: 机器学习是人工智能具有智能的必要技术手段,人工智能的核心,机器学习是致力于研究如何通过CPU和GPU(图形图像处理器)的计算,利用经验或数据来改善计算机系统自身的性能# q/ l/ N+ w5 a3 P* Q. z
; {- s- {' \' [' }) O* q9 d
总结: 机器学习模型=数据+算法$ H( L. d( b. Z
5 k! q& Y( A, K1 |* r, i2 s
如果有新的数据,我们只需要带入到Model中就可以输出预测值5 H u/ d0 w& S8 X
& Q( E& A- I7 ^0 J什么不是机器学习?( H! r. b7 r) Y9 @' E& C9 y8 n
6 P9 e( A. Z) C X0 B
比如对于计算问题丶已经知道结果等不是机器学习问题(比如: 统计成绩搞的同学的topN)
% V7 a2 y7 I2 {5 C机器学习其实就是需要有一个预测的过程! Y m* v& i$ g1 y: G0 o' X" k
' m' \7 x4 A4 N4 |0 n( c
机器学习概念补充:& _ {. U/ [- H( U( ~
$ \# v8 D- E; m+ s; k
1.说明: X: 特征或属性 Y:类别标签类或预测的值
- n" P8 r! b' u4 f! I
2 a! @, p' D" a( H' ?) Q训练集和测试集: 通常要将数据集分为两部分,训练集用来模型的训练,测试集用来模型测试模型的好坏程度." J. x w; T% @# j+ O/ D0 M; |
模型的好坏: 训练误差(模型预测在训练集上的Y值误差)丶测试误差(模型预测在测试集上Y值的误差)丶准确率(分对的/全部)丶错误率(1-正确率)
4 U) E! h9 z; `) t! c3 b; t+ W6 U二丶两种学习方式/ e( b ~# [* Z' y- [; V4 r; E8 J# F
基于规则的学习: 主要是通过基于专家发现的规则,指定规则,只需要新数据带入规则进行判断即可
$ M1 }. _# F) K( ^ K' H$ v; T基于模型的学习: x:特征数据 --> f(函数-模型) --> Y(结果数据),基于模型就可以直接预测分析得到结果数据0 J: i0 W2 o/ e6 X& r
三丶术语
8 |. E% W; s( p: ^- z; T3.1机器学习分类的几种概念
' D" B1 ]. I0 W+ X' t3 I+ S5 [- z/ A" n8 \
监督学习: 训练集数据有类别标记
3 w0 c2 f4 N9 q无监督学习:训练集数据没有类别标记
( o- ]" Y3 b* X3 @+ k) O. W; |半监督学习: 有类别标记的训练集+无标记的训练集
: ~ x" r' c5 S, Q4 T强化学习: 常见的应用场景包括动态系统以及机器人控制等
, h) V2 B" @. J- C监督学习:0 Q# s0 O7 b$ W
2 M. m2 o- Y: x1 e# w S分类:预测值是否为连续值,不是连续值的预测的话,是分类( k; z: J- Q+ B
回归:预测值是连续值的话,是回归! J# v4 Q" Z0 U' F/ Q
非监督学习:& e/ v5 j3 P1 p' l
2 k/ X, \9 T/ D( v聚类:通过相似性度量,组内的相似性是极高的,组内的相异性是极高的,进行分类* O- T- V8 J0 t/ M4 Q
降维-通过算法进行降维的话,Z1和Z2的物理含义是不明确的
7 ~: J+ w# v" \9 Y6 D, }– 特征选择: 从原有的特征中选择比较重要的特征—x1,x2,x3==>Z1,Z2/ j/ u; d2 x# G' @; d2 L
半监督学习:
: N, t6 }. W# T4 C
( j) I8 V, }- Z$ ?) Z1.基于聚类的假设
- s+ B( I; {" n) I; m* ?4 @–有类别标记的数据+没有类别标记的数据,将有类别标记的数据,去掉标签列,
! a$ S5 C2 l% m6 q) ~此时所有的数据均没标签,对全部数据进行聚类,聚类之后,有类别标记的数据和没有类别标记的数据,有可能被分到不同的组或簇中,将所有的,有类别标记的数据,根据机器学习常用的处理方法–投票原则,根据少数服从多数的原则进行表决,将没有带类别标签的数据加上类别标签: r) ?9 M0 k6 ^$ |" q0 f
2.利用所有样本再进行模型训练/ f* s! Y7 s( a y% m8 \( I9 ^
强化学习:* G- X" o0 a- A3 r" g# S7 M
/ F c4 n9 k6 D& b( B
解决连续决策的问题丶围棋丶无人驾驶汽车等问题
" s( u; M" a5 P7 X1 ^( r3.2机器学习三要素
* d G! g; t- U4 h
6 A5 @& [4 a$ z* H+ h( m模型: 决策函数丶条件概率分布
/ u) X+ c2 n* G' h, f- ^算法: 解析解和最优解(梯度下降法和牛顿法); j j$ Y6 \6 t5 h( u
策略: (损失函数)评判一个模型的好坏
4 c+ p( q1 M1 ~3.3其他
! C& r7 w% B! J v/ o, X7 Z: k0 `4 r- F' I- J1 P
降维: 将多维数据降成低维度数据,不过降过的维度不能使用具体的物理含义表示' F' l' Z; }/ j4 A. C8 E
抽样: 有行抽样和列抽样,如果模型发生欠拟合和过拟合,可以使用抽样方法很好的解决5 D' D9 s9 W4 ?0 G& q2 |, W
交叉验证: 交叉验证就是将拿到的训练数据,分为训练和验证集。以下图为例:将数据分成4份,其中一份作为验证集。然后经过4次(组)的测试,每次都更换不同的验证集。即得到4组模型的结果,取平均值作为最终结果。又称4折交叉验证
* v6 n3 k1 t; M8 x过拟合: 模型对于训练集效果很好,对于测试集效果较差 原因:模型过于复杂
+ o( W0 y, j- w+ r欠拟合:模型对于训练集和测试集效果都很差 原因: 模型太过简单0 |. ^6 x, s: @
模型选择的基本原则-奥卡姆剃刀原则:在具有相同泛化误差的模型中,选择较为简单的模型,防止过拟合
$ T: S% A1 \/ i4 @/ J特征向量: 将属性或特征,通常使用向量来进行表示* d, j9 p0 _7 D
训练集: 数据集划分的一部分,来用于模型或者算法的训练
% A1 U& W0 |8 {7 |% n, `7 ?测试集: 数据集划分的一部分,来用于对已经训练好的模型进行测试模型的误差好坏
5 B* `$ `+ L; j8 a) _' S8 @
5 M3 B$ }" I6 R7 D) `0 D2 A( a
四丶分类和回归问题0 r ^+ e5 U" ]5 k
4.1说明" D* A# K- S& Q% }( H
* ?( W0 J) C2 E% `' Y/ o& O
如果预测值是连续值对应的问题是回归问题
" o. u9 j' y5 ^5 o如果预测值是离散值对应的问题的分类问题. f# ]0 ~, U$ J
4.2类别型变量处理4 ~2 f$ l8 f( ~: t- d, q# b
比如天气: 晴天丶阴天丶雨天3 b# \5 M% v) w: n
lable encoder: 标签编码
i+ _% s& _* y, j/ t
$ q/ A# u$ F0 c0 Y8 A4 Y9 l晴天丶阴天丶雨天& n" o9 R# z$ l. B3 H$ y1 B [
0--------1--------2
% ^* G! K$ ~' x4 O- N- o
! n; m& q" e4 L5 y6 ~ont-hot encoder: 独热编码(二进制方式)
+ ^! h. _2 `) Y+ e. [/ Q, \1 T3 W8 e
" E6 X2 Z+ d' U5 i晴天 丶 阴天丶 雨天
. y, k6 f8 k4 `: e' ]1---------0----------0
- T ^% s! p7 k: q+ ]5 Q( ~0---------1----------0
/ g5 V; i5 O1 G9 o. [$ e0---------0----------1
, W. F7 `9 e2 {
; C! i) O8 P6 M6 V8 H$ @- x3 H总结:通常使用label encoder(标签编码). `; e+ }3 B6 e! [+ n6 O
————————————————
5 s% t% q+ l; K7 b4 }版权声明:本文为CSDN博主「First_____」的原创文章,遵循CC 4.0 BY-SA版权协议,转载请附上原文出处链接及本声明。
* t6 r) Q; E) l6 {5 V原文链接:https://blog.csdn.net/First_____/article/details/126717523- e( V' }1 E# \9 v6 K
9 P9 f; t7 t" o# R# u: a5 C% F- V# y. h; Z8 F2 G H; t
0 O( x- I8 |' |9 A
|
zan
|