- 在线时间
- 1630 小时
- 最后登录
- 2024-1-29
- 注册时间
- 2017-5-16
- 听众数
- 82
- 收听数
- 1
- 能力
- 120 分
- 体力
- 565611 点
- 威望
- 12 点
- 阅读权限
- 255
- 积分
- 174906
- 相册
- 1
- 日志
- 0
- 记录
- 0
- 帖子
- 5313
- 主题
- 5273
- 精华
- 3
- 分享
- 0
- 好友
- 163
TA的每日心情 | 开心 2021-8-11 17:59 |
|---|
签到天数: 17 天 [LV.4]偶尔看看III 网络挑战赛参赛者 网络挑战赛参赛者 - 自我介绍
- 本人女,毕业于内蒙古科技大学,担任文职专业,毕业专业英语。
 群组: 2018美赛大象算法课程 群组: 2018美赛护航培训课程 群组: 2019年 数学中国站长建 群组: 2019年数据分析师课程 群组: 2018年大象老师国赛优 |
; M; x- V. q9 l/ M
1.机器学习概念及相关术语解释0 E9 y0 ]* P$ i* ^& |
1 q. z3 `" I: H一丶 机器学习概念
. {/ z( M3 K# Q R! |/ U+ r( z概述: 机器学习是人工智能具有智能的必要技术手段,人工智能的核心,机器学习是致力于研究如何通过CPU和GPU(图形图像处理器)的计算,利用经验或数据来改善计算机系统自身的性能
" ]& b+ @/ ^+ ?* w% j" _/ S0 M: ~. G) Z$ V( @
总结: 机器学习模型=数据+算法: I% e& u" O$ n( e5 \7 f1 q) d1 e& q) A
. S1 \' _# D i, @如果有新的数据,我们只需要带入到Model中就可以输出预测值
4 d& ^( i( `( A2 D4 b) h( `
. p2 b2 I8 h4 }9 w9 Q什么不是机器学习?7 m3 d+ `* n7 f" X8 v E
4 b; l3 J( o1 k k6 q, ^: h# {4 I
比如对于计算问题丶已经知道结果等不是机器学习问题(比如: 统计成绩搞的同学的topN)
$ T$ g' J8 h0 S7 ^8 o& Q' U2 d机器学习其实就是需要有一个预测的过程) j6 ~ [$ i' ?( i
& E4 p# z/ {3 y) R- m4 [$ o7 J
机器学习概念补充:
& g% y% Y6 A" ^% E( I W
2 j3 p( w" ?2 U2 N9 B! L1.说明: X: 特征或属性 Y:类别标签类或预测的值* r/ o; G+ e0 \4 S& k7 Y
6 V5 b! C5 o# p( K, N训练集和测试集: 通常要将数据集分为两部分,训练集用来模型的训练,测试集用来模型测试模型的好坏程度.4 w( F. B+ `- V. ]
模型的好坏: 训练误差(模型预测在训练集上的Y值误差)丶测试误差(模型预测在测试集上Y值的误差)丶准确率(分对的/全部)丶错误率(1-正确率)
. s% _' l8 S" K a7 s% {二丶两种学习方式
# q, P# ^0 X' X7 v% M; H基于规则的学习: 主要是通过基于专家发现的规则,指定规则,只需要新数据带入规则进行判断即可
/ n: i, Z X; U q( m基于模型的学习: x:特征数据 --> f(函数-模型) --> Y(结果数据),基于模型就可以直接预测分析得到结果数据
6 u! i" u0 l' z三丶术语1 ` |$ z9 z7 U9 t& f. c
3.1机器学习分类的几种概念
4 N) e+ s# Y+ K6 b, y% R6 u3 }) y6 R$ I
监督学习: 训练集数据有类别标记' v+ I) ^3 F% i4 c
无监督学习:训练集数据没有类别标记
; R5 I: z; K( r/ A, c半监督学习: 有类别标记的训练集+无标记的训练集
0 V1 J4 @7 G" B强化学习: 常见的应用场景包括动态系统以及机器人控制等
8 k- Z& ~3 Z+ U( R$ G7 b监督学习:
' X7 p& n# `1 Y, h. G
; X+ o- P$ U$ J) h1 \; N分类:预测值是否为连续值,不是连续值的预测的话,是分类2 a* ]! k. ^, z, O7 s7 Q* j
回归:预测值是连续值的话,是回归
. N0 o+ _ L* a9 T# w# g非监督学习:# b# d5 ]2 }$ h; w. u
# O: `. G8 |, R. p6 i聚类:通过相似性度量,组内的相似性是极高的,组内的相异性是极高的,进行分类$ v2 O! S$ Z7 R! X( G4 K
降维-通过算法进行降维的话,Z1和Z2的物理含义是不明确的
9 }* z- j( I: \, E9 {1 Z3 d– 特征选择: 从原有的特征中选择比较重要的特征—x1,x2,x3==>Z1,Z2- G% V2 P5 u1 o' [
半监督学习:7 E$ t$ W7 w, a+ a% f! k* O) w2 j C
+ g2 G+ `8 m: v: B, e" Y1.基于聚类的假设$ ^' H* k) R8 A: ?: _! i I
–有类别标记的数据+没有类别标记的数据,将有类别标记的数据,去掉标签列,: [: [( r4 t! N1 G: b1 L
此时所有的数据均没标签,对全部数据进行聚类,聚类之后,有类别标记的数据和没有类别标记的数据,有可能被分到不同的组或簇中,将所有的,有类别标记的数据,根据机器学习常用的处理方法–投票原则,根据少数服从多数的原则进行表决,将没有带类别标签的数据加上类别标签* v, E, N8 z5 P) o5 F5 S
2.利用所有样本再进行模型训练
0 n" B. D5 m* l2 v! a强化学习:$ O1 W! _8 k) X+ I( X1 N
; b& T4 W2 P7 U5 ^8 U5 g: x8 z; g解决连续决策的问题丶围棋丶无人驾驶汽车等问题0 [( Q1 ]1 f- d$ ~
3.2机器学习三要素
1 J2 g5 e y( @6 Y2 W6 h7 W6 W& Q/ K7 h$ b" |
模型: 决策函数丶条件概率分布
) _. H! ^ X* z! \算法: 解析解和最优解(梯度下降法和牛顿法)4 a# E0 G8 y2 d5 j0 T# X
策略: (损失函数)评判一个模型的好坏
9 z" N! a/ E) _, w8 I* Z3.3其他+ c; B5 _8 V( g9 l! k+ U$ w
" ~' p, F: j1 }降维: 将多维数据降成低维度数据,不过降过的维度不能使用具体的物理含义表示
; ?* C6 G# W$ q9 h( x* q抽样: 有行抽样和列抽样,如果模型发生欠拟合和过拟合,可以使用抽样方法很好的解决: g9 }$ @4 `# L/ n5 b
交叉验证: 交叉验证就是将拿到的训练数据,分为训练和验证集。以下图为例:将数据分成4份,其中一份作为验证集。然后经过4次(组)的测试,每次都更换不同的验证集。即得到4组模型的结果,取平均值作为最终结果。又称4折交叉验证& u$ A5 B. d' s& `7 i
过拟合: 模型对于训练集效果很好,对于测试集效果较差 原因:模型过于复杂, I2 F" N) R \# j& Z2 g
欠拟合:模型对于训练集和测试集效果都很差 原因: 模型太过简单2 B' q* A9 {5 v# ]$ {6 O
模型选择的基本原则-奥卡姆剃刀原则:在具有相同泛化误差的模型中,选择较为简单的模型,防止过拟合
1 d# I& B6 ^: o( ?特征向量: 将属性或特征,通常使用向量来进行表示4 I8 Q5 `1 C' S+ v
训练集: 数据集划分的一部分,来用于模型或者算法的训练" q8 u3 N* f: {) v8 p, r
测试集: 数据集划分的一部分,来用于对已经训练好的模型进行测试模型的误差好坏2 p# V! a3 ~5 p2 I2 w
& M. `2 [2 L# {! W1 F
6 \$ y) `; h+ p9 |. b. @3 |四丶分类和回归问题
* c3 ] G+ P* B, B4.1说明; }6 [6 Z5 m% Z3 `* |+ S A
8 y& r2 g% {" W如果预测值是连续值对应的问题是回归问题
4 A9 @! {: Y, t; E# }如果预测值是离散值对应的问题的分类问题, n7 v) T5 t0 O- x! i; c: H
4.2类别型变量处理
$ P# z$ v, @+ S比如天气: 晴天丶阴天丶雨天$ U, v9 Q# z: B
lable encoder: 标签编码: F* B* X$ z! B+ ^5 }
1 j9 p1 A y0 `# `! f晴天丶阴天丶雨天
! ^! e) Q4 K# X n+ Z0--------1--------2
! y4 A5 e# X4 N& U; o3 Q
% }, j, o' K6 h. G9 d" T! [ont-hot encoder: 独热编码(二进制方式)
v2 n( s6 C+ m7 F
; W s S# }. `0 m5 G晴天 丶 阴天丶 雨天/ V* ~7 F* n" [! y+ | _% N3 @
1---------0----------06 @- p1 _, g" Q
0---------1----------0
$ z, a3 d* ?" b, Z* l0---------0----------1" ~ k6 r4 c- i% r' N7 K
3 ^1 ]& M& j7 D6 K3 `* ~2 @4 `
总结:通常使用label encoder(标签编码)
+ C6 O) |6 z% ^————————————————* e9 k" B9 ~8 ]# C! {) p
版权声明:本文为CSDN博主「First_____」的原创文章,遵循CC 4.0 BY-SA版权协议,转载请附上原文出处链接及本声明。
1 W& C; T# [ t2 G8 d原文链接:https://blog.csdn.net/First_____/article/details/126717523% W% c8 }8 `! M3 |; w
- \( e) w1 h' s; ?- ~
7 A' d, O0 N4 `% l/ Q
4 J5 Q' s) S& y# w |
zan
|