- 在线时间
- 1630 小时
- 最后登录
- 2024-1-29
- 注册时间
- 2017-5-16
- 听众数
- 82
- 收听数
- 1
- 能力
- 120 分
- 体力
- 569149 点
- 威望
- 12 点
- 阅读权限
- 255
- 积分
- 175968
- 相册
- 1
- 日志
- 0
- 记录
- 0
- 帖子
- 5313
- 主题
- 5273
- 精华
- 3
- 分享
- 0
- 好友
- 163
TA的每日心情 | 开心 2021-8-11 17:59 |
|---|
签到天数: 17 天 [LV.4]偶尔看看III 网络挑战赛参赛者 网络挑战赛参赛者 - 自我介绍
- 本人女,毕业于内蒙古科技大学,担任文职专业,毕业专业英语。
 群组: 2018美赛大象算法课程 群组: 2018美赛护航培训课程 群组: 2019年 数学中国站长建 群组: 2019年数据分析师课程 群组: 2018年大象老师国赛优 |
: ?# h: X+ ?; j) u% w
1.机器学习概念及相关术语解释' |% n x( `9 U& b
$ c7 K& q+ Z) u% Z7 n3 g0 e, F
一丶 机器学习概念 A) [( I' }% r
概述: 机器学习是人工智能具有智能的必要技术手段,人工智能的核心,机器学习是致力于研究如何通过CPU和GPU(图形图像处理器)的计算,利用经验或数据来改善计算机系统自身的性能
1 U& `, k7 G I; @
+ n" S0 w2 h2 ?* r7 d0 c! q7 `; r总结: 机器学习模型=数据+算法" v- N) z- _% W. {" _9 {/ |
9 @+ ?; K0 t* f! I% U
如果有新的数据,我们只需要带入到Model中就可以输出预测值
' ?. o, b0 C0 ?; L
8 n4 o A, J5 c1 v: X什么不是机器学习?# d! ?5 h- ~$ H
4 i5 U, l2 ^3 y4 V
比如对于计算问题丶已经知道结果等不是机器学习问题(比如: 统计成绩搞的同学的topN)
- r4 S% _. t$ C, O) P5 W机器学习其实就是需要有一个预测的过程! B1 Z7 }8 V" X5 ]% s3 }4 q
$ Z# X1 [1 B1 _% a( m. ^. d( T
机器学习概念补充:% w- g4 \& {6 m* R5 f' f$ |
0 W9 u) P; N# J1 W/ ?1 n2 w
1.说明: X: 特征或属性 Y:类别标签类或预测的值
& s3 X: E! D2 k) k- Y; r
, I: p* C7 ?- Q训练集和测试集: 通常要将数据集分为两部分,训练集用来模型的训练,测试集用来模型测试模型的好坏程度.+ l) n& K/ Z$ T2 R. ^' }/ Q
模型的好坏: 训练误差(模型预测在训练集上的Y值误差)丶测试误差(模型预测在测试集上Y值的误差)丶准确率(分对的/全部)丶错误率(1-正确率)9 B! a+ B4 g' X
二丶两种学习方式4 z: I) I. n% W2 {% E
基于规则的学习: 主要是通过基于专家发现的规则,指定规则,只需要新数据带入规则进行判断即可
2 i$ K" `% q/ }; U7 |基于模型的学习: x:特征数据 --> f(函数-模型) --> Y(结果数据),基于模型就可以直接预测分析得到结果数据
8 a5 }$ V9 r% D; m9 Q( y+ I三丶术语
B( @. H8 C7 ]2 j# ^3.1机器学习分类的几种概念- I" _7 u( X2 D+ Q( C0 o; `, W
5 [0 b, C+ g3 P# C/ Y1 U监督学习: 训练集数据有类别标记
8 {) @+ W8 K- |# j无监督学习:训练集数据没有类别标记9 @- a M- I: s4 h7 a% _5 w, v* ~
半监督学习: 有类别标记的训练集+无标记的训练集
( p# q- f! i! f9 V8 D) O# Z, o强化学习: 常见的应用场景包括动态系统以及机器人控制等
5 ~, r8 [ P7 o1 x; ]5 V监督学习:/ D- p; C( B; M0 Q3 Z. R
7 K' M1 p/ e, \* ~% b( a# `: `
分类:预测值是否为连续值,不是连续值的预测的话,是分类
2 B2 [. j% F! p# H( @; B& q( x! p回归:预测值是连续值的话,是回归$ {/ H) l( h& G/ X% i5 V" D9 k
非监督学习:
5 [4 G4 t9 ~$ D- f8 f+ q1 f u
1 ?" e" y% [ O8 a1 M& Q9 [( K聚类:通过相似性度量,组内的相似性是极高的,组内的相异性是极高的,进行分类
" b2 _9 U! A+ ]5 ~7 ]降维-通过算法进行降维的话,Z1和Z2的物理含义是不明确的
! i* R1 t& R( I% _– 特征选择: 从原有的特征中选择比较重要的特征—x1,x2,x3==>Z1,Z2
; z. s8 P# p: H% r1 `# z半监督学习:
) v0 y/ ^- E3 Q+ g+ F1 D
& W5 m- \% l1 ^9 s! W1.基于聚类的假设
+ F+ {5 |4 L h% z; j& [–有类别标记的数据+没有类别标记的数据,将有类别标记的数据,去掉标签列,
7 @0 d, a- d2 `' U! j t此时所有的数据均没标签,对全部数据进行聚类,聚类之后,有类别标记的数据和没有类别标记的数据,有可能被分到不同的组或簇中,将所有的,有类别标记的数据,根据机器学习常用的处理方法–投票原则,根据少数服从多数的原则进行表决,将没有带类别标签的数据加上类别标签
( \2 L. q$ K' U" G4 v+ ?9 w2.利用所有样本再进行模型训练2 W, l% z: t2 L( A6 E
强化学习:
! _7 d# v' ?0 n; U9 \1 z! j$ q# r J- k) m; A& U' r
解决连续决策的问题丶围棋丶无人驾驶汽车等问题4 Q% D K+ Z) p6 u
3.2机器学习三要素3 r- m# w4 y" e; T5 Q
& U! i9 V6 S @0 y模型: 决策函数丶条件概率分布
% `; \ a! p8 f1 B& P/ b算法: 解析解和最优解(梯度下降法和牛顿法)
: ]0 Z7 `9 y/ U, G5 }9 J) q策略: (损失函数)评判一个模型的好坏( e) X) }, S9 i" F: c* b. y$ R
3.3其他5 g4 M7 A1 E7 {( j W: F
" l* ?4 R5 w4 T5 \* N8 z3 e3 q降维: 将多维数据降成低维度数据,不过降过的维度不能使用具体的物理含义表示
" a: c# k9 |) P$ z抽样: 有行抽样和列抽样,如果模型发生欠拟合和过拟合,可以使用抽样方法很好的解决
8 ~8 w8 {3 t3 u# h. y p5 _; t交叉验证: 交叉验证就是将拿到的训练数据,分为训练和验证集。以下图为例:将数据分成4份,其中一份作为验证集。然后经过4次(组)的测试,每次都更换不同的验证集。即得到4组模型的结果,取平均值作为最终结果。又称4折交叉验证6 N3 F9 S+ ^% x4 a w$ Z
过拟合: 模型对于训练集效果很好,对于测试集效果较差 原因:模型过于复杂
+ m+ Y* ?0 I8 k( `欠拟合:模型对于训练集和测试集效果都很差 原因: 模型太过简单
d! c2 w. R; ]- [& G9 B模型选择的基本原则-奥卡姆剃刀原则:在具有相同泛化误差的模型中,选择较为简单的模型,防止过拟合) L0 I. q6 P! t- I3 @
特征向量: 将属性或特征,通常使用向量来进行表示8 |! e' j! k, f$ p0 h, r
训练集: 数据集划分的一部分,来用于模型或者算法的训练
, N, K$ l h0 {5 Y! i测试集: 数据集划分的一部分,来用于对已经训练好的模型进行测试模型的误差好坏 G/ z; X, _2 U! F
8 H2 d/ M' J2 |5 h; s; Y* }% e+ Q5 c0 W% G. y
四丶分类和回归问题
1 S4 U& _* ]7 O1 t& ^! l9 G7 S2 k4.1说明
% b, B+ a5 W2 z ]& s# [- Q+ d: ~+ d6 D
如果预测值是连续值对应的问题是回归问题4 ?, T9 R1 i& S- v: i6 `, w, X
如果预测值是离散值对应的问题的分类问题
% F- `8 u0 S8 f& I/ {& U; Y4.2类别型变量处理 o8 S; Y* r+ ]% h3 z
比如天气: 晴天丶阴天丶雨天
6 o0 k0 M* Z* s: J5 k4 Z! Alable encoder: 标签编码
# G9 }: p/ m. g' \
$ S- P9 h0 _+ R2 h晴天丶阴天丶雨天4 L% s: Y/ E6 N* B' Z6 J+ \
0--------1--------2* j- ~( k. R- L3 J8 b5 F2 q; I
& c0 [) e( Z- j7 ^$ A- |
ont-hot encoder: 独热编码(二进制方式)2 G5 Q7 R e# `9 c
+ o3 T: M9 l0 g/ t( [) J
晴天 丶 阴天丶 雨天
8 r2 \& L1 e" Y% E' I' K5 A1---------0----------0
6 h8 e/ f+ A$ L" v0---------1----------05 P( Q! l% U! R! P) K* d
0---------0----------1
" X; j* G3 D2 k) m. S4 T
+ B' g9 V5 `1 p总结:通常使用label encoder(标签编码)
6 ?! X+ C2 Z$ q! w2 v" B4 g————————————————
& o4 M6 E1 f) D% r: X% H! |: Z版权声明:本文为CSDN博主「First_____」的原创文章,遵循CC 4.0 BY-SA版权协议,转载请附上原文出处链接及本声明。7 y' V5 q* G6 o: ]9 Q
原文链接:https://blog.csdn.net/First_____/article/details/126717523 L- F/ V: w- R! k" z1 @# H- d
) B* c: I1 [2 R" z
; i# Z' p! N) p$ ~7 y& `
/ @) G) Q! p; ^, @
|
zan
|