- 在线时间
- 791 小时
- 最后登录
- 2022-11-28
- 注册时间
- 2017-6-12
- 听众数
- 15
- 收听数
- 0
- 能力
- 120 分
- 体力
- 36393 点
- 威望
- 11 点
- 阅读权限
- 255
- 积分
- 13879
- 相册
- 0
- 日志
- 0
- 记录
- 1
- 帖子
- 616
- 主题
- 542
- 精华
- 12
- 分享
- 0
- 好友
- 225
TA的每日心情 | 开心 2020-11-14 17:15 |
|---|
签到天数: 74 天 [LV.6]常住居民II
 群组: 2019美赛冲刺课程 群组: 站长地区赛培训 群组: 2019考研数学 桃子老师 群组: 2018教师培训(呼伦贝 群组: 2019考研数学 站长系列 |
1.原始数据存在的几个问题:不一致;重复;含噪声;维度高。: n/ q# A. S& b
8 r- o( W# ]/ _! [6 }2.数据预处理包含数据清洗、数据集成、数据变换和数据归约几种方法。
+ p4 g' n) c; z4 ~5 W' y+ B2 o0 f( v( K6 a, {
3.数据挖掘中使用的数据的原则9 W3 z0 c \- j6 {4 o5 C+ K/ D
) A2 g% O: R" [) F
应该是从原始数据中选取合适的属性作为数据挖掘属性,这个选取过程应参考的原则是:尽可能赋予属性名和属性值明确的含义;统一多数据源的属性值编码;去除惟一属性;去除重复性;去除可忽略字段;合理选择关联字段。
& [" ~' i- a# D6 G2 G ]0 Y) ^ A
4.处理空缺值的方法:忽略该记录;去掉属性;手工填写空缺值;使用默认值;使用属性平均值;使用同类样本平均值;预测最可能的值。
) r! j+ P: b+ g/ L; x; I# Y. j3 S/ ?
* y, j o+ K; M2 b8 C* F5.噪声数据的处理方法:分箱;聚类;计算机和人工检查结合;回归
" c8 ~' G1 }5 v" M" h4 o1 B$ U. {& W$ |
6.分箱:分箱方法是一种简单常用的预处理方法,通过考察相邻数据来确定最终值。所谓“分箱”,实际上就是按照属性值划分的子区间,如果一个属性值处于某个子区间范围内,就称把该属性值放进这个子区间所代表的“箱子”内。把待处理的数据(某列属性值)按照一定的规则放进一些箱子中,考察每一个箱子中的数据,采用某种方法分别对各个箱子中的数据进行处理。在采用分箱技术时,需要确定的两个主要问题就是:如何分箱以及如何对每个箱子中的数据进行平滑处理。3 K3 N" z8 z# ~7 m# i$ w' m
9 j8 J& Z0 p$ J# b% O- y Z
分箱的方法:有4种:等深分箱法、等宽分箱法、最小熵法和用户自定义区间法。
# l3 c$ A5 Z3 ?" L" Y# B5 F' [
; f9 ?0 s4 S4 ?统一权重,也成等深分箱法,将数据集按记录行数分箱,每箱具有相同的记录数,每箱记录数称为箱子的深度。这是最简单的一种分箱方法。3 C/ T2 A/ b4 l7 e& O7 P: e* [
{7 e+ t7 ~9 S6 N统一区间,也称等宽分箱法,使数据集在整个属性值的区间上平均分布,即每个箱的区间范围是一个常量,称为箱子宽度。
6 j- U6 u/ p7 C/ t# c; c
& ]. ?0 ^ U3 ^; V( Z- j; K用户自定义区间,用户可以根据需要自定义区间,当用户明确希望观察某些区间范围内的数据分布时,使用这种方法可以方便地帮助用户达到目的。3 B1 } P; G2 U6 E7 R8 v5 b: A
8 _: T2 S$ X4 e# P; B; z4 }
例:客户收入属性income排序后的值(人民币元):800 1000 1200 1500 1500 1800 2000 2300 2500 2800 3000 3500 4000 4500 4800 5000,分箱的结果如下。$ X9 g1 l( ^% \1 {8 \7 f
5 g% i' V, g- U/ X统一权重:设定权重(箱子深度)为4,分箱后
6 \5 a0 C- J4 L% L6 s( ], o' m. U( h+ F# e/ O# Q c0 m
箱1:800 1000 1200 1500; W% C; L$ T& t# W1 G8 i9 }
4 G2 R, P) o+ K
箱2:1500 1800 2000 2300 $ k! g7 k* A% W# h) l) f) C1 f
+ z/ B! p0 E' q# n6 p
箱3:2500 2800 3000 3500
' @% ~+ m$ G; K! y0 U* X+ X B
% U" n! F7 L4 y; s7 `( B2 Y1 M" n8 b) t箱4:4000 4500 4800 5000
, e" U: o# W- F, y8 ~" S' k! n5 L' X5 \1 `3 |& N
统一区间:设定区间范围(箱子宽度)为1000元人民币,分箱后
" O8 L! s; X, J# ]' s8 l. R7 k
0 d$ ]$ g/ l0 E( k箱1:800 1000 1200 1500 1500 1800
5 I5 z" S. r4 O9 ~3 _. b' c
/ b) j* `0 ^0 ]箱2:2000 2300 2500 2800 3000
6 p- B9 H1 l" i9 {+ x- L! G5 D& |" Y. b) t/ q
箱3:3500 4000 4500+ {) H! a( g1 v( I
' I# Y& s" J! R8 }, K" L' ]
箱4:4800 5000 ; K9 V- L" y5 Z9 D
6 H- V$ D* K9 Y5 g) {用户自定义:如将客户收入划分为1000元以下、1000~2000、2000~3000、3000~4000和4000元以上几组,分箱后
! F4 n% Q' h8 i2 v m" u [, j' E1 P. V1 `0 X" _% T
箱1:800 : ~8 Q. f3 g2 |* e3 u& |0 j ^9 ]% U, Q* k
: A5 t# ?9 B2 q2 ~箱2:1000 1200 1500 1500 1800 2000
7 I& }/ C/ r( ^+ { A- w$ V; t$ g, K8 n3 O* d
箱3:2300 2500 2800 3000
8 ^+ l2 z0 A8 g+ h/ ~; D( g* k
) k2 T: I& P; x. {- f% A! t箱4:3500 4000 ( ]. m" V4 d, E3 s* h' p
* G' j7 j# N( D }6 }- u1 v
箱5:4500 4800 5000 2 j0 G! U6 z3 Y" i9 G
1 \+ ~1 i$ W8 e. Y, E
7.数据平滑方法:按平均值平滑、按边界值平滑和按中值平滑。
# o- |/ ], }+ c W8 W4 q3 s. U, A' H, p7 @9 W$ }' f6 V& I
⑴按平均值平滑
: u7 y, T7 H D: H
. l, \) d" _# g8 B7 f- @5 N1 \对同一箱值中的数据求平均值,用平均值替代该箱子中的所有数据。 % w; {4 |/ [$ M9 @1 j- h/ j
4 e8 f4 T0 k1 e0 N& k7 j5 P1 X
⑵按边界值平滑
6 D0 W z. x0 k8 S
: Q1 t$ O& z. G. g& t' m用距离较小的边界值替代箱中每一数据。
1 P9 }2 J- x5 g6 K: c- T3 h3 H3 F2 {6 Y% j& }
⑶按中值平滑 " K: ~2 V. ]& {& w- o: d% \
6 u) d3 c8 U& U* h9 x( z! P2 r取箱子的中值,用来替代箱子中的所有数据。 + {1 W/ k3 t9 _" M0 D" u
9 L. X2 b2 ?9 @7 ~
8.聚类:将物理的或抽象对象的集合分组为由类似的对象组成的多个类。
' J* E7 i3 a, e7 h) d* n
$ \# O8 s* G7 ~8 j2 W" c" X( d! W找出并清除那些落在簇之外的值(孤立点),这些孤立点被视为噪声。6 v K0 I# Q6 P$ | {
+ C1 [8 k" R4 M4 y9 j% h1 m' O9.回归;试图发现两个相关的变量之间的变化模式,通过使数据适合一个函数来平滑数据,即通过建立数学模型来预测下一个数值,包括线性回归和非线性回归。
: h3 P0 g I( ^& U1 _0 ]
; p5 J A9 T% d2 `' D10.数据集成:将多文件或者多数据库中的异构数据进行合并,然后存放在一个一致的数据存储中。考虑以下几个问题: 1.模式匹配2.数据冗余3.数据值冲突 % L5 Z8 k6 Z4 {$ \( k. K
1 n+ U! ?7 p! ?' b7 k1 m11. 数据变换:1.平滑2.聚集3.数据概化4.规范化(1)最小-最大规范化(2)零-均值规范化(3)小数定标规范化5.属性构造6 ~8 P0 g- c- A4 @
! C7 z' ?+ M$ v# E, j5 V1 u2 C
12.数据集成:将多文件或者多数据库中的异构数据进行合并,然后存放在一个一致的数据存储中。考虑以下几个问题: 1.模式匹配2.数据冗余3.数据值冲突
5 Q6 t; o$ I2 R% P( R, H0 r& n x& R& B/ Z/ z
13.数据归约:目的是为了获得比原始数据小的多的,但不破坏数据完整性的挖掘数据集,该数据集可以得到与原始数据相同的挖掘结果。 * B) A, u+ u% _
! P" f$ h5 s+ t3 {. Z8 A4 H数据归约的方法: 1.数据立方体聚集:把聚集的方法用于数据立方体。2.维归约:检测并删除不相关、弱相关或冗余属性。3.数据压缩:选择正确的编码压缩数据集。4.数值压缩:用较小的数据表示数据,或采用较短的数据单位,或者用数据模型代表数据。5.离散化和概念分层生成:使连续的数据离散化,用确定的有限个区段值代替原始值;概念分层是指用较高层次的概念替换低层次的概念,以此来减少取值个数。
: I" E0 y: ~* a6 Y0 M2 V$ ]5 r$ |% l# I) ~8 s! u2 ~ `: n
14.数据立方体聚集 :是数据的多维建模和表示,由维和事实组成。
# c; Z) P5 L7 t0 f+ p! |, [2 E. q
. R* @9 N8 @& m5 K9 e2 q7 u维归约:去掉不相关的属性,减少数据挖掘处理的数据量。
0 Q+ E5 f% D u' K
: \+ U; S/ u2 w2 q* P属性子集选择的基本方法包括以下几种: 1.逐步向前选择2.逐步向后删除3.向前选择和向后删除结合4.判定树归纳5.基于统计分析的归约
2 J, u1 a8 I0 y/ W8 [# y) p- ]* a: ^3 G; Y
数据压缩:方法分为两类:无损压缩和有损压缩
1 C8 g" o% h5 ?6 ^
/ m5 @' z$ f; Y' l数值归约常用的方法: 1.直方图2.聚类3.抽样:不放回简单随机抽样、放回简单随机抽样、聚类抽样和分层抽样4.线性回归5.非线性回归 / W% m. G5 M7 Q$ [
- y; e) w! W4 i ^) o
15.数据变换涉及以下几个方面:1.平滑2.聚集3.数据概化4.规范化(1)最小-最大规范化(2)零-均值规范化(3)小数定标规范化5.属性构造4 ^" ], ?* m1 w m. x
8 c0 X7 P( _. |. u+ U
*规范化:(1)最小—最大规范化。原取值区间 [old_min,old_max],规范化后的新的取值区间[new_min,new_max]。
( x5 r1 d/ H" ?1 _1 ^1 G
6 h d8 \$ Y! j" Z2 u7 [3 Sx’= 其中:x是属性的真实值,x’是规范化后的值。6 m& R- d) u) f8 M8 V h
. T& P) Y: o: O1 e( e' _* @* ~! h
例如:“客户背景数据”表中的客户月收入income属性的实际值范围为[12000,98000],要把这个属性值规范到[0,1],对属性值73600应用上述公式:& p) i. z, X. f y# V
) v/ T: m* G# V4 q3 [8 X! hx’=(1.0-0)+0=0.716
: }8 g; P" [" J
$ j8 x3 g3 ~& q+ A& f/ S根据精度要求保留小数(假设精度要求0.01),最终取值0.72就是属性值73600规范化后的值。7 S9 Y: A0 B$ _
5 A5 p. M4 W5 Q (2)零—均值规范化(z—score规范化),是根据属性值的平均值和标准差进行规范化,即:7 v$ T! }- u2 i& J' i' X7 r1 Q5 v
5 G. o+ N* f7 I- X5 o: `$ R" z
x’= = = 为所有样本属性值的平均值,为样本的标准差。当属性值范围未知的时候,可以使用此方法进行规范化。0 n- D; f5 X8 r* Y V2 k
. z) c& [, t9 u& _: X* A
例:假设某属性的平均值和标准差分别为80、25,采用零-均值规范化66为:x’==-0.56* w% @8 S5 s" x4 G
0 Q3 X! [& r$ C" P5 f% N(3)小数定标规范化:通过移动属性A的小数点位置进行规范化 。& k7 Z0 S B0 }8 Q. ]0 P
. q( L# u) B6 }. Nx’= 为满足式<1的最小整数。
: A/ u2 Z' g5 \" W g/ B7 I0 `1 n! p, i
例:假设某属性规范化前的取值范围为[-120,110],采用小数定标规范化66。由于该属性的最大绝对值为120,则由<1可得出=3,因此,66规范化后为:x’==0.066
. s ~! ?% y" ^ Y- _————————————————
/ S; ?5 x/ p' q# d4 [: k- Z版权声明:本文为CSDN博主「搬砖老头」的原创文章,遵循CC 4.0 BY-SA版权协议,转载请附上原文出处链接及本声明。
7 A6 B6 I+ x- y原文链接:https://blog.csdn.net/wang1127248268/article/details/53571956" M- j6 x" Q/ ~. M4 V; O+ z2 @
: B( k% X9 V. b$ e: x% H
& c, D3 @# {7 z |
zan
|