- 在线时间
- 791 小时
- 最后登录
- 2022-11-28
- 注册时间
- 2017-6-12
- 听众数
- 15
- 收听数
- 0
- 能力
- 120 分
- 体力
- 36394 点
- 威望
- 11 点
- 阅读权限
- 255
- 积分
- 13879
- 相册
- 0
- 日志
- 0
- 记录
- 1
- 帖子
- 616
- 主题
- 542
- 精华
- 12
- 分享
- 0
- 好友
- 225
TA的每日心情 | 开心 2020-11-14 17:15 |
|---|
签到天数: 74 天 [LV.6]常住居民II
 群组: 2019美赛冲刺课程 群组: 站长地区赛培训 群组: 2019考研数学 桃子老师 群组: 2018教师培训(呼伦贝 群组: 2019考研数学 站长系列 |
1.原始数据存在的几个问题:不一致;重复;含噪声;维度高。5 }. B! _. F" o6 {$ {
9 e9 c n5 |7 \" X: M& ?2.数据预处理包含数据清洗、数据集成、数据变换和数据归约几种方法。( [( m% l* Z. U; S3 L. |
- S) c3 z; W5 O8 k
3.数据挖掘中使用的数据的原则1 B8 Q7 \& J) |% u" O, A
z% u0 I" Q: \2 m) m应该是从原始数据中选取合适的属性作为数据挖掘属性,这个选取过程应参考的原则是:尽可能赋予属性名和属性值明确的含义;统一多数据源的属性值编码;去除惟一属性;去除重复性;去除可忽略字段;合理选择关联字段。
; n+ W7 D$ c5 G0 e) p; g
% M4 [/ j: H4 A1 f4 O9 r4.处理空缺值的方法:忽略该记录;去掉属性;手工填写空缺值;使用默认值;使用属性平均值;使用同类样本平均值;预测最可能的值。
9 a; V5 u. T E, I" i7 T5 W, U0 {& I( ~: V7 b/ j
5.噪声数据的处理方法:分箱;聚类;计算机和人工检查结合;回归
' V. r- P5 n" O, i v: }- E$ M, e8 Q: L
6.分箱:分箱方法是一种简单常用的预处理方法,通过考察相邻数据来确定最终值。所谓“分箱”,实际上就是按照属性值划分的子区间,如果一个属性值处于某个子区间范围内,就称把该属性值放进这个子区间所代表的“箱子”内。把待处理的数据(某列属性值)按照一定的规则放进一些箱子中,考察每一个箱子中的数据,采用某种方法分别对各个箱子中的数据进行处理。在采用分箱技术时,需要确定的两个主要问题就是:如何分箱以及如何对每个箱子中的数据进行平滑处理。2 g* X7 b8 n& O3 i
' k5 ?0 S- w+ R* |& o分箱的方法:有4种:等深分箱法、等宽分箱法、最小熵法和用户自定义区间法。( y" |7 Z, e! ?" D2 m& K
, d: a$ U6 U [: m, L
统一权重,也成等深分箱法,将数据集按记录行数分箱,每箱具有相同的记录数,每箱记录数称为箱子的深度。这是最简单的一种分箱方法。- q/ r- ?6 V( i9 K8 R" j
" p: |8 Q% \: p1 u- b2 m统一区间,也称等宽分箱法,使数据集在整个属性值的区间上平均分布,即每个箱的区间范围是一个常量,称为箱子宽度。" K' U9 {1 Y+ {
3 n. Z% |0 V" ] N9 r+ X用户自定义区间,用户可以根据需要自定义区间,当用户明确希望观察某些区间范围内的数据分布时,使用这种方法可以方便地帮助用户达到目的。
, W, O. I' F4 E' A: ^! P1 u s+ V% u: U' b
例:客户收入属性income排序后的值(人民币元):800 1000 1200 1500 1500 1800 2000 2300 2500 2800 3000 3500 4000 4500 4800 5000,分箱的结果如下。
?: i2 Q* d% p4 R0 x* o' t" a- B" l1 h9 ]9 F9 y3 j. z5 R' ~3 x
统一权重:设定权重(箱子深度)为4,分箱后- [+ P6 Z# ], r8 J# k
9 d& d& ~1 u0 e0 B箱1:800 1000 1200 15006 G* g* Z/ v$ _! E. o
6 M- E4 L8 Y# ^. y$ N! a- G2 {
箱2:1500 1800 2000 2300 * v$ _' e% ^" Y( V2 e
( F \; E" v8 R- x: z* f6 |箱3:2500 2800 3000 3500; x# {6 Q X f
% x( i: R1 I4 X箱4:4000 4500 4800 5000 ! l5 I% f/ B2 S8 z, l5 f
. N1 R2 I: O4 L, P7 R" f$ s统一区间:设定区间范围(箱子宽度)为1000元人民币,分箱后) s4 W; G. x T0 Z
8 O+ L. h3 Q3 T0 R4 k箱1:800 1000 1200 1500 1500 1800
5 v* w2 f6 e* q* o. \5 W' ?( ^& K( ^: X9 S7 J) P ~, S
箱2:2000 2300 2500 2800 30006 r6 z* g& P, _1 C
* E1 o" j. P) x) V+ z! o2 Y0 G J
箱3:3500 4000 4500
! w* {4 A. m. W4 ]# j- T( [* E% u5 j( C4 F* l7 O: g, J
箱4:4800 5000 3 P2 E5 f( V o
# a4 k0 G0 p, A( F* M' f
用户自定义:如将客户收入划分为1000元以下、1000~2000、2000~3000、3000~4000和4000元以上几组,分箱后
9 m) r0 Q. C% `3 [3 ?2 f8 I/ I8 A" p E2 }5 n- d9 s3 o8 F
箱1:800 9 W8 r- @5 r1 w2 [# z5 }9 m% h
! y4 l# D) T( J7 |箱2:1000 1200 1500 1500 1800 2000
7 _ I( ?# P9 Q- U9 p* d
$ D2 ^, [: |; N, i& ~0 z! L$ y+ R箱3:2300 2500 2800 3000
& _* j$ @( b% Z& p; p: ]" J# Y2 s
1 t8 `7 H5 ~+ I$ w3 p/ j3 H箱4:3500 4000 4 x7 W/ j* S, [9 _. d' E! _+ a+ G
# {) e" V- X; A4 |/ ], A
箱5:4500 4800 5000 / |' C2 c5 ~9 F" X$ p# k
! W6 k7 u9 t+ [% `7.数据平滑方法:按平均值平滑、按边界值平滑和按中值平滑。
9 t5 u D( o3 V0 e- q! [' B/ x- C% I. v$ I# @1 ^
⑴按平均值平滑 / A. @* U. ?3 r6 v
. E0 ]: x. V' [! c% W* E
对同一箱值中的数据求平均值,用平均值替代该箱子中的所有数据。
- e5 _! K/ E# h- [( F! h s X: c/ T2 i; G! [9 L
⑵按边界值平滑 * O3 Q X. R5 _, `/ p
/ L5 V/ \3 p$ a" ^, C
用距离较小的边界值替代箱中每一数据。 . `1 t% F4 P/ x- q
9 ?* i) I" e* x M( Y) R⑶按中值平滑 3 T8 F* |7 \, t8 \5 A
! \1 s" @3 q. d2 ]+ {9 t
取箱子的中值,用来替代箱子中的所有数据。
2 v/ H2 U0 C7 {1 K+ T- n) z
# @9 u5 l3 p1 n) [# j8.聚类:将物理的或抽象对象的集合分组为由类似的对象组成的多个类。
9 a# r t4 @. c4 Z# \4 x+ w9 _7 J+ f& e1 l5 U
找出并清除那些落在簇之外的值(孤立点),这些孤立点被视为噪声。- ]/ J6 H! R" i9 I' z: U6 x& R
3 F8 t: n- r, k; _9 \- g7 G9.回归;试图发现两个相关的变量之间的变化模式,通过使数据适合一个函数来平滑数据,即通过建立数学模型来预测下一个数值,包括线性回归和非线性回归。
6 q7 D6 [% Y# l/ G; G( z
& `7 Y! M# B, F# j10.数据集成:将多文件或者多数据库中的异构数据进行合并,然后存放在一个一致的数据存储中。考虑以下几个问题: 1.模式匹配2.数据冗余3.数据值冲突
, y6 |2 L @" }& g
/ E* O" e. H3 ^5 o11. 数据变换:1.平滑2.聚集3.数据概化4.规范化(1)最小-最大规范化(2)零-均值规范化(3)小数定标规范化5.属性构造
5 d1 O, F2 r/ v2 A; C5 ]% [9 O( v; M/ [* E' N" D* F
12.数据集成:将多文件或者多数据库中的异构数据进行合并,然后存放在一个一致的数据存储中。考虑以下几个问题: 1.模式匹配2.数据冗余3.数据值冲突
% k2 |' M, k, g( J
4 p+ a- I0 h. i, Z) b+ H13.数据归约:目的是为了获得比原始数据小的多的,但不破坏数据完整性的挖掘数据集,该数据集可以得到与原始数据相同的挖掘结果。 & J, P5 `: u; A5 Y5 }3 }& ]9 x
5 v- `2 o& U4 P, R M* K数据归约的方法: 1.数据立方体聚集:把聚集的方法用于数据立方体。2.维归约:检测并删除不相关、弱相关或冗余属性。3.数据压缩:选择正确的编码压缩数据集。4.数值压缩:用较小的数据表示数据,或采用较短的数据单位,或者用数据模型代表数据。5.离散化和概念分层生成:使连续的数据离散化,用确定的有限个区段值代替原始值;概念分层是指用较高层次的概念替换低层次的概念,以此来减少取值个数。
2 F" D2 N0 z0 i. _
: H% O( H5 o9 l( Z. m& m! B14.数据立方体聚集 :是数据的多维建模和表示,由维和事实组成。 * [/ R) k+ [+ L* ~
9 B# t% b. W: }: k" t2 D0 H0 q维归约:去掉不相关的属性,减少数据挖掘处理的数据量。 $ o: E# c' |, f% `4 l
4 w- Q& m) a7 i0 k属性子集选择的基本方法包括以下几种: 1.逐步向前选择2.逐步向后删除3.向前选择和向后删除结合4.判定树归纳5.基于统计分析的归约 * c1 v# _2 x* c0 G: M6 e
1 h, L3 D4 B9 w4 x$ C) V
数据压缩:方法分为两类:无损压缩和有损压缩
& l/ M+ t: F+ o2 V" m& Y, q! @ {! C1 w/ c q8 S3 n
数值归约常用的方法: 1.直方图2.聚类3.抽样:不放回简单随机抽样、放回简单随机抽样、聚类抽样和分层抽样4.线性回归5.非线性回归 ) ^9 X7 S" V) ~) U
( P z7 x( v- k2 o" |15.数据变换涉及以下几个方面:1.平滑2.聚集3.数据概化4.规范化(1)最小-最大规范化(2)零-均值规范化(3)小数定标规范化5.属性构造0 [5 @& @" z9 a1 G& p/ R
& a0 C1 _4 f# j% l
*规范化:(1)最小—最大规范化。原取值区间 [old_min,old_max],规范化后的新的取值区间[new_min,new_max]。' b# @1 u5 h* T' T; ~1 V5 `
2 Q9 C2 |3 h T; S$ S0 y! S
x’= 其中:x是属性的真实值,x’是规范化后的值。: Y b$ F; i/ s: a3 B3 {+ ?
9 N0 \9 A6 n% ~9 G
例如:“客户背景数据”表中的客户月收入income属性的实际值范围为[12000,98000],要把这个属性值规范到[0,1],对属性值73600应用上述公式:
6 Y! L$ _: b' @0 v& T
" v1 O7 V. Q& C5 J: ex’=(1.0-0)+0=0.716
& J1 k# z. U* q# ^; i* [+ L2 O8 V+ {0 W+ \2 r- L1 X& O# N, h
根据精度要求保留小数(假设精度要求0.01),最终取值0.72就是属性值73600规范化后的值。
' g% i0 F: [! w. ? ^! M, a! j! ?6 h* C# l
(2)零—均值规范化(z—score规范化),是根据属性值的平均值和标准差进行规范化,即:
8 _7 @* F% w3 j8 D9 F) a! U3 ?9 d0 I. I6 ^0 v: o t8 U7 a
x’= = = 为所有样本属性值的平均值,为样本的标准差。当属性值范围未知的时候,可以使用此方法进行规范化。
/ a4 v. v6 @& q# `+ k; ]; T% u, s6 O# a! @
例:假设某属性的平均值和标准差分别为80、25,采用零-均值规范化66为:x’==-0.56 q' _8 H/ e- x3 L! ~
0 w2 W3 w: }* m+ @/ k8 E7 X$ Q- a(3)小数定标规范化:通过移动属性A的小数点位置进行规范化 。9 ]2 E( z+ Y9 _ `: |$ @
8 w, W5 j+ z, b0 P- C+ E& R% ~
x’= 为满足式<1的最小整数。' ]* L) t2 o* G. Z' T5 o
~: P2 ?) @6 e* t* \" g8 `例:假设某属性规范化前的取值范围为[-120,110],采用小数定标规范化66。由于该属性的最大绝对值为120,则由<1可得出=3,因此,66规范化后为:x’==0.066
( Z8 \( B. [, d3 B% ?; R9 r————————————————6 T) h: k' \1 m" i; G3 [7 y6 D
版权声明:本文为CSDN博主「搬砖老头」的原创文章,遵循CC 4.0 BY-SA版权协议,转载请附上原文出处链接及本声明。
0 H# `/ h/ r, k- ]0 j3 d# i6 G原文链接:https://blog.csdn.net/wang1127248268/article/details/53571956( ^9 X8 r- G7 J! {- a0 g; `- F
5 _; \+ U( ]5 A7 V% \
' m# J0 {7 f) p5 B* D0 ]! G2 E) l |
zan
|