数学建模社区-数学中国

标题: 时间序列中的标准和归一化 [打印本页]

作者: 2744557306    时间: 2024-9-20 16:35
标题: 时间序列中的标准和归一化
在时间序列分析中,标准化(Standardization)和归一化(Normalization)是两种常用的数据预处理技术,旨在提高模型的性能和稳定性。它们通过调整数据的范围和分布,使得不同特征之间具有可比性,尤其在使用机器学习算法时尤为重要。
" p' y, f" q/ Z. s/ Z: i2 r* S
) `- N; g, C- ]; e5 B### 1. 标准化(Standardization)
0 P2 A+ M; r& O) Q" n  {  X* A# e  x2 p- Z# k( n
标准化是将数据转换为均值为0,标准差为1的分布。通过标准化,可以消除不同特征之间的量纲影响,使得数据在同一尺度上进行比较。
5 h! K7 H4 J8 ~0 J! s# ]
6 S" ^2 |* X9 D#### 标准化的公式6 _' W, c& O! E5 g% `* L

& P4 Z# }4 K8 l* K2 I' |7 Y* g' W! ~对于一个数据集 \(X\),其标准化的公式为:8 _1 U3 L6 c/ B$ \3 y% ?
\[3 j, g9 [1 n& N' ~5 B* r
Z = \frac{X - \mu}{\sigma}& [6 b. W6 N3 ]
\]: P+ y/ t8 U1 ^. k- {+ j: S6 K6 R  h  u
其中:
" S1 f( v' ]2 c; D2 c- \(Z\) 是标准化后的值。
0 B( |/ Y+ A( I; H0 ^+ c% e- \(X\) 是原始数据值。( Q  U5 r3 ]6 R6 r
- \(\mu\) 是数据的均值。
" ^; D& L$ [& y" N% j- \(\sigma\) 是数据的标准差。
) F4 Z2 |8 t) o$ l& H, o' \0 T' W3 {; I) r
#### 标准化的特点
- j! j: j6 S, e4 i+ R
3 _; S# t5 X8 e8 h- **适用场景**:适合于数据呈现正态分布或近似正态分布的情况。, `6 D& V6 t: ]) P' C
- **平衡特征**:通过消除均值和标准差的影响,使得不同特征在同一尺度上进行比较。. [8 f) ^- W  M( Z* v: B
- **对异常值敏感**:标准化对异常值敏感,异常值会影响均值和标准差的计算。
- v5 Z3 ]! p( V0 {* m) I2 V! K& h- c5 n% w% w
### 2. 归一化(Normalization)
" b" l2 C: T: b9 l
* S) G* ?; C1 K- P% X+ B4 p归一化是将数据缩放到一个特定的范围,通常是[0, 1]或[-1, 1]。归一化可以使得不同特征具有相同的尺度,尤其在特征值的范围差异较大时。5 P* F# L/ t" e& }  p/ K5 D
1 x/ a* I; m1 X9 `) ]
#### 归一化的公式2 P6 u, V5 Q; `7 A

3 }9 N9 e5 M) U1 ~1 w1 a对于一个数据集 \(X\),其归一化的公式为:
3 }5 i. ]; J) C# P! [. a5 h\[
% [+ G, p0 N7 v5 U% yX' = \frac{X - \text{min}(X)}{\text{max}(X) - \text{min}(X)}% ]+ M; }  b5 H& I! x% F! Q* {$ m" P
\]* n8 V! V' I' A( y* o
或者对于[-1, 1]范围的归一化:
3 y  Z6 x- S, m: f) `8 v) V\[7 [4 e6 d; U) w9 }
X' = \frac{2(X - \text{min}(X))}{\text{max}(X) - \text{min}(X)} - 13 }+ B% C* t, L& W4 q
\]
9 p2 @% P7 J) Q9 e; S" v$ D其中:
" }0 {! R) |5 f" T* ^9 P% w+ C- \(X'\) 是归一化后的值。
- N1 B5 {7 `; h0 h- \(\text{min}(X)\) 和 \(\text{max}(X)\) 分别是数据集中的最小值和最大值。
0 c) c2 r& ?) w2 g- }1 p0 R
0 |4 H/ }2 Y) i9 d#### 归一化的特点, x2 X- |# I% c5 U; x: C

8 A  ]- G; s( y( ~- **适用场景**:适合于数据没有明显的正态分布,并且特征值范围差异较大的情况。( n5 R/ t) a# I: P
- **消除量纲**:通过将数据缩放到相同的范围,消除特征之间的量纲影响。
: M& I  ]- U7 z/ E, H* h7 ~4 R* B( H- **对异常值敏感**:归一化也对异常值敏感,异常值会影响最小值和最大值的计算。
2 G1 t7 A3 y1 @0 }2 v' T1 e: C
! |, ~. M- h& s' S) x! R### 3. 标准化与归一化的区别
  U! T( u4 ~) ]1 w
) f$ g5 b, B1 j* @# m| 特征          | 标准化                      | 归一化                      |' {2 Z, o9 ^8 _
|---------------|-----------------------------|-----------------------------|5 S: o. w" Q8 h
| 目标          | 均值为0,标准差为1          | 缩放到特定范围(如[0, 1]) |; t9 X: s  }* ^/ Z) i
| 适用场景      | 数据近似正态分布           | 数据范围差异较大           |
3 S4 g  E! D  I' D| 对异常值敏感  | 是                          | 是                          |
- R2 e+ \8 `0 D2 p9 \' b+ ?( d& E| 公式          | \(Z = \frac{X - \mu}{\sigma}\) | \(X' = \frac{X - \text{min}(X)}{\text{max}(X) - \text{min}(X)}\) |
7 f9 a7 w) L1 _# X
0 B$ s" G/ u' |% h+ F; }3 {9 R: |### 4. 在时间序列中的应用. j% Q  E. s2 ~

0 q, V* ?  Q3 J0 f( r* f" p) I  W( R在时间序列分析中,标准化和归一化可以用于以下几个方面:
& R6 J5 ]  M  {5 J8 B; q
3 F% V) p4 \; g- **特征工程**:在构建特征时,标准化和归一化可以帮助提高模型的表现,尤其是在使用基于距离的算法(如KNN、SVM等)时。
) H, }+ H/ W. G  ~6 d: `- **平稳性检验**:在进行平稳性检验时,标准化可以帮助消除数据的尺度影响,使得检验结果更为可靠。& U! v* A1 p, |/ |; C( J
- **模型训练**:在训练机器学习模型时,标准化和归一化可以加速收敛,提高模型的训练效率。9 G6 O6 L% s7 R0 P3 ?
9 |) M$ J* X! T. P6 z! J5 [
### 总结
( k- L+ H3 F0 ~( W3 p
8 M$ r9 O: k% f3 J1 x. T8 M8 B5 z标准化和归一化是时间序列数据预处理的重要步骤,能够提高模型的性能和稳定性。选择使用哪种方法取决于数据的特性和所使用的模型。了解这两者的区别和适用场景,可以帮助更好地进行时间序列分析和预测。2 C) o3 F" c" p! }, v

! m" \! C+ M/ t/ i" D/ r# K# o% F; k: ~

- P# e4 e4 w* {8 ?4 B7 i

判断数据是否适用标准化.py

215 Bytes, 下载次数: 0, 下载积分: 体力 -2 点

售价: 1 点体力  [记录]  [购买]

归一化.py

726 Bytes, 下载次数: 0, 下载积分: 体力 -2 点

售价: 1 点体力  [记录]  [购买]

标准化.py

727 Bytes, 下载次数: 0, 下载积分: 体力 -2 点

售价: 1 点体力  [记录]  [购买]

daily-minimum-temperatures-in-me.csv

62.82 KB, 下载次数: 0, 下载积分: 体力 -2 点

售价: 1 点体力  [记录]  [购买]






欢迎光临 数学建模社区-数学中国 (http://www.madio.net/) Powered by Discuz! X2.5