跳转到内容

数据标准化与归一化

在机器学习的特征工程中,不同特征往往具有不同的量纲和数值范围。如果直接将原始数据输入模型,可能导致某些大数值特征主导距离计算或梯度更新过程。因此,进行 数据归一化与标准化 是特征预处理的关键步骤。


Z-score 标准化将数据转化为均值为 0、标准差为 1 的正态分布。

$$z = \frac{x - \mu}{\sigma}$$

  • 其中 $\mu$ 是特征的均值,$\sigma$ 是特征的标准差。
  • 处理后的数据没有严格的上下界,但大部分数据会落在 $[-3, 3]$ 区间内。
  • 相比于 Min-Max 归一化,Z-score 对异常值(Outliers)具有更强的鲁棒性,因为异常值不会对均值和标准差产生毁灭性的拉伸作用。

Min-Max 归一化将原始特征的数值范围线性映射到 $[0, 1]$ 区间内(有时也可以是 $[-1, 1]$)。

$$x_{\text{new}} = \frac{x - x_{\text{min}}}{x_{\text{max}} - x_{\text{min}}}$$

  • 其中 $x_{\text{max}}$ 和 $x_{\text{min}}$ 分别是该特征在数据集中的最大值和最小值。
  • 将数据严格限制在特定区间,有利于梯度下降的高效收敛。
  • 对异常值极其敏感。如果数据中包含个别极大或极小的异常值,会压缩正常数值的分布范围,导致信息丢失。