数据标准化与归一化
在机器学习的特征工程中,不同特征往往具有不同的量纲和数值范围。如果直接将原始数据输入模型,可能导致某些大数值特征主导距离计算或梯度更新过程。因此,进行 数据归一化与标准化 是特征预处理的关键步骤。
2. 核心方法
Section titled “2. 核心方法”2.1. Z-score 标准化 (Standardization)
Section titled “2.1. Z-score 标准化 (Standardization)”Z-score 标准化将数据转化为均值为 0、标准差为 1 的正态分布。
2.1.1. 计算公式
Section titled “2.1.1. 计算公式”$$z = \frac{x - \mu}{\sigma}$$
- 其中 $\mu$ 是特征的均值,$\sigma$ 是特征的标准差。
2.1.2. 特点
Section titled “2.1.2. 特点”- 处理后的数据没有严格的上下界,但大部分数据会落在 $[-3, 3]$ 区间内。
- 相比于 Min-Max 归一化,Z-score 对异常值(Outliers)具有更强的鲁棒性,因为异常值不会对均值和标准差产生毁灭性的拉伸作用。
2.2. Min-Max 归一化 (Normalization)
Section titled “2.2. Min-Max 归一化 (Normalization)”Min-Max 归一化将原始特征的数值范围线性映射到 $[0, 1]$ 区间内(有时也可以是 $[-1, 1]$)。
2.2.1. 计算公式
Section titled “2.2.1. 计算公式”$$x_{\text{new}} = \frac{x - x_{\text{min}}}{x_{\text{max}} - x_{\text{min}}}$$
- 其中 $x_{\text{max}}$ 和 $x_{\text{min}}$ 分别是该特征在数据集中的最大值和最小值。
2.2.2. 特点
Section titled “2.2.2. 特点”- 将数据严格限制在特定区间,有利于梯度下降的高效收敛。
- 对异常值极其敏感。如果数据中包含个别极大或极小的异常值,会压缩正常数值的分布范围,导致信息丢失。