跳转到内容

损失函数与风险函数

在机器学习和深度学习中,损失函数(Loss Function) 用于量化模型预测值与真实值之间的差异程度。优化算法(如梯度下降)通过最小化损失来迭代更新模型参数。


通常情况下,损失函数(Loss Function)仅考虑 单个样本 的预测偏差。

2.1. 均方误差损失 (Mean Squared Error, MSE)

Section titled “2.1. 均方误差损失 (Mean Squared Error, MSE)”

$$L(\hat{y}, y) = (\hat{y} - y)^2$$

对于包含 $n$ 个样本的整个数据集,其均方误差表示为:

$$MSE = \frac{1}{n} \sum_{i=1}^n (\hat{y}_i - y_i)^2$$

在多分类任务中,假设真实标签为 $t$(One-hot 编码),模型的预测概率输出为 $y$:

$$E = -\sum_{k} t_k \log y_k$$

2.3. 平均绝对误差损失 (Mean Absolute Error, MAE)

Section titled “2.3. 平均绝对误差损失 (Mean Absolute Error, MAE)”

$$MAE = \frac{1}{n} \sum_{i=1}^n |\hat{y}_i - y_i|$$


3. 核心概念区别:损失、代价与风险

Section titled “3. 核心概念区别:损失、代价与风险”

在严格的理论定义中,这三个概念存在层层递进的关系:

  1. 损失函数 (Loss Function): 度量 单样本 的预测误差。例如 $L(f(x_i), y_i)$。
  2. 代价函数 (Cost Function): 度量 整个样本集(多样本)的平均误差。通常是损失函数的样本均值。例如: $$J(w, b) = \frac{1}{n} \sum_{i=1}^n L(f(x_i), y_i)$$
  3. 风险函数 (Risk Function): 度量模型在 全局未知分布 下的期望损失,包含:
    • 期望风险:模型关于未知联合概率分布 $P(X, Y)$ 的期望损失。
    • 经验风险:模型在训练集上的平均损失(即代价函数)。机器学习通常使用“经验风险最小化(ERM)”并加入正则化项(结构风险最小化)来防止过拟合。