模型评估与指标统计
本笔记系统性统计并归纳了机器学习中常见的 模型评估方法、泛化误差分解(偏差与方差)、分类评价指标 以及 特征归因解释方法(Shapley 值)。
2. 回归模型评估:决定系数 ($R^2$)
Section titled “2. 回归模型评估:决定系数 ($R^2$)”$$R^2 = 1 - \frac{\sum_{i=1}^n (\hat{y}i - y_i)^2}{\sum{i=1}^n (y_i - \bar{y})^2}$$
- 物理意义:用于评估模型对因变量变化的解释比例(即拟合优度)。$R^2$ 越接近 1,说明模型对训练数据的拟合程度越好;若为 0 甚至负数,说明模型预测效果还不如直接取真实标签的平均值 $\bar{y}$。
3. 偏差与方差的权衡 (Bias-Variance Tradeoff)
Section titled “3. 偏差与方差的权衡 (Bias-Variance Tradeoff)”泛化误差可以分解为偏差(Bias)、方差(Variance)和噪声(Noise)三部分。
- 偏差 (Bias):
- 定义:描述模型预测值的期望与真实值之间的差异。
- 对应状态:高偏差通常代表 欠拟合(Underfitting),说明模型表达能力不足,没有学到数据的核心规律。
- 方差 (Variance):
- 定义:描述模型在不同训练集(采样扰动)上预测值自身的波动剧烈程度。
- 对应状态:高方差通常代表 过拟合(Overfitting),说明模型对训练集特异性噪声过度敏感,泛化能力较差。
4. 分类模型评估指标
Section titled “4. 分类模型评估指标”在分类(特别是二分类)任务中,常用以下评估方法:
- Precision-Recall (P-R) 曲线:以精确率为纵轴、召回率为横轴绘制的曲线。常用于评估极度不平衡数据集中正样本的预测表现。
- ROC 曲线与 AUC 值:
- ROC 曲线:以真正率(TPR)为纵轴、假正率(FPR)为横轴的曲线。
- AUC (Area Under Curve):ROC 曲线下的面积,用于评估模型对正负样本排序能力的健壮性。
- F1-Score:精确率(Precision)与召回率(Recall)的调和平均数,能平衡两者的表现。
5. 特征解释性:Shapley 特征归因
Section titled “5. 特征解释性:Shapley 特征归因”5.1. Shapley 方法 (SHAP)
Section titled “5.1. Shapley 方法 (SHAP)”- 定位:基于合作博弈论原理,用于评估模型中各个特征对最终预测结果的 边际贡献度(归一化得分)。它能够提供局部解释(单样本下各特征的作用力)和全局解释(所有样本上特征的重要度)。
- 参考资料:腾讯云开发者社区:SHAP 算法深度解析
5.2. 常用可解释性方法对比
Section titled “5.2. 常用可解释性方法对比”通过下图可以直观理解不同可解释性框架在局部/全局归因、计算效率及一致性上的差异:
