跳转到内容

sklearn

Scikit-learn(简称 sklearn)是基于 NumPy, SciPy 和 Matplotlib 构建的开源 Python 机器学习库。 它封装了绝大多数经典的传统机器学习算法(不包含深度学习),并提供了一套极其统一、优雅且文档完善的 API 接口,是工业界进行数据挖掘和构建 Baseline 模型的首选基石。


Scikit-learn 的功能体系可清晰地划分为以下六大模块:

  • 分类 (Classification):用于预测离散类别标签。包含逻辑回归 (Logistic Regression)、支持向量机 (SVM)、随机森林 (Random Forest)、K-近邻 (KNN) 等。
  • 回归 (Regression):用于预测连续数值。包含线性回归 (Linear Regression)、岭回归 (Ridge)、Lasso、梯度提升树 (GBDT) 等。

2.2. 无监督学习 (Unsupervised Learning)

Section titled “2.2. 无监督学习 (Unsupervised Learning)”
  • 聚类 (Clustering):自动发现数据内部隐藏的群体结构。包含 K-Means、DBSCAN、层次聚类等。
  • 降维 (Dimensionality Reduction):减少数据的特征维度以实现可视化或提升计算效率。包含主成分分析 (PCA)、t-SNE 等。
  • 模型选择与评估 (Model Selection):用于比较不同算法并寻找最佳参数。包含网格搜索 (Grid Search)、交叉验证 (Cross-Validation)、以及计算各类准确率/召回率指标 (Metrics) 的套件。
  • 数据预处理 (Preprocessing):建模前的特征工程核心。包含标准化 (StandardScaler)、归一化、特征编码 (OneHotEncoder) 及缺失值插补 (Imputer)。