Scikit-learn 入门指南

本综合课程涵盖 Scikit-learn 的基础概念和实用技术,Scikit-learn 是 Python 中必不可少的机器学习库。学习使用各种算法和预处理技术构建、训练和评估机器学习模型。

Python数据科学

💡 本教程由 AI 辅助翻译自英文原版。如需查看原文,您可以 切换至英文原版

简介

通过 7 个聚焦的引导式实验学习 scikit-learn 的核心工作流程。你将完成库的设置、真实数据集查看、特征转换、回归与分类模型拟合、预测与可视化、分类指标计算,以及交叉验证。

课程使用小型 Python 脚本和经典数据集,让每个 API 操作都清晰可见。Iris 数据集用于探索、预处理、KNN 分类和交叉验证,California Housing 数据集则用于多变量回归示例。

你将学到什么

  • 使用 pip 安装 scikit-learn,导入模块,检查安装版本,并查看数据集对象
  • 加载 Iris 数据集,访问特征矩阵、目标标签、特征名称和元数据
  • 使用 Matplotlib 创建并保存散点图,以探索特征并比较预测值与真实值
  • 分离特征和目标,并使用 StandardScaler 标准化数值特征
  • 使用 LabelEncoder 编码标签,并理解独立的 fit、transform 和 fit_transform 操作
  • 划分训练集与测试集,在 California Housing 数据上拟合 LinearRegression 并生成预测
  • 在 Iris 数据上训练三个邻居的 KNeighborsClassifier,并另行使用准确率、混淆矩阵、精确率、召回率和 F1 评估预设二分类预测
  • 使用五折 cross_val_score 评估线性支持向量分类器,并汇总得分的均值和标准差

本课程适合谁

本课程适合希望简明学习 scikit-learn 估计器工作流程的 Python 学习者、数据分析初学者和机器学习入门者。最适合已经能够阅读和修改简单 Python 脚本、但尚未使用过该库的人。

前置要求: 建议掌握 Python 基础,包括变量、导入、函数调用、列表或数组,以及阅读简单脚本。无需机器学习实现经验;初步了解训练数据、特征和标签会有所帮助。

学习环境: 全部 7 个入门级实验都在带代码编辑器和集成终端的 Ubuntu 22.04 WebIDE 中运行。你会在 Python 文件中使用 scikit-learn、NumPy、pandas 和 Matplotlib;California Housing 实验通过 fetch_california_housing() 获取数据集。

常见问题

这是面向完全零编程基础的 Python 课程吗?

不是。实验会分步讲解 scikit-learn 操作,但默认你能编辑 Python 文件,并理解导入、变量、函数调用和数组式索引。如果这些概念还不熟悉,建议先学习 Python 基础课程。

课程会实现哪些模型?

你会为 California Housing 房价拟合线性回归模型,并为 Iris 类别训练三个邻居的 KNN 分类器。课程还使用预配置的线性支持向量分类器演示五折交叉验证。决策树、集成模型、聚类、神经网络和模型部署不在范围内。

课程使用 Jupyter Notebook 吗?

不使用。练习在 Ubuntu WebIDE 中编辑 .py 脚本,并从集成终端运行。图表保存为图像文件,而不是在 Notebook 单元格中开发。

我会构建一个完整的生产级机器学习项目吗?

不会。这 7 个独立引导式实验分别聚焦安装、探索、预处理、建模、指标和验证。它们介绍 API 工作流程,但不覆盖 Pipeline、超参数搜索、部署、监控或生产数据工程。

教师

labby
Labby
Labby is the LabEx teacher.