通过 7 个聚焦的引导式实验学习 scikit-learn 的核心工作流程。你将完成库的设置、真实数据集查看、特征转换、回归与分类模型拟合、预测与可视化、分类指标计算,以及交叉验证。
课程使用小型 Python 脚本和经典数据集,让每个 API 操作都清晰可见。Iris 数据集用于探索、预处理、KNN 分类和交叉验证,California Housing 数据集则用于多变量回归示例。
你将学到什么
- 使用
pip安装 scikit-learn,导入模块,检查安装版本,并查看数据集对象 - 加载 Iris 数据集,访问特征矩阵、目标标签、特征名称和元数据
- 使用 Matplotlib 创建并保存散点图,以探索特征并比较预测值与真实值
- 分离特征和目标,并使用
StandardScaler标准化数值特征 - 使用
LabelEncoder编码标签,并理解独立的fit、transform和fit_transform操作 - 划分训练集与测试集,在 California Housing 数据上拟合
LinearRegression并生成预测 - 在 Iris 数据上训练三个邻居的
KNeighborsClassifier,并另行使用准确率、混淆矩阵、精确率、召回率和 F1 评估预设二分类预测 - 使用五折
cross_val_score评估线性支持向量分类器,并汇总得分的均值和标准差
本课程适合谁
本课程适合希望简明学习 scikit-learn 估计器工作流程的 Python 学习者、数据分析初学者和机器学习入门者。最适合已经能够阅读和修改简单 Python 脚本、但尚未使用过该库的人。
前置要求: 建议掌握 Python 基础,包括变量、导入、函数调用、列表或数组,以及阅读简单脚本。无需机器学习实现经验;初步了解训练数据、特征和标签会有所帮助。
学习环境: 全部 7 个入门级实验都在带代码编辑器和集成终端的 Ubuntu 22.04 WebIDE 中运行。你会在 Python 文件中使用 scikit-learn、NumPy、pandas 和 Matplotlib;California Housing 实验通过 fetch_california_housing() 获取数据集。
常见问题
这是面向完全零编程基础的 Python 课程吗?
不是。实验会分步讲解 scikit-learn 操作,但默认你能编辑 Python 文件,并理解导入、变量、函数调用和数组式索引。如果这些概念还不熟悉,建议先学习 Python 基础课程。
课程会实现哪些模型?
你会为 California Housing 房价拟合线性回归模型,并为 Iris 类别训练三个邻居的 KNN 分类器。课程还使用预配置的线性支持向量分类器演示五折交叉验证。决策树、集成模型、聚类、神经网络和模型部署不在范围内。
课程使用 Jupyter Notebook 吗?
不使用。练习在 Ubuntu WebIDE 中编辑 .py 脚本,并从集成终端运行。图表保存为图像文件,而不是在 Notebook 单元格中开发。
我会构建一个完整的生产级机器学习项目吗?
不会。这 7 个独立引导式实验分别聚焦安装、探索、预处理、建模、指标和验证。它们介绍 API 工作流程,但不覆盖 Pipeline、超参数搜索、部署、监控或生产数据工程。





