课程 在 Pandas 技能树

Pandas 实战挑战

本课程包含大量 Pandas 实战挑战,每个挑战都是一个小的 Pandas 项目,配有详细的说明和解决方案。通过解决这些挑战,你可以练习 Pandas 技能,提高问题解决能力,并学习如何编写简洁高效的代码。

Python数据科学

💡 本教程由 AI 辅助翻译自英文原版。如需查看原文,您可以 切换至英文原版

简介

通过 21 个独立编程挑战强化进阶数据技能,其中 15 个聚焦 Pandas,6 个延伸到 scikit-learn。你将根据任务要求和示例自行实现数据清洗、选择、转换、聚合、时间序列、文件 IO、DataFrame 组合、可视化和机器学习工作流。

课程包含 1 个 Beginner 和 20 个 Intermediate 挑战。情境使用销售、金融、客户、天气、电影等小型数据集,随后进入内置机器学习数据集,完成分类、回归、聚类、模型验证与评分。这是一门面向应用练习和自我检验的课程,而不是 Pandas 分步入门教程。

你将学到什么

  • 清理缺失、重复、格式不一致、日期和字符串数据,并构造新特征
  • 使用 MultiIndex 访问器、where、query、布尔归约和自定义函数筛选及更新表格
  • 对 Series 与 DataFrame 进行重索引、转换、分组、归一化、重采样、移位和聚合
  • 比较不同年份的数据,并通过连接、合并和基于索引的 join 组合表格
  • 导入和导出 CSV 与 JSON 数据,并从处理结果创建分析图表
  • 训练和评估 k 近邻、决策树与逻辑回归分类模型
  • 使用特征选择和交叉验证构建线性、Ridge 与 Lasso 回归流程
  • 比较 K-means、层次聚类与 DBSCAN,并分析验证曲线和评分指标

本课程适合谁

本课程适合已经掌握 Pandas 基础、希望获得高强度多样化实现练习,并开始在 scikit-learn 流程中使用表格数据的学习者。它更适合能自主理解规范、调试初始代码并在缺少完整演示时选择合适数据操作的人。

前置要求: 你应熟悉 Python 函数,以及选择、筛选、分组、缺失值处理和文件加载等常用 Pandas 操作。对于 6 个 scikit-learn 挑战,强烈建议具备基础统计和机器学习入门知识。

学习环境: 21 个挑战均在 Ubuntu 22.04 WebIDE 中运行,提供初始 Python 文件、本地数据和任务验证。可视化任务使用 Matplotlib 等绘图库,机器学习任务使用 scikit-learn 内置数据集和本地文件,无需外部服务账号。

常见问题

这门课程只学习 Pandas 吗?

不是。15 个挑战聚焦 Pandas,但另外 6 个明确使用 scikit-learn,涵盖 k-NN、决策树、线性回归、聚类、验证曲线以及分类和回归评分。只有当这一机器学习延伸符合你的目标时,才适合选择本课程。

课程适合完全零基础的学习者吗?

不适合。虽然课程目录级别为 Beginner,但 21 个挑战中有 20 个标为 Intermediate。任务默认你能在有限指导下选择、转换、分组和调试 Pandas 数据。

挑战是否有引导,必须按顺序完成吗?

每个挑战提供要求、示例、初始文件和检查,但不会给出完整解答演示。21 个情境相互独立,可以按主题选择;在多步骤情境内部,如果后续使用前面输出,则应按顺序完成。

需要外部数据集或云账号吗?

不需要。Pandas 挑战使用本地 CSV、JSON 或生成的表格,机器学习挑战使用本地文件或 scikit-learn 内置数据集,全部工作都在提供的环境中完成。

教师

labby
Labby
Labby is the LabEx teacher.