通过 21 个独立编程挑战强化进阶数据技能,其中 15 个聚焦 Pandas,6 个延伸到 scikit-learn。你将根据任务要求和示例自行实现数据清洗、选择、转换、聚合、时间序列、文件 IO、DataFrame 组合、可视化和机器学习工作流。
课程包含 1 个 Beginner 和 20 个 Intermediate 挑战。情境使用销售、金融、客户、天气、电影等小型数据集,随后进入内置机器学习数据集,完成分类、回归、聚类、模型验证与评分。这是一门面向应用练习和自我检验的课程,而不是 Pandas 分步入门教程。
你将学到什么
- 清理缺失、重复、格式不一致、日期和字符串数据,并构造新特征
- 使用 MultiIndex 访问器、
where、query、布尔归约和自定义函数筛选及更新表格 - 对 Series 与 DataFrame 进行重索引、转换、分组、归一化、重采样、移位和聚合
- 比较不同年份的数据,并通过连接、合并和基于索引的 join 组合表格
- 导入和导出 CSV 与 JSON 数据,并从处理结果创建分析图表
- 训练和评估 k 近邻、决策树与逻辑回归分类模型
- 使用特征选择和交叉验证构建线性、Ridge 与 Lasso 回归流程
- 比较 K-means、层次聚类与 DBSCAN,并分析验证曲线和评分指标
本课程适合谁
本课程适合已经掌握 Pandas 基础、希望获得高强度多样化实现练习,并开始在 scikit-learn 流程中使用表格数据的学习者。它更适合能自主理解规范、调试初始代码并在缺少完整演示时选择合适数据操作的人。
前置要求: 你应熟悉 Python 函数,以及选择、筛选、分组、缺失值处理和文件加载等常用 Pandas 操作。对于 6 个 scikit-learn 挑战,强烈建议具备基础统计和机器学习入门知识。
学习环境: 21 个挑战均在 Ubuntu 22.04 WebIDE 中运行,提供初始 Python 文件、本地数据和任务验证。可视化任务使用 Matplotlib 等绘图库,机器学习任务使用 scikit-learn 内置数据集和本地文件,无需外部服务账号。
常见问题
这门课程只学习 Pandas 吗?
不是。15 个挑战聚焦 Pandas,但另外 6 个明确使用 scikit-learn,涵盖 k-NN、决策树、线性回归、聚类、验证曲线以及分类和回归评分。只有当这一机器学习延伸符合你的目标时,才适合选择本课程。
课程适合完全零基础的学习者吗?
不适合。虽然课程目录级别为 Beginner,但 21 个挑战中有 20 个标为 Intermediate。任务默认你能在有限指导下选择、转换、分组和调试 Pandas 数据。
挑战是否有引导,必须按顺序完成吗?
每个挑战提供要求、示例、初始文件和检查,但不会给出完整解答演示。21 个情境相互独立,可以按主题选择;在多步骤情境内部,如果后续使用前面输出,则应按顺序完成。
需要外部数据集或云账号吗?
不需要。Pandas 挑战使用本地 CSV、JSON 或生成的表格,机器学习挑战使用本地文件或 scikit-learn 内置数据集,全部工作都在提供的环境中完成。




