通过 77 个带指导的情境实验,建立对 Hadoop 生态系统的实操认识。课程从日常 HDFS 操作和存储控制开始,逐步进入 MapReduce 数据流技术、YARN 资源管理,以及覆盖面较广的 Hive 与 HiveQL 任务。
这是一套广泛的实践资源库,而不是单一线性项目。课程清单不要求固定顺序,你可以从基础一路学习到高级数据任务,也可以选择最需要加强的主题实验。
你将学到什么
完成本课程后,你将能够:
- 设置并探索课程提供的 HDFS、YARN 和 Hive 环境,开展动手练习。
- 使用文件系统 shell 读取、查找、传输、删除、检查 HDFS 数据并管理权限。
- 管理 HDFS 副本、block、DataNode、snapshot、storage policy、quota 和已删除文件清理。
- 应用涉及 partitioner、排序、combiner、join 与 distributed cache 的 MapReduce shuffle 技术。
- 检查 YARN application、container、日志、JAR 执行、node、scheduler、ResourceManager 和 NodeManager 行为。
- 创建和修改 Hive database 与 table,并加载、插入、更新、删除、导入和导出数据。
- 编写 HiveQL filter、group 与 aggregation、join 与 union、排序与分发、function 和 window query。
- 检查 Hive query plan、storage format、partition、bucket、schema、I/O、compression、serialization、integration 与 security。
本课程适合谁
本课程适合希望在存储、处理、资源管理和类 SQL 分析方面获得大量引导练习的 Hadoop 学习者。它既能帮助初学者拓展知识面,也适合已经理解概念、希望针对 HDFS、MapReduce、YARN 或 Hive 查漏补缺的人。
前置要求: 你应能使用 Linux 终端,理解文件与权限以及基本数据处理概念。尽管课程整体标为 Beginner,在学习 MapReduce、YARN 和高级 Hive 实验前仍强烈建议掌握 Hadoop 与 SQL 入门知识。
学习环境: 77 个实验均在课程提供的 Hadoop 环境中运行,并包含详细指导和解决方案。工作主要通过命令行和查询完成;课程未将外部云集群或个人服务账号列为要求。
常见问题
必须按顺序完成全部 77 个实验吗?
不必。课程被配置为非强制顺序的实践集合,而非必需的线性路径。新学习者适合先从 HDFS 设置与基础文件操作开始,再进入 MapReduce、YARN 和高级 Hive 主题。
它与 Hadoop 实践挑战有什么区别?
Hadoop 实践实验室包含覆盖四大领域的 77 个引导活动;Hadoop 实践挑战则小得多,仅有 12 个聚焦 HDFS 文件系统命令的挑战式任务。
课程包含 Spark 或 Pig 吗?
不包含。课程清单覆盖 HDFS、部分 MapReduce 模式、YARN 和 Hive/HiveQL,77 个实验主题中没有 Spark 或 Pig。
会部署和运维生产 Hadoop 集群吗?
不会。你将在配套学习环境中练习设置与组件操作;生产基础设施设计、多节点部署、容量规划、监控和服务级运维并不是这套课程已明确的学习成果。


