通过 6 个动手实验安装并操作 Hadoop 核心组件,建立可运行的基础。4 个引导实验依次讲解伪分布式部署、HDFS、YARN 和 Hive,2 个 Intermediate 挑战则检验 Hadoop daemon 管理与 Hive 数据导入能力。
这不是只讲命令的概览:你将配置服务、启停 daemon、检查日志和 Web 界面、传输数据,并编写一个小型 YARN application,从而紧凑而具体地理解各组件如何在学习系统中协同工作。
你将学到什么
完成本课程后,你将能够:
- 解释 Hadoop 核心架构,并为安装准备用户、JDK 和免密 SSH。
- 安装 Hadoop、配置伪分布式部署,并使用 HDFS 与内置 Pi 示例进行验证。
- 启动、停止和检查 Hadoop daemon,并用日志与 Web 界面确认状态。
- 初始化 HDFS,并导入、导出、读取、创建、移动和删除文件与目录。
- 通过命令行操作和 WebHDFS 界面访问 HDFS。
- 配置 YARN,创建简单 client 与 ApplicationMaster,并启动 application。
- 安装 Hive、初始化 metastore、配置环境,并执行基础 table 与 query 操作。
- 从本地文件和 HDFS 加载 Hive 数据,并用查询结果创建表数据。
本课程适合谁
本课程适合希望亲手完成第一次部署、而不只停留在 Hadoop 概念层面的开发者、数据学习者和偏系统方向的初学者。它也适合作为大型 Hadoop 实践集合的前置课程,先理解 HDFS、YARN 与 Hive 如何共同配置和运行。
前置要求: 你应具备扎实的 Linux 命令行基础,包括用户、权限、进程、配置文件和 SSH。YARN 实验明确要求 Java 编程基础,Hive 实验则假定你了解基础 SQL。
学习环境: 6 个实验均在配套的 Ubuntu 22.04 桌面环境中运行。你将在课程本地安装并配置 Hadoop 与 Hive 服务,主要使用终端和本地 Web 界面;课程未要求外部云集群或个人服务账号。
常见问题
这是真实 Hadoop 安装还是模拟?
是在课程环境内进行的真实安装。你会安装 JDK 与 Hadoop、编辑配置文件、启动 HDFS 和 YARN daemon、部署 Hive、检查日志并运行验证任务。
课程会搭建多节点生产集群吗?
不会。课程在配套学习系统上进行 standalone 和 pseudo-distributed 部署;多节点架构、高可用、安全加固、监控与生产运维不在 6 个实验的范围内。
包含哪些 Hadoop 生态组件?
动手课程涵盖 Hadoop 安装、HDFS、YARN 和 Hive。课程清单不含 HBase、Spark 或 Pig,也不是完整的 MapReduce 编程课程。
它与 Hadoop 实践实验室有什么区别?
快速入门是一条包含初次安装与组件联动设置的紧凑 6 实验路径;Hadoop 实践实验室则是拥有 77 个引导实验的非线性资源库,适合掌握基础后进行更广泛的主题练习。




