课程 在 Hadoop 技能树

Hadoop 快速入门

在本课程中,你将学习如何安装和部署 Hadoop,以及如何使用 Hadoop 处理和分析大数据。我们还将介绍 Hadoop 的生态系统,包括 HDFS、YARN、Hive 和 HBase。

数据科学Linux

💡 本教程由 AI 辅助翻译自英文原版。如需查看原文,您可以 切换至英文原版

简介

通过 6 个动手实验安装并操作 Hadoop 核心组件,建立可运行的基础。4 个引导实验依次讲解伪分布式部署、HDFS、YARN 和 Hive,2 个 Intermediate 挑战则检验 Hadoop daemon 管理与 Hive 数据导入能力。

这不是只讲命令的概览:你将配置服务、启停 daemon、检查日志和 Web 界面、传输数据,并编写一个小型 YARN application,从而紧凑而具体地理解各组件如何在学习系统中协同工作。

你将学到什么

完成本课程后,你将能够:

  • 解释 Hadoop 核心架构,并为安装准备用户、JDK 和免密 SSH。
  • 安装 Hadoop、配置伪分布式部署,并使用 HDFS 与内置 Pi 示例进行验证。
  • 启动、停止和检查 Hadoop daemon,并用日志与 Web 界面确认状态。
  • 初始化 HDFS,并导入、导出、读取、创建、移动和删除文件与目录。
  • 通过命令行操作和 WebHDFS 界面访问 HDFS。
  • 配置 YARN,创建简单 client 与 ApplicationMaster,并启动 application。
  • 安装 Hive、初始化 metastore、配置环境,并执行基础 table 与 query 操作。
  • 从本地文件和 HDFS 加载 Hive 数据,并用查询结果创建表数据。

本课程适合谁

本课程适合希望亲手完成第一次部署、而不只停留在 Hadoop 概念层面的开发者、数据学习者和偏系统方向的初学者。它也适合作为大型 Hadoop 实践集合的前置课程,先理解 HDFS、YARN 与 Hive 如何共同配置和运行。

前置要求: 你应具备扎实的 Linux 命令行基础,包括用户、权限、进程、配置文件和 SSH。YARN 实验明确要求 Java 编程基础,Hive 实验则假定你了解基础 SQL。

学习环境: 6 个实验均在配套的 Ubuntu 22.04 桌面环境中运行。你将在课程本地安装并配置 Hadoop 与 Hive 服务,主要使用终端和本地 Web 界面;课程未要求外部云集群或个人服务账号。

常见问题

这是真实 Hadoop 安装还是模拟?

是在课程环境内进行的真实安装。你会安装 JDK 与 Hadoop、编辑配置文件、启动 HDFS 和 YARN daemon、部署 Hive、检查日志并运行验证任务。

课程会搭建多节点生产集群吗?

不会。课程在配套学习系统上进行 standalone 和 pseudo-distributed 部署;多节点架构、高可用、安全加固、监控与生产运维不在 6 个实验的范围内。

包含哪些 Hadoop 生态组件?

动手课程涵盖 Hadoop 安装、HDFS、YARN 和 Hive。课程清单不含 HBase、Spark 或 Pig,也不是完整的 MapReduce 编程课程。

它与 Hadoop 实践实验室有什么区别?

快速入门是一条包含初次安装与组件联动设置的紧凑 6 实验路径;Hadoop 实践实验室则是拥有 77 个引导实验的非线性资源库,适合掌握基础后进行更广泛的主题练习。

教师

labby
Labby
Labby is the LabEx teacher.