课程 在 Hadoop 技能树

Hadoop 实践实验室

本课程包含大量 Hadoop 实验,每个实验都是一个小的 Hadoop 项目,配有详细的指导和解决方案。通过完成这些实验,你可以练习 Hadoop 技能,提高编程能力,并学习如何编写简洁高效的代码。

数据科学Linux

💡 本教程由 AI 辅助翻译自英文原版。如需查看原文,您可以 切换至英文原版

大纲

Hadoop HDFS 设置

Hadoop FS Shell cat

Hadoop FS Shell ls

Hadoop FS Shell mkdir

Hadoop FS Shell 测试

Hadoop FS Shell appendToFile

Hadoop FS Shell cp

Hadoop FS Shell copyToLocal/put

Hadoop FS Shell copyFromLocal/get

Hadoop FS Shell rm

Hadoop FS Shell mv 命令

量子数据分组冒险

Hadoop FS Shell chmod

Hadoop FS Shell chown

Hadoop FS Shell find 命令

Hadoop FS Shell du 命令

Hadoop FS Shell tail

Hadoop FS Shell stat

Hadoop FS Shell expunge

Hadoop 数据副本

Hadoop 数据块管理

Hadoop DataNode 和 NameNode 管理

Hadoop 快照管理

Hadoop 存储策略管理

Hadoop 配额管理

Hadoop 奥运会分区

神秘的 Hadoop 排序奥秘

Hadoop Shuffle Combiner

使用 Hadoop 进行恐龙数据融合

分布式缓存的古老智慧

Hadoop YARN 基础设置

Hadoop 调度器应用

Hadoop YARN 命令应用

Hadoop YARN 容器命令

使用 YARN 日志进行航天器操作

Datopia 与 Hadoop Yarn

资源防御指挥中心

忍者资源管理精通

耳语森林 Node Manager 任务

宇宙 Hive 集成之旅

Hive 竞技场中的数据掌控

Hadoop Hive 数据探索

Hadoop 中的神秘表创建

使用 Hadoop 探索火星数据

使用 Hadoop 进行反抗军数据重构

反乌托邦数据破坏任务

天界数据掌控

历史数据和谐探索

沙漠数据探索之旅

Hadoop 仙境中的 Updatium 蘑菇采集之旅

星际数据流优化

时空扭曲 Hive 精通

使用 Hadoop 揭开探险家的命运之谜

使用 LIMIT 进行反抗军数据渗透

用 Hadoop 魔法探索废墟数据

Hadoop 维度精通指南

沙漠之龙数据集成

统一数据探索:Hadoop 集成

使用 Hadoop 优化太空资源分配

使用 Hadoop 进行宝石分析

Hadoop 数值和谐探索

天文学家的 Hadoop 日期操作精通指南

Hadoop 星际通信探索

宇宙赛车数据优化

星际数据分析之旅

使用 Hadoop 探索古代宝藏

僧侣的数据探索

使用 Hadoop UDF 探索 VR 宇宙

掌握 Hadoop 查询计划

深渊中的 Hadoop 存储精通

优化银河太空港运营

皇家数据魔法模式

Xara 的数据魔法

幽灵数据转换之旅

使用 Hadoop 进行宝石数据压缩

魔法序列化精通

海盗 Hive 安全任务

简介

通过 77 个带指导的情境实验,建立对 Hadoop 生态系统的实操认识。课程从日常 HDFS 操作和存储控制开始,逐步进入 MapReduce 数据流技术、YARN 资源管理,以及覆盖面较广的 Hive 与 HiveQL 任务。

这是一套广泛的实践资源库,而不是单一线性项目。课程清单不要求固定顺序,你可以从基础一路学习到高级数据任务,也可以选择最需要加强的主题实验。

你将学到什么

完成本课程后,你将能够:

  • 设置并探索课程提供的 HDFS、YARN 和 Hive 环境,开展动手练习。
  • 使用文件系统 shell 读取、查找、传输、删除、检查 HDFS 数据并管理权限。
  • 管理 HDFS 副本、block、DataNode、snapshot、storage policy、quota 和已删除文件清理。
  • 应用涉及 partitioner、排序、combiner、join 与 distributed cache 的 MapReduce shuffle 技术。
  • 检查 YARN application、container、日志、JAR 执行、node、scheduler、ResourceManager 和 NodeManager 行为。
  • 创建和修改 Hive database 与 table,并加载、插入、更新、删除、导入和导出数据。
  • 编写 HiveQL filter、group 与 aggregation、join 与 union、排序与分发、function 和 window query。
  • 检查 Hive query plan、storage format、partition、bucket、schema、I/O、compression、serialization、integration 与 security。

本课程适合谁

本课程适合希望在存储、处理、资源管理和类 SQL 分析方面获得大量引导练习的 Hadoop 学习者。它既能帮助初学者拓展知识面,也适合已经理解概念、希望针对 HDFS、MapReduce、YARN 或 Hive 查漏补缺的人。

前置要求: 你应能使用 Linux 终端,理解文件与权限以及基本数据处理概念。尽管课程整体标为 Beginner,在学习 MapReduce、YARN 和高级 Hive 实验前仍强烈建议掌握 Hadoop 与 SQL 入门知识。

学习环境: 77 个实验均在课程提供的 Hadoop 环境中运行,并包含详细指导和解决方案。工作主要通过命令行和查询完成;课程未将外部云集群或个人服务账号列为要求。

常见问题

必须按顺序完成全部 77 个实验吗?

不必。课程被配置为非强制顺序的实践集合,而非必需的线性路径。新学习者适合先从 HDFS 设置与基础文件操作开始,再进入 MapReduce、YARN 和高级 Hive 主题。

它与 Hadoop 实践挑战有什么区别?

Hadoop 实践实验室包含覆盖四大领域的 77 个引导活动;Hadoop 实践挑战则小得多,仅有 12 个聚焦 HDFS 文件系统命令的挑战式任务。

课程包含 Spark 或 Pig 吗?

不包含。课程清单覆盖 HDFS、部分 MapReduce 模式、YARN 和 Hive/HiveQL,77 个实验主题中没有 Spark 或 Pig。

会部署和运维生产 Hadoop 集群吗?

不会。你将在配套学习环境中练习设置与组件操作;生产基础设施设计、多节点部署、容量规划、监控和服务级运维并不是这套课程已明确的学习成果。

教师

labby
Labby
Labby is the LabEx teacher.