Создайте работающую основу Hadoop, устанавливая и эксплуатируя основные компоненты в шести практических работах. Четыре управляемые работы охватывают pseudo-distributed deployment, HDFS, YARN и Hive, а два Intermediate-челленджа проверяют управление daemons и импорт данных Hive.
Это не только обзор команд: вы настроите services, запустите и остановите daemons, изучите logs и web interfaces, перенесёте данные и напишете небольшое YARN application. Так вы увидите, как компоненты совместно работают в учебной системе.
Чему вы научитесь
После завершения курса вы сможете:
- Объяснять основную архитектуру Hadoop и готовить users, JDK и password-free SSH для установки.
- Устанавливать Hadoop, настраивать pseudo-distributed deployment и проверять его через HDFS и встроенный Pi example.
- Запускать, останавливать и исследовать Hadoop daemons и проверять состояние через logs и web interfaces.
- Инициализировать HDFS и импортировать, экспортировать, читать, создавать, перемещать и удалять файлы и каталоги.
- Обращаться к HDFS через command-line operations и WebHDFS interface.
- Настраивать YARN, создавать простой client и ApplicationMaster и запускать application.
- Устанавливать Hive, инициализировать metastore, настраивать environment и выполнять базовые table и query operations.
- Загружать Hive data из локальных файлов и HDFS и создавать table data из query results.
Для кого этот курс
Курс предназначен для разработчиков, изучающих данные и системно ориентированных новичков, желающих выполнить первое развёртывание, а не только прочитать концепции. Он также полезен перед большими практическими коллекциями, поскольку связывает HDFS, YARN и Hive.
Предварительные требования: Нужна прочная Linux command-line основа: users, permissions, processes, configuration files и SSH. YARN lab явно требует базового Java, а Hive labs предполагают основы SQL.
Учебная среда: Шесть работ выполняются в предоставленных Ubuntu 22.04 desktop environments. Вы устанавливаете и настраиваете локальные Hadoop и Hive services, работаете главным образом в терминале и local web interfaces; внешний cloud cluster и личный service account не требуются.
Часто задаваемые вопросы
Это реальная установка Hadoop или simulation?
Это настоящая установка внутри учебной среды. Вы установите JDK и Hadoop, измените configuration files, запустите HDFS и YARN daemons, deploy Hive, изучите logs и выполните проверки.
Курс строит multi-node production cluster?
Нет. Deployment standalone и pseudo-distributed на учебной системе. Multi-node architecture, high availability, security hardening, monitoring и production operations не входят в шесть работ.
Какие компоненты Hadoop ecosystem включены?
Практическая программа охватывает Hadoop installation, HDFS, YARN и Hive. HBase, Spark и Pig не включены, и это не полный MapReduce programming course.
Чем курс отличается от практических лабораторных работ Hadoop?
Quick Start — компактный путь из шести работ с первой установкой и связанной настройкой компонентов. Hadoop Practice Labs — нелинейная библиотека из 77 управляемых упражнений для гораздо более широкой практики.




