курс в Hadoop Skill Tree

Быстрый старт с Hadoop

В этом курсе вы научитесь устанавливать и развертывать Hadoop, а также использовать его для обработки и анализа больших данных. Мы также расскажем об экосистеме Hadoop, включая HDFS, YARN, Hive и HBase.

Наука о данныхLinux

💡 Этот учебник переведен с английского с помощью ИИ. Чтобы просмотреть оригинал, вы можете перейти на английский оригинал

Введение

Создайте работающую основу Hadoop, устанавливая и эксплуатируя основные компоненты в шести практических работах. Четыре управляемые работы охватывают pseudo-distributed deployment, HDFS, YARN и Hive, а два Intermediate-челленджа проверяют управление daemons и импорт данных Hive.

Это не только обзор команд: вы настроите services, запустите и остановите daemons, изучите logs и web interfaces, перенесёте данные и напишете небольшое YARN application. Так вы увидите, как компоненты совместно работают в учебной системе.

Чему вы научитесь

После завершения курса вы сможете:

  • Объяснять основную архитектуру Hadoop и готовить users, JDK и password-free SSH для установки.
  • Устанавливать Hadoop, настраивать pseudo-distributed deployment и проверять его через HDFS и встроенный Pi example.
  • Запускать, останавливать и исследовать Hadoop daemons и проверять состояние через logs и web interfaces.
  • Инициализировать HDFS и импортировать, экспортировать, читать, создавать, перемещать и удалять файлы и каталоги.
  • Обращаться к HDFS через command-line operations и WebHDFS interface.
  • Настраивать YARN, создавать простой client и ApplicationMaster и запускать application.
  • Устанавливать Hive, инициализировать metastore, настраивать environment и выполнять базовые table и query operations.
  • Загружать Hive data из локальных файлов и HDFS и создавать table data из query results.

Для кого этот курс

Курс предназначен для разработчиков, изучающих данные и системно ориентированных новичков, желающих выполнить первое развёртывание, а не только прочитать концепции. Он также полезен перед большими практическими коллекциями, поскольку связывает HDFS, YARN и Hive.

Предварительные требования: Нужна прочная Linux command-line основа: users, permissions, processes, configuration files и SSH. YARN lab явно требует базового Java, а Hive labs предполагают основы SQL.

Учебная среда: Шесть работ выполняются в предоставленных Ubuntu 22.04 desktop environments. Вы устанавливаете и настраиваете локальные Hadoop и Hive services, работаете главным образом в терминале и local web interfaces; внешний cloud cluster и личный service account не требуются.

Часто задаваемые вопросы

Это реальная установка Hadoop или simulation?

Это настоящая установка внутри учебной среды. Вы установите JDK и Hadoop, измените configuration files, запустите HDFS и YARN daemons, deploy Hive, изучите logs и выполните проверки.

Курс строит multi-node production cluster?

Нет. Deployment standalone и pseudo-distributed на учебной системе. Multi-node architecture, high availability, security hardening, monitoring и production operations не входят в шесть работ.

Какие компоненты Hadoop ecosystem включены?

Практическая программа охватывает Hadoop installation, HDFS, YARN и Hive. HBase, Spark и Pig не включены, и это не полный MapReduce programming course.

Чем курс отличается от практических лабораторных работ Hadoop?

Quick Start — компактный путь из шести работ с первой установкой и связанной настройкой компонентов. Hadoop Practice Labs — нелинейная библиотека из 77 управляемых упражнений для гораздо более широкой практики.

Преподаватель

labby
Labby
Labby is the LabEx teacher.