6 つのハンズオンラボで主要コンポーネントをインストール・操作し、動作する Hadoop の基礎を作ります。4 つのガイド付きラボで pseudo-distributed deployment、HDFS、YARN、Hive を扱い、2 つの Intermediate チャレンジで daemon 管理と Hive data import を確認します。
単なるコマンド概説ではありません。service を設定し、daemon を起動・停止し、log と Web UI を確認し、データを移動し、小さな YARN application を書くことで、各コンポーネントの連携を具体的に理解します。
学習内容
このコースを修了すると、次のことができるようになります。
- Hadoop の基本 architecture を説明し、user、JDK、password-free SSH を準備する。
- Hadoop をインストールして pseudo-distributed 構成にし、HDFS と付属の Pi example で確認する。
- Hadoop daemon を起動、停止、調査し、log と Web UI で状態を確認する。
- HDFS を初期化し、ファイルとディレクトリを import、export、read、create、move、remove する。
- コマンド操作と WebHDFS interface から HDFS へアクセスする。
- YARN を設定し、単純な client と ApplicationMaster を作って application を起動する。
- Hive をインストールし、metastore を初期化して環境を設定し、基本的な table と query 操作を行う。
- ローカルファイルと HDFS から Hive データを load し、query result から table data を作る。
このコースの対象者
概念を読むだけでなく最初の Hadoop deployment を実施したい開発者、データ学習者、システム志向の初心者向けです。HDFS、YARN、Hive の連携設定を理解できるため、大規模な Hadoop 練習集の前にも適しています。
前提知識: user、permission、process、configuration file、SSH を含む十分な Linux command-line 基礎が必要です。YARN ラボは Java 基礎を明示的に要求し、Hive ラボは SQL 基礎を前提とします。
学習環境: 6 つのラボは提供される Ubuntu 22.04 desktop で実行します。course-local の Hadoop と Hive service をインストール・設定し、主にターミナルとローカル Web UI を使います。外部 cloud cluster や個人 service account は不要です。
よくある質問
実際の Hadoop インストールですか、それとも simulation ですか?
コース環境内での実際のインストールです。JDK と Hadoop を導入し、設定ファイルを編集し、HDFS と YARN daemon を起動し、Hive を deploy し、log と検証タスクを確認します。
multi-node の production cluster を構築しますか?
いいえ。提供された学習システム上の standalone と pseudo-distributed deployment です。multi-node architecture、高可用性、security hardening、monitoring、本番運用は 6 ラボの範囲外です。
どの Hadoop ecosystem component が含まれますか?
Hadoop installation、HDFS、YARN、Hive を実践します。HBase、Spark、Pig は含まず、完全な MapReduce programming course でもありません。
Hadoop 実践ラボとの違いは何ですか?
Quick Start は初回 installation と連携設定を含む 6 ラボの短い経路です。Hadoop Practice Labs は基礎後の幅広いテーマ練習を行う 77 の非線形ガイド付き exercise library です。




