Démarrage rapide avec Hadoop

Dans ce cours, vous apprendrez à installer et déployer Hadoop, ainsi qu'à utiliser Hadoop pour traiter et analyser les données massives. Nous présenterons également l'écosystème de Hadoop, y compris HDFS, YARN, Hive et HBase.

Science des donnéesLinux

💡 Ce tutoriel est traduit par l'IA à partir de la version anglaise. Pour voir la version originale, vous pouvez cliquer ici

Introduction

Construisez une base Hadoop fonctionnelle en installant et exploitant ses principaux composants au fil de six laboratoires. Quatre laboratoires guidés couvrent déploiement pseudo-distribué, HDFS, YARN et Hive ; deux défis Intermediate vérifient la gestion des daemons et l'importation de données Hive.

Ce n'est pas une simple présentation de commandes : vous configurerez des services, démarrerez et arrêterez des daemons, consulterez logs et interfaces web, transférerez des données et écrirez une petite application YARN. Vous verrez concrètement comment les composants s'articulent.

Ce que vous apprendrez

À la fin de ce cours, vous saurez :

  • Expliquer l'architecture Hadoop et préparer utilisateurs, JDK et SSH sans mot de passe.
  • Installer Hadoop, configurer un déploiement pseudo-distribué et le vérifier avec HDFS et l'exemple Pi fourni.
  • Démarrer, arrêter et inspecter les daemons et vérifier leur état via logs et interfaces web.
  • Initialiser HDFS et importer, exporter, lire, créer, déplacer et supprimer fichiers et répertoires.
  • Accéder à HDFS par commandes et via l'interface WebHDFS.
  • Configurer YARN et créer un client et un ApplicationMaster simples avant de lancer une application.
  • Installer Hive, initialiser son metastore, configurer l'environnement et effectuer des opérations de tables et requêtes.
  • Charger des données Hive depuis des fichiers locaux ou HDFS et créer des données de table depuis des résultats de requête.

À qui s’adresse ce cours

Ce cours s'adresse aux développeurs, apprenants data et débutants orientés systèmes qui veulent réaliser un premier déploiement plutôt que seulement étudier des concepts. Il prépare aussi aux collections plus vastes en montrant comment HDFS, YARN et Hive sont configurés ensemble.

Prérequis : Vous devez posséder de solides bases Linux : utilisateurs, permissions, processus, fichiers de configuration et SSH. Le laboratoire YARN exige explicitement des bases Java et les laboratoires Hive supposent des bases SQL.

Environnement d’apprentissage : Les six laboratoires utilisent des bureaux Ubuntu 22.04 fournis. Vous installez et configurez localement Hadoop et Hive, principalement dans le terminal et via des interfaces web locales ; aucun cluster cloud externe ni compte personnel n'est requis.

Questions fréquentes

S'agit-il d'une véritable installation Hadoop ou d'une simulation ?

Il s'agit d'une installation réelle dans l'environnement du cours. Vous installez JDK et Hadoop, modifiez les configurations, démarrez HDFS et YARN, déployez Hive, consultez les logs et lancez des vérifications.

Le cours construit-il un cluster de production multinœud ?

Non. Le déploiement est standalone et pseudo-distribué sur le système pédagogique. Multinœud, haute disponibilité, hardening, monitoring et exploitation de production sortent du périmètre des six laboratoires.

Quels composants de l'écosystème sont inclus ?

Le programme pratique couvre installation Hadoop, HDFS, YARN et Hive. Il n'inclut ni HBase, Spark ou Pig, ni un cursus complet de programmation MapReduce.

Quelle est la différence avec les Laboratoires pratiques Hadoop ?

Quick Start est un parcours compact de six laboratoires incluant installation et configuration coordonnée. Hadoop Practice Labs est une bibliothèque non linéaire de 77 exercices guidés pour une pratique thématique bien plus large.

Enseignant

labby
Labby
Labby is the LabEx teacher.