Réplication de données Hadoop

LinuxBeginner
Pratiquer maintenant

Introduction

Bienvenue dans l'univers de la réplication de données Hadoop ! Dans ce laboratoire, vous embarquerez pour un voyage palpitant à travers un portail temporel en tant que voyageur devant naviguer dans les subtilités de Hadoop HDFS et de sa fonctionnalité de réplication de données. Votre objectif est de garantir une réplication efficace des données afin d'améliorer la tolérance aux pannes et la disponibilité des données dans un environnement distribué, tout comme un administrateur Hadoop chevronné.

Comprendre la réplication de données Hadoop

Dans cette étape, vous allez explorer le concept de réplication de données dans Hadoop et comprendre comment il contribue à la haute disponibilité et à la fiabilité des données distribuées. Commençons par examiner les paramètres de configuration liés à la réplication des données dans HDFS.

  1. Ouvrez un terminal et passez à l'utilisateur hadoop :

    su - hadoop
    
  2. Ouvrez le fichier hdfs-site.xml à l'aide d'un éditeur de texte :

    vim /home/hadoop/hadoop/etc/hadoop/hdfs-site.xml
    

    Ou

    nano /home/hadoop/hadoop/etc/hadoop/hdfs-site.xml
    
  3. Localisez le paramètre définissant le facteur de réplication et réglez-le sur une valeur de 3 :

    <property>
        <name>dfs.replication</name>
        <value>3</value>
    </property>
    
  4. Enregistrez les modifications et quittez l'éditeur de texte.

  5. Vérifiez que le facteur de réplication a été correctement défini en consultant la configuration HDFS :

    hdfs getconf -confKey dfs.replication
    
  6. Pour appliquer les modifications, redémarrez le service HDFS :

    Arrêtez le service HDFS :

    /home/hadoop/hadoop/sbin/stop-dfs.sh
    

    Démarrez le service HDFS :

    /home/hadoop/hadoop/sbin/start-dfs.sh
    
  7. Assurez-vous que HDFS est prêt à accepter des écritures avant de passer à l'étape suivante :

    hdfs dfsadmin -safemode leave
    

    Si HDFS a déjà quitté le mode sans échec (safe mode), la commande indiquera que le mode sans échec est désactivé.

Tester la réplication de données

Dans cette étape, vous allez créer un fichier exemple dans HDFS et observer comment le processus de réplication fonctionne pour maintenir des copies redondantes des blocs de données afin d'assurer la tolérance aux pannes.

  1. Créez un nouveau fichier dans HDFS :

    echo "Hello, HDFS" | hdfs dfs -put - /user/hadoop/samplefile.txt
    
  2. Vérifiez le statut de réplication du fichier pour voir combien de répliques sont créées :

    hdfs fsck /user/hadoop/samplefile.txt -files -blocks -locations
    
  3. Visualisez le statut du fichier à partir de la sortie :

    ...
    Replicated Blocks:
    Total size:    12 B
    Total files:   1
    Total blocks (validated):      1 (avg. block size 12 B)
    Minimally replicated blocks:   1 (100.0 %)
    Over-replicated blocks:        0 (0.0 %)
    Under-replicated blocks:       1 (100.0 %)
    Mis-replicated blocks:         0 (0.0 %)
    Default replication factor:    3
    Average block replication:     1.0
    Missing blocks:                0
    Corrupt blocks:                0
    Missing replicas:              2 (66.666664 %)
    Blocks queued for replication: 0
    ...
    

Résumé

Dans ce laboratoire, nous avons approfondi le concept essentiel de la réplication de données Hadoop au sein de HDFS. En configurant le facteur de réplication et en observant le processus de réplication en action, vous avez acquis une compréhension plus approfondie de la manière dont Hadoop garantit la durabilité des données et la tolérance aux pannes dans un environnement distribué. L'exploration de ces aspects améliore non seulement vos compétences sur Hadoop, mais vous donne également les connaissances nécessaires pour maintenir une infrastructure de données robuste. Bonne exploration du monde de la réplication de données Hadoop !