Replicação de Dados no Hadoop

LinuxBeginner
Pratique Agora

Introdução

Bem-vindo ao mundo da Replicação de Dados no Hadoop! Neste laboratório, você embarcará em uma jornada emocionante através de um portal de viagem no tempo como um viajante que precisa navegar pelas complexidades do HDFS do Hadoop e seu recurso de Replicação de Dados. Seu objetivo é garantir que os dados sejam replicados de forma eficiente para aumentar a tolerância a falhas e a disponibilidade de dados em um ambiente distribuído, assim como um administrador Hadoop experiente.

Entendendo a Replicação de Dados no Hadoop

Nesta etapa, você mergulhará no conceito de replicação de dados no Hadoop e entenderá como ele contribui para a alta disponibilidade e confiabilidade dos dados distribuídos. Vamos começar explorando as configurações relacionadas à replicação de dados no HDFS.

  1. Abra um terminal e alterne para o usuário hadoop:

    su - hadoop
    
  2. Abra o arquivo hdfs-site.xml usando um editor de texto:

    vim /home/hadoop/hadoop/etc/hadoop/hdfs-site.xml
    

    Ou

    nano /home/hadoop/hadoop/etc/hadoop/hdfs-site.xml
    
  3. Localize o parâmetro que define o fator de replicação e defina-o com o valor 3:

    <property>
        <name>dfs.replication</name>
        <value>3</value>
    </property>
    
  4. Salve as alterações e saia do editor de texto.

  5. Verifique se o fator de replicação foi definido corretamente consultando a configuração do HDFS:

    hdfs getconf -confKey dfs.replication
    
  6. Para aplicar as alterações, reinicie o serviço HDFS:

    Pare o serviço HDFS:

    /home/hadoop/hadoop/sbin/stop-dfs.sh
    

    Inicie o serviço HDFS:

    /home/hadoop/hadoop/sbin/start-dfs.sh
    
  7. Certifique-se de que o HDFS esteja pronto para aceitar gravações antes de prosseguir para a próxima etapa:

    hdfs dfsadmin -safemode leave
    

    Se o HDFS já tiver saído do modo de segurança (safe mode), o comando informará que o modo de segurança está desativado.

Testando a Replicação de Dados

Nesta etapa, você criará um arquivo de exemplo no HDFS e observará como o processo de replicação de dados funciona para manter cópias redundantes dos blocos de dados, visando alcançar a tolerância a falhas.

  1. Crie um novo arquivo no HDFS:

    echo "Hello, HDFS" | hdfs dfs -put - /user/hadoop/samplefile.txt
    
  2. Verifique o status de replicação do arquivo para ver quantas réplicas foram criadas:

    hdfs fsck /user/hadoop/samplefile.txt -files -blocks -locations
    
  3. Visualize o status do arquivo com base na saída:

    ...
    Replicated Blocks:
    Total size:    12 B
    Total files:   1
    Total blocks (validated):      1 (avg. block size 12 B)
    Minimally replicated blocks:   1 (100.0 %)
    Over-replicated blocks:        0 (0.0 %)
    Under-replicated blocks:       1 (100.0 %)
    Mis-replicated blocks:         0 (0.0 %)
    Default replication factor:    3
    Average block replication:     1.0
    Missing blocks:                0
    Corrupt blocks:                0
    Missing replicas:              2 (66.666664 %)
    Blocks queued for replication: 0
    ...
    

Resumo

Neste laboratório, aprofundamo-nos no conceito essencial de Replicação de Dados no Hadoop dentro do HDFS. Ao configurar o fator de replicação e observar o processo de replicação em ação, você obteve uma compreensão mais profunda de como o Hadoop garante a durabilidade dos dados e a tolerância a falhas em um ambiente distribuído. Explorar esses aspectos não apenas aprimora suas habilidades no Hadoop, mas também o equipa com o conhecimento necessário para manter uma infraestrutura de dados robusta usando o Hadoop. Boa exploração no mundo da Replicação de Dados no Hadoop!