Início Rápido com Hadoop

Neste curso, você aprenderá como instalar e implantar o Hadoop, e como usar o Hadoop para processar e analisar big data. Também apresentaremos o ecossistema do Hadoop, incluindo HDFS, YARN, Hive e HBase.

Ciência de DadosLinux

💡 Este tutorial foi traduzido do inglês com assistência de IA. Para ver o original, você pode mudar para a versão em inglês

Introdução

Construa uma base funcional de Hadoop instalando e operando seus componentes principais em seis laboratórios. Quatro laboratórios guiados abordam implantação pseudodistribuída, HDFS, YARN e Hive; dois desafios Intermediate verificam gestão de daemons e importação de dados no Hive.

Não é apenas uma visão de comandos: você configurará serviços, iniciará e parará daemons, examinará logs e interfaces web, moverá dados e escreverá uma pequena aplicação YARN. Assim, verá concretamente como os componentes trabalham juntos.

O que você aprenderá

Ao concluir o curso, você saberá:

  • Explicar a arquitetura central do Hadoop e preparar usuários, JDK e SSH sem senha.
  • Instalar Hadoop, configurar implantação pseudodistribuída e verificá-la com HDFS e o exemplo Pi incluído.
  • Iniciar, parar e inspecionar daemons e verificar seu estado por logs e interfaces web.
  • Inicializar HDFS e importar, exportar, ler, criar, mover e remover arquivos e diretórios.
  • Acessar HDFS por operações de linha de comando e pela interface WebHDFS.
  • Configurar YARN e criar um client e ApplicationMaster simples antes de iniciar uma aplicação.
  • Instalar Hive, inicializar seu metastore, configurar o ambiente e executar operações básicas de tabelas e consultas.
  • Carregar dados Hive de arquivos locais e HDFS e criar dados de tabela a partir de resultados de consultas.

Para quem é este curso

O curso é para desenvolvedores, estudantes de dados e iniciantes orientados a sistemas que desejam fazer uma primeira implantação, não apenas ler conceitos. Também prepara para coleções maiores ao mostrar como HDFS, YARN e Hive são configurados em conjunto.

Pré-requisitos: Você precisa de uma base sólida de Linux: usuários, permissões, processos, arquivos de configuração e SSH. O laboratório YARN exige explicitamente Java básico, e os de Hive pressupõem SQL básico.

Ambiente de aprendizagem: Os seis laboratórios usam desktops Ubuntu 22.04 fornecidos. Você instala e configura serviços Hadoop e Hive locais, principalmente no terminal e em interfaces web locais; não é necessário cluster cloud externo nem conta pessoal.

Perguntas frequentes

É uma instalação real do Hadoop ou uma simulação?

É uma instalação real dentro do ambiente do curso. Você instala JDK e Hadoop, edita configurações, inicia daemons HDFS e YARN, implanta Hive, examina logs e executa verificações.

O curso constrói um cluster de produção multinode?

Não. A implantação é standalone e pseudodistribuída no sistema de aprendizagem. Arquitetura multinode, alta disponibilidade, hardening, monitoramento e operação de produção estão fora dos seis laboratórios.

Quais componentes do ecossistema estão incluídos?

O currículo prático cobre instalação Hadoop, HDFS, YARN e Hive. Não inclui HBase, Spark ou Pig e também não é um curso completo de programação MapReduce.

Como difere de Laboratórios Práticos de Hadoop?

Quick Start é um caminho compacto de seis laboratórios com instalação inicial e configuração conectada. Hadoop Practice Labs é uma biblioteca não linear de 77 exercícios guiados para prática temática muito mais ampla.

Professor

labby
Labby
Labby is the LabEx teacher.