Guía Rápida de Hadoop

En este curso, aprenderá cómo instalar y desplegar Hadoop, y cómo utilizar Hadoop para procesar y analizar grandes volúmenes de datos. También se presentará el ecosistema de Hadoop, incluyendo HDFS, YARN, Hive y HBase.

Ciencia de datosLinux

💡 Este tutorial está traducido por IA desde la versión en inglés. Para ver la versión original, puedes hacer clic aquí

Introducción

Construye una base funcional de Hadoop instalando y operando sus componentes principales en seis laboratorios. Cuatro laboratorios guiados cubren despliegue pseudodistribuido, HDFS, YARN y Hive; dos desafíos Intermediate comprueban la gestión de daemons y la importación de datos en Hive.

No es una visión solo de comandos: configurarás servicios, iniciarás y detendrás daemons, revisarás logs e interfaces web, moverás datos y escribirás una pequeña aplicación YARN. Así entenderás de forma compacta y técnica cómo encajan los componentes.

Lo que aprenderás

Al completar el curso, aprenderás a:

  • Explicar la arquitectura principal de Hadoop y preparar usuarios, JDK y SSH sin contraseña.
  • Instalar Hadoop, configurar un despliegue pseudodistribuido y verificarlo con HDFS y el ejemplo Pi incluido.
  • Iniciar, detener e inspeccionar daemons y comprobar su estado con logs e interfaces web.
  • Inicializar HDFS e importar, exportar, leer, crear, mover y eliminar archivos y directorios.
  • Acceder a HDFS mediante comandos y la interfaz WebHDFS.
  • Configurar YARN y crear un client y un ApplicationMaster sencillos antes de lanzar una aplicación.
  • Instalar Hive, inicializar su metastore, configurar el entorno y realizar operaciones básicas de tablas y consultas.
  • Cargar datos de Hive desde archivos locales y HDFS y crear datos de tabla a partir de resultados de consultas.

A quién va dirigido este curso

Está dirigido a desarrolladores, estudiantes de datos y principiantes orientados a sistemas que quieren realizar un primer despliegue, no solo estudiar conceptos. También prepara para colecciones mayores al mostrar cómo se configuran y operan juntos HDFS, YARN y Hive.

Requisitos previos: Necesitas una base sólida de Linux: usuarios, permisos, procesos, archivos de configuración y SSH. El laboratorio YARN exige explícitamente Java básico y los de Hive asumen conocimientos básicos de SQL.

Entorno de aprendizaje: Los seis laboratorios usan escritorios Ubuntu 22.04 proporcionados. Instalarás y configurarás servicios Hadoop y Hive locales, principalmente en el terminal y con interfaces web locales; no se exige clúster cloud externo ni cuenta personal.

Preguntas frecuentes

¿Es una instalación real de Hadoop o una simulación?

Es una instalación real dentro del entorno del curso. Instalarás JDK y Hadoop, editarás configuraciones, iniciarás daemons HDFS y YARN, desplegarás Hive, revisarás logs y ejecutarás verificaciones.

¿Construye un clúster de producción multinodo?

No. El despliegue es standalone y pseudodistribuido en el sistema de aprendizaje. Arquitectura multinodo, alta disponibilidad, hardening, monitorización y operación de producción quedan fuera de los seis laboratorios.

¿Qué componentes del ecosistema incluye?

El currículo cubre instalación de Hadoop, HDFS, YARN y Hive. No incluye HBase, Spark ni Pig, y tampoco es un curso completo de programación MapReduce.

¿En qué se diferencia de Laboratorios Prácticos de Hadoop?

Quick Start es una ruta compacta de seis laboratorios con instalación inicial y configuración conectada. Hadoop Practice Labs es una biblioteca no lineal de 77 ejercicios guiados para una práctica temática mucho más amplia.

Profesor

labby
Labby
Labby is the LabEx teacher.