Construye una base funcional de Hadoop instalando y operando sus componentes principales en seis laboratorios. Cuatro laboratorios guiados cubren despliegue pseudodistribuido, HDFS, YARN y Hive; dos desafíos Intermediate comprueban la gestión de daemons y la importación de datos en Hive.
No es una visión solo de comandos: configurarás servicios, iniciarás y detendrás daemons, revisarás logs e interfaces web, moverás datos y escribirás una pequeña aplicación YARN. Así entenderás de forma compacta y técnica cómo encajan los componentes.
Lo que aprenderás
Al completar el curso, aprenderás a:
- Explicar la arquitectura principal de Hadoop y preparar usuarios, JDK y SSH sin contraseña.
- Instalar Hadoop, configurar un despliegue pseudodistribuido y verificarlo con HDFS y el ejemplo Pi incluido.
- Iniciar, detener e inspeccionar daemons y comprobar su estado con logs e interfaces web.
- Inicializar HDFS e importar, exportar, leer, crear, mover y eliminar archivos y directorios.
- Acceder a HDFS mediante comandos y la interfaz WebHDFS.
- Configurar YARN y crear un client y un ApplicationMaster sencillos antes de lanzar una aplicación.
- Instalar Hive, inicializar su metastore, configurar el entorno y realizar operaciones básicas de tablas y consultas.
- Cargar datos de Hive desde archivos locales y HDFS y crear datos de tabla a partir de resultados de consultas.
A quién va dirigido este curso
Está dirigido a desarrolladores, estudiantes de datos y principiantes orientados a sistemas que quieren realizar un primer despliegue, no solo estudiar conceptos. También prepara para colecciones mayores al mostrar cómo se configuran y operan juntos HDFS, YARN y Hive.
Requisitos previos: Necesitas una base sólida de Linux: usuarios, permisos, procesos, archivos de configuración y SSH. El laboratorio YARN exige explícitamente Java básico y los de Hive asumen conocimientos básicos de SQL.
Entorno de aprendizaje: Los seis laboratorios usan escritorios Ubuntu 22.04 proporcionados. Instalarás y configurarás servicios Hadoop y Hive locales, principalmente en el terminal y con interfaces web locales; no se exige clúster cloud externo ni cuenta personal.
Preguntas frecuentes
¿Es una instalación real de Hadoop o una simulación?
Es una instalación real dentro del entorno del curso. Instalarás JDK y Hadoop, editarás configuraciones, iniciarás daemons HDFS y YARN, desplegarás Hive, revisarás logs y ejecutarás verificaciones.
¿Construye un clúster de producción multinodo?
No. El despliegue es standalone y pseudodistribuido en el sistema de aprendizaje. Arquitectura multinodo, alta disponibilidad, hardening, monitorización y operación de producción quedan fuera de los seis laboratorios.
¿Qué componentes del ecosistema incluye?
El currículo cubre instalación de Hadoop, HDFS, YARN y Hive. No incluye HBase, Spark ni Pig, y tampoco es un curso completo de programación MapReduce.
¿En qué se diferencia de Laboratorios Prácticos de Hadoop?
Quick Start es una ruta compacta de seis laboratorios con instalación inicial y configuración conectada. Hadoop Practice Labs es una biblioteca no lineal de 77 ejercicios guiados para una práctica temática mucho más amplia.




