Introducción
¡Bienvenido al mundo de la replicación de datos en Hadoop! En este laboratorio, te embarcarás en un emocionante viaje a través de un portal temporal como un viajero del tiempo que debe navegar por las complejidades de Hadoop HDFS y su función de replicación de datos. Tu objetivo es garantizar que los datos se repliquen de manera eficiente para mejorar la tolerancia a fallos y la disponibilidad de los datos en un entorno distribuido, tal como lo haría un administrador de Hadoop experto.
Comprender la replicación de datos en Hadoop
En este paso, te adentrarás en el concepto de replicación de datos en Hadoop y comprenderás cómo contribuye a la alta disponibilidad y fiabilidad de los datos distribuidos. Comencemos explorando los ajustes de configuración relacionados con la replicación de datos en HDFS.
Abre una terminal y cambia al usuario
hadoop:su - hadoopAbre el archivo
hdfs-site.xmlusando un editor de texto:vim /home/hadoop/hadoop/etc/hadoop/hdfs-site.xmlO
nano /home/hadoop/hadoop/etc/hadoop/hdfs-site.xmlLocaliza el parámetro que define el factor de replicación y asígnale un valor de
3:<property> <name>dfs.replication</name> <value>3</value> </property>Guarda los cambios y sal del editor de texto.
Verifica que el factor de replicación se haya configurado correctamente comprobando la configuración de HDFS:
hdfs getconf -confKey dfs.replicationPara aplicar los cambios, reinicia el servicio HDFS:
Detén el servicio HDFS:
/home/hadoop/hadoop/sbin/stop-dfs.shInicia el servicio HDFS:
/home/hadoop/hadoop/sbin/start-dfs.shAsegúrate de que HDFS esté listo para aceptar escrituras antes de pasar al siguiente paso:
hdfs dfsadmin -safemode leaveSi HDFS ya ha salido del modo seguro (safe mode), el comando informará que el modo seguro está desactivado.
Probar la replicación de datos
En este paso, crearás un archivo de muestra en HDFS y observarás cómo funciona el proceso de replicación de datos para mantener copias redundantes de los bloques de datos y así lograr la tolerancia a fallos.
Crea un nuevo archivo en HDFS:
echo "Hello, HDFS" | hdfs dfs -put - /user/hadoop/samplefile.txtComprueba el estado de replicación del archivo para ver cuántas réplicas se han creado:
hdfs fsck /user/hadoop/samplefile.txt -files -blocks -locationsObserva el estado del archivo basándote en la salida:
... Replicated Blocks: Total size: 12 B Total files: 1 Total blocks (validated): 1 (avg. block size 12 B) Minimally replicated blocks: 1 (100.0 %) Over-replicated blocks: 0 (0.0 %) Under-replicated blocks: 1 (100.0 %) Mis-replicated blocks: 0 (0.0 %) Default replication factor: 3 Average block replication: 1.0 Missing blocks: 0 Corrupt blocks: 0 Missing replicas: 2 (66.666664 %) Blocks queued for replication: 0 ...
Resumen
En este laboratorio, profundizamos en el concepto esencial de la replicación de datos de Hadoop dentro de HDFS. Al configurar el factor de replicación y observar el proceso en acción, obtuviste una comprensión más profunda de cómo Hadoop garantiza la durabilidad de los datos y la tolerancia a fallos en un entorno distribuido. Explorar estos aspectos no solo mejora tus habilidades en Hadoop, sino que también te proporciona el conocimiento necesario para mantener una infraestructura de datos robusta utilizando Hadoop. ¡Disfruta explorando el mundo de la replicación de datos en Hadoop!



