Schnellstart mit Hadoop

In diesem Kurs lernen Sie, wie Sie Hadoop installieren und bereitstellen sowie wie Sie Hadoop nutzen, um Big Data zu verarbeiten und zu analysieren. Wir werden auch das Hadoop-Ökosystem vorstellen, einschließlich HDFS, YARN, Hive und HBase.

DatenwissenschaftLinux

💡 Dieser Artikel wurde von AI-Assistenten übersetzt. Um die englische Version anzuzeigen, können Sie hier klicken

Einführung

Baue in sechs Hands-on-Labs eine funktionierende Hadoop-Grundlage auf, indem du zentrale Komponenten installierst und betreibst. Vier geführte Labs behandeln pseudo-verteiltes Deployment, HDFS, YARN und Hive; zwei Intermediate-Challenges prüfen Daemon-Verwaltung und Hive-Datenimport.

Dies ist keine reine Befehlsübersicht: Du konfigurierst Dienste, startest und stoppst Daemons, prüfst Logs und Weboberflächen, überträgst Daten und schreibst eine kleine YARN-Anwendung. So siehst du technisch und kompakt, wie die Komponenten zusammenarbeiten.

Was du lernen wirst

Nach Abschluss des Kurses kannst du:

  • Die Hadoop-Kernarchitektur erklären und Benutzer, JDK und passwortfreies SSH vorbereiten.
  • Hadoop installieren, pseudo-verteilt konfigurieren und mit HDFS sowie dem enthaltenen Pi-Beispiel prüfen.
  • Hadoop-Daemons starten, stoppen und untersuchen und ihren Zustand über Logs und Weboberflächen prüfen.
  • HDFS initialisieren und Dateien und Verzeichnisse importieren, exportieren, lesen, erstellen, verschieben und löschen.
  • Über Kommandozeilenoperationen und die WebHDFS-Schnittstelle auf HDFS zugreifen.
  • YARN konfigurieren und einen einfachen Client und ApplicationMaster vor dem Anwendungsstart erstellen.
  • Hive installieren, den Metastore initialisieren, die Umgebung konfigurieren und Tabellen- und Abfrageoperationen ausführen.
  • Hive-Daten aus lokalen Dateien und HDFS laden und Tabellendaten aus Abfrageergebnissen erzeugen.

Für wen dieser Kurs geeignet ist

Der Kurs richtet sich an Entwickler, Data-Lernende und systemorientierte Einsteiger, die ein erstes Deployment selbst durchführen möchten. Er eignet sich auch vor größeren Übungssammlungen, weil er zeigt, wie HDFS, YARN und Hive gemeinsam konfiguriert werden.

Voraussetzungen: Du brauchst solide Linux-Kommandozeilenkenntnisse zu Benutzern, Berechtigungen, Prozessen, Konfigurationsdateien und SSH. Das YARN-Lab verlangt ausdrücklich Java-Grundlagen, die Hive-Labs grundlegendes SQL.

Lernumgebung: Die sechs Labs laufen in bereitgestellten Ubuntu-22.04-Desktopumgebungen. Du installierst und konfigurierst lokale Hadoop- und Hive-Dienste und arbeitest vor allem im Terminal und mit lokalen Weboberflächen; externer Cloud-Cluster oder persönliches Konto sind nicht erforderlich.

Häufig gestellte Fragen

Ist dies eine echte Hadoop-Installation oder eine Simulation?

Es ist eine echte Installation innerhalb der Kursumgebung. Du installierst JDK und Hadoop, bearbeitest Konfigurationen, startest HDFS- und YARN-Daemons, stellst Hive bereit, prüfst Logs und führst Tests aus.

Wird ein produktiver Multi-Node-Cluster aufgebaut?

Nein. Das Deployment ist standalone und pseudo-verteilt auf dem Lernsystem. Multi-Node-Architektur, Hochverfügbarkeit, Hardening, Monitoring und Produktionsbetrieb liegen außerhalb der sechs Labs.

Welche Hadoop-Komponenten sind enthalten?

Der praktische Lehrplan umfasst Hadoop-Installation, HDFS, YARN und Hive. HBase, Spark und Pig sowie ein vollständiger MapReduce-Programmierkurs sind nicht enthalten.

Wie unterscheidet sich der Kurs von Hadoop Praxis-Labs?

Quick Start ist ein kompakter Pfad mit sechs Labs zu Erstinstallation und verbundener Einrichtung. Hadoop Practice Labs ist eine nicht lineare Bibliothek aus 77 geführten Übungen für wesentlich breitere Themenpraxis.

Lehrer

labby
Labby
Labby is the LabEx teacher.