Vertiefe fortgeschrittene Datenkenntnisse in 21 eigenständigen Challenges: 15 mit Pandas und sechs mit Erweiterung zu scikit-learn. Anhand von Anforderungen und Beispielen implementierst du Bereinigung, Auswahl, Transformation, Aggregation, Zeitreihen, Datei-IO, DataFrame-Kombination, Visualisierung und Machine-Learning-Workflows.
Die Sammlung umfasst eine Beginner- und zwanzig Intermediate-Challenges. Szenarien nutzen kompakte Verkaufs-, Finanz-, Kunden-, Wetter- und Filmdaten und danach integrierte Datensätze für Klassifikation, Regression, Clustering, Validierung und Scoring. Dies ist anwendungsorientierte Prüfungspraxis, keine schrittweise Pandas-Einführung.
Was du lernen wirst
- Fehlende, doppelte, inkonsistente, Datums- und Stringdaten bereinigen und Features erzeugen
- Tabellen mit MultiIndex-Zugriffen,
where,query, booleschen Reduktionen und eigenen Funktionen filtern - Series und DataFrames neu indizieren, transformieren, gruppieren, normalisieren, resamplen, verschieben und aggregieren
- Jahresdaten vergleichen und Tabellen per Konkatenation, Merge und Index-Join kombinieren
- CSV und JSON importieren oder exportieren und Analyseergebnisse visualisieren
- k-NN-, Entscheidungsbaum- und logistische Klassifikatoren trainieren und bewerten
- Lineare, Ridge- und Lasso-Regression mit Feature-Auswahl und Kreuzvalidierung aufbauen
- K-means, hierarchisches Clustering und DBSCAN sowie Validierungskurven und Metriken vergleichen
Für wen dieser Kurs geeignet ist
Der Kurs richtet sich an Lernende mit soliden Pandas-Grundlagen, die anspruchsvolle Umsetzungspraxis und einen Einstieg in tabellarische scikit-learn-Workflows suchen. Er eignet sich für selbstständige Lernende, die Spezifikationen verstehen, Startcode debuggen und passende Operationen ohne vollständige Anleitung wählen können.
Voraussetzungen: Du solltest Python-Funktionen und Pandas-Auswahl, Filterung, Gruppierung, Fehlwertbehandlung und Dateiladen beherrschen. Grundlegende Statistik und Machine-Learning-Konzepte werden für die sechs scikit-learn-Challenges dringend empfohlen.
Lernumgebung: Alle 21 Challenges laufen in einer Ubuntu-22.04-WebIDE mit Startdateien, lokalen Daten und Checks. Visualisierung nutzt Matplotlib oder ähnliche Werkzeuge, ML integrierte scikit-learn-Daten und lokale Dateien; ein externer Account ist nicht nötig.
Häufig gestellte Fragen
Geht es ausschließlich um Pandas?
Nein. 15 Challenges fokussieren Pandas, sechs nutzen scikit-learn für k-NN, Bäume, lineare Regression, Clustering, Validierungskurven und Scoring. Diese ML-Erweiterung sollte zu deinen Zielen passen.
Eignet sich der Kurs für vollständige Anfänger?
Nein. Obwohl als Beginner katalogisiert, sind 20 von 21 Challenges Intermediate. Auswahl, Transformation, Gruppierung und Debugging von Pandas-Daten werden vorausgesetzt.
Sind die Challenges geführt und ist eine Reihenfolge nötig?
Anforderungen, Beispiele, Startdateien und Prüfungen werden bereitgestellt, aber keine vollständige Lösung. Die 21 Szenarien sind unabhängig; innerhalb mehrstufiger Szenarien solltest du bei Abhängigkeiten die Reihenfolge einhalten.
Brauche ich externe Daten oder Cloud-Konten?
Nein. Pandas-Aufgaben nutzen lokale CSV-, JSON- oder Tabellendaten, ML-Aufgaben lokale Dateien oder integrierte scikit-learn-Datensätze. Alles bleibt in der Umgebung.




