Lerne in neun Jupyter-Notebooks, wie Clustering Strukturen in unbeschrifteten Daten aufdeckt. Von überwacht gegenüber unüberwacht gehst du zu zentroid-, hierarchie-, dichte- und graphbasierten Methoden und vergleichst Algorithmen bei verschiedenen Formen und Größen.
Der Kurs verbindet Intuition, ausgewählte Implementierungen, scikit-learn und Anwendungen. Du komprimierst ein Bild durch Pixelcluster, erzeugst ein Saatgut-Dendrogramm, findest dichte Fahrradbereiche und vergleichst acht Verfahren.
Was du lernen wirst
- Unüberwachtes Clustering von überwachter Vorhersage unterscheiden
- K-Means-Schritte umsetzen und K, K-Means++ sowie Mini-Batch K-Means untersuchen
- Bildfarben durch Pixelgruppierung komprimieren
- Linkage-Strategien vergleichen, agglomerative Hierarchien bauen und BIRCH sowie PCA erkunden
- Ein Dendrogramm für Weizensaatdaten erstellen und kürzen
- DBSCAN- und HDBSCAN-Konzepte auf unregelmäßige Cluster, Dichte und Rauschen anwenden
- Fahrradkoordinaten clustern und räumliche Ausreißer mit DBSCAN markieren
- Spektrales Clustering nutzen und acht Algorithmen auf moons, circles, blobs und Größen vergleichen
Für wen dieser Kurs geeignet ist
Der Kurs richtet sich an Python-Lernende mit Machine-Learning-Grundlagen, die Einsatzgebiete verschiedener Clustering-Familien verstehen möchten. Er verbindet Distanzen, Zentren, Dichte, Bäume, Graphen, Visualisierungen und Laufzeit. Trotz Anfänger-Einstufung geht er über einen ersten Programmierkurs hinaus.
Voraussetzungen: Python, NumPy, Pandas, Matplotlib und grundlegende scikit-learn-Abläufe werden empfohlen. Vektoren, Distanzen, Matrizen und Modell-APIs helfen; Clustering-Erfahrung ist nicht nötig.
Lernumgebung: Alle neun Aktivitäten laufen in einer Ubuntu-22.04-Jupyter-Umgebung mit Erklärungen, Visualisierungen, Bild- und CSV-Daten, Beispielen und Codeaufgaben.
Häufig gestellte Fragen
Implementiert der Kurs Algorithmen oder ruft er nur scikit-learn auf?
Beides. Er behandelt Ideen und Schritte von K-Means, Hierarchie, DBSCAN und Spektralverfahren und nutzt scikit-learn sowie SciPy für Modelle und Dendrogramme.
Welche Methoden werden behandelt?
K-Means, K-Means++, Mini-Batch K-Means, agglomerativ, BIRCH, DBSCAN, HDBSCAN-Konzepte, spektral, Affinity Propagation und Mean Shift.
Gibt es Anwendungen jenseits synthetischer Punkte?
Ja. Du komprimierst ein Chengdu-Bild, clusterst Saatgut und analysierst Fahrradkoordinaten auf Dichte und Ausreißer.
Kann ich alles unverändert in die neueste scikit-learn-Version kopieren?
Die Kursumgebung unterstützt die Notebooks, einige nutzen jedoch ältere Parameter wie affinity. Prüfe die aktuelle API und passe veraltete Argumente an.





