Unüberwachtes Lernen: Clustering

In diesem Kurs werden Sie das unüberwachte Lernen vollständig verstehen und lernen, es zur Durchführung von Datenclustering zu nutzen.

PythonDatenwissenschaft

💡 Dieser Artikel wurde von AI-Assistenten übersetzt. Um die englische Version anzuzeigen, können Sie hier klicken

Einführung

Lerne in neun Jupyter-Notebooks, wie Clustering Strukturen in unbeschrifteten Daten aufdeckt. Von überwacht gegenüber unüberwacht gehst du zu zentroid-, hierarchie-, dichte- und graphbasierten Methoden und vergleichst Algorithmen bei verschiedenen Formen und Größen.

Der Kurs verbindet Intuition, ausgewählte Implementierungen, scikit-learn und Anwendungen. Du komprimierst ein Bild durch Pixelcluster, erzeugst ein Saatgut-Dendrogramm, findest dichte Fahrradbereiche und vergleichst acht Verfahren.

Was du lernen wirst

  • Unüberwachtes Clustering von überwachter Vorhersage unterscheiden
  • K-Means-Schritte umsetzen und K, K-Means++ sowie Mini-Batch K-Means untersuchen
  • Bildfarben durch Pixelgruppierung komprimieren
  • Linkage-Strategien vergleichen, agglomerative Hierarchien bauen und BIRCH sowie PCA erkunden
  • Ein Dendrogramm für Weizensaatdaten erstellen und kürzen
  • DBSCAN- und HDBSCAN-Konzepte auf unregelmäßige Cluster, Dichte und Rauschen anwenden
  • Fahrradkoordinaten clustern und räumliche Ausreißer mit DBSCAN markieren
  • Spektrales Clustering nutzen und acht Algorithmen auf moons, circles, blobs und Größen vergleichen

Für wen dieser Kurs geeignet ist

Der Kurs richtet sich an Python-Lernende mit Machine-Learning-Grundlagen, die Einsatzgebiete verschiedener Clustering-Familien verstehen möchten. Er verbindet Distanzen, Zentren, Dichte, Bäume, Graphen, Visualisierungen und Laufzeit. Trotz Anfänger-Einstufung geht er über einen ersten Programmierkurs hinaus.

Voraussetzungen: Python, NumPy, Pandas, Matplotlib und grundlegende scikit-learn-Abläufe werden empfohlen. Vektoren, Distanzen, Matrizen und Modell-APIs helfen; Clustering-Erfahrung ist nicht nötig.

Lernumgebung: Alle neun Aktivitäten laufen in einer Ubuntu-22.04-Jupyter-Umgebung mit Erklärungen, Visualisierungen, Bild- und CSV-Daten, Beispielen und Codeaufgaben.

Häufig gestellte Fragen

Implementiert der Kurs Algorithmen oder ruft er nur scikit-learn auf?

Beides. Er behandelt Ideen und Schritte von K-Means, Hierarchie, DBSCAN und Spektralverfahren und nutzt scikit-learn sowie SciPy für Modelle und Dendrogramme.

Welche Methoden werden behandelt?

K-Means, K-Means++, Mini-Batch K-Means, agglomerativ, BIRCH, DBSCAN, HDBSCAN-Konzepte, spektral, Affinity Propagation und Mean Shift.

Gibt es Anwendungen jenseits synthetischer Punkte?

Ja. Du komprimierst ein Chengdu-Bild, clusterst Saatgut und analysierst Fahrradkoordinaten auf Dichte und Ausreißer.

Kann ich alles unverändert in die neueste scikit-learn-Version kopieren?

Die Kursumgebung unterstützt die Notebooks, einige nutzen jedoch ältere Parameter wie affinity. Prüfe die aktuelle API und passe veraltete Argumente an.

Lehrer

labby
Labby
Labby is the LabEx teacher.