Überwachtes Lernen: Klassifikation

In diesem Kurs werden wir weiterhin eine andere wichtige Anwendung im überwachten Lernen kennenlernen - die Lösung von Klassifikationsproblemen. In den folgenden Lektionen werden Sie sich mit den folgenden Themen vertraut machen: Logistische Regression, K-Nächste-Nachbarn-Algorithmus, Naive-Bayes-Klassifikator, Support-Vektor-Maschine, Perzeptron und künstliche neuronale Netzwerke, Entscheidungsbäume und Random Forests sowie Bagging- und Boosting-Methoden. Der Kurs beginnt mit dem Prinzip jeder dieser Methoden. Sie sollten die Implementierung vollständig verstehen.

PythonDatenwissenschaft

💡 Dieser Artikel wurde von AI-Assistenten übersetzt. Um die englische Version anzuzeigen, können Sie hier klicken

Einführung

Baue in zehn Jupyter-Notebooks eine breite Grundlage klassischer überwachter Klassifikation auf. Du untersuchst Entscheidungen wichtiger Algorithmen, implementierst Mechanismen in Python, trainierst scikit-learn-Modelle, visualisierst Ergebnisse und vergleichst Klassifikatoren per Kreuzvalidierung.

Der Kurs verbindet Mathematik und Code: Sigmoid und Log Loss, Distanzen und KNN-Abstimmung, Bayes-Wahrscheinlichkeit, SVM-Ränder und -Kerne, Informationsgewinn, Backpropagation und Modellkombination. Codeaufgaben vertiefen Gauß-Verteilungen, Ziffernerkennung und Modellauswahl.

Was du lernen wirst

  • Logistische Regression mit Sigmoid, Log Loss, Gradientenabstieg und scikit-learn herleiten und umsetzen
  • KNN aus Distanz und Abstimmung bauen sowie K-Wahl und kd-Bäume untersuchen
  • Bayes-Theorem, Parameterschätzung, Multinomial Naive Bayes und Gauß-Verteilungen anwenden
  • Lineare und nichtlineare SVMs sowie gebräuchliche Kernfunktionen vergleichen
  • Perzeptron und Backpropagation umsetzen und Ziffern mit MLPClassifier klassifizieren
  • Entscheidungsbäume mit Informationsgewinn, Pruning und scikit-learn konstruieren
  • Bagging, Random Forest, AdaBoost und Gradient Boosting trainieren
  • Abalone-Daten vorbereiten und sieben Klassifikatoren mit 10-facher Kreuzvalidierung vergleichen

Für wen dieser Kurs geeignet ist

Der Kurs richtet sich an Lernende mit Python-Kenntnissen, die viele klassische Methoden über den Aufruf eines einzelnen Schätzers hinaus verstehen möchten. Er passt zum Übergang von einführendem Machine Learning zu Modellvergleich und -auswahl. Trotz Anfänger-Einstufung sind Ableitungen und manuelle Komponenten ungeeignet für Programmier- oder Algebra-Neulinge.

Voraussetzungen: Python, NumPy, Pandas, Plotting und grundlegende Algebra werden empfohlen. Wahrscheinlichkeit, Ableitungen, Train/Test-Aufteilung sowie Merkmale und Labels sind hilfreich.

Lernumgebung: Alle zehn Aktivitäten laufen in einer bereitgestellten Ubuntu-22.04-Jupyter-Umgebung mit Erklärungen, Visualisierungen, scikit-learn-Beispielen, Daten und zu ergänzendem Code.

Häufig gestellte Fragen

Implementiert der Kurs Algorithmen selbst oder nutzt er scikit-learn?

Beides. Mehrere Notebooks programmieren logistischen Gradientenabstieg, KNN-Distanz und -Abstimmung, Perzeptron-Updates und Baumaufteilung und nutzen anschließend Schätzer für praktisches Training.

Welche Klassifikatoren werden behandelt?

Logistische Regression, KNN, Naive Bayes, lineare und Kernel-SVMs, Perzeptrons und MLPs, Bäume, Bagging, Random Forest, AdaBoost und Gradient Boosting.

Werden Modellbewertung und -auswahl vermittelt?

Ja. Labs berechnen Genauigkeit; das letzte Notebook bereitet Abalone auf und vergleicht sieben Familien per 10-facher Kreuzvalidierung mit Standardparametern.

Kann ich Beispiele in ein aktuelles scikit-learn-Projekt kopieren?

Die vorbereitete Umgebung unterstützt die Notebooks, einige Beispiele verwenden jedoch ältere Imports oder Konstruktoren. Prüfe bei neuer Installation die aktuelle API und passe veraltete Namen oder Argumente an.

Lehrer

labby
Labby
Labby is the LabEx teacher.