Apprentissage supervisé : Classification

Au cours de cette formation, nous continuerons à découvrir une autre application importante de l'apprentissage supervisé - la résolution de problèmes de classification. Dans les leçons suivantes, vous aurez l'occasion d'étudier : la régression logistique, l'algorithme des k plus proches voisins, le classifieur naïf bayésien, la machine à vecteurs de support, le perceptron et le réseau neuronal artificiel, l'arbre de décision et la forêt aléatoire, ainsi que les méthodes de bagging et de boosting. Le cours commencera par le principe de chacune de ces méthodes. Vous devriez bien comprendre la mise en œuvre

PythonScience des données

💡 Ce tutoriel est traduit par l'IA à partir de la version anglaise. Pour voir la version originale, vous pouvez cliquer ici

Introduction

Construisez une base large en classification supervisée classique dans dix notebooks Jupyter. Vous étudierez les décisions des principaux algorithmes, implémenterez certains mécanismes en Python, entraînerez des modèles scikit-learn, visualiserez les résultats et comparerez les classifieurs par validation croisée.

Le cours relie mathématiques et code : sigmoïde et perte logarithmique, distances et vote KNN, probabilités bayésiennes, marges et noyaux SVM, gain d’information, rétropropagation et combinaison de modèles. Des exercices renforcent distributions gaussiennes, reconnaissance de chiffres et sélection de modèles.

Ce que vous apprendrez

  • Dériver et implémenter une régression logistique avec sigmoïde, log loss, gradient et scikit-learn
  • Construire KNN à partir des distances et du vote, puis étudier choix de K et kd-trees
  • Appliquer théorème de Bayes, estimation, Naive Bayes multinomial et distributions gaussiennes
  • Comparer SVM linéaires et non linéaires ainsi que les noyaux courants
  • Implémenter perceptron et rétropropagation, puis classer des chiffres avec MLPClassifier
  • Construire des arbres avec gain d’information, élagage et scikit-learn
  • Entraîner Bagging, Random Forest, AdaBoost et Gradient Boosting
  • Préparer Abalone et comparer sept classifieurs par validation croisée à 10 plis

À qui s’adresse ce cours

Ce cours s’adresse aux personnes connaissant déjà Python qui veulent comprendre plusieurs méthodes classiques plutôt que simplement appeler un estimateur. Il convient au passage du machine learning introductif à la comparaison et sélection de modèles. Malgré le niveau débutant, dérivations et composants manuels ne conviennent pas à une première expérience de programmation ou d’algèbre.

Prérequis : Python, NumPy, Pandas, graphiques et algèbre de base sont recommandés. Probabilités, dérivées, séparation train/test, caractéristiques et étiquettes sont utiles.

Environnement d’apprentissage : Les dix activités utilisent un environnement Jupyter Ubuntu 22.04 fourni, avec explications, visualisations, exemples scikit-learn, données et code à compléter.

Questions fréquentes

Le cours implémente-t-il les algorithmes ou utilise-t-il scikit-learn ?

Les deux. Plusieurs notebooks codent gradient logistique, distance et vote KNN, mises à jour du perceptron et division d’arbres, puis emploient des estimateurs pour l’entraînement pratique.

Quels classifieurs sont couverts ?

Régression logistique, KNN, Naive Bayes, SVM linéaires et à noyau, perceptrons et réseaux multicouches, arbres, Bagging, Random Forest, AdaBoost et Gradient Boosting.

L’évaluation et la sélection de modèles sont-elles enseignées ?

Oui. Les laboratoires calculent la précision et le dernier notebook prépare Abalone puis compare sept familles par validation croisée à 10 plis avec paramètres par défaut.

Puis-je copier les exemples dans un projet scikit-learn actuel ?

L’environnement fourni exécute les notebooks, mais certains exemples utilisent d’anciens imports ou constructeurs. Dans une installation récente, vérifiez l’API et adaptez les noms ou arguments obsolètes.

Enseignant

labby
Labby
Labby is the LabEx teacher.