Scikit-learn pour débutants

Ce cours complet couvre les concepts fondamentaux et les techniques pratiques de Scikit-learn, la bibliothèque essentielle d'apprentissage automatique en Python. Apprenez à construire, entraîner et évaluer des modèles d'apprentissage automatique en utilisant divers algorithmes et techniques de prétraitement.

PythonScience des données

💡 Ce tutoriel est traduit par l'IA à partir de la version anglaise. Pour voir la version originale, vous pouvez cliquer ici

Introduction

Découvrez le flux de travail essentiel de scikit-learn dans sept laboratoires guidés et ciblés. Vous configurerez la bibliothèque, examinerez des jeux de données réels, transformerez les caractéristiques, ajusterez des modèles de régression et de classification, produirez des prédictions, visualiserez les résultats, calculerez des métriques et exécuterez une validation croisée.

Le cours utilise de petits scripts Python et des jeux connus pour rendre chaque opération de l’API visible. Iris sert à l’exploration, au prétraitement, à la classification KNN et à la validation croisée, tandis que California Housing fournit un exemple de régression multivariable.

Ce que vous apprendrez

  • Installer scikit-learn avec pip, importer ses modules, vérifier la version et examiner un objet de jeu de données
  • Charger Iris et accéder à sa matrice de caractéristiques, ses étiquettes, noms de caractéristiques et métadonnées
  • Créer et enregistrer des nuages de points avec Matplotlib pour explorer les caractéristiques et comparer prédictions et valeurs réelles
  • Séparer caractéristiques et cibles et standardiser les valeurs numériques avec StandardScaler
  • Encoder des étiquettes avec LabelEncoder et comprendre fit, transform et fit_transform
  • Séparer entraînement et test, ajuster LinearRegression sur California Housing et générer des prédictions
  • Entraîner un KNeighborsClassifier à trois voisins sur Iris puis, séparément, évaluer des prédictions binaires prédéfinies avec exactitude, matrice de confusion, précision, rappel et F1
  • Évaluer un classifieur linéaire à vecteurs de support par cross_val_score à cinq plis et résumer moyenne et écart-type

À qui s’adresse ce cours

Ce cours s’adresse aux apprenants Python et analyse de données et aux futurs praticiens du machine learning qui souhaitent une introduction compacte au flux des estimateurs scikit-learn. Il convient surtout si vous savez déjà lire et modifier des scripts Python simples, mais découvrez la bibliothèque.

Prérequis : Des bases en Python sont recommandées : variables, imports, appels de fonctions, listes ou tableaux et lecture de scripts simples. Aucune expérience d’implémentation du machine learning n’est requise ; quelques notions sur données d’entraînement, caractéristiques et étiquettes aideront.

Environnement d’apprentissage : Les sept laboratoires débutants s’exécutent dans un WebIDE Ubuntu 22.04 avec éditeur et terminal intégré. Vous travaillez dans des fichiers Python avec scikit-learn, NumPy, pandas et Matplotlib ; le laboratoire California Housing récupère les données avec fetch_california_housing().

Questions fréquentes

Est-ce un cours de Python pour débutants complets en programmation ?

Non. Les laboratoires expliquent les opérations pas à pas, mais supposent que vous savez modifier des fichiers Python et comprendre imports, variables, fonctions et indexation de tableaux. Si ces notions sont nouvelles, commencez par les bases de Python.

Quels modèles sont implémentés ?

Vous ajustez une régression linéaire pour California Housing et un KNN à trois voisins pour les classes Iris. Un classifieur linéaire à vecteurs de support préconfiguré sert à la validation croisée à cinq plis. Arbres, ensembles, clustering, réseaux neuronaux et déploiement ne sont pas abordés.

Le cours utilise-t-il des notebooks Jupyter ?

Non. Les exercices utilisent des scripts .py dans un WebIDE Ubuntu et les exécutent depuis le terminal intégré. Les graphiques sont enregistrés comme fichiers image plutôt que développés dans des cellules de notebook.

Construirai-je un projet complet de machine learning en production ?

Non. Sept laboratoires indépendants isolent installation, exploration, prétraitement, modélisation, métriques et validation. Ils introduisent l’API, mais pas les pipelines, la recherche d’hyperparamètres, le déploiement, la supervision ou l’ingénierie de données de production.

Enseignant

labby
Labby
Labby is the LabEx teacher.