Défis pratiques avec Pandas

Ce cours contient de nombreux défis pour Pandas. Chaque défi est un petit projet Pandas avec des instructions détaillées et des solutions. Vous pouvez améliorer vos compétences en Pandas en résolvant ces défis, développer vos capacités à résoudre des problèmes et apprendre à écrire un code propre et efficace.

PythonScience des données

💡 Ce tutoriel est traduit par l'IA à partir de la version anglaise. Pour voir la version originale, vous pouvez cliquer ici

Introduction

Renforcez vos compétences avancées avec 21 défis indépendants : 15 centrés sur Pandas et six étendus à scikit-learn. À partir d’exigences et d’exemples, vous implémenterez nettoyage, sélection, transformation, agrégation, séries temporelles, IO, combinaison de DataFrames, visualisation et workflows de machine learning.

La collection comprend un défi Beginner et vingt Intermediate. Les scénarios utilisent de petits jeux de ventes, finance, clients, météo ou films, puis des jeux intégrés pour classification, régression, clustering, validation et scoring. Il s’agit de pratique et d’autoévaluation, non d’une introduction guidée à Pandas.

Ce que vous apprendrez

  • Nettoyer valeurs manquantes, doublons, incohérences, dates et chaînes et créer des variables
  • Filtrer et modifier avec accesseurs MultiIndex, where, query, réductions booléennes et fonctions personnalisées
  • Réindexer, transformer, grouper, normaliser, rééchantillonner, décaler et agréger Series et DataFrames
  • Comparer des années et combiner les tables par concaténation, fusion et jointure d’index
  • Importer et exporter CSV et JSON et produire des graphiques analytiques
  • Entraîner et évaluer k-NN, arbres de décision et classification logistique
  • Construire des régressions linéaire, Ridge et Lasso avec sélection et validation croisée
  • Comparer K-means, clustering hiérarchique et DBSCAN et analyser courbes et métriques

À qui s’adresse ce cours

Ce cours s’adresse aux personnes maîtrisant les bases de Pandas qui recherchent une pratique exigeante et une introduction aux données tabulaires dans scikit-learn. Il convient aux apprenants autonomes capables d’interpréter des spécifications, déboguer des fichiers de départ et choisir les bonnes opérations sans tutoriel complet.

Prérequis : Vous devez maîtriser les fonctions Python et les opérations Pandas courantes : sélection, filtrage, regroupement, valeurs manquantes et chargement. Statistiques de base et notions de machine learning sont vivement recommandées pour les six défis scikit-learn.

Environnement d’apprentissage : Les 21 défis utilisent un WebIDE Ubuntu 22.04 avec fichiers Python, données locales et validation. Les visualisations emploient Matplotlib ou outils apparentés, et le ML des jeux scikit-learn intégrés ou fichiers locaux ; aucun compte externe n’est requis.

Questions fréquentes

Ce cours porte-t-il uniquement sur Pandas ?

Non. Quinze défis utilisent Pandas, mais six couvrent avec scikit-learn k-NN, arbres, régression linéaire, clustering, courbes de validation et scoring. Cette extension doit correspondre à vos objectifs.

Convient-il à un débutant complet ?

Non. Bien que catalogué Beginner, vingt défis sur 21 sont Intermediate. Vous devez savoir sélectionner, transformer, grouper et déboguer des données Pandas avec peu d’aide.

Les défis sont-ils guidés et faut-il les suivre dans l’ordre ?

Exigences, exemples, fichiers de départ et contrôles sont fournis, mais pas une solution complète. Les 21 scénarios sont indépendants ; dans un scénario en plusieurs étapes, suivez l’ordre si les résultats sont réutilisés.

Faut-il des données externes ou un compte cloud ?

Non. Les défis Pandas utilisent CSV, JSON ou tables locales ; le ML utilise des fichiers locaux ou les jeux intégrés de scikit-learn. Tout reste dans l’environnement fourni.

Enseignant

labby
Labby
Labby is the LabEx teacher.