Découvrez comment le clustering révèle la structure de données non étiquetées dans neuf notebooks Jupyter. Vous passerez de la distinction supervisé/non supervisé aux méthodes par centroïdes, hiérarchie, densité et graphes, puis comparerez leur comportement selon formes et volumes.
Le cours associe intuition, implémentations choisies, modèles scikit-learn et exercices. Vous compresserez une image par regroupement de pixels, créerez un dendrogramme de graines, localiserez des zones denses de vélos et comparerez huit méthodes.
Ce que vous apprendrez
- Distinguer clustering non supervisé et prédiction supervisée
- Implémenter des étapes K-Means et étudier K, K-Means++ et Mini-Batch K-Means
- Compresser les couleurs d’une image en regroupant ses pixels
- Comparer les liaisons, construire des hiérarchies agglomératives et explorer BIRCH et PCA
- Créer et tronquer un dendrogramme de graines de blé
- Appliquer DBSCAN et les concepts HDBSCAN aux formes irrégulières, densités et bruits
- Regrouper les coordonnées de vélos et marquer les anomalies avec DBSCAN
- Utiliser le spectral et comparer huit algorithmes sur moons, circles, blobs et volumes
À qui s’adresse ce cours
Ce cours s’adresse aux apprenants Python ayant des bases de machine learning qui veulent choisir entre familles de clustering. Il relie distances, centroïdes, densité, arbres, graphes, résultats visuels et temps de calcul. Malgré son niveau débutant, il dépasse une première initiation à la programmation.
Prérequis : Python, NumPy, Pandas, Matplotlib et les bases de scikit-learn sont recommandés. Vecteurs, distances, matrices et API de modèles sont utiles ; aucune expérience de clustering n’est requise.
Environnement d’apprentissage : Les neuf activités utilisent un environnement Jupyter Ubuntu 22.04 avec explications, visualisations, images et CSV, exemples et code à compléter.
Questions fréquentes
Le cours implémente-t-il les algorithmes ou appelle-t-il seulement scikit-learn ?
Les deux. Il détaille les idées et certaines étapes de K-Means, hiérarchique, DBSCAN et spectral, puis utilise scikit-learn et SciPy pour modèles et dendrogrammes.
Quelles méthodes sont couvertes ?
K-Means, K-Means++, Mini-Batch K-Means, agglomératif, BIRCH, DBSCAN, concepts HDBSCAN, spectral, Affinity Propagation et Mean Shift.
Y a-t-il des exercices réels au-delà des points synthétiques ?
Oui. Vous compresserez une image de Chengdu, regrouperez des graines et analyserez des coordonnées de vélos pour repérer densités et anomalies.
Puis-je copier tous les exemples dans la dernière version de scikit-learn ?
L’environnement fourni exécute les notebooks, mais certains utilisent d’anciens paramètres comme affinity. Consultez l’API actuelle et adaptez les arguments obsolètes.





