Aprende cómo el clustering descubre estructura en datos sin etiquetas mediante nueve notebooks Jupyter. Pasarás de la diferencia entre aprendizaje supervisado y no supervisado a métodos por centroides, jerarquía, densidad y grafos, y compararás algoritmos ante distintas formas y tamaños.
El curso combina intuición, implementaciones seleccionadas, modelos scikit-learn y ejercicios. Comprimirás una imagen agrupando píxeles, crearás un dendrograma de semillas, localizarás áreas densas de bicicletas y compararás ocho métodos.
Lo que aprenderás
- Distinguir clustering no supervisado de predicción supervisada
- Implementar pasos de K-Means y examinar K, K-Means++ y Mini-Batch K-Means
- Comprimir colores de una imagen agrupando píxeles
- Comparar enlaces, construir jerarquías aglomerativas y explorar BIRCH y PCA
- Crear y truncar un dendrograma de datos de semillas de trigo
- Aplicar conceptos DBSCAN y HDBSCAN a formas irregulares, densidad y ruido
- Agrupar coordenadas de bicicletas y marcar valores atípicos con DBSCAN
- Usar clustering espectral y comparar ocho algoritmos en moons, circles, blobs y tamaños
A quién va dirigido este curso
Este curso es para estudiantes de Python con machine learning introductorio que desean saber cuándo resulta útil cada familia de clustering. Conecta distancias, centroides, densidad, árboles, grafos, resultados visuales y tiempo. Aunque es de nivel principiante, supera un primer curso de programación.
Requisitos previos: Se recomiendan Python, NumPy, Pandas, Matplotlib y flujos básicos de scikit-learn. Ayudan vectores, distancias, matrices y APIs de modelos; no se requiere clustering previo.
Entorno de aprendizaje: Las nueve actividades usan un entorno Jupyter Ubuntu 22.04 con explicaciones, visualizaciones, imágenes y CSV, ejemplos y tareas de código.
Preguntas frecuentes
¿Implementa algoritmos o solo llama a scikit-learn?
Hace ambas cosas. Recorre ideas y pasos de K-Means, jerárquico, DBSCAN y espectral, y luego usa scikit-learn y SciPy en modelos y dendrogramas.
¿Qué métodos cubre?
K-Means, K-Means++, Mini-Batch K-Means, aglomerativo, BIRCH, DBSCAN, conceptos HDBSCAN, espectral, Affinity Propagation y Mean Shift.
¿Hay ejercicios reales además de puntos sintéticos?
Sí. Comprimirás una imagen de Chengdu, agruparás semillas y analizarás coordenadas de bicicletas para encontrar densidad y posibles atípicos.
¿Puedo copiar todo sin cambios a la última versión de scikit-learn?
El entorno preparado admite los notebooks, pero algunos usan parámetros antiguos como affinity. Consulta la API actual y actualiza argumentos obsoletos.





