Aprende el flujo central de scikit-learn mediante siete laboratorios guiados y específicos. Configurarás la biblioteca, inspeccionarás conjuntos de datos reales, transformarás características, ajustarás modelos de regresión y clasificación, generarás predicciones, visualizarás resultados, calcularás métricas y ejecutarás validación cruzada.
El curso utiliza pequeños scripts de Python y conjuntos conocidos para hacer visible cada operación de la API. Iris se usa para exploración, preprocesamiento, clasificación KNN y validación cruzada, mientras que California Housing ofrece un ejemplo de regresión multivariable.
Lo que aprenderás
- Instalar scikit-learn con
pip, importar módulos, comprobar la versión e inspeccionar un objeto de datos - Cargar Iris y acceder a su matriz de características, etiquetas, nombres de características y metadatos
- Crear y guardar gráficos de dispersión con Matplotlib para explorar características y comparar predicciones con valores reales
- Separar características y objetivos y estandarizar valores numéricos con
StandardScaler - Codificar etiquetas con
LabelEncodery comprenderfit,transformyfit_transform - Dividir datos de entrenamiento y prueba, ajustar
LinearRegressioncon California Housing y generar predicciones - Entrenar
KNeighborsClassifiercon tres vecinos sobre Iris y, por separado, evaluar predicciones binarias predefinidas con exactitud, matriz de confusión, precisión, recall y F1 - Evaluar un clasificador lineal de vectores de soporte con
cross_val_scorede cinco pliegues y resumir media y desviación estándar
A quién va dirigido este curso
Este curso está dirigido a estudiantes de Python y análisis de datos y aspirantes a machine learning que desean una introducción compacta al flujo de estimadores de scikit-learn. Es más adecuado si ya puedes leer y modificar scripts sencillos, pero eres nuevo en la biblioteca.
Requisitos previos: Se recomiendan fundamentos de Python: variables, imports, llamadas a funciones, listas o arrays y lectura de scripts sencillos. No se requiere experiencia implementando machine learning; ayuda conocer de forma elemental datos de entrenamiento, características y etiquetas.
Entorno de aprendizaje: Los siete laboratorios de nivel principiante se ejecutan en un WebIDE Ubuntu 22.04 con editor y terminal integrado. Trabajarás en archivos Python con scikit-learn, NumPy, pandas y Matplotlib; el laboratorio California Housing obtiene los datos mediante fetch_california_housing().
Preguntas frecuentes
¿Es un curso de Python para principiantes absolutos en programación?
No. Los laboratorios explican las operaciones paso a paso, pero esperan que puedas editar Python y entender imports, variables, funciones e indexación de arrays. Si esos conceptos no son familiares, conviene estudiar primero Python básico.
¿Qué modelos se implementan?
Ajustarás una regresión lineal para valores de California Housing y un KNN de tres vecinos para clases de Iris. Un clasificador lineal de vectores de soporte preconfigurado demuestra la validación cruzada de cinco pliegues. No se cubren árboles, ensembles, clustering, redes neuronales ni despliegue.
¿Se usan notebooks de Jupyter?
No. Los ejercicios usan scripts .py en un WebIDE Ubuntu y se ejecutan desde el terminal integrado. Los gráficos se guardan como imágenes en lugar de desarrollarse en celdas de notebook.
¿Construiré un proyecto completo de machine learning para producción?
No. Son siete laboratorios independientes que aíslan instalación, exploración, preprocesamiento, modelado, métricas y validación. Introducen la API, pero no pipelines, búsqueda de hiperparámetros, despliegue, monitorización ni ingeniería de datos de producción.





