Scikit-learn para Principiantes

Este curso completo cubre los conceptos fundamentales y las técnicas prácticas de Scikit-learn, la biblioteca esencial de aprendizaje automático en Python. Aprende a construir, entrenar y evaluar modelos de aprendizaje automático utilizando diversos algoritmos y técnicas de preprocesamiento.

PythonCiencia de datos

💡 Este tutorial está traducido por IA desde la versión en inglés. Para ver la versión original, puedes hacer clic aquí

Introducción

Aprende el flujo central de scikit-learn mediante siete laboratorios guiados y específicos. Configurarás la biblioteca, inspeccionarás conjuntos de datos reales, transformarás características, ajustarás modelos de regresión y clasificación, generarás predicciones, visualizarás resultados, calcularás métricas y ejecutarás validación cruzada.

El curso utiliza pequeños scripts de Python y conjuntos conocidos para hacer visible cada operación de la API. Iris se usa para exploración, preprocesamiento, clasificación KNN y validación cruzada, mientras que California Housing ofrece un ejemplo de regresión multivariable.

Lo que aprenderás

  • Instalar scikit-learn con pip, importar módulos, comprobar la versión e inspeccionar un objeto de datos
  • Cargar Iris y acceder a su matriz de características, etiquetas, nombres de características y metadatos
  • Crear y guardar gráficos de dispersión con Matplotlib para explorar características y comparar predicciones con valores reales
  • Separar características y objetivos y estandarizar valores numéricos con StandardScaler
  • Codificar etiquetas con LabelEncoder y comprender fit, transform y fit_transform
  • Dividir datos de entrenamiento y prueba, ajustar LinearRegression con California Housing y generar predicciones
  • Entrenar KNeighborsClassifier con tres vecinos sobre Iris y, por separado, evaluar predicciones binarias predefinidas con exactitud, matriz de confusión, precisión, recall y F1
  • Evaluar un clasificador lineal de vectores de soporte con cross_val_score de cinco pliegues y resumir media y desviación estándar

A quién va dirigido este curso

Este curso está dirigido a estudiantes de Python y análisis de datos y aspirantes a machine learning que desean una introducción compacta al flujo de estimadores de scikit-learn. Es más adecuado si ya puedes leer y modificar scripts sencillos, pero eres nuevo en la biblioteca.

Requisitos previos: Se recomiendan fundamentos de Python: variables, imports, llamadas a funciones, listas o arrays y lectura de scripts sencillos. No se requiere experiencia implementando machine learning; ayuda conocer de forma elemental datos de entrenamiento, características y etiquetas.

Entorno de aprendizaje: Los siete laboratorios de nivel principiante se ejecutan en un WebIDE Ubuntu 22.04 con editor y terminal integrado. Trabajarás en archivos Python con scikit-learn, NumPy, pandas y Matplotlib; el laboratorio California Housing obtiene los datos mediante fetch_california_housing().

Preguntas frecuentes

¿Es un curso de Python para principiantes absolutos en programación?

No. Los laboratorios explican las operaciones paso a paso, pero esperan que puedas editar Python y entender imports, variables, funciones e indexación de arrays. Si esos conceptos no son familiares, conviene estudiar primero Python básico.

¿Qué modelos se implementan?

Ajustarás una regresión lineal para valores de California Housing y un KNN de tres vecinos para clases de Iris. Un clasificador lineal de vectores de soporte preconfigurado demuestra la validación cruzada de cinco pliegues. No se cubren árboles, ensembles, clustering, redes neuronales ni despliegue.

¿Se usan notebooks de Jupyter?

No. Los ejercicios usan scripts .py en un WebIDE Ubuntu y se ejecutan desde el terminal integrado. Los gráficos se guardan como imágenes en lugar de desarrollarse en celdas de notebook.

¿Construiré un proyecto completo de machine learning para producción?

No. Son siete laboratorios independientes que aíslan instalación, exploración, preprocesamiento, modelado, métricas y validación. Introducen la API, pero no pipelines, búsqueda de hiperparámetros, despliegue, monitorización ni ingeniería de datos de producción.

Profesor

labby
Labby
Labby is the LabEx teacher.