Desafíos de Práctica de Sklearn

Este curso contiene muchos desafíos para Sklearn. Cada desafío es un pequeño proyecto de Sklearn con instrucciones detalladas y soluciones. Puedes practicar tus habilidades en Sklearn resolviendo estos desafíos, mejorar tus habilidades para resolver problemas y aprender a escribir código limpio y eficiente.

PythonCiencia de datos

💡 Este tutorial está traducido por IA desde la versión en inglés. Para ver la versión original, puedes hacer clic aquí

Introducción

Refuerza tu capacidad para resolver problemas con scikit-learn mediante siete desafíos intermedios de completar código. Cada desafío aporta archivos iniciales y requisitos TODO concretos, y te pide implementar funciones de entrenamiento, evaluación, ajuste, interpretación o visualización.

Los 20 pasos abarcan aprendizaje supervisado y no supervisado: métricas, Naive Bayes, K vecinos, curvas de validación, árboles, regresión lineal y regularizada y tres métodos de clustering. Cada tarea incluye comprobación automática y solución de referencia.

Lo que aprenderás

  • Evaluar clasificación con exactitud, precisión, recall y F1, y regresión con MSE, MAE, RMSE y R²
  • Crear un scorer personalizado y usar un pipeline SVR escalado con búsqueda en cuadrícula
  • Entrenar Gaussian Naive Bayes con Iris, escalar características, comparar variantes Gaussian, Multinomial y Bernoulli y generar una matriz de confusión
  • Dividir Iris, entrenar K vecinos, evaluar predicciones y buscar un mejor valor de k
  • Generar curvas para max_depth, elegir una profundidad mediante validación cruzada, reentrenar y probar un árbol
  • Preparar Iris en pandas, ajustar DecisionTreeClassifier y resumir precisión, recall y F1
  • Ajustar regresión lineal a CSV suministrados, calcular métricas y comparar Ridge y Lasso con validación cruzada
  • Aplicar K-means, clustering aglomerativo y DBSCAN a Iris, comparar silhouette scores y visualizar asignaciones

A quién va dirigido este curso

Este curso está dirigido a estudiantes de Python y scikit-learn que ya completaron ejercicios introductorios de modelado y buscan implementación más independiente. Debes poder leer código inicial, completar funciones, interpretar requisitos y depurar comprobaciones fallidas.

Requisitos previos: Se recomienda conocer Python, estructuras NumPy o pandas, división de entrenamiento y prueba, fit y predict y conceptos básicos de clasificación y regresión. Los desafíos no enseñan sintaxis Python desde cero.

Entorno de aprendizaje: Los siete desafíos se ejecutan en un WebIDE Ubuntu 22.04. Contienen 20 tareas intermedias, cada una con comprobación automática y solución. Seis entornos fijan scikit-learn 1.2.2; el desafío de métricas fija 1.1.3 y NumPy menor que 2 por sus ejercicios heredados de Boston Housing.

Preguntas frecuentes

¿Sirven como primera introducción a scikit-learn?

No es lo ideal. Aunque el curso figura como principiante, los siete desafíos están etiquetados individualmente como intermedios y parten de código con TODO. Empieza con fundamentos guiados si fit, predict, métricas y divisiones de datos son nuevos para ti.

¿Cuánta guía y retroalimentación se ofrece?

Cada tarea describe las funciones o salidas requeridas y proporciona archivos iniciales, pero tú implementas la lógica faltante. Cada uno de los 20 pasos tiene una comprobación automática y una solución de referencia.

¿Qué conjuntos de datos se utilizan?

Varios desafíos reutilizan Iris. El trabajo de métricas también usa Breast Cancer y el conjunto heredado Boston Housing, y la regresión lineal aporta archivos CSV propios. Es práctica enfocada en algoritmos, no un recorrido por grandes datos de producción.

¿Funcionará el código sin cambios con la última versión?

No todo. El desafío de métricas instala deliberadamente scikit-learn 1.1.3 porque importa el cargador Boston Housing eliminado después; los demás fijan 1.2.2. Trata ese ejercicio como específico de versión y usa un conjunto admitido actualmente al adaptarlo.

Profesor

labby
Labby
Labby is the LabEx teacher.