Scikit-learn para Iniciantes

Este curso abrangente aborda os conceitos fundamentais e técnicas práticas do Scikit-learn, a biblioteca essencial de aprendizado de máquina em Python. Aprenda a construir, treinar e avaliar modelos de aprendizado de máquina usando diversos algoritmos e técnicas de pré-processamento.

PythonCiência de Dados

💡 Este tutorial foi traduzido do inglês com assistência de IA. Para ver o original, você pode mudar para a versão em inglês

Introdução

Aprenda o fluxo central do scikit-learn em sete laboratórios guiados e focados. Você configurará a biblioteca, explorará conjuntos reais, transformará atributos, ajustará modelos de regressão e classificação, fará previsões, visualizará resultados, calculará métricas e executará validação cruzada.

O curso usa pequenos scripts Python e conjuntos conhecidos para tornar cada operação da API visível. Iris serve para exploração, pré-processamento, classificação KNN e validação cruzada, enquanto California Housing fornece um exemplo de regressão multivariada.

O que você aprenderá

  • Instalar scikit-learn com pip, importar módulos, verificar a versão e inspecionar um objeto de dados
  • Carregar Iris e acessar sua matriz de atributos, rótulos, nomes de atributos e metadados
  • Criar e salvar gráficos de dispersão com Matplotlib para explorar atributos e comparar previsões com valores reais
  • Separar atributos e alvos e padronizar valores numéricos com StandardScaler
  • Codificar rótulos com LabelEncoder e compreender fit, transform e fit_transform
  • Dividir dados de treino e teste, ajustar LinearRegression com California Housing e gerar previsões
  • Treinar KNeighborsClassifier com três vizinhos no Iris e, separadamente, avaliar previsões binárias predefinidas com acurácia, matriz de confusão, precisão, recall e F1
  • Avaliar um classificador linear de vetores de suporte com cross_val_score de cinco partes e resumir média e desvio padrão

Para quem é este curso

Este curso é destinado a estudantes de Python e análise de dados e iniciantes em machine learning que desejam uma introdução compacta ao fluxo de estimadores do scikit-learn. É mais adequado para quem já lê e modifica scripts Python simples, mas ainda não conhece a biblioteca.

Pré-requisitos: Recomendam-se fundamentos de Python: variáveis, imports, chamadas de função, listas ou arrays e leitura de scripts simples. Não é necessária experiência implementando machine learning; uma noção básica de dados de treino, atributos e rótulos ajuda.

Ambiente de aprendizagem: Os sete laboratórios de nível iniciante são executados em um WebIDE Ubuntu 22.04 com editor e terminal integrado. Você trabalha em arquivos Python com scikit-learn, NumPy, pandas e Matplotlib; o laboratório California Housing obtém os dados com fetch_california_housing().

Perguntas frequentes

É um curso de Python para iniciantes absolutos em programação?

Não. Os laboratórios explicam as operações passo a passo, mas esperam que você edite Python e entenda imports, variáveis, funções e indexação de arrays. Se esses conceitos forem novos, comece pelos fundamentos de Python.

Quais modelos são implementados?

Você ajustará regressão linear para valores do California Housing e KNN com três vizinhos para classes do Iris. Um classificador linear de vetores de suporte pré-configurado demonstra validação cruzada de cinco partes. Árvores, ensembles, clustering, redes neurais e implantação não são abordados.

O curso usa Jupyter Notebook?

Não. Os exercícios usam scripts .py em um WebIDE Ubuntu e os executam pelo terminal integrado. Os gráficos são salvos como arquivos de imagem, não desenvolvidos em células de notebook.

Construirei um projeto completo de machine learning para produção?

Não. São sete laboratórios independentes que isolam instalação, exploração, pré-processamento, modelagem, métricas e validação. Eles introduzem a API, mas não pipelines, busca de hiperparâmetros, implantação, monitoramento ou engenharia de dados de produção.

Professor

labby
Labby
Labby is the LabEx teacher.