Aprendizado Supervisionado: Classificação

Neste curso, continuaremos a aprender outra aplicação importante no aprendizado supervisionado - a resolução de problemas de classificação. Nas lições a seguir, você será exposto a: regressão logística, algoritmo K-vizinhos mais próximos, Naive Bayes, máquina de vetores de suporte, perceptron e rede neural artificial, árvore de decisão e floresta aleatória, e métodos de bagging e boosting. O curso começará com o princípio de cada um desses métodos. Espera-se que você entenda completamente a implementação.

PythonCiência de Dados

💡 Este tutorial foi traduzido do inglês com assistência de IA. Para ver o original, você pode mudar para a versão em inglês

Introdução

Desenvolva uma base ampla de classificação supervisionada clássica em dez notebooks Jupyter. Você estudará como os principais algoritmos decidem, implementará mecanismos em Python, criará modelos scikit-learn, visualizará resultados e comparará classificadores com validação cruzada.

O curso liga matemática e código: sigmoide e log loss, distâncias e votação KNN, probabilidade bayesiana, margens e kernels SVM, ganho de informação, retropropagação e combinação de modelos. Exercícios reforçam distribuições gaussianas, reconhecimento de dígitos e seleção de modelos.

O que você aprenderá

  • Derivar e implementar regressão logística com sigmoide, log loss, gradiente e scikit-learn
  • Construir KNN com distâncias e votação, examinando escolha de K e kd-trees
  • Aplicar teorema de Bayes, estimativa, Naive Bayes multinomial e distribuições gaussianas
  • Comparar SVMs lineares e não lineares e funções kernel comuns
  • Implementar perceptron e retropropagação e classificar dígitos com MLPClassifier
  • Construir árvores com ganho de informação, poda e scikit-learn
  • Treinar Bagging, Random Forest, AdaBoost e Gradient Boosting
  • Preparar Abalone e comparar sete classificadores com validação cruzada de 10 dobras

Para quem é este curso

Este curso é para quem já conhece Python e deseja compreender diversos métodos clássicos além de chamar um único estimator. É adequado para avançar de machine learning introdutório à comparação e seleção de modelos. Embora os notebooks sejam marcados como iniciantes, derivações e componentes manuais não são apropriados para quem está começando programação ou álgebra.

Pré-requisitos: Recomendam-se Python, NumPy, Pandas, gráficos e álgebra básica. Probabilidade, derivadas, divisão train/test e conceitos de características e rótulos ajudam.

Ambiente de aprendizagem: As dez atividades são executadas em um ambiente Jupyter Ubuntu 22.04 fornecido, com explicações, visualizações, exemplos scikit-learn, dados e código para completar.

Perguntas frequentes

O curso implementa algoritmos do zero ou usa scikit-learn?

Faz ambos. Vários notebooks programam gradiente logístico, distância e votação KNN, atualizações do perceptron e divisão de árvores, depois usam estimators para treinamento prático.

Quais classificadores são abordados?

Regressão logística, KNN, Naive Bayes, SVM linear e com kernel, perceptrons e MLPs, árvores, Bagging, Random Forest, AdaBoost e Gradient Boosting.

Ensina avaliação e seleção de modelos?

Sim. Os laboratórios calculam precisão e o último notebook prepara Abalone e compara sete famílias com validação cruzada de 10 dobras e parâmetros padrão.

Posso copiar os exemplos para um projeto scikit-learn atual?

O ambiente preparado executa os notebooks, mas alguns exemplos usam imports ou construtores antigos. Em uma instalação nova, consulte a API atual e ajuste nomes ou argumentos obsoletos.

Professor

labby
Labby
Labby is the LabEx teacher.