Scikit-learn для начинающих

Этот комплексный курс охватывает фундаментальные концепции и практические методы Scikit-learn, основной библиотеки машинного обучения на Python. Научитесь создавать, обучать и оценивать модели машинного обучения, используя различные алгоритмы и методы предварительной обработки данных.

PythonНаука о данных

💡 Этот учебник переведен с английского с помощью ИИ. Чтобы просмотреть оригинал, вы можете перейти на английский оригинал

Введение

Освойте основной рабочий процесс scikit-learn в семи целевых лабораторных работах с пошаговыми инструкциями. Вы настроите библиотеку, изучите реальные наборы данных, преобразуете признаки, обучите модели регрессии и классификации, получите прогнозы, визуализируете результаты, вычислите метрики и выполните кросс-валидацию.

Небольшие скрипты Python и известные наборы данных делают каждую операцию API наглядной. Iris используется для исследования, предобработки, KNN и кросс-валидации, а California Housing — для примера многомерной регрессии.

Чему вы научитесь

  • Устанавливать scikit-learn через pip, импортировать модули, проверять версию и изучать объект набора данных
  • Загружать Iris и обращаться к матрице признаков, целевым меткам, названиям признаков и метаданным
  • Создавать и сохранять диаграммы рассеяния Matplotlib для исследования признаков и сравнения прогнозов с реальными значениями
  • Разделять признаки и цели и стандартизировать числовые признаки с StandardScaler
  • Кодировать метки с LabelEncoder и понимать отдельные операции fit, transform и fit_transform
  • Делить данные на обучение и тест, обучать LinearRegression на California Housing и строить прогнозы
  • Обучать KNeighborsClassifier с тремя соседями на Iris, а отдельно оценивать заданные бинарные прогнозы по accuracy, матрице ошибок, precision, recall и F1
  • Оценивать линейный классификатор опорных векторов пятиблочным cross_val_score и вычислять среднее и стандартное отклонение

Для кого этот курс

Курс предназначен для изучающих Python и анализ данных и начинающих специалистов по машинному обучению, которым нужно компактное введение в рабочий процесс estimator в scikit-learn. Лучше всего он подходит тем, кто уже умеет читать и менять простые скрипты Python, но не знаком с библиотекой.

Предварительные требования: Рекомендуются основы Python: переменные, импорт, вызовы функций, списки или массивы и чтение простых скриптов. Опыт реализации машинного обучения не нужен; полезно начальное понимание обучающих данных, признаков и меток.

Учебная среда: Все семь начальных работ выполняются в WebIDE Ubuntu 22.04 с редактором и встроенным терминалом. Вы работаете в файлах Python со scikit-learn, NumPy, pandas и Matplotlib; работа California Housing получает данные через fetch_california_housing().

Часто задаваемые вопросы

Это курс Python для полных новичков в программировании?

Нет. Операции scikit-learn объясняются пошагово, но предполагается, что вы умеете редактировать Python и понимаете импорт, переменные, функции и индексацию массивов. Если эти понятия незнакомы, сначала изучите основы Python.

Какие модели реализуются?

Вы обучите линейную регрессию для California Housing и KNN с тремя соседями для классов Iris. Предварительно настроенный линейный классификатор опорных векторов демонстрирует пятиблочную кросс-валидацию. Деревья, ансамбли, кластеризация, нейросети и развёртывание не рассматриваются.

Используются ли Jupyter Notebook?

Нет. Упражнения используют скрипты .py в WebIDE Ubuntu и запускают их во встроенном терминале. Графики сохраняются как изображения, а не создаются в ячейках Notebook.

Создам ли я полный производственный проект машинного обучения?

Нет. Семь независимых работ отдельно рассматривают установку, исследование, предобработку, модели, метрики и валидацию. Они знакомят с API, но не охватывают pipelines, поиск гиперпараметров, развёртывание, мониторинг и производственную инженерию данных.

Преподаватель

labby
Labby
Labby is the LabEx teacher.