Освойте основной рабочий процесс scikit-learn в семи целевых лабораторных работах с пошаговыми инструкциями. Вы настроите библиотеку, изучите реальные наборы данных, преобразуете признаки, обучите модели регрессии и классификации, получите прогнозы, визуализируете результаты, вычислите метрики и выполните кросс-валидацию.
Небольшие скрипты Python и известные наборы данных делают каждую операцию API наглядной. Iris используется для исследования, предобработки, KNN и кросс-валидации, а California Housing — для примера многомерной регрессии.
Чему вы научитесь
- Устанавливать scikit-learn через
pip, импортировать модули, проверять версию и изучать объект набора данных - Загружать Iris и обращаться к матрице признаков, целевым меткам, названиям признаков и метаданным
- Создавать и сохранять диаграммы рассеяния Matplotlib для исследования признаков и сравнения прогнозов с реальными значениями
- Разделять признаки и цели и стандартизировать числовые признаки с
StandardScaler - Кодировать метки с
LabelEncoderи понимать отдельные операцииfit,transformиfit_transform - Делить данные на обучение и тест, обучать
LinearRegressionна California Housing и строить прогнозы - Обучать
KNeighborsClassifierс тремя соседями на Iris, а отдельно оценивать заданные бинарные прогнозы по accuracy, матрице ошибок, precision, recall и F1 - Оценивать линейный классификатор опорных векторов пятиблочным
cross_val_scoreи вычислять среднее и стандартное отклонение
Для кого этот курс
Курс предназначен для изучающих Python и анализ данных и начинающих специалистов по машинному обучению, которым нужно компактное введение в рабочий процесс estimator в scikit-learn. Лучше всего он подходит тем, кто уже умеет читать и менять простые скрипты Python, но не знаком с библиотекой.
Предварительные требования: Рекомендуются основы Python: переменные, импорт, вызовы функций, списки или массивы и чтение простых скриптов. Опыт реализации машинного обучения не нужен; полезно начальное понимание обучающих данных, признаков и меток.
Учебная среда: Все семь начальных работ выполняются в WebIDE Ubuntu 22.04 с редактором и встроенным терминалом. Вы работаете в файлах Python со scikit-learn, NumPy, pandas и Matplotlib; работа California Housing получает данные через fetch_california_housing().
Часто задаваемые вопросы
Это курс Python для полных новичков в программировании?
Нет. Операции scikit-learn объясняются пошагово, но предполагается, что вы умеете редактировать Python и понимаете импорт, переменные, функции и индексацию массивов. Если эти понятия незнакомы, сначала изучите основы Python.
Какие модели реализуются?
Вы обучите линейную регрессию для California Housing и KNN с тремя соседями для классов Iris. Предварительно настроенный линейный классификатор опорных векторов демонстрирует пятиблочную кросс-валидацию. Деревья, ансамбли, кластеризация, нейросети и развёртывание не рассматриваются.
Используются ли Jupyter Notebook?
Нет. Упражнения используют скрипты .py в WebIDE Ubuntu и запускают их во встроенном терминале. Графики сохраняются как изображения, а не создаются в ячейках Notebook.
Создам ли я полный производственный проект машинного обучения?
Нет. Семь независимых работ отдельно рассматривают установку, исследование, предобработку, модели, метрики и валидацию. Они знакомят с API, но не охватывают pipelines, поиск гиперпараметров, развёртывание, мониторинг и производственную инженерию данных.





