курс в Pandas Skill Tree

Практические задачи по Pandas

Этот курс содержит множество задач по Pandas. Каждая задача представляет собой небольшой проект на Pandas с подробными инструкциями и решениями. Вы можете практиковать свои навыки работы с Pandas, решая эти задачи, улучшить свои навыки решения проблем и научиться писать чистый и эффективный код.

PythonНаука о данных

💡 Этот учебник переведен с английского с помощью ИИ. Чтобы просмотреть оригинал, вы можете перейти на английский оригинал

Программа

DataFrame с данными о продажах

Фильтрация и индексация данных в формате CSV

Сравнение данных о продажах

Обработка NaN и дубликатов

Работа с Series

Анализ продаж и скидок

Математические операции с DataFrame

Обработка строк в Pandas для данных в электронной коммерции

Исследование функции where

Мощный метод query

Анализ данных с использованием булевых сокращений в Pandas

Доступ к DataFrame в Pandas

Глубокие исследования в transform

Предсказание типов цветов с использованием ближайших соседей

Ввод и экспорт данных с использованием Pandas IO

Техники комбинирования Pandas DataFrame

Деревья решений

Линейная регрессия

Кластеризация и инсайты

Понимание кривых валидации

Понимание метрик и оценки моделей

Введение

Укрепите продвинутые навыки в 21 самостоятельном испытании: 15 посвящены Pandas, а шесть переходят к scikit-learn. По требованиям и примерам вы реализуете очистку, выборку, преобразование, агрегацию, временные ряды, файловый IO, объединение DataFrame, визуализацию и машинное обучение.

Сборник включает одно задание Beginner и двадцать Intermediate. Сценарии используют небольшие данные о продажах, финансах, клиентах, погоде и фильмах, а затем встроенные наборы для классификации, регрессии, кластеризации, проверки и оценки моделей. Это прикладная практика, а не пошаговое введение в Pandas.

Чему вы научитесь

  • Очищать пропуски, дубликаты, несогласованные даты и строки и создавать признаки
  • Фильтровать таблицы через MultiIndex, where, query, булевы свёртки и свои функции
  • Переиндексировать, преобразовывать, группировать, нормализовать, ресемплировать, сдвигать и агрегировать данные
  • Сравнивать годовые данные и объединять таблицы конкатенацией, merge и join по индексу
  • Импортировать и экспортировать CSV и JSON и строить аналитические графики
  • Обучать и оценивать k-NN, деревья решений и логистические классификаторы
  • Строить линейную, Ridge- и Lasso-регрессию с отбором признаков и кросс-валидацией
  • Сравнивать K-means, иерархическую кластеризацию и DBSCAN, кривые валидации и метрики

Для кого этот курс

Курс предназначен для учащихся с устойчивыми основами Pandas, которым нужна сложная практика и введение в табличные workflows scikit-learn. Он подходит самостоятельным учащимся, способным читать спецификации, отлаживать начальный код и выбирать операции без полного руководства.

Предварительные требования: Нужно владеть функциями Python и выборкой, фильтрацией, группировкой, обработкой пропусков и загрузкой файлов в Pandas. Основы статистики и машинного обучения настоятельно рекомендуются для шести заданий scikit-learn.

Учебная среда: Все 21 испытание работают в WebIDE Ubuntu 22.04 с начальными файлами, локальными данными и проверками. Визуализация использует Matplotlib или похожие средства, ML — встроенные наборы scikit-learn и локальные файлы; внешний аккаунт не нужен.

Часто задаваемые вопросы

Курс посвящён только Pandas?

Нет. 15 испытаний работают с Pandas, но шесть используют scikit-learn для k-NN, деревьев, линейной регрессии, кластеризации, кривых валидации и оценки. Убедитесь, что такое расширение соответствует вашим целям.

Подойдёт ли курс полному новичку?

Нет. Хотя каталог указывает Beginner, 20 из 21 испытания помечены Intermediate. Предполагается умение выбирать, преобразовывать, группировать и отлаживать данные Pandas с минимумом подсказок.

Есть ли пошаговое руководство и нужен ли порядок?

Даны требования, примеры, начальные файлы и проверки, но не полные решения. 21 сценарий независим; внутри многоэтапного задания соблюдайте порядок, если поздние шаги используют ранние результаты.

Нужны ли внешние данные или облачные аккаунты?

Нет. Pandas-задачи используют локальные CSV, JSON или таблицы, а ML — локальные файлы или встроенные наборы scikit-learn. Всё выполняется в предоставленной среде.

Преподаватель

labby
Labby
Labby is the LabEx teacher.