Ненадзорное обучение: Кластеризация

В этом курсе вы полностью поймете ненадзорное обучение и научитесь использовать его для кластеризации данных.

PythonНаука о данных

💡 Этот учебник переведен с английского с помощью ИИ. Чтобы просмотреть оригинал, вы можете перейти на английский оригинал

Введение

Узнайте в девяти Jupyter Notebook, как кластеризация выявляет структуру неразмеченных данных. Вы пройдёте от различий с обучением с учителем к центроидным, иерархическим, плотностным и графовым методам и сравните их на разных формах и объёмах.

Курс сочетает интуицию, отдельные реализации, scikit-learn и задачи. Вы сожмёте изображение кластеризацией пикселей, построите дендрограмму семян, найдёте плотные зоны велосипедов и сравните восемь методов.

Чему вы научитесь

  • Отличать кластеризацию без учителя от прогнозирования с учителем
  • Реализовывать шаги K-Means и исследовать K, K-Means++ и Mini-Batch K-Means
  • Сжимать цвета изображения группировкой пикселей
  • Сравнивать linkage, строить агломеративные иерархии и изучать BIRCH и PCA
  • Создавать и усекать дендрограмму данных семян пшеницы
  • Применять DBSCAN и концепции HDBSCAN к сложным формам, плотности и шуму
  • Кластеризовать координаты велосипедов и отмечать выбросы через DBSCAN
  • Использовать спектральный метод и сравнивать восемь алгоритмов на moons, circles, blobs и объёмах

Для кого этот курс

Курс предназначен для пользователей Python с основами машинного обучения, желающих выбирать семейства кластеризации. Он связывает расстояния, центроиды, плотность, деревья, графы, визуальные результаты и время. Несмотря на начальный уровень, это не первый курс программирования.

Предварительные требования: Рекомендуются Python, NumPy, Pandas, Matplotlib и основы scikit-learn. Полезны векторы, расстояния, матрицы и API моделей; опыт кластеризации не нужен.

Учебная среда: Девять занятий выполняются в Ubuntu 22.04 Jupyter с объяснениями, визуализациями, изображениями, CSV, примерами и кодовыми задачами.

Часто задаваемые вопросы

Алгоритмы реализуются или только вызывается scikit-learn?

И то и другое. Разбираются идеи и шаги K-Means, иерархии, DBSCAN и спектрального метода, затем scikit-learn и SciPy применяются для моделей и дендрограмм.

Какие методы охвачены?

K-Means, K-Means++, Mini-Batch K-Means, агломеративный, BIRCH, DBSCAN, концепции HDBSCAN, спектральный, Affinity Propagation и Mean Shift.

Есть ли практические задачи кроме синтетических точек?

Да. Вы сожмёте изображение Чэнду, кластеризуете семена и проанализируете координаты велосипедов для плотностей и выбросов.

Можно ли копировать примеры в новейший scikit-learn?

Курс работает в подготовленной среде, но некоторые примеры используют старые параметры вроде affinity. В новой среде сверяйтесь с API и обновляйте устаревшие аргументы.

Преподаватель

labby
Labby
Labby is the LabEx teacher.