Узнайте в девяти Jupyter Notebook, как кластеризация выявляет структуру неразмеченных данных. Вы пройдёте от различий с обучением с учителем к центроидным, иерархическим, плотностным и графовым методам и сравните их на разных формах и объёмах.
Курс сочетает интуицию, отдельные реализации, scikit-learn и задачи. Вы сожмёте изображение кластеризацией пикселей, построите дендрограмму семян, найдёте плотные зоны велосипедов и сравните восемь методов.
Чему вы научитесь
- Отличать кластеризацию без учителя от прогнозирования с учителем
- Реализовывать шаги K-Means и исследовать K, K-Means++ и Mini-Batch K-Means
- Сжимать цвета изображения группировкой пикселей
- Сравнивать linkage, строить агломеративные иерархии и изучать BIRCH и PCA
- Создавать и усекать дендрограмму данных семян пшеницы
- Применять DBSCAN и концепции HDBSCAN к сложным формам, плотности и шуму
- Кластеризовать координаты велосипедов и отмечать выбросы через DBSCAN
- Использовать спектральный метод и сравнивать восемь алгоритмов на moons, circles, blobs и объёмах
Для кого этот курс
Курс предназначен для пользователей Python с основами машинного обучения, желающих выбирать семейства кластеризации. Он связывает расстояния, центроиды, плотность, деревья, графы, визуальные результаты и время. Несмотря на начальный уровень, это не первый курс программирования.
Предварительные требования: Рекомендуются Python, NumPy, Pandas, Matplotlib и основы scikit-learn. Полезны векторы, расстояния, матрицы и API моделей; опыт кластеризации не нужен.
Учебная среда: Девять занятий выполняются в Ubuntu 22.04 Jupyter с объяснениями, визуализациями, изображениями, CSV, примерами и кодовыми задачами.
Часто задаваемые вопросы
Алгоритмы реализуются или только вызывается scikit-learn?
И то и другое. Разбираются идеи и шаги K-Means, иерархии, DBSCAN и спектрального метода, затем scikit-learn и SciPy применяются для моделей и дендрограмм.
Какие методы охвачены?
K-Means, K-Means++, Mini-Batch K-Means, агломеративный, BIRCH, DBSCAN, концепции HDBSCAN, спектральный, Affinity Propagation и Mean Shift.
Есть ли практические задачи кроме синтетических точек?
Да. Вы сожмёте изображение Чэнду, кластеризуете семена и проанализируете координаты велосипедов для плотностей и выбросов.
Можно ли копировать примеры в новейший scikit-learn?
Курс работает в подготовленной среде, но некоторые примеры используют старые параметры вроде affinity. В новой среде сверяйтесь с API и обновляйте устаревшие аргументы.





