비지도 학습: 클러스터링

본 과정에서는 비지도 학습을 완벽하게 이해하고, 비지도 학습을 사용하여 데이터 클러스터링을 수행하는 방법을 배우게 됩니다.

Python데이터 과학

💡 이 튜토리얼은 영어로 번역되었습니다. 원본을 보려면 영어로 전환

소개

9개의 Jupyter Notebook에서 클러스터링이 레이블 없는 데이터의 구조를 찾는 방법을 배웁니다. 지도·비지도 학습의 차이에서 중심, 계층, 밀도, 그래프 기반 방법으로 진행하고 데이터 모양과 크기에 따른 결과를 비교합니다.

알고리즘 직관, 일부 Python 구현, scikit-learn 모델, 응용 과제를 결합합니다. 픽셀 클러스터링으로 이미지를 압축하고, 밀 씨앗 dendrogram을 만들며, 공유 자전거 밀집 지역과 이상치를 찾고, 8개 방법을 비교합니다.

학습 내용

  • 비지도 클러스터링과 지도 예측 구분하기
  • K-Means 핵심 단계를 구현하고 K, K-Means++, Mini-Batch K-Means 살펴보기
  • Mini-Batch K-Means로 픽셀을 묶어 이미지 색상 압축하기
  • Linkage를 비교하고 응집 계층을 만들며 BIRCH와 PCA 살펴보기
  • 밀 씨앗 데이터의 dendrogram을 생성하고 잘라 표시하기
  • DBSCAN 및 HDBSCAN 개념을 불규칙 군집, 밀도, 노이즈에 적용하기
  • DBSCAN으로 공유 자전거 좌표를 묶고 공간 이상치 표시하기
  • Spectral clustering을 사용하고 moons, circles, blobs, 크기에서 8개 알고리즘 비교하기

추천 대상

Python과 입문 머신 러닝을 알고 여러 클러스터링 계열의 쓰임을 이해하려는 학습자를 위한 과정입니다. 거리, 중심, 밀도, 계층 트리, 그래프, 시각 결과, 실행 시간의 관계를 다룹니다. 초급으로 표시되지만 첫 프로그래밍 강좌보다 깊습니다.

선수 지식: Python, NumPy, Pandas, Matplotlib, scikit-learn 기본 흐름을 권장합니다. 벡터, 거리, 행렬, 모델 API 이해가 도움이 되며 클러스터링 경험은 필요하지 않습니다.

학습 환경: 9개 활동은 제공되는 Ubuntu 22.04 Jupyter 환경에서 실행되며 설명, 시각화, 이미지와 CSV, 예제, 코드 과제를 포함합니다.

자주 묻는 질문

알고리즘을 구현하나요, scikit-learn만 호출하나요?

둘 다 합니다. K-Means, 계층, DBSCAN, spectral 방법의 아이디어와 일부 단계를 배우고 scikit-learn과 SciPy로 모델과 dendrogram을 만듭니다.

어떤 방법을 다루나요?

K-Means, K-Means++, Mini-Batch K-Means, 응집, BIRCH, DBSCAN, HDBSCAN 개념, spectral, Affinity Propagation, Mean Shift를 다룹니다.

합성 점 외에 응용 과제가 있나요?

네. 청두 이미지를 압축하고, 밀 씨앗을 클러스터링하며, 자전거 위도·경도에서 밀집 지역과 이상치를 찾습니다.

최신 scikit-learn에 그대로 복사할 수 있나요?

준비된 환경에서는 실행되지만 일부 예제는 affinity 같은 이전 인수를 사용합니다. 새 환경에서는 현재 API를 확인하고 더 이상 권장되지 않는 인수를 수정하세요.

강사

labby
Labby
Labby is the LabEx teacher.