教師なし学習:クラスタリング

このコースでは、教師なし学習を完全に理解し、教師なし学習を使ってデータのクラスタリングを行う方法を学びます。

Pythonデータサイエンス

💡 このチュートリアルは英語版からAIによって翻訳されています。原文を確認するには、 ここをクリックしてください

はじめに

9 つの Jupyter Notebook で、ラベルなしデータからクラスタリングが構造を見つける方法を学びます。教師ありとの違いから、重心・階層・密度・グラフに基づく手法へ進み、データの形状と規模による挙動を比較します。

アルゴリズムの直感、部分的な Python 実装、scikit-learn、応用課題を組み合わせます。画素クラスタリングによる画像圧縮、種子のデンドログラム、自転車の高密度領域と外れ値、8 手法の比較を行います。

学習内容

  • 教師なしクラスタリングと教師あり予測を区別する
  • K-Means の主要手順を実装し、K、K-Means++、Mini-Batch K-Means を調べる
  • Mini-Batch K-Means で画素をまとめて画像の色を圧縮する
  • linkage を比較し、凝集階層を構築して BIRCH と PCA を調べる
  • 小麦種子データのデンドログラムを作成・切り詰める
  • DBSCAN と HDBSCAN の概念を不規則なクラスタ、密度、ノイズに適用する
  • DBSCAN で共有自転車の座標をクラスタリングし、空間的外れ値を示す
  • スペクトラルクラスタリングを使い、moons、circles、blobs、規模で 8 手法を比較する

このコースの対象者

Python と入門的な機械学習を理解し、クラスタリング各系統の使い分けを学びたい方に向いています。距離、重心、密度、階層木、グラフ、可視化、実行時間を結び付けます。初級表記ですが、最初のプログラミング講座より先の内容です。

前提知識: Python、NumPy、Pandas、Matplotlib、scikit-learn の基本を推奨します。ベクトル、距離、行列、モデル API の理解が役立ちます。クラスタリング経験は不要です。

学習環境: 9 つの活動は Ubuntu 22.04 Jupyter 環境で行います。説明、可視化、画像と CSV、実行例、コード課題が用意されています。

よくある質問

アルゴリズムを実装しますか、それとも scikit-learn だけですか?

両方です。K-Means、階層、DBSCAN、スペクトラルの考え方と一部手順を学び、scikit-learn と SciPy で実用モデルやデンドログラムを作ります。

どの手法を扱いますか?

K-Means、K-Means++、Mini-Batch K-Means、凝集、BIRCH、DBSCAN、HDBSCAN の概念、スペクトラル、Affinity Propagation、Mean Shift です。

合成点群以外の応用課題はありますか?

はい。成都の画像を圧縮し、小麦種子をクラスタリングし、自転車の緯度経度から高密度領域と外れ値を調べます。

最新版 scikit-learn にそのままコピーできますか?

用意された環境では動作しますが、一部に affinity など古い引数があります。新環境では現行 API を確認し、非推奨引数を更新してください。

講師

labby
Labby
Labby is the LabEx teacher.