初心者向け Scikit-learn

この包括的なコースでは、Python の必須機械学習ライブラリである Scikit-learn の基本的な概念と実践的なテクニックを網羅します。様々なアルゴリズムと前処理技術を使用して、機械学習モデルの構築、トレーニング、評価方法を学びます。

Pythonデータサイエンス

💡 このチュートリアルは英語版からAIによって翻訳されています。原文を確認するには、 ここをクリックしてください

はじめに

7 つの焦点を絞ったガイド付きラボで、scikit-learn の中核的なワークフローを学びます。ライブラリの設定、実データセットの確認、特徴量の変換、回帰・分類モデルの学習、予測、可視化、分類指標の計算、交差検証を実践します。

小さな Python スクリプトとよく知られたデータセットを使い、各 API 操作を明確に確認します。Iris は探索、前処理、KNN 分類、交差検証に使用し、California Housing は多変量回帰の例に使用します。

学習内容

  • pip で scikit-learn をインストールし、モジュールを import してバージョンを確認し、データセットオブジェクトを調べる
  • Iris を読み込み、特徴量行列、目的ラベル、特徴量名、メタデータにアクセスする
  • Matplotlib で散布図を作成・保存し、特徴量を探索して予測値と実測値を比較する
  • 特徴量と目的変数を分け、StandardScaler で数値特徴量を標準化する
  • LabelEncoder でラベルを符号化し、fit、transform、fit_transform の操作を理解する
  • 訓練・テストデータに分割し、California Housing に LinearRegression を適合させて予測する
  • Iris で 3 近傍の KNeighborsClassifier を学習し、別途、定義済みの二値予測を正解率、混同行列、適合率、再現率、F1 で評価する
  • 線形サポートベクター分類器を 5 分割 cross_val_score で評価し、得点の平均と標準偏差をまとめる

このコースの対象者

このコースは、scikit-learn の estimator ワークフローをコンパクトに学びたい Python 学習者、データ分析初心者、機械学習を始める方を対象としています。簡単な Python スクリプトを読み書きでき、ライブラリは初めてという方に最適です。

前提知識: 変数、import、関数呼び出し、リストまたは配列、簡単なスクリプトの読解といった Python の基礎を推奨します。機械学習の実装経験は不要ですが、訓練データ、特徴量、ラベルの初歩的な理解があると役立ちます。

学習環境: 7 つの初級ラボはすべて、エディターと統合ターミナルを備えた Ubuntu 22.04 WebIDE で実行します。Python ファイルで scikit-learn、NumPy、pandas、Matplotlib を使用し、California Housing ラボは fetch_california_housing() でデータを取得します。

よくある質問

プログラミング完全初心者向けの Python コースですか?

いいえ。scikit-learn の操作は段階的に説明しますが、Python ファイルを編集し、import、変数、関数呼び出し、配列のインデックスを理解できることを前提とします。これらが未経験なら、先に Python 基礎を学んでください。

どのモデルを実装しますか?

California Housing の値に線形回帰を適合させ、Iris のクラスに 3 近傍 KNN を学習します。事前設定された線形サポートベクター分類器で 5 分割交差検証も行います。木、アンサンブル、クラスタリング、ニューラルネットワーク、デプロイは扱いません。

Jupyter Notebook を使いますか?

いいえ。Ubuntu WebIDE で .py スクリプトを編集し、統合ターミナルから実行します。グラフは Notebook セルではなく画像ファイルとして保存します。

本番向けの完全な機械学習プロジェクトを構築しますか?

いいえ。7 つの独立したガイド付きラボが、インストール、探索、前処理、モデル、指標、検証を個別に扱います。API の流れは学びますが、Pipeline、ハイパーパラメーター探索、デプロイ、監視、本番データ基盤は範囲外です。

講師

labby
Labby
Labby is the LabEx teacher.