7 つの焦点を絞ったガイド付きラボで、scikit-learn の中核的なワークフローを学びます。ライブラリの設定、実データセットの確認、特徴量の変換、回帰・分類モデルの学習、予測、可視化、分類指標の計算、交差検証を実践します。
小さな Python スクリプトとよく知られたデータセットを使い、各 API 操作を明確に確認します。Iris は探索、前処理、KNN 分類、交差検証に使用し、California Housing は多変量回帰の例に使用します。
学習内容
pipで scikit-learn をインストールし、モジュールを import してバージョンを確認し、データセットオブジェクトを調べる- Iris を読み込み、特徴量行列、目的ラベル、特徴量名、メタデータにアクセスする
- Matplotlib で散布図を作成・保存し、特徴量を探索して予測値と実測値を比較する
- 特徴量と目的変数を分け、
StandardScalerで数値特徴量を標準化する LabelEncoderでラベルを符号化し、fit、transform、fit_transformの操作を理解する- 訓練・テストデータに分割し、California Housing に
LinearRegressionを適合させて予測する - Iris で 3 近傍の
KNeighborsClassifierを学習し、別途、定義済みの二値予測を正解率、混同行列、適合率、再現率、F1 で評価する - 線形サポートベクター分類器を 5 分割
cross_val_scoreで評価し、得点の平均と標準偏差をまとめる
このコースの対象者
このコースは、scikit-learn の estimator ワークフローをコンパクトに学びたい Python 学習者、データ分析初心者、機械学習を始める方を対象としています。簡単な Python スクリプトを読み書きでき、ライブラリは初めてという方に最適です。
前提知識: 変数、import、関数呼び出し、リストまたは配列、簡単なスクリプトの読解といった Python の基礎を推奨します。機械学習の実装経験は不要ですが、訓練データ、特徴量、ラベルの初歩的な理解があると役立ちます。
学習環境: 7 つの初級ラボはすべて、エディターと統合ターミナルを備えた Ubuntu 22.04 WebIDE で実行します。Python ファイルで scikit-learn、NumPy、pandas、Matplotlib を使用し、California Housing ラボは fetch_california_housing() でデータを取得します。
よくある質問
プログラミング完全初心者向けの Python コースですか?
いいえ。scikit-learn の操作は段階的に説明しますが、Python ファイルを編集し、import、変数、関数呼び出し、配列のインデックスを理解できることを前提とします。これらが未経験なら、先に Python 基礎を学んでください。
どのモデルを実装しますか?
California Housing の値に線形回帰を適合させ、Iris のクラスに 3 近傍 KNN を学習します。事前設定された線形サポートベクター分類器で 5 分割交差検証も行います。木、アンサンブル、クラスタリング、ニューラルネットワーク、デプロイは扱いません。
Jupyter Notebook を使いますか?
いいえ。Ubuntu WebIDE で .py スクリプトを編集し、統合ターミナルから実行します。グラフは Notebook セルではなく画像ファイルとして保存します。
本番向けの完全な機械学習プロジェクトを構築しますか?
いいえ。7 つの独立したガイド付きラボが、インストール、探索、前処理、モデル、指標、検証を個別に扱います。API の流れは学びますが、Pipeline、ハイパーパラメーター探索、デプロイ、監視、本番データ基盤は範囲外です。





