Sklearn 実践チャレンジ

このコースには Sklearn に関する多数のチャレンジが含まれています。各チャレンジは、詳細な指示と解決策を備えた小規模な Sklearn プロジェクトです。これらのチャレンジを解くことで、Sklearn のスキルを練習し、問題解決能力を向上させ、クリーンで効率的なコードの書き方を学ぶことができます。

Pythonデータサイエンス

💡 このチュートリアルは英語版からAIによって翻訳されています。原文を確認するには、 ここをクリックしてください

はじめに

7 つの中級コード補完チャレンジで、scikit-learn を使った問題解決力を強化します。各チャレンジにはスターターファイルと具体的な TODO 要件があり、モデルの学習、評価、チューニング、解釈、可視化を行う関数を実装します。

20 のタスクステップは教師あり・教師なし学習を横断し、指標、Naive Bayes、K 近傍、検証曲線、決定木、線形・正則化回帰、3 種類のクラスタリングを扱います。すべてのタスクに自動チェックと参考解答があります。

学習内容

  • 分類を正解率、適合率、再現率、F1 で、回帰を MSE、MAE、RMSE、R² で評価する
  • 独自 scorer を作成し、標準化した SVR Pipeline をグリッドサーチで調整する
  • Iris で Gaussian Naive Bayes を学習し、特徴量をスケーリングして Gaussian、Multinomial、Bernoulli を比較し、混同行列を出力する
  • Iris を分割し、KNN を学習・評価して、より良い k を探索する
  • 決定木の max_depth に対する検証曲線を生成し、交差検証から深さを選び、再学習してテストする
  • pandas で Iris を準備し、DecisionTreeClassifier を適合させ、適合率、再現率、F1 をまとめる
  • 提供された CSV に線形回帰を適合させ、回帰指標を計算し、Ridge と Lasso を交差検証で比較する
  • Iris に K-means、凝集型クラスタリング、DBSCAN を適用し、シルエットスコアを比較してクラスタを可視化する

このコースの対象者

このコースは、入門的なモデル構築演習を終え、より自立した実装練習を求める Python と scikit-learn の学習者向けです。スターターコードを読み、関数本体を補完し、要件を解釈し、失敗したチェックをデバッグできることが必要です。

前提知識: Python、NumPy または pandas のデータ構造、訓練・テスト分割、estimator の fit と predict、分類と回帰の基礎を推奨します。Python 構文をゼロから教えるチャレンジではありません。

学習環境: 7 つのチャレンジは Ubuntu 22.04 WebIDE で実行します。20 の中級タスクに、それぞれ自動チェックと参考解答があります。6 環境は scikit-learn 1.2.2、指標チャレンジは旧 Boston Housing 演習のため 1.1.3 と NumPy 2 未満に固定されています。

よくある質問

scikit-learn の最初の入門として適していますか?

最適ではありません。コース全体は初級表示ですが、7 つのチャレンジはすべて個別に中級で、TODO 中心のスターターコードから始まります。fit、predict、指標、データ分割が初めてなら、先にガイド付き基礎を学んでください。

どの程度のガイドとフィードバックがありますか?

各タスクは必要な関数や出力を説明し、スターターファイルを提供しますが、欠けているロジックは自分で実装します。20 のタスクすべてに 1 つの自動チェックと参考解答があります。

どのデータセットを使いますか?

複数のチャレンジで Iris を再利用します。指標では Breast Cancer と旧 Boston Housing、線形回帰では付属 CSV も使います。大規模な本番データセットの紹介ではなく、アルゴリズムに焦点を当てた練習です。

最新版 scikit-learn で無変更のまま動きますか?

すべては動きません。指標チャレンジは後に削除された Boston Housing loader を import するため、意図的に scikit-learn 1.1.3 をインストールし、他は 1.2.2 に固定されています。この演習はバージョン固有と考え、現代のプロジェクトでは現在サポートされるデータセットに置き換えてください。

講師

labby
Labby
Labby is the LabEx teacher.

おすすめ

no data