Pandas 実践チャレンジ

このコースには、Pandas に関する多数のチャレンジが含まれています。各チャレンジは、詳細な指示と解決策を備えた小規模な Pandas プロジェクトです。これらのチャレンジを解くことで、Pandas のスキルを練習し、問題解決能力を向上させ、クリーンで効率的なコードの書き方を学ぶことができます。

Pythonデータサイエンス

💡 このチュートリアルは英語版からAIによって翻訳されています。原文を確認するには、 ここをクリックしてください

はじめに

21 個の独立したプログラミングチャレンジで高度なデータスキルを強化します。15 個は Pandas、6 個は scikit-learn へ発展し、要件と例からクリーニング、選択、変換、集約、時系列、ファイル IO、DataFrame 結合、可視化、機械学習を実装します。

内訳は Beginner が 1 個、Intermediate が 20 個です。販売、金融、顧客、天気、映画などの小規模データから、分類、回帰、クラスタリング、モデル検証、評価用の組み込みデータへ進みます。Pandas 入門ではなく、応用練習と自己評価のコースです。

学習内容

  • 欠損、重複、不整合、日付、文字列データを整え、新しい特徴を作る
  • MultiIndex アクセサ、where、query、ブール集約、独自関数で表を操作する
  • Series と DataFrame を再インデックス、変換、グループ化、正規化、再標本化、シフト、集約する
  • 年次データを比較し、連結、マージ、インデックス結合で表を組み合わせる
  • CSV と JSON を入出力し、処理結果から分析グラフを作る
  • k-NN、決定木、ロジスティック分類モデルを学習・評価する
  • 特徴選択と交差検証を用いて線形、Ridge、Lasso 回帰を構築する
  • K-means、階層クラスタリング、DBSCAN と検証曲線・評価指標を比較する

このコースの対象者

Pandas の基礎を習得し、難度の高い実装練習と scikit-learn での表データ活用を始めたい方向けです。仕様を読み、開始コードをデバッグし、完全な手順なしで適切な操作を選べる自律的な学習者に適しています。

前提知識: Python 関数と、選択、絞り込み、グループ化、欠損値処理、ファイル読込などの Pandas 操作が必要です。6 個の scikit-learn 課題には統計と機械学習の基礎を強く推奨します。

学習環境: 21 課題すべてで Ubuntu 22.04 WebIDE、開始用 Python ファイル、ローカルデータ、検証を使用します。可視化は Matplotlib 等、機械学習は scikit-learn 組み込みデータまたはローカルファイルを使い、外部アカウントは不要です。

よくある質問

Pandas だけを扱うコースですか?

いいえ。15 課題は Pandas ですが、6 課題は scikit-learn で k-NN、決定木、線形回帰、クラスタリング、検証曲線、評価指標を扱います。この機械学習部分が目標に合うか確認してください。

完全な初心者にも適していますか?

いいえ。カタログ上は Beginner ですが、21 課題中 20 個は Intermediate です。少ない指示で Pandas データを選択、変換、グループ化、デバッグできることを前提とします。

ガイド付きですか。順番に進める必要がありますか?

要件、例、開始ファイル、チェックはありますが、完全な解答手順はありません。21 のシナリオは独立しており、複数ステップ内で前の出力を使う場合のみ順番に進めます。

外部データやクラウドアカウントは必要ですか?

不要です。Pandas 課題はローカル CSV・JSON・生成表、機械学習課題はローカルファイルや scikit-learn 組み込みデータを使用し、すべて提供環境内で完結します。

講師

labby
Labby
Labby is the LabEx teacher.