Pandas 실습 챌린지

본 과정은 Pandas 를 위한 다양한 챌린지를 포함하고 있으며, 각 챌린지는 상세한 지침과 솔루션을 갖춘 작은 Pandas 프로젝트입니다. 이러한 챌린지를 해결하여 Pandas 기술을 연습하고, 문제 해결 능력을 향상시키며, 깔끔하고 효율적인 코드를 작성하는 방법을 배울 수 있습니다.

Python데이터 과학

💡 이 튜토리얼은 영어로 번역되었습니다. 원본을 보려면 영어로 전환

소개

21개의 독립적인 프로그래밍 과제로 심화 데이터 역량을 강화합니다. 15개는 Pandas에 집중하고 6개는 scikit-learn으로 확장되며, 요구 사항과 예제를 바탕으로 정리, 선택, 변환, 집계, 시계열, 파일 IO, DataFrame 결합, 시각화, 머신 러닝을 구현합니다.

1개의 Beginner와 20개의 Intermediate 과제로 구성됩니다. 판매, 금융, 고객, 날씨, 영화 등의 작은 데이터에서 시작해 분류, 회귀, 클러스터링, 모델 검증, 평가를 위한 내장 데이터셋으로 발전합니다. 단계별 Pandas 입문이 아니라 응용 연습과 자기 평가 과정입니다.

학습 내용

  • 결측, 중복, 불일치, 날짜, 문자열 데이터를 정리하고 새 특성 만들기
  • MultiIndex 접근자, where, query, 불리언 축약, 사용자 함수로 표 조작하기
  • Series와 DataFrame 재인덱싱, 변환, 그룹화, 정규화, 리샘플링, 이동, 집계하기
  • 연도별 데이터를 비교하고 연결, 병합, 인덱스 조인으로 표 결합하기
  • CSV와 JSON을 가져오고 내보내며 분석 그래프 만들기
  • k-NN, 결정 트리, 로지스틱 분류 모델 학습 및 평가하기
  • 특성 선택과 교차 검증으로 선형, Ridge, Lasso 회귀 구성하기
  • K-means, 계층 클러스터링, DBSCAN과 검증 곡선 및 평가 지표 비교하기

추천 대상

Pandas 기초가 확립되어 있고 다양한 고난도 구현 연습과 scikit-learn 표 데이터 워크플로 입문을 원하는 학습자에게 적합합니다. 명세를 해석하고 시작 코드를 디버깅하며 완전한 해설 없이 알맞은 작업을 선택할 수 있어야 합니다.

선수 지식: Python 함수와 Pandas 선택, 필터링, 그룹화, 결측값 처리, 파일 불러오기에 익숙해야 합니다. 6개의 scikit-learn 과제에는 기초 통계와 머신 러닝 개념을 강력히 권장합니다.

학습 환경: 21개 과제 모두 Ubuntu 22.04 WebIDE에서 시작 파일, 로컬 데이터, 검증을 제공합니다. 시각화는 Matplotlib 등의 도구를, ML은 scikit-learn 내장 데이터나 로컬 파일을 사용하며 외부 계정은 필요하지 않습니다.

자주 묻는 질문

Pandas만 다루는 과정인가요?

아니요. 15개는 Pandas지만 6개는 scikit-learn으로 k-NN, 결정 트리, 선형 회귀, 클러스터링, 검증 곡선, 평가 지표를 다룹니다. 이 머신 러닝 확장이 목표에 맞는지 확인하세요.

완전한 초보자에게 적합한가요?

아니요. 카탈로그는 Beginner이지만 21개 중 20개가 Intermediate입니다. 제한된 안내로 Pandas 데이터를 선택, 변환, 그룹화, 디버깅할 수 있다고 가정합니다.

안내형이며 순서대로 해야 하나요?

요구 사항, 예제, 시작 파일, 검사는 있지만 완성 해설은 없습니다. 21개 시나리오는 독립적이며, 다단계 시나리오에서 이전 출력에 의존할 때만 순서대로 진행합니다.

외부 데이터나 클라우드 계정이 필요한가요?

아니요. Pandas 과제는 로컬 CSV, JSON, 생성 표를 사용하고 ML 과제는 로컬 파일이나 scikit-learn 내장 데이터를 사용합니다. 모두 제공 환경에서 수행됩니다.

강사

labby
Labby
Labby is the LabEx teacher.