7개의 중급 코드 완성 챌린지를 통해 scikit-learn 문제 해결 역량을 강화합니다. 각 챌린지는 시작 파일과 구체적인 TODO 요구 사항을 제공하며, 모델 학습, 평가, 튜닝, 해석 또는 시각화를 위한 함수를 직접 구현합니다.
20개 작업 단계는 지도 및 비지도 학습을 아우르며 지표, Naive Bayes, KNN, 검증 곡선, 결정 트리, 선형 및 정규화 회귀, 세 가지 군집화 방법을 다룹니다. 모든 작업에 자동 검사와 참고 해답이 있습니다.
학습 내용
- 분류를 정확도, 정밀도, 재현율, F1로 평가하고 회귀를 MSE, MAE, RMSE, R²로 평가하기
- 사용자 정의 scorer를 만들고 스케일링된 SVR Pipeline을 그리드 검색과 함께 사용하기
- Iris에 Gaussian Naive Bayes를 학습하고 특성을 스케일링하며 Gaussian, Multinomial, Bernoulli 변형을 비교하고 혼동 행렬 출력하기
- Iris를 분할하고 KNN을 학습해 예측을 평가하며 더 나은
k값 찾기 - 결정 트리
max_depth의 검증 곡선을 만들고 교차 검증 점수로 깊이를 선택해 재학습 및 테스트하기 - pandas에서 Iris를 준비하고
DecisionTreeClassifier를 학습해 정밀도, 재현율, F1 요약하기 - 제공된 CSV에 선형 회귀를 학습하고 회귀 지표를 계산하며 Ridge와 Lasso를 교차 검증으로 비교하기
- Iris에 K-means, 응집 군집화, DBSCAN을 적용하고 실루엣 점수를 비교해 군집 시각화하기
추천 대상
이 과정은 입문 모델 실습을 완료하고 더 독립적인 구현 연습을 원하는 Python 및 scikit-learn 학습자를 위한 과정입니다. 시작 코드를 읽고 함수 본문을 완성하며 요구 사항을 해석하고 실패한 검사를 디버깅할 수 있어야 합니다.
선수 지식: Python, NumPy 또는 pandas 데이터 구조, 훈련/테스트 분할, estimator의 fit과 predict, 기본 분류 및 회귀 개념을 권장합니다. Python 구문을 처음부터 가르치지는 않습니다.
학습 환경: 7개 챌린지는 Ubuntu 22.04 WebIDE에서 실행됩니다. 20개의 중급 작업 단계마다 자동 검사와 참고 해답이 있습니다. 6개 환경은 scikit-learn 1.2.2를 고정하고, 지표 챌린지는 기존 Boston Housing 연습 때문에 1.1.3과 NumPy 2 미만을 사용합니다.
자주 묻는 질문
scikit-learn을 처음 배우는 과정으로 적합한가요?
가장 적합하지는 않습니다. 과정 수준은 초급으로 표시되지만 7개 챌린지는 모두 개별적으로 중급이며 TODO 중심 시작 코드에서 출발합니다. fit, predict, 지표, 데이터 분할이 처음이라면 먼저 가이드형 기초를 학습하세요.
어느 정도의 안내와 피드백이 제공되나요?
각 작업은 필요한 함수나 출력을 설명하고 시작 프로젝트 파일을 제공하지만 누락된 로직은 직접 구현합니다. 20개 작업 단계 각각에 자동 검사 1개와 참고 해답 1개가 있습니다.
어떤 데이터셋을 사용하나요?
여러 챌린지가 Iris를 재사용합니다. 지표 작업은 Breast Cancer와 기존 Boston Housing도 사용하고, 선형 회귀 챌린지는 자체 CSV를 제공합니다. 대규모 운영 데이터셋 개요가 아니라 알고리즘 중심 연습입니다.
최신 scikit-learn에서 코드가 수정 없이 실행되나요?
모두 그렇지는 않습니다. 지표 챌린지는 이후 제거된 Boston Housing loader를 가져오기 때문에 의도적으로 scikit-learn 1.1.3을 설치하고, 나머지는 1.2.2를 고정합니다. 해당 연습은 버전 전용으로 보고 현대 프로젝트에서는 현재 지원 데이터셋으로 바꾸세요.




