실패한 요청의 원인을 설명하고 애플리케이션 상태를 측정하며 경보와 리소스 변경을 관찰합니다. CloudWatch Logs, CloudWatch 지표, CloudTrail로 작은 운영 사고를 조사합니다.
안내형 실습 5개에서 관측 신호를 익힌 뒤 독립 경보 복구 도전 과제를 수행합니다. 제공되는 애플리케이션 예제를 통해 관찰과 진단에 집중할 수 있습니다.
배울 내용
- 요청 ID로 로그에서 실패한 요청 찾기
- 요청 수, 오류 수, 측정한 핸들러 지연 시간 게시하기
- 애플리케이션을 구분하는 지표 차원 선택하기
- 실제 요청 결과를 바탕으로 경보 발생과 복구 관찰하기
- 관리 작업의 수행자, 리소스, 시간 추적하기
- 로그와 지표를 함께 사용하여 사고 진단하기
- 잘못된 애플리케이션을 감시하는 경보 복구하기
이 과정의 대상
애플리케이션 관찰과 감사 증거를 실무적으로 배우려는 AWS 입문자, 개발자, 운영 입문자를 위한 과정입니다.
사전 요구 사항: AWS Foundations for Beginners의 Get Started with AWS on LabEx부터 시작하세요. 감사 실습에는 호출자 ID와 Parameter Store에 대한 기초 지식이 필요합니다. 각 실습에서 로그, 지표, 경보 관련 선수 지식을 안내합니다.
학습 환경: 모든 활동은 브라우저에서 제공되는 LabEx Linux 환경에서 진행합니다. AWS CLI 명령에는 Terminal을 사용하고, 옆의 AWS View에서 동일한 리소스와 애플리케이션 상태를 확인합니다. 도구와 연결은 준비되어 있으므로 개인 AWS 계정이나 액세스 키가 필요하지 않습니다. 각 실습은 새로운 VM에서 독립적으로 시작합니다.
자주 묻는 질문
로그, 지표, 경보, 감사 기록은 어떻게 다른가요?
로그는 이벤트를 설명하고, 지표는 시간에 따라 측정한 수치를 요약하며, 경보는 선택한 지표를 정책에 따라 평가합니다. 관리 기록은 제어 영역 작업의 수행자, 작업, 리소스, 시간을 기록합니다. 사고를 설명할 때 이 신호들을 함께 사용하세요.
OK 경보가 애플리케이션의 정상 상태를 증명하나요?
아니요. 누락 데이터 처리 방식 때문에 OK가 표시될 수 있습니다. 실제 요청과 의도한 지표 차원을 확인하세요. Sum은 횟수에 유용하고 Average는 측정한 핸들러 지연 시간을 나타내며 백분위 지연 시간이 아닙니다. 이전 실패는 집계 기간의 합계에 남으므로 새 요청 ID로 복구를 확인하세요.
짧은 경보 주기는 프로덕션 권장 사항인가요?
아니요. 고해상도 10초 주기는 실습에서 상태 변화를 관찰하기 위한 것입니다. 보존 기간, 해상도, 주기, 누락 데이터 처리 방식은 동작과 비용에 영향을 줍니다. CloudWatch 개념과 경보 평가를 참고하세요.
정리하면 모든 과거 증거가 삭제되나요?
아니요. 리소스를 삭제해도 감사 기록은 지워지지 않으며 기존 지표 데이터 포인트에는 개별 삭제 API가 없습니다. 게시를 중지하고 직접 만든 정확한 리소스를 제거한 뒤 인벤토리를 확인하고 자격 증명을 제거하세요.
Lambda 전에 전체 과정을 마쳐야 하나요?
첫 요청 로그 실습은 Lambda에 필요한 로그 기초를 제공합니다. SNS 전달, X-Ray 추적, 완전한 프로덕션 관측 시스템은 이 과정 범위 밖입니다.





