관측 가능성 스택 (Observability Stack)

블랙박스 시스템을 관측 가능한 인프라로 전환합니다. 메트릭 수집을 위해 Prometheus, 시각화를 위해 Grafana, 로그 집계를 위해 Loki 를 배포하여 시스템 성능에 대한 깊은 통찰력을 확보합니다.

DevOps EngineerDevOpsLinux

💡 이 튜토리얼은 영어로 번역되었습니다. 원본을 보려면 영어로 전환

소개

관측 가능성 파이프라인은 호스트 활동을 메트릭, 검색 가능한 로그, 대응 가능한 알림 상태로 변환합니다. 이 챌린지형 프로젝트에서는 Prometheus, Grafana, Loki, Promtail, Node Exporter, Alertmanager로 로컬 파이프라인을 구성합니다.

구성 파일과 실제 API로 구성 요소를 연결해 호스트 메트릭을 Scrape하고, Grafana Data Source를 Provisioning하고, 활성 System Log를 Loki로 보내고, Node Exporter 중지로 InstanceDown을 발생시킵니다. 단일 호스트 흐름을 끝까지 검증합니다.

학습 내용

  • Node Exporter를 9100, Prometheus를 9090에서 실행하고 정상 Scrape Target으로 구성하기
  • Grafana Prometheus Data Source를 YAML로 Provisioning하고 8080 API에서 확인하기
  • Loki를 3100에서 시작하고 Promtail로 활성 로컬 System Log 추적하기
  • Loki Label API로 Log Ingestion을 확인하고 Collector와 Storage 역할 구분하기
  • Alertmanager를 9093에서 실행하고 alertmanagers 설정으로 Prometheus와 연결하기
  • up == 0의 InstanceDown을 정의하고 Node Exporter를 중지해 firing 상태 확인하기

추천 대상

구성과 서비스 검사로 로컬 관측 가능성 파이프라인을 조립할 DevOps 및 SRE 학습자에게 적합합니다.

선수 지식: Linux 서비스·프로세스, YAML, HTTP API, 포트, Prometheus Scrape, 로그 경로, curl에 익숙해야 하는 평가형 프로젝트입니다.

학습 환경: sudo, Prometheus, Node Exporter, Grafana, 다운로드 가능한 Loki·Promtail·Alertmanager, 활성 로컬 로그, HTTP 접근이 있는 브라우저 기반 단일 노드 Linux이며 클라우드는 필요하지 않습니다.

자주 묻는 질문

Grafana Dashboard와 Panel을 만드나요?

아니요. Prometheus Data Source만 코드로 Provisioning하고 검증합니다. Dashboard, Panel, Variable, Grafana Alert Rule은 범위 밖입니다.

여러 서버의 로그를 수집하나요?

아니요. Promtail이 같은 호스트의 /var/log/syslog 또는 활성 로그를 로컬 Loki로 보냅니다. 분산 Agent, Retention, Object Storage는 구성하지 않습니다.

Alertmanager가 이메일, Slack, Webhook을 보내나요?

아니요. Prometheus가 로컬 Alertmanager로 라우팅하고 API 또는 UI에서 firing을 확인합니다. 외부 Receiver는 없습니다.

장애는 어떻게 실행하고 검증하나요?

Node Exporter를 중지해 up == 0을 만듭니다. Exporter 중지와 Prometheus API의 InstanceDown firing 상태를 확인합니다.

강사

labby
Labby
Labby is the LabEx teacher.