Стек наблюдаемости (Observability Stack)

Превратите системы типа «черный ящик» в наблюдаемую инфраструктуру. Вы развернете Prometheus для сбора метрик, Grafana для визуализации и Loki для агрегации логов, чтобы получить глубокое понимание производительности системы.

DevOps EngineerDevOpsLinux

💡 Этот учебник переведен с английского с помощью ИИ. Чтобы просмотреть оригинал, вы можете перейти на английский оригинал

Введение

Конвейер наблюдаемости превращает активность хоста в метрики, доступные для поиска журналы и состояния оповещений. В этом проекте вы локально соберете его из Prometheus, Grafana, Loki, Promtail, Node Exporter и Alertmanager.

Вы соедините компоненты конфигурациями и API: соберете метрики, добавите источник Grafana, отправите активный системный журнал в Loki и вызовете InstanceDown, остановив Node Exporter. Поток однохостового стека проверяется от начала до конца.

Чему вы научитесь

  • Запускать Node Exporter на 9100 и настраивать Prometheus на 9090 для здоровой scrape-цели
  • Provisioning источника Prometheus в Grafana через YAML и проверка API на 8080
  • Запускать Loki на 3100 и настраивать Promtail для активного локального журнала
  • Подтверждать прием логов через Loki label API и различать сбор и хранение
  • Запускать Alertmanager на 9093 и связывать его с Prometheus через alertmanagers
  • Задавать InstanceDown для up == 0, останавливать Node Exporter и проверять firing

Для кого этот курс

Проект предназначен для изучающих DevOps и SRE, готовых собрать локальный конвейер через конфигурацию и проверки.

Предварительные требования: Linux-службы и процессы, YAML, HTTP API, порты, Prometheus scrape, пути журналов и curl; проверочный проект.

Учебная среда: Одноузловой Linux в браузере с sudo, Prometheus, Node Exporter, Grafana, загружаемыми Loki, Promtail и Alertmanager, активным локальным журналом и HTTP; облако не нужно.

Часто задаваемые вопросы

Буду ли я создавать dashboards и panels Grafana?

Нет. Вы только создаете источник Prometheus как код и проверяете его. Dashboards, panels, variables и правила Grafana не входят.

Собираются ли журналы с нескольких серверов?

Нет. Promtail читает /var/log/syslog или другой активный журнал того же хоста и отправляет локальному Loki. Распределенные агенты, retention и object storage не настраиваются.

Alertmanager отправляет email, Slack или webhooks?

Нет. Prometheus направляет оповещение локальному Alertmanager, а вы проверяете firing через API или UI. Внешних получателей нет.

Как выполняется и проверяется сбой?

Вы останавливаете Node Exporter для up == 0. Проверяется его остановка и InstanceDown в состоянии firing в API Prometheus.

Преподаватель

labby
Labby
Labby is the LabEx teacher.