Научитесь объяснять неудачные запросы, измерять состояние приложения, наблюдать сигналы тревоги и выявлять изменения ресурсов. Вы будете использовать CloudWatch Logs, метрики CloudWatch и CloudTrail для расследования небольших эксплуатационных инцидентов.
Пять пошаговых работ знакомят с сигналами перед самостоятельной задачей исправления сигнала тревоги. Предоставленные компоненты приложения позволяют сосредоточиться на наблюдении и диагностике.
Чему вы научитесь
- Найти неудачный запрос в журналах по его идентификатору
- Публиковать количества запросов и ошибок и измеренную задержку обработчика
- Выбирать измерения метрик, разделяющие приложения
- Наблюдать срабатывание и восстановление сигнала тревоги по результатам реальных запросов
- Связать действие управления с его исполнителем, ресурсом и временем
- Объединять журналы и метрики для диагностики инцидента
- Исправить сигнал тревоги, наблюдающий не то приложение
Для кого предназначен курс
Курс предназначен для начинающих пользователей AWS, разработчиков и будущих специалистов эксплуатации, которым нужно практическое введение в наблюдение приложений и доказательства аудита.
Предварительные требования: Начните с Get Started with AWS on LabEx в AWS Foundations for Beginners. Для аудита изучите идентификацию вызывающего пользователя и Parameter Store. Каждый практикум указывает свои требования по журналам, метрикам и сигналам тревоги.
Учебная среда: Все задания выполняются в предоставленной среде Linux LabEx, доступной через браузер. Используйте Terminal для команд AWS CLI и расположенный рядом AWS View, чтобы проверять то же состояние ресурсов и приложений. Инструменты и подключение уже подготовлены; личный аккаунт AWS и ключи доступа не нужны. Каждая лабораторная работа начинается независимо в новой VM.
Часто задаваемые вопросы
Чем отличаются журналы, метрики, сигналы тревоги и история аудита?
Журналы описывают события; метрики обобщают измеренные величины во времени; сигналы тревоги оценивают выбранную метрику по политике. История управления фиксирует исполнителя, действие, ресурс и время операции плоскости управления. Объединяйте сигналы для объяснения инцидента.
Доказывает ли состояние OK исправность приложения?
Нет. Обработка отсутствующих данных может дать OK. Проверяйте реальные запросы и нужные измерения метрик. Sum подходит для счётчиков; Average описывает измеренную среднюю задержку обработчика, а не процентиль. Прежние ошибки остаются в итогах окна, поэтому подтверждайте восстановление новым идентификатором запроса.
Рекомендуются ли короткие периоды сигналов тревоги для рабочей среды?
Нет. Периоды высокой разрешающей способности в 10 секунд позволяют наблюдать переходы в упражнениях. Хранение, разрешение, периоды и обработка отсутствующих данных влияют на поведение и стоимость. См. понятия CloudWatch и оценку сигналов тревоги.
Удаляет ли очистка все исторические доказательства?
Нет. Удаление ресурса не стирает запись аудита, а существующие точки метрик нельзя удалять по одной через API. Остановите публикацию, удалите точно определённые собственные ресурсы, подтвердите инвентаризацию и затем удалите учётные данные.
Нужен ли весь курс перед Lambda?
Первая работа с журналами запросов даёт необходимые для Lambda основы. Доставка SNS, трассировка X-Ray и полный стек наблюдаемости рабочей среды находятся за рамками курса.





