Aprenda a explicar solicitações com falha, medir a saúde de aplicações, observar alarmes e identificar mudanças nos recursos. Use CloudWatch Logs, métricas do CloudWatch e CloudTrail para investigar pequenos incidentes operacionais.
Cinco laboratórios guiados apresentam os sinais antes de um desafio independente de reparo de alarmes. Aplicações de exemplo fornecidas permitem concentrar-se na observação e no diagnóstico.
O que você vai aprender
- Encontrar uma solicitação com falha nos logs usando seu ID de solicitação
- Publicar contagens de solicitações e erros e a latência medida do manipulador
- Selecionar dimensões de métricas que separem aplicações
- Observar o disparo e a recuperação de um alarme a partir de resultados reais de solicitações
- Rastrear uma ação de gerenciamento até seu autor, recurso e horário
- Combinar logs e métricas para diagnosticar um incidente
- Reparar um alarme que monitora a aplicação errada
Para quem é este curso
Este curso é para iniciantes na AWS, desenvolvedores e futuros operadores que querem uma introdução prática à observação de aplicações e às evidências de auditoria.
Pré-requisitos: Comece com Get Started with AWS on LabEx em AWS Foundations for Beginners. Antes do laboratório de auditoria, aprenda a identidade do chamador e Parameter Store. Cada laboratório informa seus requisitos de logs, métricas e alarmes.
Ambiente de aprendizagem: Todas as atividades são realizadas em um ambiente Linux do LabEx fornecido pelo navegador. Use Terminal para os comandos da AWS CLI e AWS View, ao lado do Terminal, para inspecionar o mesmo estado dos recursos e da aplicação. As ferramentas e a conexão já estão preparadas; você não precisa de uma conta AWS pessoal nem de chaves de acesso. Cada laboratório começa de forma independente em uma nova VM.
Perguntas frequentes
Qual é a diferença entre logs, métricas, alarmes e histórico de auditoria?
Logs descrevem eventos; métricas resumem quantidades medidas ao longo do tempo; alarmes avaliam uma métrica selecionada segundo uma política. O histórico de gerenciamento registra autor, ação, recurso e horário de uma operação do plano de controle. Combine os sinais para explicar um incidente.
Um alarme em OK comprova que a aplicação está saudável?
Não. O tratamento de dados ausentes pode produzir OK. Verifique solicitações reais e as dimensões de métricas pretendidas. Sum ajuda com contagens; Average descreve a latência medida do manipulador, não a latência por percentil. Falhas anteriores continuam nos totais da janela, portanto use um novo ID de solicitação para confirmar a recuperação.
Os períodos curtos dos alarmes são uma recomendação para produção?
Não. Períodos de alta resolução de 10 segundos tornam as transições observáveis nos exercícios. Retenção, resolução, períodos e tratamento de dados ausentes afetam comportamento e custo. Consulte os conceitos do CloudWatch e a avaliação de alarmes.
A limpeza apaga todas as evidências históricas?
Não. Excluir um recurso não apaga seu registro de auditoria, e pontos de dados de métricas existentes não têm uma API de exclusão individual. Pare a publicação, remova exatamente os recursos que criou, confirme o inventário e depois remova as credenciais.
Preciso concluir o curso inteiro antes de Lambda?
O primeiro laboratório de logs de solicitações fornece a base de logs para Lambda. Entrega por SNS, rastreamento com X-Ray e uma plataforma completa de observabilidade de produção estão fora deste curso.





