课程 在 AWS 技能树

AWS 监控与审计入门

学习解释失败请求、衡量应用健康、观察告警并识别资源变化。使用 CloudWatch Logs、CloudWatch 指标和 CloudTrail 调查小型运维事件。

AWS

💡 本教程由 AI 辅助翻译自英文原版。如需查看原文,您可以 切换至英文原版

简介

学习解释失败请求、衡量应用健康、观察告警并识别资源变化。使用 CloudWatch Logs、CloudWatch 指标和 CloudTrail 调查小型运维事件。

5 个引导实验先介绍各类信号,再进行独立告警修复挑战。已提供应用配套代码,让你集中练习观察与诊断。

你将学到什么

  • 通过请求 ID 在日志中查找失败请求
  • 发布请求数、错误数和测量的处理程序延迟
  • 选择能区分应用的指标维度
  • 观察实际请求引发的告警与恢复
  • 将管理操作追溯到操作者、资源和时间
  • 结合日志与指标诊断事件
  • 修复监控了错误应用的告警

适合人群

适合希望实践应用观察和审计证据的 AWS 初学者、开发者及运维学习者。

先修要求: 从 AWS Foundations for Beginners 中的 Get Started with AWS on LabEx 开始。审计实验需要基础课的调用者身份和 Parameter Store 知识;日志、指标与告警实验各自说明具体前置。

学习环境: 所有活动都在 LabEx 提供的浏览器 Linux 环境中进行。使用 Terminal 执行 AWS CLI 命令,并在其旁边的 AWS View 查看相同的资源和应用状态。工具与连接已准备好,无需个人 AWS 账户或访问密钥。每个实验都在全新的 VM 中独立开始。

常见问题

日志、指标、告警与审计历史有什么区别?

日志描述事件,指标汇总一段时间内的测量值,告警按策略评估指定指标。管理历史记录控制面操作的操作者、动作、资源和时间。组合这些信号来解释事件。

OK 告警状态能证明应用健康吗?

不能。缺失数据策略也可能产生 OK。需检查实际请求和正确指标维度。Sum 适合计数,Average 表示测量的处理程序延迟而非百分位延迟。窗口总量仍包含之前的失败,应使用新请求 ID 确认恢复。

短告警周期是生产配置建议吗?

不是。高分辨率的 10 秒周期用于快速观察实验变化。保留期、分辨率、周期和缺失数据策略都会影响行为与成本。详见 CloudWatch 概念和告警评估。

清理会删除所有历史证据吗?

不会。删除资源不会删除审计记录,现有指标数据点也没有逐条删除 API。停止发布并移除自己拥有的资源,确认清单后再移除凭据。

学习 Lambda 前需要完成整门课吗?

第一个请求日志实验提供 Lambda 所需的日志基础。SNS 投递、X-Ray 追踪和完整生产可观测性平台不在本课范围内。

教师

labby
Labby
Labby is the LabEx teacher.