学习解释失败请求、衡量应用健康、观察告警并识别资源变化。使用 CloudWatch Logs、CloudWatch 指标和 CloudTrail 调查小型运维事件。
5 个引导实验先介绍各类信号,再进行独立告警修复挑战。已提供应用配套代码,让你集中练习观察与诊断。
你将学到什么
- 通过请求 ID 在日志中查找失败请求
- 发布请求数、错误数和测量的处理程序延迟
- 选择能区分应用的指标维度
- 观察实际请求引发的告警与恢复
- 将管理操作追溯到操作者、资源和时间
- 结合日志与指标诊断事件
- 修复监控了错误应用的告警
适合人群
适合希望实践应用观察和审计证据的 AWS 初学者、开发者及运维学习者。
先修要求: 从 AWS Foundations for Beginners 中的 Get Started with AWS on LabEx 开始。审计实验需要基础课的调用者身份和 Parameter Store 知识;日志、指标与告警实验各自说明具体前置。
学习环境: 所有活动都在 LabEx 提供的浏览器 Linux 环境中进行。使用 Terminal 执行 AWS CLI 命令,并在其旁边的 AWS View 查看相同的资源和应用状态。工具与连接已准备好,无需个人 AWS 账户或访问密钥。每个实验都在全新的 VM 中独立开始。
常见问题
日志、指标、告警与审计历史有什么区别?
日志描述事件,指标汇总一段时间内的测量值,告警按策略评估指定指标。管理历史记录控制面操作的操作者、动作、资源和时间。组合这些信号来解释事件。
OK 告警状态能证明应用健康吗?
不能。缺失数据策略也可能产生 OK。需检查实际请求和正确指标维度。Sum 适合计数,Average 表示测量的处理程序延迟而非百分位延迟。窗口总量仍包含之前的失败,应使用新请求 ID 确认恢复。
短告警周期是生产配置建议吗?
不是。高分辨率的 10 秒周期用于快速观察实验变化。保留期、分辨率、周期和缺失数据策略都会影响行为与成本。详见 CloudWatch 概念和告警评估。
清理会删除所有历史证据吗?
不会。删除资源不会删除审计记录,现有指标数据点也没有逐条删除 API。停止发布并移除自己拥有的资源,确认清单后再移除凭据。
学习 Lambda 前需要完成整门课吗?
第一个请求日志实验提供 Lambda 所需的日志基础。SNS 投递、X-Ray 追踪和完整生产可观测性平台不在本课范围内。





