本文属于机器翻译版本。若本译文内容与英语原文存在差异,则一律以英文原文为准。
生产运营
生产操作是一组功能,可在代码在生产环境中运行后帮助您检测、响应和预防事件。 AWS DevOps 从检测到调查、恢复和预防,代理在整个事件生命周期中与您的运营团队合作。
生产运营是如何运作的
AWS DevOps Agent 通过与您的可观察性平台(亚马逊 CloudWatch、Datadog、Dynatrace、Grafana、New Relic 和 Splunk)以及诸如和之类的票务系统和 Slack 等通信工具集成来监控您的生产环境。 ServiceNow PagerDuty当警报触发或支持请求到来时,代理会立即开始调查。
在调查期间,代理使用您的应用程序拓扑(自动生成的资源及其关系地图)来关联服务间的信号。它通过依赖关系图跟踪指标、日志、跟踪、代码更改和部署历史记录,以确定根本原因,评估爆炸半径并确定哪些下游服务可能受到影响。
在两次事件之间,代理会分析您的调查历史中的模式,以确定系统性改进。它针对可观察性、基础架构、治理和代码优化生成有针对性的建议,以解决根本原因而不是症状。
有关代理如何发现您的基础设施的更多信息,请参阅什么是 DevOps 代理拓扑?。有关连接监控工具的详细信息,请参阅连接遥测源。
生产运营入门
要开始使用生产运营功能,请执行以下操作:
创建代理空间-代理空间是定义 AWS DevOps 代理可以访问和调查哪些内容的逻辑容器。配置您的主 AWS 账号并为您的团队设置操作员访问权限。请参阅创建代理空间。
连接您的遥测源 — 连接您的监控平台,以便代理可以在调查期间访问指标、日志和跟踪。 AWS DevOps 代理支持与亚马逊 CloudWatch、Datadog、Dynatrace、Grafana、New Relic 和 Splunk 的内置集成,以及其他工具的 webhook 和 MCP 服务器集成。请参阅连接遥测源。
Connect 工单和通信工具(可选)— Connect ServiceNow PagerDuty、或 Slack,用于自动触发事件的调查,并将实时状态更新反馈给您的团队。请参阅连接票务和聊天。
等待拓扑发现-连接您的账户后,代理会自动发现您的资源并构建应用程序拓扑。这通常在几分钟内完成,并提供了代理在调查期间用来关联信号的上下文。
开始首次调查 — 调查可以从连接的警报源自动开始,也可以通过 webhook 启动,也可以从客服 Web 应用程序的 “事件响应” 选项卡手动 DevOps 开始。尝试通过描述问题或选择预先配置的起点(例如 “最新警报” 或 “错误率峰值”)来开始手动调查。请参阅自主事件响应。
首次调查完成后,您可以提供有关根本原因分析的反馈,查看调查时间表,并在 “改进” 页面上探索主动建议。
生产运营能力
生产运营包括三项核心能力:
自主事件响应 — 代理在问题发生时自动调查问题,分析指标、日志、跟踪、代码更改和部署历史记录,以确定根本原因并提出缓解建议。请参阅自主事件响应。
主动事件预防 — 代理会分析您的事件历史记录中的模式,以生成建议,防止将来发生事件并缩短平均检测时间。请参阅主动预防事故。
On-demand DevOps 任务 — 对话界面,用于使用自然语言查询基础架构、分析系统运行状况和指导调查。请参阅按需 DevOps 任务。
生产运营如何反馈到发布准备状态
生产运营和发布管理形成了持续的反馈循环。从生产事件中获得的见解可以为生产前验证提供信息,从而使您的发布过程随着时间的推移变得更加智能。
事件模式决定了发布审查 — 当代理通过主动的事件预防来确定反复出现的根本原因(例如错误处理缺失、重试逻辑不足或权限过高的 IAM 政策)时,这些模式会为发布就绪代码审查的目标提供信息。代理对导致环境中生产失败的原因的了解越来越多,这使得未来的代码审查与您的实际风险状况更加相关。
预防建议推动代码变更 — 主动式事件预防会生成代理就绪规范,这些规格描述了代码和配置的改进以及特定的文件路径和实施计划。这些规范可以在发布管理工作流程中交给编码代理,从而结束从生产问题到经过验证的修复的循环。
拓扑知识可以改善依赖关系分析 — 在生产运营期间构建的应用程序拓扑(包括服务关系、请求路径和部署边界)直接输入到发布就绪审查期间执行的跨存储库依赖关系分析中。无论是在事件响应期间还是在代码审查期间,代理都使用对服务交互方式的相同理解来评估爆炸半径。
调查反馈可以完善所学技能 — 你提供的调查反馈和建议的准确性会更新代理所学的技能。随着这些技能的提高,事件调查和发布审查都将受益于对您的环境、操作模式和更有效的调查技巧的更准确的了解。