View a markdown version of this page

本番稼働オペレーション - AWS DevOps エージェント

翻訳は機械翻訳により提供されています。提供された翻訳内容と英語版の間で齟齬、不一致または矛盾がある場合、英語版が優先します。

本番稼働オペレーション

本番環境オペレーションは、コードが本番環境で実行された後にインシデントを検出、対応、防止するのに役立つ一連の機能です。 AWS DevOps Agent は、検出から調査、復旧、防止まで、インシデントのライフサイクル全体で運用チームと協力して作業します。

本番稼働オペレーションの仕組み

AWS DevOps Agent は、Amazon CloudWatch、Datadog、Dynatrace、Grafana、New Relic、Splunk などのオブザーバビリティプラットフォームと、ServiceNow や PagerDuty などのチケットシステム、Slack などの通信ツールを統合することで、本番環境をモニタリングします。アラートが発生したり、サポートチケットが到着すると、エージェントはすぐに調査を開始します。

エージェントは、リソースとその関係の自動生成されたマップであるアプリケーショントポロジを使用して、調査中にサービス間でシグナルを関連付けます。依存関係グラフを使用してメトリクス、ログ、トレース、コード変更、デプロイ履歴をトレースし、根本原因を特定し、爆発半径を評価し、影響を受ける可能性のあるダウンストリームサービスを特定します。

インシデント間で、エージェントは調査履歴全体のパターンを分析し、体系的な改善を特定します。症状ではなく根本原因に対処する、オブザーバビリティ、インフラストラクチャ、ガバナンス、コード最適化にわたるターゲットを絞ったレコメンデーションを生成します。

エージェントがインフラストラクチャを検出する方法の詳細については、「」を参照してくださいDevOps エージェントトポロジとは。モニタリングツールの接続の詳細については、「」を参照してくださいテレメトリソースの接続

本番稼働オペレーションの開始方法

本稼働オペレーション機能の使用を開始するには:

  1. エージェントスペースの作成 — エージェントスペースは、 AWS DevOps エージェントがアクセスして調査できる論理コンテナです。プライマリ AWS アカウントを設定し、チームのオペレーターアクセスを設定します。「エージェントスペースの作成」を参照してください。

  2. テレメトリソースを接続する — エージェントが調査中にメトリクス、ログ、トレースにアクセスできるようにモニタリングプラットフォームを接続します。 AWS DevOps Agent は、Amazon CloudWatch、Datadog、Dynatrace、Grafana、New Relic、Splunk との組み込み統合と、他のツールのウェブフックと MCP サーバーの統合をサポートしています。「テレメトリソースの接続」を参照してください。

  3. Connect チケット作成ツールと通信ツール (オプション) — ServiceNow、PagerDuty、または Slack を接続して、インシデントからの自動調査トリガーとリアルタイムのステータス更新をチームに返すことができます。「チケット発行とチャットへの接続」を参照してください。

  4. トポロジ検出の待機 — アカウントを接続すると、エージェントは自動的にリソースを検出し、アプリケーショントポロジを構築します。これは通常、数分以内に完了し、エージェントが調査中にシグナルを関連付けるために使用するコンテキストを提供します。

  5. 最初の調査を開始する — 調査は、接続されたアラートソースから、ウェブフック経由で、または DevOps エージェントウェブアプリのインシデント対応タブから手動で開始できます。問題を記述するか、「最新のアラーム」や「エラー率スパイク」などの事前設定された開始点を選択して、手動調査を開始してみてください。「自律型インシデント対応」を参照してください。

最初の調査が完了したら、根本原因分析に関するフィードバックを提供し、調査タイムラインを確認し、改善ページでプロアクティブレコメンデーションを調べることができます。

本番運用機能

本稼働オペレーションには、次の 3 つのコア機能が含まれています。

  • 自律型インシデント対応 — エージェントは発生時に問題を自動的に調査し、メトリクス、ログ、トレース、コード変更、デプロイ履歴を分析して根本原因を判断し、緩和策を提案します。「自律型インシデント対応」を参照してください。

  • プロアクティブインシデント防止 — エージェントはインシデント履歴全体のパターンを分析し、将来のインシデントを防ぎ、平均検出時間を短縮するレコメンデーションを生成します。「プロアクティブインシデント防止」を参照してください。

  • オンデマンド DevOps タスク — インフラストラクチャのクエリ、システムの状態の分析、自然言語を使用した調査のガイドを行うための会話型インターフェイス。「オンデマンド DevOps タスク」を参照してください。

本稼働オペレーションがリリース準備にフィードバックする方法

本稼働オペレーションとリリース管理は、継続的なフィードバックループを形成します。本番稼働用インシデントからのインサイトは、本番稼働前の検証に役立つため、リリースプロセスが時間の経過とともにスマートになります。

インシデントパターンがリリースレビューを形成する — エージェントが、エラー処理の欠落、不適切な再試行ロジック、過剰なアクセス許可の IAM ポリシーなど、プロアクティブなインシデント防止を通じて定期的な根本原因を特定する場合、これらのパターンはリリース準備コードレビューが探すものを通知します。エージェントは、環境で本番稼働に障害が発生する原因を深く理解しているため、将来のコードレビューは実際のリスクプロファイルにより関連しています。

予防レコメンデーションはコードの変更を促進 — プロアクティブインシデント防止は、特定のファイルパスと実装プランによるコードと設定の改善を説明するエージェント対応仕様を生成します。これらの仕様は、リリース管理ワークフロー中にコーディングエージェントに渡し、本番の問題から検証済みの修正までのループを閉じることができます。

トポロジの知識は、サービス関係、リクエストパス、デプロイ境界など、本稼働オペレーション中に構築されたアプリケーショントポロジが、リリース準備状況レビュー中に実行されるリポジトリ間の依存関係分析に直接フィードします。エージェントは、インシデント対応中とコードレビュー中の両方で、サービスがどのように相互作用するかについて同じ理解を使用して爆発半径を評価します。

調査フィードバックは、学習したスキルを絞り込みます — 調査に関して提供するフィードバックとレコメンデーションの精度によって、エージェントの学習したスキルが更新されます。これらのスキルが向上するにつれて、インシデント調査とリリースレビューの両方が、環境、運用パターン、効果的な調査手法に関するより正確な知識から恩恵を受けます。