Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.
Opérations de production
Les opérations de production sont l'ensemble des fonctionnalités qui vous aident à détecter les incidents, à y répondre et à les prévenir une fois que votre code est exécuté en production. AWS DevOps L'agent travaille aux côtés de votre équipe opérationnelle tout au long du cycle de vie des incidents, de la détection à l'investigation, en passant par le rétablissement et la prévention.
Comment fonctionnent les opérations de production
AWS DevOps Agent surveille votre environnement de production en s'intégrant à vos plateformes d'observabilité (Amazon CloudWatch, Datadog, Dynatrace, Grafana, New Relic et Splunk) ainsi qu'à des systèmes de billetterie tels que et et à des outils de communication tels que Slack. ServiceNow PagerDuty Lorsqu'une alerte se déclenche ou qu'un ticket d'assistance arrive, l'agent commence immédiatement à enquêter.
L'agent utilise la topologie de votre application (une carte générée automatiquement de vos ressources et de leurs relations) pour corréler les signaux entre les services au cours d'une enquête. Il suit les métriques, les journaux, les traces, les modifications de code et l'historique des déploiements via le graphe de dépendance afin d'identifier la cause première, d'évaluer le rayon d'explosion et de déterminer quels services en aval peuvent être affectés.
Entre les incidents, l'agent analyse les tendances de l'historique de vos enquêtes afin d'identifier les améliorations systémiques. Il génère des recommandations ciblées en matière d'observabilité, d'infrastructure, de gouvernance et d'optimisation du code qui s'attaquent aux causes profondes plutôt qu'aux symptômes.
Pour plus d'informations sur la façon dont l'agent découvre votre infrastructure, consultezQu'est-ce qu'une topologie d' DevOps agent ?. Pour plus de détails sur la connexion de vos outils de surveillance, consultezConnexion de sources de télémétrie.
Démarrage des opérations de production
Pour commencer à utiliser les fonctionnalités des opérations de production :
Créer un espace d'agent — Un espace d'agent est le conteneur logique qui définit ce à quoi l' AWS DevOps agent peut accéder et à quoi il peut enquêter. Configurez votre AWS compte principal et configurez l'accès opérateur pour votre équipe. Consultez Création d'un espace d'agents.
Connectez vos sources de télémétrie : connectez vos plateformes de surveillance afin que l'agent puisse accéder aux métriques, aux journaux et aux traces pendant les enquêtes. AWS DevOps L'agent prend en charge les intégrations intégrées avec Amazon CloudWatch, Datadog, Dynatrace, Grafana, New Relic et Splunk, ainsi que les intégrations de serveurs Webhook et MCP pour d'autres outils. Consultez Connexion de sources de télémétrie.
Connectez les outils de billetterie et de communication (facultatif) : Connect ServiceNow ou Slack pour activer le déclenchement automatique d'enquêtes en cas d'incident et des mises à jour de statut en temps réel pour votre équipe. PagerDuty Consultez Connexion à la billetterie et au chat.
Attendez la découverte de la topologie : après avoir connecté vos comptes, l'agent découvre automatiquement vos ressources et crée une topologie d'application. Cela se termine généralement en quelques minutes et fournit le contexte que l'agent utilise pour corréler les signaux lors des enquêtes.
Commencez votre première enquête : les enquêtes peuvent démarrer automatiquement à partir de sources d'alerte connectées, via des webhooks ou manuellement depuis l'onglet Réponse aux incidents de l'application Web DevOps Agent. Essayez de démarrer une enquête manuelle en décrivant un problème ou en choisissant un point de départ préconfiguré tel que « Dernière alarme » ou « Augmentation du taux d'erreur ». Consultez Réponse autonome aux incidents.
Une fois votre première enquête terminée, vous pouvez fournir des commentaires sur l'analyse des causes profondes, consulter le calendrier de l'enquête et explorer les recommandations proactives sur la page Améliorations.
Capacités des opérations de production
Les opérations de production incluent trois fonctionnalités de base :
Réponse autonome aux incidents : l'agent enquête automatiquement sur les problèmes dès qu'ils surviennent, en analysant les métriques, les journaux, les traces, les modifications du code et l'historique des déploiements afin d'en déterminer la cause première et de proposer des mesures d'atténuation. Consultez Réponse autonome aux incidents.
Prévention proactive des incidents : l'agent analyse les tendances de l'historique de vos incidents afin de générer des recommandations visant à prévenir de futurs incidents et à réduire le délai moyen de détection. Consultez Prévention proactive des incidents.
On-demand DevOps tâches : interface conversationnelle permettant d'interroger votre infrastructure, d'analyser l'état de santé du système et de guider les enquêtes en langage naturel. Consultez DevOps Tâches à la demande.
Comment les opérations de production influent sur la préparation à la sortie
Les opérations de production et la gestion des versions forment une boucle de rétroaction continue. Les informations issues des incidents de production éclairent la validation de la pré-production, ce qui rend votre processus de publication plus intelligent au fil du temps.
Les modèles d'incidents façonnent les révisions des versions : lorsque l'agent identifie les causes profondes récurrentes grâce à une prévention proactive des incidents, telles que l'absence de gestion des erreurs, une logique de nouvelle tentative inadéquate ou des politiques IAM trop autorisées, ces modèles déterminent ce que recherchent les révisions du code de préparation aux versions. La compréhension croissante par l'agent des causes des défaillances de production dans votre environnement rend les futures révisions de code plus pertinentes par rapport à votre profil de risque réel.
Les recommandations de prévention entraînent des modifications du code : la prévention proactive des incidents génère des spécifications prêtes à être utilisées par les agents qui décrivent les améliorations du code et de la configuration avec des chemins de fichiers et des plans de mise en œuvre spécifiques. Ces spécifications peuvent être transmises à un agent de codage pendant le flux de travail de gestion des versions, bouclant ainsi la boucle entre le problème de production et le correctif validé.
La connaissance de la topologie améliore l'analyse des dépendances — La topologie des applications créée au cours des opérations de production, y compris les relations de service, les chemins de demande et les limites de déploiement, alimente directement l'analyse des dépendances entre référentiels effectuée lors des examens de préparation aux versions. L'agent utilise la même compréhension de la façon dont vos services interagissent pour évaluer le rayon d'explosion à la fois lors de la réponse à un incident et lors de la révision du code.
Les commentaires sur les enquêtes affinent les compétences acquises. Les commentaires que vous fournissez sur les enquêtes et l'exactitude des recommandations mettent à jour les compétences acquises par l'agent. Au fur et à mesure que ces compétences s'améliorent, les enquêtes sur les incidents et les révisions des versions bénéficient de connaissances plus précises sur votre environnement, de vos modèles opérationnels et de techniques d'investigation efficaces.