View a markdown version of this page

Alarmes ProMQL recommandées - Amazon CloudWatch

Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.

Alarmes ProMQL recommandées

Utilisez ces alarmes ProMQL comme équivalentes aux alarmes classiques recommandées. Ils surveillent les mêmes métriques à l'aide de requêtes instantanées ProMQL qui sont évaluées par rapport aux métriques ingérées via le CloudWatch point de terminaison OTLP.

Les alarmes ProMQL sont utilisées EvaluationCriteria avec. PromQLCriteria Contrairement aux alarmes métriques classiques, le seuil est intégré directement dans l'expression de requête ProMQL.

  • Période d'attente  : durée en secondes pendant laquelle une série chronologique doit continuellement dépasser avant que l'alarme ne passe à l'état ALARME.

  • Période de restauration  : durée en secondes pendant laquelle toutes les séries chronologiques doivent cesser d'être piratées avant que l'alarme ne revienne à l'état OK.

  • Intervalle d'évaluation  : fréquence, en secondes, d' CloudWatch exécution de la requête ProMQL.

Note

Ces alarmes nécessitent la publication de mesures via le point de terminaison CloudWatch OTLP. Pour de plus amples informations, veuillez consulter Alarmes ProMQL.

Vous pouvez déployer ces alarmes à l'aide de AWS CloudFormation. Utilisez les PromQLCriteria propriétés EvaluationCriteria et de la AWS::CloudWatch::Alarm ressource.

API REST

4XXError

Étiquettes : ApiName, Stage

Description de l'alarme : Alarme lorsque le taux d'erreur 4XX moyen dépasse 5 % pour une étape de l'API REST.

Objectif : détecter un taux d'erreur client élevé indiquant des problèmes de demande.

Critères ProMQL : avg({__name__="4XXError", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiName="your-api-name",Stage="your-stage"}) > 0.05

Seuil recommandé : 0,05 (intégré dans la requête)

Justification du seuil : détecte un taux d'erreur client supérieur à 5 %, ce qui indique des échecs de demande importants.

Intervalle d'évaluation : 60

Période d'attente : 300

Période de récupération : 300

5XXError

Libellés : ApiName, Stage

Description de l'alarme : Alarme lorsque le taux d'erreur 5XX moyen dépasse 5 % pour une étape de l'API REST.

Objectif : détecter un taux d'erreur de serveur élevé indiquant des défaillances du backend.

Critères ProMQL : avg({__name__="5XXError", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiName="your-api-name",Stage="your-stage"}) > 0.05

Seuil recommandé : 0,05 (intégré dans la requête)

Justification du seuil : détecte un taux d'erreur du serveur supérieur à 5 %, ce qui nécessite une enquête immédiate.

Intervalle d'évaluation : 60

Période en attente : 180

Période de récupération : 300

Latence

Libellés : ApiName, Stage

Description de l'alarme : Alarme lorsque la latence p90 dépasse 2 500 ms pour une étape de l'API REST.

Objectif : détecter une latence p90 élevée affectant l'expérience utilisateur.

Critères ProMQL : histogram_quantile(0.9, {__name__="Latency", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiName="your-api-name",Stage="your-stage"}) > 2500

Seuil recommandé : 2500 (intégré dans la requête)

Justification du seuil : une latence p90 supérieure à 2 500 ms indique des temps de réponse dégradés pour la plupart des requêtes.

Intervalle d'évaluation : 60

Période d'attente : 300

Période de récupération : 300

Count

Libellés : ApiName, Stage

Description de l'alarme : alarme lorsque le nombre total de demandes tombe en dessous de la valeur de référence attendue pour une étape de l'API REST.

Objectif : détecter un faible volume de trafic susceptible d'indiquer des problèmes de routage ou de disponibilité.

Critères ProMQL : sum({__name__="Count", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiName="your-api-name",Stage="your-stage"}) < THRESHOLD

Seuil recommandé : THRESHOLD (intégré dans la requête)

Justification du seuil : définissez-le en fonction de votre niveau de référence de trafic attendu pour détecter les baisses inattendues.

Intervalle d'évaluation : 60

Période d'attente : 600

Période de récupération : 300

API HTTP

4xx

Étiquettes : ApiId, Stage

Description de l'alarme : Alarme lorsque le taux d'erreur 4xx moyen dépasse 5 % pour une étape d'API HTTP.

Objectif : détecter un taux d'erreur client élevé sur les points de terminaison de l'API HTTP.

Critères ProMQL : avg({__name__="4xx", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="your-api-id",Stage="your-stage"}) > 0.05

Seuil recommandé : 0,05 (intégré dans la requête)

Justification du seuil : détecte un taux d'erreur client supérieur à 5 %.

Intervalle d'évaluation : 60

Période d'attente : 300

Période de récupération : 300

5xx

Libellés : ApiId, Stage

Description de l'alarme : Alarme lorsque le taux d'erreur 5xx moyen dépasse 5 % pour une étape d'API HTTP.

Objectif : détecter un taux d'erreur de serveur élevé sur les points de terminaison de l'API HTTP.

Critères ProMQL : avg({__name__="5xx", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="your-api-id",Stage="your-stage"}) > 0.05

Seuil recommandé : 0,05 (intégré dans la requête)

Justification du seuil : détecte un taux d'erreur de serveur supérieur à 5 % nécessitant une enquête.

Intervalle d'évaluation : 60

Période en attente : 180

Période de récupération : 300

Latence

Libellés : ApiId, Stage

Description de l'alarme : Alarme lorsque la latence du p90 dépasse 2 500 ms pour une étape d'API HTTP.

Objectif : détecter une latence p90 élevée sur les points de terminaison de l'API HTTP.

Critères ProMQL : histogram_quantile(0.9, {__name__="Latency", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="your-api-id",Stage="your-stage"}) > 2500

Seuil recommandé : 2500 (intégré dans la requête)

Justification du seuil : une latence p90 supérieure à 2 500 ms indique des temps de réponse dégradés.

Intervalle d'évaluation : 60

Période d'attente : 300

Période de récupération : 300

IntegrationLatency

Libellés : ApiId, Stage

Description de l'alarme : Alarme lorsque la latence d'intégration du p90 dépasse 2 000 ms pour une étape d'API HTTP.

Objectif : détecter les temps de latence élevés liés à l'intégration du backend qui ont une incidence sur les temps de réponse.

Critères ProMQL : histogram_quantile(0.9, {__name__="IntegrationLatency", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="your-api-id",Stage="your-stage"}) > 2000

Seuil recommandé : 2000 (intégré dans la requête)

Justification du seuil : une latence d'intégration p90 supérieure à 2 000 ms indique une lenteur du backend.

Intervalle d'évaluation : 60

Période d'attente : 300

Période de récupération : 300

Count

Libellés : ApiId, Stage

Description de l'alarme : alarme lorsque le nombre total de demandes tombe en dessous de la valeur de référence attendue pour une étape d'API HTTP.

Objectif : détecter un faible volume de trafic susceptible d'indiquer des problèmes de routage ou de disponibilité.

Critères ProMQL : sum({__name__="Count", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="your-api-id",Stage="your-stage"}) < THRESHOLD

Seuil recommandé : THRESHOLD (intégré dans la requête)

Justification du seuil : définissez-le en fonction de votre niveau de référence de trafic attendu pour détecter les baisses inattendues.

Intervalle d'évaluation : 60

Période d'attente : 600

Période de récupération : 300

WebSocket API

ClientError

Libellés : ApiId, Stage

Description de l'alarme : Alarme lorsque le taux d'erreur moyen du client dépasse 5 % pour une étape de WebSocket l'API.

Objectif : détecter un taux d'erreur client élevé sur les connexions WebSocket API.

Critères ProMQL : avg({__name__="ClientError", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="your-api-id",Stage="your-stage"}) > 0.05

Seuil recommandé : 0,05 (intégré dans la requête)

Justification du seuil : détecte un taux d'erreur client supérieur à 5 % sur WebSocket les connexions.

Intervalle d'évaluation : 60

Période d'attente : 300

Période de récupération : 300

ExecutionError

Libellés : ApiId, Stage

Description de l'alarme : Alarme lorsque le taux d'erreur d'exécution moyen dépasse 5 % pour une étape d' WebSocket API.

Objectif : détecter un taux élevé d'erreurs d'exécution côté serveur sur les WebSocket API.

Critères ProMQL : avg({__name__="ExecutionError", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="your-api-id",Stage="your-stage"}) > 0.05

Seuil recommandé : 0,05 (intégré dans la requête)

Justification du seuil : détecte un taux d'erreur d'exécution supérieur à 5 % nécessitant une investigation.

Intervalle d'évaluation : 60

Période en attente : 180

Période de récupération : 300

IntegrationLatency

Libellés : ApiId, Stage

Description de l'alarme : Alarme lorsque la latence d'intégration du p90 dépasse 2 000 ms pour une étape d' WebSocket API.

Objectif : détecter une latence d'intégration élevée du backend sur les routes WebSocket d'API.

Critères ProMQL : histogram_quantile(0.9, {__name__="IntegrationLatency", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="your-api-id",Stage="your-stage"}) > 2000

Seuil recommandé : 2000 (intégré dans la requête)

Justification du seuil : une latence d'intégration p90 supérieure à 2 000 ms indique une lenteur du backend.

Intervalle d'évaluation : 60

Période d'attente : 300

Période de récupération : 300

MessageCount

Libellés : ApiId, Stage

Description de l'alarme : alarme lorsque le nombre total de messages tombe en dessous de la valeur de référence attendue pour une étape de WebSocket l'API.

Objectif : détecter un faible volume de messages susceptible d'indiquer des problèmes de connexion ou de routage.

Critères ProMQL : sum({__name__="MessageCount", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="your-api-id",Stage="your-stage"}) < THRESHOLD

Seuil recommandé : THRESHOLD (intégré dans la requête)

Justification du seuil : définissez-le en fonction du volume de messages attendu pour détecter les baisses inattendues.

Intervalle d'évaluation : 60

Période d'attente : 600

Période de récupération : 300

GroupInServiceCapacity

Étiquettes : AutoScalingGroupName

Description de l'alarme : Alarme lorsque la capacité moyenne en service tombe en dessous du minimum attendu pour un groupe Auto Scaling.

Objectif : détecter la faible disponibilité due à des échecs de lancement ou à la fermeture d'instances.

Critères ProMQL : avg({__name__="GroupInServiceCapacity", "@instrumentation.@name"="cloudwatch.aws/autoscaling", AutoScalingGroupName="your-auto-scaling-group-name"}) < THRESHOLD

Seuil recommandé : THRESHOLD (intégré dans la requête)

Justification du seuil : défini en fonction de la capacité minimale souhaitée pour détecter les échecs de lancement ou le nombre d'instances insuffisantes.

Intervalle d'évaluation : 60

Période d'attente : 600

Période de récupération : 600

DaysToExpiry

Étiquettes : CertificateArn

Description de l'alarme : Alarme lorsque le délai minimum avant l'expiration du certificat tombe à 44 jours ou moins.

Objectif : alerte proactive d'expiration du certificat pour laisser le temps de le renouveler.

Critères ProMQL : min({__name__="DaysToExpiry", "@instrumentation.@name"="cloudwatch.aws/certificatemanager", CertificateArn="your-certificate-arn"}) <= 44

Seuil recommandé : 44 (intégré dans la requête)

Justification du seuil : fournit un délai suffisant avant l'expiration du certificat pour terminer le processus de renouvellement.

Intervalle d'évaluation : 86400

Période en attente : 86400

Période de récupération : 86400

5xxErrorRate

Étiquettes : DistributionId

Description de l'alarme : Alarme lorsque le taux d'erreur moyen de 5xx dépasse le seuil d'une CloudFront distribution.

Objectif : détecter une origine ou un taux CloudFront d'erreur élevé affectant la diffusion du contenu.

Critères ProMQL : avg({__name__="5xxErrorRate", "@instrumentation.@name"="cloudwatch.aws/cloudfront", DistributionId="your-distribution-id"}) > THRESHOLD

Seuil recommandé : THRESHOLD (intégré dans la requête)

Justification du seuil : défini en fonction de votre taux d'erreur acceptable pour la diffusion de contenu.

Intervalle d'évaluation : 60

Période d'attente : 300

Période de récupération : 300

OriginLatency

Étiquettes : DistributionId

Description de l'alarme : Alarme lorsque la latence d'origine de p90 dépasse le seuil d'une CloudFront distribution.

Objectif : détecter une latence de réponse d'origine élevée qui affecte les performances de diffusion du contenu.

Critères ProMQL : histogram_quantile(0.9, {__name__="OriginLatency", "@instrumentation.@name"="cloudwatch.aws/cloudfront", DistributionId="your-distribution-id"}) > THRESHOLD

Seuil recommandé : THRESHOLD (intégré dans la requête)

Justification du seuil : défini en fonction du temps de réponse attendu à l'origine et de la stratégie de mise en cache.

Intervalle d'évaluation : 60

Période d'attente : 300

Période de récupération : 300

FunctionValidationErrors

Étiquettes : DistributionId, FunctionName

Description de l'alarme : Alarme en cas d'erreur de validation de CloudFront fonction.

Objectif : détecter les CloudFront échecs de validation des fonctions qui empêchent leur exécution.

Critères ProMQL : sum({__name__="FunctionValidationErrors", "@instrumentation.@name"="cloudwatch.aws/cloudfront", DistributionId="your-distribution-id",FunctionName="your-function-name"}) > 0

Seuil recommandé : 0 (intégré dans la requête)

Justification du seuil : toute erreur de validation indique un problème de configuration des fonctions qui nécessite une attention particulière.

Intervalle d'évaluation : 60

Période en attente : 120

Période de récupération : 120

FunctionExecutionErrors

Étiquettes : DistributionId, FunctionName

Description de l'alarme : Alarme en cas d'erreur d'exécution d'une CloudFront fonction.

Objectif : détecter les défaillances d'exécution dans CloudFront les fonctions qui affectent le traitement des demandes.

Critères ProMQL : sum({__name__="FunctionExecutionErrors", "@instrumentation.@name"="cloudwatch.aws/cloudfront", DistributionId="your-distribution-id",FunctionName="your-function-name"}) > 0

Seuil recommandé : 0 (intégré dans la requête)

Justification du seuil : toute erreur d'exécution indique un problème d'exécution dans le code de la fonction.

Intervalle d'évaluation : 60

Période d'attente : 300

Période de récupération : 300

FunctionThrottles

Étiquettes : DistributionId, FunctionName

Description de l'alarme : Alarme lorsqu' CloudFront une fonction est bloquée.

Objectif : détecter CloudFront la limitation des fonctions susceptible de dégrader le traitement des requêtes.

Critères ProMQL : sum({__name__="FunctionThrottles", "@instrumentation.@name"="cloudwatch.aws/cloudfront", DistributionId="your-distribution-id",FunctionName="your-function-name"}) > 0

Seuil recommandé : 0 (intégré dans la requête)

Justification du seuil : tout étranglement indique que la fonction atteint les limites de calcul.

Intervalle d'évaluation : 60

Période d'attente : 300

Période de récupération : 300

SignUpThrottles

Étiquettes : UserPool, UserPoolClient

Description de l'alarme : Alarme lorsque les événements d'accélération de l'inscription dépassent le seuil d'un groupe d'utilisateurs.

Objectif : détecter la limitation des inscriptions qui empêche l'inscription de nouveaux utilisateurs.

Critères ProMQL : sum({__name__="SignUpThrottles", "@instrumentation.@name"="cloudwatch.aws/cognito", UserPool="your-user-pool",UserPoolClient="your-user-pool-client"}) > THRESHOLD

Seuil recommandé : THRESHOLD (intégré dans la requête)

Justification du seuil : défini en fonction de votre taux d'accélération acceptable pour les opérations d'inscription.

Intervalle d'évaluation : 60

Période d'attente : 300

Période de récupération : 300

SignInThrottles

Étiquettes : UserPool, UserPoolClient

Description de l'alarme : Alarme lorsque les événements d'accélération de la connexion dépassent le seuil d'un groupe d'utilisateurs.

Objectif : détecter les restrictions de connexion qui empêchent l'authentification des utilisateurs.

Critères ProMQL : sum({__name__="SignInThrottles", "@instrumentation.@name"="cloudwatch.aws/cognito", UserPool="your-user-pool",UserPoolClient="your-user-pool-client"}) > THRESHOLD

Seuil recommandé : THRESHOLD (intégré dans la requête)

Justification du seuil : défini en fonction de votre taux d'accélération acceptable pour les opérations de connexion.

Intervalle d'évaluation : 60

Période d'attente : 300

Période de récupération : 300

TokenRefreshThrottles

Étiquettes : UserPool, UserPoolClient

Description de l'alarme : Alarme lorsque les événements d'accélération de l'actualisation des jetons dépassent le seuil d'un groupe d'utilisateurs.

Objectif : détecter la limitation de l'actualisation des jetons susceptible d'entraîner des interruptions de session.

Critères ProMQL : sum({__name__="TokenRefreshThrottles", "@instrumentation.@name"="cloudwatch.aws/cognito", UserPool="your-user-pool",UserPoolClient="your-user-pool-client"}) > THRESHOLD

Seuil recommandé : THRESHOLD (intégré dans la requête)

Justification du seuil : défini en fonction de votre taux d'accélération acceptable pour les opérations d'actualisation des jetons.

Intervalle d'évaluation : 60

Période d'attente : 300

Période de récupération : 300

FederationThrottles

Étiquettes : UserPool, UserPoolClient, IdentityProvider

Description de l'alarme : Alarme lorsque les événements d'accélération de la fédération dépassent le seuil pour le fournisseur d'identité d'un pool d'utilisateurs.

Objectif : détecter les restrictions de fédération susceptibles d'empêcher la connexion fédérée.

Critères ProMQL : sum({__name__="FederationThrottles", "@instrumentation.@name"="cloudwatch.aws/cognito", UserPool="your-user-pool",UserPoolClient="your-user-pool-client",IdentityProvider="your-identity-provider"}) > THRESHOLD

Seuil recommandé : THRESHOLD (intégré dans la requête)

Justification du seuil : défini en fonction de votre taux d'accélération acceptable pour les opérations de fédération.

Intervalle d'évaluation : 60

Période d'attente : 300

Période de récupération : 300

AccountProvisionedReadCapacityUtilization

Étiquettes : Aucune

Description de l'alarme : alarme lorsque l'utilisation de la capacité de lecture provisionnée au niveau du compte dépasse 80 %.

Objectif : détecter quand la capacité de lecture provisionnée approche les limites du compte.

Critères ProMQL : max({__name__="AccountProvisionedReadCapacityUtilization", "@instrumentation.@name"="cloudwatch.aws/dynamodb"}) > 80

Seuil recommandé : 80 (intégré dans la requête)

Justification du seuil : à 80 % d'utilisation, vous disposez d'une marge de manœuvre limitée avant d'atteindre les limites de votre compte.

Intervalle d'évaluation : 300

Période d'attente : 600

Période de récupération : 600

AccountProvisionedWriteCapacityUtilization

Étiquettes : Aucune

Description de l'alarme : alarme lorsque l'utilisation de la capacité d'écriture provisionnée au niveau du compte dépasse 80 %.

Objectif : détecter quand la capacité d'écriture provisionnée approche les limites du compte.

Critères ProMQL : max({__name__="AccountProvisionedWriteCapacityUtilization", "@instrumentation.@name"="cloudwatch.aws/dynamodb"}) > 80

Seuil recommandé : 80 (intégré dans la requête)

Justification du seuil : à 80 % d'utilisation, vous disposez d'une marge de manœuvre limitée avant d'atteindre les limites de votre compte.

Intervalle d'évaluation : 300

Période d'attente : 600

Période de récupération : 600

AgeOfOldestUnreplicatedRecord

Étiquettes : TableName, DelegatedOperation

Description de l'alarme : Alarme lorsque l'âge du plus ancien enregistrement non répliqué dépasse le seuil.

Objectif : détecter les retards de réplication susceptibles d'entraîner des données obsolètes dans les tables globales.

Critères ProMQL : max({__name__="AgeOfOldestUnreplicatedRecord", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name",DelegatedOperation="your-operation"}) > THRESHOLD

Seuil recommandé : THRESHOLD (intégré dans la requête)

Justification du seuil : défini en fonction de vos exigences en matière de fraîcheur de la réplication.

Intervalle d'évaluation : 300

Période d'attente : 900

Période de récupération : 900

FailedToReplicateRecordCount

Étiquettes : TableName, DelegatedOperation

Description de l'alarme : alarme lorsqu'un enregistrement ne parvient pas à se répliquer dans une table globale.

Objectif : détecter les échecs de réplication qui entraînent une incohérence des données entre les régions.

Critères ProMQL : sum({__name__="FailedToReplicateRecordCount", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name",DelegatedOperation="your-operation"}) > 0

Seuil recommandé : 0 (intégré dans la requête)

Justification du seuil : tout échec de réplication indique des problèmes de cohérence des données nécessitant une attention immédiate.

Intervalle d'évaluation : 60

Période d'attente : 60

Période de récupération : 60

ReadThrottleEvents

Étiquettes : TableName

Description de l'alarme : Alarme lorsque les événements de lecture de l'accélérateur dépassent le seuil d'un tableau.

Objectif : détecter la limitation de la lecture qui indique une capacité provisionnée insuffisante.

Critères ProMQL : sum({__name__="ReadThrottleEvents", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name"}) > THRESHOLD

Seuil recommandé : THRESHOLD (intégré dans la requête)

Justification du seuil : défini en fonction du nombre d'accélérateurs que vous pouvez accepter pour les opérations de lecture.

Intervalle d'évaluation : 60

Période d'attente : 300

Période de récupération : 300

ReadThrottleEvents (GSI)

Étiquettes : TableName, GlobalSecondaryIndexName

Description de l'alarme : Alarme lorsque les événements d'accélération de lecture dépassent le seuil d'un indice secondaire global.

Objectif : détecter la limitation de la lecture sur un GSI qui indique une capacité d'index insuffisante.

Critères ProMQL : sum({__name__="ReadThrottleEvents", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name",GlobalSecondaryIndexName="your-index-name"}) > THRESHOLD

Seuil recommandé : THRESHOLD (intégré dans la requête)

Justification du seuil : défini en fonction de votre nombre d'accélérateurs acceptable pour les opérations de lecture GSI.

Intervalle d'évaluation : 60

Période d'attente : 300

Période de récupération : 300

ReplicationLatency

Étiquettes : TableName, ReceivingRegion

Description de l'alarme : Alarme lorsque la latence moyenne de réplication dépasse le seuil d'une table globale.

Objectif : détecter une latence de réplication élevée susceptible de provoquer des lectures obsolètes dans les régions de réplication.

Critères ProMQL : avg({__name__="ReplicationLatency", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name",ReceivingRegion="your-receiving-region"}) > THRESHOLD

Seuil recommandé : THRESHOLD (intégré dans la requête)

Justification du seuil : défini en fonction de vos exigences en matière d'actualisation des données pour les régions de répliques.

Intervalle d'évaluation : 60

Période d'attente : 900

Période de récupération : 900

SuccessfulRequestLatency

Libellés : TableName, Opération

Description de l'alarme : Alarme lorsque la latence moyenne des demandes réussies dépasse le seuil d'une opération de table.

Objectif : détecter une latence élevée sur les opérations DynamoDB qui ont une incidence sur les performances de l'application.

Critères ProMQL : avg({__name__="SuccessfulRequestLatency", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name",Operation="your-operation"}) > THRESHOLD

Seuil recommandé : THRESHOLD (intégré dans la requête)

Justification du seuil : défini en fonction de votre SLA de latence pour l'opération DynamoDB spécifique.

Intervalle d'évaluation : 60

Période d'attente : 600

Période de récupération : 600

SystemErrors

Étiquettes : TableName

Description de l'alarme : Alarme lorsque les erreurs du système dépassent le seuil d'une table.

Objectif : détecter les erreurs côté service DynamoDB qui affectent la disponibilité des tables.

Critères ProMQL : sum({__name__="SystemErrors", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name"}) > THRESHOLD

Seuil recommandé : THRESHOLD (intégré dans la requête)

Justification du seuil : défini en fonction du nombre d'erreurs système acceptable pour le tableau.

Intervalle d'évaluation : 60

Période d'attente : 900

Période de récupération : 900

ThrottledPutRecordCount

Étiquettes : TableName, DelegatedOperation

Description de l'alarme : Alarme lorsque le nombre d'enregistrements de put étranglé dépasse le seuil d'une table.

Objectif : détecter les accès limités susceptibles d'entraîner une perte de données lors des opérations de streaming.

Critères ProMQL : max({__name__="ThrottledPutRecordCount", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name",DelegatedOperation="your-operation"}) > THRESHOLD

Seuil recommandé : THRESHOLD (intégré dans la requête)

Justification du seuil : défini en fonction de votre nombre d'accélérateurs acceptable pour les opérations de diffusion en continu.

Intervalle d'évaluation : 60

Période d'attente : 600

Période de récupération : 600

UserErrors

Étiquettes : Aucune

Description de l'alarme : Alarme lorsque les erreurs de l'utilisateur dépassent le seuil défini pour l'ensemble du compte.

Objectif : détecter les taux élevés d'erreurs des clients, telles que les échecs de validation ou de vérification conditionnelle.

Critères ProMQL : sum({__name__="UserErrors", "@instrumentation.@name"="cloudwatch.aws/dynamodb"}) > THRESHOLD

Seuil recommandé : THRESHOLD (intégré dans la requête)

Justification du seuil : défini en fonction de votre taux d'erreur acceptable pour les échecs des demandes côté client.

Intervalle d'évaluation : 60

Période d'attente : 600

Période de récupération : 600

WriteThrottleEvents

Étiquettes : TableName

Description de l'alarme : Alarme lorsque les événements d'accélération d'écriture dépassent le seuil d'une table.

Objectif : détecter la limitation de l'écriture qui indique une capacité provisionnée insuffisante.

Critères ProMQL : sum({__name__="WriteThrottleEvents", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name"}) > THRESHOLD

Seuil recommandé : THRESHOLD (intégré dans la requête)

Justification du seuil : défini en fonction du nombre d'accélérateurs que vous pouvez accepter pour les opérations d'écriture.

Intervalle d'évaluation : 60

Période d'attente : 300

Période de récupération : 300

WriteThrottleEvents (GSI)

Étiquettes : TableName, GlobalSecondaryIndexName

Description de l'alarme : Alarme lorsque les événements d'accélération d'écriture dépassent le seuil d'un index secondaire global.

Objectif : détecter la limitation de l'écriture sur un GSI qui indique une capacité d'index insuffisante.

Critères ProMQL : sum({__name__="WriteThrottleEvents", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name",GlobalSecondaryIndexName="your-index-name"}) > THRESHOLD

Seuil recommandé : THRESHOLD (intégré dans la requête)

Justification du seuil : défini en fonction de votre nombre d'accélérateurs acceptable pour les opérations d'écriture GSI.

Intervalle d'évaluation : 60

Période d'attente : 300

Période de récupération : 300

VolumeStalledIOCheck

Étiquettes : VolumeId, InstanceId

Description de l'alarme : Alarme lorsqu'un volume EBS signale un échec de I/O vérification bloqué.

Objectif : Détecter les volumes EBS bloqués I/O , ce qui indique une diminution du volume.

Critères ProMQL : max({__name__="VolumeStalledIOCheck", "@instrumentation.@name"="cloudwatch.aws/ebs", VolumeId="your-volume-id",InstanceId="your-instance-id"}) >= 1

Seuil recommandé : 1 (intégré dans la requête)

Justification du seuil : une valeur supérieure ou égale à 1 indique que le volume a stagné I/O, ce qui nécessite une enquête immédiate.

Intervalle d'évaluation : 60

Période d'attente : 600

Période de récupération : 600

CPUUtilization

Étiquettes : InstanceId

Description de l'alarme : Alarme lorsque l'utilisation moyenne du processeur dépasse 80 % pour une instance EC2.

Objectif : détecter une utilisation élevée du processeur.

Critères ProMQL : avg({__name__="CPUUtilization", "@instrumentation.@name"="cloudwatch.aws/ec2", InstanceId="your-instance-id"}) > 80

Seuil recommandé : 80 (intégré dans la requête)

Justification du seuil : le seuil de 80 % donne une marge avant la saturation.

Intervalle d'évaluation : 300

Période d'attente : 900

Période de récupération : 900

StatusCheckFailed

Étiquettes : InstanceId

Description de l'alarme : Alarme en cas d'échec de la vérification de l'état d'une instance ou d'un système pour une instance EC2.

Objectif : détecter les problèmes de santé de l'instance ou du système.

Critères ProMQL : max({__name__="StatusCheckFailed", "@instrumentation.@name"="cloudwatch.aws/ec2", InstanceId="your-instance-id"}) >= 1

Seuil recommandé : 1 (intégré dans la requête)

Justification du seuil : tout échec de la vérification de statut nécessite une enquête.

Intervalle d'évaluation : 300

Période d'attente : 600

Période de récupération : 600

StatusCheckFailed_EBS attachés

Étiquettes : InstanceId

Description de l'alarme : Alarme lorsqu'un volume EBS connecté devient inaccessible pour une instance EC2.

Objectif : détecter les volumes EBS inaccessibles.

Critères ProMQL : max({__name__="StatusCheckFailed_AttachedEBS", "@instrumentation.@name"="cloudwatch.aws/ec2", InstanceId="your-instance-id"}) >= 1

Seuil recommandé : 1 (intégré dans la requête)

Justification du seuil : les volumes inaccessibles entraînent des I/O défaillances.

Intervalle d'évaluation : 60

Période d'attente : 600

Période de récupération : 600

CPUReservation

Étiquettes : ClusterName

Description de l'alarme : Alarme lorsque la réservation moyenne du processeur dépasse 80 % pour un cluster ECS.

Objectif : détecter un cluster approchant de la capacité du processeur.

Critères ProMQL : avg({__name__="CPUReservation", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="your-cluster-name"}) > 80

Seuil recommandé : 80 (intégré dans la requête)

Justification du seuil : une réserve de 80 % indique une marge de manœuvre limitée pour les nouvelles tâches.

Intervalle d'évaluation : 60

Période d'attente : 300

Période de récupération : 300

CPUUtilization

Étiquettes : ClusterName, ServiceName

Description de l'alarme : Alarme lorsque l'utilisation moyenne du processeur dépasse 80 % pour un service ECS.

Objectif : détecter une utilisation élevée du processeur pour le service ECS.

Critères ProMQL : avg({__name__="CPUUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="your-cluster-name",ServiceName="your-service-name"}) > 80

Seuil recommandé : 80 (intégré dans la requête)

Justification du seuil : 80 % donnent une marge de manœuvre avant la saturation.

Intervalle d'évaluation : 60

Période d'attente : 300

Période de récupération : 300

EBSFilesystemUtilization

Étiquettes : ClusterName, ServiceName

Description de l'alarme : Alarme lorsque l'utilisation moyenne du système de fichiers EBS dépasse 80 % pour un service ECS.

Objectif : détecter une utilisation élevée du stockage EBS.

Critères ProMQL : avg({__name__="EBSFilesystemUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="your-cluster-name",ServiceName="your-service-name"}) > 80

Seuil recommandé : 80 (intégré dans la requête)

Justification du seuil : 80 % donnent une marge de manœuvre avant la saturation.

Intervalle d'évaluation : 60

Période d'attente : 300

Période de récupération : 300

MemoryReservation

Étiquettes : ClusterName

Description de l'alarme : Alarme lorsque la réservation moyenne de mémoire dépasse 80 % pour un cluster ECS.

Objectif : Détecter un cluster dont la capacité de mémoire est proche.

Critères ProMQL : avg({__name__="MemoryReservation", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="your-cluster-name"}) > 80

Seuil recommandé : 80 (intégré dans la requête)

Justification du seuil : une réserve de 80 % indique une marge de manœuvre limitée pour les nouvelles tâches.

Intervalle d'évaluation : 60

Période d'attente : 300

Période de récupération : 300

MemoryUtilization

Étiquettes : ClusterName, ServiceName

Description de l'alarme : Alarme lorsque l'utilisation moyenne de la mémoire dépasse 80 % pour un service ECS.

Objectif : détecter une utilisation élevée de la mémoire.

Critères ProMQL : avg({__name__="MemoryUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="your-cluster-name",ServiceName="your-service-name"}) > 80

Seuil recommandé : 80 (intégré dans la requête)

Justification du seuil : 80 % donnent une marge de manœuvre avant la saturation.

Intervalle d'évaluation : 60

Période d'attente : 300

Période de récupération : 300

HTTP Code_Target _5xx_Count

Étiquettes : ClusterName, ServiceName

Description de l'alarme : alarme lorsque le nombre d'erreurs HTTP 5XX dépasse le seuil d'un service ECS.

Objectif : détecter un nombre élevé d'erreurs côté serveur.

Critères ProMQL : sum({__name__="HTTPCode_Target_5XX_Count", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="your-cluster-name",ServiceName="your-service-name"}) > THRESHOLD

Seuil recommandé : THRESHOLD (intégré dans la requête)

Justification du seuil : défini en fonction du taux d'erreur de référence normal de votre application.

Intervalle d'évaluation : 60

Période d'attente : 300

Période de récupération : 300

TargetResponseTime

Étiquettes : ClusterName, ServiceName

Description de l'alarme : Alarme lorsque le temps de réponse cible moyen dépasse le seuil d'un service ECS.

Objectif : détecter un temps de réponse cible élevé.

Critères ProMQL : avg({__name__="TargetResponseTime", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="your-cluster-name",ServiceName="your-service-name"}) > THRESHOLD

Seuil recommandé : THRESHOLD (intégré dans la requête)

Justification du seuil : défini en fonction des exigences de latence acceptables de votre application.

Intervalle d'évaluation : 60

Période d'attente : 300

Période de récupération : 300

EphemeralStorageUtilized

Étiquettes : ClusterName, ServiceName

Description de l'alarme : alarme lorsque l'utilisation moyenne du stockage éphémère dépasse le seuil des tâches Fargate.

Objectif : détecter une utilisation élevée du stockage éphémère pour les tâches Fargate.

Critères ProMQL : avg({__name__="EphemeralStorageUtilized", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name",ServiceName="your-service-name"}) > THRESHOLD

Seuil recommandé : THRESHOLD (intégré dans la requête)

Justification du seuil : défini en fonction de l'allocation de stockage éphémère de votre tâche.

Intervalle d'évaluation : 60

Période d'attente : 300

Période de récupération : 300

RunningTaskCount

Étiquettes : ClusterName, ServiceName

Description de l'alarme : Alarme lorsque le nombre de tâches en cours tombe à zéro pour un service ECS.

Objectif : détecter lorsqu'aucune tâche n'est en cours d'exécution.

Critères ProMQL : avg({__name__="RunningTaskCount", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name",ServiceName="your-service-name"}) <= 0

Seuil recommandé : 0 (intégré dans la requête)

Justification du seuil : aucune tâche en cours d'exécution indique une interruption de service.

Intervalle d'évaluation : 60

Période d'attente : 300

Période de récupération : 300

instance_filesystem_utilization

Étiquettes : InstanceId, ContainerInstanceId, ClusterName

Description de l'alarme : alarme lorsque l'utilisation moyenne du système de fichiers dépasse 90 % sur une instance de conteneur.

Objectif : détecter une utilisation élevée du système de fichiers.

Critères ProMQL : avg({__name__="instance_filesystem_utilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", InstanceId="your-instance-id",ContainerInstanceId="your-container-instance-id",ClusterName="your-cluster-name"}) > 90

Seuil recommandé : 90 (intégré dans la requête)

Justification du seuil : 90 % d'utilisation du système de fichiers laissent un minimum d'espace pour les opérations.

Intervalle d'évaluation : 60

Période d'attente : 300

Période de récupération : 300

TaskCpuUtilization (niveau du cluster)

Étiquettes : ClusterName

Description de l'alarme : Alarme lorsque l'utilisation moyenne du processeur des tâches dépasse 80 % au niveau du cluster.

Objectif : détecter une utilisation élevée du processeur.

Critères ProMQL : avg({__name__="TaskCpuUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name"}) > 80

Seuil recommandé : 80 (intégré dans la requête)

Justification du seuil : 80 % donnent une marge de manœuvre avant la saturation.

Intervalle d'évaluation : 60

Période d'attente : 300

Période de récupération : 300

TaskCpuUtilization (niveau de service)

Étiquettes : ClusterName, ServiceName

Description de l'alarme : Alarme lorsque l'utilisation moyenne du processeur des tâches dépasse 80 % au niveau du service.

Objectif : détecter une utilisation élevée du processeur.

Critères ProMQL : avg({__name__="TaskCpuUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name",ServiceName="your-service-name"}) > 80

Seuil recommandé : 80 (intégré dans la requête)

Justification du seuil : 80 % donnent une marge de manœuvre avant la saturation.

Intervalle d'évaluation : 60

Période d'attente : 300

Période de récupération : 300

TaskMemoryUtilization (niveau du cluster)

Étiquettes : ClusterName

Description de l'alarme : Alarme lorsque l'utilisation moyenne de la mémoire des tâches dépasse 80 % au niveau du cluster.

Objectif : détecter une utilisation élevée de la mémoire.

Critères ProMQL : avg({__name__="TaskMemoryUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name"}) > 80

Seuil recommandé : 80 (intégré dans la requête)

Justification du seuil : 80 % donnent une marge de manœuvre avant la saturation.

Intervalle d'évaluation : 60

Période d'attente : 300

Période de récupération : 300

TaskMemoryUtilization (niveau de service)

Étiquettes : ClusterName, ServiceName

Description de l'alarme : Alarme lorsque l'utilisation moyenne de la mémoire des tâches dépasse 80 % au niveau du service.

Objectif : détecter une utilisation élevée de la mémoire.

Critères ProMQL : avg({__name__="TaskMemoryUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name",ServiceName="your-service-name"}) > 80

Seuil recommandé : 80 (intégré dans la requête)

Justification du seuil : 80 % donnent une marge de manœuvre avant la saturation.

Intervalle d'évaluation : 60

Période d'attente : 300

Période de récupération : 300

ContainerCpuUtilization (niveau du cluster)

Étiquettes : ClusterName

Description de l'alarme : Alarme lorsque l'utilisation moyenne du processeur du conteneur dépasse 80 % au niveau du cluster.

Objectif : détecter une utilisation élevée du processeur.

Critères ProMQL : avg({__name__="ContainerCpuUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name"}) > 80

Seuil recommandé : 80 (intégré dans la requête)

Justification du seuil : 80 % donnent une marge de manœuvre avant la saturation.

Intervalle d'évaluation : 60

Période d'attente : 300

Période de récupération : 300

ContainerCpuUtilization (niveau du conteneur)

Étiquettes : ContainerName, ClusterName, ServiceName

Description de l'alarme : Alarme lorsque l'utilisation moyenne du processeur du conteneur dépasse 80 % au niveau du conteneur.

Objectif : détecter une utilisation élevée du processeur.

Critères ProMQL : avg({__name__="ContainerCpuUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ContainerName="your-container-name",ClusterName="your-cluster-name",ServiceName="your-service-name"}) > 80

Seuil recommandé : 80 (intégré dans la requête)

Justification du seuil : 80 % donnent une marge de manœuvre avant la saturation.

Intervalle d'évaluation : 60

Période d'attente : 300

Période de récupération : 300

ContainerMemoryUtilization (niveau du cluster)

Étiquettes : ClusterName

Description de l'alarme : Alarme lorsque l'utilisation moyenne de la mémoire du conteneur dépasse 80 % au niveau du cluster.

Objectif : détecter une utilisation élevée de la mémoire.

Critères ProMQL : avg({__name__="ContainerMemoryUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name"}) > 80

Seuil recommandé : 80 (intégré dans la requête)

Justification du seuil : 80 % donnent une marge de manœuvre avant la saturation.

Intervalle d'évaluation : 60

Période d'attente : 300

Période de récupération : 300

ContainerMemoryUtilization (niveau du conteneur)

Étiquettes : ContainerName, ClusterName, ServiceName

Description de l'alarme : Alarme lorsque l'utilisation moyenne de la mémoire du conteneur dépasse 80 % au niveau du conteneur.

Objectif : détecter une utilisation élevée de la mémoire.

Critères ProMQL : avg({__name__="ContainerMemoryUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ContainerName="your-container-name",ClusterName="your-cluster-name",ServiceName="your-service-name"}) > 80

Seuil recommandé : 80 (intégré dans la requête)

Justification du seuil : 80 % donnent une marge de manœuvre avant la saturation.

Intervalle d'évaluation : 60

Période d'attente : 300

Période de récupération : 300

TaskEBSfilesystemUtilization

Étiquettes : ClusterName, ServiceName

Description de l'alarme : alarme lorsque l'utilisation moyenne du système de fichiers EBS dépasse 80 % pour les tâches.

Objectif : détecter une utilisation élevée du système de fichiers EBS.

Critères ProMQL : avg({__name__="TaskEBSfilesystemUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name",ServiceName="your-service-name"}) > 80

Seuil recommandé : 80 (intégré dans la requête)

Justification du seuil : 80 % donnent une marge de manœuvre avant la saturation.

Intervalle d'évaluation : 60

Période d'attente : 300

Période de récupération : 300

TaskEphemeralStorageUtilization (niveau du cluster)

Étiquettes : ClusterName

Description de l'alarme : Alarme lorsque l'utilisation moyenne du stockage éphémère dépasse 80 % au niveau du cluster.

Objectif : détecter une utilisation élevée du stockage éphémère.

Critères ProMQL : avg({__name__="TaskEphemeralStorageUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name"}) > 80

Seuil recommandé : 80 (intégré dans la requête)

Justification du seuil : 80 % donnent une marge de manœuvre avant la saturation.

Intervalle d'évaluation : 60

Période d'attente : 300

Période de récupération : 300

TaskEphemeralStorageUtilization (niveau de service)

Étiquettes : ClusterName, ServiceName

Description de l'alarme : Alarme lorsque l'utilisation moyenne du stockage éphémère dépasse 80 % au niveau de service.

Objectif : détecter une utilisation élevée du stockage éphémère.

Critères ProMQL : avg({__name__="TaskEphemeralStorageUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name",ServiceName="your-service-name"}) > 80

Seuil recommandé : 80 (intégré dans la requête)

Justification du seuil : 80 % donnent une marge de manœuvre avant la saturation.

Intervalle d'évaluation : 60

Période d'attente : 300

Période de récupération : 300

PercentIOLimit

Étiquettes : FileSystemId

Description de l'alarme : Alarme lorsqu'un système de fichiers EFS atteint 100 % de sa I/O limite.

Objectif : détecter quand le système de fichiers atteint sa I/O limite.

Critères ProMQL : avg({__name__="PercentIOLimit", "@instrumentation.@name"="cloudwatch.aws/efs", FileSystemId="your-filesystem-id"}) >= 100

Seuil recommandé : 100 (intégré dans la requête)

Justification du seuil : à 100 %, le système de fichiers devient un goulot d'étranglement.

Intervalle d'évaluation : 60

Période d'attente : 900

Période de récupération : 900

BurstCreditBalance

Étiquettes : FileSystemId

Description de l'alarme : Alarme lorsque le solde créditeur d'un système de fichiers EFS tombe à zéro.

Objectif : détecter les crédits de rafale épuisés entraînant un ralentissement du débit.

Critères ProMQL : avg({__name__="BurstCreditBalance", "@instrumentation.@name"="cloudwatch.aws/efs", FileSystemId="your-filesystem-id"}) <= 0

Seuil recommandé : 0 (intégré dans la requête)

Justification du seuil : l'absence de crédit entraîne une réduction du débit.

Intervalle d'évaluation : 60

Période d'attente : 900

Période de récupération : 900

node_cpu_utilization

Étiquettes : ClusterName

Description de l'alarme : Alarme lorsque l'utilisation maximale du processeur dépasse 80 % sur les nœuds de travail EKS.

Objectif : détecter un processeur élevé sur les nœuds de travail.

Critères ProMQL : max({__name__="node_cpu_utilization", "@instrumentation.@name"="cloudwatch.aws/eks-containerinsights", ClusterName="your-cluster-name"}) > 80

Seuil recommandé : 80 (intégré dans la requête)

Justification du seuil : 80 % donnent une marge de manœuvre avant la saturation.

Intervalle d'évaluation : 60

Période d'attente : 300

Période de récupération : 300

node_filesystem_utilization

Étiquettes : ClusterName

Description de l'alarme : alarme lorsque l'utilisation maximale du système de fichiers dépasse le seuil sur les nœuds de travail EKS.

Objectif : détecter une utilisation élevée du système de fichiers sur les nœuds de travail.

Critères ProMQL : max({__name__="node_filesystem_utilization", "@instrumentation.@name"="cloudwatch.aws/eks-containerinsights", ClusterName="your-cluster-name"}) > THRESHOLD

Seuil recommandé : THRESHOLD (intégré dans la requête)

Justification du seuil : défini en fonction de la capacité de stockage et des habitudes d'utilisation de votre nœud.

Intervalle d'évaluation : 60

Période d'attente : 300

Période de récupération : 300

node_memory_utilization

Étiquettes : ClusterName

Description de l'alarme : Alarme lorsque l'utilisation maximale de la mémoire dépasse 80 % sur les nœuds de travail EKS.

Objectif : détecter une mémoire élevée sur les nœuds de travail.

Critères ProMQL : max({__name__="node_memory_utilization", "@instrumentation.@name"="cloudwatch.aws/eks-containerinsights", ClusterName="your-cluster-name"}) > 80

Seuil recommandé : 80 (intégré dans la requête)

Justification du seuil : 80 % donnent une marge de manœuvre avant la saturation.

Intervalle d'évaluation : 60

Période d'attente : 300

Période de récupération : 300

pod_cpu_utilization_over_pod_limit

Libellés : ClusterName, Namespace, Service

Description de l'alarme : Alarme lorsque l'utilisation du processeur du pod dépasse 80 % de sa limite.

Objectif : détecter les pods approchant les limites du processeur.

Critères ProMQL : max({__name__="pod_cpu_utilization_over_pod_limit", "@instrumentation.@name"="cloudwatch.aws/eks-containerinsights", ClusterName="your-cluster-name",Namespace="your-namespace",Service="your-service"}) > 80

Seuil recommandé : 80 (intégré dans la requête)

Justification du seuil : 80 % donnent une marge de manœuvre avant que l'étranglement ne se produise.

Intervalle d'évaluation : 60

Période d'attente : 300

Période de récupération : 300

pod_memory_utilization_over_pod_limit

Libellés : ClusterName, Namespace, Service

Description de l'alarme : Alarme lorsque l'utilisation de la mémoire du pod dépasse 80 % de sa limite.

Objectif : détecter les modules approchant les limites de mémoire.

Critères ProMQL : max({__name__="pod_memory_utilization_over_pod_limit", "@instrumentation.@name"="cloudwatch.aws/eks-containerinsights", ClusterName="your-cluster-name",Namespace="your-namespace",Service="your-service"}) > 80

Seuil recommandé : 80 (intégré dans la requête)

Justification du seuil : 80 % donnent une marge de manœuvre avant que OOMkill ne se produise.

Intervalle d'évaluation : 60

Période d'attente : 300

Période de récupération : 300

CPUUtilization

Étiquettes : CacheClusterId, CacheNodeId

Description de l'alarme : Alarme lorsque l'utilisation moyenne du processeur dépasse le seuil d'un ElastiCache nœud.

Intention : détecter un processeur élevé sur l'ensemble de l'instance.

Critères ProMQL : avg({__name__="CPUUtilization", "@instrumentation.@name"="cloudwatch.aws/elasticache", CacheClusterId="your-cache-cluster-id",CacheNodeId="your-cache-node-id"}) > THRESHOLD

Seuil recommandé : THRESHOLD (intégré dans la requête)

Justification du seuil : défini en fonction de votre type de nœud et des caractéristiques de charge de travail.

Intervalle d'évaluation : 60

Période d'attente : 300

Période de récupération : 300

CurrConnections

Étiquettes : CacheClusterId, CacheNodeId

Description de l'alarme : Alarme lorsque le nombre de connexions dépasse le seuil d'un ElastiCache nœud.

Objectif : détecter un nombre élevé de connexions.

Critères ProMQL : avg({__name__="CurrConnections", "@instrumentation.@name"="cloudwatch.aws/elasticache", CacheClusterId="your-cache-cluster-id",CacheNodeId="your-cache-node-id"}) > THRESHOLD

Seuil recommandé : THRESHOLD (intégré dans la requête)

Justification du seuil : définissez-le en fonction de la taille prévue de votre pool de connexions et des besoins de l'application.

Intervalle d'évaluation : 60

Période d'attente : 600

Période de récupération : 600

DatabaseMemoryUsagePercentage

Étiquettes : CacheClusterId

Description de l'alarme : alarme lorsque l'utilisation de la mémoire de la base de données dépasse le seuil d'un ElastiCache cluster.

Objectif : détecter une utilisation élevée de la mémoire pour éviter les échecs d'écriture.

Critères ProMQL : avg({__name__="DatabaseMemoryUsagePercentage", "@instrumentation.@name"="cloudwatch.aws/elasticache", CacheClusterId="your-cache-cluster-id"}) > THRESHOLD

Seuil recommandé : THRESHOLD (intégré dans la requête)

Justification du seuil : défini en fonction de votre politique d'expulsion et de la criticité des données.

Intervalle d'évaluation : 60

Période d'attente : 300

Période de récupération : 300

EngineCPUUtilization

Étiquettes : CacheClusterId

Description de l'alarme : Alarme lorsque l'utilisation du processeur du moteur Redis dépasse 90 % pour un ElastiCache cluster.

Objectif : détecter une utilisation élevée du processeur du moteur Redis.

Critères ProMQL : avg({__name__="EngineCPUUtilization", "@instrumentation.@name"="cloudwatch.aws/elasticache", CacheClusterId="your-cache-cluster-id"}) > 90

Seuil recommandé : 90 (intégré dans la requête)

Justification du seuil : Redis est monothread ; une valeur supérieure à 90 % indique une saturation.

Intervalle d'évaluation : 60

Période d'attente : 300

Période de récupération : 300

ReplicationLag

Étiquettes : CacheClusterId

Description de l'alarme : Alarme lorsque le délai de réplication dépasse le seuil d'un ElastiCache cluster.

Objectif : détecter les retards de réplication affectant la cohérence des données.

Critères ProMQL : avg({__name__="ReplicationLag", "@instrumentation.@name"="cloudwatch.aws/elasticache", CacheClusterId="your-cache-cluster-id"}) > THRESHOLD

Seuil recommandé : THRESHOLD (intégré dans la requête)

Justification du seuil : défini en fonction de la tolérance de votre application pour les lectures périmées.

Intervalle d'évaluation : 60

Période d'attente : 900

Période de récupération : 900

GPUConnectivityCheckFailed

Libellés : InstanceId, eGPUID

Description de l'alarme : Alarme lorsque l'accélérateur Elastic Graphics perd la connectivité avec l'instance.

Objectif : détecter les problèmes de connectivité avec Elastic Graphics Accelerator.

Critères ProMQL : max({__name__="GPUConnectivityCheckFailed", "@instrumentation.@name"="cloudwatch.aws/elasticgpus", InstanceId="your-instance-id",EGPUId="your-egpu-id"}) > 0

Seuil recommandé : 0 (intégré dans la requête)

Justification du seuil : toute défaillance de connectivité doit faire l'objet d'une enquête.

Intervalle d'évaluation : 300

Période d'attente : 900

Période de récupération : 900

GPUHealthCheckFailed

Libellés : InstanceId, eGPUID

Description de l'alarme : Alarme en cas d'échec de la vérification de l'état d'un accélérateur Elastic Graphics.

Objectif : détecter un accélérateur Elastic Graphics défectueux.

Critères ProMQL : max({__name__="GPUHealthCheckFailed", "@instrumentation.@name"="cloudwatch.aws/elasticgpus", InstanceId="your-instance-id",EGPUId="your-egpu-id"}) > 0

Seuil recommandé : 0 (intégré dans la requête)

Justification du seuil : les échecs du bilan de santé indiquent des problèmes d'accélérateur.

Intervalle d'évaluation : 300

Période d'attente : 900

Période de récupération : 900

TargetErrorThrottledCount

Description de l'alarme : Alarme lorsque les appels de la cible planifiée sont limités.

Objectif : détecter l'étranglement des cibles entraînant des retards dans le calendrier.

Critères ProMQL : sum({__name__="TargetErrorThrottledCount", "@instrumentation.@name"="cloudwatch.aws/scheduler"}) > 0

Seuil recommandé : 0 (intégré dans la requête)

Justification du seuil : toute limitation indique des problèmes de capacité cible.

Intervalle d'évaluation : 60

Période d'attente : 900

Période de récupération : 900

InvocationThrottleCount

Description de l'alarme : Alarme lorsque les appels du planificateur sont limités.

Objectif : détecter la limitation des invocations du planificateur.

Critères ProMQL : sum({__name__="InvocationThrottleCount", "@instrumentation.@name"="cloudwatch.aws/scheduler"}) > 0

Seuil recommandé : 0 (intégré dans la requête)

Justification du seuil : la limitation retarde les exécutions prévues.

Intervalle d'évaluation : 60

Période d'attente : 900

Période de récupération : 900

InvocationDroppedCount

Description de l'alarme : Alarme lorsque des appels planifiés sont abandonnés.

Objectif : détecter les appels supprimés.

Critères ProMQL : sum({__name__="InvocationDroppedCount", "@instrumentation.@name"="cloudwatch.aws/scheduler"}) > 0

Seuil recommandé : 0 (intégré dans la requête)

Justification du seuil : les invocations abandonnées représentent des événements planifiés perdus.

Intervalle d'évaluation : 60

Période d'attente : 60

Période de récupération : 60

InvocationsFailedToBeSentToDeadLetterCount

Description de l'alarme : Alarme lorsque les appels échoués ne peuvent pas être envoyés à la file d'attente de lettres mortes.

Objectif : détecter les échecs de distribution du DLQ.

Critères ProMQL : sum({__name__="InvocationsFailedToBeSentToDeadLetterCount", "@instrumentation.@name"="cloudwatch.aws/scheduler"}) > 0

Seuil recommandé : 0 (intégré dans la requête)

Justification du seuil : l'échec de la livraison du DLQ entraîne la perte des informations d'erreur.

Intervalle d'évaluation : 60

Période d'attente : 900

Période de récupération : 900

GetRecords.IteratorAgeMilliseconds

Étiquettes : StreamName

Description de l'alarme : alarme lorsque l'âge de l'itérateur du consommateur dépasse le seuil d'un flux Kinesis.

Objectif : détecter les données en retard dans la période de conservation risquant de perdre des données.

Critères ProMQL : max({__name__="GetRecords.IteratorAgeMilliseconds", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="your-stream-name"}) > THRESHOLD

Seuil recommandé : THRESHOLD (intégré dans la requête)

Justification du seuil : défini en fonction du pourcentage de la période de rétention du flux.

Intervalle d'évaluation : 60

Période d'attente : 900

Période de récupération : 900

GetRecords.Success

Étiquettes : StreamName

Description de l'alarme : Alarme lorsque le taux de GetRecords réussite tombe en dessous du seuil d'un flux Kinesis.

Objectif : détecter les échecs de récupération par les consommateurs.

Critères ProMQL : avg({__name__="GetRecords.Success", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="your-stream-name"}) < THRESHOLD

Seuil recommandé : THRESHOLD (intégré dans la requête)

Justification du seuil : défini en fonction du taux de réussite attendu.

Intervalle d'évaluation : 60

Période d'attente : 300

Période de récupération : 300

PutRecord.Success

Étiquettes : StreamName

Description de l'alarme : Alarme lorsque le taux de PutRecord réussite tombe en dessous du seuil d'un flux Kinesis.

Objectif : détecter les défaillances d'ingestion par les producteurs.

Critères ProMQL : avg({__name__="PutRecord.Success", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="your-stream-name"}) < THRESHOLD

Seuil recommandé : THRESHOLD (intégré dans la requête)

Justification du seuil : défini en fonction du taux de réussite attendu.

Intervalle d'évaluation : 60

Période d'attente : 300

Période de récupération : 300

PutRecords.FailedRecords

Étiquettes : StreamName

Description de l'alarme : Alarme lorsque les opérations de mise en lots produisent des enregistrements échoués pour un flux Kinesis.

Objectif : détecter les échecs de mise en lots.

Critères ProMQL : sum({__name__="PutRecords.FailedRecords", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="your-stream-name"}) > THRESHOLD

Seuil recommandé : THRESHOLD (intégré dans la requête)

Justification du seuil : défini en fonction d'un nombre de défaillances acceptable.

Intervalle d'évaluation : 60

Période d'attente : 300

Période de récupération : 300

ReadProvisionedThroughputExceeded

Étiquettes : StreamName

Description de l'alarme : Alarme lorsque les lectures des utilisateurs dépassent le débit prévu pour un flux Kinesis.

Objectif : détecter la limitation de la lecture par les consommateurs.

Critères ProMQL : avg({__name__="ReadProvisionedThroughputExceeded", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="your-stream-name"}) > THRESHOLD

Seuil recommandé : THRESHOLD (intégré dans la requête)

Justification du seuil : Toute limitation prolongée indique des besoins en capacité.

Intervalle d'évaluation : 60

Période d'attente : 300

Période de récupération : 300

SubscribeToShardEvent.MillisBehindLatest

Étiquettes : StreamName, ConsumerName

Description de l'alarme : Alarme lorsqu'un consommateur bénéficiant d'un plus grand nombre de fans prend du retard par rapport au dernier record.

Objectif : détecter l'augmentation du délai de traitement des ventilateurs par les consommateurs.

Critères ProMQL : avg({__name__="SubscribeToShardEvent.MillisBehindLatest", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="your-stream-name",ConsumerName="your-consumer-name"}) > THRESHOLD

Seuil recommandé : THRESHOLD (intégré dans la requête)

Justification du seuil : défini en fonction d'un délai de traitement acceptable.

Intervalle d'évaluation : 60

Période d'attente : 300

Période de récupération : 300

WriteProvisionedThroughputExceeded

Étiquettes : StreamName

Description de l'alarme : Alarme lorsque les écritures du producteur dépassent le débit prévu pour un flux Kinesis.

Objectif : détecter la limitation de l'écriture du producteur.

Critères ProMQL : avg({__name__="WriteProvisionedThroughputExceeded", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="your-stream-name"}) > THRESHOLD

Seuil recommandé : THRESHOLD (intégré dans la requête)

Justification du seuil : une limitation continue indique les besoins en capacité.

Intervalle d'évaluation : 60

Période d'attente : 300

Période de récupération : 300

ClaimedAccountConcurrency

Description de l'alarme : alarme lorsque la simultanéité des comptes réclamés dépasse le seuil.

Objectif : détecter un compte approchant le quota de simultanéité.

Critères ProMQL : max({__name__="ClaimedAccountConcurrency", "@instrumentation.@name"="cloudwatch.aws/lambda"}) > THRESHOLD

Seuil recommandé : THRESHOLD (intégré dans la requête)

Justification du seuil : défini en pourcentage de la limite de simultanéité régionale.

Intervalle d'évaluation : 60

Période d'attente : 600

Période de récupération : 600

Erreurs

Étiquettes : FunctionName

Description de l'alarme : Alarme lorsque le nombre d'erreurs de fonction dépasse le seuil d'une fonction Lambda.

Objectif : détecter un nombre élevé d'erreurs de fonctionnement.

Critères ProMQL : sum({__name__="Errors", "@instrumentation.@name"="cloudwatch.aws/lambda", FunctionName="your-function-name"}) > THRESHOLD

Seuil recommandé : THRESHOLD (intégré dans la requête)

Justification du seuil : défini en fonction du volume d'erreur acceptable.

Intervalle d'évaluation : 60

Période en attente : 180

Période de récupération : 300

Throttles

Étiquettes : FunctionName

Description de l'alarme : Alarme lorsque les appels de fonction sont limités pour une fonction Lambda.

Objectif : détecter la limitation de l'invocation des fonctions.

Critères ProMQL : sum({__name__="Throttles", "@instrumentation.@name"="cloudwatch.aws/lambda", FunctionName="your-function-name"}) > THRESHOLD

Seuil recommandé : THRESHOLD (intégré dans la requête)

Justification du seuil : la limitation indique que la limite de simultanéité est atteinte.

Intervalle d'évaluation : 60

Période d'attente : 300

Période de récupération : 300

Durée

Étiquettes : FunctionName

Description de l'alarme : Alarme lorsque la durée de la fonction p90 dépasse le seuil d'une fonction Lambda.

Objectif : détecter les appels de fonctions de longue durée.

Critères ProMQL : histogram_quantile(0.9, {__name__="Duration", "@instrumentation.@name"="cloudwatch.aws/lambda", FunctionName="your-function-name"}) > THRESHOLD

Seuil recommandé : THRESHOLD (intégré dans la requête)

Justification du seuil : défini par rapport au délai d'expiration de la fonction.

Intervalle d'évaluation : 60

Période d'attente : 900

Période de récupération : 900

ConcurrentExecutions

Étiquettes : FunctionName

Description de l'alarme : Alarme lorsque les exécutions simultanées dépassent le seuil d'une fonction Lambda.

Objectif : détecter les fonctions qui approchent des limites de simultanéité.

Critères ProMQL : max({__name__="ConcurrentExecutions", "@instrumentation.@name"="cloudwatch.aws/lambda", FunctionName="your-function-name"}) > THRESHOLD

Seuil recommandé : THRESHOLD (intégré dans la requête)

Justification du seuil : défini sur le pourcentage de simultanéité réservée.

Intervalle d'évaluation : 60

Période d'attente : 600

Période de récupération : 600

memory_utilization

Étiquettes : function_name

Description de l'alarme : Alarme lorsque l'utilisation moyenne de la mémoire dépasse 90 % pour une fonction Lambda.

Objectif : Détecter une fonction approchant la limite de mémoire configurée.

Critères ProMQL : avg({__name__="memory_utilization", "@instrumentation.@name"="cloudwatch.aws/lambda-insights", function_name="your-function-name"}) > 90

Seuil recommandé : 90 (intégré dans la requête)

Justification du seuil : Au-delà de 90 %, le risque de défaillance de la mémoire est insuffisant.

Intervalle d'évaluation : 60

Période d'attente : 600

Période de récupération : 600

ErrorPortAllocation

Étiquettes : NatGatewayId

Description de l'alarme : Alarme lorsque la passerelle NAT ne parvient pas à allouer un port pour les nouvelles connexions.

Objectif : détecter les échecs d'allocation de ports empêchant de nouvelles connexions.

Critères ProMQL : sum({__name__="ErrorPortAllocation", "@instrumentation.@name"="cloudwatch.aws/natgateway", NatGatewayId="your-nat-gateway-id"}) > 0

Seuil recommandé : 0 (intégré dans la requête)

Justification du seuil : tout échec d'allocation a un impact sur la connectivité.

Intervalle d'évaluation : 60

Période d'attente : 900

Période de récupération : 900

PacketsDropCount

Étiquettes : NatGatewayId

Description de l'alarme : Alarme lorsque la passerelle NAT supprime des paquets dépassant le seuil.

Objectif : détecter les pertes de paquets indiquant des problèmes de capacité ou de connectivité.

Critères ProMQL : sum({__name__="PacketsDropCount", "@instrumentation.@name"="cloudwatch.aws/natgateway", NatGatewayId="your-nat-gateway-id"}) > THRESHOLD

Seuil recommandé : THRESHOLD (intégré dans la requête)

Justification du seuil : défini en fonction d'un taux de chute acceptable.

Intervalle d'évaluation : 60

Période d'attente : 300

Période de récupération : 300

PacketsDropped

Étiquettes : VpcId VpcEndpointId, EndpointType, SubnetId, ServiceName

Description de l'alarme : Alarme lorsqu'un point de terminaison VPC supprime des paquets dépassant le seuil.

Objectif : détecter les terminaux ou les services de terminaux défectueux.

Critères ProMQL : sum({__name__="PacketsDropped", "@instrumentation.@name"="cloudwatch.aws/privatelinkendpoints", VpcId="your-vpc-id",VpcEndpointId="your-vpc-endpoint-id",EndpointType="your-endpoint-type",SubnetId="your-subnet-id",ServiceName="your-service-name"}) > THRESHOLD

Seuil recommandé : THRESHOLD (intégré dans la requête)

Justification du seuil : défini en fonction d'un taux de chute acceptable.

Intervalle d'évaluation : 60

Période d'attente : 300

Période de récupération : 300

RstPacketsSent

Libellés : ServiceId, LoadBalancerArn, Az

Description de l'alarme : Alarme lorsque le débit de paquets RST dépasse le seuil d'un service de point de terminaison.

Objectif : détecter les cibles malsaines du service Endpoint.

Critères ProMQL : sum({__name__="RstPacketsSent", "@instrumentation.@name"="cloudwatch.aws/privatelinkservices", ServiceId="SVC",LoadBalancerArn="LB",Az="AZ"}) > THRESHOLD

Seuil recommandé : THRESHOLD (intégré dans la requête)

Justification du seuil : défini en fonction d'un débit de paquets RST acceptable.

Intervalle d'évaluation : 60

Période d'attente : 300

Période de récupération : 300

CPUUtilization

Étiquettes : DBInstanceIdentifier

Description de l'alarme : Alarme lorsque l'utilisation moyenne du processeur dépasse 90 % pour une instance RDS.

Objectif : détecter les hautes performances du processeur afin d'éviter toute dégradation des performances.

Critères ProMQL : avg({__name__="CPUUtilization", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > 90

Seuil recommandé : 90 (intégré dans la requête)

Justification du seuil : 90 % indiquent une saturation proche de la saturation.

Intervalle d'évaluation : 60

Période d'attente : 300

Période de récupération : 300

DatabaseConnections

Étiquettes : DBInstanceIdentifier

Description de l'alarme : Alarme lorsque les connexions à la base de données dépassent le seuil d'une instance RDS.

Objectif : empêcher les connexions rejetées dans la limite maximale.

Critères ProMQL : avg({__name__="DatabaseConnections", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > THRESHOLD

Seuil recommandé : THRESHOLD (intégré dans la requête)

Justification du seuil : défini sur le pourcentage du paramètre max_connections.

Intervalle d'évaluation : 60

Période d'attente : 300

Période de récupération : 300

EBSByteBalance%

Étiquettes : DBInstanceIdentifier

Description de l'alarme : Alarme lorsque le solde des octets EBS tombe en dessous de 10 % pour une instance RDS.

Objectif : détecter les crédits à faible débit à l'origine de goulots d'étranglement.

Critères ProMQL : avg({__name__="EBSByteBalance%", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) < 10

Seuil recommandé : 10 (intégré dans la requête)

Justification du seuil : En dessous de 10 %, le débit risque d'être dégradé.

Intervalle d'évaluation : 60

Période en attente : 180

Période de récupération : 180

EBSIOBalance%

Étiquettes : DBInstanceIdentifier

Description de l'alarme : Alarme lorsque l'équilibre des E/S EBS tombe en dessous de 10 % pour une instance RDS.

Objectif : détecter les faibles crédits IOPS à l'origine de goulots d'étranglement.

Critères ProMQL : avg({__name__="EBSIOBalance%", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) < 10

Seuil recommandé : 10 (intégré dans la requête)

Justification du seuil : Un seuil inférieur à 10 % présente un risque de dégradation des IOPS.

Intervalle d'évaluation : 60

Période en attente : 180

Période de récupération : 180

FreeableMemory

Étiquettes : DBInstanceIdentifier

Description de l'alarme : Alarme lorsque la mémoire libérable tombe en dessous du seuil d'une instance RDS.

Objectif : éviter que le manque de mémoire n'entraîne le rejet de connexions.

Critères ProMQL : avg({__name__="FreeableMemory", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) < THRESHOLD

Seuil recommandé : THRESHOLD (intégré dans la requête)

Justification du seuil : défini en fonction de la mémoire des classes d'instance.

Intervalle d'évaluation : 60

Période d'attente : 900

Période de récupération : 900

FreeLocalStorage

Étiquettes : DBInstanceIdentifier

Description de l'alarme : Alarme lorsque le stockage local disponible tombe en dessous du seuil d'une instance Aurora.

Objectif : empêcher l'épuisement du stockage local d'Aurora.

Critères ProMQL : avg({__name__="FreeLocalStorage", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) < THRESHOLD

Seuil recommandé : THRESHOLD (intégré dans la requête)

Justification du seuil : défini en fonction du minimum requis pour les opérations.

Intervalle d'évaluation : 60

Période d'attente : 300

Période de récupération : 300

FreeStorageSpace

Étiquettes : DBInstanceIdentifier

Description de l'alarme : Alarme lorsque l'espace de stockage disponible tombe en dessous du seuil d'une instance RDS.

Objectif : éviter les interruptions de stockage complètes.

Critères ProMQL : min({__name__="FreeStorageSpace", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) < THRESHOLD

Seuil recommandé : THRESHOLD (intégré dans la requête)

Justification du seuil : défini en fonction du taux de croissance du stockage et de la taille provisionnée.

Intervalle d'évaluation : 60

Période d'attente : 300

Période de récupération : 300

MaximumUsedTransactionIDs

Étiquettes : DBInstanceIdentifier

Description de l'alarme : Alarme lorsque le nombre maximum d'ID de transaction utilisés dépasse 1 milliard pour une instance RDS.

Objectif : empêcher le contournement de l'ID de transaction PostgreSQL.

Critères ProMQL : avg({__name__="MaximumUsedTransactionIDs", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > 1000000000

Seuil recommandé : 1000000000 (intégré dans la requête)

Justification du seuil : 1 milliard indique qu'un danger global approche.

Intervalle d'évaluation : 60

Période d'attente : 60

Période de récupération : 60

ReadLatency

Étiquettes : DBInstanceIdentifier

Description de l'alarme : Alarme lorsque la latence de lecture de p90 dépasse le seuil d'une instance RDS.

Objectif : détecter une latence de lecture élevée indiquant des problèmes de disque.

Critères ProMQL : histogram_quantile(0.9, {__name__="ReadLatency", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > THRESHOLD

Seuil recommandé : THRESHOLD (intégré dans la requête)

Justification du seuil : défini en fonction de la latence acceptable de l'application.

Intervalle d'évaluation : 60

Période d'attente : 300

Période de récupération : 300

ReplicaLag

Étiquettes : DBInstanceIdentifier

Description de l'alarme : Alarme lorsque le délai de réplication dépasse 60 secondes pour une réplique en lecture RDS.

Objectif : détecter les retards de réplication risquant de perdre des données.

Critères ProMQL : max({__name__="ReplicaLag", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > 60

Seuil recommandé : 60 (intégré dans la requête)

Justification du seuil : 60 secondes représentent un décalage significatif pour la plupart des charges de travail.

Intervalle d'évaluation : 60

Période d'attente : 600

Période de récupération : 600

WriteLatency

Étiquettes : DBInstanceIdentifier

Description de l'alarme : Alarme lorsque la latence d'écriture de p90 dépasse le seuil d'une instance RDS.

Objectif : détecter une latence d'écriture élevée indiquant des problèmes de disque.

Critères ProMQL : histogram_quantile(0.9, {__name__="WriteLatency", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > THRESHOLD

Seuil recommandé : THRESHOLD (intégré dans la requête)

Justification du seuil : défini en fonction de la latence acceptable de l'application.

Intervalle d'évaluation : 60

Période d'attente : 300

Période de récupération : 300

DBLoad

Étiquettes : DBInstanceIdentifier

Description de l'alarme : alarme lorsque la charge moyenne de la base de données dépasse le seuil d'une instance RDS.

Objectif : détecter une charge de base de données élevée qui dégrade les performances.

Critères ProMQL : avg({__name__="DBLoad", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > THRESHOLD

Seuil recommandé : THRESHOLD (intégré dans la requête)

Justification du seuil : défini sur un multiple du nombre de processeurs virtuels.

Intervalle d'évaluation : 60

Période d'attente : 900

Période de récupération : 900

AuroraVolumeBytesLeftTotal

Étiquettes : DBClusterIdentifier

Description de l'alarme : Alarme lorsque le nombre d'octets de stockage restants dans le cluster Aurora tombe en dessous du seuil.

Objectif : empêcher l'épuisement de l'espace de stockage du cluster Aurora.

Critères ProMQL : avg({__name__="AuroraVolumeBytesLeftTotal", "@instrumentation.@name"="cloudwatch.aws/rds", DBClusterIdentifier="CLUSTER"}) < THRESHOLD

Seuil recommandé : THRESHOLD (intégré dans la requête)

Justification du seuil : défini en fonction du taux de croissance.

Intervalle d'évaluation : 60

Période d'attente : 300

Période de récupération : 300

AuroraBinlogReplicaLag

Étiquettes : DBClusterIdentifier

Description de l'alarme : Alarme lorsque le décalage de la réplication du binlog Aurora indique un état d'erreur.

Objectif : détecter les erreurs de réplication des instances de rédaction.

Critères ProMQL : avg({__name__="AuroraBinlogReplicaLag", "@instrumentation.@name"="cloudwatch.aws/rds", DBClusterIdentifier="CLUSTER"}) <= -1

Seuil recommandé : -1 (intégré dans la requête)

Justification du seuil : -1 indique l'état d'erreur.

Intervalle d'évaluation : 60

Période en attente : 120

Période de récupération : 120

BlockedTransactions

Étiquettes : DBInstanceIdentifier

Description de l'alarme : Alarme lorsque le nombre de transactions bloquées dépasse le seuil d'une instance RDS.

Objectif : détecter le blocage des transactions entraînant une dégradation des performances.

Critères ProMQL : avg({__name__="BlockedTransactions", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > THRESHOLD

Seuil recommandé : THRESHOLD (intégré dans la requête)

Justification du seuil : défini en fonction du nombre de transactions bloquées acceptable.

Intervalle d'évaluation : 60

Période d'attente : 300

Période de récupération : 300

BufferCacheHitRatio

Étiquettes : DBInstanceIdentifier

Description de l'alarme : Alarme lorsque le taux d'accès au cache de la mémoire tampon tombe en dessous de 80 % pour une instance RDS.

Objectif : détecter une faible efficacité du cache entraînant une baisse des performances.

Critères ProMQL : avg({__name__="BufferCacheHitRatio", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) < 80

Seuil recommandé : 80 (intégré dans la requête)

Justification du seuil : une valeur inférieure à 80 % indique une quantité excessive de disque I/O.

Intervalle d'évaluation : 60

Période d'attente : 600

Période de récupération : 600

EngineUptime

Étiquettes : DBClusterIdentifier

Description de l'alarme : Alarme lorsque le temps de fonctionnement du moteur tombe à zéro, indiquant le redémarrage d'un enregistreur Aurora.

Objectif : détecter les temps d'arrêt ou les pannes de l'instance Aurora Writer.

Critères ProMQL : avg({__name__="EngineUptime", "@instrumentation.@name"="cloudwatch.aws/rds", DBClusterIdentifier="CLUSTER"}) <= 0

Seuil recommandé : 0 (intégré dans la requête)

Justification du seuil : une disponibilité nulle indique un redémarrage de l'instance.

Intervalle d'évaluation : 60

Période en attente : 120

Période de récupération : 120

RollbackSegmentHistoryListLength

Étiquettes : DBInstanceIdentifier

Description de l'alarme : Alarme lorsque la longueur de la liste de l'historique des segments d'annulation dépasse 1 million pour une instance Aurora.

Objectif : détecter un historique de restauration élevé à l'origine de la dégradation du processeur.

Critères ProMQL : avg({__name__="RollbackSegmentHistoryListLength", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > 1000000

Seuil recommandé : 1000000 (intégré dans la requête)

Justification du seuil : un seuil supérieur à 1 million entraîne des problèmes de performances.

Intervalle d'évaluation : 60

Période d'attente : 300

Période de récupération : 300

StorageNetworkThroughput

Étiquettes : DBClusterIdentifier

Description de l'alarme : Alarme lorsque le débit du réseau de stockage dépasse le seuil d'un cluster Aurora.

Objectif : détecter les pertes de paquets réseau présentant un risque de perte de paquets sur le haut débit.

Critères ProMQL : avg({__name__="StorageNetworkThroughput", "@instrumentation.@name"="cloudwatch.aws/rds", DBClusterIdentifier="CLUSTER"}) > THRESHOLD

Seuil recommandé : THRESHOLD (intégré dans la requête)

Justification du seuil : défini en fonction de la capacité du réseau d'instances.

Intervalle d'évaluation : 60

Période d'attente : 300

Période de récupération : 300

HealthCheckStatus

Étiquettes : HealthCheckId

Description de l'alarme : Alarme lorsqu'un bilan de santé de la Route 53 signale un terminal défectueux.

Objectif : Détectez les terminaux défectueux à l'aide des vérificateurs de santé Route 53.

Critères ProMQL : avg({__name__="HealthCheckStatus", "@instrumentation.@name"="cloudwatch.aws/route53", HealthCheckId="HC"}) < 1

Seuil recommandé : 1 (intégré dans la requête)

Justification du seuil : un seuil inférieur à 1 indique que le terminal échoue aux tests de santé.

Intervalle d'évaluation : 60

Période en attente : 180

Période de récupération : 180

4xxErrors

Étiquettes : BucketName, FilterId

Description de l'alarme : Alarme lorsque le taux d'erreur 4xx dépasse 5 % pour un compartiment S3.

Objectif : détecter les taux d'erreur anormaux des clients.

Critères ProMQL : avg({__name__="4xxErrors", "@instrumentation.@name"="cloudwatch.aws/s3", BucketName="BUCKET",FilterId="FILTER"}) > 0.05

Seuil recommandé : 0,05 (intégré dans la requête)

Justification du seuil : un seuil supérieur à 5 % indique des problèmes de configuration ou d'accès.

Intervalle d'évaluation : 60

Période d'attente : 900

Période de récupération : 900

5xxErrors

Étiquettes : BucketName, FilterId

Description de l'alarme : Alarme lorsque le taux d'erreur 5xx dépasse 5 % pour un compartiment S3.

Objectif : détecter les erreurs côté serveur affectant l'application.

Critères ProMQL : avg({__name__="5xxErrors", "@instrumentation.@name"="cloudwatch.aws/s3", BucketName="BUCKET",FilterId="FILTER"}) > 0.05

Seuil recommandé : 0,05 (intégré dans la requête)

Justification du seuil : une valeur supérieure à 5 % indique des problèmes de service S3.

Intervalle d'évaluation : 60

Période d'attente : 900

Période de récupération : 900

OperationsFailedReplication

Étiquettes : SourceBucket, DestinationBucket, RuleId

Description de l'alarme : Alarme lorsque les opérations de réplication S3 échouent pour un bucket.

Objectif : détecter les échecs de réplication risquant d'entraîner des incohérences dans les données.

Critères ProMQL : max({__name__="OperationsFailedReplication", "@instrumentation.@name"="cloudwatch.aws/s3", SourceBucket="SRC",DestinationBucket="DST",RuleId="RULE"}) > 0

Seuil recommandé : 0 (intégré dans la requête)

Justification du seuil : tout échec de réplication doit faire l'objet d'une enquête.

Intervalle d'évaluation : 60

Période d'attente : 300

Période de récupération : 300

4xxErrors

Libellés : AccessPointName, DataSource ARN

Description de l'alarme : Alarme lorsque le taux d'erreur 4xx dépasse 5 % pour un point d'accès S3 Object Lambda.

Objectif : détecter des taux d'erreur client anormaux pour Object Lambda.

Critères ProMQL : avg({__name__="4xxErrors", "@instrumentation.@name"="cloudwatch.aws/s3objectlambda", AccessPointName="AP",DataSourceARN="ARN"}) > 0.05

Seuil recommandé : 0,05 (intégré dans la requête)

Justification du seuil : un seuil supérieur à 5 % indique des problèmes de configuration.

Intervalle d'évaluation : 60

Période d'attente : 900

Période de récupération : 900

5xxErrors

Libellés : AccessPointName, DataSource ARN

Description de l'alarme : Alarme lorsque le taux d'erreur 5xx dépasse 5 % pour un point d'accès S3 Object Lambda.

Objectif : détecter les erreurs côté serveur dans Object Lambda.

Critères ProMQL : avg({__name__="5xxErrors", "@instrumentation.@name"="cloudwatch.aws/s3objectlambda", AccessPointName="AP",DataSourceARN="ARN"}) > 0.05

Seuil recommandé : 0,05 (intégré dans la requête)

Justification du seuil : un seuil supérieur à 5 % indique des problèmes Lambda ou S3.

Intervalle d'évaluation : 60

Période d'attente : 900

Période de récupération : 900

LambdaResponse4xx

Libellés : AccessPointName, DataSource ARN

Description de l'alarme : Alarme lorsque le taux de réponse de la fonction Lambda 4xx dépasse 5 % pour un point d'accès S3 Object Lambda.

Objectif : détecter les erreurs du client de la fonction Lambda.

Critères ProMQL : avg({__name__="LambdaResponse4xx", "@instrumentation.@name"="cloudwatch.aws/s3objectlambda", AccessPointName="AP",DataSourceARN="ARN"}) > 0.05

Seuil recommandé : 0,05 (intégré dans la requête)

Justification du seuil : un seuil supérieur à 5 % indique des problèmes liés à la fonction Lambda.

Intervalle d'évaluation : 60

Période d'attente : 900

Période de récupération : 900

NumberOfMessagesPublished

Étiquettes : TopicName

Description de l'alarme : Alarme lorsque le nombre de messages publiés tombe en dessous du seuil d'une rubrique SNS.

Objectif : détecter une baisse significative du volume de publication.

Critères ProMQL : sum({__name__="NumberOfMessagesPublished", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) < THRESHOLD

Seuil recommandé : THRESHOLD (intégré dans la requête)

Justification du seuil : défini en fonction du trafic minimum attendu.

Intervalle d'évaluation : 60

Période d'attente : 300

Période de récupération : 300

NumberOfNotificationsDelivered

Étiquettes : TopicName

Description de l'alarme : Alarme lorsque le nombre de notifications envoyées tombe en dessous du seuil d'une rubrique SNS.

Objectif : détecter la baisse du volume de notifications envoyées.

Critères ProMQL : sum({__name__="NumberOfNotificationsDelivered", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) < THRESHOLD

Seuil recommandé : THRESHOLD (intégré dans la requête)

Justification du seuil : défini en fonction du nombre minimum de livraisons attendues.

Intervalle d'évaluation : 60

Période d'attente : 300

Période de récupération : 300

NumberOfNotificationsFailed

Étiquettes : TopicName

Description de l'alarme : Alarme lorsque le nombre d'échecs de transmission de notifications dépasse le seuil d'une rubrique SNS.

Objectif : détecter les échecs de livraison.

Critères ProMQL : sum({__name__="NumberOfNotificationsFailed", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) > THRESHOLD

Seuil recommandé : THRESHOLD (intégré dans la requête)

Justification du seuil : défini en fonction d'un taux d'échec acceptable.

Intervalle d'évaluation : 60

Période d'attente : 300

Période de récupération : 300

NumberOfNotificationsFilteredOut-InvalidAttributes

Étiquettes : TopicName

Description de l'alarme : Alarme lorsque les notifications sont filtrées en raison d'attributs de message non valides.

Objectif : détecter les attributs de message non valides.

Critères ProMQL : sum({__name__="NumberOfNotificationsFilteredOut-InvalidAttributes", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) > 0

Seuil recommandé : 0 (intégré dans la requête)

Justification du seuil : tout filtre non valide indique une mauvaise configuration.

Intervalle d'évaluation : 60

Période d'attente : 300

Période de récupération : 300

NumberOfNotificationsFilteredOut-InvalidMessageBody

Étiquettes : TopicName

Description de l'alarme : Alarme lorsque les notifications sont filtrées en raison de corps de message non valides.

Objectif : détecter les corps de message non valides.

Critères ProMQL : sum({__name__="NumberOfNotificationsFilteredOut-InvalidMessageBody", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) > 0

Seuil recommandé : 0 (intégré dans la requête)

Justification du seuil : tout filtre non valide indique une mauvaise configuration.

Intervalle d'évaluation : 60

Période d'attente : 300

Période de récupération : 300

NumberOfNotificationsRedrivenToDlq

Étiquettes : TopicName

Description de l'alarme : Alarme lorsque des notifications sont envoyées à la file d'attente des lettres mortes pour une rubrique SNS.

Objectif : détecter les messages envoyés à la file d'attente des lettres mortes.

Critères ProMQL : sum({__name__="NumberOfNotificationsRedrivenToDlq", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) > 0

Seuil recommandé : 0 (intégré dans la requête)

Justification du seuil : tout message DLQ indique des problèmes de livraison.

Intervalle d'évaluation : 60

Période d'attente : 300

Période de récupération : 300

NumberOfNotificationsFailedToRedriveToDlq

Étiquettes : TopicName

Description de l'alarme : Alarme lorsque les notifications ne sont pas envoyées à la file d'attente des lettres mortes pour une rubrique SNS.

Objectif : détecter les échecs de distribution du DLQ.

Critères ProMQL : sum({__name__="NumberOfNotificationsFailedToRedriveToDlq", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) > 0

Seuil recommandé : 0 (intégré dans la requête)

Justification du seuil : l'échec du DLQ signifie la perte du suivi des erreurs.

Intervalle d'évaluation : 60

Période d'attente : 300

Période de récupération : 300

SMSMonthToDateSpentUSD

Étiquettes : TopicName

Description de l'alarme : Alarme lorsque les dépenses en SMS approchent le quota du compte pour une rubrique SNS.

Objectif : détecter les dépenses liées aux SMS qui approchent du quota.

Critères ProMQL : max({__name__="SMSMonthToDateSpentUSD", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) > THRESHOLD

Seuil recommandé : THRESHOLD (intégré dans la requête)

Justification du seuil : défini en fonction du quota de SMS du compte.

Intervalle d'évaluation : 60

Période d'attente : 300

Période de récupération : 300

SMSSuccessRate

Étiquettes : TopicName

Description de l'alarme : alarme lorsque le taux de réussite de l'envoi de SMS tombe en dessous du seuil d'une rubrique SNS.

Objectif : détecter les échecs d'envoi de SMS.

Critères ProMQL : avg({__name__="SMSSuccessRate", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) < THRESHOLD

Seuil recommandé : THRESHOLD (intégré dans la requête)

Justification du seuil : défini en fonction d'un taux de livraison acceptable.

Intervalle d'évaluation : 60

Période d'attente : 300

Période de récupération : 300

ApproximateAgeOfOldestMessage

Étiquettes : QueueName

Description de l'alarme : alarme lorsque l'âge du message le plus ancien dépasse le seuil d'une file d'attente SQS.

Objectif : détecter les messages qui ne sont pas traités assez rapidement.

Critères ProMQL : max({__name__="ApproximateAgeOfOldestMessage", "@instrumentation.@name"="cloudwatch.aws/sqs", QueueName="QUEUE"}) > THRESHOLD

Seuil recommandé : THRESHOLD (intégré dans la requête)

Justification du seuil : défini en fonction du temps de traitement des messages acceptable.

Intervalle d'évaluation : 60

Période d'attente : 900

Période de récupération : 900

ApproximateNumberOfMessagesNotVisible

Étiquettes : QueueName

Description de l'alarme : Alarme lorsque le nombre de messages en vol dépasse le seuil d'une file d'attente SQS.

Objectif : détecter les nombreux messages en vol indiquant des problèmes rencontrés par les consommateurs.

Critères ProMQL : avg({__name__="ApproximateNumberOfMessagesNotVisible", "@instrumentation.@name"="cloudwatch.aws/sqs", QueueName="QUEUE"}) > THRESHOLD

Seuil recommandé : THRESHOLD (intégré dans la requête)

Justification du seuil : défini en fonction du volume de traitement attendu.

Intervalle d'évaluation : 60

Période d'attente : 900

Période de récupération : 900

ApproximateNumberOfMessagesVisible

Étiquettes : QueueName

Description de l'alarme : Alarme lorsque le nombre de messages visibles dépasse le seuil d'une file SQS.

Objectif : détecter l'arriéré de messages indiquant la lenteur des consommateurs.

Critères ProMQL : avg({__name__="ApproximateNumberOfMessagesVisible", "@instrumentation.@name"="cloudwatch.aws/sqs", QueueName="QUEUE"}) > THRESHOLD

Seuil recommandé : THRESHOLD (intégré dans la requête)

Justification du seuil : défini en fonction de la profondeur de file d'attente attendue.

Intervalle d'évaluation : 60

Période d'attente : 900

Période de récupération : 900

NumberOfMessagesSent

Étiquettes : QueueName

Description de l'alarme : Alarme lorsqu'aucun message n'est envoyé à une file d'attente SQS.

Objectif : détecter que les producteurs ont cessé d'envoyer des messages.

Critères ProMQL : sum({__name__="NumberOfMessagesSent", "@instrumentation.@name"="cloudwatch.aws/sqs", QueueName="QUEUE"}) <= 0

Seuil recommandé : 0 (intégré dans la requête)

Justification du seuil : aucun message n'indique une défaillance du producteur.

Intervalle d'évaluation : 60

Période d'attente : 900

Période de récupération : 900

TunnelState (niveau VPN)

Étiquettes : VpnId

Description de l'alarme : Alarme lorsqu'au moins un tunnel VPN est en état d'arrêt.

Objectif : détecter au moins un tunnel en état DOWN.

Critères ProMQL : min({__name__="TunnelState", "@instrumentation.@name"="cloudwatch.aws/vpn", VpnId="VPN"}) < 1

Seuil recommandé : 1 (intégré dans la requête)

Justification du seuil : un seuil inférieur à 1 signifie que le tunnel est en panne.

Intervalle d'évaluation : 300

Période d'attente : 900

Période de récupération : 900

TunnelState (niveau du tunnel)

Étiquettes : TunnelIpAddress

Description de l'alarme : Alarme lorsqu'un tunnel VPN spécifique est en état d'arrêt.

Objectif : détecter un tunnel spécifique en état DOWN.

Critères ProMQL : min({__name__="TunnelState", "@instrumentation.@name"="cloudwatch.aws/vpn", TunnelIpAddress="IP"}) < 1

Seuil recommandé : 1 (intégré dans la requête)

Justification du seuil : un seuil inférieur à 1 signifie que le tunnel est en panne.

Intervalle d'évaluation : 300

Période d'attente : 900

Période de récupération : 900