Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.
Alarmes ProMQL recommandées
Utilisez ces alarmes ProMQL comme équivalentes aux alarmes classiques recommandées. Ils surveillent les mêmes métriques à l'aide de requêtes instantanées ProMQL qui sont évaluées par rapport aux métriques ingérées via le CloudWatch point de terminaison OTLP.
Les alarmes ProMQL sont utilisées EvaluationCriteria avec. PromQLCriteria Contrairement aux alarmes métriques classiques, le seuil est intégré directement dans l'expression de requête ProMQL.
-
Période d'attente : durée en secondes pendant laquelle une série chronologique doit continuellement dépasser avant que l'alarme ne passe à l'état ALARME.
-
Période de restauration : durée en secondes pendant laquelle toutes les séries chronologiques doivent cesser d'être piratées avant que l'alarme ne revienne à l'état OK.
-
Intervalle d'évaluation : fréquence, en secondes, d' CloudWatch exécution de la requête ProMQL.
Note
Ces alarmes nécessitent la publication de mesures via le point de terminaison CloudWatch OTLP. Pour de plus amples informations, veuillez consulter Alarmes ProMQL.
Vous pouvez déployer ces alarmes à l'aide de AWS CloudFormation. Utilisez les PromQLCriteria propriétés EvaluationCriteria et de la AWS::CloudWatch::Alarm ressource.
Rubriques
API Gateway
API REST
- 4XXError
-
Étiquettes : ApiName, Stage
Description de l'alarme : Alarme lorsque le taux d'erreur 4XX moyen dépasse 5 % pour une étape de l'API REST.
Objectif : détecter un taux d'erreur client élevé indiquant des problèmes de demande.
Critères ProMQL :
avg({__name__="4XXError", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiName="your-api-name",Stage="your-stage"}) > 0.05Seuil recommandé : 0,05 (intégré dans la requête)
Justification du seuil : détecte un taux d'erreur client supérieur à 5 %, ce qui indique des échecs de demande importants.
Intervalle d'évaluation : 60
Période d'attente : 300
Période de récupération : 300
- 5XXError
-
Libellés : ApiName, Stage
Description de l'alarme : Alarme lorsque le taux d'erreur 5XX moyen dépasse 5 % pour une étape de l'API REST.
Objectif : détecter un taux d'erreur de serveur élevé indiquant des défaillances du backend.
Critères ProMQL :
avg({__name__="5XXError", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiName="your-api-name",Stage="your-stage"}) > 0.05Seuil recommandé : 0,05 (intégré dans la requête)
Justification du seuil : détecte un taux d'erreur du serveur supérieur à 5 %, ce qui nécessite une enquête immédiate.
Intervalle d'évaluation : 60
Période en attente : 180
Période de récupération : 300
- Latence
-
Libellés : ApiName, Stage
Description de l'alarme : Alarme lorsque la latence p90 dépasse 2 500 ms pour une étape de l'API REST.
Objectif : détecter une latence p90 élevée affectant l'expérience utilisateur.
Critères ProMQL :
histogram_quantile(0.9, {__name__="Latency", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiName="your-api-name",Stage="your-stage"}) > 2500Seuil recommandé : 2500 (intégré dans la requête)
Justification du seuil : une latence p90 supérieure à 2 500 ms indique des temps de réponse dégradés pour la plupart des requêtes.
Intervalle d'évaluation : 60
Période d'attente : 300
Période de récupération : 300
- Count
-
Libellés : ApiName, Stage
Description de l'alarme : alarme lorsque le nombre total de demandes tombe en dessous de la valeur de référence attendue pour une étape de l'API REST.
Objectif : détecter un faible volume de trafic susceptible d'indiquer des problèmes de routage ou de disponibilité.
Critères ProMQL :
sum({__name__="Count", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiName="your-api-name",Stage="your-stage"}) <THRESHOLDSeuil recommandé :
THRESHOLD(intégré dans la requête)Justification du seuil : définissez-le en fonction de votre niveau de référence de trafic attendu pour détecter les baisses inattendues.
Intervalle d'évaluation : 60
Période d'attente : 600
Période de récupération : 300
API HTTP
- 4xx
-
Étiquettes : ApiId, Stage
Description de l'alarme : Alarme lorsque le taux d'erreur 4xx moyen dépasse 5 % pour une étape d'API HTTP.
Objectif : détecter un taux d'erreur client élevé sur les points de terminaison de l'API HTTP.
Critères ProMQL :
avg({__name__="4xx", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="your-api-id",Stage="your-stage"}) > 0.05Seuil recommandé : 0,05 (intégré dans la requête)
Justification du seuil : détecte un taux d'erreur client supérieur à 5 %.
Intervalle d'évaluation : 60
Période d'attente : 300
Période de récupération : 300
- 5xx
-
Libellés : ApiId, Stage
Description de l'alarme : Alarme lorsque le taux d'erreur 5xx moyen dépasse 5 % pour une étape d'API HTTP.
Objectif : détecter un taux d'erreur de serveur élevé sur les points de terminaison de l'API HTTP.
Critères ProMQL :
avg({__name__="5xx", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="your-api-id",Stage="your-stage"}) > 0.05Seuil recommandé : 0,05 (intégré dans la requête)
Justification du seuil : détecte un taux d'erreur de serveur supérieur à 5 % nécessitant une enquête.
Intervalle d'évaluation : 60
Période en attente : 180
Période de récupération : 300
- Latence
-
Libellés : ApiId, Stage
Description de l'alarme : Alarme lorsque la latence du p90 dépasse 2 500 ms pour une étape d'API HTTP.
Objectif : détecter une latence p90 élevée sur les points de terminaison de l'API HTTP.
Critères ProMQL :
histogram_quantile(0.9, {__name__="Latency", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="your-api-id",Stage="your-stage"}) > 2500Seuil recommandé : 2500 (intégré dans la requête)
Justification du seuil : une latence p90 supérieure à 2 500 ms indique des temps de réponse dégradés.
Intervalle d'évaluation : 60
Période d'attente : 300
Période de récupération : 300
- IntegrationLatency
-
Libellés : ApiId, Stage
Description de l'alarme : Alarme lorsque la latence d'intégration du p90 dépasse 2 000 ms pour une étape d'API HTTP.
Objectif : détecter les temps de latence élevés liés à l'intégration du backend qui ont une incidence sur les temps de réponse.
Critères ProMQL :
histogram_quantile(0.9, {__name__="IntegrationLatency", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="your-api-id",Stage="your-stage"}) > 2000Seuil recommandé : 2000 (intégré dans la requête)
Justification du seuil : une latence d'intégration p90 supérieure à 2 000 ms indique une lenteur du backend.
Intervalle d'évaluation : 60
Période d'attente : 300
Période de récupération : 300
- Count
-
Libellés : ApiId, Stage
Description de l'alarme : alarme lorsque le nombre total de demandes tombe en dessous de la valeur de référence attendue pour une étape d'API HTTP.
Objectif : détecter un faible volume de trafic susceptible d'indiquer des problèmes de routage ou de disponibilité.
Critères ProMQL :
sum({__name__="Count", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="your-api-id",Stage="your-stage"}) <THRESHOLDSeuil recommandé :
THRESHOLD(intégré dans la requête)Justification du seuil : définissez-le en fonction de votre niveau de référence de trafic attendu pour détecter les baisses inattendues.
Intervalle d'évaluation : 60
Période d'attente : 600
Période de récupération : 300
WebSocket API
- ClientError
-
Libellés : ApiId, Stage
Description de l'alarme : Alarme lorsque le taux d'erreur moyen du client dépasse 5 % pour une étape de WebSocket l'API.
Objectif : détecter un taux d'erreur client élevé sur les connexions WebSocket API.
Critères ProMQL :
avg({__name__="ClientError", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="your-api-id",Stage="your-stage"}) > 0.05Seuil recommandé : 0,05 (intégré dans la requête)
Justification du seuil : détecte un taux d'erreur client supérieur à 5 % sur WebSocket les connexions.
Intervalle d'évaluation : 60
Période d'attente : 300
Période de récupération : 300
- ExecutionError
-
Libellés : ApiId, Stage
Description de l'alarme : Alarme lorsque le taux d'erreur d'exécution moyen dépasse 5 % pour une étape d' WebSocket API.
Objectif : détecter un taux élevé d'erreurs d'exécution côté serveur sur les WebSocket API.
Critères ProMQL :
avg({__name__="ExecutionError", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="your-api-id",Stage="your-stage"}) > 0.05Seuil recommandé : 0,05 (intégré dans la requête)
Justification du seuil : détecte un taux d'erreur d'exécution supérieur à 5 % nécessitant une investigation.
Intervalle d'évaluation : 60
Période en attente : 180
Période de récupération : 300
- IntegrationLatency
-
Libellés : ApiId, Stage
Description de l'alarme : Alarme lorsque la latence d'intégration du p90 dépasse 2 000 ms pour une étape d' WebSocket API.
Objectif : détecter une latence d'intégration élevée du backend sur les routes WebSocket d'API.
Critères ProMQL :
histogram_quantile(0.9, {__name__="IntegrationLatency", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="your-api-id",Stage="your-stage"}) > 2000Seuil recommandé : 2000 (intégré dans la requête)
Justification du seuil : une latence d'intégration p90 supérieure à 2 000 ms indique une lenteur du backend.
Intervalle d'évaluation : 60
Période d'attente : 300
Période de récupération : 300
- MessageCount
-
Libellés : ApiId, Stage
Description de l'alarme : alarme lorsque le nombre total de messages tombe en dessous de la valeur de référence attendue pour une étape de WebSocket l'API.
Objectif : détecter un faible volume de messages susceptible d'indiquer des problèmes de connexion ou de routage.
Critères ProMQL :
sum({__name__="MessageCount", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="your-api-id",Stage="your-stage"}) <THRESHOLDSeuil recommandé :
THRESHOLD(intégré dans la requête)Justification du seuil : définissez-le en fonction du volume de messages attendu pour détecter les baisses inattendues.
Intervalle d'évaluation : 60
Période d'attente : 600
Période de récupération : 300
Auto Scaling
- GroupInServiceCapacity
-
Étiquettes : AutoScalingGroupName
Description de l'alarme : Alarme lorsque la capacité moyenne en service tombe en dessous du minimum attendu pour un groupe Auto Scaling.
Objectif : détecter la faible disponibilité due à des échecs de lancement ou à la fermeture d'instances.
Critères ProMQL :
avg({__name__="GroupInServiceCapacity", "@instrumentation.@name"="cloudwatch.aws/autoscaling", AutoScalingGroupName="your-auto-scaling-group-name"}) <THRESHOLDSeuil recommandé :
THRESHOLD(intégré dans la requête)Justification du seuil : défini en fonction de la capacité minimale souhaitée pour détecter les échecs de lancement ou le nombre d'instances insuffisantes.
Intervalle d'évaluation : 60
Période d'attente : 600
Période de récupération : 600
Gestionnaire de certificats
- DaysToExpiry
-
Étiquettes : CertificateArn
Description de l'alarme : Alarme lorsque le délai minimum avant l'expiration du certificat tombe à 44 jours ou moins.
Objectif : alerte proactive d'expiration du certificat pour laisser le temps de le renouveler.
Critères ProMQL :
min({__name__="DaysToExpiry", "@instrumentation.@name"="cloudwatch.aws/certificatemanager", CertificateArn="your-certificate-arn"}) <= 44Seuil recommandé : 44 (intégré dans la requête)
Justification du seuil : fournit un délai suffisant avant l'expiration du certificat pour terminer le processus de renouvellement.
Intervalle d'évaluation : 86400
Période en attente : 86400
Période de récupération : 86400
CloudFront
- 5xxErrorRate
-
Étiquettes : DistributionId
Description de l'alarme : Alarme lorsque le taux d'erreur moyen de 5xx dépasse le seuil d'une CloudFront distribution.
Objectif : détecter une origine ou un taux CloudFront d'erreur élevé affectant la diffusion du contenu.
Critères ProMQL :
avg({__name__="5xxErrorRate", "@instrumentation.@name"="cloudwatch.aws/cloudfront", DistributionId="your-distribution-id"}) >THRESHOLDSeuil recommandé :
THRESHOLD(intégré dans la requête)Justification du seuil : défini en fonction de votre taux d'erreur acceptable pour la diffusion de contenu.
Intervalle d'évaluation : 60
Période d'attente : 300
Période de récupération : 300
- OriginLatency
-
Étiquettes : DistributionId
Description de l'alarme : Alarme lorsque la latence d'origine de p90 dépasse le seuil d'une CloudFront distribution.
Objectif : détecter une latence de réponse d'origine élevée qui affecte les performances de diffusion du contenu.
Critères ProMQL :
histogram_quantile(0.9, {__name__="OriginLatency", "@instrumentation.@name"="cloudwatch.aws/cloudfront", DistributionId="your-distribution-id"}) >THRESHOLDSeuil recommandé :
THRESHOLD(intégré dans la requête)Justification du seuil : défini en fonction du temps de réponse attendu à l'origine et de la stratégie de mise en cache.
Intervalle d'évaluation : 60
Période d'attente : 300
Période de récupération : 300
- FunctionValidationErrors
-
Étiquettes : DistributionId, FunctionName
Description de l'alarme : Alarme en cas d'erreur de validation de CloudFront fonction.
Objectif : détecter les CloudFront échecs de validation des fonctions qui empêchent leur exécution.
Critères ProMQL :
sum({__name__="FunctionValidationErrors", "@instrumentation.@name"="cloudwatch.aws/cloudfront", DistributionId="your-distribution-id",FunctionName="your-function-name"}) > 0Seuil recommandé : 0 (intégré dans la requête)
Justification du seuil : toute erreur de validation indique un problème de configuration des fonctions qui nécessite une attention particulière.
Intervalle d'évaluation : 60
Période en attente : 120
Période de récupération : 120
- FunctionExecutionErrors
-
Étiquettes : DistributionId, FunctionName
Description de l'alarme : Alarme en cas d'erreur d'exécution d'une CloudFront fonction.
Objectif : détecter les défaillances d'exécution dans CloudFront les fonctions qui affectent le traitement des demandes.
Critères ProMQL :
sum({__name__="FunctionExecutionErrors", "@instrumentation.@name"="cloudwatch.aws/cloudfront", DistributionId="your-distribution-id",FunctionName="your-function-name"}) > 0Seuil recommandé : 0 (intégré dans la requête)
Justification du seuil : toute erreur d'exécution indique un problème d'exécution dans le code de la fonction.
Intervalle d'évaluation : 60
Période d'attente : 300
Période de récupération : 300
- FunctionThrottles
-
Étiquettes : DistributionId, FunctionName
Description de l'alarme : Alarme lorsqu' CloudFront une fonction est bloquée.
Objectif : détecter CloudFront la limitation des fonctions susceptible de dégrader le traitement des requêtes.
Critères ProMQL :
sum({__name__="FunctionThrottles", "@instrumentation.@name"="cloudwatch.aws/cloudfront", DistributionId="your-distribution-id",FunctionName="your-function-name"}) > 0Seuil recommandé : 0 (intégré dans la requête)
Justification du seuil : tout étranglement indique que la fonction atteint les limites de calcul.
Intervalle d'évaluation : 60
Période d'attente : 300
Période de récupération : 300
Cognito
- SignUpThrottles
-
Étiquettes : UserPool, UserPoolClient
Description de l'alarme : Alarme lorsque les événements d'accélération de l'inscription dépassent le seuil d'un groupe d'utilisateurs.
Objectif : détecter la limitation des inscriptions qui empêche l'inscription de nouveaux utilisateurs.
Critères ProMQL :
sum({__name__="SignUpThrottles", "@instrumentation.@name"="cloudwatch.aws/cognito", UserPool="your-user-pool",UserPoolClient="your-user-pool-client"}) >THRESHOLDSeuil recommandé :
THRESHOLD(intégré dans la requête)Justification du seuil : défini en fonction de votre taux d'accélération acceptable pour les opérations d'inscription.
Intervalle d'évaluation : 60
Période d'attente : 300
Période de récupération : 300
- SignInThrottles
-
Étiquettes : UserPool, UserPoolClient
Description de l'alarme : Alarme lorsque les événements d'accélération de la connexion dépassent le seuil d'un groupe d'utilisateurs.
Objectif : détecter les restrictions de connexion qui empêchent l'authentification des utilisateurs.
Critères ProMQL :
sum({__name__="SignInThrottles", "@instrumentation.@name"="cloudwatch.aws/cognito", UserPool="your-user-pool",UserPoolClient="your-user-pool-client"}) >THRESHOLDSeuil recommandé :
THRESHOLD(intégré dans la requête)Justification du seuil : défini en fonction de votre taux d'accélération acceptable pour les opérations de connexion.
Intervalle d'évaluation : 60
Période d'attente : 300
Période de récupération : 300
- TokenRefreshThrottles
-
Étiquettes : UserPool, UserPoolClient
Description de l'alarme : Alarme lorsque les événements d'accélération de l'actualisation des jetons dépassent le seuil d'un groupe d'utilisateurs.
Objectif : détecter la limitation de l'actualisation des jetons susceptible d'entraîner des interruptions de session.
Critères ProMQL :
sum({__name__="TokenRefreshThrottles", "@instrumentation.@name"="cloudwatch.aws/cognito", UserPool="your-user-pool",UserPoolClient="your-user-pool-client"}) >THRESHOLDSeuil recommandé :
THRESHOLD(intégré dans la requête)Justification du seuil : défini en fonction de votre taux d'accélération acceptable pour les opérations d'actualisation des jetons.
Intervalle d'évaluation : 60
Période d'attente : 300
Période de récupération : 300
- FederationThrottles
-
Étiquettes : UserPool, UserPoolClient, IdentityProvider
Description de l'alarme : Alarme lorsque les événements d'accélération de la fédération dépassent le seuil pour le fournisseur d'identité d'un pool d'utilisateurs.
Objectif : détecter les restrictions de fédération susceptibles d'empêcher la connexion fédérée.
Critères ProMQL :
sum({__name__="FederationThrottles", "@instrumentation.@name"="cloudwatch.aws/cognito", UserPool="your-user-pool",UserPoolClient="your-user-pool-client",IdentityProvider="your-identity-provider"}) >THRESHOLDSeuil recommandé :
THRESHOLD(intégré dans la requête)Justification du seuil : défini en fonction de votre taux d'accélération acceptable pour les opérations de fédération.
Intervalle d'évaluation : 60
Période d'attente : 300
Période de récupération : 300
DynamoDB
- AccountProvisionedReadCapacityUtilization
-
Étiquettes : Aucune
Description de l'alarme : alarme lorsque l'utilisation de la capacité de lecture provisionnée au niveau du compte dépasse 80 %.
Objectif : détecter quand la capacité de lecture provisionnée approche les limites du compte.
Critères ProMQL :
max({__name__="AccountProvisionedReadCapacityUtilization", "@instrumentation.@name"="cloudwatch.aws/dynamodb"}) > 80Seuil recommandé : 80 (intégré dans la requête)
Justification du seuil : à 80 % d'utilisation, vous disposez d'une marge de manœuvre limitée avant d'atteindre les limites de votre compte.
Intervalle d'évaluation : 300
Période d'attente : 600
Période de récupération : 600
- AccountProvisionedWriteCapacityUtilization
-
Étiquettes : Aucune
Description de l'alarme : alarme lorsque l'utilisation de la capacité d'écriture provisionnée au niveau du compte dépasse 80 %.
Objectif : détecter quand la capacité d'écriture provisionnée approche les limites du compte.
Critères ProMQL :
max({__name__="AccountProvisionedWriteCapacityUtilization", "@instrumentation.@name"="cloudwatch.aws/dynamodb"}) > 80Seuil recommandé : 80 (intégré dans la requête)
Justification du seuil : à 80 % d'utilisation, vous disposez d'une marge de manœuvre limitée avant d'atteindre les limites de votre compte.
Intervalle d'évaluation : 300
Période d'attente : 600
Période de récupération : 600
- AgeOfOldestUnreplicatedRecord
-
Étiquettes : TableName, DelegatedOperation
Description de l'alarme : Alarme lorsque l'âge du plus ancien enregistrement non répliqué dépasse le seuil.
Objectif : détecter les retards de réplication susceptibles d'entraîner des données obsolètes dans les tables globales.
Critères ProMQL :
max({__name__="AgeOfOldestUnreplicatedRecord", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name",DelegatedOperation="your-operation"}) >THRESHOLDSeuil recommandé :
THRESHOLD(intégré dans la requête)Justification du seuil : défini en fonction de vos exigences en matière de fraîcheur de la réplication.
Intervalle d'évaluation : 300
Période d'attente : 900
Période de récupération : 900
- FailedToReplicateRecordCount
-
Étiquettes : TableName, DelegatedOperation
Description de l'alarme : alarme lorsqu'un enregistrement ne parvient pas à se répliquer dans une table globale.
Objectif : détecter les échecs de réplication qui entraînent une incohérence des données entre les régions.
Critères ProMQL :
sum({__name__="FailedToReplicateRecordCount", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name",DelegatedOperation="your-operation"}) > 0Seuil recommandé : 0 (intégré dans la requête)
Justification du seuil : tout échec de réplication indique des problèmes de cohérence des données nécessitant une attention immédiate.
Intervalle d'évaluation : 60
Période d'attente : 60
Période de récupération : 60
- ReadThrottleEvents
-
Étiquettes : TableName
Description de l'alarme : Alarme lorsque les événements de lecture de l'accélérateur dépassent le seuil d'un tableau.
Objectif : détecter la limitation de la lecture qui indique une capacité provisionnée insuffisante.
Critères ProMQL :
sum({__name__="ReadThrottleEvents", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name"}) >THRESHOLDSeuil recommandé :
THRESHOLD(intégré dans la requête)Justification du seuil : défini en fonction du nombre d'accélérateurs que vous pouvez accepter pour les opérations de lecture.
Intervalle d'évaluation : 60
Période d'attente : 300
Période de récupération : 300
- ReadThrottleEvents (GSI)
-
Étiquettes : TableName, GlobalSecondaryIndexName
Description de l'alarme : Alarme lorsque les événements d'accélération de lecture dépassent le seuil d'un indice secondaire global.
Objectif : détecter la limitation de la lecture sur un GSI qui indique une capacité d'index insuffisante.
Critères ProMQL :
sum({__name__="ReadThrottleEvents", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name",GlobalSecondaryIndexName="your-index-name"}) >THRESHOLDSeuil recommandé :
THRESHOLD(intégré dans la requête)Justification du seuil : défini en fonction de votre nombre d'accélérateurs acceptable pour les opérations de lecture GSI.
Intervalle d'évaluation : 60
Période d'attente : 300
Période de récupération : 300
- ReplicationLatency
-
Étiquettes : TableName, ReceivingRegion
Description de l'alarme : Alarme lorsque la latence moyenne de réplication dépasse le seuil d'une table globale.
Objectif : détecter une latence de réplication élevée susceptible de provoquer des lectures obsolètes dans les régions de réplication.
Critères ProMQL :
avg({__name__="ReplicationLatency", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name",ReceivingRegion="your-receiving-region"}) >THRESHOLDSeuil recommandé :
THRESHOLD(intégré dans la requête)Justification du seuil : défini en fonction de vos exigences en matière d'actualisation des données pour les régions de répliques.
Intervalle d'évaluation : 60
Période d'attente : 900
Période de récupération : 900
- SuccessfulRequestLatency
-
Libellés : TableName, Opération
Description de l'alarme : Alarme lorsque la latence moyenne des demandes réussies dépasse le seuil d'une opération de table.
Objectif : détecter une latence élevée sur les opérations DynamoDB qui ont une incidence sur les performances de l'application.
Critères ProMQL :
avg({__name__="SuccessfulRequestLatency", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name",Operation="your-operation"}) >THRESHOLDSeuil recommandé :
THRESHOLD(intégré dans la requête)Justification du seuil : défini en fonction de votre SLA de latence pour l'opération DynamoDB spécifique.
Intervalle d'évaluation : 60
Période d'attente : 600
Période de récupération : 600
- SystemErrors
-
Étiquettes : TableName
Description de l'alarme : Alarme lorsque les erreurs du système dépassent le seuil d'une table.
Objectif : détecter les erreurs côté service DynamoDB qui affectent la disponibilité des tables.
Critères ProMQL :
sum({__name__="SystemErrors", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name"}) >THRESHOLDSeuil recommandé :
THRESHOLD(intégré dans la requête)Justification du seuil : défini en fonction du nombre d'erreurs système acceptable pour le tableau.
Intervalle d'évaluation : 60
Période d'attente : 900
Période de récupération : 900
- ThrottledPutRecordCount
-
Étiquettes : TableName, DelegatedOperation
Description de l'alarme : Alarme lorsque le nombre d'enregistrements de put étranglé dépasse le seuil d'une table.
Objectif : détecter les accès limités susceptibles d'entraîner une perte de données lors des opérations de streaming.
Critères ProMQL :
max({__name__="ThrottledPutRecordCount", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name",DelegatedOperation="your-operation"}) >THRESHOLDSeuil recommandé :
THRESHOLD(intégré dans la requête)Justification du seuil : défini en fonction de votre nombre d'accélérateurs acceptable pour les opérations de diffusion en continu.
Intervalle d'évaluation : 60
Période d'attente : 600
Période de récupération : 600
- UserErrors
-
Étiquettes : Aucune
Description de l'alarme : Alarme lorsque les erreurs de l'utilisateur dépassent le seuil défini pour l'ensemble du compte.
Objectif : détecter les taux élevés d'erreurs des clients, telles que les échecs de validation ou de vérification conditionnelle.
Critères ProMQL :
sum({__name__="UserErrors", "@instrumentation.@name"="cloudwatch.aws/dynamodb"}) >THRESHOLDSeuil recommandé :
THRESHOLD(intégré dans la requête)Justification du seuil : défini en fonction de votre taux d'erreur acceptable pour les échecs des demandes côté client.
Intervalle d'évaluation : 60
Période d'attente : 600
Période de récupération : 600
- WriteThrottleEvents
-
Étiquettes : TableName
Description de l'alarme : Alarme lorsque les événements d'accélération d'écriture dépassent le seuil d'une table.
Objectif : détecter la limitation de l'écriture qui indique une capacité provisionnée insuffisante.
Critères ProMQL :
sum({__name__="WriteThrottleEvents", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name"}) >THRESHOLDSeuil recommandé :
THRESHOLD(intégré dans la requête)Justification du seuil : défini en fonction du nombre d'accélérateurs que vous pouvez accepter pour les opérations d'écriture.
Intervalle d'évaluation : 60
Période d'attente : 300
Période de récupération : 300
- WriteThrottleEvents (GSI)
-
Étiquettes : TableName, GlobalSecondaryIndexName
Description de l'alarme : Alarme lorsque les événements d'accélération d'écriture dépassent le seuil d'un index secondaire global.
Objectif : détecter la limitation de l'écriture sur un GSI qui indique une capacité d'index insuffisante.
Critères ProMQL :
sum({__name__="WriteThrottleEvents", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name",GlobalSecondaryIndexName="your-index-name"}) >THRESHOLDSeuil recommandé :
THRESHOLD(intégré dans la requête)Justification du seuil : défini en fonction de votre nombre d'accélérateurs acceptable pour les opérations d'écriture GSI.
Intervalle d'évaluation : 60
Période d'attente : 300
Période de récupération : 300
EBS
- VolumeStalledIOCheck
-
Étiquettes : VolumeId, InstanceId
Description de l'alarme : Alarme lorsqu'un volume EBS signale un échec de I/O vérification bloqué.
Objectif : Détecter les volumes EBS bloqués I/O , ce qui indique une diminution du volume.
Critères ProMQL :
max({__name__="VolumeStalledIOCheck", "@instrumentation.@name"="cloudwatch.aws/ebs", VolumeId="your-volume-id",InstanceId="your-instance-id"}) >= 1Seuil recommandé : 1 (intégré dans la requête)
Justification du seuil : une valeur supérieure ou égale à 1 indique que le volume a stagné I/O, ce qui nécessite une enquête immédiate.
Intervalle d'évaluation : 60
Période d'attente : 600
Période de récupération : 600
Amazon Elastic Compute Cloud
- CPUUtilization
-
Étiquettes : InstanceId
Description de l'alarme : Alarme lorsque l'utilisation moyenne du processeur dépasse 80 % pour une instance EC2.
Objectif : détecter une utilisation élevée du processeur.
Critères ProMQL :
avg({__name__="CPUUtilization", "@instrumentation.@name"="cloudwatch.aws/ec2", InstanceId="your-instance-id"}) > 80Seuil recommandé : 80 (intégré dans la requête)
Justification du seuil : le seuil de 80 % donne une marge avant la saturation.
Intervalle d'évaluation : 300
Période d'attente : 900
Période de récupération : 900
- StatusCheckFailed
-
Étiquettes : InstanceId
Description de l'alarme : Alarme en cas d'échec de la vérification de l'état d'une instance ou d'un système pour une instance EC2.
Objectif : détecter les problèmes de santé de l'instance ou du système.
Critères ProMQL :
max({__name__="StatusCheckFailed", "@instrumentation.@name"="cloudwatch.aws/ec2", InstanceId="your-instance-id"}) >= 1Seuil recommandé : 1 (intégré dans la requête)
Justification du seuil : tout échec de la vérification de statut nécessite une enquête.
Intervalle d'évaluation : 300
Période d'attente : 600
Période de récupération : 600
- StatusCheckFailed_EBS attachés
-
Étiquettes : InstanceId
Description de l'alarme : Alarme lorsqu'un volume EBS connecté devient inaccessible pour une instance EC2.
Objectif : détecter les volumes EBS inaccessibles.
Critères ProMQL :
max({__name__="StatusCheckFailed_AttachedEBS", "@instrumentation.@name"="cloudwatch.aws/ec2", InstanceId="your-instance-id"}) >= 1Seuil recommandé : 1 (intégré dans la requête)
Justification du seuil : les volumes inaccessibles entraînent des I/O défaillances.
Intervalle d'évaluation : 60
Période d'attente : 600
Période de récupération : 600
Amazon ECS
- CPUReservation
-
Étiquettes : ClusterName
Description de l'alarme : Alarme lorsque la réservation moyenne du processeur dépasse 80 % pour un cluster ECS.
Objectif : détecter un cluster approchant de la capacité du processeur.
Critères ProMQL :
avg({__name__="CPUReservation", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="your-cluster-name"}) > 80Seuil recommandé : 80 (intégré dans la requête)
Justification du seuil : une réserve de 80 % indique une marge de manœuvre limitée pour les nouvelles tâches.
Intervalle d'évaluation : 60
Période d'attente : 300
Période de récupération : 300
- CPUUtilization
-
Étiquettes : ClusterName, ServiceName
Description de l'alarme : Alarme lorsque l'utilisation moyenne du processeur dépasse 80 % pour un service ECS.
Objectif : détecter une utilisation élevée du processeur pour le service ECS.
Critères ProMQL :
avg({__name__="CPUUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="your-cluster-name",ServiceName="your-service-name"}) > 80Seuil recommandé : 80 (intégré dans la requête)
Justification du seuil : 80 % donnent une marge de manœuvre avant la saturation.
Intervalle d'évaluation : 60
Période d'attente : 300
Période de récupération : 300
- EBSFilesystemUtilization
-
Étiquettes : ClusterName, ServiceName
Description de l'alarme : Alarme lorsque l'utilisation moyenne du système de fichiers EBS dépasse 80 % pour un service ECS.
Objectif : détecter une utilisation élevée du stockage EBS.
Critères ProMQL :
avg({__name__="EBSFilesystemUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="your-cluster-name",ServiceName="your-service-name"}) > 80Seuil recommandé : 80 (intégré dans la requête)
Justification du seuil : 80 % donnent une marge de manœuvre avant la saturation.
Intervalle d'évaluation : 60
Période d'attente : 300
Période de récupération : 300
- MemoryReservation
-
Étiquettes : ClusterName
Description de l'alarme : Alarme lorsque la réservation moyenne de mémoire dépasse 80 % pour un cluster ECS.
Objectif : Détecter un cluster dont la capacité de mémoire est proche.
Critères ProMQL :
avg({__name__="MemoryReservation", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="your-cluster-name"}) > 80Seuil recommandé : 80 (intégré dans la requête)
Justification du seuil : une réserve de 80 % indique une marge de manœuvre limitée pour les nouvelles tâches.
Intervalle d'évaluation : 60
Période d'attente : 300
Période de récupération : 300
- MemoryUtilization
-
Étiquettes : ClusterName, ServiceName
Description de l'alarme : Alarme lorsque l'utilisation moyenne de la mémoire dépasse 80 % pour un service ECS.
Objectif : détecter une utilisation élevée de la mémoire.
Critères ProMQL :
avg({__name__="MemoryUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="your-cluster-name",ServiceName="your-service-name"}) > 80Seuil recommandé : 80 (intégré dans la requête)
Justification du seuil : 80 % donnent une marge de manœuvre avant la saturation.
Intervalle d'évaluation : 60
Période d'attente : 300
Période de récupération : 300
- HTTP Code_Target _5xx_Count
-
Étiquettes : ClusterName, ServiceName
Description de l'alarme : alarme lorsque le nombre d'erreurs HTTP 5XX dépasse le seuil d'un service ECS.
Objectif : détecter un nombre élevé d'erreurs côté serveur.
Critères ProMQL :
sum({__name__="HTTPCode_Target_5XX_Count", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="your-cluster-name",ServiceName="your-service-name"}) >THRESHOLDSeuil recommandé :
THRESHOLD(intégré dans la requête)Justification du seuil : défini en fonction du taux d'erreur de référence normal de votre application.
Intervalle d'évaluation : 60
Période d'attente : 300
Période de récupération : 300
- TargetResponseTime
-
Étiquettes : ClusterName, ServiceName
Description de l'alarme : Alarme lorsque le temps de réponse cible moyen dépasse le seuil d'un service ECS.
Objectif : détecter un temps de réponse cible élevé.
Critères ProMQL :
avg({__name__="TargetResponseTime", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="your-cluster-name",ServiceName="your-service-name"}) >THRESHOLDSeuil recommandé :
THRESHOLD(intégré dans la requête)Justification du seuil : défini en fonction des exigences de latence acceptables de votre application.
Intervalle d'évaluation : 60
Période d'attente : 300
Période de récupération : 300
Informations sur les conteneurs Amazon ECS
- EphemeralStorageUtilized
-
Étiquettes : ClusterName, ServiceName
Description de l'alarme : alarme lorsque l'utilisation moyenne du stockage éphémère dépasse le seuil des tâches Fargate.
Objectif : détecter une utilisation élevée du stockage éphémère pour les tâches Fargate.
Critères ProMQL :
avg({__name__="EphemeralStorageUtilized", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name",ServiceName="your-service-name"}) >THRESHOLDSeuil recommandé :
THRESHOLD(intégré dans la requête)Justification du seuil : défini en fonction de l'allocation de stockage éphémère de votre tâche.
Intervalle d'évaluation : 60
Période d'attente : 300
Période de récupération : 300
- RunningTaskCount
-
Étiquettes : ClusterName, ServiceName
Description de l'alarme : Alarme lorsque le nombre de tâches en cours tombe à zéro pour un service ECS.
Objectif : détecter lorsqu'aucune tâche n'est en cours d'exécution.
Critères ProMQL :
avg({__name__="RunningTaskCount", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name",ServiceName="your-service-name"}) <= 0Seuil recommandé : 0 (intégré dans la requête)
Justification du seuil : aucune tâche en cours d'exécution indique une interruption de service.
Intervalle d'évaluation : 60
Période d'attente : 300
Période de récupération : 300
- instance_filesystem_utilization
-
Étiquettes : InstanceId, ContainerInstanceId, ClusterName
Description de l'alarme : alarme lorsque l'utilisation moyenne du système de fichiers dépasse 90 % sur une instance de conteneur.
Objectif : détecter une utilisation élevée du système de fichiers.
Critères ProMQL :
avg({__name__="instance_filesystem_utilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", InstanceId="your-instance-id",ContainerInstanceId="your-container-instance-id",ClusterName="your-cluster-name"}) > 90Seuil recommandé : 90 (intégré dans la requête)
Justification du seuil : 90 % d'utilisation du système de fichiers laissent un minimum d'espace pour les opérations.
Intervalle d'évaluation : 60
Période d'attente : 300
Période de récupération : 300
Observabilité améliorée d'Amazon ECS Container Insights
- TaskCpuUtilization (niveau du cluster)
-
Étiquettes : ClusterName
Description de l'alarme : Alarme lorsque l'utilisation moyenne du processeur des tâches dépasse 80 % au niveau du cluster.
Objectif : détecter une utilisation élevée du processeur.
Critères ProMQL :
avg({__name__="TaskCpuUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name"}) > 80Seuil recommandé : 80 (intégré dans la requête)
Justification du seuil : 80 % donnent une marge de manœuvre avant la saturation.
Intervalle d'évaluation : 60
Période d'attente : 300
Période de récupération : 300
- TaskCpuUtilization (niveau de service)
-
Étiquettes : ClusterName, ServiceName
Description de l'alarme : Alarme lorsque l'utilisation moyenne du processeur des tâches dépasse 80 % au niveau du service.
Objectif : détecter une utilisation élevée du processeur.
Critères ProMQL :
avg({__name__="TaskCpuUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name",ServiceName="your-service-name"}) > 80Seuil recommandé : 80 (intégré dans la requête)
Justification du seuil : 80 % donnent une marge de manœuvre avant la saturation.
Intervalle d'évaluation : 60
Période d'attente : 300
Période de récupération : 300
- TaskMemoryUtilization (niveau du cluster)
-
Étiquettes : ClusterName
Description de l'alarme : Alarme lorsque l'utilisation moyenne de la mémoire des tâches dépasse 80 % au niveau du cluster.
Objectif : détecter une utilisation élevée de la mémoire.
Critères ProMQL :
avg({__name__="TaskMemoryUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name"}) > 80Seuil recommandé : 80 (intégré dans la requête)
Justification du seuil : 80 % donnent une marge de manœuvre avant la saturation.
Intervalle d'évaluation : 60
Période d'attente : 300
Période de récupération : 300
- TaskMemoryUtilization (niveau de service)
-
Étiquettes : ClusterName, ServiceName
Description de l'alarme : Alarme lorsque l'utilisation moyenne de la mémoire des tâches dépasse 80 % au niveau du service.
Objectif : détecter une utilisation élevée de la mémoire.
Critères ProMQL :
avg({__name__="TaskMemoryUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name",ServiceName="your-service-name"}) > 80Seuil recommandé : 80 (intégré dans la requête)
Justification du seuil : 80 % donnent une marge de manœuvre avant la saturation.
Intervalle d'évaluation : 60
Période d'attente : 300
Période de récupération : 300
- ContainerCpuUtilization (niveau du cluster)
-
Étiquettes : ClusterName
Description de l'alarme : Alarme lorsque l'utilisation moyenne du processeur du conteneur dépasse 80 % au niveau du cluster.
Objectif : détecter une utilisation élevée du processeur.
Critères ProMQL :
avg({__name__="ContainerCpuUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name"}) > 80Seuil recommandé : 80 (intégré dans la requête)
Justification du seuil : 80 % donnent une marge de manœuvre avant la saturation.
Intervalle d'évaluation : 60
Période d'attente : 300
Période de récupération : 300
- ContainerCpuUtilization (niveau du conteneur)
-
Étiquettes : ContainerName, ClusterName, ServiceName
Description de l'alarme : Alarme lorsque l'utilisation moyenne du processeur du conteneur dépasse 80 % au niveau du conteneur.
Objectif : détecter une utilisation élevée du processeur.
Critères ProMQL :
avg({__name__="ContainerCpuUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ContainerName="your-container-name",ClusterName="your-cluster-name",ServiceName="your-service-name"}) > 80Seuil recommandé : 80 (intégré dans la requête)
Justification du seuil : 80 % donnent une marge de manœuvre avant la saturation.
Intervalle d'évaluation : 60
Période d'attente : 300
Période de récupération : 300
- ContainerMemoryUtilization (niveau du cluster)
-
Étiquettes : ClusterName
Description de l'alarme : Alarme lorsque l'utilisation moyenne de la mémoire du conteneur dépasse 80 % au niveau du cluster.
Objectif : détecter une utilisation élevée de la mémoire.
Critères ProMQL :
avg({__name__="ContainerMemoryUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name"}) > 80Seuil recommandé : 80 (intégré dans la requête)
Justification du seuil : 80 % donnent une marge de manœuvre avant la saturation.
Intervalle d'évaluation : 60
Période d'attente : 300
Période de récupération : 300
- ContainerMemoryUtilization (niveau du conteneur)
-
Étiquettes : ContainerName, ClusterName, ServiceName
Description de l'alarme : Alarme lorsque l'utilisation moyenne de la mémoire du conteneur dépasse 80 % au niveau du conteneur.
Objectif : détecter une utilisation élevée de la mémoire.
Critères ProMQL :
avg({__name__="ContainerMemoryUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ContainerName="your-container-name",ClusterName="your-cluster-name",ServiceName="your-service-name"}) > 80Seuil recommandé : 80 (intégré dans la requête)
Justification du seuil : 80 % donnent une marge de manœuvre avant la saturation.
Intervalle d'évaluation : 60
Période d'attente : 300
Période de récupération : 300
- TaskEBSfilesystemUtilization
-
Étiquettes : ClusterName, ServiceName
Description de l'alarme : alarme lorsque l'utilisation moyenne du système de fichiers EBS dépasse 80 % pour les tâches.
Objectif : détecter une utilisation élevée du système de fichiers EBS.
Critères ProMQL :
avg({__name__="TaskEBSfilesystemUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name",ServiceName="your-service-name"}) > 80Seuil recommandé : 80 (intégré dans la requête)
Justification du seuil : 80 % donnent une marge de manœuvre avant la saturation.
Intervalle d'évaluation : 60
Période d'attente : 300
Période de récupération : 300
- TaskEphemeralStorageUtilization (niveau du cluster)
-
Étiquettes : ClusterName
Description de l'alarme : Alarme lorsque l'utilisation moyenne du stockage éphémère dépasse 80 % au niveau du cluster.
Objectif : détecter une utilisation élevée du stockage éphémère.
Critères ProMQL :
avg({__name__="TaskEphemeralStorageUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name"}) > 80Seuil recommandé : 80 (intégré dans la requête)
Justification du seuil : 80 % donnent une marge de manœuvre avant la saturation.
Intervalle d'évaluation : 60
Période d'attente : 300
Période de récupération : 300
- TaskEphemeralStorageUtilization (niveau de service)
-
Étiquettes : ClusterName, ServiceName
Description de l'alarme : Alarme lorsque l'utilisation moyenne du stockage éphémère dépasse 80 % au niveau de service.
Objectif : détecter une utilisation élevée du stockage éphémère.
Critères ProMQL :
avg({__name__="TaskEphemeralStorageUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name",ServiceName="your-service-name"}) > 80Seuil recommandé : 80 (intégré dans la requête)
Justification du seuil : 80 % donnent une marge de manœuvre avant la saturation.
Intervalle d'évaluation : 60
Période d'attente : 300
Période de récupération : 300
Amazon EFS
- PercentIOLimit
-
Étiquettes : FileSystemId
Description de l'alarme : Alarme lorsqu'un système de fichiers EFS atteint 100 % de sa I/O limite.
Objectif : détecter quand le système de fichiers atteint sa I/O limite.
Critères ProMQL :
avg({__name__="PercentIOLimit", "@instrumentation.@name"="cloudwatch.aws/efs", FileSystemId="your-filesystem-id"}) >= 100Seuil recommandé : 100 (intégré dans la requête)
Justification du seuil : à 100 %, le système de fichiers devient un goulot d'étranglement.
Intervalle d'évaluation : 60
Période d'attente : 900
Période de récupération : 900
- BurstCreditBalance
-
Étiquettes : FileSystemId
Description de l'alarme : Alarme lorsque le solde créditeur d'un système de fichiers EFS tombe à zéro.
Objectif : détecter les crédits de rafale épuisés entraînant un ralentissement du débit.
Critères ProMQL :
avg({__name__="BurstCreditBalance", "@instrumentation.@name"="cloudwatch.aws/efs", FileSystemId="your-filesystem-id"}) <= 0Seuil recommandé : 0 (intégré dans la requête)
Justification du seuil : l'absence de crédit entraîne une réduction du débit.
Intervalle d'évaluation : 60
Période d'attente : 900
Période de récupération : 900
Informations sur les conteneurs Amazon EKS
- node_cpu_utilization
-
Étiquettes : ClusterName
Description de l'alarme : Alarme lorsque l'utilisation maximale du processeur dépasse 80 % sur les nœuds de travail EKS.
Objectif : détecter un processeur élevé sur les nœuds de travail.
Critères ProMQL :
max({__name__="node_cpu_utilization", "@instrumentation.@name"="cloudwatch.aws/eks-containerinsights", ClusterName="your-cluster-name"}) > 80Seuil recommandé : 80 (intégré dans la requête)
Justification du seuil : 80 % donnent une marge de manœuvre avant la saturation.
Intervalle d'évaluation : 60
Période d'attente : 300
Période de récupération : 300
- node_filesystem_utilization
-
Étiquettes : ClusterName
Description de l'alarme : alarme lorsque l'utilisation maximale du système de fichiers dépasse le seuil sur les nœuds de travail EKS.
Objectif : détecter une utilisation élevée du système de fichiers sur les nœuds de travail.
Critères ProMQL :
max({__name__="node_filesystem_utilization", "@instrumentation.@name"="cloudwatch.aws/eks-containerinsights", ClusterName="your-cluster-name"}) >THRESHOLDSeuil recommandé :
THRESHOLD(intégré dans la requête)Justification du seuil : défini en fonction de la capacité de stockage et des habitudes d'utilisation de votre nœud.
Intervalle d'évaluation : 60
Période d'attente : 300
Période de récupération : 300
- node_memory_utilization
-
Étiquettes : ClusterName
Description de l'alarme : Alarme lorsque l'utilisation maximale de la mémoire dépasse 80 % sur les nœuds de travail EKS.
Objectif : détecter une mémoire élevée sur les nœuds de travail.
Critères ProMQL :
max({__name__="node_memory_utilization", "@instrumentation.@name"="cloudwatch.aws/eks-containerinsights", ClusterName="your-cluster-name"}) > 80Seuil recommandé : 80 (intégré dans la requête)
Justification du seuil : 80 % donnent une marge de manœuvre avant la saturation.
Intervalle d'évaluation : 60
Période d'attente : 300
Période de récupération : 300
- pod_cpu_utilization_over_pod_limit
-
Libellés : ClusterName, Namespace, Service
Description de l'alarme : Alarme lorsque l'utilisation du processeur du pod dépasse 80 % de sa limite.
Objectif : détecter les pods approchant les limites du processeur.
Critères ProMQL :
max({__name__="pod_cpu_utilization_over_pod_limit", "@instrumentation.@name"="cloudwatch.aws/eks-containerinsights", ClusterName="your-cluster-name",Namespace="your-namespace",Service="your-service"}) > 80Seuil recommandé : 80 (intégré dans la requête)
Justification du seuil : 80 % donnent une marge de manœuvre avant que l'étranglement ne se produise.
Intervalle d'évaluation : 60
Période d'attente : 300
Période de récupération : 300
- pod_memory_utilization_over_pod_limit
-
Libellés : ClusterName, Namespace, Service
Description de l'alarme : Alarme lorsque l'utilisation de la mémoire du pod dépasse 80 % de sa limite.
Objectif : détecter les modules approchant les limites de mémoire.
Critères ProMQL :
max({__name__="pod_memory_utilization_over_pod_limit", "@instrumentation.@name"="cloudwatch.aws/eks-containerinsights", ClusterName="your-cluster-name",Namespace="your-namespace",Service="your-service"}) > 80Seuil recommandé : 80 (intégré dans la requête)
Justification du seuil : 80 % donnent une marge de manœuvre avant que OOMkill ne se produise.
Intervalle d'évaluation : 60
Période d'attente : 300
Période de récupération : 300
Amazon ElastiCache
- CPUUtilization
-
Étiquettes : CacheClusterId, CacheNodeId
Description de l'alarme : Alarme lorsque l'utilisation moyenne du processeur dépasse le seuil d'un ElastiCache nœud.
Intention : détecter un processeur élevé sur l'ensemble de l'instance.
Critères ProMQL :
avg({__name__="CPUUtilization", "@instrumentation.@name"="cloudwatch.aws/elasticache", CacheClusterId="your-cache-cluster-id",CacheNodeId="your-cache-node-id"}) >THRESHOLDSeuil recommandé :
THRESHOLD(intégré dans la requête)Justification du seuil : défini en fonction de votre type de nœud et des caractéristiques de charge de travail.
Intervalle d'évaluation : 60
Période d'attente : 300
Période de récupération : 300
- CurrConnections
-
Étiquettes : CacheClusterId, CacheNodeId
Description de l'alarme : Alarme lorsque le nombre de connexions dépasse le seuil d'un ElastiCache nœud.
Objectif : détecter un nombre élevé de connexions.
Critères ProMQL :
avg({__name__="CurrConnections", "@instrumentation.@name"="cloudwatch.aws/elasticache", CacheClusterId="your-cache-cluster-id",CacheNodeId="your-cache-node-id"}) >THRESHOLDSeuil recommandé :
THRESHOLD(intégré dans la requête)Justification du seuil : définissez-le en fonction de la taille prévue de votre pool de connexions et des besoins de l'application.
Intervalle d'évaluation : 60
Période d'attente : 600
Période de récupération : 600
- DatabaseMemoryUsagePercentage
-
Étiquettes : CacheClusterId
Description de l'alarme : alarme lorsque l'utilisation de la mémoire de la base de données dépasse le seuil d'un ElastiCache cluster.
Objectif : détecter une utilisation élevée de la mémoire pour éviter les échecs d'écriture.
Critères ProMQL :
avg({__name__="DatabaseMemoryUsagePercentage", "@instrumentation.@name"="cloudwatch.aws/elasticache", CacheClusterId="your-cache-cluster-id"}) >THRESHOLDSeuil recommandé :
THRESHOLD(intégré dans la requête)Justification du seuil : défini en fonction de votre politique d'expulsion et de la criticité des données.
Intervalle d'évaluation : 60
Période d'attente : 300
Période de récupération : 300
- EngineCPUUtilization
-
Étiquettes : CacheClusterId
Description de l'alarme : Alarme lorsque l'utilisation du processeur du moteur Redis dépasse 90 % pour un ElastiCache cluster.
Objectif : détecter une utilisation élevée du processeur du moteur Redis.
Critères ProMQL :
avg({__name__="EngineCPUUtilization", "@instrumentation.@name"="cloudwatch.aws/elasticache", CacheClusterId="your-cache-cluster-id"}) > 90Seuil recommandé : 90 (intégré dans la requête)
Justification du seuil : Redis est monothread ; une valeur supérieure à 90 % indique une saturation.
Intervalle d'évaluation : 60
Période d'attente : 300
Période de récupération : 300
- ReplicationLag
-
Étiquettes : CacheClusterId
Description de l'alarme : Alarme lorsque le délai de réplication dépasse le seuil d'un ElastiCache cluster.
Objectif : détecter les retards de réplication affectant la cohérence des données.
Critères ProMQL :
avg({__name__="ReplicationLag", "@instrumentation.@name"="cloudwatch.aws/elasticache", CacheClusterId="your-cache-cluster-id"}) >THRESHOLDSeuil recommandé :
THRESHOLD(intégré dans la requête)Justification du seuil : défini en fonction de la tolérance de votre application pour les lectures périmées.
Intervalle d'évaluation : 60
Période d'attente : 900
Période de récupération : 900
GPU Elastic
- GPUConnectivityCheckFailed
-
Libellés : InstanceId, eGPUID
Description de l'alarme : Alarme lorsque l'accélérateur Elastic Graphics perd la connectivité avec l'instance.
Objectif : détecter les problèmes de connectivité avec Elastic Graphics Accelerator.
Critères ProMQL :
max({__name__="GPUConnectivityCheckFailed", "@instrumentation.@name"="cloudwatch.aws/elasticgpus", InstanceId="your-instance-id",EGPUId="your-egpu-id"}) > 0Seuil recommandé : 0 (intégré dans la requête)
Justification du seuil : toute défaillance de connectivité doit faire l'objet d'une enquête.
Intervalle d'évaluation : 300
Période d'attente : 900
Période de récupération : 900
- GPUHealthCheckFailed
-
Libellés : InstanceId, eGPUID
Description de l'alarme : Alarme en cas d'échec de la vérification de l'état d'un accélérateur Elastic Graphics.
Objectif : détecter un accélérateur Elastic Graphics défectueux.
Critères ProMQL :
max({__name__="GPUHealthCheckFailed", "@instrumentation.@name"="cloudwatch.aws/elasticgpus", InstanceId="your-instance-id",EGPUId="your-egpu-id"}) > 0Seuil recommandé : 0 (intégré dans la requête)
Justification du seuil : les échecs du bilan de santé indiquent des problèmes d'accélérateur.
Intervalle d'évaluation : 300
Période d'attente : 900
Période de récupération : 900
EventBridge Planificateur Amazon
- TargetErrorThrottledCount
-
Description de l'alarme : Alarme lorsque les appels de la cible planifiée sont limités.
Objectif : détecter l'étranglement des cibles entraînant des retards dans le calendrier.
Critères ProMQL :
sum({__name__="TargetErrorThrottledCount", "@instrumentation.@name"="cloudwatch.aws/scheduler"}) > 0Seuil recommandé : 0 (intégré dans la requête)
Justification du seuil : toute limitation indique des problèmes de capacité cible.
Intervalle d'évaluation : 60
Période d'attente : 900
Période de récupération : 900
- InvocationThrottleCount
-
Description de l'alarme : Alarme lorsque les appels du planificateur sont limités.
Objectif : détecter la limitation des invocations du planificateur.
Critères ProMQL :
sum({__name__="InvocationThrottleCount", "@instrumentation.@name"="cloudwatch.aws/scheduler"}) > 0Seuil recommandé : 0 (intégré dans la requête)
Justification du seuil : la limitation retarde les exécutions prévues.
Intervalle d'évaluation : 60
Période d'attente : 900
Période de récupération : 900
- InvocationDroppedCount
-
Description de l'alarme : Alarme lorsque des appels planifiés sont abandonnés.
Objectif : détecter les appels supprimés.
Critères ProMQL :
sum({__name__="InvocationDroppedCount", "@instrumentation.@name"="cloudwatch.aws/scheduler"}) > 0Seuil recommandé : 0 (intégré dans la requête)
Justification du seuil : les invocations abandonnées représentent des événements planifiés perdus.
Intervalle d'évaluation : 60
Période d'attente : 60
Période de récupération : 60
- InvocationsFailedToBeSentToDeadLetterCount
-
Description de l'alarme : Alarme lorsque les appels échoués ne peuvent pas être envoyés à la file d'attente de lettres mortes.
Objectif : détecter les échecs de distribution du DLQ.
Critères ProMQL :
sum({__name__="InvocationsFailedToBeSentToDeadLetterCount", "@instrumentation.@name"="cloudwatch.aws/scheduler"}) > 0Seuil recommandé : 0 (intégré dans la requête)
Justification du seuil : l'échec de la livraison du DLQ entraîne la perte des informations d'erreur.
Intervalle d'évaluation : 60
Période d'attente : 900
Période de récupération : 900
Amazon Kinesis Data Streams
- GetRecords.IteratorAgeMilliseconds
-
Étiquettes : StreamName
Description de l'alarme : alarme lorsque l'âge de l'itérateur du consommateur dépasse le seuil d'un flux Kinesis.
Objectif : détecter les données en retard dans la période de conservation risquant de perdre des données.
Critères ProMQL :
max({__name__="GetRecords.IteratorAgeMilliseconds", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="your-stream-name"}) >THRESHOLDSeuil recommandé :
THRESHOLD(intégré dans la requête)Justification du seuil : défini en fonction du pourcentage de la période de rétention du flux.
Intervalle d'évaluation : 60
Période d'attente : 900
Période de récupération : 900
- GetRecords.Success
-
Étiquettes : StreamName
Description de l'alarme : Alarme lorsque le taux de GetRecords réussite tombe en dessous du seuil d'un flux Kinesis.
Objectif : détecter les échecs de récupération par les consommateurs.
Critères ProMQL :
avg({__name__="GetRecords.Success", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="your-stream-name"}) <THRESHOLDSeuil recommandé :
THRESHOLD(intégré dans la requête)Justification du seuil : défini en fonction du taux de réussite attendu.
Intervalle d'évaluation : 60
Période d'attente : 300
Période de récupération : 300
- PutRecord.Success
-
Étiquettes : StreamName
Description de l'alarme : Alarme lorsque le taux de PutRecord réussite tombe en dessous du seuil d'un flux Kinesis.
Objectif : détecter les défaillances d'ingestion par les producteurs.
Critères ProMQL :
avg({__name__="PutRecord.Success", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="your-stream-name"}) <THRESHOLDSeuil recommandé :
THRESHOLD(intégré dans la requête)Justification du seuil : défini en fonction du taux de réussite attendu.
Intervalle d'évaluation : 60
Période d'attente : 300
Période de récupération : 300
- PutRecords.FailedRecords
-
Étiquettes : StreamName
Description de l'alarme : Alarme lorsque les opérations de mise en lots produisent des enregistrements échoués pour un flux Kinesis.
Objectif : détecter les échecs de mise en lots.
Critères ProMQL :
sum({__name__="PutRecords.FailedRecords", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="your-stream-name"}) >THRESHOLDSeuil recommandé :
THRESHOLD(intégré dans la requête)Justification du seuil : défini en fonction d'un nombre de défaillances acceptable.
Intervalle d'évaluation : 60
Période d'attente : 300
Période de récupération : 300
- ReadProvisionedThroughputExceeded
-
Étiquettes : StreamName
Description de l'alarme : Alarme lorsque les lectures des utilisateurs dépassent le débit prévu pour un flux Kinesis.
Objectif : détecter la limitation de la lecture par les consommateurs.
Critères ProMQL :
avg({__name__="ReadProvisionedThroughputExceeded", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="your-stream-name"}) >THRESHOLDSeuil recommandé :
THRESHOLD(intégré dans la requête)Justification du seuil : Toute limitation prolongée indique des besoins en capacité.
Intervalle d'évaluation : 60
Période d'attente : 300
Période de récupération : 300
- SubscribeToShardEvent.MillisBehindLatest
-
Étiquettes : StreamName, ConsumerName
Description de l'alarme : Alarme lorsqu'un consommateur bénéficiant d'un plus grand nombre de fans prend du retard par rapport au dernier record.
Objectif : détecter l'augmentation du délai de traitement des ventilateurs par les consommateurs.
Critères ProMQL :
avg({__name__="SubscribeToShardEvent.MillisBehindLatest", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="your-stream-name",ConsumerName="your-consumer-name"}) >THRESHOLDSeuil recommandé :
THRESHOLD(intégré dans la requête)Justification du seuil : défini en fonction d'un délai de traitement acceptable.
Intervalle d'évaluation : 60
Période d'attente : 300
Période de récupération : 300
- WriteProvisionedThroughputExceeded
-
Étiquettes : StreamName
Description de l'alarme : Alarme lorsque les écritures du producteur dépassent le débit prévu pour un flux Kinesis.
Objectif : détecter la limitation de l'écriture du producteur.
Critères ProMQL :
avg({__name__="WriteProvisionedThroughputExceeded", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="your-stream-name"}) >THRESHOLDSeuil recommandé :
THRESHOLD(intégré dans la requête)Justification du seuil : une limitation continue indique les besoins en capacité.
Intervalle d'évaluation : 60
Période d'attente : 300
Période de récupération : 300
AWS Lambda
- ClaimedAccountConcurrency
-
Description de l'alarme : alarme lorsque la simultanéité des comptes réclamés dépasse le seuil.
Objectif : détecter un compte approchant le quota de simultanéité.
Critères ProMQL :
max({__name__="ClaimedAccountConcurrency", "@instrumentation.@name"="cloudwatch.aws/lambda"}) >THRESHOLDSeuil recommandé :
THRESHOLD(intégré dans la requête)Justification du seuil : défini en pourcentage de la limite de simultanéité régionale.
Intervalle d'évaluation : 60
Période d'attente : 600
Période de récupération : 600
- Erreurs
-
Étiquettes : FunctionName
Description de l'alarme : Alarme lorsque le nombre d'erreurs de fonction dépasse le seuil d'une fonction Lambda.
Objectif : détecter un nombre élevé d'erreurs de fonctionnement.
Critères ProMQL :
sum({__name__="Errors", "@instrumentation.@name"="cloudwatch.aws/lambda", FunctionName="your-function-name"}) >THRESHOLDSeuil recommandé :
THRESHOLD(intégré dans la requête)Justification du seuil : défini en fonction du volume d'erreur acceptable.
Intervalle d'évaluation : 60
Période en attente : 180
Période de récupération : 300
- Throttles
-
Étiquettes : FunctionName
Description de l'alarme : Alarme lorsque les appels de fonction sont limités pour une fonction Lambda.
Objectif : détecter la limitation de l'invocation des fonctions.
Critères ProMQL :
sum({__name__="Throttles", "@instrumentation.@name"="cloudwatch.aws/lambda", FunctionName="your-function-name"}) >THRESHOLDSeuil recommandé :
THRESHOLD(intégré dans la requête)Justification du seuil : la limitation indique que la limite de simultanéité est atteinte.
Intervalle d'évaluation : 60
Période d'attente : 300
Période de récupération : 300
- Durée
-
Étiquettes : FunctionName
Description de l'alarme : Alarme lorsque la durée de la fonction p90 dépasse le seuil d'une fonction Lambda.
Objectif : détecter les appels de fonctions de longue durée.
Critères ProMQL :
histogram_quantile(0.9, {__name__="Duration", "@instrumentation.@name"="cloudwatch.aws/lambda", FunctionName="your-function-name"}) >THRESHOLDSeuil recommandé :
THRESHOLD(intégré dans la requête)Justification du seuil : défini par rapport au délai d'expiration de la fonction.
Intervalle d'évaluation : 60
Période d'attente : 900
Période de récupération : 900
- ConcurrentExecutions
-
Étiquettes : FunctionName
Description de l'alarme : Alarme lorsque les exécutions simultanées dépassent le seuil d'une fonction Lambda.
Objectif : détecter les fonctions qui approchent des limites de simultanéité.
Critères ProMQL :
max({__name__="ConcurrentExecutions", "@instrumentation.@name"="cloudwatch.aws/lambda", FunctionName="your-function-name"}) >THRESHOLDSeuil recommandé :
THRESHOLD(intégré dans la requête)Justification du seuil : défini sur le pourcentage de simultanéité réservée.
Intervalle d'évaluation : 60
Période d'attente : 600
Période de récupération : 600
AWS Lambda Informations
- memory_utilization
-
Étiquettes : function_name
Description de l'alarme : Alarme lorsque l'utilisation moyenne de la mémoire dépasse 90 % pour une fonction Lambda.
Objectif : Détecter une fonction approchant la limite de mémoire configurée.
Critères ProMQL :
avg({__name__="memory_utilization", "@instrumentation.@name"="cloudwatch.aws/lambda-insights", function_name="your-function-name"}) > 90Seuil recommandé : 90 (intégré dans la requête)
Justification du seuil : Au-delà de 90 %, le risque de défaillance de la mémoire est insuffisant.
Intervalle d'évaluation : 60
Période d'attente : 600
Période de récupération : 600
Passerelle NAT
- ErrorPortAllocation
-
Étiquettes : NatGatewayId
Description de l'alarme : Alarme lorsque la passerelle NAT ne parvient pas à allouer un port pour les nouvelles connexions.
Objectif : détecter les échecs d'allocation de ports empêchant de nouvelles connexions.
Critères ProMQL :
sum({__name__="ErrorPortAllocation", "@instrumentation.@name"="cloudwatch.aws/natgateway", NatGatewayId="your-nat-gateway-id"}) > 0Seuil recommandé : 0 (intégré dans la requête)
Justification du seuil : tout échec d'allocation a un impact sur la connectivité.
Intervalle d'évaluation : 60
Période d'attente : 900
Période de récupération : 900
- PacketsDropCount
-
Étiquettes : NatGatewayId
Description de l'alarme : Alarme lorsque la passerelle NAT supprime des paquets dépassant le seuil.
Objectif : détecter les pertes de paquets indiquant des problèmes de capacité ou de connectivité.
Critères ProMQL :
sum({__name__="PacketsDropCount", "@instrumentation.@name"="cloudwatch.aws/natgateway", NatGatewayId="your-nat-gateway-id"}) >THRESHOLDSeuil recommandé :
THRESHOLD(intégré dans la requête)Justification du seuil : défini en fonction d'un taux de chute acceptable.
Intervalle d'évaluation : 60
Période d'attente : 300
Période de récupération : 300
AWS PrivateLink points de terminaison
- PacketsDropped
-
Étiquettes : VpcId VpcEndpointId, EndpointType, SubnetId, ServiceName
Description de l'alarme : Alarme lorsqu'un point de terminaison VPC supprime des paquets dépassant le seuil.
Objectif : détecter les terminaux ou les services de terminaux défectueux.
Critères ProMQL :
sum({__name__="PacketsDropped", "@instrumentation.@name"="cloudwatch.aws/privatelinkendpoints", VpcId="your-vpc-id",VpcEndpointId="your-vpc-endpoint-id",EndpointType="your-endpoint-type",SubnetId="your-subnet-id",ServiceName="your-service-name"}) >THRESHOLDSeuil recommandé :
THRESHOLD(intégré dans la requête)Justification du seuil : défini en fonction d'un taux de chute acceptable.
Intervalle d'évaluation : 60
Période d'attente : 300
Période de récupération : 300
AWS PrivateLink services
- RstPacketsSent
-
Libellés : ServiceId, LoadBalancerArn, Az
Description de l'alarme : Alarme lorsque le débit de paquets RST dépasse le seuil d'un service de point de terminaison.
Objectif : détecter les cibles malsaines du service Endpoint.
Critères ProMQL :
sum({__name__="RstPacketsSent", "@instrumentation.@name"="cloudwatch.aws/privatelinkservices", ServiceId="SVC",LoadBalancerArn="LB",Az="AZ"}) >THRESHOLDSeuil recommandé :
THRESHOLD(intégré dans la requête)Justification du seuil : défini en fonction d'un débit de paquets RST acceptable.
Intervalle d'évaluation : 60
Période d'attente : 300
Période de récupération : 300
RDS
- CPUUtilization
-
Étiquettes : DBInstanceIdentifier
Description de l'alarme : Alarme lorsque l'utilisation moyenne du processeur dépasse 90 % pour une instance RDS.
Objectif : détecter les hautes performances du processeur afin d'éviter toute dégradation des performances.
Critères ProMQL :
avg({__name__="CPUUtilization", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > 90Seuil recommandé : 90 (intégré dans la requête)
Justification du seuil : 90 % indiquent une saturation proche de la saturation.
Intervalle d'évaluation : 60
Période d'attente : 300
Période de récupération : 300
- DatabaseConnections
-
Étiquettes : DBInstanceIdentifier
Description de l'alarme : Alarme lorsque les connexions à la base de données dépassent le seuil d'une instance RDS.
Objectif : empêcher les connexions rejetées dans la limite maximale.
Critères ProMQL :
avg({__name__="DatabaseConnections", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) >THRESHOLDSeuil recommandé :
THRESHOLD(intégré dans la requête)Justification du seuil : défini sur le pourcentage du paramètre max_connections.
Intervalle d'évaluation : 60
Période d'attente : 300
Période de récupération : 300
- EBSByteBalance%
-
Étiquettes : DBInstanceIdentifier
Description de l'alarme : Alarme lorsque le solde des octets EBS tombe en dessous de 10 % pour une instance RDS.
Objectif : détecter les crédits à faible débit à l'origine de goulots d'étranglement.
Critères ProMQL :
avg({__name__="EBSByteBalance%", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) < 10Seuil recommandé : 10 (intégré dans la requête)
Justification du seuil : En dessous de 10 %, le débit risque d'être dégradé.
Intervalle d'évaluation : 60
Période en attente : 180
Période de récupération : 180
- EBSIOBalance%
-
Étiquettes : DBInstanceIdentifier
Description de l'alarme : Alarme lorsque l'équilibre des E/S EBS tombe en dessous de 10 % pour une instance RDS.
Objectif : détecter les faibles crédits IOPS à l'origine de goulots d'étranglement.
Critères ProMQL :
avg({__name__="EBSIOBalance%", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) < 10Seuil recommandé : 10 (intégré dans la requête)
Justification du seuil : Un seuil inférieur à 10 % présente un risque de dégradation des IOPS.
Intervalle d'évaluation : 60
Période en attente : 180
Période de récupération : 180
- FreeableMemory
-
Étiquettes : DBInstanceIdentifier
Description de l'alarme : Alarme lorsque la mémoire libérable tombe en dessous du seuil d'une instance RDS.
Objectif : éviter que le manque de mémoire n'entraîne le rejet de connexions.
Critères ProMQL :
avg({__name__="FreeableMemory", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) <THRESHOLDSeuil recommandé :
THRESHOLD(intégré dans la requête)Justification du seuil : défini en fonction de la mémoire des classes d'instance.
Intervalle d'évaluation : 60
Période d'attente : 900
Période de récupération : 900
- FreeLocalStorage
-
Étiquettes : DBInstanceIdentifier
Description de l'alarme : Alarme lorsque le stockage local disponible tombe en dessous du seuil d'une instance Aurora.
Objectif : empêcher l'épuisement du stockage local d'Aurora.
Critères ProMQL :
avg({__name__="FreeLocalStorage", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) <THRESHOLDSeuil recommandé :
THRESHOLD(intégré dans la requête)Justification du seuil : défini en fonction du minimum requis pour les opérations.
Intervalle d'évaluation : 60
Période d'attente : 300
Période de récupération : 300
- FreeStorageSpace
-
Étiquettes : DBInstanceIdentifier
Description de l'alarme : Alarme lorsque l'espace de stockage disponible tombe en dessous du seuil d'une instance RDS.
Objectif : éviter les interruptions de stockage complètes.
Critères ProMQL :
min({__name__="FreeStorageSpace", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) <THRESHOLDSeuil recommandé :
THRESHOLD(intégré dans la requête)Justification du seuil : défini en fonction du taux de croissance du stockage et de la taille provisionnée.
Intervalle d'évaluation : 60
Période d'attente : 300
Période de récupération : 300
- MaximumUsedTransactionIDs
-
Étiquettes : DBInstanceIdentifier
Description de l'alarme : Alarme lorsque le nombre maximum d'ID de transaction utilisés dépasse 1 milliard pour une instance RDS.
Objectif : empêcher le contournement de l'ID de transaction PostgreSQL.
Critères ProMQL :
avg({__name__="MaximumUsedTransactionIDs", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > 1000000000Seuil recommandé : 1000000000 (intégré dans la requête)
Justification du seuil : 1 milliard indique qu'un danger global approche.
Intervalle d'évaluation : 60
Période d'attente : 60
Période de récupération : 60
- ReadLatency
-
Étiquettes : DBInstanceIdentifier
Description de l'alarme : Alarme lorsque la latence de lecture de p90 dépasse le seuil d'une instance RDS.
Objectif : détecter une latence de lecture élevée indiquant des problèmes de disque.
Critères ProMQL :
histogram_quantile(0.9, {__name__="ReadLatency", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) >THRESHOLDSeuil recommandé :
THRESHOLD(intégré dans la requête)Justification du seuil : défini en fonction de la latence acceptable de l'application.
Intervalle d'évaluation : 60
Période d'attente : 300
Période de récupération : 300
- ReplicaLag
-
Étiquettes : DBInstanceIdentifier
Description de l'alarme : Alarme lorsque le délai de réplication dépasse 60 secondes pour une réplique en lecture RDS.
Objectif : détecter les retards de réplication risquant de perdre des données.
Critères ProMQL :
max({__name__="ReplicaLag", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > 60Seuil recommandé : 60 (intégré dans la requête)
Justification du seuil : 60 secondes représentent un décalage significatif pour la plupart des charges de travail.
Intervalle d'évaluation : 60
Période d'attente : 600
Période de récupération : 600
- WriteLatency
-
Étiquettes : DBInstanceIdentifier
Description de l'alarme : Alarme lorsque la latence d'écriture de p90 dépasse le seuil d'une instance RDS.
Objectif : détecter une latence d'écriture élevée indiquant des problèmes de disque.
Critères ProMQL :
histogram_quantile(0.9, {__name__="WriteLatency", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) >THRESHOLDSeuil recommandé :
THRESHOLD(intégré dans la requête)Justification du seuil : défini en fonction de la latence acceptable de l'application.
Intervalle d'évaluation : 60
Période d'attente : 300
Période de récupération : 300
- DBLoad
-
Étiquettes : DBInstanceIdentifier
Description de l'alarme : alarme lorsque la charge moyenne de la base de données dépasse le seuil d'une instance RDS.
Objectif : détecter une charge de base de données élevée qui dégrade les performances.
Critères ProMQL :
avg({__name__="DBLoad", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) >THRESHOLDSeuil recommandé :
THRESHOLD(intégré dans la requête)Justification du seuil : défini sur un multiple du nombre de processeurs virtuels.
Intervalle d'évaluation : 60
Période d'attente : 900
Période de récupération : 900
- AuroraVolumeBytesLeftTotal
-
Étiquettes : DBClusterIdentifier
Description de l'alarme : Alarme lorsque le nombre d'octets de stockage restants dans le cluster Aurora tombe en dessous du seuil.
Objectif : empêcher l'épuisement de l'espace de stockage du cluster Aurora.
Critères ProMQL :
avg({__name__="AuroraVolumeBytesLeftTotal", "@instrumentation.@name"="cloudwatch.aws/rds", DBClusterIdentifier="CLUSTER"}) <THRESHOLDSeuil recommandé :
THRESHOLD(intégré dans la requête)Justification du seuil : défini en fonction du taux de croissance.
Intervalle d'évaluation : 60
Période d'attente : 300
Période de récupération : 300
- AuroraBinlogReplicaLag
-
Étiquettes : DBClusterIdentifier
Description de l'alarme : Alarme lorsque le décalage de la réplication du binlog Aurora indique un état d'erreur.
Objectif : détecter les erreurs de réplication des instances de rédaction.
Critères ProMQL :
avg({__name__="AuroraBinlogReplicaLag", "@instrumentation.@name"="cloudwatch.aws/rds", DBClusterIdentifier="CLUSTER"}) <= -1Seuil recommandé : -1 (intégré dans la requête)
Justification du seuil : -1 indique l'état d'erreur.
Intervalle d'évaluation : 60
Période en attente : 120
Période de récupération : 120
- BlockedTransactions
-
Étiquettes : DBInstanceIdentifier
Description de l'alarme : Alarme lorsque le nombre de transactions bloquées dépasse le seuil d'une instance RDS.
Objectif : détecter le blocage des transactions entraînant une dégradation des performances.
Critères ProMQL :
avg({__name__="BlockedTransactions", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) >THRESHOLDSeuil recommandé :
THRESHOLD(intégré dans la requête)Justification du seuil : défini en fonction du nombre de transactions bloquées acceptable.
Intervalle d'évaluation : 60
Période d'attente : 300
Période de récupération : 300
- BufferCacheHitRatio
-
Étiquettes : DBInstanceIdentifier
Description de l'alarme : Alarme lorsque le taux d'accès au cache de la mémoire tampon tombe en dessous de 80 % pour une instance RDS.
Objectif : détecter une faible efficacité du cache entraînant une baisse des performances.
Critères ProMQL :
avg({__name__="BufferCacheHitRatio", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) < 80Seuil recommandé : 80 (intégré dans la requête)
Justification du seuil : une valeur inférieure à 80 % indique une quantité excessive de disque I/O.
Intervalle d'évaluation : 60
Période d'attente : 600
Période de récupération : 600
- EngineUptime
-
Étiquettes : DBClusterIdentifier
Description de l'alarme : Alarme lorsque le temps de fonctionnement du moteur tombe à zéro, indiquant le redémarrage d'un enregistreur Aurora.
Objectif : détecter les temps d'arrêt ou les pannes de l'instance Aurora Writer.
Critères ProMQL :
avg({__name__="EngineUptime", "@instrumentation.@name"="cloudwatch.aws/rds", DBClusterIdentifier="CLUSTER"}) <= 0Seuil recommandé : 0 (intégré dans la requête)
Justification du seuil : une disponibilité nulle indique un redémarrage de l'instance.
Intervalle d'évaluation : 60
Période en attente : 120
Période de récupération : 120
- RollbackSegmentHistoryListLength
-
Étiquettes : DBInstanceIdentifier
Description de l'alarme : Alarme lorsque la longueur de la liste de l'historique des segments d'annulation dépasse 1 million pour une instance Aurora.
Objectif : détecter un historique de restauration élevé à l'origine de la dégradation du processeur.
Critères ProMQL :
avg({__name__="RollbackSegmentHistoryListLength", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > 1000000Seuil recommandé : 1000000 (intégré dans la requête)
Justification du seuil : un seuil supérieur à 1 million entraîne des problèmes de performances.
Intervalle d'évaluation : 60
Période d'attente : 300
Période de récupération : 300
- StorageNetworkThroughput
-
Étiquettes : DBClusterIdentifier
Description de l'alarme : Alarme lorsque le débit du réseau de stockage dépasse le seuil d'un cluster Aurora.
Objectif : détecter les pertes de paquets réseau présentant un risque de perte de paquets sur le haut débit.
Critères ProMQL :
avg({__name__="StorageNetworkThroughput", "@instrumentation.@name"="cloudwatch.aws/rds", DBClusterIdentifier="CLUSTER"}) >THRESHOLDSeuil recommandé :
THRESHOLD(intégré dans la requête)Justification du seuil : défini en fonction de la capacité du réseau d'instances.
Intervalle d'évaluation : 60
Période d'attente : 300
Période de récupération : 300
Route 53
- HealthCheckStatus
-
Étiquettes : HealthCheckId
Description de l'alarme : Alarme lorsqu'un bilan de santé de la Route 53 signale un terminal défectueux.
Objectif : Détectez les terminaux défectueux à l'aide des vérificateurs de santé Route 53.
Critères ProMQL :
avg({__name__="HealthCheckStatus", "@instrumentation.@name"="cloudwatch.aws/route53", HealthCheckId="HC"}) < 1Seuil recommandé : 1 (intégré dans la requête)
Justification du seuil : un seuil inférieur à 1 indique que le terminal échoue aux tests de santé.
Intervalle d'évaluation : 60
Période en attente : 180
Période de récupération : 180
S3
- 4xxErrors
-
Étiquettes : BucketName, FilterId
Description de l'alarme : Alarme lorsque le taux d'erreur 4xx dépasse 5 % pour un compartiment S3.
Objectif : détecter les taux d'erreur anormaux des clients.
Critères ProMQL :
avg({__name__="4xxErrors", "@instrumentation.@name"="cloudwatch.aws/s3", BucketName="BUCKET",FilterId="FILTER"}) > 0.05Seuil recommandé : 0,05 (intégré dans la requête)
Justification du seuil : un seuil supérieur à 5 % indique des problèmes de configuration ou d'accès.
Intervalle d'évaluation : 60
Période d'attente : 900
Période de récupération : 900
- 5xxErrors
-
Étiquettes : BucketName, FilterId
Description de l'alarme : Alarme lorsque le taux d'erreur 5xx dépasse 5 % pour un compartiment S3.
Objectif : détecter les erreurs côté serveur affectant l'application.
Critères ProMQL :
avg({__name__="5xxErrors", "@instrumentation.@name"="cloudwatch.aws/s3", BucketName="BUCKET",FilterId="FILTER"}) > 0.05Seuil recommandé : 0,05 (intégré dans la requête)
Justification du seuil : une valeur supérieure à 5 % indique des problèmes de service S3.
Intervalle d'évaluation : 60
Période d'attente : 900
Période de récupération : 900
- OperationsFailedReplication
-
Étiquettes : SourceBucket, DestinationBucket, RuleId
Description de l'alarme : Alarme lorsque les opérations de réplication S3 échouent pour un bucket.
Objectif : détecter les échecs de réplication risquant d'entraîner des incohérences dans les données.
Critères ProMQL :
max({__name__="OperationsFailedReplication", "@instrumentation.@name"="cloudwatch.aws/s3", SourceBucket="SRC",DestinationBucket="DST",RuleId="RULE"}) > 0Seuil recommandé : 0 (intégré dans la requête)
Justification du seuil : tout échec de réplication doit faire l'objet d'une enquête.
Intervalle d'évaluation : 60
Période d'attente : 300
Période de récupération : 300
S3 Object Lambda
- 4xxErrors
-
Libellés : AccessPointName, DataSource ARN
Description de l'alarme : Alarme lorsque le taux d'erreur 4xx dépasse 5 % pour un point d'accès S3 Object Lambda.
Objectif : détecter des taux d'erreur client anormaux pour Object Lambda.
Critères ProMQL :
avg({__name__="4xxErrors", "@instrumentation.@name"="cloudwatch.aws/s3objectlambda", AccessPointName="AP",DataSourceARN="ARN"}) > 0.05Seuil recommandé : 0,05 (intégré dans la requête)
Justification du seuil : un seuil supérieur à 5 % indique des problèmes de configuration.
Intervalle d'évaluation : 60
Période d'attente : 900
Période de récupération : 900
- 5xxErrors
-
Libellés : AccessPointName, DataSource ARN
Description de l'alarme : Alarme lorsque le taux d'erreur 5xx dépasse 5 % pour un point d'accès S3 Object Lambda.
Objectif : détecter les erreurs côté serveur dans Object Lambda.
Critères ProMQL :
avg({__name__="5xxErrors", "@instrumentation.@name"="cloudwatch.aws/s3objectlambda", AccessPointName="AP",DataSourceARN="ARN"}) > 0.05Seuil recommandé : 0,05 (intégré dans la requête)
Justification du seuil : un seuil supérieur à 5 % indique des problèmes Lambda ou S3.
Intervalle d'évaluation : 60
Période d'attente : 900
Période de récupération : 900
- LambdaResponse4xx
-
Libellés : AccessPointName, DataSource ARN
Description de l'alarme : Alarme lorsque le taux de réponse de la fonction Lambda 4xx dépasse 5 % pour un point d'accès S3 Object Lambda.
Objectif : détecter les erreurs du client de la fonction Lambda.
Critères ProMQL :
avg({__name__="LambdaResponse4xx", "@instrumentation.@name"="cloudwatch.aws/s3objectlambda", AccessPointName="AP",DataSourceARN="ARN"}) > 0.05Seuil recommandé : 0,05 (intégré dans la requête)
Justification du seuil : un seuil supérieur à 5 % indique des problèmes liés à la fonction Lambda.
Intervalle d'évaluation : 60
Période d'attente : 900
Période de récupération : 900
SNS
- NumberOfMessagesPublished
-
Étiquettes : TopicName
Description de l'alarme : Alarme lorsque le nombre de messages publiés tombe en dessous du seuil d'une rubrique SNS.
Objectif : détecter une baisse significative du volume de publication.
Critères ProMQL :
sum({__name__="NumberOfMessagesPublished", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) <THRESHOLDSeuil recommandé :
THRESHOLD(intégré dans la requête)Justification du seuil : défini en fonction du trafic minimum attendu.
Intervalle d'évaluation : 60
Période d'attente : 300
Période de récupération : 300
- NumberOfNotificationsDelivered
-
Étiquettes : TopicName
Description de l'alarme : Alarme lorsque le nombre de notifications envoyées tombe en dessous du seuil d'une rubrique SNS.
Objectif : détecter la baisse du volume de notifications envoyées.
Critères ProMQL :
sum({__name__="NumberOfNotificationsDelivered", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) <THRESHOLDSeuil recommandé :
THRESHOLD(intégré dans la requête)Justification du seuil : défini en fonction du nombre minimum de livraisons attendues.
Intervalle d'évaluation : 60
Période d'attente : 300
Période de récupération : 300
- NumberOfNotificationsFailed
-
Étiquettes : TopicName
Description de l'alarme : Alarme lorsque le nombre d'échecs de transmission de notifications dépasse le seuil d'une rubrique SNS.
Objectif : détecter les échecs de livraison.
Critères ProMQL :
sum({__name__="NumberOfNotificationsFailed", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) >THRESHOLDSeuil recommandé :
THRESHOLD(intégré dans la requête)Justification du seuil : défini en fonction d'un taux d'échec acceptable.
Intervalle d'évaluation : 60
Période d'attente : 300
Période de récupération : 300
- NumberOfNotificationsFilteredOut-InvalidAttributes
-
Étiquettes : TopicName
Description de l'alarme : Alarme lorsque les notifications sont filtrées en raison d'attributs de message non valides.
Objectif : détecter les attributs de message non valides.
Critères ProMQL :
sum({__name__="NumberOfNotificationsFilteredOut-InvalidAttributes", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) > 0Seuil recommandé : 0 (intégré dans la requête)
Justification du seuil : tout filtre non valide indique une mauvaise configuration.
Intervalle d'évaluation : 60
Période d'attente : 300
Période de récupération : 300
- NumberOfNotificationsFilteredOut-InvalidMessageBody
-
Étiquettes : TopicName
Description de l'alarme : Alarme lorsque les notifications sont filtrées en raison de corps de message non valides.
Objectif : détecter les corps de message non valides.
Critères ProMQL :
sum({__name__="NumberOfNotificationsFilteredOut-InvalidMessageBody", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) > 0Seuil recommandé : 0 (intégré dans la requête)
Justification du seuil : tout filtre non valide indique une mauvaise configuration.
Intervalle d'évaluation : 60
Période d'attente : 300
Période de récupération : 300
- NumberOfNotificationsRedrivenToDlq
-
Étiquettes : TopicName
Description de l'alarme : Alarme lorsque des notifications sont envoyées à la file d'attente des lettres mortes pour une rubrique SNS.
Objectif : détecter les messages envoyés à la file d'attente des lettres mortes.
Critères ProMQL :
sum({__name__="NumberOfNotificationsRedrivenToDlq", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) > 0Seuil recommandé : 0 (intégré dans la requête)
Justification du seuil : tout message DLQ indique des problèmes de livraison.
Intervalle d'évaluation : 60
Période d'attente : 300
Période de récupération : 300
- NumberOfNotificationsFailedToRedriveToDlq
-
Étiquettes : TopicName
Description de l'alarme : Alarme lorsque les notifications ne sont pas envoyées à la file d'attente des lettres mortes pour une rubrique SNS.
Objectif : détecter les échecs de distribution du DLQ.
Critères ProMQL :
sum({__name__="NumberOfNotificationsFailedToRedriveToDlq", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) > 0Seuil recommandé : 0 (intégré dans la requête)
Justification du seuil : l'échec du DLQ signifie la perte du suivi des erreurs.
Intervalle d'évaluation : 60
Période d'attente : 300
Période de récupération : 300
- SMSMonthToDateSpentUSD
-
Étiquettes : TopicName
Description de l'alarme : Alarme lorsque les dépenses en SMS approchent le quota du compte pour une rubrique SNS.
Objectif : détecter les dépenses liées aux SMS qui approchent du quota.
Critères ProMQL :
max({__name__="SMSMonthToDateSpentUSD", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) >THRESHOLDSeuil recommandé :
THRESHOLD(intégré dans la requête)Justification du seuil : défini en fonction du quota de SMS du compte.
Intervalle d'évaluation : 60
Période d'attente : 300
Période de récupération : 300
- SMSSuccessRate
-
Étiquettes : TopicName
Description de l'alarme : alarme lorsque le taux de réussite de l'envoi de SMS tombe en dessous du seuil d'une rubrique SNS.
Objectif : détecter les échecs d'envoi de SMS.
Critères ProMQL :
avg({__name__="SMSSuccessRate", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) <THRESHOLDSeuil recommandé :
THRESHOLD(intégré dans la requête)Justification du seuil : défini en fonction d'un taux de livraison acceptable.
Intervalle d'évaluation : 60
Période d'attente : 300
Période de récupération : 300
SQS
- ApproximateAgeOfOldestMessage
-
Étiquettes : QueueName
Description de l'alarme : alarme lorsque l'âge du message le plus ancien dépasse le seuil d'une file d'attente SQS.
Objectif : détecter les messages qui ne sont pas traités assez rapidement.
Critères ProMQL :
max({__name__="ApproximateAgeOfOldestMessage", "@instrumentation.@name"="cloudwatch.aws/sqs", QueueName="QUEUE"}) >THRESHOLDSeuil recommandé :
THRESHOLD(intégré dans la requête)Justification du seuil : défini en fonction du temps de traitement des messages acceptable.
Intervalle d'évaluation : 60
Période d'attente : 900
Période de récupération : 900
- ApproximateNumberOfMessagesNotVisible
-
Étiquettes : QueueName
Description de l'alarme : Alarme lorsque le nombre de messages en vol dépasse le seuil d'une file d'attente SQS.
Objectif : détecter les nombreux messages en vol indiquant des problèmes rencontrés par les consommateurs.
Critères ProMQL :
avg({__name__="ApproximateNumberOfMessagesNotVisible", "@instrumentation.@name"="cloudwatch.aws/sqs", QueueName="QUEUE"}) >THRESHOLDSeuil recommandé :
THRESHOLD(intégré dans la requête)Justification du seuil : défini en fonction du volume de traitement attendu.
Intervalle d'évaluation : 60
Période d'attente : 900
Période de récupération : 900
- ApproximateNumberOfMessagesVisible
-
Étiquettes : QueueName
Description de l'alarme : Alarme lorsque le nombre de messages visibles dépasse le seuil d'une file SQS.
Objectif : détecter l'arriéré de messages indiquant la lenteur des consommateurs.
Critères ProMQL :
avg({__name__="ApproximateNumberOfMessagesVisible", "@instrumentation.@name"="cloudwatch.aws/sqs", QueueName="QUEUE"}) >THRESHOLDSeuil recommandé :
THRESHOLD(intégré dans la requête)Justification du seuil : défini en fonction de la profondeur de file d'attente attendue.
Intervalle d'évaluation : 60
Période d'attente : 900
Période de récupération : 900
- NumberOfMessagesSent
-
Étiquettes : QueueName
Description de l'alarme : Alarme lorsqu'aucun message n'est envoyé à une file d'attente SQS.
Objectif : détecter que les producteurs ont cessé d'envoyer des messages.
Critères ProMQL :
sum({__name__="NumberOfMessagesSent", "@instrumentation.@name"="cloudwatch.aws/sqs", QueueName="QUEUE"}) <= 0Seuil recommandé : 0 (intégré dans la requête)
Justification du seuil : aucun message n'indique une défaillance du producteur.
Intervalle d'évaluation : 60
Période d'attente : 900
Période de récupération : 900
VPN
- TunnelState (niveau VPN)
-
Étiquettes : VpnId
Description de l'alarme : Alarme lorsqu'au moins un tunnel VPN est en état d'arrêt.
Objectif : détecter au moins un tunnel en état DOWN.
Critères ProMQL :
min({__name__="TunnelState", "@instrumentation.@name"="cloudwatch.aws/vpn", VpnId="VPN"}) < 1Seuil recommandé : 1 (intégré dans la requête)
Justification du seuil : un seuil inférieur à 1 signifie que le tunnel est en panne.
Intervalle d'évaluation : 300
Période d'attente : 900
Période de récupération : 900
- TunnelState (niveau du tunnel)
-
Étiquettes : TunnelIpAddress
Description de l'alarme : Alarme lorsqu'un tunnel VPN spécifique est en état d'arrêt.
Objectif : détecter un tunnel spécifique en état DOWN.
Critères ProMQL :
min({__name__="TunnelState", "@instrumentation.@name"="cloudwatch.aws/vpn", TunnelIpAddress="IP"}) < 1Seuil recommandé : 1 (intégré dans la requête)
Justification du seuil : un seuil inférieur à 1 signifie que le tunnel est en panne.
Intervalle d'évaluation : 300
Période d'attente : 900
Période de récupération : 900