

Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.

# Alarmes ProMQL recommandées
<a name="Recommended_PromQL_Alarms"></a>

Utilisez ces alarmes ProMQL comme équivalentes aux alarmes classiques recommandées. Ils surveillent les mêmes métriques à l'aide de requêtes instantanées ProMQL qui sont évaluées par rapport aux métriques ingérées via le CloudWatch point de terminaison OTLP.

Les alarmes ProMQL sont utilisées `EvaluationCriteria` avec. `PromQLCriteria` Contrairement aux alarmes métriques classiques, le seuil est intégré directement dans l'expression de requête ProMQL.
+ **Période d'attente ** : durée en secondes pendant laquelle une série chronologique doit continuellement dépasser avant que l'alarme ne passe à l'état ALARME.
+ **Période de restauration ** : durée en secondes pendant laquelle toutes les séries chronologiques doivent cesser d'être piratées avant que l'alarme ne revienne à l'état OK.
+ **Intervalle d'évaluation ** : fréquence, en secondes, d' CloudWatch exécution de la requête ProMQL.

**Note**  
Ces alarmes nécessitent la publication de mesures via le point de terminaison CloudWatch OTLP. Pour de plus amples informations, veuillez consulter [Alarmes ProMQL](alarm-promql.md).

Vous pouvez déployer ces alarmes à l'aide de AWS CloudFormation. Utilisez les `PromQLCriteria` propriétés `EvaluationCriteria` et de la `AWS::CloudWatch::Alarm` ressource.

**Topics**
+ [API Gateway](#Recommended_PromQL_ApiGateway)
+ [Auto Scaling](#Recommended_PromQL_AutoScaling)
+ [Gestionnaire de certificats](#Recommended_PromQL_CertificateManager)
+ [CloudFront](#Recommended_PromQL_CloudFront)
+ [Cognito](#Recommended_PromQL_Cognito)
+ [DynamoDB](#Recommended_PromQL_DynamoDB)
+ [EBS](#Recommended_PromQL_EBS)
+ [Amazon Elastic Compute Cloud](#Recommended_PromQL_EC2)
+ [Amazon ECS](#Recommended_PromQL_ECS)
+ [Informations sur les conteneurs Amazon ECS](#Recommended_PromQL_ECS_ContainerInsights)
+ [Observabilité améliorée d'Amazon ECS Container Insights](#Recommended_PromQL_ECS_ContainerInsights_Enhanced)
+ [Amazon EFS](#Recommended_PromQL_EFS)
+ [Informations sur les conteneurs Amazon EKS](#Recommended_PromQL_EKS)
+ [Amazon ElastiCache](#Recommended_PromQL_ElastiCache)
+ [GPU Elastic](#Recommended_PromQL_ElasticGPUs)
+ [EventBridge Planificateur Amazon](#Recommended_PromQL_Scheduler)
+ [Amazon Kinesis Data Streams](#Recommended_PromQL_Kinesis)
+ [AWS Lambda](#Recommended_PromQL_Lambda)
+ [AWS Lambda Informations](#Recommended_PromQL_LambdaInsights)
+ [Passerelle NAT](#Recommended_PromQL_NATGateway)
+ [AWS PrivateLink points de terminaison](#Recommended_PromQL_PrivateLinkEndpoints)
+ [AWS PrivateLink services](#Recommended_PromQL_PrivateLinkServices)
+ [RDS](#Recommended_PromQL_RDS)
+ [Route 53](#Recommended_PromQL_Route53)
+ [S3](#Recommended_PromQL_S3)
+ [S3 Object Lambda](#Recommended_PromQL_S3ObjectLambda)
+ [SNS](#Recommended_PromQL_SNS)
+ [SQS](#Recommended_PromQL_SQS)
+ [VPN](#Recommended_PromQL_VPN)

## API Gateway
<a name="Recommended_PromQL_ApiGateway"></a>

**API REST **

**4XXError**  
**Étiquettes : **ApiName, Stage  
**Description de l'**alarme : Alarme lorsque le taux d'erreur 4XX moyen dépasse 5 % pour une étape de l'API REST.  
**Objectif : ** détecter un taux d'erreur client élevé indiquant des problèmes de demande.  
**Critères ProMQL : ** `avg({__name__="4XXError", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiName="{{your-api-name}}",Stage="{{your-stage}}"}) > 0.05`  
**Seuil recommandé : ** 0,05 (intégré dans la requête)  
**Justification du seuil : ** détecte un taux d'erreur client supérieur à 5 %, ce qui indique des échecs de demande importants.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 300  
**Période de récupération : ** 300

**5XXError**  
**Libellés : **ApiName, Stage  
**Description de l'**alarme : Alarme lorsque le taux d'erreur 5XX moyen dépasse 5 % pour une étape de l'API REST.  
**Objectif : ** détecter un taux d'erreur de serveur élevé indiquant des défaillances du backend.  
**Critères ProMQL : ** `avg({__name__="5XXError", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiName="{{your-api-name}}",Stage="{{your-stage}}"}) > 0.05`  
**Seuil recommandé : ** 0,05 (intégré dans la requête)  
**Justification du seuil : ** détecte un taux d'erreur du serveur supérieur à 5 %, ce qui nécessite une enquête immédiate.  
**Intervalle d'évaluation : ** 60  
**Période en attente : ** 180  
**Période de récupération : ** 300

**Latence**  
**Libellés : **ApiName, Stage  
**Description de l'**alarme : Alarme lorsque la latence p90 dépasse 2 500 ms pour une étape de l'API REST.  
**Objectif : ** détecter une latence p90 élevée affectant l'expérience utilisateur.  
**Critères ProMQL : ** `histogram_quantile(0.9, {__name__="Latency", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiName="{{your-api-name}}",Stage="{{your-stage}}"}) > 2500`  
**Seuil recommandé : ** 2500 (intégré dans la requête)  
**Justification du seuil : ** une latence p90 supérieure à 2 500 ms indique des temps de réponse dégradés pour la plupart des requêtes.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 300  
**Période de récupération : ** 300

**Count**  
**Libellés : **ApiName, Stage  
**Description de l'**alarme : alarme lorsque le nombre total de demandes tombe en dessous de la valeur de référence attendue pour une étape de l'API REST.  
**Objectif : ** détecter un faible volume de trafic susceptible d'indiquer des problèmes de routage ou de disponibilité.  
**Critères ProMQL : ** `sum({__name__="Count", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiName="{{your-api-name}}",Stage="{{your-stage}}"}) < {{THRESHOLD}}`  
**Seuil recommandé : ** {{THRESHOLD}} (intégré dans la requête)  
**Justification du seuil : ** définissez-le en fonction de votre niveau de référence de trafic attendu pour détecter les baisses inattendues.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 600  
**Période de récupération : ** 300

**API HTTP **

**4xx**  
**Étiquettes : **ApiId, Stage  
**Description de l'**alarme : Alarme lorsque le taux d'erreur 4xx moyen dépasse 5 % pour une étape d'API HTTP.  
**Objectif : ** détecter un taux d'erreur client élevé sur les points de terminaison de l'API HTTP.  
**Critères ProMQL : ** `avg({__name__="4xx", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="{{your-api-id}}",Stage="{{your-stage}}"}) > 0.05`  
**Seuil recommandé : ** 0,05 (intégré dans la requête)  
**Justification du seuil : ** détecte un taux d'erreur client supérieur à 5 %.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 300  
**Période de récupération : ** 300

**5xx**  
**Libellés : **ApiId, Stage  
**Description de l'**alarme : Alarme lorsque le taux d'erreur 5xx moyen dépasse 5 % pour une étape d'API HTTP.  
**Objectif : ** détecter un taux d'erreur de serveur élevé sur les points de terminaison de l'API HTTP.  
**Critères ProMQL : ** `avg({__name__="5xx", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="{{your-api-id}}",Stage="{{your-stage}}"}) > 0.05`  
**Seuil recommandé : ** 0,05 (intégré dans la requête)  
**Justification du seuil : ** détecte un taux d'erreur de serveur supérieur à 5 % nécessitant une enquête.  
**Intervalle d'évaluation : ** 60  
**Période en attente : ** 180  
**Période de récupération : ** 300

**Latence**  
**Libellés : **ApiId, Stage  
**Description de l'**alarme : Alarme lorsque la latence du p90 dépasse 2 500 ms pour une étape d'API HTTP.  
**Objectif : ** détecter une latence p90 élevée sur les points de terminaison de l'API HTTP.  
**Critères ProMQL : ** `histogram_quantile(0.9, {__name__="Latency", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="{{your-api-id}}",Stage="{{your-stage}}"}) > 2500`  
**Seuil recommandé : ** 2500 (intégré dans la requête)  
**Justification du seuil : ** une latence p90 supérieure à 2 500 ms indique des temps de réponse dégradés.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 300  
**Période de récupération : ** 300

**IntegrationLatency**  
**Libellés : **ApiId, Stage  
**Description de l'**alarme : Alarme lorsque la latence d'intégration du p90 dépasse 2 000 ms pour une étape d'API HTTP.  
**Objectif : ** détecter les temps de latence élevés liés à l'intégration du backend qui ont une incidence sur les temps de réponse.  
**Critères ProMQL : ** `histogram_quantile(0.9, {__name__="IntegrationLatency", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="{{your-api-id}}",Stage="{{your-stage}}"}) > 2000`  
**Seuil recommandé : ** 2000 (intégré dans la requête)  
**Justification du seuil : ** une latence d'intégration p90 supérieure à 2 000 ms indique une lenteur du backend.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 300  
**Période de récupération : ** 300

**Count**  
**Libellés : **ApiId, Stage  
**Description de l'**alarme : alarme lorsque le nombre total de demandes tombe en dessous de la valeur de référence attendue pour une étape d'API HTTP.  
**Objectif : ** détecter un faible volume de trafic susceptible d'indiquer des problèmes de routage ou de disponibilité.  
**Critères ProMQL : ** `sum({__name__="Count", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="{{your-api-id}}",Stage="{{your-stage}}"}) < {{THRESHOLD}}`  
**Seuil recommandé : ** {{THRESHOLD}} (intégré dans la requête)  
**Justification du seuil : ** définissez-le en fonction de votre niveau de référence de trafic attendu pour détecter les baisses inattendues.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 600  
**Période de récupération : ** 300

**WebSocket API**

**ClientError**  
**Libellés : **ApiId, Stage  
**Description de l'**alarme : Alarme lorsque le taux d'erreur moyen du client dépasse 5 % pour une étape de WebSocket l'API.  
**Objectif : ** détecter un taux d'erreur client élevé sur les connexions WebSocket API.  
**Critères ProMQL : ** `avg({__name__="ClientError", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="{{your-api-id}}",Stage="{{your-stage}}"}) > 0.05`  
**Seuil recommandé : ** 0,05 (intégré dans la requête)  
**Justification du seuil : ** détecte un taux d'erreur client supérieur à 5 % sur WebSocket les connexions.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 300  
**Période de récupération : ** 300

**ExecutionError**  
**Libellés : **ApiId, Stage  
**Description de l'**alarme : Alarme lorsque le taux d'erreur d'exécution moyen dépasse 5 % pour une étape d' WebSocket API.  
**Objectif : ** détecter un taux élevé d'erreurs d'exécution côté serveur sur les WebSocket API.  
**Critères ProMQL : ** `avg({__name__="ExecutionError", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="{{your-api-id}}",Stage="{{your-stage}}"}) > 0.05`  
**Seuil recommandé : ** 0,05 (intégré dans la requête)  
**Justification du seuil : ** détecte un taux d'erreur d'exécution supérieur à 5 % nécessitant une investigation.  
**Intervalle d'évaluation : ** 60  
**Période en attente : ** 180  
**Période de récupération : ** 300

**IntegrationLatency**  
**Libellés : **ApiId, Stage  
**Description de l'**alarme : Alarme lorsque la latence d'intégration du p90 dépasse 2 000 ms pour une étape d' WebSocket API.  
**Objectif : ** détecter une latence d'intégration élevée du backend sur les routes WebSocket d'API.  
**Critères ProMQL : ** `histogram_quantile(0.9, {__name__="IntegrationLatency", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="{{your-api-id}}",Stage="{{your-stage}}"}) > 2000`  
**Seuil recommandé : ** 2000 (intégré dans la requête)  
**Justification du seuil : ** une latence d'intégration p90 supérieure à 2 000 ms indique une lenteur du backend.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 300  
**Période de récupération : ** 300

**MessageCount**  
**Libellés : **ApiId, Stage  
**Description de l'**alarme : alarme lorsque le nombre total de messages tombe en dessous de la valeur de référence attendue pour une étape de WebSocket l'API.  
**Objectif : ** détecter un faible volume de messages susceptible d'indiquer des problèmes de connexion ou de routage.  
**Critères ProMQL : ** `sum({__name__="MessageCount", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="{{your-api-id}}",Stage="{{your-stage}}"}) < {{THRESHOLD}}`  
**Seuil recommandé : ** {{THRESHOLD}} (intégré dans la requête)  
**Justification du seuil : ** définissez-le en fonction du volume de messages attendu pour détecter les baisses inattendues.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 600  
**Période de récupération : ** 300

## Auto Scaling
<a name="Recommended_PromQL_AutoScaling"></a>

**GroupInServiceCapacity**  
**Étiquettes : ** AutoScalingGroupName  
**Description de l'**alarme : Alarme lorsque la capacité moyenne en service tombe en dessous du minimum attendu pour un groupe Auto Scaling.  
**Objectif : ** détecter la faible disponibilité due à des échecs de lancement ou à la fermeture d'instances.  
**Critères ProMQL : ** `avg({__name__="GroupInServiceCapacity", "@instrumentation.@name"="cloudwatch.aws/autoscaling", AutoScalingGroupName="{{your-auto-scaling-group-name}}"}) < {{THRESHOLD}}`  
**Seuil recommandé : ** {{THRESHOLD}} (intégré dans la requête)  
**Justification du seuil : ** défini en fonction de la capacité minimale souhaitée pour détecter les échecs de lancement ou le nombre d'instances insuffisantes.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 600  
**Période de récupération : ** 600

## Gestionnaire de certificats
<a name="Recommended_PromQL_CertificateManager"></a>

**DaysToExpiry**  
**Étiquettes : ** CertificateArn  
**Description de l'**alarme : Alarme lorsque le délai minimum avant l'expiration du certificat tombe à 44 jours ou moins.  
**Objectif : alerte ** proactive d'expiration du certificat pour laisser le temps de le renouveler.  
**Critères ProMQL : ** `min({__name__="DaysToExpiry", "@instrumentation.@name"="cloudwatch.aws/certificatemanager", CertificateArn="{{your-certificate-arn}}"}) <= 44`  
**Seuil recommandé : ** 44 (intégré dans la requête)  
**Justification du seuil : ** fournit un délai suffisant avant l'expiration du certificat pour terminer le processus de renouvellement.  
**Intervalle d'évaluation : ** 86400  
**Période en attente : ** 86400  
**Période de récupération : ** 86400

## CloudFront
<a name="Recommended_PromQL_CloudFront"></a>

**5xxErrorRate**  
**Étiquettes : ** DistributionId  
**Description de l'**alarme : Alarme lorsque le taux d'erreur moyen de 5xx dépasse le seuil d'une CloudFront distribution.  
**Objectif : ** détecter une origine ou un taux CloudFront d'erreur élevé affectant la diffusion du contenu.  
**Critères ProMQL : ** `avg({__name__="5xxErrorRate", "@instrumentation.@name"="cloudwatch.aws/cloudfront", DistributionId="{{your-distribution-id}}"}) > {{THRESHOLD}}`  
**Seuil recommandé : ** {{THRESHOLD}} (intégré dans la requête)  
**Justification du seuil : ** défini en fonction de votre taux d'erreur acceptable pour la diffusion de contenu.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 300  
**Période de récupération : ** 300

**OriginLatency**  
**Étiquettes : ** DistributionId  
**Description de l'**alarme : Alarme lorsque la latence d'origine de p90 dépasse le seuil d'une CloudFront distribution.  
**Objectif : ** détecter une latence de réponse d'origine élevée qui affecte les performances de diffusion du contenu.  
**Critères ProMQL : ** `histogram_quantile(0.9, {__name__="OriginLatency", "@instrumentation.@name"="cloudwatch.aws/cloudfront", DistributionId="{{your-distribution-id}}"}) > {{THRESHOLD}}`  
**Seuil recommandé : ** {{THRESHOLD}} (intégré dans la requête)  
**Justification du seuil : ** défini en fonction du temps de réponse attendu à l'origine et de la stratégie de mise en cache.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 300  
**Période de récupération : ** 300

**FunctionValidationErrors**  
**Étiquettes : **DistributionId, FunctionName  
**Description de l'**alarme : Alarme en cas d'erreur de validation de CloudFront fonction.  
**Objectif : ** détecter les CloudFront échecs de validation des fonctions qui empêchent leur exécution.  
**Critères ProMQL : ** `sum({__name__="FunctionValidationErrors", "@instrumentation.@name"="cloudwatch.aws/cloudfront", DistributionId="{{your-distribution-id}}",FunctionName="{{your-function-name}}"}) > 0`  
**Seuil recommandé : ** 0 (intégré dans la requête)  
**Justification du seuil : ** toute erreur de validation indique un problème de configuration des fonctions qui nécessite une attention particulière.  
**Intervalle d'évaluation : ** 60  
**Période en attente : ** 120  
**Période de récupération : ** 120

**FunctionExecutionErrors**  
**Étiquettes : **DistributionId, FunctionName  
**Description de l'**alarme : Alarme en cas d'erreur d'exécution d'une CloudFront fonction.  
**Objectif : ** détecter les défaillances d'exécution dans CloudFront les fonctions qui affectent le traitement des demandes.  
**Critères ProMQL : ** `sum({__name__="FunctionExecutionErrors", "@instrumentation.@name"="cloudwatch.aws/cloudfront", DistributionId="{{your-distribution-id}}",FunctionName="{{your-function-name}}"}) > 0`  
**Seuil recommandé : ** 0 (intégré dans la requête)  
**Justification du seuil : ** toute erreur d'exécution indique un problème d'exécution dans le code de la fonction.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 300  
**Période de récupération : ** 300

**FunctionThrottles**  
**Étiquettes : **DistributionId, FunctionName  
**Description de l'**alarme : Alarme lorsqu' CloudFront une fonction est bloquée.  
**Objectif : ** détecter CloudFront la limitation des fonctions susceptible de dégrader le traitement des requêtes.  
**Critères ProMQL : ** `sum({__name__="FunctionThrottles", "@instrumentation.@name"="cloudwatch.aws/cloudfront", DistributionId="{{your-distribution-id}}",FunctionName="{{your-function-name}}"}) > 0`  
**Seuil recommandé : ** 0 (intégré dans la requête)  
**Justification du seuil : ** tout étranglement indique que la fonction atteint les limites de calcul.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 300  
**Période de récupération : ** 300

## Cognito
<a name="Recommended_PromQL_Cognito"></a>

**SignUpThrottles**  
**Étiquettes : **UserPool, UserPoolClient  
**Description de l'**alarme : Alarme lorsque les événements d'accélération de l'inscription dépassent le seuil d'un groupe d'utilisateurs.  
**Objectif : ** détecter la limitation des inscriptions qui empêche l'inscription de nouveaux utilisateurs.  
**Critères ProMQL : ** `sum({__name__="SignUpThrottles", "@instrumentation.@name"="cloudwatch.aws/cognito", UserPool="{{your-user-pool}}",UserPoolClient="{{your-user-pool-client}}"}) > {{THRESHOLD}}`  
**Seuil recommandé : ** {{THRESHOLD}} (intégré dans la requête)  
**Justification du seuil : ** défini en fonction de votre taux d'accélération acceptable pour les opérations d'inscription.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 300  
**Période de récupération : ** 300

**SignInThrottles**  
**Étiquettes : **UserPool, UserPoolClient  
**Description de l'**alarme : Alarme lorsque les événements d'accélération de la connexion dépassent le seuil d'un groupe d'utilisateurs.  
**Objectif : ** détecter les restrictions de connexion qui empêchent l'authentification des utilisateurs.  
**Critères ProMQL : ** `sum({__name__="SignInThrottles", "@instrumentation.@name"="cloudwatch.aws/cognito", UserPool="{{your-user-pool}}",UserPoolClient="{{your-user-pool-client}}"}) > {{THRESHOLD}}`  
**Seuil recommandé : ** {{THRESHOLD}} (intégré dans la requête)  
**Justification du seuil : ** défini en fonction de votre taux d'accélération acceptable pour les opérations de connexion.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 300  
**Période de récupération : ** 300

**TokenRefreshThrottles**  
**Étiquettes : **UserPool, UserPoolClient  
**Description de l'**alarme : Alarme lorsque les événements d'accélération de l'actualisation des jetons dépassent le seuil d'un groupe d'utilisateurs.  
**Objectif : ** détecter la limitation de l'actualisation des jetons susceptible d'entraîner des interruptions de session.  
**Critères ProMQL : ** `sum({__name__="TokenRefreshThrottles", "@instrumentation.@name"="cloudwatch.aws/cognito", UserPool="{{your-user-pool}}",UserPoolClient="{{your-user-pool-client}}"}) > {{THRESHOLD}}`  
**Seuil recommandé : ** {{THRESHOLD}} (intégré dans la requête)  
**Justification du seuil : ** défini en fonction de votre taux d'accélération acceptable pour les opérations d'actualisation des jetons.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 300  
**Période de récupération : ** 300

**FederationThrottles**  
**Étiquettes : **UserPool, UserPoolClient, IdentityProvider  
**Description de l'**alarme : Alarme lorsque les événements d'accélération de la fédération dépassent le seuil pour le fournisseur d'identité d'un pool d'utilisateurs.  
**Objectif : ** détecter les restrictions de fédération susceptibles d'empêcher la connexion fédérée.  
**Critères ProMQL : ** `sum({__name__="FederationThrottles", "@instrumentation.@name"="cloudwatch.aws/cognito", UserPool="{{your-user-pool}}",UserPoolClient="{{your-user-pool-client}}",IdentityProvider="{{your-identity-provider}}"}) > {{THRESHOLD}}`  
**Seuil recommandé : ** {{THRESHOLD}} (intégré dans la requête)  
**Justification du seuil : ** défini en fonction de votre taux d'accélération acceptable pour les opérations de fédération.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 300  
**Période de récupération : ** 300

## DynamoDB
<a name="Recommended_PromQL_DynamoDB"></a>

**AccountProvisionedReadCapacityUtilization**  
**Étiquettes : ** Aucune  
**Description de l'alarme : ** alarme lorsque l'utilisation de la capacité de lecture provisionnée au niveau du compte dépasse 80 %.  
**Objectif : ** détecter quand la capacité de lecture provisionnée approche les limites du compte.  
**Critères ProMQL : ** `max({__name__="AccountProvisionedReadCapacityUtilization", "@instrumentation.@name"="cloudwatch.aws/dynamodb"}) > 80`  
**Seuil recommandé : ** 80 (intégré dans la requête)  
**Justification du seuil : ** à 80 % d'utilisation, vous disposez d'une marge de manœuvre limitée avant d'atteindre les limites de votre compte.  
**Intervalle d'évaluation : ** 300  
**Période d'attente : ** 600  
**Période de récupération : ** 600

**AccountProvisionedWriteCapacityUtilization**  
**Étiquettes : ** Aucune  
**Description de l'alarme : ** alarme lorsque l'utilisation de la capacité d'écriture provisionnée au niveau du compte dépasse 80 %.  
**Objectif : ** détecter quand la capacité d'écriture provisionnée approche les limites du compte.  
**Critères ProMQL : ** `max({__name__="AccountProvisionedWriteCapacityUtilization", "@instrumentation.@name"="cloudwatch.aws/dynamodb"}) > 80`  
**Seuil recommandé : ** 80 (intégré dans la requête)  
**Justification du seuil : ** à 80 % d'utilisation, vous disposez d'une marge de manœuvre limitée avant d'atteindre les limites de votre compte.  
**Intervalle d'évaluation : ** 300  
**Période d'attente : ** 600  
**Période de récupération : ** 600

**AgeOfOldestUnreplicatedRecord**  
**Étiquettes : **TableName, DelegatedOperation  
**Description de l'**alarme : Alarme lorsque l'âge du plus ancien enregistrement non répliqué dépasse le seuil.  
**Objectif : ** détecter les retards de réplication susceptibles d'entraîner des données obsolètes dans les tables globales.  
**Critères ProMQL : ** `max({__name__="AgeOfOldestUnreplicatedRecord", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="{{your-table-name}}",DelegatedOperation="{{your-operation}}"}) > {{THRESHOLD}}`  
**Seuil recommandé : ** {{THRESHOLD}} (intégré dans la requête)  
**Justification du seuil : ** défini en fonction de vos exigences en matière de fraîcheur de la réplication.  
**Intervalle d'évaluation : ** 300  
**Période d'attente : ** 900  
**Période de récupération : ** 900

**FailedToReplicateRecordCount**  
**Étiquettes : **TableName, DelegatedOperation  
**Description de l'**alarme : alarme lorsqu'un enregistrement ne parvient pas à se répliquer dans une table globale.  
**Objectif : ** détecter les échecs de réplication qui entraînent une incohérence des données entre les régions.  
**Critères ProMQL : ** `sum({__name__="FailedToReplicateRecordCount", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="{{your-table-name}}",DelegatedOperation="{{your-operation}}"}) > 0`  
**Seuil recommandé : ** 0 (intégré dans la requête)  
**Justification du seuil : ** tout échec de réplication indique des problèmes de cohérence des données nécessitant une attention immédiate.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 60  
**Période de récupération : ** 60

**ReadThrottleEvents**  
**Étiquettes : ** TableName  
**Description de l'**alarme : Alarme lorsque les événements de lecture de l'accélérateur dépassent le seuil d'un tableau.  
**Objectif : ** détecter la limitation de la lecture qui indique une capacité provisionnée insuffisante.  
**Critères ProMQL : ** `sum({__name__="ReadThrottleEvents", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="{{your-table-name}}"}) > {{THRESHOLD}}`  
**Seuil recommandé : ** {{THRESHOLD}} (intégré dans la requête)  
**Justification du seuil : ** défini en fonction du nombre d'accélérateurs que vous pouvez accepter pour les opérations de lecture.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 300  
**Période de récupération : ** 300

**ReadThrottleEvents (GSI) **  
**Étiquettes : **TableName, GlobalSecondaryIndexName  
**Description de l'**alarme : Alarme lorsque les événements d'accélération de lecture dépassent le seuil d'un indice secondaire global.  
**Objectif : ** détecter la limitation de la lecture sur un GSI qui indique une capacité d'index insuffisante.  
**Critères ProMQL : ** `sum({__name__="ReadThrottleEvents", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="{{your-table-name}}",GlobalSecondaryIndexName="{{your-index-name}}"}) > {{THRESHOLD}}`  
**Seuil recommandé : ** {{THRESHOLD}} (intégré dans la requête)  
**Justification du seuil : ** défini en fonction de votre nombre d'accélérateurs acceptable pour les opérations de lecture GSI.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 300  
**Période de récupération : ** 300

**ReplicationLatency**  
**Étiquettes : **TableName, ReceivingRegion  
**Description de l'**alarme : Alarme lorsque la latence moyenne de réplication dépasse le seuil d'une table globale.  
**Objectif : ** détecter une latence de réplication élevée susceptible de provoquer des lectures obsolètes dans les régions de réplication.  
**Critères ProMQL : ** `avg({__name__="ReplicationLatency", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="{{your-table-name}}",ReceivingRegion="{{your-receiving-region}}"}) > {{THRESHOLD}}`  
**Seuil recommandé : ** {{THRESHOLD}} (intégré dans la requête)  
**Justification du seuil : ** défini en fonction de vos exigences en matière d'actualisation des données pour les régions de répliques.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 900  
**Période de récupération : ** 900

**SuccessfulRequestLatency**  
**Libellés : **TableName, Opération  
**Description de l'**alarme : Alarme lorsque la latence moyenne des demandes réussies dépasse le seuil d'une opération de table.  
**Objectif : ** détecter une latence élevée sur les opérations DynamoDB qui ont une incidence sur les performances de l'application.  
**Critères ProMQL : ** `avg({__name__="SuccessfulRequestLatency", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="{{your-table-name}}",Operation="{{your-operation}}"}) > {{THRESHOLD}}`  
**Seuil recommandé : ** {{THRESHOLD}} (intégré dans la requête)  
**Justification du seuil : ** défini en fonction de votre SLA de latence pour l'opération DynamoDB spécifique.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 600  
**Période de récupération : ** 600

**SystemErrors**  
**Étiquettes : ** TableName  
**Description de l'**alarme : Alarme lorsque les erreurs du système dépassent le seuil d'une table.  
**Objectif : ** détecter les erreurs côté service DynamoDB qui affectent la disponibilité des tables.  
**Critères ProMQL : ** `sum({__name__="SystemErrors", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="{{your-table-name}}"}) > {{THRESHOLD}}`  
**Seuil recommandé : ** {{THRESHOLD}} (intégré dans la requête)  
**Justification du seuil : ** défini en fonction du nombre d'erreurs système acceptable pour le tableau.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 900  
**Période de récupération : ** 900

**ThrottledPutRecordCount**  
**Étiquettes : **TableName, DelegatedOperation  
**Description de l'**alarme : Alarme lorsque le nombre d'enregistrements de put étranglé dépasse le seuil d'une table.  
**Objectif : ** détecter les accès limités susceptibles d'entraîner une perte de données lors des opérations de streaming.  
**Critères ProMQL : ** `max({__name__="ThrottledPutRecordCount", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="{{your-table-name}}",DelegatedOperation="{{your-operation}}"}) > {{THRESHOLD}}`  
**Seuil recommandé : ** {{THRESHOLD}} (intégré dans la requête)  
**Justification du seuil : ** défini en fonction de votre nombre d'accélérateurs acceptable pour les opérations de diffusion en continu.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 600  
**Période de récupération : ** 600

**UserErrors**  
**Étiquettes : ** Aucune  
**Description de l'**alarme : Alarme lorsque les erreurs de l'utilisateur dépassent le seuil défini pour l'ensemble du compte.  
**Objectif : ** détecter les taux élevés d'erreurs des clients, telles que les échecs de validation ou de vérification conditionnelle.  
**Critères ProMQL : ** `sum({__name__="UserErrors", "@instrumentation.@name"="cloudwatch.aws/dynamodb"}) > {{THRESHOLD}}`  
**Seuil recommandé : ** {{THRESHOLD}} (intégré dans la requête)  
**Justification du seuil : ** défini en fonction de votre taux d'erreur acceptable pour les échecs des demandes côté client.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 600  
**Période de récupération : ** 600

**WriteThrottleEvents**  
**Étiquettes : ** TableName  
**Description de l'**alarme : Alarme lorsque les événements d'accélération d'écriture dépassent le seuil d'une table.  
**Objectif : ** détecter la limitation de l'écriture qui indique une capacité provisionnée insuffisante.  
**Critères ProMQL : ** `sum({__name__="WriteThrottleEvents", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="{{your-table-name}}"}) > {{THRESHOLD}}`  
**Seuil recommandé : ** {{THRESHOLD}} (intégré dans la requête)  
**Justification du seuil : ** défini en fonction du nombre d'accélérateurs que vous pouvez accepter pour les opérations d'écriture.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 300  
**Période de récupération : ** 300

**WriteThrottleEvents (GSI) **  
**Étiquettes : **TableName, GlobalSecondaryIndexName  
**Description de l'**alarme : Alarme lorsque les événements d'accélération d'écriture dépassent le seuil d'un index secondaire global.  
**Objectif : ** détecter la limitation de l'écriture sur un GSI qui indique une capacité d'index insuffisante.  
**Critères ProMQL : ** `sum({__name__="WriteThrottleEvents", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="{{your-table-name}}",GlobalSecondaryIndexName="{{your-index-name}}"}) > {{THRESHOLD}}`  
**Seuil recommandé : ** {{THRESHOLD}} (intégré dans la requête)  
**Justification du seuil : ** défini en fonction de votre nombre d'accélérateurs acceptable pour les opérations d'écriture GSI.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 300  
**Période de récupération : ** 300

## EBS
<a name="Recommended_PromQL_EBS"></a>

**VolumeStalledIOCheck**  
**Étiquettes : **VolumeId, InstanceId  
**Description de l'**alarme : Alarme lorsqu'un volume EBS signale un échec de I/O vérification bloqué.  
**Objectif : ** Détecter les volumes EBS bloqués I/O , ce qui indique une diminution du volume.  
**Critères ProMQL : ** `max({__name__="VolumeStalledIOCheck", "@instrumentation.@name"="cloudwatch.aws/ebs", VolumeId="{{your-volume-id}}",InstanceId="{{your-instance-id}}"}) >= 1`  
**Seuil recommandé : ** 1 (intégré dans la requête)  
**Justification du seuil : ** une valeur supérieure ou égale à 1 indique que le volume a stagné I/O, ce qui nécessite une enquête immédiate.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 600  
**Période de récupération : ** 600

## Amazon Elastic Compute Cloud
<a name="Recommended_PromQL_EC2"></a>

**CPUUtilization**  
**Étiquettes : ** InstanceId  
**Description de l'**alarme : Alarme lorsque l'utilisation moyenne du processeur dépasse 80 % pour une instance EC2.  
**Objectif : ** détecter une utilisation élevée du processeur.  
**Critères ProMQL : ** `avg({__name__="CPUUtilization", "@instrumentation.@name"="cloudwatch.aws/ec2", InstanceId="{{your-instance-id}}"}) > 80`  
**Seuil recommandé : ** 80 (intégré dans la requête)  
**Justification du seuil : le seuil de ** 80 % donne une marge avant la saturation.  
**Intervalle d'évaluation : ** 300  
**Période d'attente : ** 900  
**Période de récupération : ** 900

**StatusCheckFailed**  
**Étiquettes : ** InstanceId  
**Description de l'**alarme : Alarme en cas d'échec de la vérification de l'état d'une instance ou d'un système pour une instance EC2.  
**Objectif : ** détecter les problèmes de santé de l'instance ou du système.  
**Critères ProMQL : ** `max({__name__="StatusCheckFailed", "@instrumentation.@name"="cloudwatch.aws/ec2", InstanceId="{{your-instance-id}}"}) >= 1`  
**Seuil recommandé : ** 1 (intégré dans la requête)  
**Justification du seuil : ** tout échec de la vérification de statut nécessite une enquête.  
**Intervalle d'évaluation : ** 300  
**Période d'attente : ** 600  
**Période de récupération : ** 600

**StatusCheckFailed\_EBS attachés **  
**Étiquettes : ** InstanceId  
**Description de l'**alarme : Alarme lorsqu'un volume EBS connecté devient inaccessible pour une instance EC2.  
**Objectif : ** détecter les volumes EBS inaccessibles.  
**Critères ProMQL : ** `max({__name__="StatusCheckFailed_AttachedEBS", "@instrumentation.@name"="cloudwatch.aws/ec2", InstanceId="{{your-instance-id}}"}) >= 1`  
**Seuil recommandé : ** 1 (intégré dans la requête)  
**Justification du seuil : ** les volumes inaccessibles entraînent des I/O défaillances.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 600  
**Période de récupération : ** 600

## Amazon ECS
<a name="Recommended_PromQL_ECS"></a>

**CPUReservation**  
**Étiquettes : ** ClusterName  
**Description de l'**alarme : Alarme lorsque la réservation moyenne du processeur dépasse 80 % pour un cluster ECS.  
**Objectif : ** détecter un cluster approchant de la capacité du processeur.  
**Critères ProMQL : ** `avg({__name__="CPUReservation", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="{{your-cluster-name}}"}) > 80`  
**Seuil recommandé : ** 80 (intégré dans la requête)  
**Justification du seuil : une réserve de ** 80 % indique une marge de manœuvre limitée pour les nouvelles tâches.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 300  
**Période de récupération : ** 300

**CPUUtilization**  
**Étiquettes : **ClusterName, ServiceName  
**Description de l'**alarme : Alarme lorsque l'utilisation moyenne du processeur dépasse 80 % pour un service ECS.  
**Objectif : ** détecter une utilisation élevée du processeur pour le service ECS.  
**Critères ProMQL : ** `avg({__name__="CPUUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="{{your-cluster-name}}",ServiceName="{{your-service-name}}"}) > 80`  
**Seuil recommandé : ** 80 (intégré dans la requête)  
**Justification du seuil : ** 80 % donnent une marge de manœuvre avant la saturation.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 300  
**Période de récupération : ** 300

**EBSFilesystemUtilization**  
**Étiquettes : **ClusterName, ServiceName  
**Description de l'**alarme : Alarme lorsque l'utilisation moyenne du système de fichiers EBS dépasse 80 % pour un service ECS.  
**Objectif : ** détecter une utilisation élevée du stockage EBS.  
**Critères ProMQL : ** `avg({__name__="EBSFilesystemUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="{{your-cluster-name}}",ServiceName="{{your-service-name}}"}) > 80`  
**Seuil recommandé : ** 80 (intégré dans la requête)  
**Justification du seuil : ** 80 % donnent une marge de manœuvre avant la saturation.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 300  
**Période de récupération : ** 300

**MemoryReservation**  
**Étiquettes : ** ClusterName  
**Description de l'**alarme : Alarme lorsque la réservation moyenne de mémoire dépasse 80 % pour un cluster ECS.  
**Objectif : ** Détecter un cluster dont la capacité de mémoire est proche.  
**Critères ProMQL : ** `avg({__name__="MemoryReservation", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="{{your-cluster-name}}"}) > 80`  
**Seuil recommandé : ** 80 (intégré dans la requête)  
**Justification du seuil : une réserve de ** 80 % indique une marge de manœuvre limitée pour les nouvelles tâches.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 300  
**Période de récupération : ** 300

**MemoryUtilization**  
**Étiquettes : **ClusterName, ServiceName  
**Description de l'**alarme : Alarme lorsque l'utilisation moyenne de la mémoire dépasse 80 % pour un service ECS.  
**Objectif : ** détecter une utilisation élevée de la mémoire.  
**Critères ProMQL : ** `avg({__name__="MemoryUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="{{your-cluster-name}}",ServiceName="{{your-service-name}}"}) > 80`  
**Seuil recommandé : ** 80 (intégré dans la requête)  
**Justification du seuil : ** 80 % donnent une marge de manœuvre avant la saturation.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 300  
**Période de récupération : ** 300

**HTTP Code\_Target \_5xx\_Count **  
**Étiquettes : **ClusterName, ServiceName  
**Description de l'**alarme : alarme lorsque le nombre d'erreurs HTTP 5XX dépasse le seuil d'un service ECS.  
**Objectif : ** détecter un nombre élevé d'erreurs côté serveur.  
**Critères ProMQL : ** `sum({__name__="HTTPCode_Target_5XX_Count", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="{{your-cluster-name}}",ServiceName="{{your-service-name}}"}) > {{THRESHOLD}}`  
**Seuil recommandé : ** {{THRESHOLD}} (intégré dans la requête)  
**Justification du seuil : ** défini en fonction du taux d'erreur de référence normal de votre application.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 300  
**Période de récupération : ** 300

**TargetResponseTime**  
**Étiquettes : **ClusterName, ServiceName  
**Description de l'**alarme : Alarme lorsque le temps de réponse cible moyen dépasse le seuil d'un service ECS.  
**Objectif : ** détecter un temps de réponse cible élevé.  
**Critères ProMQL : ** `avg({__name__="TargetResponseTime", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="{{your-cluster-name}}",ServiceName="{{your-service-name}}"}) > {{THRESHOLD}}`  
**Seuil recommandé : ** {{THRESHOLD}} (intégré dans la requête)  
**Justification du seuil : ** défini en fonction des exigences de latence acceptables de votre application.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 300  
**Période de récupération : ** 300

## Informations sur les conteneurs Amazon ECS
<a name="Recommended_PromQL_ECS_ContainerInsights"></a>

**EphemeralStorageUtilized**  
**Étiquettes : **ClusterName, ServiceName  
**Description de l'**alarme : alarme lorsque l'utilisation moyenne du stockage éphémère dépasse le seuil des tâches Fargate.  
**Objectif : ** détecter une utilisation élevée du stockage éphémère pour les tâches Fargate.  
**Critères ProMQL : ** `avg({__name__="EphemeralStorageUtilized", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="{{your-cluster-name}}",ServiceName="{{your-service-name}}"}) > {{THRESHOLD}}`  
**Seuil recommandé : ** {{THRESHOLD}} (intégré dans la requête)  
**Justification du seuil : ** défini en fonction de l'allocation de stockage éphémère de votre tâche.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 300  
**Période de récupération : ** 300

**RunningTaskCount**  
**Étiquettes : **ClusterName, ServiceName  
**Description de l'**alarme : Alarme lorsque le nombre de tâches en cours tombe à zéro pour un service ECS.  
**Objectif : ** détecter lorsqu'aucune tâche n'est en cours d'exécution.  
**Critères ProMQL : ** `avg({__name__="RunningTaskCount", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="{{your-cluster-name}}",ServiceName="{{your-service-name}}"}) <= 0`  
**Seuil recommandé : ** 0 (intégré dans la requête)  
**Justification du seuil : ** aucune tâche en cours d'exécution indique une interruption de service.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 300  
**Période de récupération : ** 300

**instance\_filesystem\_utilization**  
**Étiquettes : **InstanceId, ContainerInstanceId, ClusterName  
**Description de l'**alarme : alarme lorsque l'utilisation moyenne du système de fichiers dépasse 90 % sur une instance de conteneur.  
**Objectif : ** détecter une utilisation élevée du système de fichiers.  
**Critères ProMQL : ** `avg({__name__="instance_filesystem_utilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", InstanceId="{{your-instance-id}}",ContainerInstanceId="{{your-container-instance-id}}",ClusterName="{{your-cluster-name}}"}) > 90`  
**Seuil recommandé : ** 90 (intégré dans la requête)  
**Justification du seuil : ** 90 % d'utilisation du système de fichiers laissent un minimum d'espace pour les opérations.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 300  
**Période de récupération : ** 300

## Observabilité améliorée d'Amazon ECS Container Insights
<a name="Recommended_PromQL_ECS_ContainerInsights_Enhanced"></a>

**TaskCpuUtilization (niveau du cluster) **  
**Étiquettes : ** ClusterName  
**Description de l'**alarme : Alarme lorsque l'utilisation moyenne du processeur des tâches dépasse 80 % au niveau du cluster.  
**Objectif : ** détecter une utilisation élevée du processeur.  
**Critères ProMQL : ** `avg({__name__="TaskCpuUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="{{your-cluster-name}}"}) > 80`  
**Seuil recommandé : ** 80 (intégré dans la requête)  
**Justification du seuil : ** 80 % donnent une marge de manœuvre avant la saturation.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 300  
**Période de récupération : ** 300

**TaskCpuUtilization (niveau de service) **  
**Étiquettes : **ClusterName, ServiceName  
**Description de l'**alarme : Alarme lorsque l'utilisation moyenne du processeur des tâches dépasse 80 % au niveau du service.  
**Objectif : ** détecter une utilisation élevée du processeur.  
**Critères ProMQL : ** `avg({__name__="TaskCpuUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="{{your-cluster-name}}",ServiceName="{{your-service-name}}"}) > 80`  
**Seuil recommandé : ** 80 (intégré dans la requête)  
**Justification du seuil : ** 80 % donnent une marge de manœuvre avant la saturation.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 300  
**Période de récupération : ** 300

**TaskMemoryUtilization (niveau du cluster) **  
**Étiquettes : ** ClusterName  
**Description de l'**alarme : Alarme lorsque l'utilisation moyenne de la mémoire des tâches dépasse 80 % au niveau du cluster.  
**Objectif : ** détecter une utilisation élevée de la mémoire.  
**Critères ProMQL : ** `avg({__name__="TaskMemoryUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="{{your-cluster-name}}"}) > 80`  
**Seuil recommandé : ** 80 (intégré dans la requête)  
**Justification du seuil : ** 80 % donnent une marge de manœuvre avant la saturation.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 300  
**Période de récupération : ** 300

**TaskMemoryUtilization (niveau de service) **  
**Étiquettes : **ClusterName, ServiceName  
**Description de l'**alarme : Alarme lorsque l'utilisation moyenne de la mémoire des tâches dépasse 80 % au niveau du service.  
**Objectif : ** détecter une utilisation élevée de la mémoire.  
**Critères ProMQL : ** `avg({__name__="TaskMemoryUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="{{your-cluster-name}}",ServiceName="{{your-service-name}}"}) > 80`  
**Seuil recommandé : ** 80 (intégré dans la requête)  
**Justification du seuil : ** 80 % donnent une marge de manœuvre avant la saturation.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 300  
**Période de récupération : ** 300

**ContainerCpuUtilization (niveau du cluster) **  
**Étiquettes : ** ClusterName  
**Description de l'**alarme : Alarme lorsque l'utilisation moyenne du processeur du conteneur dépasse 80 % au niveau du cluster.  
**Objectif : ** détecter une utilisation élevée du processeur.  
**Critères ProMQL : ** `avg({__name__="ContainerCpuUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="{{your-cluster-name}}"}) > 80`  
**Seuil recommandé : ** 80 (intégré dans la requête)  
**Justification du seuil : ** 80 % donnent une marge de manœuvre avant la saturation.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 300  
**Période de récupération : ** 300

**ContainerCpuUtilization (niveau du conteneur) **  
**Étiquettes : **ContainerName, ClusterName, ServiceName  
**Description de l'**alarme : Alarme lorsque l'utilisation moyenne du processeur du conteneur dépasse 80 % au niveau du conteneur.  
**Objectif : ** détecter une utilisation élevée du processeur.  
**Critères ProMQL : ** `avg({__name__="ContainerCpuUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ContainerName="{{your-container-name}}",ClusterName="{{your-cluster-name}}",ServiceName="{{your-service-name}}"}) > 80`  
**Seuil recommandé : ** 80 (intégré dans la requête)  
**Justification du seuil : ** 80 % donnent une marge de manœuvre avant la saturation.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 300  
**Période de récupération : ** 300

**ContainerMemoryUtilization (niveau du cluster) **  
**Étiquettes : ** ClusterName  
**Description de l'**alarme : Alarme lorsque l'utilisation moyenne de la mémoire du conteneur dépasse 80 % au niveau du cluster.  
**Objectif : ** détecter une utilisation élevée de la mémoire.  
**Critères ProMQL : ** `avg({__name__="ContainerMemoryUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="{{your-cluster-name}}"}) > 80`  
**Seuil recommandé : ** 80 (intégré dans la requête)  
**Justification du seuil : ** 80 % donnent une marge de manœuvre avant la saturation.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 300  
**Période de récupération : ** 300

**ContainerMemoryUtilization (niveau du conteneur) **  
**Étiquettes : **ContainerName, ClusterName, ServiceName  
**Description de l'**alarme : Alarme lorsque l'utilisation moyenne de la mémoire du conteneur dépasse 80 % au niveau du conteneur.  
**Objectif : ** détecter une utilisation élevée de la mémoire.  
**Critères ProMQL : ** `avg({__name__="ContainerMemoryUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ContainerName="{{your-container-name}}",ClusterName="{{your-cluster-name}}",ServiceName="{{your-service-name}}"}) > 80`  
**Seuil recommandé : ** 80 (intégré dans la requête)  
**Justification du seuil : ** 80 % donnent une marge de manœuvre avant la saturation.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 300  
**Période de récupération : ** 300

**TaskEBSfilesystemUtilization**  
**Étiquettes : **ClusterName, ServiceName  
**Description de l'alarme : ** alarme lorsque l'utilisation moyenne du système de fichiers EBS dépasse 80 % pour les tâches.  
**Objectif : ** détecter une utilisation élevée du système de fichiers EBS.  
**Critères ProMQL : ** `avg({__name__="TaskEBSfilesystemUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="{{your-cluster-name}}",ServiceName="{{your-service-name}}"}) > 80`  
**Seuil recommandé : ** 80 (intégré dans la requête)  
**Justification du seuil : ** 80 % donnent une marge de manœuvre avant la saturation.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 300  
**Période de récupération : ** 300

**TaskEphemeralStorageUtilization (niveau du cluster) **  
**Étiquettes : ** ClusterName  
**Description de l'**alarme : Alarme lorsque l'utilisation moyenne du stockage éphémère dépasse 80 % au niveau du cluster.  
**Objectif : ** détecter une utilisation élevée du stockage éphémère.  
**Critères ProMQL : ** `avg({__name__="TaskEphemeralStorageUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="{{your-cluster-name}}"}) > 80`  
**Seuil recommandé : ** 80 (intégré dans la requête)  
**Justification du seuil : ** 80 % donnent une marge de manœuvre avant la saturation.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 300  
**Période de récupération : ** 300

**TaskEphemeralStorageUtilization (niveau de service) **  
**Étiquettes : **ClusterName, ServiceName  
**Description de l'**alarme : Alarme lorsque l'utilisation moyenne du stockage éphémère dépasse 80 % au niveau de service.  
**Objectif : ** détecter une utilisation élevée du stockage éphémère.  
**Critères ProMQL : ** `avg({__name__="TaskEphemeralStorageUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="{{your-cluster-name}}",ServiceName="{{your-service-name}}"}) > 80`  
**Seuil recommandé : ** 80 (intégré dans la requête)  
**Justification du seuil : ** 80 % donnent une marge de manœuvre avant la saturation.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 300  
**Période de récupération : ** 300

## Amazon EFS
<a name="Recommended_PromQL_EFS"></a>

**PercentIOLimit**  
**Étiquettes : ** FileSystemId  
**Description de l'**alarme : Alarme lorsqu'un système de fichiers EFS atteint 100 % de sa I/O limite.  
**Objectif : ** détecter quand le système de fichiers atteint sa I/O limite.  
**Critères ProMQL : ** `avg({__name__="PercentIOLimit", "@instrumentation.@name"="cloudwatch.aws/efs", FileSystemId="{{your-filesystem-id}}"}) >= 100`  
**Seuil recommandé : ** 100 (intégré dans la requête)  
**Justification du seuil : ** à 100 %, le système de fichiers devient un goulot d'étranglement.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 900  
**Période de récupération : ** 900

**BurstCreditBalance**  
**Étiquettes : ** FileSystemId  
**Description de l'**alarme : Alarme lorsque le solde créditeur d'un système de fichiers EFS tombe à zéro.  
**Objectif : ** détecter les crédits de rafale épuisés entraînant un ralentissement du débit.  
**Critères ProMQL : ** `avg({__name__="BurstCreditBalance", "@instrumentation.@name"="cloudwatch.aws/efs", FileSystemId="{{your-filesystem-id}}"}) <= 0`  
**Seuil recommandé : ** 0 (intégré dans la requête)  
**Justification du seuil : l'**absence de crédit entraîne une réduction du débit.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 900  
**Période de récupération : ** 900

## Informations sur les conteneurs Amazon EKS
<a name="Recommended_PromQL_EKS"></a>

**node\_cpu\_utilization**  
**Étiquettes : ** ClusterName  
**Description de l'**alarme : Alarme lorsque l'utilisation maximale du processeur dépasse 80 % sur les nœuds de travail EKS.  
**Objectif : ** détecter un processeur élevé sur les nœuds de travail.  
**Critères ProMQL : ** `max({__name__="node_cpu_utilization", "@instrumentation.@name"="cloudwatch.aws/eks-containerinsights", ClusterName="{{your-cluster-name}}"}) > 80`  
**Seuil recommandé : ** 80 (intégré dans la requête)  
**Justification du seuil : ** 80 % donnent une marge de manœuvre avant la saturation.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 300  
**Période de récupération : ** 300

**node\_filesystem\_utilization**  
**Étiquettes : ** ClusterName  
**Description de l'**alarme : alarme lorsque l'utilisation maximale du système de fichiers dépasse le seuil sur les nœuds de travail EKS.  
**Objectif : ** détecter une utilisation élevée du système de fichiers sur les nœuds de travail.  
**Critères ProMQL : ** `max({__name__="node_filesystem_utilization", "@instrumentation.@name"="cloudwatch.aws/eks-containerinsights", ClusterName="{{your-cluster-name}}"}) > {{THRESHOLD}}`  
**Seuil recommandé : ** {{THRESHOLD}} (intégré dans la requête)  
**Justification du seuil : ** défini en fonction de la capacité de stockage et des habitudes d'utilisation de votre nœud.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 300  
**Période de récupération : ** 300

**node\_memory\_utilization**  
**Étiquettes : ** ClusterName  
**Description de l'**alarme : Alarme lorsque l'utilisation maximale de la mémoire dépasse 80 % sur les nœuds de travail EKS.  
**Objectif : ** détecter une mémoire élevée sur les nœuds de travail.  
**Critères ProMQL : ** `max({__name__="node_memory_utilization", "@instrumentation.@name"="cloudwatch.aws/eks-containerinsights", ClusterName="{{your-cluster-name}}"}) > 80`  
**Seuil recommandé : ** 80 (intégré dans la requête)  
**Justification du seuil : ** 80 % donnent une marge de manœuvre avant la saturation.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 300  
**Période de récupération : ** 300

**pod\_cpu\_utilization\_over\_pod\_limit**  
**Libellés : **ClusterName, Namespace, Service  
**Description de l'**alarme : Alarme lorsque l'utilisation du processeur du pod dépasse 80 % de sa limite.  
**Objectif : ** détecter les pods approchant les limites du processeur.  
**Critères ProMQL : ** `max({__name__="pod_cpu_utilization_over_pod_limit", "@instrumentation.@name"="cloudwatch.aws/eks-containerinsights", ClusterName="{{your-cluster-name}}",Namespace="{{your-namespace}}",Service="{{your-service}}"}) > 80`  
**Seuil recommandé : ** 80 (intégré dans la requête)  
**Justification du seuil : ** 80 % donnent une marge de manœuvre avant que l'étranglement ne se produise.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 300  
**Période de récupération : ** 300

**pod\_memory\_utilization\_over\_pod\_limit**  
**Libellés : **ClusterName, Namespace, Service  
**Description de l'**alarme : Alarme lorsque l'utilisation de la mémoire du pod dépasse 80 % de sa limite.  
**Objectif : ** détecter les modules approchant les limites de mémoire.  
**Critères ProMQL : ** `max({__name__="pod_memory_utilization_over_pod_limit", "@instrumentation.@name"="cloudwatch.aws/eks-containerinsights", ClusterName="{{your-cluster-name}}",Namespace="{{your-namespace}}",Service="{{your-service}}"}) > 80`  
**Seuil recommandé : ** 80 (intégré dans la requête)  
**Justification du seuil : ** 80 % donnent une marge de manœuvre avant que OOMkill ne se produise.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 300  
**Période de récupération : ** 300

## Amazon ElastiCache
<a name="Recommended_PromQL_ElastiCache"></a>

**CPUUtilization**  
**Étiquettes : **CacheClusterId, CacheNodeId  
**Description de l'**alarme : Alarme lorsque l'utilisation moyenne du processeur dépasse le seuil d'un ElastiCache nœud.  
**Intention : ** détecter un processeur élevé sur l'ensemble de l'instance.  
**Critères ProMQL : ** `avg({__name__="CPUUtilization", "@instrumentation.@name"="cloudwatch.aws/elasticache", CacheClusterId="{{your-cache-cluster-id}}",CacheNodeId="{{your-cache-node-id}}"}) > {{THRESHOLD}}`  
**Seuil recommandé : ** {{THRESHOLD}} (intégré dans la requête)  
**Justification du seuil : ** défini en fonction de votre type de nœud et des caractéristiques de charge de travail.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 300  
**Période de récupération : ** 300

**CurrConnections**  
**Étiquettes : **CacheClusterId, CacheNodeId  
**Description de l'**alarme : Alarme lorsque le nombre de connexions dépasse le seuil d'un ElastiCache nœud.  
**Objectif : ** détecter un nombre élevé de connexions.  
**Critères ProMQL : ** `avg({__name__="CurrConnections", "@instrumentation.@name"="cloudwatch.aws/elasticache", CacheClusterId="{{your-cache-cluster-id}}",CacheNodeId="{{your-cache-node-id}}"}) > {{THRESHOLD}}`  
**Seuil recommandé : ** {{THRESHOLD}} (intégré dans la requête)  
**Justification du seuil : ** définissez-le en fonction de la taille prévue de votre pool de connexions et des besoins de l'application.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 600  
**Période de récupération : ** 600

**DatabaseMemoryUsagePercentage**  
**Étiquettes : ** CacheClusterId  
**Description de l'alarme : ** alarme lorsque l'utilisation de la mémoire de la base de données dépasse le seuil d'un ElastiCache cluster.  
**Objectif : ** détecter une utilisation élevée de la mémoire pour éviter les échecs d'écriture.  
**Critères ProMQL : ** `avg({__name__="DatabaseMemoryUsagePercentage", "@instrumentation.@name"="cloudwatch.aws/elasticache", CacheClusterId="{{your-cache-cluster-id}}"}) > {{THRESHOLD}}`  
**Seuil recommandé : ** {{THRESHOLD}} (intégré dans la requête)  
**Justification du seuil : ** défini en fonction de votre politique d'expulsion et de la criticité des données.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 300  
**Période de récupération : ** 300

**EngineCPUUtilization**  
**Étiquettes : ** CacheClusterId  
**Description de l'**alarme : Alarme lorsque l'utilisation du processeur du moteur Redis dépasse 90 % pour un ElastiCache cluster.  
**Objectif : ** détecter une utilisation élevée du processeur du moteur Redis.  
**Critères ProMQL : ** `avg({__name__="EngineCPUUtilization", "@instrumentation.@name"="cloudwatch.aws/elasticache", CacheClusterId="{{your-cache-cluster-id}}"}) > 90`  
**Seuil recommandé : ** 90 (intégré dans la requête)  
**Justification du seuil : ** Redis est monothread ; une valeur supérieure à 90 % indique une saturation.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 300  
**Période de récupération : ** 300

**ReplicationLag**  
**Étiquettes : ** CacheClusterId  
**Description de l'**alarme : Alarme lorsque le délai de réplication dépasse le seuil d'un ElastiCache cluster.  
**Objectif : ** détecter les retards de réplication affectant la cohérence des données.  
**Critères ProMQL : ** `avg({__name__="ReplicationLag", "@instrumentation.@name"="cloudwatch.aws/elasticache", CacheClusterId="{{your-cache-cluster-id}}"}) > {{THRESHOLD}}`  
**Seuil recommandé : ** {{THRESHOLD}} (intégré dans la requête)  
**Justification du seuil : ** défini en fonction de la tolérance de votre application pour les lectures périmées.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 900  
**Période de récupération : ** 900

## GPU Elastic
<a name="Recommended_PromQL_ElasticGPUs"></a>

**GPUConnectivityCheckFailed**  
**Libellés : **InstanceId, eGPUID  
**Description de l'**alarme : Alarme lorsque l'accélérateur Elastic Graphics perd la connectivité avec l'instance.  
**Objectif : ** détecter les problèmes de connectivité avec Elastic Graphics Accelerator.  
**Critères ProMQL : ** `max({__name__="GPUConnectivityCheckFailed", "@instrumentation.@name"="cloudwatch.aws/elasticgpus", InstanceId="{{your-instance-id}}",EGPUId="{{your-egpu-id}}"}) > 0`  
**Seuil recommandé : ** 0 (intégré dans la requête)  
**Justification du seuil : ** toute défaillance de connectivité doit faire l'objet d'une enquête.  
**Intervalle d'évaluation : ** 300  
**Période d'attente : ** 900  
**Période de récupération : ** 900

**GPUHealthCheckFailed**  
**Libellés : **InstanceId, eGPUID  
**Description de l'**alarme : Alarme en cas d'échec de la vérification de l'état d'un accélérateur Elastic Graphics.  
**Objectif : ** détecter un accélérateur Elastic Graphics défectueux.  
**Critères ProMQL : ** `max({__name__="GPUHealthCheckFailed", "@instrumentation.@name"="cloudwatch.aws/elasticgpus", InstanceId="{{your-instance-id}}",EGPUId="{{your-egpu-id}}"}) > 0`  
**Seuil recommandé : ** 0 (intégré dans la requête)  
**Justification du seuil : les échecs du bilan de ** santé indiquent des problèmes d'accélérateur.  
**Intervalle d'évaluation : ** 300  
**Période d'attente : ** 900  
**Période de récupération : ** 900

## EventBridge Planificateur Amazon
<a name="Recommended_PromQL_Scheduler"></a>

**TargetErrorThrottledCount**  
**Description de l'**alarme : Alarme lorsque les appels de la cible planifiée sont limités.  
**Objectif : ** détecter l'étranglement des cibles entraînant des retards dans le calendrier.  
**Critères ProMQL : ** `sum({__name__="TargetErrorThrottledCount", "@instrumentation.@name"="cloudwatch.aws/scheduler"}) > 0`  
**Seuil recommandé : ** 0 (intégré dans la requête)  
**Justification du seuil : ** toute limitation indique des problèmes de capacité cible.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 900  
**Période de récupération : ** 900

**InvocationThrottleCount**  
**Description de l'**alarme : Alarme lorsque les appels du planificateur sont limités.  
**Objectif : ** détecter la limitation des invocations du planificateur.  
**Critères ProMQL : ** `sum({__name__="InvocationThrottleCount", "@instrumentation.@name"="cloudwatch.aws/scheduler"}) > 0`  
**Seuil recommandé : ** 0 (intégré dans la requête)  
**Justification du seuil : ** la limitation retarde les exécutions prévues.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 900  
**Période de récupération : ** 900

**InvocationDroppedCount**  
**Description de l'**alarme : Alarme lorsque des appels planifiés sont abandonnés.  
**Objectif : ** détecter les appels supprimés.  
**Critères ProMQL : ** `sum({__name__="InvocationDroppedCount", "@instrumentation.@name"="cloudwatch.aws/scheduler"}) > 0`  
**Seuil recommandé : ** 0 (intégré dans la requête)  
**Justification du seuil : les invocations ** abandonnées représentent des événements planifiés perdus.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 60  
**Période de récupération : ** 60

**InvocationsFailedToBeSentToDeadLetterCount**  
**Description de l'**alarme : Alarme lorsque les appels échoués ne peuvent pas être envoyés à la file d'attente de lettres mortes.  
**Objectif : ** détecter les échecs de distribution du DLQ.  
**Critères ProMQL : ** `sum({__name__="InvocationsFailedToBeSentToDeadLetterCount", "@instrumentation.@name"="cloudwatch.aws/scheduler"}) > 0`  
**Seuil recommandé : ** 0 (intégré dans la requête)  
**Justification du seuil : l'**échec de la livraison du DLQ entraîne la perte des informations d'erreur.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 900  
**Période de récupération : ** 900

## Amazon Kinesis Data Streams
<a name="Recommended_PromQL_Kinesis"></a>

**GetRecords.IteratorAgeMilliseconds**  
**Étiquettes : ** StreamName  
**Description de l'**alarme : alarme lorsque l'âge de l'itérateur du consommateur dépasse le seuil d'un flux Kinesis.  
**Objectif : ** détecter les données en retard dans la période de conservation risquant de perdre des données.  
**Critères ProMQL : ** `max({__name__="GetRecords.IteratorAgeMilliseconds", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="{{your-stream-name}}"}) > {{THRESHOLD}}`  
**Seuil recommandé : ** {{THRESHOLD}} (intégré dans la requête)  
**Justification du seuil : ** défini en fonction du pourcentage de la période de rétention du flux.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 900  
**Période de récupération : ** 900

**GetRecords.Success**  
**Étiquettes : ** StreamName  
**Description de l'**alarme : Alarme lorsque le taux de GetRecords réussite tombe en dessous du seuil d'un flux Kinesis.  
**Objectif : ** détecter les échecs de récupération par les consommateurs.  
**Critères ProMQL : ** `avg({__name__="GetRecords.Success", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="{{your-stream-name}}"}) < {{THRESHOLD}}`  
**Seuil recommandé : ** {{THRESHOLD}} (intégré dans la requête)  
**Justification du seuil : ** défini en fonction du taux de réussite attendu.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 300  
**Période de récupération : ** 300

**PutRecord.Success**  
**Étiquettes : ** StreamName  
**Description de l'**alarme : Alarme lorsque le taux de PutRecord réussite tombe en dessous du seuil d'un flux Kinesis.  
**Objectif : ** détecter les défaillances d'ingestion par les producteurs.  
**Critères ProMQL : ** `avg({__name__="PutRecord.Success", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="{{your-stream-name}}"}) < {{THRESHOLD}}`  
**Seuil recommandé : ** {{THRESHOLD}} (intégré dans la requête)  
**Justification du seuil : ** défini en fonction du taux de réussite attendu.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 300  
**Période de récupération : ** 300

**PutRecords.FailedRecords**  
**Étiquettes : ** StreamName  
**Description de l'**alarme : Alarme lorsque les opérations de mise en lots produisent des enregistrements échoués pour un flux Kinesis.  
**Objectif : ** détecter les échecs de mise en lots.  
**Critères ProMQL : ** `sum({__name__="PutRecords.FailedRecords", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="{{your-stream-name}}"}) > {{THRESHOLD}}`  
**Seuil recommandé : ** {{THRESHOLD}} (intégré dans la requête)  
**Justification du seuil : ** défini en fonction d'un nombre de défaillances acceptable.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 300  
**Période de récupération : ** 300

**ReadProvisionedThroughputExceeded**  
**Étiquettes : ** StreamName  
**Description de l'**alarme : Alarme lorsque les lectures des utilisateurs dépassent le débit prévu pour un flux Kinesis.  
**Objectif : ** détecter la limitation de la lecture par les consommateurs.  
**Critères ProMQL : ** `avg({__name__="ReadProvisionedThroughputExceeded", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="{{your-stream-name}}"}) > {{THRESHOLD}}`  
**Seuil recommandé : ** {{THRESHOLD}} (intégré dans la requête)  
**Justification du seuil : ** Toute limitation prolongée indique des besoins en capacité.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 300  
**Période de récupération : ** 300

**SubscribeToShardEvent.MillisBehindLatest**  
**Étiquettes : **StreamName, ConsumerName  
**Description de l'**alarme : Alarme lorsqu'un consommateur bénéficiant d'un plus grand nombre de fans prend du retard par rapport au dernier record.  
**Objectif : ** détecter l'augmentation du délai de traitement des ventilateurs par les consommateurs.  
**Critères ProMQL : ** `avg({__name__="SubscribeToShardEvent.MillisBehindLatest", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="{{your-stream-name}}",ConsumerName="{{your-consumer-name}}"}) > {{THRESHOLD}}`  
**Seuil recommandé : ** {{THRESHOLD}} (intégré dans la requête)  
**Justification du seuil : ** défini en fonction d'un délai de traitement acceptable.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 300  
**Période de récupération : ** 300

**WriteProvisionedThroughputExceeded**  
**Étiquettes : ** StreamName  
**Description de l'**alarme : Alarme lorsque les écritures du producteur dépassent le débit prévu pour un flux Kinesis.  
**Objectif : ** détecter la limitation de l'écriture du producteur.  
**Critères ProMQL : ** `avg({__name__="WriteProvisionedThroughputExceeded", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="{{your-stream-name}}"}) > {{THRESHOLD}}`  
**Seuil recommandé : ** {{THRESHOLD}} (intégré dans la requête)  
**Justification du seuil : ** une limitation continue indique les besoins en capacité.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 300  
**Période de récupération : ** 300

## AWS Lambda
<a name="Recommended_PromQL_Lambda"></a>

**ClaimedAccountConcurrency**  
**Description de l'**alarme : alarme lorsque la simultanéité des comptes réclamés dépasse le seuil.  
**Objectif : ** détecter un compte approchant le quota de simultanéité.  
**Critères ProMQL : ** `max({__name__="ClaimedAccountConcurrency", "@instrumentation.@name"="cloudwatch.aws/lambda"}) > {{THRESHOLD}}`  
**Seuil recommandé : ** {{THRESHOLD}} (intégré dans la requête)  
**Justification du seuil : ** défini en pourcentage de la limite de simultanéité régionale.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 600  
**Période de récupération : ** 600

**Erreurs**  
**Étiquettes : ** FunctionName  
**Description de l'**alarme : Alarme lorsque le nombre d'erreurs de fonction dépasse le seuil d'une fonction Lambda.  
**Objectif : ** détecter un nombre élevé d'erreurs de fonctionnement.  
**Critères ProMQL : ** `sum({__name__="Errors", "@instrumentation.@name"="cloudwatch.aws/lambda", FunctionName="{{your-function-name}}"}) > {{THRESHOLD}}`  
**Seuil recommandé : ** {{THRESHOLD}} (intégré dans la requête)  
**Justification du seuil : ** défini en fonction du volume d'erreur acceptable.  
**Intervalle d'évaluation : ** 60  
**Période en attente : ** 180  
**Période de récupération : ** 300

**Throttles**  
**Étiquettes : ** FunctionName  
**Description de l'**alarme : Alarme lorsque les appels de fonction sont limités pour une fonction Lambda.  
**Objectif : ** détecter la limitation de l'invocation des fonctions.  
**Critères ProMQL : ** `sum({__name__="Throttles", "@instrumentation.@name"="cloudwatch.aws/lambda", FunctionName="{{your-function-name}}"}) > {{THRESHOLD}}`  
**Seuil recommandé : ** {{THRESHOLD}} (intégré dans la requête)  
**Justification du seuil : la ** limitation indique que la limite de simultanéité est atteinte.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 300  
**Période de récupération : ** 300

**Durée**  
**Étiquettes : ** FunctionName  
**Description de l'**alarme : Alarme lorsque la durée de la fonction p90 dépasse le seuil d'une fonction Lambda.  
**Objectif : ** détecter les appels de fonctions de longue durée.  
**Critères ProMQL : ** `histogram_quantile(0.9, {__name__="Duration", "@instrumentation.@name"="cloudwatch.aws/lambda", FunctionName="{{your-function-name}}"}) > {{THRESHOLD}}`  
**Seuil recommandé : ** {{THRESHOLD}} (intégré dans la requête)  
**Justification du seuil : ** défini par rapport au délai d'expiration de la fonction.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 900  
**Période de récupération : ** 900

**ConcurrentExecutions**  
**Étiquettes : ** FunctionName  
**Description de l'**alarme : Alarme lorsque les exécutions simultanées dépassent le seuil d'une fonction Lambda.  
**Objectif : ** détecter les fonctions qui approchent des limites de simultanéité.  
**Critères ProMQL : ** `max({__name__="ConcurrentExecutions", "@instrumentation.@name"="cloudwatch.aws/lambda", FunctionName="{{your-function-name}}"}) > {{THRESHOLD}}`  
**Seuil recommandé : ** {{THRESHOLD}} (intégré dans la requête)  
**Justification du seuil : ** défini sur le pourcentage de simultanéité réservée.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 600  
**Période de récupération : ** 600

## AWS Lambda Informations
<a name="Recommended_PromQL_LambdaInsights"></a>

**memory\_utilization**  
**Étiquettes : ** function\_name  
**Description de l'**alarme : Alarme lorsque l'utilisation moyenne de la mémoire dépasse 90 % pour une fonction Lambda.  
**Objectif : ** Détecter une fonction approchant la limite de mémoire configurée.  
**Critères ProMQL : ** `avg({__name__="memory_utilization", "@instrumentation.@name"="cloudwatch.aws/lambda-insights", function_name="{{your-function-name}}"}) > 90`  
**Seuil recommandé : ** 90 (intégré dans la requête)  
**Justification du seuil : ** Au-delà de 90 %, le risque de défaillance de la mémoire est insuffisant.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 600  
**Période de récupération : ** 600

## Passerelle NAT
<a name="Recommended_PromQL_NATGateway"></a>

**ErrorPortAllocation**  
**Étiquettes : ** NatGatewayId  
**Description de l'**alarme : Alarme lorsque la passerelle NAT ne parvient pas à allouer un port pour les nouvelles connexions.  
**Objectif : ** détecter les échecs d'allocation de ports empêchant de nouvelles connexions.  
**Critères ProMQL : ** `sum({__name__="ErrorPortAllocation", "@instrumentation.@name"="cloudwatch.aws/natgateway", NatGatewayId="{{your-nat-gateway-id}}"}) > 0`  
**Seuil recommandé : ** 0 (intégré dans la requête)  
**Justification du seuil : ** tout échec d'allocation a un impact sur la connectivité.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 900  
**Période de récupération : ** 900

**PacketsDropCount**  
**Étiquettes : ** NatGatewayId  
**Description de l'**alarme : Alarme lorsque la passerelle NAT supprime des paquets dépassant le seuil.  
**Objectif : ** détecter les pertes de paquets indiquant des problèmes de capacité ou de connectivité.  
**Critères ProMQL : ** `sum({__name__="PacketsDropCount", "@instrumentation.@name"="cloudwatch.aws/natgateway", NatGatewayId="{{your-nat-gateway-id}}"}) > {{THRESHOLD}}`  
**Seuil recommandé : ** {{THRESHOLD}} (intégré dans la requête)  
**Justification du seuil : ** défini en fonction d'un taux de chute acceptable.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 300  
**Période de récupération : ** 300

## AWS PrivateLink points de terminaison
<a name="Recommended_PromQL_PrivateLinkEndpoints"></a>

**PacketsDropped**  
**Étiquettes : ** VpcId VpcEndpointId, EndpointType, SubnetId, ServiceName  
**Description de l'**alarme : Alarme lorsqu'un point de terminaison VPC supprime des paquets dépassant le seuil.  
**Objectif : ** détecter les terminaux ou les services de terminaux défectueux.  
**Critères ProMQL : ** `sum({__name__="PacketsDropped", "@instrumentation.@name"="cloudwatch.aws/privatelinkendpoints", VpcId="{{your-vpc-id}}",VpcEndpointId="{{your-vpc-endpoint-id}}",EndpointType="{{your-endpoint-type}}",SubnetId="{{your-subnet-id}}",ServiceName="{{your-service-name}}"}) > {{THRESHOLD}}`  
**Seuil recommandé : ** {{THRESHOLD}} (intégré dans la requête)  
**Justification du seuil : ** défini en fonction d'un taux de chute acceptable.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 300  
**Période de récupération : ** 300

## AWS PrivateLink services
<a name="Recommended_PromQL_PrivateLinkServices"></a>

**RstPacketsSent**  
**Libellés : **ServiceId, LoadBalancerArn, Az  
**Description de l'**alarme : Alarme lorsque le débit de paquets RST dépasse le seuil d'un service de point de terminaison.  
**Objectif : ** détecter les cibles malsaines du service Endpoint.  
**Critères ProMQL : ** `sum({__name__="RstPacketsSent", "@instrumentation.@name"="cloudwatch.aws/privatelinkservices", ServiceId="SVC",LoadBalancerArn="LB",Az="AZ"}) > {{THRESHOLD}}`  
**Seuil recommandé : ** {{THRESHOLD}} (intégré dans la requête)  
**Justification du seuil : ** défini en fonction d'un débit de paquets RST acceptable.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 300  
**Période de récupération : ** 300

## RDS
<a name="Recommended_PromQL_RDS"></a>

**CPUUtilization**  
**Étiquettes : ** DBInstanceIdentifier  
**Description de l'**alarme : Alarme lorsque l'utilisation moyenne du processeur dépasse 90 % pour une instance RDS.  
**Objectif : ** détecter les hautes performances du processeur afin d'éviter toute dégradation des performances.  
**Critères ProMQL : ** `avg({__name__="CPUUtilization", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > 90`  
**Seuil recommandé : ** 90 (intégré dans la requête)  
**Justification du seuil : ** 90 % indiquent une saturation proche de la saturation.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 300  
**Période de récupération : ** 300

**DatabaseConnections**  
**Étiquettes : ** DBInstanceIdentifier  
**Description de l'**alarme : Alarme lorsque les connexions à la base de données dépassent le seuil d'une instance RDS.  
**Objectif : ** empêcher les connexions rejetées dans la limite maximale.  
**Critères ProMQL : ** `avg({__name__="DatabaseConnections", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > {{THRESHOLD}}`  
**Seuil recommandé : ** {{THRESHOLD}} (intégré dans la requête)  
**Justification du seuil : ** défini sur le pourcentage du paramètre max\_connections.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 300  
**Période de récupération : ** 300

**EBSByteBalance%**  
**Étiquettes : ** DBInstanceIdentifier  
**Description de l'**alarme : Alarme lorsque le solde des octets EBS tombe en dessous de 10 % pour une instance RDS.  
**Objectif : ** détecter les crédits à faible débit à l'origine de goulots d'étranglement.  
**Critères ProMQL : ** `avg({__name__="EBSByteBalance%", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) < 10`  
**Seuil recommandé : ** 10 (intégré dans la requête)  
**Justification du seuil : En ** dessous de 10 %, le débit risque d'être dégradé.  
**Intervalle d'évaluation : ** 60  
**Période en attente : ** 180  
**Période de récupération : ** 180

**EBSIOBalance%**  
**Étiquettes : ** DBInstanceIdentifier  
**Description de l'**alarme : Alarme lorsque l'équilibre des E/S EBS tombe en dessous de 10 % pour une instance RDS.  
**Objectif : ** détecter les faibles crédits IOPS à l'origine de goulots d'étranglement.  
**Critères ProMQL : ** `avg({__name__="EBSIOBalance%", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) < 10`  
**Seuil recommandé : ** 10 (intégré dans la requête)  
**Justification du seuil : Un seuil ** inférieur à 10 % présente un risque de dégradation des IOPS.  
**Intervalle d'évaluation : ** 60  
**Période en attente : ** 180  
**Période de récupération : ** 180

**FreeableMemory**  
**Étiquettes : ** DBInstanceIdentifier  
**Description de l'**alarme : Alarme lorsque la mémoire libérable tombe en dessous du seuil d'une instance RDS.  
**Objectif : ** éviter que le manque de mémoire n'entraîne le rejet de connexions.  
**Critères ProMQL : ** `avg({__name__="FreeableMemory", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) < {{THRESHOLD}}`  
**Seuil recommandé : ** {{THRESHOLD}} (intégré dans la requête)  
**Justification du seuil : ** défini en fonction de la mémoire des classes d'instance.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 900  
**Période de récupération : ** 900

**FreeLocalStorage**  
**Étiquettes : ** DBInstanceIdentifier  
**Description de l'**alarme : Alarme lorsque le stockage local disponible tombe en dessous du seuil d'une instance Aurora.  
**Objectif : ** empêcher l'épuisement du stockage local d'Aurora.  
**Critères ProMQL : ** `avg({__name__="FreeLocalStorage", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) < {{THRESHOLD}}`  
**Seuil recommandé : ** {{THRESHOLD}} (intégré dans la requête)  
**Justification du seuil : ** défini en fonction du minimum requis pour les opérations.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 300  
**Période de récupération : ** 300

**FreeStorageSpace**  
**Étiquettes : ** DBInstanceIdentifier  
**Description de l'**alarme : Alarme lorsque l'espace de stockage disponible tombe en dessous du seuil d'une instance RDS.  
**Objectif : ** éviter les interruptions de stockage complètes.  
**Critères ProMQL : ** `min({__name__="FreeStorageSpace", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) < {{THRESHOLD}}`  
**Seuil recommandé : ** {{THRESHOLD}} (intégré dans la requête)  
**Justification du seuil : ** défini en fonction du taux de croissance du stockage et de la taille provisionnée.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 300  
**Période de récupération : ** 300

**MaximumUsedTransactionIDs**  
**Étiquettes : ** DBInstanceIdentifier  
**Description de l'**alarme : Alarme lorsque le nombre maximum d'ID de transaction utilisés dépasse 1 milliard pour une instance RDS.  
**Objectif : ** empêcher le contournement de l'ID de transaction PostgreSQL.  
**Critères ProMQL : ** `avg({__name__="MaximumUsedTransactionIDs", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > 1000000000`  
**Seuil recommandé : ** 1000000000 (intégré dans la requête)  
**Justification du seuil : ** 1 milliard indique qu'un danger global approche.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 60  
**Période de récupération : ** 60

**ReadLatency**  
**Étiquettes : ** DBInstanceIdentifier  
**Description de l'**alarme : Alarme lorsque la latence de lecture de p90 dépasse le seuil d'une instance RDS.  
**Objectif : ** détecter une latence de lecture élevée indiquant des problèmes de disque.  
**Critères ProMQL : ** `histogram_quantile(0.9, {__name__="ReadLatency", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > {{THRESHOLD}}`  
**Seuil recommandé : ** {{THRESHOLD}} (intégré dans la requête)  
**Justification du seuil : ** défini en fonction de la latence acceptable de l'application.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 300  
**Période de récupération : ** 300

**ReplicaLag**  
**Étiquettes : ** DBInstanceIdentifier  
**Description de l'**alarme : Alarme lorsque le délai de réplication dépasse 60 secondes pour une réplique en lecture RDS.  
**Objectif : ** détecter les retards de réplication risquant de perdre des données.  
**Critères ProMQL : ** `max({__name__="ReplicaLag", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > 60`  
**Seuil recommandé : ** 60 (intégré dans la requête)  
**Justification du seuil : ** 60 secondes représentent un décalage significatif pour la plupart des charges de travail.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 600  
**Période de récupération : ** 600

**WriteLatency**  
**Étiquettes : ** DBInstanceIdentifier  
**Description de l'**alarme : Alarme lorsque la latence d'écriture de p90 dépasse le seuil d'une instance RDS.  
**Objectif : ** détecter une latence d'écriture élevée indiquant des problèmes de disque.  
**Critères ProMQL : ** `histogram_quantile(0.9, {__name__="WriteLatency", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > {{THRESHOLD}}`  
**Seuil recommandé : ** {{THRESHOLD}} (intégré dans la requête)  
**Justification du seuil : ** défini en fonction de la latence acceptable de l'application.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 300  
**Période de récupération : ** 300

**DBLoad**  
**Étiquettes : ** DBInstanceIdentifier  
**Description de l'**alarme : alarme lorsque la charge moyenne de la base de données dépasse le seuil d'une instance RDS.  
**Objectif : ** détecter une charge de base de données élevée qui dégrade les performances.  
**Critères ProMQL : ** `avg({__name__="DBLoad", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > {{THRESHOLD}}`  
**Seuil recommandé : ** {{THRESHOLD}} (intégré dans la requête)  
**Justification du seuil : ** défini sur un multiple du nombre de processeurs virtuels.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 900  
**Période de récupération : ** 900

**AuroraVolumeBytesLeftTotal**  
**Étiquettes : ** DBClusterIdentifier  
**Description de l'**alarme : Alarme lorsque le nombre d'octets de stockage restants dans le cluster Aurora tombe en dessous du seuil.  
**Objectif : ** empêcher l'épuisement de l'espace de stockage du cluster Aurora.  
**Critères ProMQL : ** `avg({__name__="AuroraVolumeBytesLeftTotal", "@instrumentation.@name"="cloudwatch.aws/rds", DBClusterIdentifier="CLUSTER"}) < {{THRESHOLD}}`  
**Seuil recommandé : ** {{THRESHOLD}} (intégré dans la requête)  
**Justification du seuil : ** défini en fonction du taux de croissance.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 300  
**Période de récupération : ** 300

**AuroraBinlogReplicaLag**  
**Étiquettes : ** DBClusterIdentifier  
**Description de l'**alarme : Alarme lorsque le décalage de la réplication du binlog Aurora indique un état d'erreur.  
**Objectif : ** détecter les erreurs de réplication des instances de rédaction.  
**Critères ProMQL : ** `avg({__name__="AuroraBinlogReplicaLag", "@instrumentation.@name"="cloudwatch.aws/rds", DBClusterIdentifier="CLUSTER"}) <= -1`  
**Seuil recommandé : ** -1 (intégré dans la requête)  
**Justification du seuil : ** -1 indique l'état d'erreur.  
**Intervalle d'évaluation : ** 60  
**Période en attente : ** 120  
**Période de récupération : ** 120

**BlockedTransactions**  
**Étiquettes : ** DBInstanceIdentifier  
**Description de l'**alarme : Alarme lorsque le nombre de transactions bloquées dépasse le seuil d'une instance RDS.  
**Objectif : ** détecter le blocage des transactions entraînant une dégradation des performances.  
**Critères ProMQL : ** `avg({__name__="BlockedTransactions", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > {{THRESHOLD}}`  
**Seuil recommandé : ** {{THRESHOLD}} (intégré dans la requête)  
**Justification du seuil : ** défini en fonction du nombre de transactions bloquées acceptable.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 300  
**Période de récupération : ** 300

**BufferCacheHitRatio**  
**Étiquettes : ** DBInstanceIdentifier  
**Description de l'**alarme : Alarme lorsque le taux d'accès au cache de la mémoire tampon tombe en dessous de 80 % pour une instance RDS.  
**Objectif : ** détecter une faible efficacité du cache entraînant une baisse des performances.  
**Critères ProMQL : ** `avg({__name__="BufferCacheHitRatio", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) < 80`  
**Seuil recommandé : ** 80 (intégré dans la requête)  
**Justification du seuil : une valeur ** inférieure à 80 % indique une quantité excessive de disque I/O.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 600  
**Période de récupération : ** 600

**EngineUptime**  
**Étiquettes : ** DBClusterIdentifier  
**Description de l'**alarme : Alarme lorsque le temps de fonctionnement du moteur tombe à zéro, indiquant le redémarrage d'un enregistreur Aurora.  
**Objectif : ** détecter les temps d'arrêt ou les pannes de l'instance Aurora Writer.  
**Critères ProMQL : ** `avg({__name__="EngineUptime", "@instrumentation.@name"="cloudwatch.aws/rds", DBClusterIdentifier="CLUSTER"}) <= 0`  
**Seuil recommandé : ** 0 (intégré dans la requête)  
**Justification du seuil : une disponibilité ** nulle indique un redémarrage de l'instance.  
**Intervalle d'évaluation : ** 60  
**Période en attente : ** 120  
**Période de récupération : ** 120

**RollbackSegmentHistoryListLength**  
**Étiquettes : ** DBInstanceIdentifier  
**Description de l'**alarme : Alarme lorsque la longueur de la liste de l'historique des segments d'annulation dépasse 1 million pour une instance Aurora.  
**Objectif : ** détecter un historique de restauration élevé à l'origine de la dégradation du processeur.  
**Critères ProMQL : ** `avg({__name__="RollbackSegmentHistoryListLength", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > 1000000`  
**Seuil recommandé : ** 1000000 (intégré dans la requête)  
**Justification du seuil : un seuil ** supérieur à 1 million entraîne des problèmes de performances.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 300  
**Période de récupération : ** 300

**StorageNetworkThroughput**  
**Étiquettes : ** DBClusterIdentifier  
**Description de l'**alarme : Alarme lorsque le débit du réseau de stockage dépasse le seuil d'un cluster Aurora.  
**Objectif : ** détecter les pertes de paquets réseau présentant un risque de perte de paquets sur le haut débit.  
**Critères ProMQL : ** `avg({__name__="StorageNetworkThroughput", "@instrumentation.@name"="cloudwatch.aws/rds", DBClusterIdentifier="CLUSTER"}) > {{THRESHOLD}}`  
**Seuil recommandé : ** {{THRESHOLD}} (intégré dans la requête)  
**Justification du seuil : ** défini en fonction de la capacité du réseau d'instances.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 300  
**Période de récupération : ** 300

## Route 53
<a name="Recommended_PromQL_Route53"></a>

**HealthCheckStatus**  
**Étiquettes : ** HealthCheckId  
**Description de l'**alarme : Alarme lorsqu'un bilan de santé de la Route 53 signale un terminal défectueux.  
**Objectif : ** Détectez les terminaux défectueux à l'aide des vérificateurs de santé Route 53.  
**Critères ProMQL : ** `avg({__name__="HealthCheckStatus", "@instrumentation.@name"="cloudwatch.aws/route53", HealthCheckId="HC"}) < 1`  
**Seuil recommandé : ** 1 (intégré dans la requête)  
**Justification du seuil : un seuil ** inférieur à 1 indique que le terminal échoue aux tests de santé.  
**Intervalle d'évaluation : ** 60  
**Période en attente : ** 180  
**Période de récupération : ** 180

## S3
<a name="Recommended_PromQL_S3"></a>

**4xxErrors**  
**Étiquettes : **BucketName, FilterId  
**Description de l'**alarme : Alarme lorsque le taux d'erreur 4xx dépasse 5 % pour un compartiment S3.  
**Objectif : ** détecter les taux d'erreur anormaux des clients.  
**Critères ProMQL : ** `avg({__name__="4xxErrors", "@instrumentation.@name"="cloudwatch.aws/s3", BucketName="BUCKET",FilterId="FILTER"}) > 0.05`  
**Seuil recommandé : ** 0,05 (intégré dans la requête)  
**Justification du seuil : un seuil ** supérieur à 5 % indique des problèmes de configuration ou d'accès.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 900  
**Période de récupération : ** 900

**5xxErrors**  
**Étiquettes : **BucketName, FilterId  
**Description de l'**alarme : Alarme lorsque le taux d'erreur 5xx dépasse 5 % pour un compartiment S3.  
**Objectif : ** détecter les erreurs côté serveur affectant l'application.  
**Critères ProMQL : ** `avg({__name__="5xxErrors", "@instrumentation.@name"="cloudwatch.aws/s3", BucketName="BUCKET",FilterId="FILTER"}) > 0.05`  
**Seuil recommandé : ** 0,05 (intégré dans la requête)  
**Justification du seuil : une valeur ** supérieure à 5 % indique des problèmes de service S3.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 900  
**Période de récupération : ** 900

**OperationsFailedReplication**  
**Étiquettes : **SourceBucket, DestinationBucket, RuleId  
**Description de l'**alarme : Alarme lorsque les opérations de réplication S3 échouent pour un bucket.  
**Objectif : ** détecter les échecs de réplication risquant d'entraîner des incohérences dans les données.  
**Critères ProMQL : ** `max({__name__="OperationsFailedReplication", "@instrumentation.@name"="cloudwatch.aws/s3", SourceBucket="SRC",DestinationBucket="DST",RuleId="RULE"}) > 0`  
**Seuil recommandé : ** 0 (intégré dans la requête)  
**Justification du seuil : ** tout échec de réplication doit faire l'objet d'une enquête.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 300  
**Période de récupération : ** 300

## S3 Object Lambda
<a name="Recommended_PromQL_S3ObjectLambda"></a>

**4xxErrors**  
**Libellés : **AccessPointName, DataSource ARN  
**Description de l'**alarme : Alarme lorsque le taux d'erreur 4xx dépasse 5 % pour un point d'accès S3 Object Lambda.  
**Objectif : ** détecter des taux d'erreur client anormaux pour Object Lambda.  
**Critères ProMQL : ** `avg({__name__="4xxErrors", "@instrumentation.@name"="cloudwatch.aws/s3objectlambda", AccessPointName="AP",DataSourceARN="ARN"}) > 0.05`  
**Seuil recommandé : ** 0,05 (intégré dans la requête)  
**Justification du seuil : un seuil ** supérieur à 5 % indique des problèmes de configuration.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 900  
**Période de récupération : ** 900

**5xxErrors**  
**Libellés : **AccessPointName, DataSource ARN  
**Description de l'**alarme : Alarme lorsque le taux d'erreur 5xx dépasse 5 % pour un point d'accès S3 Object Lambda.  
**Objectif : ** détecter les erreurs côté serveur dans Object Lambda.  
**Critères ProMQL : ** `avg({__name__="5xxErrors", "@instrumentation.@name"="cloudwatch.aws/s3objectlambda", AccessPointName="AP",DataSourceARN="ARN"}) > 0.05`  
**Seuil recommandé : ** 0,05 (intégré dans la requête)  
**Justification du seuil : un seuil ** supérieur à 5 % indique des problèmes Lambda ou S3.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 900  
**Période de récupération : ** 900

**LambdaResponse4xx**  
**Libellés : **AccessPointName, DataSource ARN  
**Description de l'**alarme : Alarme lorsque le taux de réponse de la fonction Lambda 4xx dépasse 5 % pour un point d'accès S3 Object Lambda.  
**Objectif : ** détecter les erreurs du client de la fonction Lambda.  
**Critères ProMQL : ** `avg({__name__="LambdaResponse4xx", "@instrumentation.@name"="cloudwatch.aws/s3objectlambda", AccessPointName="AP",DataSourceARN="ARN"}) > 0.05`  
**Seuil recommandé : ** 0,05 (intégré dans la requête)  
**Justification du seuil : un seuil ** supérieur à 5 % indique des problèmes liés à la fonction Lambda.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 900  
**Période de récupération : ** 900

## SNS
<a name="Recommended_PromQL_SNS"></a>

**NumberOfMessagesPublished**  
**Étiquettes : ** TopicName  
**Description de l'**alarme : Alarme lorsque le nombre de messages publiés tombe en dessous du seuil d'une rubrique SNS.  
**Objectif : ** détecter une baisse significative du volume de publication.  
**Critères ProMQL : ** `sum({__name__="NumberOfMessagesPublished", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) < {{THRESHOLD}}`  
**Seuil recommandé : ** {{THRESHOLD}} (intégré dans la requête)  
**Justification du seuil : ** défini en fonction du trafic minimum attendu.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 300  
**Période de récupération : ** 300

**NumberOfNotificationsDelivered**  
**Étiquettes : ** TopicName  
**Description de l'**alarme : Alarme lorsque le nombre de notifications envoyées tombe en dessous du seuil d'une rubrique SNS.  
**Objectif : ** détecter la baisse du volume de notifications envoyées.  
**Critères ProMQL : ** `sum({__name__="NumberOfNotificationsDelivered", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) < {{THRESHOLD}}`  
**Seuil recommandé : ** {{THRESHOLD}} (intégré dans la requête)  
**Justification du seuil : ** défini en fonction du nombre minimum de livraisons attendues.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 300  
**Période de récupération : ** 300

**NumberOfNotificationsFailed**  
**Étiquettes : ** TopicName  
**Description de l'**alarme : Alarme lorsque le nombre d'échecs de transmission de notifications dépasse le seuil d'une rubrique SNS.  
**Objectif : ** détecter les échecs de livraison.  
**Critères ProMQL : ** `sum({__name__="NumberOfNotificationsFailed", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) > {{THRESHOLD}}`  
**Seuil recommandé : ** {{THRESHOLD}} (intégré dans la requête)  
**Justification du seuil : ** défini en fonction d'un taux d'échec acceptable.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 300  
**Période de récupération : ** 300

**NumberOfNotificationsFilteredOut-InvalidAttributes**  
**Étiquettes : ** TopicName  
**Description de l'**alarme : Alarme lorsque les notifications sont filtrées en raison d'attributs de message non valides.  
**Objectif : ** détecter les attributs de message non valides.  
**Critères ProMQL : ** `sum({__name__="NumberOfNotificationsFilteredOut-InvalidAttributes", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) > 0`  
**Seuil recommandé : ** 0 (intégré dans la requête)  
**Justification du seuil : ** tout filtre non valide indique une mauvaise configuration.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 300  
**Période de récupération : ** 300

**NumberOfNotificationsFilteredOut-InvalidMessageBody**  
**Étiquettes : ** TopicName  
**Description de l'**alarme : Alarme lorsque les notifications sont filtrées en raison de corps de message non valides.  
**Objectif : ** détecter les corps de message non valides.  
**Critères ProMQL : ** `sum({__name__="NumberOfNotificationsFilteredOut-InvalidMessageBody", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) > 0`  
**Seuil recommandé : ** 0 (intégré dans la requête)  
**Justification du seuil : ** tout filtre non valide indique une mauvaise configuration.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 300  
**Période de récupération : ** 300

**NumberOfNotificationsRedrivenToDlq**  
**Étiquettes : ** TopicName  
**Description de l'**alarme : Alarme lorsque des notifications sont envoyées à la file d'attente des lettres mortes pour une rubrique SNS.  
**Objectif : ** détecter les messages envoyés à la file d'attente des lettres mortes.  
**Critères ProMQL : ** `sum({__name__="NumberOfNotificationsRedrivenToDlq", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) > 0`  
**Seuil recommandé : ** 0 (intégré dans la requête)  
**Justification du seuil : ** tout message DLQ indique des problèmes de livraison.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 300  
**Période de récupération : ** 300

**NumberOfNotificationsFailedToRedriveToDlq**  
**Étiquettes : ** TopicName  
**Description de l'**alarme : Alarme lorsque les notifications ne sont pas envoyées à la file d'attente des lettres mortes pour une rubrique SNS.  
**Objectif : ** détecter les échecs de distribution du DLQ.  
**Critères ProMQL : ** `sum({__name__="NumberOfNotificationsFailedToRedriveToDlq", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) > 0`  
**Seuil recommandé : ** 0 (intégré dans la requête)  
**Justification du seuil : l'**échec du DLQ signifie la perte du suivi des erreurs.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 300  
**Période de récupération : ** 300

**SMSMonthToDateSpentUSD**  
**Étiquettes : ** TopicName  
**Description de l'**alarme : Alarme lorsque les dépenses en SMS approchent le quota du compte pour une rubrique SNS.  
**Objectif : ** détecter les dépenses liées aux SMS qui approchent du quota.  
**Critères ProMQL : ** `max({__name__="SMSMonthToDateSpentUSD", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) > {{THRESHOLD}}`  
**Seuil recommandé : ** {{THRESHOLD}} (intégré dans la requête)  
**Justification du seuil : ** défini en fonction du quota de SMS du compte.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 300  
**Période de récupération : ** 300

**SMSSuccessRate**  
**Étiquettes : ** TopicName  
**Description de l'**alarme : alarme lorsque le taux de réussite de l'envoi de SMS tombe en dessous du seuil d'une rubrique SNS.  
**Objectif : ** détecter les échecs d'envoi de SMS.  
**Critères ProMQL : ** `avg({__name__="SMSSuccessRate", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) < {{THRESHOLD}}`  
**Seuil recommandé : ** {{THRESHOLD}} (intégré dans la requête)  
**Justification du seuil : ** défini en fonction d'un taux de livraison acceptable.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 300  
**Période de récupération : ** 300

## SQS
<a name="Recommended_PromQL_SQS"></a>

**ApproximateAgeOfOldestMessage**  
**Étiquettes : ** QueueName  
**Description de l'**alarme : alarme lorsque l'âge du message le plus ancien dépasse le seuil d'une file d'attente SQS.  
**Objectif : ** détecter les messages qui ne sont pas traités assez rapidement.  
**Critères ProMQL : ** `max({__name__="ApproximateAgeOfOldestMessage", "@instrumentation.@name"="cloudwatch.aws/sqs", QueueName="QUEUE"}) > {{THRESHOLD}}`  
**Seuil recommandé : ** {{THRESHOLD}} (intégré dans la requête)  
**Justification du seuil : ** défini en fonction du temps de traitement des messages acceptable.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 900  
**Période de récupération : ** 900

**ApproximateNumberOfMessagesNotVisible**  
**Étiquettes : ** QueueName  
**Description de l'**alarme : Alarme lorsque le nombre de messages en vol dépasse le seuil d'une file d'attente SQS.  
**Objectif : ** détecter les nombreux messages en vol indiquant des problèmes rencontrés par les consommateurs.  
**Critères ProMQL : ** `avg({__name__="ApproximateNumberOfMessagesNotVisible", "@instrumentation.@name"="cloudwatch.aws/sqs", QueueName="QUEUE"}) > {{THRESHOLD}}`  
**Seuil recommandé : ** {{THRESHOLD}} (intégré dans la requête)  
**Justification du seuil : ** défini en fonction du volume de traitement attendu.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 900  
**Période de récupération : ** 900

**ApproximateNumberOfMessagesVisible**  
**Étiquettes : ** QueueName  
**Description de l'**alarme : Alarme lorsque le nombre de messages visibles dépasse le seuil d'une file SQS.  
**Objectif : ** détecter l'arriéré de messages indiquant la lenteur des consommateurs.  
**Critères ProMQL : ** `avg({__name__="ApproximateNumberOfMessagesVisible", "@instrumentation.@name"="cloudwatch.aws/sqs", QueueName="QUEUE"}) > {{THRESHOLD}}`  
**Seuil recommandé : ** {{THRESHOLD}} (intégré dans la requête)  
**Justification du seuil : ** défini en fonction de la profondeur de file d'attente attendue.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 900  
**Période de récupération : ** 900

**NumberOfMessagesSent**  
**Étiquettes : ** QueueName  
**Description de l'**alarme : Alarme lorsqu'aucun message n'est envoyé à une file d'attente SQS.  
**Objectif : ** détecter que les producteurs ont cessé d'envoyer des messages.  
**Critères ProMQL : ** `sum({__name__="NumberOfMessagesSent", "@instrumentation.@name"="cloudwatch.aws/sqs", QueueName="QUEUE"}) <= 0`  
**Seuil recommandé : ** 0 (intégré dans la requête)  
**Justification du seuil : ** aucun message n'indique une défaillance du producteur.  
**Intervalle d'évaluation : ** 60  
**Période d'attente : ** 900  
**Période de récupération : ** 900

## VPN
<a name="Recommended_PromQL_VPN"></a>

**TunnelState (niveau VPN) **  
**Étiquettes : ** VpnId  
**Description de l'**alarme : Alarme lorsqu'au moins un tunnel VPN est en état d'arrêt.  
**Objectif : ** détecter au moins un tunnel en état DOWN.  
**Critères ProMQL : ** `min({__name__="TunnelState", "@instrumentation.@name"="cloudwatch.aws/vpn", VpnId="VPN"}) < 1`  
**Seuil recommandé : ** 1 (intégré dans la requête)  
**Justification du seuil : un seuil ** inférieur à 1 signifie que le tunnel est en panne.  
**Intervalle d'évaluation : ** 300  
**Période d'attente : ** 900  
**Période de récupération : ** 900

**TunnelState (niveau du tunnel) **  
**Étiquettes : ** TunnelIpAddress  
**Description de l'**alarme : Alarme lorsqu'un tunnel VPN spécifique est en état d'arrêt.  
**Objectif : ** détecter un tunnel spécifique en état DOWN.  
**Critères ProMQL : ** `min({__name__="TunnelState", "@instrumentation.@name"="cloudwatch.aws/vpn", TunnelIpAddress="IP"}) < 1`  
**Seuil recommandé : ** 1 (intégré dans la requête)  
**Justification du seuil : un seuil ** inférieur à 1 signifie que le tunnel est en panne.  
**Intervalle d'évaluation : ** 300  
**Période d'attente : ** 900  
**Période de récupération : ** 900