

# Alarmas de PromQL recomendadas
<a name="Recommended_PromQL_Alarms"></a>

Utilice estas alarmas de PromQL como equivalentes de las alarmas clásicas recomendadas. Supervisan las mismas métricas mediante consultas instantáneas de PromQL que se evalúan con respecto a las métricas ingeridas mediante el punto de conexión OTLP de CloudWatch.

Las alarmas de PromQL utilizan `EvaluationCriteria` con `PromQLCriteria`. A diferencia de las alarmas de métricas clásicas, el valor límite se incorpora directamente en la expresión de consulta de PromQL.
+ **Periodo pendiente**: duración, en segundos, durante la cual una serie de tiempo debe superar continuamente el valor límite antes de que la alarma pase al estado ALARM.
+ **Periodo de recuperación**: duración, en segundos, durante la cual todas las series de tiempo deben dejar de superar el valor límite antes de que la alarma vuelva al estado OK.
+ **Intervalo de evaluación**: frecuencia, en segundos, con la que CloudWatch ejecuta la consulta de PromQL.

**nota**  
Estas alarmas requieren métricas publicadas mediante el punto de conexión OTLP de CloudWatch. Para obtener más información, consulte [Alarmas PromQL](alarm-promql.md).

Puede implementar estas alarmas mediante AWS CloudFormation. Utilice las propiedades `EvaluationCriteria` y `PromQLCriteria` en el recurso `AWS::CloudWatch::Alarm`.

**Topics**
+ [API Gateway](#Recommended_PromQL_ApiGateway)
+ [escalado automático](#Recommended_PromQL_AutoScaling)
+ [Certificate Manager](#Recommended_PromQL_CertificateManager)
+ [CloudFront](#Recommended_PromQL_CloudFront)
+ [Cognito](#Recommended_PromQL_Cognito)
+ [DynamoDB](#Recommended_PromQL_DynamoDB)
+ [EBS](#Recommended_PromQL_EBS)
+ [Amazon Elastic Compute Cloud](#Recommended_PromQL_EC2)
+ [Amazon ECS](#Recommended_PromQL_ECS)
+ [Información de contenedores de Amazon ECS](#Recommended_PromQL_ECS_ContainerInsights)
+ [Observabilidad mejorada de Información de contenedores de Amazon ECS](#Recommended_PromQL_ECS_ContainerInsights_Enhanced)
+ [Amazon EFS](#Recommended_PromQL_EFS)
+ [Información de contenedores de Amazon EKS](#Recommended_PromQL_EKS)
+ [Amazon ElastiCache](#Recommended_PromQL_ElastiCache)
+ [GPU elásticas](#Recommended_PromQL_ElasticGPUs)
+ [Programador de Amazon EventBridge](#Recommended_PromQL_Scheduler)
+ [Amazon Kinesis Data Streams](#Recommended_PromQL_Kinesis)
+ [AWS Lambda](#Recommended_PromQL_Lambda)
+ [AWS LambdaConocimientos en](#Recommended_PromQL_LambdaInsights)
+ [Puerta de enlace NAT](#Recommended_PromQL_NATGateway)
+ [Puntos de conexión de AWS PrivateLink](#Recommended_PromQL_PrivateLinkEndpoints)
+ [Servicios de AWS PrivateLink](#Recommended_PromQL_PrivateLinkServices)
+ [RDS](#Recommended_PromQL_RDS)
+ [Route 53](#Recommended_PromQL_Route53)
+ [S3](#Recommended_PromQL_S3)
+ [S3 Object Lambda](#Recommended_PromQL_S3ObjectLambda)
+ [SNS](#Recommended_PromQL_SNS)
+ [SQS](#Recommended_PromQL_SQS)
+ [VPN](#Recommended_PromQL_VPN)

## API Gateway
<a name="Recommended_PromQL_ApiGateway"></a>

**API de REST**

**4XXError**  
**Etiquetas:** ApiName, Stage  
**Descripción de la alarma: **alarma que se activa cuando la tasa promedio de errores 4XX supera el 5 % en una etapa de una API de REST.  
**Objetivo: **detectar una tasa alta de errores del cliente que indique problemas con las solicitudes.  
**Criterios de PromQL: **`avg({__name__="4XXError", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiName="{{your-api-name}}",Stage="{{your-stage}}"}) > 0.05`  
**Valor límite recomendado: **0,05 (incrustado en la consulta)  
**Justificación del valor límite: **detecta una tasa de errores del cliente superior al 5 %, lo que indica errores significativos en las solicitudes.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **300  
**Periodo de recuperación: **300

**5XXError**  
**Etiquetas:** ApiName, Stage  
**Descripción de la alarma: **alarma que se activa cuando la tasa promedio de errores 5XX supera el 5 % en una etapa de una API de REST.  
**Objetivo: **detectar una tasa alta de errores del servidor que indique fallos del backend.  
**Criterios de PromQL: **`avg({__name__="5XXError", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiName="{{your-api-name}}",Stage="{{your-stage}}"}) > 0.05`  
**Valor límite recomendado: **0,05 (incrustado en la consulta)  
**Justificación del valor límite: **detecta una tasa de errores del servidor superior al 5 %, lo que requiere una investigación inmediata.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **180  
**Periodo de recuperación: **300

**Latencia**  
**Etiquetas:** ApiName, Stage  
**Descripción de la alarma: **alarma que se activa cuando la latencia p90 supera los 2500 ms en una etapa de una API de REST.  
**Objetivo: **detectar una latencia p90 alta que afecte a la experiencia del usuario.  
**Criterios de PromQL: **`histogram_quantile(0.9, {__name__="Latency", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiName="{{your-api-name}}",Stage="{{your-stage}}"}) > 2500`  
**Valor límite recomendado: **2500 (incrustado en la consulta)  
**Justificación del valor límite: **una latencia p90 superior a 2500 ms indica tiempos de respuesta deficientes para la mayoría de las solicitudes.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **300  
**Periodo de recuperación: **300

**recuento**  
**Etiquetas:** ApiName, Stage  
**Descripción de la alarma: **alarma que se activa cuando el recuento total de solicitudes cae por debajo del valor de referencia esperado para una etapa de una API de REST.  
**Objetivo: **detectar un volumen bajo de tráfico que podría indicar problemas de enrutamiento o disponibilidad.  
**Criterios de PromQL: **`sum({__name__="Count", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiName="{{your-api-name}}",Stage="{{your-stage}}"}) < {{THRESHOLD}}`  
**Valor límite recomendado: **{{THRESHOLD}} (incrustado en la consulta)  
**Justificación del valor límite: **dstablézcalo según el valor de referencia de tráfico esperado para detectar disminuciones inesperadas.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **600  
**Periodo de recuperación: **300

**API HTTP**

**4XX**  
**Etiquetas: **ApiId, Stage  
**Descripción de la alarma: **alarma que se activa cuando la tasa promedio de errores 4xx supera el 5 % en una etapa de una API HTTP.  
**Objetivo: **detectar una tasa alta de errores del cliente en los puntos de conexión de la API HTTP.  
**Criterios de PromQL: **`avg({__name__="4xx", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="{{your-api-id}}",Stage="{{your-stage}}"}) > 0.05`  
**Valor límite recomendado: **0,05 (incrustado en la consulta)  
**Justificación del valor límite: **detecta una tasa de errores del cliente superior al 5 %.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **300  
**Periodo de recuperación: **300

**5xx**  
**Etiquetas: **ApiId, Stage  
**Descripción de la alarma: **alarma que se activa cuando la tasa promedio de errores 5xx supera el 5 % en una etapa de una API HTTP.  
**Objetivo: **detectar una tasa alta de errores del servidor en los puntos de conexión de la API HTTP.  
**Criterios de PromQL: **`avg({__name__="5xx", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="{{your-api-id}}",Stage="{{your-stage}}"}) > 0.05`  
**Valor límite recomendado: **0,05 (incrustado en la consulta)  
**Justificación del valor límite: **detecta una tasa de errores del servidor superior al 5 %, lo que requiere una investigación.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **180  
**Periodo de recuperación: **300

**Latencia**  
**Etiquetas: **ApiId, Stage  
**Descripción de la alarma: **alarma que se activa cuando la latencia p90 supera los 2500 ms en una etapa de una API HTTP.  
**Objetivo: **detectar una latencia p90 alta en los puntos de conexión de la API HTTP.  
**Criterios de PromQL: **`histogram_quantile(0.9, {__name__="Latency", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="{{your-api-id}}",Stage="{{your-stage}}"}) > 2500`  
**Valor límite recomendado: **2500 (incrustado en la consulta)  
**Justificación del valor límite: **una latencia p90 superior a 2500 ms indica tiempos de respuesta deficientes.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **300  
**Periodo de recuperación: **300

**IntegrationLatency**  
**Etiquetas: **ApiId, Stage  
**Descripción de la alarma: **alarma que se activa cuando la latencia de integración p90 supera los 2000 ms en una etapa de una API HTTP.  
**Objetivo: **detectar una latencia alta en la integración con el backend que afecte a los tiempos de respuesta.  
**Criterios de PromQL: **`histogram_quantile(0.9, {__name__="IntegrationLatency", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="{{your-api-id}}",Stage="{{your-stage}}"}) > 2000`  
**Valor límite recomendado: **2000 (incrustado en la consulta)  
**Justificación del valor límite: **una latencia de integración p90 superior a 2000 ms indica lentitud en el backend.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **300  
**Periodo de recuperación: **300

**recuento**  
**Etiquetas: **ApiId, Stage  
**Descripción de la alarma: **alarma que se activa cuando el recuento total de solicitudes cae por debajo del valor de referencia esperado para una etapa de una API HTTP.  
**Objetivo: **detectar un volumen bajo de tráfico que podría indicar problemas de enrutamiento o disponibilidad.  
**Criterios de PromQL: **`sum({__name__="Count", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="{{your-api-id}}",Stage="{{your-stage}}"}) < {{THRESHOLD}}`  
**Valor límite recomendado: **{{THRESHOLD}} (incrustado en la consulta)  
**Justificación del valor límite: **dstablézcalo según el valor de referencia de tráfico esperado para detectar disminuciones inesperadas.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **600  
**Periodo de recuperación: **300

**API de WebSocket**

**ClientError**  
**Etiquetas: **ApiId, Stage  
**Descripción de la alarma: **alarma que se activa cuando la tasa promedio de errores del cliente supera el 5 % en una etapa de una API de WebSocket.  
**Objetivo: **detectar una tasa alta de errores del cliente en las conexiones de la API de WebSocket.  
**Criterios de PromQL: **`avg({__name__="ClientError", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="{{your-api-id}}",Stage="{{your-stage}}"}) > 0.05`  
**Valor límite recomendado: **0,05 (incrustado en la consulta)  
**Justificación del valor límite: **detecta una tasa de errores del cliente superior al 5 % en las conexiones de WebSocket.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **300  
**Periodo de recuperación: **300

**ExecutionError**  
**Etiquetas: **ApiId, Stage  
**Descripción de la alarma: **alarma que se activa cuando la tasa promedio de errores de ejecución supera el 5 % en una etapa de una API de WebSocket.  
**Objetivo: **detectar una tasa alta de errores de ejecución del servidor en las API de WebSocket.  
**Criterios de PromQL: **`avg({__name__="ExecutionError", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="{{your-api-id}}",Stage="{{your-stage}}"}) > 0.05`  
**Valor límite recomendado: **0,05 (incrustado en la consulta)  
**Justificación del valor límite: **detecta una tasa de errores de ejecución superior al 5 %, lo que requiere una investigación.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **180  
**Periodo de recuperación: **300

**IntegrationLatency**  
**Etiquetas: **ApiId, Stage  
**Descripción de la alarma: **alarma que se activa cuando la latencia de integración p90 supera los 2000 ms en una etapa de una API de WebSocket.  
**Objetivo: **detectar una latencia alta en la integración con el backend en las rutas de la API de WebSocket.  
**Criterios de PromQL: **`histogram_quantile(0.9, {__name__="IntegrationLatency", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="{{your-api-id}}",Stage="{{your-stage}}"}) > 2000`  
**Valor límite recomendado: **2000 (incrustado en la consulta)  
**Justificación del valor límite: **una latencia de integración p90 superior a 2000 ms indica lentitud en el backend.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **300  
**Periodo de recuperación: **300

**MessageCount**  
**Etiquetas: **ApiId, Stage  
**Descripción de la alarma: **alarma que se activa cuando el recuento total de mensajes cae por debajo del valor de referencia esperado para una etapa de una API de WebSocket.  
**Objetivo: **detectar un volumen bajo de mensajes que podría indicar problemas de conexión o enrutamiento.  
**Criterios de PromQL: **`sum({__name__="MessageCount", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="{{your-api-id}}",Stage="{{your-stage}}"}) < {{THRESHOLD}}`  
**Valor límite recomendado: **{{THRESHOLD}} (incrustado en la consulta)  
**Justificación del valor límite: **se establece según el volumen de mensajes esperado para detectar disminuciones inesperadas.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **600  
**Periodo de recuperación: **300

## escalado automático
<a name="Recommended_PromQL_AutoScaling"></a>

**GroupInServiceCapacity**  
**Etiquetas: **AutoScalingGroupName  
**Descripción de la alarma: **alarma que se activa cuando la capacidad promedio en servicio cae por debajo del mínimo esperado para un grupo de escalado automático.  
**Objetivo: **detectar una disponibilidad baja debido a errores de lanzamiento o instancias terminadas.  
**Criterios de PromQL: **`avg({__name__="GroupInServiceCapacity", "@instrumentation.@name"="cloudwatch.aws/autoscaling", AutoScalingGroupName="{{your-auto-scaling-group-name}}"}) < {{THRESHOLD}}`  
**Valor límite recomendado: **{{THRESHOLD}} (incrustado en la consulta)  
**Justificación del valor límite: **se establece según la capacidad mínima deseada para detectar errores de lanzamiento o un número insuficiente de instancias.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **600  
**Periodo de recuperación: **600

## Certificate Manager
<a name="Recommended_PromQL_CertificateManager"></a>

**DaysToExpiry**  
**Etiquetas: **CertificateArn  
**Descripción de la alarma: **alarma que se activa cuando el número mínimo de días hasta el vencimiento del certificado disminuye a 44 días o menos.  
**Objetivo: **generar una alerta proactiva sobre el vencimiento del certificado para disponer de tiempo suficiente para renovarlo.  
**Criterios de PromQL: **`min({__name__="DaysToExpiry", "@instrumentation.@name"="cloudwatch.aws/certificatemanager", CertificateArn="{{your-certificate-arn}}"}) <= 44`  
**Valor límite recomendado: **44 (incrustado en la consulta)  
**Justificación del valor límite: **proporciona un margen suficiente antes del vencimiento del certificado para completar el proceso de renovación.  
**Intervalo de evaluación: **86400  
**Periodo pendiente: **86400  
**Periodo de recuperación: **86400

## CloudFront
<a name="Recommended_PromQL_CloudFront"></a>

**5xxErrorRate**  
**Etiquetas: **DistributionId  
**Descripción de la alarma: **alarma que se activa cuando la tasa promedio de errores 5xx supera el valor límite en una distribución de CloudFront.  
**Objetivo: **detectar una tasa alta de errores del origen o de CloudFront que afecte a la entrega de contenido.  
**Criterios de PromQL: **`avg({__name__="5xxErrorRate", "@instrumentation.@name"="cloudwatch.aws/cloudfront", DistributionId="{{your-distribution-id}}"}) > {{THRESHOLD}}`  
**Valor límite recomendado: **{{THRESHOLD}} (incrustado en la consulta)  
**Justificación del valor límite: **se establece según la tasa de errores aceptable para la entrega de contenido.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **300  
**Periodo de recuperación: **300

**OriginLatency**  
**Etiquetas: **DistributionId  
**Descripción de la alarma: **alarma que se activa cuando la latencia p90 del origen supera el valor límite en una distribución de CloudFront.  
**Objetivo: **detectar una latencia alta de respuesta del origen que afecte al rendimiento de la entrega de contenido.  
**Criterios de PromQL: **`histogram_quantile(0.9, {__name__="OriginLatency", "@instrumentation.@name"="cloudwatch.aws/cloudfront", DistributionId="{{your-distribution-id}}"}) > {{THRESHOLD}}`  
**Valor límite recomendado: **{{THRESHOLD}} (incrustado en la consulta)  
**Justificación del valor límite: **se establece según el tiempo de respuesta esperado del origen y la estrategia de almacenamiento en caché.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **300  
**Periodo de recuperación: **300

**FunctionValidationErrors**  
**Etiquetas: **DistributionId, FunctionName  
**Descripción de la alarma: **alarma que se activa cuando se produce algún error de validación de una función de CloudFront.  
**Objetivo: **detectar errores de validación de funciones de CloudFront que impidan la ejecución de la función.  
**Criterios de PromQL: **`sum({__name__="FunctionValidationErrors", "@instrumentation.@name"="cloudwatch.aws/cloudfront", DistributionId="{{your-distribution-id}}",FunctionName="{{your-function-name}}"}) > 0`  
**Valor límite recomendado: **0 (incrustado en la consulta)  
**Justificación del valor límite: **cualquier error de validación indica un problema de configuración de la función que requiere atención.  
**Intervalo de evaluación: **60  
**Período pendiente: **120  
**Periodo de recuperación: **120

**FunctionExecutionErrors**  
**Etiquetas: **DistributionId, FunctionName  
**Descripción de la alarma: **alarma que se activa cuando se produce algún error de ejecución de una función de CloudFront.  
**Objetivo: **detectar errores durante el tiempo de ejecución de las funciones de CloudFront que afecten al procesamiento de solicitudes.  
**Criterios de PromQL: **`sum({__name__="FunctionExecutionErrors", "@instrumentation.@name"="cloudwatch.aws/cloudfront", DistributionId="{{your-distribution-id}}",FunctionName="{{your-function-name}}"}) > 0`  
**Valor límite recomendado: **0 (incrustado en la consulta)  
**Justificación del valor límite: **cualquier error de ejecución indica un problema durante el tiempo de ejecución en el código de la función.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **300  
**Periodo de recuperación: **300

**FunctionThrottles**  
**Etiquetas: **DistributionId, FunctionName  
**Descripción de la alarma: **alarma que se activa cuando se produce alguna limitación controlada en una función de CloudFront.  
**Objetivo: **detectar la limitación controlada de funciones de CloudFront que podría afectar al procesamiento de solicitudes.  
**Criterios de PromQL: **`sum({__name__="FunctionThrottles", "@instrumentation.@name"="cloudwatch.aws/cloudfront", DistributionId="{{your-distribution-id}}",FunctionName="{{your-function-name}}"}) > 0`  
**Valor límite recomendado: **0 (incrustado en la consulta)  
**Justificación del valor límite: **cualquier limitación controlada indica que la función está alcanzando los límites de computación.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **300  
**Periodo de recuperación: **300

## Cognito
<a name="Recommended_PromQL_Cognito"></a>

**SignUpThrottles**  
**Etiquetas: **UserPool, UserPoolClient  
**Descripción de la alarma: **alarma que se activa cuando los eventos de limitación controlada del registro superan el valor límite en un grupo de usuarios.  
**Objetivo: **detectar la limitación controlada del registro que impide registrar usuarios nuevos.  
**Criterios de PromQL: **`sum({__name__="SignUpThrottles", "@instrumentation.@name"="cloudwatch.aws/cognito", UserPool="{{your-user-pool}}",UserPoolClient="{{your-user-pool-client}}"}) > {{THRESHOLD}}`  
**Valor límite recomendado: **{{THRESHOLD}} (incrustado en la consulta)  
**Justificación del valor límite: **establézcalo según la tasa aceptable de limitación controlada para las operaciones de registro.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **300  
**Periodo de recuperación: **300

**SignInThrottles**  
**Etiquetas: **UserPool, UserPoolClient  
**Descripción de la alarma: **alarma que se activa cuando los eventos de limitación controlada del inicio de sesión superan el valor límite en un grupo de usuarios.  
**Objetivo: **detectar la limitación controlada del inicio de sesión que impide autenticar a los usuarios.  
**Criterios de PromQL: **`sum({__name__="SignInThrottles", "@instrumentation.@name"="cloudwatch.aws/cognito", UserPool="{{your-user-pool}}",UserPoolClient="{{your-user-pool-client}}"}) > {{THRESHOLD}}`  
**Valor límite recomendado: **{{THRESHOLD}} (incrustado en la consulta)  
**Justificación del valor límite: **se establece según la tasa aceptable de limitación controlada para las operaciones de inicio de sesión.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **300  
**Periodo de recuperación: **300

**TokenRefreshThrottles**  
**Etiquetas: **UserPool, UserPoolClient  
**Descripción de la alarma: **alarma que se activa cuando los eventos de limitación controlada de la actualización de tokens superan el valor límite en un grupo de usuarios.  
**Objetivo: **detectar la limitación controlada de la actualización de tokens que podría interrumpir las sesiones.  
**Criterios de PromQL: **`sum({__name__="TokenRefreshThrottles", "@instrumentation.@name"="cloudwatch.aws/cognito", UserPool="{{your-user-pool}}",UserPoolClient="{{your-user-pool-client}}"}) > {{THRESHOLD}}`  
**Valor límite recomendado: **{{THRESHOLD}} (incrustado en la consulta)  
**Justificación del valor límite: **se establece según la tasa aceptable de limitación controlada para las operaciones de actualización de tokens.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **300  
**Periodo de recuperación: **300

**FederationThrottles**  
**Etiquetas: **UserPool, UserPoolClient, IdentityProvider  
**Descripción de la alarma: **alarma que se activa cuando los eventos de limitación controlada de la federación superan el valor límite para un proveedor de identidades de un grupo de usuarios.  
**Objetivo: **detectar la limitación controlada de la federación que podría impedir el inicio de sesión federado.  
**Criterios de PromQL: **`sum({__name__="FederationThrottles", "@instrumentation.@name"="cloudwatch.aws/cognito", UserPool="{{your-user-pool}}",UserPoolClient="{{your-user-pool-client}}",IdentityProvider="{{your-identity-provider}}"}) > {{THRESHOLD}}`  
**Valor límite recomendado: **{{THRESHOLD}} (incrustado en la consulta)  
**Justificación del valor límite: **se establece según la tasa aceptable de limitación controlada para las operaciones de federación.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **300  
**Periodo de recuperación: **300

## DynamoDB
<a name="Recommended_PromQL_DynamoDB"></a>

**AccountProvisionedReadCapacityUtilization**  
**Etiquetas: **ninguna  
**Descripción de la alarma: **alarma que se activa cuando el uso de la capacidad de lectura aprovisionada a nivel de cuenta supera el 80 %.  
**Objetivo: **detectar cuándo la capacidad de lectura aprovisionada se aproxima a los límites de la cuenta.  
**Criterios de PromQL: **`max({__name__="AccountProvisionedReadCapacityUtilization", "@instrumentation.@name"="cloudwatch.aws/dynamodb"}) > 80`  
**Valor límite recomendado: **80 (incrustado en la consulta)  
**Justificación del valor límite: **con un uso del 80 %, queda un margen limitado antes de alcanzar los límites de la cuenta.  
**Intervalo de evaluación: **300  
**Periodo pendiente: **600  
**Periodo de recuperación: **600

**AccountProvisionedWriteCapacityUtilization**  
**Etiquetas: **ninguna  
**Descripción de la alarma: **alarma que se activa cuando el uso de la capacidad de escritura aprovisionada a nivel de cuenta supera el 80 %.  
**Objetivo: **detectar cuándo la capacidad de escritura aprovisionada se aproxima a los límites de la cuenta.  
**Criterios de PromQL: **`max({__name__="AccountProvisionedWriteCapacityUtilization", "@instrumentation.@name"="cloudwatch.aws/dynamodb"}) > 80`  
**Valor límite recomendado: **80 (incrustado en la consulta)  
**Justificación del valor límite: **con un uso del 80 %, queda un margen limitado antes de alcanzar los límites de la cuenta.  
**Intervalo de evaluación: **300  
**Periodo pendiente: **600  
**Periodo de recuperación: **600

**AgeOfOldestUnreplicatedRecord**  
**Etiquetas: **TableName, DelegatedOperation  
**Descripción de la alarma: **alarma que se activa cuando la antigüedad del registro no replicado más antiguo supera el valor límite.  
**Objetivo: **detectar retrasos en la replicación que podrían generar datos obsoletos en las tablas globales.  
**Criterios de PromQL: **`max({__name__="AgeOfOldestUnreplicatedRecord", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="{{your-table-name}}",DelegatedOperation="{{your-operation}}"}) > {{THRESHOLD}}`  
**Valor límite recomendado: **{{THRESHOLD}} (incrustado en la consulta)  
**Justificación del valor límite: **se establece según los requisitos de actualidad de la replicación.  
**Intervalo de evaluación: **300  
**Periodo pendiente: **900  
**Periodo de recuperación: **900

**FailedToReplicateRecordCount**  
**Etiquetas: **TableName, DelegatedOperation  
**Descripción de la alarma: **alarma que se activa cuando algún registro no se replica en una tabla global.  
**Objetivo: **detectar errores de replicación que provoquen incoherencias en los datos entre regiones.  
**Criterios de PromQL: **`sum({__name__="FailedToReplicateRecordCount", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="{{your-table-name}}",DelegatedOperation="{{your-operation}}"}) > 0`  
**Valor límite recomendado: **0 (incrustado en la consulta)  
**Justificación del valor límite: **cualquier error de replicación indica problemas de coherencia de datos que requieren atención inmediata.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **60  
**Período de recuperación: **60

**ReadThrottleEvents**  
**Etiquetas: **TableName  
**Descripción de la alarma: **alarma que se activa cuando los eventos de limitación controlada de lectura superan el valor límite de una tabla.  
**Objetivo: **detectar una limitación controlada de lectura que indique una capacidad aprovisionada insuficiente.  
**Criterios de PromQL: **`sum({__name__="ReadThrottleEvents", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="{{your-table-name}}"}) > {{THRESHOLD}}`  
**Valor límite recomendado: **{{THRESHOLD}} (incrustado en la consulta)  
**Justificación del valor límite: **se establece según el número aceptable de eventos de limitación controlada en las operaciones de lectura.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **300  
**Periodo de recuperación: **300

**ReadThrottleEvents (GSI)**  
**Etiquetas: **TableName, GlobalSecondaryIndexName  
**Descripción de la alarma: **alarma que se activa cuando los eventos de limitación controlada de lectura superan el valor límite de un índice secundario global.  
**Objetivo: **detectar la limitación controlada de lectura en un GSI que indique una capacidad insuficiente del índice.  
**Criterios de PromQL: **`sum({__name__="ReadThrottleEvents", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="{{your-table-name}}",GlobalSecondaryIndexName="{{your-index-name}}"}) > {{THRESHOLD}}`  
**Valor límite recomendado: **{{THRESHOLD}} (incrustado en la consulta)  
**Justificación del valor límite: **se establece según el número aceptable de eventos de limitación controlada en las operaciones de lectura del GSI.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **300  
**Periodo de recuperación: **300

**ReplicationLatency**  
**Etiquetas:**TableName, ReceivingRegion  
**Descripción de la alarma: **alarma que se activa cuando la latencia promedio de replicación supera el valor límite de una tabla global.  
**Objetivo: **detectar una latencia alta de replicación que podría provocar lecturas de datos obsoletos en las regiones de réplica.  
**Criterios de PromQL: **`avg({__name__="ReplicationLatency", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="{{your-table-name}}",ReceivingRegion="{{your-receiving-region}}"}) > {{THRESHOLD}}`  
**Valor límite recomendado: **{{THRESHOLD}} (incrustado en la consulta)  
**Justificación del valor límite: **se establece según los requisitos de actualidad de los datos de las regiones de réplica.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **900  
**Periodo de recuperación: **900

**SuccessfulRequestLatency**  
**Etiquetas: **TableName, Operation  
**Descripción de la alarma: **alarma que se activa cuando la latencia promedio de las solicitudes completadas correctamente supera el valor límite de una operación de tabla.  
**Objetivo: **detectar una latencia alta en las operaciones de DynamoDB que afecte al rendimiento de la aplicación.  
**Criterios de PromQL: **`avg({__name__="SuccessfulRequestLatency", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="{{your-table-name}}",Operation="{{your-operation}}"}) > {{THRESHOLD}}`  
**Valor límite recomendado: **{{THRESHOLD}} (incrustado en la consulta)  
**Justificación del valor límite: **se establece según el acuerdo de nivel de servicio (SLA) de latencia de la operación específica de DynamoDB.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **600  
**Periodo de recuperación: **600

**SystemErrors**  
**Etiquetas: **TableName  
**Descripción de la alarma: **alarma que se activa cuando los errores del sistema superan el valor límite de una tabla.  
**Objetivo: **detectar errores del servicio de DynamoDB que afecten a la disponibilidad de la tabla.  
**Criterios de PromQL: **`sum({__name__="SystemErrors", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="{{your-table-name}}"}) > {{THRESHOLD}}`  
**Valor límite recomendado: **{{THRESHOLD}} (incrustado en la consulta)  
**Justificación del valor límite: **se establece según el número aceptable de errores del sistema para la tabla.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **900  
**Periodo de recuperación: **900

**ThrottledPutRecordCount**  
**Etiquetas: **TableName, DelegatedOperation  
**Descripción de la alarma: **alarma que se activa cuando el número de operaciones de inserción sujetas a limitación controlada supera el valor límite de una tabla.  
**Objetivo: **detectar operaciones de inserción sujetas a limitación controlada que podrían provocar la pérdida de datos en las operaciones de streaming.  
**Criterios de PromQL: **`max({__name__="ThrottledPutRecordCount", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="{{your-table-name}}",DelegatedOperation="{{your-operation}}"}) > {{THRESHOLD}}`  
**Valor límite recomendado: **{{THRESHOLD}} (incrustado en la consulta)  
**Justificación del valor límite: **se establece según el número aceptable de eventos de limitación controlada en las operaciones de inserción en streaming.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **600  
**Periodo de recuperación: **600

**UserErrors**  
**Etiquetas: **ninguna  
**Descripción de la alarma: **alarma que se activa cuando los errores del usuario superan el valor límite en la cuenta.  
**Objetivo: **detectar tasas altas de errores del cliente, como errores de validación o de comprobaciones condicionales.  
**Criterios de PromQL: **`sum({__name__="UserErrors", "@instrumentation.@name"="cloudwatch.aws/dynamodb"}) > {{THRESHOLD}}`  
**Valor límite recomendado: **{{THRESHOLD}} (incrustado en la consulta)  
**Justificación del valor límite: **se establece según la tasa de errores aceptable para los fallos de las solicitudes del cliente.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **600  
**Periodo de recuperación: **600

**WriteThrottleEvents**  
**Etiquetas: **TableName  
**Descripción de la alarma: **alarma que se activa cuando los eventos de limitación controlada de escritura superan el valor límite de una tabla.  
**Objetivo: **detectar la limitación controlada de las operaciones de escritura que indique que la capacidad aprovisionada es insuficiente.  
**Criterios de PromQL: **`sum({__name__="WriteThrottleEvents", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="{{your-table-name}}"}) > {{THRESHOLD}}`  
**Valor límite recomendado: **{{THRESHOLD}} (incrustado en la consulta)  
**Justificación del valor límite: **se establece según el número aceptable de eventos de limitación controlada en las operaciones de escritura.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **300  
**Periodo de recuperación: **300

**WriteThrottleEvents (GSI)**  
**Etiquetas: **TableName, GlobalSecondaryIndexName  
**Descripción de la alarma: **alarma que se activa cuando los eventos de limitación controlada de escritura superan el valor límite de un índice secundario global.  
**Objetivo: **detectar la limitación controlada de las operaciones de escritura en un GSI que indique que la capacidad del índice es insuficiente.  
**Criterios de PromQL: **`sum({__name__="WriteThrottleEvents", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="{{your-table-name}}",GlobalSecondaryIndexName="{{your-index-name}}"}) > {{THRESHOLD}}`  
**Valor límite recomendado: **{{THRESHOLD}} (incrustado en la consulta)  
**Justificación del valor límite: **se establece según el número aceptable de eventos de limitación controlada en las operaciones de escritura del GSI.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **300  
**Periodo de recuperación: **300

## EBS
<a name="Recommended_PromQL_EBS"></a>

**VolumeStalledIOCheck**  
**Etiquetas: **VolumeId, InstanceId  
**Descripción de la alarma: **alarma que se activa cuando un volumen de EBS informa de un error en la comprobación de operaciones de E/S bloqueadas.  
**Objetivo: **detectar operaciones de E/S bloqueadas en volúmenes de EBS, lo que puede indicar una degradación del volumen.  
**Criterios de PromQL: **`max({__name__="VolumeStalledIOCheck", "@instrumentation.@name"="cloudwatch.aws/ebs", VolumeId="{{your-volume-id}}",InstanceId="{{your-instance-id}}"}) >= 1`  
**Valor límite recomendado: **1 (incrustado en la consulta)  
**Justificación del valor límite: **un valor de 1 o superior indica que el volumen presenta operaciones de E/S bloqueadas, lo que requiere una investigación inmediata.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **600  
**Periodo de recuperación: **600

## Amazon Elastic Compute Cloud
<a name="Recommended_PromQL_EC2"></a>

**CPUUtilization**  
**Etiquetas: **InstanceId  
**Descripción de la alarma: **alarma que se activa cuando el uso promedio de la CPU supera el 80 % en una instancia de EC2.  
**Objetivo: **detectar un uso elevado de la CPU.  
**Criterios de PromQL: **`avg({__name__="CPUUtilization", "@instrumentation.@name"="cloudwatch.aws/ec2", InstanceId="{{your-instance-id}}"}) > 80`  
**Valor límite recomendado: **80 (incrustado en la consulta)  
**Justificación del valor límite: **el valor límite del 80 % deja margen antes de que la CPU alcance la saturación.  
**Intervalo de evaluación: **300  
**Periodo pendiente: **900  
**Periodo de recuperación: **900

**StatusCheckFailed**  
**Etiquetas: **InstanceId  
**Descripción de la alarma: **alarma que se activa cuando falla una comprobación de estado de la instancia o del sistema en una instancia de EC2.  
**Objetivo: **detectar problemas de estado de la instancia o del sistema.  
**Criterios de PromQL: **`max({__name__="StatusCheckFailed", "@instrumentation.@name"="cloudwatch.aws/ec2", InstanceId="{{your-instance-id}}"}) >= 1`  
**Valor límite recomendado: **1 (incrustado en la consulta)  
**Justificación del valor límite: **cualquier error en una comprobación de estado requiere una investigación.  
**Intervalo de evaluación: **300  
**Periodo pendiente: **600  
**Periodo de recuperación: **600

**StatusCheckFailed\_AttachedEBS**  
**Etiquetas: **InstanceId  
**Descripción de la alarma: **alarma que se activa cuando una instancia de EC2 deja de poder acceder a un volumen de EBS asociado.  
**Objetivo: **detectar volúmenes de EBS inaccesibles.  
**Criterios de PromQL: **`max({__name__="StatusCheckFailed_AttachedEBS", "@instrumentation.@name"="cloudwatch.aws/ec2", InstanceId="{{your-instance-id}}"}) >= 1`  
**Valor límite recomendado: **1 (incrustado en la consulta)  
**Justificación del valor límite: **los volúmenes inaccesibles provocan errores de E/S.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **600  
**Periodo de recuperación: **600

## Amazon ECS
<a name="Recommended_PromQL_ECS"></a>

**CPUReservation**  
**Etiquetas: **ClusterName  
**Descripción de la alarma: **alarma que se activa cuando la reserva promedio de CPU supera el 80 % en un clúster de ECS.  
**Objetivo: **detectar cuándo el clúster se aproxima a su capacidad de CPU.  
**Criterios de PromQL: **`avg({__name__="CPUReservation", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="{{your-cluster-name}}"}) > 80`  
**Valor límite recomendado: **80 (incrustado en la consulta)  
**Justificación del valor límite: **una reserva del 80 % deja poco margen para tareas nuevas.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **300  
**Periodo de recuperación: **300

**CPUUtilization**  
**Etiquetas: **ClusterName, ServiceName  
**Descripción de la alarma: **alarma que se activa cuando el uso promedio de la CPU supera el 80 % en un servicio de ECS.  
**Objetivo: **detectar un uso elevado de la CPU en el servicio de ECS.  
**Criterios de PromQL: **`avg({__name__="CPUUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="{{your-cluster-name}}",ServiceName="{{your-service-name}}"}) > 80`  
**Valor límite recomendado: **80 (incrustado en la consulta)  
**Justificación del valor límite: **un valor del 80 % deja margen antes de que la CPU alcance la saturación.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **300  
**Periodo de recuperación: **300

**EBSFilesystemUtilization**  
**Etiquetas: **ClusterName, ServiceName  
**Descripción de la alarma: **alarma que se activa cuando el uso promedio del sistema de archivos de EBS supera el 80 % en un servicio de ECS.  
**Objetivo: **detectar un uso elevado del almacenamiento de EBS.  
**Criterios de PromQL: **`avg({__name__="EBSFilesystemUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="{{your-cluster-name}}",ServiceName="{{your-service-name}}"}) > 80`  
**Valor límite recomendado: **80 (incrustado en la consulta)  
**Justificación del valor límite: **un valor del 80 % deja margen antes de que la CPU alcance la saturación.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **300  
**Periodo de recuperación: **300

**MemoryReservation**  
**Etiquetas: **ClusterName  
**Descripción de la alarma: **alarma que se activa cuando la reserva promedio de memoria supera el 80 % en un clúster de ECS.  
**Objetivo: **detectar cuándo el clúster se aproxima al límite de su capacidad de memoria.  
**Criterios de PromQL: **`avg({__name__="MemoryReservation", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="{{your-cluster-name}}"}) > 80`  
**Valor límite recomendado: **80 (incrustado en la consulta)  
**Justificación del valor límite: **una reserva del 80 % deja poco margen para tareas nuevas.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **300  
**Periodo de recuperación: **300

**MemoryUtilization**  
**Etiquetas: **ClusterName, ServiceName  
**Descripción de la alarma: **alarma que se activa cuando el uso promedio de la memoria supera el 80 % en un servicio de ECS.  
**Objetivo: **detectar un uso elevado de la memoria.  
**Criterios de PromQL: **`avg({__name__="MemoryUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="{{your-cluster-name}}",ServiceName="{{your-service-name}}"}) > 80`  
**Valor límite recomendado: **80 (incrustado en la consulta)  
**Justificación del valor límite: **un valor del 80 % deja margen antes de que la CPU alcance la saturación.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **300  
**Periodo de recuperación: **300

**HTTPCode\_Target\_5XX\_Count**  
**Etiquetas: **ClusterName, ServiceName  
**Descripción de la alarma: **alarma que se activa cuando el número de errores HTTP 5XX supera el valor límite en un servicio de ECS.  
**Objetivo: **detectar un número elevado de errores del servidor.  
**Criterios de PromQL: **`sum({__name__="HTTPCode_Target_5XX_Count", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="{{your-cluster-name}}",ServiceName="{{your-service-name}}"}) > {{THRESHOLD}}`  
**Valor límite recomendado: **{{THRESHOLD}} (incrustado en la consulta)  
**Justificación del valor límite: **se establece según el valor de referencia de la tasa de errores habitual de la aplicación.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **300  
**Periodo de recuperación: **300

**TargetResponseTime**  
**Etiquetas: **ClusterName, ServiceName  
**Descripción de la alarma: **alarma que se activa cuando el tiempo promedio de respuesta del destino supera el valor límite en un servicio de ECS.  
**Objetivo: **detectar un tiempo de respuesta elevado del destino.  
**Criterios de PromQL: **`avg({__name__="TargetResponseTime", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="{{your-cluster-name}}",ServiceName="{{your-service-name}}"}) > {{THRESHOLD}}`  
**Valor límite recomendado: **{{THRESHOLD}} (incrustado en la consulta)  
**Justificación del valor límite: **se establece según los requisitos de latencia aceptable de la aplicación.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **300  
**Periodo de recuperación: **300

## Información de contenedores de Amazon ECS
<a name="Recommended_PromQL_ECS_ContainerInsights"></a>

**EphemeralStorageUtilized**  
**Etiquetas: **ClusterName, ServiceName  
**Descripción de la alarma: **alarma que se activa cuando el uso promedio del almacenamiento efímero supera el valor límite en las tareas de Fargate.  
**Objetivo: **detectar un uso elevado del almacenamiento efímero en las tareas de Fargate.  
**Criterios de PromQL: **`avg({__name__="EphemeralStorageUtilized", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="{{your-cluster-name}}",ServiceName="{{your-service-name}}"}) > {{THRESHOLD}}`  
**Valor límite recomendado: **{{THRESHOLD}} (incrustado en la consulta)  
**Justificación del valor límite: **se establece según el almacenamiento efímero asignado a las tareas.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **300  
**Periodo de recuperación: **300

**RunningTaskCount**  
**Etiquetas: **ClusterName, ServiceName  
**Descripción de la alarma: **alarma que se activa cuando el número de tareas en ejecución se reduce a cero en un servicio de ECS.  
**Objetivo: **detectar cuando no hay ninguna tarea en ejecución.  
**Criterios de PromQL: **`avg({__name__="RunningTaskCount", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="{{your-cluster-name}}",ServiceName="{{your-service-name}}"}) <= 0`  
**Valor límite recomendado: **0 (incrustado en la consulta)  
**Justificación del valor límite: **la ausencia de tareas en ejecución indica una interrupción del servicio.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **300  
**Periodo de recuperación: **300

**instance\_filesystem\_utilization**  
**Etiquetas: **InstanceId, ContainerInstanceId, ClusterName  
**Descripción de la alarma: **alarma que se activa cuando el uso promedio del sistema de archivos supera el 90 % en una instancia de contenedor.  
**Objetivo: **detectar un uso elevado del sistema de archivos.  
**Criterios de PromQL: **`avg({__name__="instance_filesystem_utilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", InstanceId="{{your-instance-id}}",ContainerInstanceId="{{your-container-instance-id}}",ClusterName="{{your-cluster-name}}"}) > 90`  
**Valor límite recomendado: **90 (incrustado en la consulta)  
**Justificación del valor límite: **un uso del sistema de archivos del 90 % deja poco espacio disponible para las operaciones.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **300  
**Periodo de recuperación: **300

## Observabilidad mejorada de Información de contenedores de Amazon ECS
<a name="Recommended_PromQL_ECS_ContainerInsights_Enhanced"></a>

**TaskCpuUtilization (nivel de clúster)**  
**Etiquetas: **ClusterName  
**Descripción de la alarma:** alarma que se activa cuando el uso promedio de CPU de las tareas supera el 80 % a nivel de clúster.  
**Objetivo: **detectar un uso elevado de la CPU.  
**Criterios de PromQL: **`avg({__name__="TaskCpuUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="{{your-cluster-name}}"}) > 80`  
**Valor límite recomendado: **80 (incrustado en la consulta)  
**Justificación del valor límite: **un valor del 80 % deja margen antes de que la CPU alcance la saturación.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **300  
**Periodo de recuperación: **300

**TaskCpuUtilization (nivel de servicio)**  
**Etiquetas: **ClusterName, ServiceName  
**Descripción de la alarma:** alarma que se activa cuando el uso promedio de CPU de las tareas supera el 80 % a nivel de servicio.  
**Objetivo: **detectar un uso elevado de la CPU.  
**Criterios de PromQL: **`avg({__name__="TaskCpuUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="{{your-cluster-name}}",ServiceName="{{your-service-name}}"}) > 80`  
**Valor límite recomendado: **80 (incrustado en la consulta)  
**Justificación del valor límite: **un valor del 80 % deja margen antes de que la CPU alcance la saturación.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **300  
**Periodo de recuperación: **300

**TaskMemoryUtilization (nivel de clúster)**  
**Etiquetas: **ClusterName  
**Descripción de la alarma: **alarma que se activa cuando el uso promedio de memoria de las tareas supera el 80 % a nivel de clúster.  
**Objetivo: **detectar un uso elevado de la memoria.  
**Criterios de PromQL: **`avg({__name__="TaskMemoryUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="{{your-cluster-name}}"}) > 80`  
**Valor límite recomendado: **80 (incrustado en la consulta)  
**Justificación del valor límite: **un valor del 80 % deja margen antes de que la CPU alcance la saturación.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **300  
**Periodo de recuperación: **300

**TaskMemoryUtilization (nivel de servicio)**  
**Etiquetas: **ClusterName, ServiceName  
**Descripción de la alarma: **alarma que se activa cuando el uso promedio de memoria de las tareas supera el 80 % a nivel de servicio.  
**Objetivo: **detectar un uso elevado de la memoria.  
**Criterios de PromQL: **`avg({__name__="TaskMemoryUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="{{your-cluster-name}}",ServiceName="{{your-service-name}}"}) > 80`  
**Valor límite recomendado: **80 (incrustado en la consulta)  
**Justificación del valor límite: **un valor del 80 % deja margen antes de que la CPU alcance la saturación.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **300  
**Periodo de recuperación: **300

**ContainerCpuUtilization (nivel de clúster)**  
**Etiquetas: **ClusterName  
**Descripción de la alarma: **alarma que se activa cuando el uso promedio de CPU de los contenedores supera el 80 % a nivel de clúster.  
**Objetivo: **detectar un uso elevado de la CPU.  
**Criterios de PromQL: **`avg({__name__="ContainerCpuUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="{{your-cluster-name}}"}) > 80`  
**Valor límite recomendado: **80 (incrustado en la consulta)  
**Justificación del valor límite: **un valor del 80 % deja margen antes de que la CPU alcance la saturación.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **300  
**Periodo de recuperación: **300

**ContainerCpuUtilization (nivel de contenedor)**  
**Etiquetas: **ContainerName, ClusterName, ServiceName  
**Descripción de la alarma: **alarma que se activa cuando el uso promedio de CPU de los contenedores supera el 80 % a nivel de contenedor.  
**Objetivo: **detectar un uso elevado de la CPU.  
**Criterios de PromQL: **`avg({__name__="ContainerCpuUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ContainerName="{{your-container-name}}",ClusterName="{{your-cluster-name}}",ServiceName="{{your-service-name}}"}) > 80`  
**Valor límite recomendado: **80 (incrustado en la consulta)  
**Justificación del valor límite: **un valor del 80 % deja margen antes de que la CPU alcance la saturación.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **300  
**Periodo de recuperación: **300

**ContainerMemoryUtilization (nivel de clúster)**  
**Etiquetas: **ClusterName  
**Descripción de la alarma: **alarma que se activa cuando el uso promedio de memoria de los contenedores supera el 80 % a nivel de clúster.  
**Objetivo: **detectar un uso elevado de la memoria.  
**Criterios de PromQL: **`avg({__name__="ContainerMemoryUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="{{your-cluster-name}}"}) > 80`  
**Valor límite recomendado: **80 (incrustado en la consulta)  
**Justificación del valor límite: **un valor del 80 % deja margen antes de que la CPU alcance la saturación.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **300  
**Periodo de recuperación: **300

**ContainerMemoryUtilization (nivel de contenedor)**  
**Etiquetas: **ContainerName, ClusterName, ServiceName  
**Descripción de la alarma: **alarma que se activa cuando el uso promedio de memoria de los contenedores supera el 80 % a nivel de contenedor.  
**Objetivo: **detectar un uso elevado de la memoria.  
**Criterios de PromQL: **`avg({__name__="ContainerMemoryUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ContainerName="{{your-container-name}}",ClusterName="{{your-cluster-name}}",ServiceName="{{your-service-name}}"}) > 80`  
**Valor límite recomendado: **80 (incrustado en la consulta)  
**Justificación del valor límite: **un valor del 80 % deja margen antes de que la CPU alcance la saturación.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **300  
**Periodo de recuperación: **300

**TaskEBSfilesystemUtilization**  
**Etiquetas: **ClusterName, ServiceName  
**Descripción de la alarma: **alarma que se activa cuando el uso promedio del sistema de archivos de EBS supera el 80 % en las tareas.  
**Objetivo: **detectar un uso elevado del sistema de archivos de EBS.  
**Criterios de PromQL: **`avg({__name__="TaskEBSfilesystemUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="{{your-cluster-name}}",ServiceName="{{your-service-name}}"}) > 80`  
**Valor límite recomendado: **80 (incrustado en la consulta)  
**Justificación del valor límite: **un valor del 80 % deja margen antes de que la CPU alcance la saturación.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **300  
**Periodo de recuperación: **300

**TaskEphemeralStorageUtilization (nivel de clúster)**  
**Etiquetas: **ClusterName  
**Descripción de la alarma: **alarma que se activa cuando el uso promedio del almacenamiento efímero supera el 80 % a nivel de clúster.  
**Objetivo: **detectar un uso elevado del almacenamiento efímero.  
**Criterios de PromQL: **`avg({__name__="TaskEphemeralStorageUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="{{your-cluster-name}}"}) > 80`  
**Valor límite recomendado: **80 (incrustado en la consulta)  
**Justificación del valor límite: **un valor del 80 % deja margen antes de que la CPU alcance la saturación.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **300  
**Periodo de recuperación: **300

**TaskEphemeralStorageUtilization (nivel de servicio)**  
**Etiquetas: **ClusterName, ServiceName  
**Descripción de la alarma: **alarma que se activa cuando el uso promedio del almacenamiento efímero supera el 80 % a nivel de servicio.  
**Objetivo: **detectar un uso elevado del almacenamiento efímero.  
**Criterios de PromQL: **`avg({__name__="TaskEphemeralStorageUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="{{your-cluster-name}}",ServiceName="{{your-service-name}}"}) > 80`  
**Valor límite recomendado: **80 (incrustado en la consulta)  
**Justificación del valor límite: **un valor del 80 % deja margen antes de que la CPU alcance la saturación.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **300  
**Periodo de recuperación: **300

## Amazon EFS
<a name="Recommended_PromQL_EFS"></a>

**PercentIOLimit**  
**Etiquetas: **FileSystemId  
**Descripción de la alarma: **alarma que se activa cuando un sistema de archivos de EFS alcanza el 100 % de su límite de operaciones de E/S.  
**Objetivo: **detectar cuándo el sistema de archivos alcanza su límite de operaciones de E/S.  
**Criterios de PromQL: **`avg({__name__="PercentIOLimit", "@instrumentation.@name"="cloudwatch.aws/efs", FileSystemId="{{your-filesystem-id}}"}) >= 100`  
**Valor límite recomendado: **100 (incrustado en la consulta)  
**Justificación del valor límite: **al alcanzar el 100 %, el sistema de archivos se convierte en un cuello de botella.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **900  
**Periodo de recuperación: **900

**BurstCreditBalance**  
**Etiquetas: **FileSystemId  
**Descripción de la alarma: **alarma que se activa cuando el saldo de créditos de ampliación se reduce a cero en un sistema de archivos de EFS.  
**Objetivo: **detectar el agotamiento de los créditos de ampliación que provoca una disminución del rendimiento.  
**Criterios de PromQL: **`avg({__name__="BurstCreditBalance", "@instrumentation.@name"="cloudwatch.aws/efs", FileSystemId="{{your-filesystem-id}}"}) <= 0`  
**Valor límite recomendado: **0 (incrustado en la consulta)  
**Justificación del valor límite: **un saldo de cero créditos reduce el rendimiento.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **900  
**Periodo de recuperación: **900

## Información de contenedores de Amazon EKS
<a name="Recommended_PromQL_EKS"></a>

**node\_cpu\_utilization**  
**Etiquetas: **ClusterName  
**Descripción de la alarma: **alarma que se activa cuando el uso máximo de CPU supera el 80 % en los nodos de trabajo de EKS.  
**Objetivo: **detectar un uso elevado de CPU en los nodos de trabajo.  
**Criterios de PromQL: **`max({__name__="node_cpu_utilization", "@instrumentation.@name"="cloudwatch.aws/eks-containerinsights", ClusterName="{{your-cluster-name}}"}) > 80`  
**Valor límite recomendado: **80 (incrustado en la consulta)  
**Justificación del valor límite: **un valor del 80 % deja margen antes de que la CPU alcance la saturación.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **300  
**Periodo de recuperación: **300

**node\_filesystem\_utilization**  
**Etiquetas: **ClusterName  
**Descripción de la alarma: **alarma que se activa cuando el uso máximo del sistema de archivos supera el valor límite en los nodos de trabajo de EKS.  
**Objetivo: **detectar un uso elevado del sistema de archivos en los nodos de trabajo.  
**Criterios de PromQL: **`max({__name__="node_filesystem_utilization", "@instrumentation.@name"="cloudwatch.aws/eks-containerinsights", ClusterName="{{your-cluster-name}}"}) > {{THRESHOLD}}`  
**Valor límite recomendado: **{{THRESHOLD}} (incrustado en la consulta)  
**Justificación del valor límite: **se establece según la capacidad de almacenamiento de los nodos y sus patrones de uso.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **300  
**Periodo de recuperación: **300

**node\_memory\_utilization**  
**Etiquetas: **ClusterName  
**Descripción de la alarma: **alarma que se activa cuando el uso máximo de memoria supera el 80 % en los nodos de trabajo de EKS.  
**Objetivo: **detectar un uso elevado de memoria en los nodos de trabajo.  
**Criterios de PromQL: **`max({__name__="node_memory_utilization", "@instrumentation.@name"="cloudwatch.aws/eks-containerinsights", ClusterName="{{your-cluster-name}}"}) > 80`  
**Valor límite recomendado: **80 (incrustado en la consulta)  
**Justificación del valor límite: **un valor del 80 % deja margen antes de que la CPU alcance la saturación.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **300  
**Periodo de recuperación: **300

**pod\_cpu\_utilization\_over\_pod\_limit**  
**Etiquetas: **ClusterName, Namespace, Service  
**Descripción de la alarma: **alarma que se activa cuando el uso de CPU de un pod supera el 80 % de su límite.  
**Objetivo: **detectar pods que se aproximan a sus límites de CPU.  
**Criterios de PromQL: **`max({__name__="pod_cpu_utilization_over_pod_limit", "@instrumentation.@name"="cloudwatch.aws/eks-containerinsights", ClusterName="{{your-cluster-name}}",Namespace="{{your-namespace}}",Service="{{your-service}}"}) > 80`  
**Valor límite recomendado: **80 (incrustado en la consulta)  
**Justificación del valor límite: **un uso del 80 % deja margen antes de que se produzca una limitación controlada.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **300  
**Periodo de recuperación: **300

**pod\_memory\_utilization\_over\_pod\_limit**  
**Etiquetas: **ClusterName, Namespace, Service  
**Descripción de la alarma: **alarma que se activa cuando el uso de memoria de un pod supera el 80 % de su límite.  
**Objetivo: **detectar pods que se aproximan a sus límites de memoria.  
**Criterios de PromQL: **`max({__name__="pod_memory_utilization_over_pod_limit", "@instrumentation.@name"="cloudwatch.aws/eks-containerinsights", ClusterName="{{your-cluster-name}}",Namespace="{{your-namespace}}",Service="{{your-service}}"}) > 80`  
**Valor límite recomendado: **80 (incrustado en la consulta)  
**Justificación del valor límite: **un uso del 80 % deja margen antes de que se produzca un OOMKill.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **300  
**Periodo de recuperación: **300

## Amazon ElastiCache
<a name="Recommended_PromQL_ElastiCache"></a>

**CPUUtilization**  
**Etiquetas: **CacheClusterId, CacheNodeId  
**Descripción de la alarma: **alarma que se activa cuando el uso promedio de CPU supera el valor límite en un nodo de ElastiCache.  
**Objetivo: **detectar un uso elevado de CPU en la instancia.  
**Criterios de PromQL: **`avg({__name__="CPUUtilization", "@instrumentation.@name"="cloudwatch.aws/elasticache", CacheClusterId="{{your-cache-cluster-id}}",CacheNodeId="{{your-cache-node-id}}"}) > {{THRESHOLD}}`  
**Valor límite recomendado: **{{THRESHOLD}} (incrustado en la consulta)  
**Justificación del valor límite: **se establece según el tipo de nodo y las características de la carga de trabajo.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **300  
**Periodo de recuperación: **300

**CurrConnections**  
**Etiquetas: **CacheClusterId, CacheNodeId  
**Descripción de la alarma: **alarma que se activa cuando el número de conexiones supera el valor límite en un nodo de ElastiCache.  
**Objetivo: **detectar un número elevado de conexiones.  
**Criterios de PromQL: **`avg({__name__="CurrConnections", "@instrumentation.@name"="cloudwatch.aws/elasticache", CacheClusterId="{{your-cache-cluster-id}}",CacheNodeId="{{your-cache-node-id}}"}) > {{THRESHOLD}}`  
**Valor límite recomendado: **{{THRESHOLD}} (incrustado en la consulta)  
**Justificación del valor límite: **se establece según el tamaño previsto del grupo de conexiones y las necesidades de la aplicación.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **600  
**Periodo de recuperación: **600

**DatabaseMemoryUsagePercentage**  
**Etiquetas: **CacheClusterId  
**Descripción de la alarma: **alarma que se activa cuando el uso de memoria de la base de datos supera el valor límite en un clúster de ElastiCache.  
**Objetivo: **detectar un uso elevado de memoria para evitar errores de escritura.  
**Criterios de PromQL: **`avg({__name__="DatabaseMemoryUsagePercentage", "@instrumentation.@name"="cloudwatch.aws/elasticache", CacheClusterId="{{your-cache-cluster-id}}"}) > {{THRESHOLD}}`  
**Valor límite recomendado: **{{THRESHOLD}} (incrustado en la consulta)  
**Justificación del valor límite: **se establece según la política de expulsión y la criticidad de los datos.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **300  
**Periodo de recuperación: **300

**EngineCPUUtilization**  
**Etiquetas: **CacheClusterId  
**Descripción de la alarma **alarma que se activa cuando el uso de CPU del motor de Redis supera el 90 % en un clúster de ElastiCache.  
**Objetivo: **detectar un uso elevado de CPU del motor de Redis.  
**Criterios de PromQL: **`avg({__name__="EngineCPUUtilization", "@instrumentation.@name"="cloudwatch.aws/elasticache", CacheClusterId="{{your-cache-cluster-id}}"}) > 90`  
**Valor límite recomendado: **90 (incrustado en la consulta)  
**Justificación del valor límite: **Redis utiliza un solo subproceso; un uso superior al 90 % indica saturación.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **300  
**Periodo de recuperación: **300

**ReplicationLag**  
**Etiquetas: **CacheClusterId  
**Descripción de la alarma: **alarma que se activa cuando el retraso de replicación supera el valor límite en un clúster de ElastiCache.  
**Objetivo: **detectar retrasos en la replicación que afecten a la coherencia de datos.  
**Criterios de PromQL: **`avg({__name__="ReplicationLag", "@instrumentation.@name"="cloudwatch.aws/elasticache", CacheClusterId="{{your-cache-cluster-id}}"}) > {{THRESHOLD}}`  
**Valor límite recomendado: **{{THRESHOLD}} (incrustado en la consulta)  
**Justificación del valor límite: **se establece según la tolerancia de la aplicación a las lecturas de datos obsoletos.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **900  
**Periodo de recuperación: **900

## GPU elásticas
<a name="Recommended_PromQL_ElasticGPUs"></a>

**GPUConnectivityCheckFailed**  
**Etiquetas: **InstanceId, EGPUId  
**Descripción de la alarma: **alarma que se activa cuando el acelerador Elastic Graphics pierde la conectividad con la instancia.  
**Objetivo: **detectar problemas de conectividad con el acelerador de Elastic Graphics.  
**Criterios de PromQL: **`max({__name__="GPUConnectivityCheckFailed", "@instrumentation.@name"="cloudwatch.aws/elasticgpus", InstanceId="{{your-instance-id}}",EGPUId="{{your-egpu-id}}"}) > 0`  
**Valor límite recomendado: **0 (incrustado en la consulta)  
**Justificación del valor límite: **cualquier error de conectividad requiere una investigación.  
**Intervalo de evaluación: **300  
**Periodo pendiente: **900  
**Periodo de recuperación: **900

**GPUHealthCheckFailed**  
**Etiquetas: **InstanceId, EGPUId  
**Descripción de la alarma: **alarma que se activa cuando falla una comprobación de estado del acelerador de Elastic Graphics.  
**Objetivo: **detectar un estado incorrecto del acelerador de Elastic Graphics.  
**Criterios de PromQL: **`max({__name__="GPUHealthCheckFailed", "@instrumentation.@name"="cloudwatch.aws/elasticgpus", InstanceId="{{your-instance-id}}",EGPUId="{{your-egpu-id}}"}) > 0`  
**Valor límite recomendado: **0 (incrustado en la consulta)  
**Justificación del valor límite: **los errores en las comprobaciones de estado indican problemas con el acelerador.  
**Intervalo de evaluación: **300  
**Periodo pendiente: **900  
**Periodo de recuperación: **900

## Programador de Amazon EventBridge
<a name="Recommended_PromQL_Scheduler"></a>

**TargetErrorThrottledCount**  
**Descripción de la alarma: **alarma que se activa cuando las invocaciones de destino programadas están sujetas a limitación controlada.  
**Objetivo: **detectar la limitación controlada del destino que provoca retrasos en la programación.  
**Criterios de PromQL: **`sum({__name__="TargetErrorThrottledCount", "@instrumentation.@name"="cloudwatch.aws/scheduler"}) > 0`  
**Valor límite recomendado: **0 (incrustado en la consulta)  
**Justificación del valor límite: **cualquier limitación controlada indica problemas de capacidad del destino.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **900  
**Periodo de recuperación: **900

**InvocationThrottleCount**  
**Descripción de la alarma: **alarma que se activa cuando las invocaciones del programador están sujetas a limitación controlada.  
**Objetivo: **detectar la limitación controlada de las invocaciones del programador.  
**Criterios de PromQL: **`sum({__name__="InvocationThrottleCount", "@instrumentation.@name"="cloudwatch.aws/scheduler"}) > 0`  
**Valor límite recomendado: **0 (incrustado en la consulta)  
**Justificación del valor límite: **la limitación controlada retrasa las ejecuciones programadas.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **900  
**Periodo de recuperación: **900

**InvocationDroppedCount**  
**Descripción de la alarma: **alarma que se activa cuando se descartan invocaciones programadas.  
**Objetivo: **detectar invocaciones descartadas.  
**Criterios de PromQL: **`sum({__name__="InvocationDroppedCount", "@instrumentation.@name"="cloudwatch.aws/scheduler"}) > 0`  
**Valor límite recomendado: **0 (incrustado en la consulta)  
**Justificación del valor límite: **las invocaciones descartadas representan eventos programados que no se ejecutaron.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **60  
**Período de recuperación: **60

**InvocationsFailedToBeSentToDeadLetterCount**  
**Descripción de la alarma: **alarma que se activa cuando las invocaciones fallidas no se pueden enviar a la cola de mensajes fallidos.  
**Objetivo:**detectar errores de entrega a la cola de mensajes fallidos (DLQ).  
**Criterios de PromQL: **`sum({__name__="InvocationsFailedToBeSentToDeadLetterCount", "@instrumentation.@name"="cloudwatch.aws/scheduler"}) > 0`  
**Valor límite recomendado: **0 (incrustado en la consulta)  
**Justificación del valor límite: **un error de entrega a la DLQ implica la pérdida de información sobre el error.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **900  
**Periodo de recuperación: **900

## Amazon Kinesis Data Streams
<a name="Recommended_PromQL_Kinesis"></a>

**GetRecords.IteratorAgeMilliseconds**  
**Etiquetas: **StreamName  
**Descripción de la alarma: **alarma que se activa cuando la antigüedad del iterador del consumidor supera el valor límite en un flujo de Kinesis.  
**Objetivo: **detectar datos cuyo retraso se aproxima al período de retención, con el consiguiente riesgo de pérdida de datos.  
**Criterios de PromQL: **`max({__name__="GetRecords.IteratorAgeMilliseconds", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="{{your-stream-name}}"}) > {{THRESHOLD}}`  
**Valor límite recomendado: **{{THRESHOLD}} (incrustado en la consulta)  
**Justificación del valor límite: **se establece según un porcentaje del período de retención del flujo.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **900  
**Periodo de recuperación: **900

**GetRecords.Success**  
**Etiquetas: **StreamName  
**Descripción de la alarma: **alarma que se activa cuando la tasa de éxito de GetRecords cae por debajo del valor límite en un flujo de Kinesis.  
**Objetivo: **detectar errores en la recuperación de datos por parte de los consumidores.  
**Criterios de PromQL: **`avg({__name__="GetRecords.Success", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="{{your-stream-name}}"}) < {{THRESHOLD}}`  
**Valor límite recomendado: **{{THRESHOLD}} (incrustado en la consulta)  
**Justificación del valor límite: **se establece según la tasa de éxito esperada.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **300  
**Periodo de recuperación: **300

**PutRecord.Success**  
**Etiquetas: **StreamName  
**Descripción de la alarma: **alarma que se activa cuando la tasa de éxito de PutRecord cae por debajo del valor límite en un flujo de Kinesis.  
**Objetivo: **detectar errores en la ingesta de datos por parte de los productores.  
**Criterios de PromQL: **`avg({__name__="PutRecord.Success", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="{{your-stream-name}}"}) < {{THRESHOLD}}`  
**Valor límite recomendado: **{{THRESHOLD}} (incrustado en la consulta)  
**Justificación del valor límite: **se establece según la tasa de éxito esperada.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **300  
**Periodo de recuperación: **300

**PutRecords.FailedRecords**  
**Etiquetas: **StreamName  
**Descripción de la alarma: **alarma que se activa cuando las operaciones de inserción por lotes generan registros con errores en un flujo de Kinesis.  
**Objetivo: **detectar errores en las operaciones de inserción por lotes.  
**Criterios de PromQL: **`sum({__name__="PutRecords.FailedRecords", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="{{your-stream-name}}"}) > {{THRESHOLD}}`  
**Valor límite recomendado: **{{THRESHOLD}} (incrustado en la consulta)  
**Justificación del valor límite: **se establece según el número aceptable de errores.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **300  
**Periodo de recuperación: **300

**ReadProvisionedThroughputExceeded**  
**Etiquetas: **StreamName  
**Descripción de la alarma: **alarma que se activa cuando las lecturas del consumidor superan el rendimiento aprovisionado de un flujo de Kinesis.  
**Objetivo: **detectar la limitación controlada de las lecturas del consumidor.  
**Criterios de PromQL: **`avg({__name__="ReadProvisionedThroughputExceeded", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="{{your-stream-name}}"}) > {{THRESHOLD}}`  
**Valor límite recomendado: **{{THRESHOLD}} (incrustado en la consulta)  
**Justificación del valor límite: **cualquier limitación controlada sostenida indica que se necesita más capacidad.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **300  
**Periodo de recuperación: **300

**SubscribeToShardEvent.MillisBehindLatest**  
**Etiquetas: **StreamName, ConsumerName  
**Descripción de la alarma: **alarma que se activa cuando un consumidor con distribución mejorada se retrasa respecto al registro más reciente.  
**Objetivo: **detectar retrasos en el procesamiento del consumidor con distribución mejorada.  
**Criterios de PromQL: **`avg({__name__="SubscribeToShardEvent.MillisBehindLatest", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="{{your-stream-name}}",ConsumerName="{{your-consumer-name}}"}) > {{THRESHOLD}}`  
**Valor límite recomendado: **{{THRESHOLD}} (incrustado en la consulta)  
**Justificación del valor límite: **se establece según el retraso de procesamiento aceptable.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **300  
**Periodo de recuperación: **300

**WriteProvisionedThroughputExceeded**  
**Etiquetas: **StreamName  
**Descripción de la alarma: **alarma que se activa cuando las escrituras del productor superan el rendimiento aprovisionado de un flujo de Kinesis.  
**Objetivo: **detectar la limitación controlada de las escrituras del productor.  
**Criterios de PromQL: **`avg({__name__="WriteProvisionedThroughputExceeded", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="{{your-stream-name}}"}) > {{THRESHOLD}}`  
**Valor límite recomendado: **{{THRESHOLD}} (incrustado en la consulta)  
**Justificación del valor límite: **una limitación controlada sostenida indica que se necesita más capacidad.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **300  
**Periodo de recuperación: **300

## AWS Lambda
<a name="Recommended_PromQL_Lambda"></a>

**ClaimedAccountConcurrency**  
**Descripción de la alarma: **alarma que se activa cuando la simultaneidad reclamada de la cuenta supera el valor límite.  
**Objetivo: **detectar cuándo la cuenta se aproxima a la cuota de simultaneidad.  
**Criterios de PromQL: **`max({__name__="ClaimedAccountConcurrency", "@instrumentation.@name"="cloudwatch.aws/lambda"}) > {{THRESHOLD}}`  
**Valor límite recomendado: **{{THRESHOLD}} (incrustado en la consulta)  
**Justificación del valor límite: **se establece como un porcentaje del límite regional de simultaneidad.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **600  
**Periodo de recuperación: **600

**Errores**  
**Etiquetas: **FunctionName  
**Descripción de la alarma: **alarma que se activa cuando el número de errores de una función de Lambda supera el valor límite.  
**Objetivo: **detectar un número elevado de errores de la función.  
**Criterios de PromQL: **`sum({__name__="Errors", "@instrumentation.@name"="cloudwatch.aws/lambda", FunctionName="{{your-function-name}}"}) > {{THRESHOLD}}`  
**Valor límite recomendado: **{{THRESHOLD}} (incrustado en la consulta)  
**Justificación del valor límite: **se establece según el volumen de errores aceptable.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **180  
**Periodo de recuperación: **300

**Limitaciones**  
**Etiquetas: **FunctionName  
**Descripción de la alarma: **alarma que se activa cuando las invocaciones de una función de Lambda están sujetas a limitación controlada.  
**Objetivo: **detectar la limitación controlada de las invocaciones de la función.  
**Criterios de PromQL: **`sum({__name__="Throttles", "@instrumentation.@name"="cloudwatch.aws/lambda", FunctionName="{{your-function-name}}"}) > {{THRESHOLD}}`  
**Valor límite recomendado: **{{THRESHOLD}} (incrustado en la consulta)  
**Justificación del valor límite: **la limitación controlada indica que se alcanzó el límite de simultaneidad.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **300  
**Periodo de recuperación: **300

**Duración**  
**Etiquetas: **FunctionName  
**Descripción de la alarma: **alarma que se activa cuando la duración p90 de una función supera el valor límite en una función de Lambda.  
**Objetivo: **detectar invocaciones de funciones de larga duración.  
**Criterios de PromQL: **`histogram_quantile(0.9, {__name__="Duration", "@instrumentation.@name"="cloudwatch.aws/lambda", FunctionName="{{your-function-name}}"}) > {{THRESHOLD}}`  
**Valor límite recomendado: **{{THRESHOLD}} (incrustado en la consulta)  
**Justificación del valor límite: **se establece en relación con el tiempo de espera de la función.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **900  
**Periodo de recuperación: **900

**ConcurrentExecutions**  
**Etiquetas: **FunctionName  
**Descripción de la alarma: **alarma que se activa cuando las ejecuciones simultáneas superan el valor límite de una función de Lambda.  
**Objetivo: **detectar cuándo la función se aproxima a sus límites de simultaneidad.  
**Criterios de PromQL: **`max({__name__="ConcurrentExecutions", "@instrumentation.@name"="cloudwatch.aws/lambda", FunctionName="{{your-function-name}}"}) > {{THRESHOLD}}`  
**Valor límite recomendado: **{{THRESHOLD}} (incrustado en la consulta)  
**Justificación del valor límite: **se establece como un porcentaje de la simultaneidad reservada.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **600  
**Periodo de recuperación: **600

## AWS LambdaConocimientos en
<a name="Recommended_PromQL_LambdaInsights"></a>

**memory\_utilization**  
**Etiquetas: **function\_name  
**Descripción de la alarma: **alarma que se activa cuando el uso promedio de memoria supera el 90 % en una función de Lambda.  
**Objetivo: **detectar cuándo la función se aproxima al límite de memoria configurado.  
**Criterios de PromQL: **`avg({__name__="memory_utilization", "@instrumentation.@name"="cloudwatch.aws/lambda-insights", function_name="{{your-function-name}}"}) > 90`  
**Valor límite recomendado: **90 (incrustado en la consulta)  
**Justificación del valor límite: **un uso superior al 90 % aumenta el riesgo de errores por falta de memoria.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **600  
**Periodo de recuperación: **600

## Puerta de enlace NAT
<a name="Recommended_PromQL_NATGateway"></a>

**ErrorPortAllocation**  
**Etiquetas: **NatGatewayId  
**Descripción de la alarma: **alarma que se activa cuando la puerta de enlace NAT no puede asignar un puerto para conexiones nuevas.  
**Objetivo:**detectar errores de asignación de puertos que impiden establecer conexiones nuevas.  
**Criterios de PromQL: **`sum({__name__="ErrorPortAllocation", "@instrumentation.@name"="cloudwatch.aws/natgateway", NatGatewayId="{{your-nat-gateway-id}}"}) > 0`  
**Valor límite recomendado: **0 (incrustado en la consulta)  
**Justificación del valor límite: **cualquier error de asignación afecta a la conectividad.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **900  
**Periodo de recuperación: **900

**PacketsDropCount**  
**Etiquetas: **NatGatewayId  
**Descripción de la alarma: **alarma que se activa cuando la puerta de enlace NAT descarta paquetes por encima del valor límite.  
**Objetivo: **detectar descartes de paquetes que indiquen problemas de capacidad o conectividad.  
**Criterios de PromQL: **`sum({__name__="PacketsDropCount", "@instrumentation.@name"="cloudwatch.aws/natgateway", NatGatewayId="{{your-nat-gateway-id}}"}) > {{THRESHOLD}}`  
**Valor límite recomendado: **{{THRESHOLD}} (incrustado en la consulta)  
**Justificación del valor límite: **se establece según la tasa de descarte aceptable.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **300  
**Periodo de recuperación: **300

## Puntos de conexión de AWS PrivateLink
<a name="Recommended_PromQL_PrivateLinkEndpoints"></a>

**PacketsDropped**  
**Etiquetas: **VpcId, VpcEndpointId, EndpointType, SubnetId, ServiceName  
**Descripción de la alarma: **alarma que se activa cuando un punto de conexión de VPC descarta paquetes por encima del valor límite.  
**Objetivo: **detectar un punto de conexión o servicio de punto de conexión en mal estado.  
**Criterios de PromQL: **`sum({__name__="PacketsDropped", "@instrumentation.@name"="cloudwatch.aws/privatelinkendpoints", VpcId="{{your-vpc-id}}",VpcEndpointId="{{your-vpc-endpoint-id}}",EndpointType="{{your-endpoint-type}}",SubnetId="{{your-subnet-id}}",ServiceName="{{your-service-name}}"}) > {{THRESHOLD}}`  
**Valor límite recomendado: **{{THRESHOLD}} (incrustado en la consulta)  
**Justificación del valor límite: **se establece según la tasa de descarte aceptable.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **300  
**Periodo de recuperación: **300

## Servicios de AWS PrivateLink
<a name="Recommended_PromQL_PrivateLinkServices"></a>

**RstPacketsSent**  
**Etiquetas: **ServiceId, LoadBalancerArn, Az  
**Descripción de la alarma: **alarma que se activa cuando la tasa de paquetes RST supera el valor límite de un servicio de punto de conexión.  
**Objetivo:**detectar destinos en mal estado del servicio de punto de conexión.  
**Criterios de PromQL: **`sum({__name__="RstPacketsSent", "@instrumentation.@name"="cloudwatch.aws/privatelinkservices", ServiceId="SVC",LoadBalancerArn="LB",Az="AZ"}) > {{THRESHOLD}}`  
**Valor límite recomendado: **{{THRESHOLD}} (incrustado en la consulta)  
**Justificación del valor límite: **se establece según una tasa aceptable de paquetes RST.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **300  
**Periodo de recuperación: **300

## RDS
<a name="Recommended_PromQL_RDS"></a>

**CPUUtilization**  
**Etiquetas: **DBInstanceIdentifier  
**Descripción de la alarma: **alarma que se activa cuando el uso promedio de CPU supera el 90 % en una instancia de RDS.  
**Objetivo: **detectar un uso elevado de CPU que pueda degradar el rendimiento.  
**Criterios de PromQL: **`avg({__name__="CPUUtilization", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > 90`  
**Valor límite recomendado: **90 (incrustado en la consulta)  
**Justificación del valor límite: **un valor del 90 % indica que está cerca de alcanzar la saturación.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **300  
**Periodo de recuperación: **300

**DatabaseConnections**  
**Etiquetas: **DBInstanceIdentifier  
**Descripción de la alarma: **alarma que se activa cuando el número de conexiones a la base de datos supera el valor límite de una instancia de RDS.  
**Objetivo: **evitar que se rechacen conexiones al alcanzar el límite máximo.  
**Criterios de PromQL: **`avg({__name__="DatabaseConnections", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > {{THRESHOLD}}`  
**Valor límite recomendado: **{{THRESHOLD}} (incrustado en la consulta)  
**Justificación del valor límite: **se establece como un porcentaje del parámetro max\_connections.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **300  
**Periodo de recuperación: **300

**EBSByteBalance%**  
**Etiquetas: **DBInstanceIdentifier  
**Descripción de la alarma: **alarma que se activa cuando el saldo de bytes de EBS cae por debajo del 10 % en una instancia de RDS.  
**Objetivo: **detectar un nivel bajo de créditos de rendimiento que pueda provocar cuellos de botella.  
**Criterios de PromQL: **`avg({__name__="EBSByteBalance%", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) < 10`  
**Valor límite recomendado: **10 (incrustado en la consulta)  
**Justificación del valor límite: **un valor inferior al 10 % conlleva el riesgo de una degradación del rendimiento.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **180  
**Periodo de recuperación: **180

**EBSIOBalance%**  
**Etiquetas: **DBInstanceIdentifier  
**Descripción de la alarma: **alarma que se activa cuando el saldo de operaciones de E/S de EBS cae por debajo del 10 % en una instancia de RDS.  
**Objetivo: **detectar un nivel bajo de créditos de operaciones de entrada/salida por segundo (IOPS) que pueda provocar cuellos de botella.  
**Criterios de PromQL: **`avg({__name__="EBSIOBalance%", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) < 10`  
**Valor límite recomendado: **10 (incrustado en la consulta)  
**Justificación del valor límite: **un valor inferior al 10 % conlleva el riesgo de una degradación de las operaciones de entrada/salida por segundo (IOPS).  
**Intervalo de evaluación: **60  
**Periodo pendiente: **180  
**Periodo de recuperación: **180

**FreeableMemory**  
**Etiquetas: **DBInstanceIdentifier  
**Descripción de la alarma: **alarma que se activa cuando la memoria disponible cae por debajo del valor límite en una instancia de RDS.  
**Objetivo: **evitar que la falta de memoria provoque el rechazo de conexiones.  
**Criterios de PromQL: **`avg({__name__="FreeableMemory", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) < {{THRESHOLD}}`  
**Valor límite recomendado: **{{THRESHOLD}} (incrustado en la consulta)  
**Justificación del valor límite: **se establece según la memoria de la clase de instancia.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **900  
**Periodo de recuperación: **900

**FreeLocalStorage**  
**Etiquetas: **DBInstanceIdentifier  
**Descripción de la alarma: **alarma que se activa cuando el almacenamiento local disponible cae por debajo del valor límite en una instancia de Aurora.  
**Objetivo: **evitar que se agote el almacenamiento local de Aurora.  
**Criterios de PromQL: **`avg({__name__="FreeLocalStorage", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) < {{THRESHOLD}}`  
**Valor límite recomendado: **{{THRESHOLD}} (incrustado en la consulta)  
**Justificación del valor límite: **se establece según el mínimo necesario para las operaciones.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **300  
**Periodo de recuperación: **300

**FreeStorageSpace**  
**Etiquetas: **DBInstanceIdentifier  
**Descripción de la alarma: **alarma que se activa cuando el espacio de almacenamiento disponible cae por debajo del valor límite en una instancia de RDS.  
**Objetivo: **evitar tiempo de inactividad causado por el agotamiento del almacenamiento.  
**Criterios de PromQL: **`min({__name__="FreeStorageSpace", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) < {{THRESHOLD}}`  
**Valor límite recomendado: **{{THRESHOLD}} (incrustado en la consulta)  
**Justificación del valor límite: **se establece según la tasa de crecimiento del almacenamiento y el tamaño aprovisionado.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **300  
**Periodo de recuperación: **300

**MaximumUsedTransactionIDs**  
**Etiquetas: **DBInstanceIdentifier  
**Descripción de la alarma: **alarma que se activa cuando el número máximo de ID de transacción utilizados supera los 1000 millones en una instancia de RDS.  
**Objetivo: **evitar el reinicio cíclico de los ID de transacción de PostgreSQL.  
**Criterios de PromQL: **`avg({__name__="MaximumUsedTransactionIDs", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > 1000000000`  
**Valor límite recomendado: **1000000000 (incrustado en la consulta)  
**Justificación del valor límite: **un valor de 1000 millones indica que se aproxima el riesgo de reinicio cíclico.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **60  
**Período de recuperación: **60

**ReadLatency**  
**Etiquetas: **DBInstanceIdentifier  
**Descripción de la alarma: **alarma que se activa cuando la latencia de lectura p90 supera el valor límite en una instancia de RDS.  
**Objetivo: **detectar una latencia de lectura elevada que indique problemas de disco.  
**Criterios de PromQL: **`histogram_quantile(0.9, {__name__="ReadLatency", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > {{THRESHOLD}}`  
**Valor límite recomendado: **{{THRESHOLD}} (incrustado en la consulta)  
**Justificación del valor límite: **se establece según la latencia aceptable para la aplicación.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **300  
**Periodo de recuperación: **300

**ReplicaLag**  
**Etiquetas: **DBInstanceIdentifier  
**Descripción de la alarma: **alarma que se activa cuando el retraso de replicación supera los 60 segundos en una réplica de lectura de RDS.  
**Objetivo: **detectar retrasos en la replicación que puedan provocar la pérdida de datos.  
**Criterios de PromQL: **`max({__name__="ReplicaLag", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > 60`  
**Valor límite recomendado: **60 (incrustado en la consulta)  
**Justificación del valor límite: **un retraso de 60 segundos es significativo para la mayoría de las cargas de trabajo.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **600  
**Periodo de recuperación: **600

**WriteLatency**  
**Etiquetas: **DBInstanceIdentifier  
**Descripción de la alarma: **alarma que se activa cuando la latencia de escritura p90 supera el valor límite en una instancia de RDS.  
**Objetivo: **detectar una latencia de escritura elevada que indique problemas de disco.  
**Criterios de PromQL: **`histogram_quantile(0.9, {__name__="WriteLatency", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > {{THRESHOLD}}`  
**Valor límite recomendado: **{{THRESHOLD}} (incrustado en la consulta)  
**Justificación del valor límite: **se establece según la latencia aceptable para la aplicación.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **300  
**Periodo de recuperación: **300

**DBLoad**  
**Etiquetas: **DBInstanceIdentifier  
**Descripción de la alarma: **alarma que se activa cuando la carga promedio de la base de datos supera el valor límite en una instancia de RDS.  
**Objetivo: **detectar una carga elevada de la base de datos que degrade el rendimiento.  
**Criterios de PromQL: **`avg({__name__="DBLoad", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > {{THRESHOLD}}`  
**Valor límite recomendado: **{{THRESHOLD}} (incrustado en la consulta)  
**Justificación del valor límite: **se establece en un múltiplo del número de vCPU.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **900  
**Periodo de recuperación: **900

**AuroraVolumeBytesLeftTotal**  
**Etiquetas: **DBClusterIdentifier  
**Descripción de la alarma: **alarma que se activa cuando los bytes de almacenamiento restantes de un clúster de Aurora caen por debajo del valor límite.  
**Objetivo: **evitar que se agote el almacenamiento del clúster de Aurora.  
**Criterios de PromQL: **`avg({__name__="AuroraVolumeBytesLeftTotal", "@instrumentation.@name"="cloudwatch.aws/rds", DBClusterIdentifier="CLUSTER"}) < {{THRESHOLD}}`  
**Valor límite recomendado: **{{THRESHOLD}} (incrustado en la consulta)  
**Justificación del valor límite: **se establece según la tasa de crecimiento.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **300  
**Periodo de recuperación: **300

**AuroraBinlogReplicaLag**  
**Etiquetas: **DBClusterIdentifier  
**Descripción de la alarma: **alarma que se activa cuando el retraso de la réplica de binlog de Aurora indica un estado de error.  
**Objetivo: **detectar errores de replicación de la instancia de escritura.  
**Criterios de PromQL: **`avg({__name__="AuroraBinlogReplicaLag", "@instrumentation.@name"="cloudwatch.aws/rds", DBClusterIdentifier="CLUSTER"}) <= -1`  
**Valor límite recomendado: **1 (incrustado en la consulta)  
**Justificación del valor límite: **un valor de 1 indica un estado de error.  
**Intervalo de evaluación: **60  
**Período pendiente: **120  
**Periodo de recuperación: **120

**BlockedTransactions**  
**Etiquetas: **DBInstanceIdentifier  
**Descripción de la alarma: **alarma que se activa cuando el número de transacciones bloqueadas supera el valor límite en una instancia de RDS.  
**Objetivo: **detectar el bloqueo de transacciones que provoque una degradación del rendimiento.  
**Criterios de PromQL: **`avg({__name__="BlockedTransactions", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > {{THRESHOLD}}`  
**Valor límite recomendado: **{{THRESHOLD}} (incrustado en la consulta)  
**Justificación del valor límite: **se establece según el número aceptable de transacciones bloqueadas.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **300  
**Periodo de recuperación: **300

**BufferCacheHitRatio**  
**Etiquetas: **DBInstanceIdentifier  
**Descripción de la alarma: **alarma que se activa cuando la tasa de aciertos de la caché de búfer cae por debajo del 80 % en una instancia de RDS.  
**Objetivo: **detectar una baja eficiencia de la caché que provoque una disminución del rendimiento.  
**Criterios de PromQL: **`avg({__name__="BufferCacheHitRatio", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) < 80`  
**Valor límite recomendado: **80 (incrustado en la consulta)  
**Justificación del valor límite: **un valor inferior al 80 % indica un uso excesivo de las operaciones de operaciones de E/S de disco.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **600  
**Periodo de recuperación: **600

**EngineUptime**  
**Etiquetas: **DBClusterIdentifier  
**Descripción de la alarma: **alarma que se activa cuando el tiempo de actividad del motor cae a cero, lo que indica el reinicio de una instancia de escritura de Aurora.  
**Objetivo: **detectar un tiempo de inactividad o un bloqueo de la instancia de escritura de Aurora.  
**Criterios de PromQL: **`avg({__name__="EngineUptime", "@instrumentation.@name"="cloudwatch.aws/rds", DBClusterIdentifier="CLUSTER"}) <= 0`  
**Valor límite recomendado: **0 (incrustado en la consulta)  
**Justificación del valor límite: **un tiempo de actividad de cero indica un reinicio de la instancia.  
**Intervalo de evaluación: **60  
**Período pendiente: **120  
**Periodo de recuperación: **120

**RollbackSegmentHistoryListLength**  
**Etiquetas: **DBInstanceIdentifier  
**Descripción de la alarma: **alarma que se activa cuando la longitud de la lista de historial de segmentos de reversión supera 1 millón en una instancia de Aurora.  
**Objetivo: **detectar un historial de reversión elevado que provoque una degradación del rendimiento de la CPU.  
**Criterios de PromQL: **`avg({__name__="RollbackSegmentHistoryListLength", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > 1000000`  
**Valor límite recomendado: **1000000 (incrustado en la consulta)  
**Justificación del valor límite: **un valor superior a 1 millón provoca problemas de rendimiento.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **300  
**Periodo de recuperación: **300

**StorageNetworkThroughput**  
**Etiquetas: **DBClusterIdentifier  
**Descripción de la alarma: **alarma que se activa cuando el rendimiento de la red de almacenamiento supera el valor límite en un clúster de Aurora.  
**Objetivo: **detectar un rendimiento elevado que pueda provocar el descarte de paquetes de red.  
**Criterios de PromQL: **`avg({__name__="StorageNetworkThroughput", "@instrumentation.@name"="cloudwatch.aws/rds", DBClusterIdentifier="CLUSTER"}) > {{THRESHOLD}}`  
**Valor límite recomendado: **{{THRESHOLD}} (incrustado en la consulta)  
**Justificación del valor límite: **se establece según la capacidad de red de la instancia.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **300  
**Periodo de recuperación: **300

## Route 53
<a name="Recommended_PromQL_Route53"></a>

**HealthCheckStatus**  
**Etiquetas: **HealthCheckId  
**Descripción de la alarma: **alarma que se activa cuando una comprobación de estado de Route 53 informa de un punto de conexión en mal estado.  
**Objetivo:** detectar puntos de conexión en mal estado mediante las comprobaciones de estado de Route 53.  
**Criterios de PromQL: **`avg({__name__="HealthCheckStatus", "@instrumentation.@name"="cloudwatch.aws/route53", HealthCheckId="HC"}) < 1`  
**Valor límite recomendado: **1 (incrustado en la consulta)  
**Justificación del valor límite: **un valor inferior a 1 indica que el punto de conexión no supera las comprobaciones de estado.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **180  
**Periodo de recuperación: **180

## S3
<a name="Recommended_PromQL_S3"></a>

**4xxErrors**  
**Etiquetas: **BucketName, FilterId  
**Descripción de la alarma: **alarma que se activa cuando la tasa de errores 4xx supera el 5 % en un bucket de S3.  
**Objetivo: **detectar tasas anómalas de errores del cliente.  
**Criterios de PromQL: **`avg({__name__="4xxErrors", "@instrumentation.@name"="cloudwatch.aws/s3", BucketName="BUCKET",FilterId="FILTER"}) > 0.05`  
**Valor límite recomendado: **0,05 (incrustado en la consulta)  
**Justificación del valor límite: **un valor superior al 5 % indica problemas de configuración o acceso.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **900  
**Periodo de recuperación: **900

**5xxErrors**  
**Etiquetas: **BucketName, FilterId  
**Descripción de la alarma: **alarma que se activa cuando la tasa de errores 5xx supera el 5 % en un bucket de S3.  
**Objetivo: **detectar errores del servidor que afecten a la aplicación.  
**Criterios de PromQL: **`avg({__name__="5xxErrors", "@instrumentation.@name"="cloudwatch.aws/s3", BucketName="BUCKET",FilterId="FILTER"}) > 0.05`  
**Valor límite recomendado: **0,05 (incrustado en la consulta)  
**Justificación del valor límite: **un valor superior al 5 % indica problemas con el servicio S3.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **900  
**Periodo de recuperación: **900

**OperationsFailedReplication**  
**Etiquetas: **SourceBucket, DestinationBucket, RuleId  
**Descripción de la alarma: **alarma que se activa cuando fallan las operaciones de replicación de S3 de un bucket.  
**Objetivo: **detectar errores de replicación que puedan provocar incoherencias en los datos.  
**Criterios de PromQL: **`max({__name__="OperationsFailedReplication", "@instrumentation.@name"="cloudwatch.aws/s3", SourceBucket="SRC",DestinationBucket="DST",RuleId="RULE"}) > 0`  
**Valor límite recomendado: **0 (incrustado en la consulta)  
**Justificación del valor límite: **cualquier error de replicación requiere una investigación.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **300  
**Periodo de recuperación: **300

## S3 Object Lambda
<a name="Recommended_PromQL_S3ObjectLambda"></a>

**4xxErrors**  
**Etiquetas: **AccessPointName, DataSourceARN  
**Descripción de la alarma: **alarma que se activa cuando la tasa de errores 4xx supera el 5 % en un punto de acceso de S3 Object Lambda.  
**Objetivo: **detectar tasas anómalas de errores del cliente en Object Lambda.  
**Criterios de PromQL: **`avg({__name__="4xxErrors", "@instrumentation.@name"="cloudwatch.aws/s3objectlambda", AccessPointName="AP",DataSourceARN="ARN"}) > 0.05`  
**Valor límite recomendado: **0,05 (incrustado en la consulta)  
**Justificación del valor límite: **un valor superior al 5 % indica problemas de configuración.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **900  
**Periodo de recuperación: **900

**5xxErrors**  
**Etiquetas: **AccessPointName, DataSourceARN  
**Descripción de la alarma: **alarma que se activa cuando la tasa de errores 5xx supera el 5 % en un punto de acceso de S3 Object Lambda.  
**Objetivo: **detectar errores del servidor en Object Lambda.  
**Criterios de PromQL: **`avg({__name__="5xxErrors", "@instrumentation.@name"="cloudwatch.aws/s3objectlambda", AccessPointName="AP",DataSourceARN="ARN"}) > 0.05`  
**Valor límite recomendado: **0,05 (incrustado en la consulta)  
**Justificación del valor límite: **un valor superior al 5 % indica problemas con Lambda o S3.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **900  
**Periodo de recuperación: **900

**LambdaResponse4xx**  
**Etiquetas: **AccessPointName, DataSourceARN  
**Descripción de la alarma: **alarma que se activa cuando la tasa de respuestas 4xx de la función de Lambda supera el 5 % en un punto de acceso de S3 Object Lambda.  
**Objetivo: **detectar errores del cliente de la función de Lambda.  
**Criterios de PromQL: **`avg({__name__="LambdaResponse4xx", "@instrumentation.@name"="cloudwatch.aws/s3objectlambda", AccessPointName="AP",DataSourceARN="ARN"}) > 0.05`  
**Valor límite recomendado: **0,05 (incrustado en la consulta)  
**Justificación del valor límite: **un valor superior al 5 % indica problemas con la función de Lambda.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **900  
**Periodo de recuperación: **900

## SNS
<a name="Recommended_PromQL_SNS"></a>

**NumberOfMessagesPublished**  
**Etiquetas: **TopicName  
**Descripción de la alarma: **alarma que se activa cuando el número de mensajes publicados cae por debajo del valor límite en un tema de SNS.  
**Objetivo: **detectar una disminución significativa del volumen de publicación.  
**Criterios de PromQL: **`sum({__name__="NumberOfMessagesPublished", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) < {{THRESHOLD}}`  
**Valor límite recomendado: **{{THRESHOLD}} (incrustado en la consulta)  
**Justificación del valor límite: **se establece según el volumen mínimo de tráfico esperado.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **300  
**Periodo de recuperación: **300

**NumberOfNotificationsDelivered**  
**Etiquetas: **TopicName  
**Descripción de la alarma: **alarma que se activa cuando el número de notificaciones entregadas cae por debajo del valor límite en un tema de SNS.  
**Objetivo: **detectar una disminución del volumen de entrega de notificaciones.  
**Criterios de PromQL: **`sum({__name__="NumberOfNotificationsDelivered", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) < {{THRESHOLD}}`  
**Valor límite recomendado: **{{THRESHOLD}} (incrustado en la consulta)  
**Justificación del valor límite: **se establece según el número mínimo de entregas esperado.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **300  
**Periodo de recuperación: **300

**NumberOfNotificationsFailed**  
**Etiquetas: **TopicName  
**Descripción de la alarma: **alarma que se activa cuando el número de errores de entrega de notificaciones supera el valor límite en un tema de SNS.  
**Objetivo: **detectar errores de entrega.  
**Criterios de PromQL: **`sum({__name__="NumberOfNotificationsFailed", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) > {{THRESHOLD}}`  
**Valor límite recomendado: **{{THRESHOLD}} (incrustado en la consulta)  
**Justificación del valor límite: **se establece según la tasa de errores aceptable.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **300  
**Periodo de recuperación: **300

**NumberOfNotificationsFilteredOut-InvalidAttributes**  
**Etiquetas: **TopicName  
**Descripción de la alarma: **alarma que se activa cuando se filtran notificaciones debido a atributos de mensaje no válidos.  
**Objetivo: **detectar atributos de mensaje no válidos.  
**Criterios de PromQL: **`sum({__name__="NumberOfNotificationsFilteredOut-InvalidAttributes", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) > 0`  
**Valor límite recomendado: **0 (incrustado en la consulta)  
**Justificación del valor límite: **cualquier filtrado debido a atributos no válidos indica una configuración incorrecta.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **300  
**Periodo de recuperación: **300

**NumberOfNotificationsFilteredOut-InvalidMessageBody**  
**Etiquetas: **TopicName  
**Descripción de la alarma: **alarma que se activa cuando se filtran notificaciones debido a cuerpos de mensaje no válidos.  
**Objetivo: **detectar cuerpos de mensaje no válidos.  
**Criterios de PromQL: **`sum({__name__="NumberOfNotificationsFilteredOut-InvalidMessageBody", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) > 0`  
**Valor límite recomendado: **0 (incrustado en la consulta)  
**Justificación del valor límite: **cualquier filtrado debido a atributos no válidos indica una configuración incorrecta.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **300  
**Periodo de recuperación: **300

**NumberOfNotificationsRedrivenToDlq**  
**Etiquetas: **TopicName  
**Descripción de la alarma: **alarma que se activa cuando se envían notificaciones a la cola de mensajes fallidos de un tema de SNS.  
**Objetivo: **detectar mensajes enviados a la cola de mensajes fallidos (DLQ).  
**Criterios de PromQL: **`sum({__name__="NumberOfNotificationsRedrivenToDlq", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) > 0`  
**Valor límite recomendado: **0 (incrustado en la consulta)  
**Justificación del valor límite: **cualquier mensaje enviado a la cola de mensajes fallidos (DLQ) indica problemas de entrega.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **300  
**Periodo de recuperación: **300

**NumberOfNotificationsFailedToRedriveToDlq**  
**Etiquetas: **TopicName  
**Descripción de la alarma: **alarma que se activa cuando las notificaciones no se pueden enviar a la cola de mensajes fallidos de un tema de SNS.  
**Objetivo:**detectar errores de entrega a la cola de mensajes fallidos (DLQ).  
**Criterios de PromQL: **`sum({__name__="NumberOfNotificationsFailedToRedriveToDlq", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) > 0`  
**Valor límite recomendado: **0 (incrustado en la consulta)  
**Justificación del valor límite: **un error de entrega a la cola de mensajes fallidos (DLQ) implica la pérdida del seguimiento de errores.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **300  
**Periodo de recuperación: **300

**SMSMonthToDateSpentUSD**  
**Etiquetas: **TopicName  
**Descripción de la alarma: **alarma que se activa cuando el gasto en SMS se aproxima a la cuota de la cuenta para un tema de SNS.  
**Objetivo: **detectar cuándo el gasto en SMS se aproxima a la cuota.  
**Criterios de PromQL: **`max({__name__="SMSMonthToDateSpentUSD", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) > {{THRESHOLD}}`  
**Valor límite recomendado: **{{THRESHOLD}} (incrustado en la consulta)  
**Justificación del valor límite: **se establece según la cuota de gasto en SMS de la cuenta.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **300  
**Periodo de recuperación: **300

**SMSSuccessRate**  
**Etiquetas: **TopicName  
**Descripción de la alarma: **alarma que se activa cuando la tasa de entregas correctas de SMS cae por debajo del valor límite en un tema de SNS.  
**Objetivo: **detectar una disminución de las entregas de SMS.  
**Criterios de PromQL: **`avg({__name__="SMSSuccessRate", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) < {{THRESHOLD}}`  
**Valor límite recomendado: **{{THRESHOLD}} (incrustado en la consulta)  
**Justificación del valor límite: **se establece según la tasa de entrega aceptable.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **300  
**Periodo de recuperación: **300

## SQS
<a name="Recommended_PromQL_SQS"></a>

**ApproximateAgeOfOldestMessage**  
**Etiquetas: **QueueName  
**Descripción de la alarma: **alarma que se activa cuando la antigüedad del mensaje más antiguo supera el valor límite en una cola de SQS.  
**Objetivo: **detectar mensajes que no se procesan con la rapidez necesaria.  
**Criterios de PromQL: **`max({__name__="ApproximateAgeOfOldestMessage", "@instrumentation.@name"="cloudwatch.aws/sqs", QueueName="QUEUE"}) > {{THRESHOLD}}`  
**Valor límite recomendado: **{{THRESHOLD}} (incrustado en la consulta)  
**Justificación del valor límite: **se establece según el tiempo de procesamiento de mensajes aceptable.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **900  
**Periodo de recuperación: **900

**ApproximateNumberOfMessagesNotVisible**  
**Etiquetas: **QueueName  
**Descripción de la alarma: **alarma que se activa cuando el número de mensajes en tránsito supera el valor límite en una cola de SQS.  
**Objetivo: **detectar un número elevado de mensajes en tránsito que indique problemas con los consumidores.  
**Criterios de PromQL: **`avg({__name__="ApproximateNumberOfMessagesNotVisible", "@instrumentation.@name"="cloudwatch.aws/sqs", QueueName="QUEUE"}) > {{THRESHOLD}}`  
**Valor límite recomendado: **{{THRESHOLD}} (incrustado en la consulta)  
**Justificación del valor límite: **se establece según el volumen de procesamiento previsto.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **900  
**Periodo de recuperación: **900

**ApproximateNumberOfMessagesVisible**  
**Etiquetas: **QueueName  
**Descripción de la alarma: **alarma que se activa cuando el número de mensajes visibles supera el valor límite de una cola de SQS.  
**Objetivo**: detectar una acumulación de mensajes que indique que los consumidores procesan los mensajes con lentitud.  
**Criterios de PromQL: **`avg({__name__="ApproximateNumberOfMessagesVisible", "@instrumentation.@name"="cloudwatch.aws/sqs", QueueName="QUEUE"}) > {{THRESHOLD}}`  
**Valor límite recomendado: **{{THRESHOLD}} (incrustado en la consulta)  
**Justificación del valor límite: **se establece según la profundidad prevista de la cola.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **900  
**Periodo de recuperación: **900

**NumberOfMessagesSent**  
**Etiquetas: **QueueName  
**Descripción de la alarma: **alarma que se activa cuando no se envían mensajes a una cola de SQS.  
**Objetivo: **detectar cuándo los productores dejan de enviar mensajes.  
**Criterios de PromQL: **`sum({__name__="NumberOfMessagesSent", "@instrumentation.@name"="cloudwatch.aws/sqs", QueueName="QUEUE"}) <= 0`  
**Valor límite recomendado: **0 (incrustado en la consulta)  
**Justificación del valor límite: **la ausencia de mensajes indica un error del productor.  
**Intervalo de evaluación: **60  
**Periodo pendiente: **900  
**Periodo de recuperación: **900

## VPN
<a name="Recommended_PromQL_VPN"></a>

**TunnelState (nivel de VPN)**  
**Etiquetas: **VpnId  
**Descripción de la alarma: **alarma que se activa cuando al menos un túnel de VPN se encuentra en estado inactivo.  
**Objetivo: **detectar si al menos un túnel se encuentra en estado inactivo.  
**Criterios de PromQL: **`min({__name__="TunnelState", "@instrumentation.@name"="cloudwatch.aws/vpn", VpnId="VPN"}) < 1`  
**Valor límite recomendado: **1 (incrustado en la consulta)  
**Justificación del valor límite: **un valor inferior a 1 indica que el túnel está inactivo.  
**Intervalo de evaluación: **300  
**Periodo pendiente: **900  
**Periodo de recuperación: **900

**TunnelState (nivel del túnel)**  
**Etiquetas: **TunnelIpAddress  
**Descripción de la alarma: **alarma que se activa cuando un túnel de VPN específico se encuentra en estado inactivo.  
**Objetivo: **detectar si un túnel específico se encuentra en estado inactivo.  
**Criterios de PromQL: **`min({__name__="TunnelState", "@instrumentation.@name"="cloudwatch.aws/vpn", TunnelIpAddress="IP"}) < 1`  
**Valor límite recomendado: **1 (incrustado en la consulta)  
**Justificación del valor límite: **un valor inferior a 1 indica que el túnel está inactivo.  
**Intervalo de evaluación: **300  
**Periodo pendiente: **900  
**Periodo de recuperación: **900