View a markdown version of this page

Alarmas de PromQL recomendadas - Amazon CloudWatch

Alarmas de PromQL recomendadas

Utilice estas alarmas de PromQL como equivalentes de las alarmas clásicas recomendadas. Supervisan las mismas métricas mediante consultas instantáneas de PromQL que se evalúan con respecto a las métricas ingeridas mediante el punto de conexión OTLP de CloudWatch.

Las alarmas de PromQL utilizan EvaluationCriteria con PromQLCriteria. A diferencia de las alarmas de métricas clásicas, el valor límite se incorpora directamente en la expresión de consulta de PromQL.

  • Periodo pendiente: duración, en segundos, durante la cual una serie de tiempo debe superar continuamente el valor límite antes de que la alarma pase al estado ALARM.

  • Periodo de recuperación: duración, en segundos, durante la cual todas las series de tiempo deben dejar de superar el valor límite antes de que la alarma vuelva al estado OK.

  • Intervalo de evaluación: frecuencia, en segundos, con la que CloudWatch ejecuta la consulta de PromQL.

nota

Estas alarmas requieren métricas publicadas mediante el punto de conexión OTLP de CloudWatch. Para obtener más información, consulte Alarmas PromQL.

Puede implementar estas alarmas mediante AWS CloudFormation. Utilice las propiedades EvaluationCriteria y PromQLCriteria en el recurso AWS::CloudWatch::Alarm.

API de REST

4XXError

Etiquetas: ApiName, Stage

Descripción de la alarma: alarma que se activa cuando la tasa promedio de errores 4XX supera el 5 % en una etapa de una API de REST.

Objetivo: detectar una tasa alta de errores del cliente que indique problemas con las solicitudes.

Criterios de PromQL: avg({__name__="4XXError", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiName="your-api-name",Stage="your-stage"}) > 0.05

Valor límite recomendado: 0,05 (incrustado en la consulta)

Justificación del valor límite: detecta una tasa de errores del cliente superior al 5 %, lo que indica errores significativos en las solicitudes.

Intervalo de evaluación: 60

Periodo pendiente: 300

Periodo de recuperación: 300

5XXError

Etiquetas: ApiName, Stage

Descripción de la alarma: alarma que se activa cuando la tasa promedio de errores 5XX supera el 5 % en una etapa de una API de REST.

Objetivo: detectar una tasa alta de errores del servidor que indique fallos del backend.

Criterios de PromQL: avg({__name__="5XXError", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiName="your-api-name",Stage="your-stage"}) > 0.05

Valor límite recomendado: 0,05 (incrustado en la consulta)

Justificación del valor límite: detecta una tasa de errores del servidor superior al 5 %, lo que requiere una investigación inmediata.

Intervalo de evaluación: 60

Periodo pendiente: 180

Periodo de recuperación: 300

Latencia

Etiquetas: ApiName, Stage

Descripción de la alarma: alarma que se activa cuando la latencia p90 supera los 2500 ms en una etapa de una API de REST.

Objetivo: detectar una latencia p90 alta que afecte a la experiencia del usuario.

Criterios de PromQL: histogram_quantile(0.9, {__name__="Latency", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiName="your-api-name",Stage="your-stage"}) > 2500

Valor límite recomendado: 2500 (incrustado en la consulta)

Justificación del valor límite: una latencia p90 superior a 2500 ms indica tiempos de respuesta deficientes para la mayoría de las solicitudes.

Intervalo de evaluación: 60

Periodo pendiente: 300

Periodo de recuperación: 300

recuento

Etiquetas: ApiName, Stage

Descripción de la alarma: alarma que se activa cuando el recuento total de solicitudes cae por debajo del valor de referencia esperado para una etapa de una API de REST.

Objetivo: detectar un volumen bajo de tráfico que podría indicar problemas de enrutamiento o disponibilidad.

Criterios de PromQL: sum({__name__="Count", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiName="your-api-name",Stage="your-stage"}) < THRESHOLD

Valor límite recomendado: THRESHOLD (incrustado en la consulta)

Justificación del valor límite: dstablézcalo según el valor de referencia de tráfico esperado para detectar disminuciones inesperadas.

Intervalo de evaluación: 60

Periodo pendiente: 600

Periodo de recuperación: 300

API HTTP

4XX

Etiquetas: ApiId, Stage

Descripción de la alarma: alarma que se activa cuando la tasa promedio de errores 4xx supera el 5 % en una etapa de una API HTTP.

Objetivo: detectar una tasa alta de errores del cliente en los puntos de conexión de la API HTTP.

Criterios de PromQL: avg({__name__="4xx", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="your-api-id",Stage="your-stage"}) > 0.05

Valor límite recomendado: 0,05 (incrustado en la consulta)

Justificación del valor límite: detecta una tasa de errores del cliente superior al 5 %.

Intervalo de evaluación: 60

Periodo pendiente: 300

Periodo de recuperación: 300

5xx

Etiquetas: ApiId, Stage

Descripción de la alarma: alarma que se activa cuando la tasa promedio de errores 5xx supera el 5 % en una etapa de una API HTTP.

Objetivo: detectar una tasa alta de errores del servidor en los puntos de conexión de la API HTTP.

Criterios de PromQL: avg({__name__="5xx", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="your-api-id",Stage="your-stage"}) > 0.05

Valor límite recomendado: 0,05 (incrustado en la consulta)

Justificación del valor límite: detecta una tasa de errores del servidor superior al 5 %, lo que requiere una investigación.

Intervalo de evaluación: 60

Periodo pendiente: 180

Periodo de recuperación: 300

Latencia

Etiquetas: ApiId, Stage

Descripción de la alarma: alarma que se activa cuando la latencia p90 supera los 2500 ms en una etapa de una API HTTP.

Objetivo: detectar una latencia p90 alta en los puntos de conexión de la API HTTP.

Criterios de PromQL: histogram_quantile(0.9, {__name__="Latency", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="your-api-id",Stage="your-stage"}) > 2500

Valor límite recomendado: 2500 (incrustado en la consulta)

Justificación del valor límite: una latencia p90 superior a 2500 ms indica tiempos de respuesta deficientes.

Intervalo de evaluación: 60

Periodo pendiente: 300

Periodo de recuperación: 300

IntegrationLatency

Etiquetas: ApiId, Stage

Descripción de la alarma: alarma que se activa cuando la latencia de integración p90 supera los 2000 ms en una etapa de una API HTTP.

Objetivo: detectar una latencia alta en la integración con el backend que afecte a los tiempos de respuesta.

Criterios de PromQL: histogram_quantile(0.9, {__name__="IntegrationLatency", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="your-api-id",Stage="your-stage"}) > 2000

Valor límite recomendado: 2000 (incrustado en la consulta)

Justificación del valor límite: una latencia de integración p90 superior a 2000 ms indica lentitud en el backend.

Intervalo de evaluación: 60

Periodo pendiente: 300

Periodo de recuperación: 300

recuento

Etiquetas: ApiId, Stage

Descripción de la alarma: alarma que se activa cuando el recuento total de solicitudes cae por debajo del valor de referencia esperado para una etapa de una API HTTP.

Objetivo: detectar un volumen bajo de tráfico que podría indicar problemas de enrutamiento o disponibilidad.

Criterios de PromQL: sum({__name__="Count", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="your-api-id",Stage="your-stage"}) < THRESHOLD

Valor límite recomendado: THRESHOLD (incrustado en la consulta)

Justificación del valor límite: dstablézcalo según el valor de referencia de tráfico esperado para detectar disminuciones inesperadas.

Intervalo de evaluación: 60

Periodo pendiente: 600

Periodo de recuperación: 300

API de WebSocket

ClientError

Etiquetas: ApiId, Stage

Descripción de la alarma: alarma que se activa cuando la tasa promedio de errores del cliente supera el 5 % en una etapa de una API de WebSocket.

Objetivo: detectar una tasa alta de errores del cliente en las conexiones de la API de WebSocket.

Criterios de PromQL: avg({__name__="ClientError", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="your-api-id",Stage="your-stage"}) > 0.05

Valor límite recomendado: 0,05 (incrustado en la consulta)

Justificación del valor límite: detecta una tasa de errores del cliente superior al 5 % en las conexiones de WebSocket.

Intervalo de evaluación: 60

Periodo pendiente: 300

Periodo de recuperación: 300

ExecutionError

Etiquetas: ApiId, Stage

Descripción de la alarma: alarma que se activa cuando la tasa promedio de errores de ejecución supera el 5 % en una etapa de una API de WebSocket.

Objetivo: detectar una tasa alta de errores de ejecución del servidor en las API de WebSocket.

Criterios de PromQL: avg({__name__="ExecutionError", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="your-api-id",Stage="your-stage"}) > 0.05

Valor límite recomendado: 0,05 (incrustado en la consulta)

Justificación del valor límite: detecta una tasa de errores de ejecución superior al 5 %, lo que requiere una investigación.

Intervalo de evaluación: 60

Periodo pendiente: 180

Periodo de recuperación: 300

IntegrationLatency

Etiquetas: ApiId, Stage

Descripción de la alarma: alarma que se activa cuando la latencia de integración p90 supera los 2000 ms en una etapa de una API de WebSocket.

Objetivo: detectar una latencia alta en la integración con el backend en las rutas de la API de WebSocket.

Criterios de PromQL: histogram_quantile(0.9, {__name__="IntegrationLatency", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="your-api-id",Stage="your-stage"}) > 2000

Valor límite recomendado: 2000 (incrustado en la consulta)

Justificación del valor límite: una latencia de integración p90 superior a 2000 ms indica lentitud en el backend.

Intervalo de evaluación: 60

Periodo pendiente: 300

Periodo de recuperación: 300

MessageCount

Etiquetas: ApiId, Stage

Descripción de la alarma: alarma que se activa cuando el recuento total de mensajes cae por debajo del valor de referencia esperado para una etapa de una API de WebSocket.

Objetivo: detectar un volumen bajo de mensajes que podría indicar problemas de conexión o enrutamiento.

Criterios de PromQL: sum({__name__="MessageCount", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="your-api-id",Stage="your-stage"}) < THRESHOLD

Valor límite recomendado: THRESHOLD (incrustado en la consulta)

Justificación del valor límite: se establece según el volumen de mensajes esperado para detectar disminuciones inesperadas.

Intervalo de evaluación: 60

Periodo pendiente: 600

Periodo de recuperación: 300

GroupInServiceCapacity

Etiquetas: AutoScalingGroupName

Descripción de la alarma: alarma que se activa cuando la capacidad promedio en servicio cae por debajo del mínimo esperado para un grupo de escalado automático.

Objetivo: detectar una disponibilidad baja debido a errores de lanzamiento o instancias terminadas.

Criterios de PromQL: avg({__name__="GroupInServiceCapacity", "@instrumentation.@name"="cloudwatch.aws/autoscaling", AutoScalingGroupName="your-auto-scaling-group-name"}) < THRESHOLD

Valor límite recomendado: THRESHOLD (incrustado en la consulta)

Justificación del valor límite: se establece según la capacidad mínima deseada para detectar errores de lanzamiento o un número insuficiente de instancias.

Intervalo de evaluación: 60

Periodo pendiente: 600

Periodo de recuperación: 600

DaysToExpiry

Etiquetas: CertificateArn

Descripción de la alarma: alarma que se activa cuando el número mínimo de días hasta el vencimiento del certificado disminuye a 44 días o menos.

Objetivo: generar una alerta proactiva sobre el vencimiento del certificado para disponer de tiempo suficiente para renovarlo.

Criterios de PromQL: min({__name__="DaysToExpiry", "@instrumentation.@name"="cloudwatch.aws/certificatemanager", CertificateArn="your-certificate-arn"}) <= 44

Valor límite recomendado: 44 (incrustado en la consulta)

Justificación del valor límite: proporciona un margen suficiente antes del vencimiento del certificado para completar el proceso de renovación.

Intervalo de evaluación: 86400

Periodo pendiente: 86400

Periodo de recuperación: 86400

5xxErrorRate

Etiquetas: DistributionId

Descripción de la alarma: alarma que se activa cuando la tasa promedio de errores 5xx supera el valor límite en una distribución de CloudFront.

Objetivo: detectar una tasa alta de errores del origen o de CloudFront que afecte a la entrega de contenido.

Criterios de PromQL: avg({__name__="5xxErrorRate", "@instrumentation.@name"="cloudwatch.aws/cloudfront", DistributionId="your-distribution-id"}) > THRESHOLD

Valor límite recomendado: THRESHOLD (incrustado en la consulta)

Justificación del valor límite: se establece según la tasa de errores aceptable para la entrega de contenido.

Intervalo de evaluación: 60

Periodo pendiente: 300

Periodo de recuperación: 300

OriginLatency

Etiquetas: DistributionId

Descripción de la alarma: alarma que se activa cuando la latencia p90 del origen supera el valor límite en una distribución de CloudFront.

Objetivo: detectar una latencia alta de respuesta del origen que afecte al rendimiento de la entrega de contenido.

Criterios de PromQL: histogram_quantile(0.9, {__name__="OriginLatency", "@instrumentation.@name"="cloudwatch.aws/cloudfront", DistributionId="your-distribution-id"}) > THRESHOLD

Valor límite recomendado: THRESHOLD (incrustado en la consulta)

Justificación del valor límite: se establece según el tiempo de respuesta esperado del origen y la estrategia de almacenamiento en caché.

Intervalo de evaluación: 60

Periodo pendiente: 300

Periodo de recuperación: 300

FunctionValidationErrors

Etiquetas: DistributionId, FunctionName

Descripción de la alarma: alarma que se activa cuando se produce algún error de validación de una función de CloudFront.

Objetivo: detectar errores de validación de funciones de CloudFront que impidan la ejecución de la función.

Criterios de PromQL: sum({__name__="FunctionValidationErrors", "@instrumentation.@name"="cloudwatch.aws/cloudfront", DistributionId="your-distribution-id",FunctionName="your-function-name"}) > 0

Valor límite recomendado: 0 (incrustado en la consulta)

Justificación del valor límite: cualquier error de validación indica un problema de configuración de la función que requiere atención.

Intervalo de evaluación: 60

Período pendiente: 120

Periodo de recuperación: 120

FunctionExecutionErrors

Etiquetas: DistributionId, FunctionName

Descripción de la alarma: alarma que se activa cuando se produce algún error de ejecución de una función de CloudFront.

Objetivo: detectar errores durante el tiempo de ejecución de las funciones de CloudFront que afecten al procesamiento de solicitudes.

Criterios de PromQL: sum({__name__="FunctionExecutionErrors", "@instrumentation.@name"="cloudwatch.aws/cloudfront", DistributionId="your-distribution-id",FunctionName="your-function-name"}) > 0

Valor límite recomendado: 0 (incrustado en la consulta)

Justificación del valor límite: cualquier error de ejecución indica un problema durante el tiempo de ejecución en el código de la función.

Intervalo de evaluación: 60

Periodo pendiente: 300

Periodo de recuperación: 300

FunctionThrottles

Etiquetas: DistributionId, FunctionName

Descripción de la alarma: alarma que se activa cuando se produce alguna limitación controlada en una función de CloudFront.

Objetivo: detectar la limitación controlada de funciones de CloudFront que podría afectar al procesamiento de solicitudes.

Criterios de PromQL: sum({__name__="FunctionThrottles", "@instrumentation.@name"="cloudwatch.aws/cloudfront", DistributionId="your-distribution-id",FunctionName="your-function-name"}) > 0

Valor límite recomendado: 0 (incrustado en la consulta)

Justificación del valor límite: cualquier limitación controlada indica que la función está alcanzando los límites de computación.

Intervalo de evaluación: 60

Periodo pendiente: 300

Periodo de recuperación: 300

SignUpThrottles

Etiquetas: UserPool, UserPoolClient

Descripción de la alarma: alarma que se activa cuando los eventos de limitación controlada del registro superan el valor límite en un grupo de usuarios.

Objetivo: detectar la limitación controlada del registro que impide registrar usuarios nuevos.

Criterios de PromQL: sum({__name__="SignUpThrottles", "@instrumentation.@name"="cloudwatch.aws/cognito", UserPool="your-user-pool",UserPoolClient="your-user-pool-client"}) > THRESHOLD

Valor límite recomendado: THRESHOLD (incrustado en la consulta)

Justificación del valor límite: establézcalo según la tasa aceptable de limitación controlada para las operaciones de registro.

Intervalo de evaluación: 60

Periodo pendiente: 300

Periodo de recuperación: 300

SignInThrottles

Etiquetas: UserPool, UserPoolClient

Descripción de la alarma: alarma que se activa cuando los eventos de limitación controlada del inicio de sesión superan el valor límite en un grupo de usuarios.

Objetivo: detectar la limitación controlada del inicio de sesión que impide autenticar a los usuarios.

Criterios de PromQL: sum({__name__="SignInThrottles", "@instrumentation.@name"="cloudwatch.aws/cognito", UserPool="your-user-pool",UserPoolClient="your-user-pool-client"}) > THRESHOLD

Valor límite recomendado: THRESHOLD (incrustado en la consulta)

Justificación del valor límite: se establece según la tasa aceptable de limitación controlada para las operaciones de inicio de sesión.

Intervalo de evaluación: 60

Periodo pendiente: 300

Periodo de recuperación: 300

TokenRefreshThrottles

Etiquetas: UserPool, UserPoolClient

Descripción de la alarma: alarma que se activa cuando los eventos de limitación controlada de la actualización de tokens superan el valor límite en un grupo de usuarios.

Objetivo: detectar la limitación controlada de la actualización de tokens que podría interrumpir las sesiones.

Criterios de PromQL: sum({__name__="TokenRefreshThrottles", "@instrumentation.@name"="cloudwatch.aws/cognito", UserPool="your-user-pool",UserPoolClient="your-user-pool-client"}) > THRESHOLD

Valor límite recomendado: THRESHOLD (incrustado en la consulta)

Justificación del valor límite: se establece según la tasa aceptable de limitación controlada para las operaciones de actualización de tokens.

Intervalo de evaluación: 60

Periodo pendiente: 300

Periodo de recuperación: 300

FederationThrottles

Etiquetas: UserPool, UserPoolClient, IdentityProvider

Descripción de la alarma: alarma que se activa cuando los eventos de limitación controlada de la federación superan el valor límite para un proveedor de identidades de un grupo de usuarios.

Objetivo: detectar la limitación controlada de la federación que podría impedir el inicio de sesión federado.

Criterios de PromQL: sum({__name__="FederationThrottles", "@instrumentation.@name"="cloudwatch.aws/cognito", UserPool="your-user-pool",UserPoolClient="your-user-pool-client",IdentityProvider="your-identity-provider"}) > THRESHOLD

Valor límite recomendado: THRESHOLD (incrustado en la consulta)

Justificación del valor límite: se establece según la tasa aceptable de limitación controlada para las operaciones de federación.

Intervalo de evaluación: 60

Periodo pendiente: 300

Periodo de recuperación: 300

AccountProvisionedReadCapacityUtilization

Etiquetas: ninguna

Descripción de la alarma: alarma que se activa cuando el uso de la capacidad de lectura aprovisionada a nivel de cuenta supera el 80 %.

Objetivo: detectar cuándo la capacidad de lectura aprovisionada se aproxima a los límites de la cuenta.

Criterios de PromQL: max({__name__="AccountProvisionedReadCapacityUtilization", "@instrumentation.@name"="cloudwatch.aws/dynamodb"}) > 80

Valor límite recomendado: 80 (incrustado en la consulta)

Justificación del valor límite: con un uso del 80 %, queda un margen limitado antes de alcanzar los límites de la cuenta.

Intervalo de evaluación: 300

Periodo pendiente: 600

Periodo de recuperación: 600

AccountProvisionedWriteCapacityUtilization

Etiquetas: ninguna

Descripción de la alarma: alarma que se activa cuando el uso de la capacidad de escritura aprovisionada a nivel de cuenta supera el 80 %.

Objetivo: detectar cuándo la capacidad de escritura aprovisionada se aproxima a los límites de la cuenta.

Criterios de PromQL: max({__name__="AccountProvisionedWriteCapacityUtilization", "@instrumentation.@name"="cloudwatch.aws/dynamodb"}) > 80

Valor límite recomendado: 80 (incrustado en la consulta)

Justificación del valor límite: con un uso del 80 %, queda un margen limitado antes de alcanzar los límites de la cuenta.

Intervalo de evaluación: 300

Periodo pendiente: 600

Periodo de recuperación: 600

AgeOfOldestUnreplicatedRecord

Etiquetas: TableName, DelegatedOperation

Descripción de la alarma: alarma que se activa cuando la antigüedad del registro no replicado más antiguo supera el valor límite.

Objetivo: detectar retrasos en la replicación que podrían generar datos obsoletos en las tablas globales.

Criterios de PromQL: max({__name__="AgeOfOldestUnreplicatedRecord", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name",DelegatedOperation="your-operation"}) > THRESHOLD

Valor límite recomendado: THRESHOLD (incrustado en la consulta)

Justificación del valor límite: se establece según los requisitos de actualidad de la replicación.

Intervalo de evaluación: 300

Periodo pendiente: 900

Periodo de recuperación: 900

FailedToReplicateRecordCount

Etiquetas: TableName, DelegatedOperation

Descripción de la alarma: alarma que se activa cuando algún registro no se replica en una tabla global.

Objetivo: detectar errores de replicación que provoquen incoherencias en los datos entre regiones.

Criterios de PromQL: sum({__name__="FailedToReplicateRecordCount", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name",DelegatedOperation="your-operation"}) > 0

Valor límite recomendado: 0 (incrustado en la consulta)

Justificación del valor límite: cualquier error de replicación indica problemas de coherencia de datos que requieren atención inmediata.

Intervalo de evaluación: 60

Periodo pendiente: 60

Período de recuperación: 60

ReadThrottleEvents

Etiquetas: TableName

Descripción de la alarma: alarma que se activa cuando los eventos de limitación controlada de lectura superan el valor límite de una tabla.

Objetivo: detectar una limitación controlada de lectura que indique una capacidad aprovisionada insuficiente.

Criterios de PromQL: sum({__name__="ReadThrottleEvents", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name"}) > THRESHOLD

Valor límite recomendado: THRESHOLD (incrustado en la consulta)

Justificación del valor límite: se establece según el número aceptable de eventos de limitación controlada en las operaciones de lectura.

Intervalo de evaluación: 60

Periodo pendiente: 300

Periodo de recuperación: 300

ReadThrottleEvents (GSI)

Etiquetas: TableName, GlobalSecondaryIndexName

Descripción de la alarma: alarma que se activa cuando los eventos de limitación controlada de lectura superan el valor límite de un índice secundario global.

Objetivo: detectar la limitación controlada de lectura en un GSI que indique una capacidad insuficiente del índice.

Criterios de PromQL: sum({__name__="ReadThrottleEvents", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name",GlobalSecondaryIndexName="your-index-name"}) > THRESHOLD

Valor límite recomendado: THRESHOLD (incrustado en la consulta)

Justificación del valor límite: se establece según el número aceptable de eventos de limitación controlada en las operaciones de lectura del GSI.

Intervalo de evaluación: 60

Periodo pendiente: 300

Periodo de recuperación: 300

ReplicationLatency

Etiquetas:TableName, ReceivingRegion

Descripción de la alarma: alarma que se activa cuando la latencia promedio de replicación supera el valor límite de una tabla global.

Objetivo: detectar una latencia alta de replicación que podría provocar lecturas de datos obsoletos en las regiones de réplica.

Criterios de PromQL: avg({__name__="ReplicationLatency", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name",ReceivingRegion="your-receiving-region"}) > THRESHOLD

Valor límite recomendado: THRESHOLD (incrustado en la consulta)

Justificación del valor límite: se establece según los requisitos de actualidad de los datos de las regiones de réplica.

Intervalo de evaluación: 60

Periodo pendiente: 900

Periodo de recuperación: 900

SuccessfulRequestLatency

Etiquetas: TableName, Operation

Descripción de la alarma: alarma que se activa cuando la latencia promedio de las solicitudes completadas correctamente supera el valor límite de una operación de tabla.

Objetivo: detectar una latencia alta en las operaciones de DynamoDB que afecte al rendimiento de la aplicación.

Criterios de PromQL: avg({__name__="SuccessfulRequestLatency", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name",Operation="your-operation"}) > THRESHOLD

Valor límite recomendado: THRESHOLD (incrustado en la consulta)

Justificación del valor límite: se establece según el acuerdo de nivel de servicio (SLA) de latencia de la operación específica de DynamoDB.

Intervalo de evaluación: 60

Periodo pendiente: 600

Periodo de recuperación: 600

SystemErrors

Etiquetas: TableName

Descripción de la alarma: alarma que se activa cuando los errores del sistema superan el valor límite de una tabla.

Objetivo: detectar errores del servicio de DynamoDB que afecten a la disponibilidad de la tabla.

Criterios de PromQL: sum({__name__="SystemErrors", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name"}) > THRESHOLD

Valor límite recomendado: THRESHOLD (incrustado en la consulta)

Justificación del valor límite: se establece según el número aceptable de errores del sistema para la tabla.

Intervalo de evaluación: 60

Periodo pendiente: 900

Periodo de recuperación: 900

ThrottledPutRecordCount

Etiquetas: TableName, DelegatedOperation

Descripción de la alarma: alarma que se activa cuando el número de operaciones de inserción sujetas a limitación controlada supera el valor límite de una tabla.

Objetivo: detectar operaciones de inserción sujetas a limitación controlada que podrían provocar la pérdida de datos en las operaciones de streaming.

Criterios de PromQL: max({__name__="ThrottledPutRecordCount", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name",DelegatedOperation="your-operation"}) > THRESHOLD

Valor límite recomendado: THRESHOLD (incrustado en la consulta)

Justificación del valor límite: se establece según el número aceptable de eventos de limitación controlada en las operaciones de inserción en streaming.

Intervalo de evaluación: 60

Periodo pendiente: 600

Periodo de recuperación: 600

UserErrors

Etiquetas: ninguna

Descripción de la alarma: alarma que se activa cuando los errores del usuario superan el valor límite en la cuenta.

Objetivo: detectar tasas altas de errores del cliente, como errores de validación o de comprobaciones condicionales.

Criterios de PromQL: sum({__name__="UserErrors", "@instrumentation.@name"="cloudwatch.aws/dynamodb"}) > THRESHOLD

Valor límite recomendado: THRESHOLD (incrustado en la consulta)

Justificación del valor límite: se establece según la tasa de errores aceptable para los fallos de las solicitudes del cliente.

Intervalo de evaluación: 60

Periodo pendiente: 600

Periodo de recuperación: 600

WriteThrottleEvents

Etiquetas: TableName

Descripción de la alarma: alarma que se activa cuando los eventos de limitación controlada de escritura superan el valor límite de una tabla.

Objetivo: detectar la limitación controlada de las operaciones de escritura que indique que la capacidad aprovisionada es insuficiente.

Criterios de PromQL: sum({__name__="WriteThrottleEvents", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name"}) > THRESHOLD

Valor límite recomendado: THRESHOLD (incrustado en la consulta)

Justificación del valor límite: se establece según el número aceptable de eventos de limitación controlada en las operaciones de escritura.

Intervalo de evaluación: 60

Periodo pendiente: 300

Periodo de recuperación: 300

WriteThrottleEvents (GSI)

Etiquetas: TableName, GlobalSecondaryIndexName

Descripción de la alarma: alarma que se activa cuando los eventos de limitación controlada de escritura superan el valor límite de un índice secundario global.

Objetivo: detectar la limitación controlada de las operaciones de escritura en un GSI que indique que la capacidad del índice es insuficiente.

Criterios de PromQL: sum({__name__="WriteThrottleEvents", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name",GlobalSecondaryIndexName="your-index-name"}) > THRESHOLD

Valor límite recomendado: THRESHOLD (incrustado en la consulta)

Justificación del valor límite: se establece según el número aceptable de eventos de limitación controlada en las operaciones de escritura del GSI.

Intervalo de evaluación: 60

Periodo pendiente: 300

Periodo de recuperación: 300

VolumeStalledIOCheck

Etiquetas: VolumeId, InstanceId

Descripción de la alarma: alarma que se activa cuando un volumen de EBS informa de un error en la comprobación de operaciones de E/S bloqueadas.

Objetivo: detectar operaciones de E/S bloqueadas en volúmenes de EBS, lo que puede indicar una degradación del volumen.

Criterios de PromQL: max({__name__="VolumeStalledIOCheck", "@instrumentation.@name"="cloudwatch.aws/ebs", VolumeId="your-volume-id",InstanceId="your-instance-id"}) >= 1

Valor límite recomendado: 1 (incrustado en la consulta)

Justificación del valor límite: un valor de 1 o superior indica que el volumen presenta operaciones de E/S bloqueadas, lo que requiere una investigación inmediata.

Intervalo de evaluación: 60

Periodo pendiente: 600

Periodo de recuperación: 600

CPUUtilization

Etiquetas: InstanceId

Descripción de la alarma: alarma que se activa cuando el uso promedio de la CPU supera el 80 % en una instancia de EC2.

Objetivo: detectar un uso elevado de la CPU.

Criterios de PromQL: avg({__name__="CPUUtilization", "@instrumentation.@name"="cloudwatch.aws/ec2", InstanceId="your-instance-id"}) > 80

Valor límite recomendado: 80 (incrustado en la consulta)

Justificación del valor límite: el valor límite del 80 % deja margen antes de que la CPU alcance la saturación.

Intervalo de evaluación: 300

Periodo pendiente: 900

Periodo de recuperación: 900

StatusCheckFailed

Etiquetas: InstanceId

Descripción de la alarma: alarma que se activa cuando falla una comprobación de estado de la instancia o del sistema en una instancia de EC2.

Objetivo: detectar problemas de estado de la instancia o del sistema.

Criterios de PromQL: max({__name__="StatusCheckFailed", "@instrumentation.@name"="cloudwatch.aws/ec2", InstanceId="your-instance-id"}) >= 1

Valor límite recomendado: 1 (incrustado en la consulta)

Justificación del valor límite: cualquier error en una comprobación de estado requiere una investigación.

Intervalo de evaluación: 300

Periodo pendiente: 600

Periodo de recuperación: 600

StatusCheckFailed_AttachedEBS

Etiquetas: InstanceId

Descripción de la alarma: alarma que se activa cuando una instancia de EC2 deja de poder acceder a un volumen de EBS asociado.

Objetivo: detectar volúmenes de EBS inaccesibles.

Criterios de PromQL: max({__name__="StatusCheckFailed_AttachedEBS", "@instrumentation.@name"="cloudwatch.aws/ec2", InstanceId="your-instance-id"}) >= 1

Valor límite recomendado: 1 (incrustado en la consulta)

Justificación del valor límite: los volúmenes inaccesibles provocan errores de E/S.

Intervalo de evaluación: 60

Periodo pendiente: 600

Periodo de recuperación: 600

CPUReservation

Etiquetas: ClusterName

Descripción de la alarma: alarma que se activa cuando la reserva promedio de CPU supera el 80 % en un clúster de ECS.

Objetivo: detectar cuándo el clúster se aproxima a su capacidad de CPU.

Criterios de PromQL: avg({__name__="CPUReservation", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="your-cluster-name"}) > 80

Valor límite recomendado: 80 (incrustado en la consulta)

Justificación del valor límite: una reserva del 80 % deja poco margen para tareas nuevas.

Intervalo de evaluación: 60

Periodo pendiente: 300

Periodo de recuperación: 300

CPUUtilization

Etiquetas: ClusterName, ServiceName

Descripción de la alarma: alarma que se activa cuando el uso promedio de la CPU supera el 80 % en un servicio de ECS.

Objetivo: detectar un uso elevado de la CPU en el servicio de ECS.

Criterios de PromQL: avg({__name__="CPUUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="your-cluster-name",ServiceName="your-service-name"}) > 80

Valor límite recomendado: 80 (incrustado en la consulta)

Justificación del valor límite: un valor del 80 % deja margen antes de que la CPU alcance la saturación.

Intervalo de evaluación: 60

Periodo pendiente: 300

Periodo de recuperación: 300

EBSFilesystemUtilization

Etiquetas: ClusterName, ServiceName

Descripción de la alarma: alarma que se activa cuando el uso promedio del sistema de archivos de EBS supera el 80 % en un servicio de ECS.

Objetivo: detectar un uso elevado del almacenamiento de EBS.

Criterios de PromQL: avg({__name__="EBSFilesystemUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="your-cluster-name",ServiceName="your-service-name"}) > 80

Valor límite recomendado: 80 (incrustado en la consulta)

Justificación del valor límite: un valor del 80 % deja margen antes de que la CPU alcance la saturación.

Intervalo de evaluación: 60

Periodo pendiente: 300

Periodo de recuperación: 300

MemoryReservation

Etiquetas: ClusterName

Descripción de la alarma: alarma que se activa cuando la reserva promedio de memoria supera el 80 % en un clúster de ECS.

Objetivo: detectar cuándo el clúster se aproxima al límite de su capacidad de memoria.

Criterios de PromQL: avg({__name__="MemoryReservation", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="your-cluster-name"}) > 80

Valor límite recomendado: 80 (incrustado en la consulta)

Justificación del valor límite: una reserva del 80 % deja poco margen para tareas nuevas.

Intervalo de evaluación: 60

Periodo pendiente: 300

Periodo de recuperación: 300

MemoryUtilization

Etiquetas: ClusterName, ServiceName

Descripción de la alarma: alarma que se activa cuando el uso promedio de la memoria supera el 80 % en un servicio de ECS.

Objetivo: detectar un uso elevado de la memoria.

Criterios de PromQL: avg({__name__="MemoryUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="your-cluster-name",ServiceName="your-service-name"}) > 80

Valor límite recomendado: 80 (incrustado en la consulta)

Justificación del valor límite: un valor del 80 % deja margen antes de que la CPU alcance la saturación.

Intervalo de evaluación: 60

Periodo pendiente: 300

Periodo de recuperación: 300

HTTPCode_Target_5XX_Count

Etiquetas: ClusterName, ServiceName

Descripción de la alarma: alarma que se activa cuando el número de errores HTTP 5XX supera el valor límite en un servicio de ECS.

Objetivo: detectar un número elevado de errores del servidor.

Criterios de PromQL: sum({__name__="HTTPCode_Target_5XX_Count", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="your-cluster-name",ServiceName="your-service-name"}) > THRESHOLD

Valor límite recomendado: THRESHOLD (incrustado en la consulta)

Justificación del valor límite: se establece según el valor de referencia de la tasa de errores habitual de la aplicación.

Intervalo de evaluación: 60

Periodo pendiente: 300

Periodo de recuperación: 300

TargetResponseTime

Etiquetas: ClusterName, ServiceName

Descripción de la alarma: alarma que se activa cuando el tiempo promedio de respuesta del destino supera el valor límite en un servicio de ECS.

Objetivo: detectar un tiempo de respuesta elevado del destino.

Criterios de PromQL: avg({__name__="TargetResponseTime", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="your-cluster-name",ServiceName="your-service-name"}) > THRESHOLD

Valor límite recomendado: THRESHOLD (incrustado en la consulta)

Justificación del valor límite: se establece según los requisitos de latencia aceptable de la aplicación.

Intervalo de evaluación: 60

Periodo pendiente: 300

Periodo de recuperación: 300

EphemeralStorageUtilized

Etiquetas: ClusterName, ServiceName

Descripción de la alarma: alarma que se activa cuando el uso promedio del almacenamiento efímero supera el valor límite en las tareas de Fargate.

Objetivo: detectar un uso elevado del almacenamiento efímero en las tareas de Fargate.

Criterios de PromQL: avg({__name__="EphemeralStorageUtilized", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name",ServiceName="your-service-name"}) > THRESHOLD

Valor límite recomendado: THRESHOLD (incrustado en la consulta)

Justificación del valor límite: se establece según el almacenamiento efímero asignado a las tareas.

Intervalo de evaluación: 60

Periodo pendiente: 300

Periodo de recuperación: 300

RunningTaskCount

Etiquetas: ClusterName, ServiceName

Descripción de la alarma: alarma que se activa cuando el número de tareas en ejecución se reduce a cero en un servicio de ECS.

Objetivo: detectar cuando no hay ninguna tarea en ejecución.

Criterios de PromQL: avg({__name__="RunningTaskCount", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name",ServiceName="your-service-name"}) <= 0

Valor límite recomendado: 0 (incrustado en la consulta)

Justificación del valor límite: la ausencia de tareas en ejecución indica una interrupción del servicio.

Intervalo de evaluación: 60

Periodo pendiente: 300

Periodo de recuperación: 300

instance_filesystem_utilization

Etiquetas: InstanceId, ContainerInstanceId, ClusterName

Descripción de la alarma: alarma que se activa cuando el uso promedio del sistema de archivos supera el 90 % en una instancia de contenedor.

Objetivo: detectar un uso elevado del sistema de archivos.

Criterios de PromQL: avg({__name__="instance_filesystem_utilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", InstanceId="your-instance-id",ContainerInstanceId="your-container-instance-id",ClusterName="your-cluster-name"}) > 90

Valor límite recomendado: 90 (incrustado en la consulta)

Justificación del valor límite: un uso del sistema de archivos del 90 % deja poco espacio disponible para las operaciones.

Intervalo de evaluación: 60

Periodo pendiente: 300

Periodo de recuperación: 300

TaskCpuUtilization (nivel de clúster)

Etiquetas: ClusterName

Descripción de la alarma: alarma que se activa cuando el uso promedio de CPU de las tareas supera el 80 % a nivel de clúster.

Objetivo: detectar un uso elevado de la CPU.

Criterios de PromQL: avg({__name__="TaskCpuUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name"}) > 80

Valor límite recomendado: 80 (incrustado en la consulta)

Justificación del valor límite: un valor del 80 % deja margen antes de que la CPU alcance la saturación.

Intervalo de evaluación: 60

Periodo pendiente: 300

Periodo de recuperación: 300

TaskCpuUtilization (nivel de servicio)

Etiquetas: ClusterName, ServiceName

Descripción de la alarma: alarma que se activa cuando el uso promedio de CPU de las tareas supera el 80 % a nivel de servicio.

Objetivo: detectar un uso elevado de la CPU.

Criterios de PromQL: avg({__name__="TaskCpuUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name",ServiceName="your-service-name"}) > 80

Valor límite recomendado: 80 (incrustado en la consulta)

Justificación del valor límite: un valor del 80 % deja margen antes de que la CPU alcance la saturación.

Intervalo de evaluación: 60

Periodo pendiente: 300

Periodo de recuperación: 300

TaskMemoryUtilization (nivel de clúster)

Etiquetas: ClusterName

Descripción de la alarma: alarma que se activa cuando el uso promedio de memoria de las tareas supera el 80 % a nivel de clúster.

Objetivo: detectar un uso elevado de la memoria.

Criterios de PromQL: avg({__name__="TaskMemoryUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name"}) > 80

Valor límite recomendado: 80 (incrustado en la consulta)

Justificación del valor límite: un valor del 80 % deja margen antes de que la CPU alcance la saturación.

Intervalo de evaluación: 60

Periodo pendiente: 300

Periodo de recuperación: 300

TaskMemoryUtilization (nivel de servicio)

Etiquetas: ClusterName, ServiceName

Descripción de la alarma: alarma que se activa cuando el uso promedio de memoria de las tareas supera el 80 % a nivel de servicio.

Objetivo: detectar un uso elevado de la memoria.

Criterios de PromQL: avg({__name__="TaskMemoryUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name",ServiceName="your-service-name"}) > 80

Valor límite recomendado: 80 (incrustado en la consulta)

Justificación del valor límite: un valor del 80 % deja margen antes de que la CPU alcance la saturación.

Intervalo de evaluación: 60

Periodo pendiente: 300

Periodo de recuperación: 300

ContainerCpuUtilization (nivel de clúster)

Etiquetas: ClusterName

Descripción de la alarma: alarma que se activa cuando el uso promedio de CPU de los contenedores supera el 80 % a nivel de clúster.

Objetivo: detectar un uso elevado de la CPU.

Criterios de PromQL: avg({__name__="ContainerCpuUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name"}) > 80

Valor límite recomendado: 80 (incrustado en la consulta)

Justificación del valor límite: un valor del 80 % deja margen antes de que la CPU alcance la saturación.

Intervalo de evaluación: 60

Periodo pendiente: 300

Periodo de recuperación: 300

ContainerCpuUtilization (nivel de contenedor)

Etiquetas: ContainerName, ClusterName, ServiceName

Descripción de la alarma: alarma que se activa cuando el uso promedio de CPU de los contenedores supera el 80 % a nivel de contenedor.

Objetivo: detectar un uso elevado de la CPU.

Criterios de PromQL: avg({__name__="ContainerCpuUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ContainerName="your-container-name",ClusterName="your-cluster-name",ServiceName="your-service-name"}) > 80

Valor límite recomendado: 80 (incrustado en la consulta)

Justificación del valor límite: un valor del 80 % deja margen antes de que la CPU alcance la saturación.

Intervalo de evaluación: 60

Periodo pendiente: 300

Periodo de recuperación: 300

ContainerMemoryUtilization (nivel de clúster)

Etiquetas: ClusterName

Descripción de la alarma: alarma que se activa cuando el uso promedio de memoria de los contenedores supera el 80 % a nivel de clúster.

Objetivo: detectar un uso elevado de la memoria.

Criterios de PromQL: avg({__name__="ContainerMemoryUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name"}) > 80

Valor límite recomendado: 80 (incrustado en la consulta)

Justificación del valor límite: un valor del 80 % deja margen antes de que la CPU alcance la saturación.

Intervalo de evaluación: 60

Periodo pendiente: 300

Periodo de recuperación: 300

ContainerMemoryUtilization (nivel de contenedor)

Etiquetas: ContainerName, ClusterName, ServiceName

Descripción de la alarma: alarma que se activa cuando el uso promedio de memoria de los contenedores supera el 80 % a nivel de contenedor.

Objetivo: detectar un uso elevado de la memoria.

Criterios de PromQL: avg({__name__="ContainerMemoryUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ContainerName="your-container-name",ClusterName="your-cluster-name",ServiceName="your-service-name"}) > 80

Valor límite recomendado: 80 (incrustado en la consulta)

Justificación del valor límite: un valor del 80 % deja margen antes de que la CPU alcance la saturación.

Intervalo de evaluación: 60

Periodo pendiente: 300

Periodo de recuperación: 300

TaskEBSfilesystemUtilization

Etiquetas: ClusterName, ServiceName

Descripción de la alarma: alarma que se activa cuando el uso promedio del sistema de archivos de EBS supera el 80 % en las tareas.

Objetivo: detectar un uso elevado del sistema de archivos de EBS.

Criterios de PromQL: avg({__name__="TaskEBSfilesystemUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name",ServiceName="your-service-name"}) > 80

Valor límite recomendado: 80 (incrustado en la consulta)

Justificación del valor límite: un valor del 80 % deja margen antes de que la CPU alcance la saturación.

Intervalo de evaluación: 60

Periodo pendiente: 300

Periodo de recuperación: 300

TaskEphemeralStorageUtilization (nivel de clúster)

Etiquetas: ClusterName

Descripción de la alarma: alarma que se activa cuando el uso promedio del almacenamiento efímero supera el 80 % a nivel de clúster.

Objetivo: detectar un uso elevado del almacenamiento efímero.

Criterios de PromQL: avg({__name__="TaskEphemeralStorageUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name"}) > 80

Valor límite recomendado: 80 (incrustado en la consulta)

Justificación del valor límite: un valor del 80 % deja margen antes de que la CPU alcance la saturación.

Intervalo de evaluación: 60

Periodo pendiente: 300

Periodo de recuperación: 300

TaskEphemeralStorageUtilization (nivel de servicio)

Etiquetas: ClusterName, ServiceName

Descripción de la alarma: alarma que se activa cuando el uso promedio del almacenamiento efímero supera el 80 % a nivel de servicio.

Objetivo: detectar un uso elevado del almacenamiento efímero.

Criterios de PromQL: avg({__name__="TaskEphemeralStorageUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name",ServiceName="your-service-name"}) > 80

Valor límite recomendado: 80 (incrustado en la consulta)

Justificación del valor límite: un valor del 80 % deja margen antes de que la CPU alcance la saturación.

Intervalo de evaluación: 60

Periodo pendiente: 300

Periodo de recuperación: 300

PercentIOLimit

Etiquetas: FileSystemId

Descripción de la alarma: alarma que se activa cuando un sistema de archivos de EFS alcanza el 100 % de su límite de operaciones de E/S.

Objetivo: detectar cuándo el sistema de archivos alcanza su límite de operaciones de E/S.

Criterios de PromQL: avg({__name__="PercentIOLimit", "@instrumentation.@name"="cloudwatch.aws/efs", FileSystemId="your-filesystem-id"}) >= 100

Valor límite recomendado: 100 (incrustado en la consulta)

Justificación del valor límite: al alcanzar el 100 %, el sistema de archivos se convierte en un cuello de botella.

Intervalo de evaluación: 60

Periodo pendiente: 900

Periodo de recuperación: 900

BurstCreditBalance

Etiquetas: FileSystemId

Descripción de la alarma: alarma que se activa cuando el saldo de créditos de ampliación se reduce a cero en un sistema de archivos de EFS.

Objetivo: detectar el agotamiento de los créditos de ampliación que provoca una disminución del rendimiento.

Criterios de PromQL: avg({__name__="BurstCreditBalance", "@instrumentation.@name"="cloudwatch.aws/efs", FileSystemId="your-filesystem-id"}) <= 0

Valor límite recomendado: 0 (incrustado en la consulta)

Justificación del valor límite: un saldo de cero créditos reduce el rendimiento.

Intervalo de evaluación: 60

Periodo pendiente: 900

Periodo de recuperación: 900

node_cpu_utilization

Etiquetas: ClusterName

Descripción de la alarma: alarma que se activa cuando el uso máximo de CPU supera el 80 % en los nodos de trabajo de EKS.

Objetivo: detectar un uso elevado de CPU en los nodos de trabajo.

Criterios de PromQL: max({__name__="node_cpu_utilization", "@instrumentation.@name"="cloudwatch.aws/eks-containerinsights", ClusterName="your-cluster-name"}) > 80

Valor límite recomendado: 80 (incrustado en la consulta)

Justificación del valor límite: un valor del 80 % deja margen antes de que la CPU alcance la saturación.

Intervalo de evaluación: 60

Periodo pendiente: 300

Periodo de recuperación: 300

node_filesystem_utilization

Etiquetas: ClusterName

Descripción de la alarma: alarma que se activa cuando el uso máximo del sistema de archivos supera el valor límite en los nodos de trabajo de EKS.

Objetivo: detectar un uso elevado del sistema de archivos en los nodos de trabajo.

Criterios de PromQL: max({__name__="node_filesystem_utilization", "@instrumentation.@name"="cloudwatch.aws/eks-containerinsights", ClusterName="your-cluster-name"}) > THRESHOLD

Valor límite recomendado: THRESHOLD (incrustado en la consulta)

Justificación del valor límite: se establece según la capacidad de almacenamiento de los nodos y sus patrones de uso.

Intervalo de evaluación: 60

Periodo pendiente: 300

Periodo de recuperación: 300

node_memory_utilization

Etiquetas: ClusterName

Descripción de la alarma: alarma que se activa cuando el uso máximo de memoria supera el 80 % en los nodos de trabajo de EKS.

Objetivo: detectar un uso elevado de memoria en los nodos de trabajo.

Criterios de PromQL: max({__name__="node_memory_utilization", "@instrumentation.@name"="cloudwatch.aws/eks-containerinsights", ClusterName="your-cluster-name"}) > 80

Valor límite recomendado: 80 (incrustado en la consulta)

Justificación del valor límite: un valor del 80 % deja margen antes de que la CPU alcance la saturación.

Intervalo de evaluación: 60

Periodo pendiente: 300

Periodo de recuperación: 300

pod_cpu_utilization_over_pod_limit

Etiquetas: ClusterName, Namespace, Service

Descripción de la alarma: alarma que se activa cuando el uso de CPU de un pod supera el 80 % de su límite.

Objetivo: detectar pods que se aproximan a sus límites de CPU.

Criterios de PromQL: max({__name__="pod_cpu_utilization_over_pod_limit", "@instrumentation.@name"="cloudwatch.aws/eks-containerinsights", ClusterName="your-cluster-name",Namespace="your-namespace",Service="your-service"}) > 80

Valor límite recomendado: 80 (incrustado en la consulta)

Justificación del valor límite: un uso del 80 % deja margen antes de que se produzca una limitación controlada.

Intervalo de evaluación: 60

Periodo pendiente: 300

Periodo de recuperación: 300

pod_memory_utilization_over_pod_limit

Etiquetas: ClusterName, Namespace, Service

Descripción de la alarma: alarma que se activa cuando el uso de memoria de un pod supera el 80 % de su límite.

Objetivo: detectar pods que se aproximan a sus límites de memoria.

Criterios de PromQL: max({__name__="pod_memory_utilization_over_pod_limit", "@instrumentation.@name"="cloudwatch.aws/eks-containerinsights", ClusterName="your-cluster-name",Namespace="your-namespace",Service="your-service"}) > 80

Valor límite recomendado: 80 (incrustado en la consulta)

Justificación del valor límite: un uso del 80 % deja margen antes de que se produzca un OOMKill.

Intervalo de evaluación: 60

Periodo pendiente: 300

Periodo de recuperación: 300

CPUUtilization

Etiquetas: CacheClusterId, CacheNodeId

Descripción de la alarma: alarma que se activa cuando el uso promedio de CPU supera el valor límite en un nodo de ElastiCache.

Objetivo: detectar un uso elevado de CPU en la instancia.

Criterios de PromQL: avg({__name__="CPUUtilization", "@instrumentation.@name"="cloudwatch.aws/elasticache", CacheClusterId="your-cache-cluster-id",CacheNodeId="your-cache-node-id"}) > THRESHOLD

Valor límite recomendado: THRESHOLD (incrustado en la consulta)

Justificación del valor límite: se establece según el tipo de nodo y las características de la carga de trabajo.

Intervalo de evaluación: 60

Periodo pendiente: 300

Periodo de recuperación: 300

CurrConnections

Etiquetas: CacheClusterId, CacheNodeId

Descripción de la alarma: alarma que se activa cuando el número de conexiones supera el valor límite en un nodo de ElastiCache.

Objetivo: detectar un número elevado de conexiones.

Criterios de PromQL: avg({__name__="CurrConnections", "@instrumentation.@name"="cloudwatch.aws/elasticache", CacheClusterId="your-cache-cluster-id",CacheNodeId="your-cache-node-id"}) > THRESHOLD

Valor límite recomendado: THRESHOLD (incrustado en la consulta)

Justificación del valor límite: se establece según el tamaño previsto del grupo de conexiones y las necesidades de la aplicación.

Intervalo de evaluación: 60

Periodo pendiente: 600

Periodo de recuperación: 600

DatabaseMemoryUsagePercentage

Etiquetas: CacheClusterId

Descripción de la alarma: alarma que se activa cuando el uso de memoria de la base de datos supera el valor límite en un clúster de ElastiCache.

Objetivo: detectar un uso elevado de memoria para evitar errores de escritura.

Criterios de PromQL: avg({__name__="DatabaseMemoryUsagePercentage", "@instrumentation.@name"="cloudwatch.aws/elasticache", CacheClusterId="your-cache-cluster-id"}) > THRESHOLD

Valor límite recomendado: THRESHOLD (incrustado en la consulta)

Justificación del valor límite: se establece según la política de expulsión y la criticidad de los datos.

Intervalo de evaluación: 60

Periodo pendiente: 300

Periodo de recuperación: 300

EngineCPUUtilization

Etiquetas: CacheClusterId

Descripción de la alarma alarma que se activa cuando el uso de CPU del motor de Redis supera el 90 % en un clúster de ElastiCache.

Objetivo: detectar un uso elevado de CPU del motor de Redis.

Criterios de PromQL: avg({__name__="EngineCPUUtilization", "@instrumentation.@name"="cloudwatch.aws/elasticache", CacheClusterId="your-cache-cluster-id"}) > 90

Valor límite recomendado: 90 (incrustado en la consulta)

Justificación del valor límite: Redis utiliza un solo subproceso; un uso superior al 90 % indica saturación.

Intervalo de evaluación: 60

Periodo pendiente: 300

Periodo de recuperación: 300

ReplicationLag

Etiquetas: CacheClusterId

Descripción de la alarma: alarma que se activa cuando el retraso de replicación supera el valor límite en un clúster de ElastiCache.

Objetivo: detectar retrasos en la replicación que afecten a la coherencia de datos.

Criterios de PromQL: avg({__name__="ReplicationLag", "@instrumentation.@name"="cloudwatch.aws/elasticache", CacheClusterId="your-cache-cluster-id"}) > THRESHOLD

Valor límite recomendado: THRESHOLD (incrustado en la consulta)

Justificación del valor límite: se establece según la tolerancia de la aplicación a las lecturas de datos obsoletos.

Intervalo de evaluación: 60

Periodo pendiente: 900

Periodo de recuperación: 900

GPUConnectivityCheckFailed

Etiquetas: InstanceId, EGPUId

Descripción de la alarma: alarma que se activa cuando el acelerador Elastic Graphics pierde la conectividad con la instancia.

Objetivo: detectar problemas de conectividad con el acelerador de Elastic Graphics.

Criterios de PromQL: max({__name__="GPUConnectivityCheckFailed", "@instrumentation.@name"="cloudwatch.aws/elasticgpus", InstanceId="your-instance-id",EGPUId="your-egpu-id"}) > 0

Valor límite recomendado: 0 (incrustado en la consulta)

Justificación del valor límite: cualquier error de conectividad requiere una investigación.

Intervalo de evaluación: 300

Periodo pendiente: 900

Periodo de recuperación: 900

GPUHealthCheckFailed

Etiquetas: InstanceId, EGPUId

Descripción de la alarma: alarma que se activa cuando falla una comprobación de estado del acelerador de Elastic Graphics.

Objetivo: detectar un estado incorrecto del acelerador de Elastic Graphics.

Criterios de PromQL: max({__name__="GPUHealthCheckFailed", "@instrumentation.@name"="cloudwatch.aws/elasticgpus", InstanceId="your-instance-id",EGPUId="your-egpu-id"}) > 0

Valor límite recomendado: 0 (incrustado en la consulta)

Justificación del valor límite: los errores en las comprobaciones de estado indican problemas con el acelerador.

Intervalo de evaluación: 300

Periodo pendiente: 900

Periodo de recuperación: 900

TargetErrorThrottledCount

Descripción de la alarma: alarma que se activa cuando las invocaciones de destino programadas están sujetas a limitación controlada.

Objetivo: detectar la limitación controlada del destino que provoca retrasos en la programación.

Criterios de PromQL: sum({__name__="TargetErrorThrottledCount", "@instrumentation.@name"="cloudwatch.aws/scheduler"}) > 0

Valor límite recomendado: 0 (incrustado en la consulta)

Justificación del valor límite: cualquier limitación controlada indica problemas de capacidad del destino.

Intervalo de evaluación: 60

Periodo pendiente: 900

Periodo de recuperación: 900

InvocationThrottleCount

Descripción de la alarma: alarma que se activa cuando las invocaciones del programador están sujetas a limitación controlada.

Objetivo: detectar la limitación controlada de las invocaciones del programador.

Criterios de PromQL: sum({__name__="InvocationThrottleCount", "@instrumentation.@name"="cloudwatch.aws/scheduler"}) > 0

Valor límite recomendado: 0 (incrustado en la consulta)

Justificación del valor límite: la limitación controlada retrasa las ejecuciones programadas.

Intervalo de evaluación: 60

Periodo pendiente: 900

Periodo de recuperación: 900

InvocationDroppedCount

Descripción de la alarma: alarma que se activa cuando se descartan invocaciones programadas.

Objetivo: detectar invocaciones descartadas.

Criterios de PromQL: sum({__name__="InvocationDroppedCount", "@instrumentation.@name"="cloudwatch.aws/scheduler"}) > 0

Valor límite recomendado: 0 (incrustado en la consulta)

Justificación del valor límite: las invocaciones descartadas representan eventos programados que no se ejecutaron.

Intervalo de evaluación: 60

Periodo pendiente: 60

Período de recuperación: 60

InvocationsFailedToBeSentToDeadLetterCount

Descripción de la alarma: alarma que se activa cuando las invocaciones fallidas no se pueden enviar a la cola de mensajes fallidos.

Objetivo:detectar errores de entrega a la cola de mensajes fallidos (DLQ).

Criterios de PromQL: sum({__name__="InvocationsFailedToBeSentToDeadLetterCount", "@instrumentation.@name"="cloudwatch.aws/scheduler"}) > 0

Valor límite recomendado: 0 (incrustado en la consulta)

Justificación del valor límite: un error de entrega a la DLQ implica la pérdida de información sobre el error.

Intervalo de evaluación: 60

Periodo pendiente: 900

Periodo de recuperación: 900

GetRecords.IteratorAgeMilliseconds

Etiquetas: StreamName

Descripción de la alarma: alarma que se activa cuando la antigüedad del iterador del consumidor supera el valor límite en un flujo de Kinesis.

Objetivo: detectar datos cuyo retraso se aproxima al período de retención, con el consiguiente riesgo de pérdida de datos.

Criterios de PromQL: max({__name__="GetRecords.IteratorAgeMilliseconds", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="your-stream-name"}) > THRESHOLD

Valor límite recomendado: THRESHOLD (incrustado en la consulta)

Justificación del valor límite: se establece según un porcentaje del período de retención del flujo.

Intervalo de evaluación: 60

Periodo pendiente: 900

Periodo de recuperación: 900

GetRecords.Success

Etiquetas: StreamName

Descripción de la alarma: alarma que se activa cuando la tasa de éxito de GetRecords cae por debajo del valor límite en un flujo de Kinesis.

Objetivo: detectar errores en la recuperación de datos por parte de los consumidores.

Criterios de PromQL: avg({__name__="GetRecords.Success", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="your-stream-name"}) < THRESHOLD

Valor límite recomendado: THRESHOLD (incrustado en la consulta)

Justificación del valor límite: se establece según la tasa de éxito esperada.

Intervalo de evaluación: 60

Periodo pendiente: 300

Periodo de recuperación: 300

PutRecord.Success

Etiquetas: StreamName

Descripción de la alarma: alarma que se activa cuando la tasa de éxito de PutRecord cae por debajo del valor límite en un flujo de Kinesis.

Objetivo: detectar errores en la ingesta de datos por parte de los productores.

Criterios de PromQL: avg({__name__="PutRecord.Success", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="your-stream-name"}) < THRESHOLD

Valor límite recomendado: THRESHOLD (incrustado en la consulta)

Justificación del valor límite: se establece según la tasa de éxito esperada.

Intervalo de evaluación: 60

Periodo pendiente: 300

Periodo de recuperación: 300

PutRecords.FailedRecords

Etiquetas: StreamName

Descripción de la alarma: alarma que se activa cuando las operaciones de inserción por lotes generan registros con errores en un flujo de Kinesis.

Objetivo: detectar errores en las operaciones de inserción por lotes.

Criterios de PromQL: sum({__name__="PutRecords.FailedRecords", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="your-stream-name"}) > THRESHOLD

Valor límite recomendado: THRESHOLD (incrustado en la consulta)

Justificación del valor límite: se establece según el número aceptable de errores.

Intervalo de evaluación: 60

Periodo pendiente: 300

Periodo de recuperación: 300

ReadProvisionedThroughputExceeded

Etiquetas: StreamName

Descripción de la alarma: alarma que se activa cuando las lecturas del consumidor superan el rendimiento aprovisionado de un flujo de Kinesis.

Objetivo: detectar la limitación controlada de las lecturas del consumidor.

Criterios de PromQL: avg({__name__="ReadProvisionedThroughputExceeded", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="your-stream-name"}) > THRESHOLD

Valor límite recomendado: THRESHOLD (incrustado en la consulta)

Justificación del valor límite: cualquier limitación controlada sostenida indica que se necesita más capacidad.

Intervalo de evaluación: 60

Periodo pendiente: 300

Periodo de recuperación: 300

SubscribeToShardEvent.MillisBehindLatest

Etiquetas: StreamName, ConsumerName

Descripción de la alarma: alarma que se activa cuando un consumidor con distribución mejorada se retrasa respecto al registro más reciente.

Objetivo: detectar retrasos en el procesamiento del consumidor con distribución mejorada.

Criterios de PromQL: avg({__name__="SubscribeToShardEvent.MillisBehindLatest", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="your-stream-name",ConsumerName="your-consumer-name"}) > THRESHOLD

Valor límite recomendado: THRESHOLD (incrustado en la consulta)

Justificación del valor límite: se establece según el retraso de procesamiento aceptable.

Intervalo de evaluación: 60

Periodo pendiente: 300

Periodo de recuperación: 300

WriteProvisionedThroughputExceeded

Etiquetas: StreamName

Descripción de la alarma: alarma que se activa cuando las escrituras del productor superan el rendimiento aprovisionado de un flujo de Kinesis.

Objetivo: detectar la limitación controlada de las escrituras del productor.

Criterios de PromQL: avg({__name__="WriteProvisionedThroughputExceeded", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="your-stream-name"}) > THRESHOLD

Valor límite recomendado: THRESHOLD (incrustado en la consulta)

Justificación del valor límite: una limitación controlada sostenida indica que se necesita más capacidad.

Intervalo de evaluación: 60

Periodo pendiente: 300

Periodo de recuperación: 300

ClaimedAccountConcurrency

Descripción de la alarma: alarma que se activa cuando la simultaneidad reclamada de la cuenta supera el valor límite.

Objetivo: detectar cuándo la cuenta se aproxima a la cuota de simultaneidad.

Criterios de PromQL: max({__name__="ClaimedAccountConcurrency", "@instrumentation.@name"="cloudwatch.aws/lambda"}) > THRESHOLD

Valor límite recomendado: THRESHOLD (incrustado en la consulta)

Justificación del valor límite: se establece como un porcentaje del límite regional de simultaneidad.

Intervalo de evaluación: 60

Periodo pendiente: 600

Periodo de recuperación: 600

Errores

Etiquetas: FunctionName

Descripción de la alarma: alarma que se activa cuando el número de errores de una función de Lambda supera el valor límite.

Objetivo: detectar un número elevado de errores de la función.

Criterios de PromQL: sum({__name__="Errors", "@instrumentation.@name"="cloudwatch.aws/lambda", FunctionName="your-function-name"}) > THRESHOLD

Valor límite recomendado: THRESHOLD (incrustado en la consulta)

Justificación del valor límite: se establece según el volumen de errores aceptable.

Intervalo de evaluación: 60

Periodo pendiente: 180

Periodo de recuperación: 300

Limitaciones

Etiquetas: FunctionName

Descripción de la alarma: alarma que se activa cuando las invocaciones de una función de Lambda están sujetas a limitación controlada.

Objetivo: detectar la limitación controlada de las invocaciones de la función.

Criterios de PromQL: sum({__name__="Throttles", "@instrumentation.@name"="cloudwatch.aws/lambda", FunctionName="your-function-name"}) > THRESHOLD

Valor límite recomendado: THRESHOLD (incrustado en la consulta)

Justificación del valor límite: la limitación controlada indica que se alcanzó el límite de simultaneidad.

Intervalo de evaluación: 60

Periodo pendiente: 300

Periodo de recuperación: 300

Duración

Etiquetas: FunctionName

Descripción de la alarma: alarma que se activa cuando la duración p90 de una función supera el valor límite en una función de Lambda.

Objetivo: detectar invocaciones de funciones de larga duración.

Criterios de PromQL: histogram_quantile(0.9, {__name__="Duration", "@instrumentation.@name"="cloudwatch.aws/lambda", FunctionName="your-function-name"}) > THRESHOLD

Valor límite recomendado: THRESHOLD (incrustado en la consulta)

Justificación del valor límite: se establece en relación con el tiempo de espera de la función.

Intervalo de evaluación: 60

Periodo pendiente: 900

Periodo de recuperación: 900

ConcurrentExecutions

Etiquetas: FunctionName

Descripción de la alarma: alarma que se activa cuando las ejecuciones simultáneas superan el valor límite de una función de Lambda.

Objetivo: detectar cuándo la función se aproxima a sus límites de simultaneidad.

Criterios de PromQL: max({__name__="ConcurrentExecutions", "@instrumentation.@name"="cloudwatch.aws/lambda", FunctionName="your-function-name"}) > THRESHOLD

Valor límite recomendado: THRESHOLD (incrustado en la consulta)

Justificación del valor límite: se establece como un porcentaje de la simultaneidad reservada.

Intervalo de evaluación: 60

Periodo pendiente: 600

Periodo de recuperación: 600

memory_utilization

Etiquetas: function_name

Descripción de la alarma: alarma que se activa cuando el uso promedio de memoria supera el 90 % en una función de Lambda.

Objetivo: detectar cuándo la función se aproxima al límite de memoria configurado.

Criterios de PromQL: avg({__name__="memory_utilization", "@instrumentation.@name"="cloudwatch.aws/lambda-insights", function_name="your-function-name"}) > 90

Valor límite recomendado: 90 (incrustado en la consulta)

Justificación del valor límite: un uso superior al 90 % aumenta el riesgo de errores por falta de memoria.

Intervalo de evaluación: 60

Periodo pendiente: 600

Periodo de recuperación: 600

ErrorPortAllocation

Etiquetas: NatGatewayId

Descripción de la alarma: alarma que se activa cuando la puerta de enlace NAT no puede asignar un puerto para conexiones nuevas.

Objetivo:detectar errores de asignación de puertos que impiden establecer conexiones nuevas.

Criterios de PromQL: sum({__name__="ErrorPortAllocation", "@instrumentation.@name"="cloudwatch.aws/natgateway", NatGatewayId="your-nat-gateway-id"}) > 0

Valor límite recomendado: 0 (incrustado en la consulta)

Justificación del valor límite: cualquier error de asignación afecta a la conectividad.

Intervalo de evaluación: 60

Periodo pendiente: 900

Periodo de recuperación: 900

PacketsDropCount

Etiquetas: NatGatewayId

Descripción de la alarma: alarma que se activa cuando la puerta de enlace NAT descarta paquetes por encima del valor límite.

Objetivo: detectar descartes de paquetes que indiquen problemas de capacidad o conectividad.

Criterios de PromQL: sum({__name__="PacketsDropCount", "@instrumentation.@name"="cloudwatch.aws/natgateway", NatGatewayId="your-nat-gateway-id"}) > THRESHOLD

Valor límite recomendado: THRESHOLD (incrustado en la consulta)

Justificación del valor límite: se establece según la tasa de descarte aceptable.

Intervalo de evaluación: 60

Periodo pendiente: 300

Periodo de recuperación: 300

PacketsDropped

Etiquetas: VpcId, VpcEndpointId, EndpointType, SubnetId, ServiceName

Descripción de la alarma: alarma que se activa cuando un punto de conexión de VPC descarta paquetes por encima del valor límite.

Objetivo: detectar un punto de conexión o servicio de punto de conexión en mal estado.

Criterios de PromQL: sum({__name__="PacketsDropped", "@instrumentation.@name"="cloudwatch.aws/privatelinkendpoints", VpcId="your-vpc-id",VpcEndpointId="your-vpc-endpoint-id",EndpointType="your-endpoint-type",SubnetId="your-subnet-id",ServiceName="your-service-name"}) > THRESHOLD

Valor límite recomendado: THRESHOLD (incrustado en la consulta)

Justificación del valor límite: se establece según la tasa de descarte aceptable.

Intervalo de evaluación: 60

Periodo pendiente: 300

Periodo de recuperación: 300

RstPacketsSent

Etiquetas: ServiceId, LoadBalancerArn, Az

Descripción de la alarma: alarma que se activa cuando la tasa de paquetes RST supera el valor límite de un servicio de punto de conexión.

Objetivo:detectar destinos en mal estado del servicio de punto de conexión.

Criterios de PromQL: sum({__name__="RstPacketsSent", "@instrumentation.@name"="cloudwatch.aws/privatelinkservices", ServiceId="SVC",LoadBalancerArn="LB",Az="AZ"}) > THRESHOLD

Valor límite recomendado: THRESHOLD (incrustado en la consulta)

Justificación del valor límite: se establece según una tasa aceptable de paquetes RST.

Intervalo de evaluación: 60

Periodo pendiente: 300

Periodo de recuperación: 300

CPUUtilization

Etiquetas: DBInstanceIdentifier

Descripción de la alarma: alarma que se activa cuando el uso promedio de CPU supera el 90 % en una instancia de RDS.

Objetivo: detectar un uso elevado de CPU que pueda degradar el rendimiento.

Criterios de PromQL: avg({__name__="CPUUtilization", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > 90

Valor límite recomendado: 90 (incrustado en la consulta)

Justificación del valor límite: un valor del 90 % indica que está cerca de alcanzar la saturación.

Intervalo de evaluación: 60

Periodo pendiente: 300

Periodo de recuperación: 300

DatabaseConnections

Etiquetas: DBInstanceIdentifier

Descripción de la alarma: alarma que se activa cuando el número de conexiones a la base de datos supera el valor límite de una instancia de RDS.

Objetivo: evitar que se rechacen conexiones al alcanzar el límite máximo.

Criterios de PromQL: avg({__name__="DatabaseConnections", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > THRESHOLD

Valor límite recomendado: THRESHOLD (incrustado en la consulta)

Justificación del valor límite: se establece como un porcentaje del parámetro max_connections.

Intervalo de evaluación: 60

Periodo pendiente: 300

Periodo de recuperación: 300

EBSByteBalance%

Etiquetas: DBInstanceIdentifier

Descripción de la alarma: alarma que se activa cuando el saldo de bytes de EBS cae por debajo del 10 % en una instancia de RDS.

Objetivo: detectar un nivel bajo de créditos de rendimiento que pueda provocar cuellos de botella.

Criterios de PromQL: avg({__name__="EBSByteBalance%", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) < 10

Valor límite recomendado: 10 (incrustado en la consulta)

Justificación del valor límite: un valor inferior al 10 % conlleva el riesgo de una degradación del rendimiento.

Intervalo de evaluación: 60

Periodo pendiente: 180

Periodo de recuperación: 180

EBSIOBalance%

Etiquetas: DBInstanceIdentifier

Descripción de la alarma: alarma que se activa cuando el saldo de operaciones de E/S de EBS cae por debajo del 10 % en una instancia de RDS.

Objetivo: detectar un nivel bajo de créditos de operaciones de entrada/salida por segundo (IOPS) que pueda provocar cuellos de botella.

Criterios de PromQL: avg({__name__="EBSIOBalance%", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) < 10

Valor límite recomendado: 10 (incrustado en la consulta)

Justificación del valor límite: un valor inferior al 10 % conlleva el riesgo de una degradación de las operaciones de entrada/salida por segundo (IOPS).

Intervalo de evaluación: 60

Periodo pendiente: 180

Periodo de recuperación: 180

FreeableMemory

Etiquetas: DBInstanceIdentifier

Descripción de la alarma: alarma que se activa cuando la memoria disponible cae por debajo del valor límite en una instancia de RDS.

Objetivo: evitar que la falta de memoria provoque el rechazo de conexiones.

Criterios de PromQL: avg({__name__="FreeableMemory", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) < THRESHOLD

Valor límite recomendado: THRESHOLD (incrustado en la consulta)

Justificación del valor límite: se establece según la memoria de la clase de instancia.

Intervalo de evaluación: 60

Periodo pendiente: 900

Periodo de recuperación: 900

FreeLocalStorage

Etiquetas: DBInstanceIdentifier

Descripción de la alarma: alarma que se activa cuando el almacenamiento local disponible cae por debajo del valor límite en una instancia de Aurora.

Objetivo: evitar que se agote el almacenamiento local de Aurora.

Criterios de PromQL: avg({__name__="FreeLocalStorage", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) < THRESHOLD

Valor límite recomendado: THRESHOLD (incrustado en la consulta)

Justificación del valor límite: se establece según el mínimo necesario para las operaciones.

Intervalo de evaluación: 60

Periodo pendiente: 300

Periodo de recuperación: 300

FreeStorageSpace

Etiquetas: DBInstanceIdentifier

Descripción de la alarma: alarma que se activa cuando el espacio de almacenamiento disponible cae por debajo del valor límite en una instancia de RDS.

Objetivo: evitar tiempo de inactividad causado por el agotamiento del almacenamiento.

Criterios de PromQL: min({__name__="FreeStorageSpace", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) < THRESHOLD

Valor límite recomendado: THRESHOLD (incrustado en la consulta)

Justificación del valor límite: se establece según la tasa de crecimiento del almacenamiento y el tamaño aprovisionado.

Intervalo de evaluación: 60

Periodo pendiente: 300

Periodo de recuperación: 300

MaximumUsedTransactionIDs

Etiquetas: DBInstanceIdentifier

Descripción de la alarma: alarma que se activa cuando el número máximo de ID de transacción utilizados supera los 1000 millones en una instancia de RDS.

Objetivo: evitar el reinicio cíclico de los ID de transacción de PostgreSQL.

Criterios de PromQL: avg({__name__="MaximumUsedTransactionIDs", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > 1000000000

Valor límite recomendado: 1000000000 (incrustado en la consulta)

Justificación del valor límite: un valor de 1000 millones indica que se aproxima el riesgo de reinicio cíclico.

Intervalo de evaluación: 60

Periodo pendiente: 60

Período de recuperación: 60

ReadLatency

Etiquetas: DBInstanceIdentifier

Descripción de la alarma: alarma que se activa cuando la latencia de lectura p90 supera el valor límite en una instancia de RDS.

Objetivo: detectar una latencia de lectura elevada que indique problemas de disco.

Criterios de PromQL: histogram_quantile(0.9, {__name__="ReadLatency", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > THRESHOLD

Valor límite recomendado: THRESHOLD (incrustado en la consulta)

Justificación del valor límite: se establece según la latencia aceptable para la aplicación.

Intervalo de evaluación: 60

Periodo pendiente: 300

Periodo de recuperación: 300

ReplicaLag

Etiquetas: DBInstanceIdentifier

Descripción de la alarma: alarma que se activa cuando el retraso de replicación supera los 60 segundos en una réplica de lectura de RDS.

Objetivo: detectar retrasos en la replicación que puedan provocar la pérdida de datos.

Criterios de PromQL: max({__name__="ReplicaLag", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > 60

Valor límite recomendado: 60 (incrustado en la consulta)

Justificación del valor límite: un retraso de 60 segundos es significativo para la mayoría de las cargas de trabajo.

Intervalo de evaluación: 60

Periodo pendiente: 600

Periodo de recuperación: 600

WriteLatency

Etiquetas: DBInstanceIdentifier

Descripción de la alarma: alarma que se activa cuando la latencia de escritura p90 supera el valor límite en una instancia de RDS.

Objetivo: detectar una latencia de escritura elevada que indique problemas de disco.

Criterios de PromQL: histogram_quantile(0.9, {__name__="WriteLatency", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > THRESHOLD

Valor límite recomendado: THRESHOLD (incrustado en la consulta)

Justificación del valor límite: se establece según la latencia aceptable para la aplicación.

Intervalo de evaluación: 60

Periodo pendiente: 300

Periodo de recuperación: 300

DBLoad

Etiquetas: DBInstanceIdentifier

Descripción de la alarma: alarma que se activa cuando la carga promedio de la base de datos supera el valor límite en una instancia de RDS.

Objetivo: detectar una carga elevada de la base de datos que degrade el rendimiento.

Criterios de PromQL: avg({__name__="DBLoad", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > THRESHOLD

Valor límite recomendado: THRESHOLD (incrustado en la consulta)

Justificación del valor límite: se establece en un múltiplo del número de vCPU.

Intervalo de evaluación: 60

Periodo pendiente: 900

Periodo de recuperación: 900

AuroraVolumeBytesLeftTotal

Etiquetas: DBClusterIdentifier

Descripción de la alarma: alarma que se activa cuando los bytes de almacenamiento restantes de un clúster de Aurora caen por debajo del valor límite.

Objetivo: evitar que se agote el almacenamiento del clúster de Aurora.

Criterios de PromQL: avg({__name__="AuroraVolumeBytesLeftTotal", "@instrumentation.@name"="cloudwatch.aws/rds", DBClusterIdentifier="CLUSTER"}) < THRESHOLD

Valor límite recomendado: THRESHOLD (incrustado en la consulta)

Justificación del valor límite: se establece según la tasa de crecimiento.

Intervalo de evaluación: 60

Periodo pendiente: 300

Periodo de recuperación: 300

AuroraBinlogReplicaLag

Etiquetas: DBClusterIdentifier

Descripción de la alarma: alarma que se activa cuando el retraso de la réplica de binlog de Aurora indica un estado de error.

Objetivo: detectar errores de replicación de la instancia de escritura.

Criterios de PromQL: avg({__name__="AuroraBinlogReplicaLag", "@instrumentation.@name"="cloudwatch.aws/rds", DBClusterIdentifier="CLUSTER"}) <= -1

Valor límite recomendado: 1 (incrustado en la consulta)

Justificación del valor límite: un valor de 1 indica un estado de error.

Intervalo de evaluación: 60

Período pendiente: 120

Periodo de recuperación: 120

BlockedTransactions

Etiquetas: DBInstanceIdentifier

Descripción de la alarma: alarma que se activa cuando el número de transacciones bloqueadas supera el valor límite en una instancia de RDS.

Objetivo: detectar el bloqueo de transacciones que provoque una degradación del rendimiento.

Criterios de PromQL: avg({__name__="BlockedTransactions", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > THRESHOLD

Valor límite recomendado: THRESHOLD (incrustado en la consulta)

Justificación del valor límite: se establece según el número aceptable de transacciones bloqueadas.

Intervalo de evaluación: 60

Periodo pendiente: 300

Periodo de recuperación: 300

BufferCacheHitRatio

Etiquetas: DBInstanceIdentifier

Descripción de la alarma: alarma que se activa cuando la tasa de aciertos de la caché de búfer cae por debajo del 80 % en una instancia de RDS.

Objetivo: detectar una baja eficiencia de la caché que provoque una disminución del rendimiento.

Criterios de PromQL: avg({__name__="BufferCacheHitRatio", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) < 80

Valor límite recomendado: 80 (incrustado en la consulta)

Justificación del valor límite: un valor inferior al 80 % indica un uso excesivo de las operaciones de operaciones de E/S de disco.

Intervalo de evaluación: 60

Periodo pendiente: 600

Periodo de recuperación: 600

EngineUptime

Etiquetas: DBClusterIdentifier

Descripción de la alarma: alarma que se activa cuando el tiempo de actividad del motor cae a cero, lo que indica el reinicio de una instancia de escritura de Aurora.

Objetivo: detectar un tiempo de inactividad o un bloqueo de la instancia de escritura de Aurora.

Criterios de PromQL: avg({__name__="EngineUptime", "@instrumentation.@name"="cloudwatch.aws/rds", DBClusterIdentifier="CLUSTER"}) <= 0

Valor límite recomendado: 0 (incrustado en la consulta)

Justificación del valor límite: un tiempo de actividad de cero indica un reinicio de la instancia.

Intervalo de evaluación: 60

Período pendiente: 120

Periodo de recuperación: 120

RollbackSegmentHistoryListLength

Etiquetas: DBInstanceIdentifier

Descripción de la alarma: alarma que se activa cuando la longitud de la lista de historial de segmentos de reversión supera 1 millón en una instancia de Aurora.

Objetivo: detectar un historial de reversión elevado que provoque una degradación del rendimiento de la CPU.

Criterios de PromQL: avg({__name__="RollbackSegmentHistoryListLength", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > 1000000

Valor límite recomendado: 1000000 (incrustado en la consulta)

Justificación del valor límite: un valor superior a 1 millón provoca problemas de rendimiento.

Intervalo de evaluación: 60

Periodo pendiente: 300

Periodo de recuperación: 300

StorageNetworkThroughput

Etiquetas: DBClusterIdentifier

Descripción de la alarma: alarma que se activa cuando el rendimiento de la red de almacenamiento supera el valor límite en un clúster de Aurora.

Objetivo: detectar un rendimiento elevado que pueda provocar el descarte de paquetes de red.

Criterios de PromQL: avg({__name__="StorageNetworkThroughput", "@instrumentation.@name"="cloudwatch.aws/rds", DBClusterIdentifier="CLUSTER"}) > THRESHOLD

Valor límite recomendado: THRESHOLD (incrustado en la consulta)

Justificación del valor límite: se establece según la capacidad de red de la instancia.

Intervalo de evaluación: 60

Periodo pendiente: 300

Periodo de recuperación: 300

HealthCheckStatus

Etiquetas: HealthCheckId

Descripción de la alarma: alarma que se activa cuando una comprobación de estado de Route 53 informa de un punto de conexión en mal estado.

Objetivo: detectar puntos de conexión en mal estado mediante las comprobaciones de estado de Route 53.

Criterios de PromQL: avg({__name__="HealthCheckStatus", "@instrumentation.@name"="cloudwatch.aws/route53", HealthCheckId="HC"}) < 1

Valor límite recomendado: 1 (incrustado en la consulta)

Justificación del valor límite: un valor inferior a 1 indica que el punto de conexión no supera las comprobaciones de estado.

Intervalo de evaluación: 60

Periodo pendiente: 180

Periodo de recuperación: 180

4xxErrors

Etiquetas: BucketName, FilterId

Descripción de la alarma: alarma que se activa cuando la tasa de errores 4xx supera el 5 % en un bucket de S3.

Objetivo: detectar tasas anómalas de errores del cliente.

Criterios de PromQL: avg({__name__="4xxErrors", "@instrumentation.@name"="cloudwatch.aws/s3", BucketName="BUCKET",FilterId="FILTER"}) > 0.05

Valor límite recomendado: 0,05 (incrustado en la consulta)

Justificación del valor límite: un valor superior al 5 % indica problemas de configuración o acceso.

Intervalo de evaluación: 60

Periodo pendiente: 900

Periodo de recuperación: 900

5xxErrors

Etiquetas: BucketName, FilterId

Descripción de la alarma: alarma que se activa cuando la tasa de errores 5xx supera el 5 % en un bucket de S3.

Objetivo: detectar errores del servidor que afecten a la aplicación.

Criterios de PromQL: avg({__name__="5xxErrors", "@instrumentation.@name"="cloudwatch.aws/s3", BucketName="BUCKET",FilterId="FILTER"}) > 0.05

Valor límite recomendado: 0,05 (incrustado en la consulta)

Justificación del valor límite: un valor superior al 5 % indica problemas con el servicio S3.

Intervalo de evaluación: 60

Periodo pendiente: 900

Periodo de recuperación: 900

OperationsFailedReplication

Etiquetas: SourceBucket, DestinationBucket, RuleId

Descripción de la alarma: alarma que se activa cuando fallan las operaciones de replicación de S3 de un bucket.

Objetivo: detectar errores de replicación que puedan provocar incoherencias en los datos.

Criterios de PromQL: max({__name__="OperationsFailedReplication", "@instrumentation.@name"="cloudwatch.aws/s3", SourceBucket="SRC",DestinationBucket="DST",RuleId="RULE"}) > 0

Valor límite recomendado: 0 (incrustado en la consulta)

Justificación del valor límite: cualquier error de replicación requiere una investigación.

Intervalo de evaluación: 60

Periodo pendiente: 300

Periodo de recuperación: 300

4xxErrors

Etiquetas: AccessPointName, DataSourceARN

Descripción de la alarma: alarma que se activa cuando la tasa de errores 4xx supera el 5 % en un punto de acceso de S3 Object Lambda.

Objetivo: detectar tasas anómalas de errores del cliente en Object Lambda.

Criterios de PromQL: avg({__name__="4xxErrors", "@instrumentation.@name"="cloudwatch.aws/s3objectlambda", AccessPointName="AP",DataSourceARN="ARN"}) > 0.05

Valor límite recomendado: 0,05 (incrustado en la consulta)

Justificación del valor límite: un valor superior al 5 % indica problemas de configuración.

Intervalo de evaluación: 60

Periodo pendiente: 900

Periodo de recuperación: 900

5xxErrors

Etiquetas: AccessPointName, DataSourceARN

Descripción de la alarma: alarma que se activa cuando la tasa de errores 5xx supera el 5 % en un punto de acceso de S3 Object Lambda.

Objetivo: detectar errores del servidor en Object Lambda.

Criterios de PromQL: avg({__name__="5xxErrors", "@instrumentation.@name"="cloudwatch.aws/s3objectlambda", AccessPointName="AP",DataSourceARN="ARN"}) > 0.05

Valor límite recomendado: 0,05 (incrustado en la consulta)

Justificación del valor límite: un valor superior al 5 % indica problemas con Lambda o S3.

Intervalo de evaluación: 60

Periodo pendiente: 900

Periodo de recuperación: 900

LambdaResponse4xx

Etiquetas: AccessPointName, DataSourceARN

Descripción de la alarma: alarma que se activa cuando la tasa de respuestas 4xx de la función de Lambda supera el 5 % en un punto de acceso de S3 Object Lambda.

Objetivo: detectar errores del cliente de la función de Lambda.

Criterios de PromQL: avg({__name__="LambdaResponse4xx", "@instrumentation.@name"="cloudwatch.aws/s3objectlambda", AccessPointName="AP",DataSourceARN="ARN"}) > 0.05

Valor límite recomendado: 0,05 (incrustado en la consulta)

Justificación del valor límite: un valor superior al 5 % indica problemas con la función de Lambda.

Intervalo de evaluación: 60

Periodo pendiente: 900

Periodo de recuperación: 900

NumberOfMessagesPublished

Etiquetas: TopicName

Descripción de la alarma: alarma que se activa cuando el número de mensajes publicados cae por debajo del valor límite en un tema de SNS.

Objetivo: detectar una disminución significativa del volumen de publicación.

Criterios de PromQL: sum({__name__="NumberOfMessagesPublished", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) < THRESHOLD

Valor límite recomendado: THRESHOLD (incrustado en la consulta)

Justificación del valor límite: se establece según el volumen mínimo de tráfico esperado.

Intervalo de evaluación: 60

Periodo pendiente: 300

Periodo de recuperación: 300

NumberOfNotificationsDelivered

Etiquetas: TopicName

Descripción de la alarma: alarma que se activa cuando el número de notificaciones entregadas cae por debajo del valor límite en un tema de SNS.

Objetivo: detectar una disminución del volumen de entrega de notificaciones.

Criterios de PromQL: sum({__name__="NumberOfNotificationsDelivered", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) < THRESHOLD

Valor límite recomendado: THRESHOLD (incrustado en la consulta)

Justificación del valor límite: se establece según el número mínimo de entregas esperado.

Intervalo de evaluación: 60

Periodo pendiente: 300

Periodo de recuperación: 300

NumberOfNotificationsFailed

Etiquetas: TopicName

Descripción de la alarma: alarma que se activa cuando el número de errores de entrega de notificaciones supera el valor límite en un tema de SNS.

Objetivo: detectar errores de entrega.

Criterios de PromQL: sum({__name__="NumberOfNotificationsFailed", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) > THRESHOLD

Valor límite recomendado: THRESHOLD (incrustado en la consulta)

Justificación del valor límite: se establece según la tasa de errores aceptable.

Intervalo de evaluación: 60

Periodo pendiente: 300

Periodo de recuperación: 300

NumberOfNotificationsFilteredOut-InvalidAttributes

Etiquetas: TopicName

Descripción de la alarma: alarma que se activa cuando se filtran notificaciones debido a atributos de mensaje no válidos.

Objetivo: detectar atributos de mensaje no válidos.

Criterios de PromQL: sum({__name__="NumberOfNotificationsFilteredOut-InvalidAttributes", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) > 0

Valor límite recomendado: 0 (incrustado en la consulta)

Justificación del valor límite: cualquier filtrado debido a atributos no válidos indica una configuración incorrecta.

Intervalo de evaluación: 60

Periodo pendiente: 300

Periodo de recuperación: 300

NumberOfNotificationsFilteredOut-InvalidMessageBody

Etiquetas: TopicName

Descripción de la alarma: alarma que se activa cuando se filtran notificaciones debido a cuerpos de mensaje no válidos.

Objetivo: detectar cuerpos de mensaje no válidos.

Criterios de PromQL: sum({__name__="NumberOfNotificationsFilteredOut-InvalidMessageBody", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) > 0

Valor límite recomendado: 0 (incrustado en la consulta)

Justificación del valor límite: cualquier filtrado debido a atributos no válidos indica una configuración incorrecta.

Intervalo de evaluación: 60

Periodo pendiente: 300

Periodo de recuperación: 300

NumberOfNotificationsRedrivenToDlq

Etiquetas: TopicName

Descripción de la alarma: alarma que se activa cuando se envían notificaciones a la cola de mensajes fallidos de un tema de SNS.

Objetivo: detectar mensajes enviados a la cola de mensajes fallidos (DLQ).

Criterios de PromQL: sum({__name__="NumberOfNotificationsRedrivenToDlq", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) > 0

Valor límite recomendado: 0 (incrustado en la consulta)

Justificación del valor límite: cualquier mensaje enviado a la cola de mensajes fallidos (DLQ) indica problemas de entrega.

Intervalo de evaluación: 60

Periodo pendiente: 300

Periodo de recuperación: 300

NumberOfNotificationsFailedToRedriveToDlq

Etiquetas: TopicName

Descripción de la alarma: alarma que se activa cuando las notificaciones no se pueden enviar a la cola de mensajes fallidos de un tema de SNS.

Objetivo:detectar errores de entrega a la cola de mensajes fallidos (DLQ).

Criterios de PromQL: sum({__name__="NumberOfNotificationsFailedToRedriveToDlq", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) > 0

Valor límite recomendado: 0 (incrustado en la consulta)

Justificación del valor límite: un error de entrega a la cola de mensajes fallidos (DLQ) implica la pérdida del seguimiento de errores.

Intervalo de evaluación: 60

Periodo pendiente: 300

Periodo de recuperación: 300

SMSMonthToDateSpentUSD

Etiquetas: TopicName

Descripción de la alarma: alarma que se activa cuando el gasto en SMS se aproxima a la cuota de la cuenta para un tema de SNS.

Objetivo: detectar cuándo el gasto en SMS se aproxima a la cuota.

Criterios de PromQL: max({__name__="SMSMonthToDateSpentUSD", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) > THRESHOLD

Valor límite recomendado: THRESHOLD (incrustado en la consulta)

Justificación del valor límite: se establece según la cuota de gasto en SMS de la cuenta.

Intervalo de evaluación: 60

Periodo pendiente: 300

Periodo de recuperación: 300

SMSSuccessRate

Etiquetas: TopicName

Descripción de la alarma: alarma que se activa cuando la tasa de entregas correctas de SMS cae por debajo del valor límite en un tema de SNS.

Objetivo: detectar una disminución de las entregas de SMS.

Criterios de PromQL: avg({__name__="SMSSuccessRate", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) < THRESHOLD

Valor límite recomendado: THRESHOLD (incrustado en la consulta)

Justificación del valor límite: se establece según la tasa de entrega aceptable.

Intervalo de evaluación: 60

Periodo pendiente: 300

Periodo de recuperación: 300

ApproximateAgeOfOldestMessage

Etiquetas: QueueName

Descripción de la alarma: alarma que se activa cuando la antigüedad del mensaje más antiguo supera el valor límite en una cola de SQS.

Objetivo: detectar mensajes que no se procesan con la rapidez necesaria.

Criterios de PromQL: max({__name__="ApproximateAgeOfOldestMessage", "@instrumentation.@name"="cloudwatch.aws/sqs", QueueName="QUEUE"}) > THRESHOLD

Valor límite recomendado: THRESHOLD (incrustado en la consulta)

Justificación del valor límite: se establece según el tiempo de procesamiento de mensajes aceptable.

Intervalo de evaluación: 60

Periodo pendiente: 900

Periodo de recuperación: 900

ApproximateNumberOfMessagesNotVisible

Etiquetas: QueueName

Descripción de la alarma: alarma que se activa cuando el número de mensajes en tránsito supera el valor límite en una cola de SQS.

Objetivo: detectar un número elevado de mensajes en tránsito que indique problemas con los consumidores.

Criterios de PromQL: avg({__name__="ApproximateNumberOfMessagesNotVisible", "@instrumentation.@name"="cloudwatch.aws/sqs", QueueName="QUEUE"}) > THRESHOLD

Valor límite recomendado: THRESHOLD (incrustado en la consulta)

Justificación del valor límite: se establece según el volumen de procesamiento previsto.

Intervalo de evaluación: 60

Periodo pendiente: 900

Periodo de recuperación: 900

ApproximateNumberOfMessagesVisible

Etiquetas: QueueName

Descripción de la alarma: alarma que se activa cuando el número de mensajes visibles supera el valor límite de una cola de SQS.

Objetivo: detectar una acumulación de mensajes que indique que los consumidores procesan los mensajes con lentitud.

Criterios de PromQL: avg({__name__="ApproximateNumberOfMessagesVisible", "@instrumentation.@name"="cloudwatch.aws/sqs", QueueName="QUEUE"}) > THRESHOLD

Valor límite recomendado: THRESHOLD (incrustado en la consulta)

Justificación del valor límite: se establece según la profundidad prevista de la cola.

Intervalo de evaluación: 60

Periodo pendiente: 900

Periodo de recuperación: 900

NumberOfMessagesSent

Etiquetas: QueueName

Descripción de la alarma: alarma que se activa cuando no se envían mensajes a una cola de SQS.

Objetivo: detectar cuándo los productores dejan de enviar mensajes.

Criterios de PromQL: sum({__name__="NumberOfMessagesSent", "@instrumentation.@name"="cloudwatch.aws/sqs", QueueName="QUEUE"}) <= 0

Valor límite recomendado: 0 (incrustado en la consulta)

Justificación del valor límite: la ausencia de mensajes indica un error del productor.

Intervalo de evaluación: 60

Periodo pendiente: 900

Periodo de recuperación: 900

TunnelState (nivel de VPN)

Etiquetas: VpnId

Descripción de la alarma: alarma que se activa cuando al menos un túnel de VPN se encuentra en estado inactivo.

Objetivo: detectar si al menos un túnel se encuentra en estado inactivo.

Criterios de PromQL: min({__name__="TunnelState", "@instrumentation.@name"="cloudwatch.aws/vpn", VpnId="VPN"}) < 1

Valor límite recomendado: 1 (incrustado en la consulta)

Justificación del valor límite: un valor inferior a 1 indica que el túnel está inactivo.

Intervalo de evaluación: 300

Periodo pendiente: 900

Periodo de recuperación: 900

TunnelState (nivel del túnel)

Etiquetas: TunnelIpAddress

Descripción de la alarma: alarma que se activa cuando un túnel de VPN específico se encuentra en estado inactivo.

Objetivo: detectar si un túnel específico se encuentra en estado inactivo.

Criterios de PromQL: min({__name__="TunnelState", "@instrumentation.@name"="cloudwatch.aws/vpn", TunnelIpAddress="IP"}) < 1

Valor límite recomendado: 1 (incrustado en la consulta)

Justificación del valor límite: un valor inferior a 1 indica que el túnel está inactivo.

Intervalo de evaluación: 300

Periodo pendiente: 900

Periodo de recuperación: 900