Alarmas de PromQL recomendadas
Utilice estas alarmas de PromQL como equivalentes de las alarmas clásicas recomendadas. Supervisan las mismas métricas mediante consultas instantáneas de PromQL que se evalúan con respecto a las métricas ingeridas mediante el punto de conexión OTLP de CloudWatch.
Las alarmas de PromQL utilizan EvaluationCriteria con PromQLCriteria. A diferencia de las alarmas de métricas clásicas, el valor límite se incorpora directamente en la expresión de consulta de PromQL.
-
Periodo pendiente: duración, en segundos, durante la cual una serie de tiempo debe superar continuamente el valor límite antes de que la alarma pase al estado ALARM.
-
Periodo de recuperación: duración, en segundos, durante la cual todas las series de tiempo deben dejar de superar el valor límite antes de que la alarma vuelva al estado OK.
-
Intervalo de evaluación: frecuencia, en segundos, con la que CloudWatch ejecuta la consulta de PromQL.
nota
Estas alarmas requieren métricas publicadas mediante el punto de conexión OTLP de CloudWatch. Para obtener más información, consulte Alarmas PromQL.
Puede implementar estas alarmas mediante AWS CloudFormation. Utilice las propiedades EvaluationCriteria y PromQLCriteria en el recurso AWS::CloudWatch::Alarm.
API Gateway
API de REST
- 4XXError
-
Etiquetas: ApiName, Stage
Descripción de la alarma: alarma que se activa cuando la tasa promedio de errores 4XX supera el 5 % en una etapa de una API de REST.
Objetivo: detectar una tasa alta de errores del cliente que indique problemas con las solicitudes.
Criterios de PromQL:
avg({__name__="4XXError", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiName="your-api-name",Stage="your-stage"}) > 0.05Valor límite recomendado: 0,05 (incrustado en la consulta)
Justificación del valor límite: detecta una tasa de errores del cliente superior al 5 %, lo que indica errores significativos en las solicitudes.
Intervalo de evaluación: 60
Periodo pendiente: 300
Periodo de recuperación: 300
- 5XXError
-
Etiquetas: ApiName, Stage
Descripción de la alarma: alarma que se activa cuando la tasa promedio de errores 5XX supera el 5 % en una etapa de una API de REST.
Objetivo: detectar una tasa alta de errores del servidor que indique fallos del backend.
Criterios de PromQL:
avg({__name__="5XXError", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiName="your-api-name",Stage="your-stage"}) > 0.05Valor límite recomendado: 0,05 (incrustado en la consulta)
Justificación del valor límite: detecta una tasa de errores del servidor superior al 5 %, lo que requiere una investigación inmediata.
Intervalo de evaluación: 60
Periodo pendiente: 180
Periodo de recuperación: 300
- Latencia
-
Etiquetas: ApiName, Stage
Descripción de la alarma: alarma que se activa cuando la latencia p90 supera los 2500 ms en una etapa de una API de REST.
Objetivo: detectar una latencia p90 alta que afecte a la experiencia del usuario.
Criterios de PromQL:
histogram_quantile(0.9, {__name__="Latency", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiName="your-api-name",Stage="your-stage"}) > 2500Valor límite recomendado: 2500 (incrustado en la consulta)
Justificación del valor límite: una latencia p90 superior a 2500 ms indica tiempos de respuesta deficientes para la mayoría de las solicitudes.
Intervalo de evaluación: 60
Periodo pendiente: 300
Periodo de recuperación: 300
- recuento
-
Etiquetas: ApiName, Stage
Descripción de la alarma: alarma que se activa cuando el recuento total de solicitudes cae por debajo del valor de referencia esperado para una etapa de una API de REST.
Objetivo: detectar un volumen bajo de tráfico que podría indicar problemas de enrutamiento o disponibilidad.
Criterios de PromQL:
sum({__name__="Count", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiName="your-api-name",Stage="your-stage"}) <THRESHOLDValor límite recomendado:
THRESHOLD(incrustado en la consulta)Justificación del valor límite: dstablézcalo según el valor de referencia de tráfico esperado para detectar disminuciones inesperadas.
Intervalo de evaluación: 60
Periodo pendiente: 600
Periodo de recuperación: 300
API HTTP
- 4XX
-
Etiquetas: ApiId, Stage
Descripción de la alarma: alarma que se activa cuando la tasa promedio de errores 4xx supera el 5 % en una etapa de una API HTTP.
Objetivo: detectar una tasa alta de errores del cliente en los puntos de conexión de la API HTTP.
Criterios de PromQL:
avg({__name__="4xx", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="your-api-id",Stage="your-stage"}) > 0.05Valor límite recomendado: 0,05 (incrustado en la consulta)
Justificación del valor límite: detecta una tasa de errores del cliente superior al 5 %.
Intervalo de evaluación: 60
Periodo pendiente: 300
Periodo de recuperación: 300
- 5xx
-
Etiquetas: ApiId, Stage
Descripción de la alarma: alarma que se activa cuando la tasa promedio de errores 5xx supera el 5 % en una etapa de una API HTTP.
Objetivo: detectar una tasa alta de errores del servidor en los puntos de conexión de la API HTTP.
Criterios de PromQL:
avg({__name__="5xx", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="your-api-id",Stage="your-stage"}) > 0.05Valor límite recomendado: 0,05 (incrustado en la consulta)
Justificación del valor límite: detecta una tasa de errores del servidor superior al 5 %, lo que requiere una investigación.
Intervalo de evaluación: 60
Periodo pendiente: 180
Periodo de recuperación: 300
- Latencia
-
Etiquetas: ApiId, Stage
Descripción de la alarma: alarma que se activa cuando la latencia p90 supera los 2500 ms en una etapa de una API HTTP.
Objetivo: detectar una latencia p90 alta en los puntos de conexión de la API HTTP.
Criterios de PromQL:
histogram_quantile(0.9, {__name__="Latency", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="your-api-id",Stage="your-stage"}) > 2500Valor límite recomendado: 2500 (incrustado en la consulta)
Justificación del valor límite: una latencia p90 superior a 2500 ms indica tiempos de respuesta deficientes.
Intervalo de evaluación: 60
Periodo pendiente: 300
Periodo de recuperación: 300
- IntegrationLatency
-
Etiquetas: ApiId, Stage
Descripción de la alarma: alarma que se activa cuando la latencia de integración p90 supera los 2000 ms en una etapa de una API HTTP.
Objetivo: detectar una latencia alta en la integración con el backend que afecte a los tiempos de respuesta.
Criterios de PromQL:
histogram_quantile(0.9, {__name__="IntegrationLatency", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="your-api-id",Stage="your-stage"}) > 2000Valor límite recomendado: 2000 (incrustado en la consulta)
Justificación del valor límite: una latencia de integración p90 superior a 2000 ms indica lentitud en el backend.
Intervalo de evaluación: 60
Periodo pendiente: 300
Periodo de recuperación: 300
- recuento
-
Etiquetas: ApiId, Stage
Descripción de la alarma: alarma que se activa cuando el recuento total de solicitudes cae por debajo del valor de referencia esperado para una etapa de una API HTTP.
Objetivo: detectar un volumen bajo de tráfico que podría indicar problemas de enrutamiento o disponibilidad.
Criterios de PromQL:
sum({__name__="Count", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="your-api-id",Stage="your-stage"}) <THRESHOLDValor límite recomendado:
THRESHOLD(incrustado en la consulta)Justificación del valor límite: dstablézcalo según el valor de referencia de tráfico esperado para detectar disminuciones inesperadas.
Intervalo de evaluación: 60
Periodo pendiente: 600
Periodo de recuperación: 300
API de WebSocket
- ClientError
-
Etiquetas: ApiId, Stage
Descripción de la alarma: alarma que se activa cuando la tasa promedio de errores del cliente supera el 5 % en una etapa de una API de WebSocket.
Objetivo: detectar una tasa alta de errores del cliente en las conexiones de la API de WebSocket.
Criterios de PromQL:
avg({__name__="ClientError", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="your-api-id",Stage="your-stage"}) > 0.05Valor límite recomendado: 0,05 (incrustado en la consulta)
Justificación del valor límite: detecta una tasa de errores del cliente superior al 5 % en las conexiones de WebSocket.
Intervalo de evaluación: 60
Periodo pendiente: 300
Periodo de recuperación: 300
- ExecutionError
-
Etiquetas: ApiId, Stage
Descripción de la alarma: alarma que se activa cuando la tasa promedio de errores de ejecución supera el 5 % en una etapa de una API de WebSocket.
Objetivo: detectar una tasa alta de errores de ejecución del servidor en las API de WebSocket.
Criterios de PromQL:
avg({__name__="ExecutionError", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="your-api-id",Stage="your-stage"}) > 0.05Valor límite recomendado: 0,05 (incrustado en la consulta)
Justificación del valor límite: detecta una tasa de errores de ejecución superior al 5 %, lo que requiere una investigación.
Intervalo de evaluación: 60
Periodo pendiente: 180
Periodo de recuperación: 300
- IntegrationLatency
-
Etiquetas: ApiId, Stage
Descripción de la alarma: alarma que se activa cuando la latencia de integración p90 supera los 2000 ms en una etapa de una API de WebSocket.
Objetivo: detectar una latencia alta en la integración con el backend en las rutas de la API de WebSocket.
Criterios de PromQL:
histogram_quantile(0.9, {__name__="IntegrationLatency", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="your-api-id",Stage="your-stage"}) > 2000Valor límite recomendado: 2000 (incrustado en la consulta)
Justificación del valor límite: una latencia de integración p90 superior a 2000 ms indica lentitud en el backend.
Intervalo de evaluación: 60
Periodo pendiente: 300
Periodo de recuperación: 300
- MessageCount
-
Etiquetas: ApiId, Stage
Descripción de la alarma: alarma que se activa cuando el recuento total de mensajes cae por debajo del valor de referencia esperado para una etapa de una API de WebSocket.
Objetivo: detectar un volumen bajo de mensajes que podría indicar problemas de conexión o enrutamiento.
Criterios de PromQL:
sum({__name__="MessageCount", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="your-api-id",Stage="your-stage"}) <THRESHOLDValor límite recomendado:
THRESHOLD(incrustado en la consulta)Justificación del valor límite: se establece según el volumen de mensajes esperado para detectar disminuciones inesperadas.
Intervalo de evaluación: 60
Periodo pendiente: 600
Periodo de recuperación: 300
escalado automático
- GroupInServiceCapacity
-
Etiquetas: AutoScalingGroupName
Descripción de la alarma: alarma que se activa cuando la capacidad promedio en servicio cae por debajo del mínimo esperado para un grupo de escalado automático.
Objetivo: detectar una disponibilidad baja debido a errores de lanzamiento o instancias terminadas.
Criterios de PromQL:
avg({__name__="GroupInServiceCapacity", "@instrumentation.@name"="cloudwatch.aws/autoscaling", AutoScalingGroupName="your-auto-scaling-group-name"}) <THRESHOLDValor límite recomendado:
THRESHOLD(incrustado en la consulta)Justificación del valor límite: se establece según la capacidad mínima deseada para detectar errores de lanzamiento o un número insuficiente de instancias.
Intervalo de evaluación: 60
Periodo pendiente: 600
Periodo de recuperación: 600
Certificate Manager
- DaysToExpiry
-
Etiquetas: CertificateArn
Descripción de la alarma: alarma que se activa cuando el número mínimo de días hasta el vencimiento del certificado disminuye a 44 días o menos.
Objetivo: generar una alerta proactiva sobre el vencimiento del certificado para disponer de tiempo suficiente para renovarlo.
Criterios de PromQL:
min({__name__="DaysToExpiry", "@instrumentation.@name"="cloudwatch.aws/certificatemanager", CertificateArn="your-certificate-arn"}) <= 44Valor límite recomendado: 44 (incrustado en la consulta)
Justificación del valor límite: proporciona un margen suficiente antes del vencimiento del certificado para completar el proceso de renovación.
Intervalo de evaluación: 86400
Periodo pendiente: 86400
Periodo de recuperación: 86400
CloudFront
- 5xxErrorRate
-
Etiquetas: DistributionId
Descripción de la alarma: alarma que se activa cuando la tasa promedio de errores 5xx supera el valor límite en una distribución de CloudFront.
Objetivo: detectar una tasa alta de errores del origen o de CloudFront que afecte a la entrega de contenido.
Criterios de PromQL:
avg({__name__="5xxErrorRate", "@instrumentation.@name"="cloudwatch.aws/cloudfront", DistributionId="your-distribution-id"}) >THRESHOLDValor límite recomendado:
THRESHOLD(incrustado en la consulta)Justificación del valor límite: se establece según la tasa de errores aceptable para la entrega de contenido.
Intervalo de evaluación: 60
Periodo pendiente: 300
Periodo de recuperación: 300
- OriginLatency
-
Etiquetas: DistributionId
Descripción de la alarma: alarma que se activa cuando la latencia p90 del origen supera el valor límite en una distribución de CloudFront.
Objetivo: detectar una latencia alta de respuesta del origen que afecte al rendimiento de la entrega de contenido.
Criterios de PromQL:
histogram_quantile(0.9, {__name__="OriginLatency", "@instrumentation.@name"="cloudwatch.aws/cloudfront", DistributionId="your-distribution-id"}) >THRESHOLDValor límite recomendado:
THRESHOLD(incrustado en la consulta)Justificación del valor límite: se establece según el tiempo de respuesta esperado del origen y la estrategia de almacenamiento en caché.
Intervalo de evaluación: 60
Periodo pendiente: 300
Periodo de recuperación: 300
- FunctionValidationErrors
-
Etiquetas: DistributionId, FunctionName
Descripción de la alarma: alarma que se activa cuando se produce algún error de validación de una función de CloudFront.
Objetivo: detectar errores de validación de funciones de CloudFront que impidan la ejecución de la función.
Criterios de PromQL:
sum({__name__="FunctionValidationErrors", "@instrumentation.@name"="cloudwatch.aws/cloudfront", DistributionId="your-distribution-id",FunctionName="your-function-name"}) > 0Valor límite recomendado: 0 (incrustado en la consulta)
Justificación del valor límite: cualquier error de validación indica un problema de configuración de la función que requiere atención.
Intervalo de evaluación: 60
Período pendiente: 120
Periodo de recuperación: 120
- FunctionExecutionErrors
-
Etiquetas: DistributionId, FunctionName
Descripción de la alarma: alarma que se activa cuando se produce algún error de ejecución de una función de CloudFront.
Objetivo: detectar errores durante el tiempo de ejecución de las funciones de CloudFront que afecten al procesamiento de solicitudes.
Criterios de PromQL:
sum({__name__="FunctionExecutionErrors", "@instrumentation.@name"="cloudwatch.aws/cloudfront", DistributionId="your-distribution-id",FunctionName="your-function-name"}) > 0Valor límite recomendado: 0 (incrustado en la consulta)
Justificación del valor límite: cualquier error de ejecución indica un problema durante el tiempo de ejecución en el código de la función.
Intervalo de evaluación: 60
Periodo pendiente: 300
Periodo de recuperación: 300
- FunctionThrottles
-
Etiquetas: DistributionId, FunctionName
Descripción de la alarma: alarma que se activa cuando se produce alguna limitación controlada en una función de CloudFront.
Objetivo: detectar la limitación controlada de funciones de CloudFront que podría afectar al procesamiento de solicitudes.
Criterios de PromQL:
sum({__name__="FunctionThrottles", "@instrumentation.@name"="cloudwatch.aws/cloudfront", DistributionId="your-distribution-id",FunctionName="your-function-name"}) > 0Valor límite recomendado: 0 (incrustado en la consulta)
Justificación del valor límite: cualquier limitación controlada indica que la función está alcanzando los límites de computación.
Intervalo de evaluación: 60
Periodo pendiente: 300
Periodo de recuperación: 300
Cognito
- SignUpThrottles
-
Etiquetas: UserPool, UserPoolClient
Descripción de la alarma: alarma que se activa cuando los eventos de limitación controlada del registro superan el valor límite en un grupo de usuarios.
Objetivo: detectar la limitación controlada del registro que impide registrar usuarios nuevos.
Criterios de PromQL:
sum({__name__="SignUpThrottles", "@instrumentation.@name"="cloudwatch.aws/cognito", UserPool="your-user-pool",UserPoolClient="your-user-pool-client"}) >THRESHOLDValor límite recomendado:
THRESHOLD(incrustado en la consulta)Justificación del valor límite: establézcalo según la tasa aceptable de limitación controlada para las operaciones de registro.
Intervalo de evaluación: 60
Periodo pendiente: 300
Periodo de recuperación: 300
- SignInThrottles
-
Etiquetas: UserPool, UserPoolClient
Descripción de la alarma: alarma que se activa cuando los eventos de limitación controlada del inicio de sesión superan el valor límite en un grupo de usuarios.
Objetivo: detectar la limitación controlada del inicio de sesión que impide autenticar a los usuarios.
Criterios de PromQL:
sum({__name__="SignInThrottles", "@instrumentation.@name"="cloudwatch.aws/cognito", UserPool="your-user-pool",UserPoolClient="your-user-pool-client"}) >THRESHOLDValor límite recomendado:
THRESHOLD(incrustado en la consulta)Justificación del valor límite: se establece según la tasa aceptable de limitación controlada para las operaciones de inicio de sesión.
Intervalo de evaluación: 60
Periodo pendiente: 300
Periodo de recuperación: 300
- TokenRefreshThrottles
-
Etiquetas: UserPool, UserPoolClient
Descripción de la alarma: alarma que se activa cuando los eventos de limitación controlada de la actualización de tokens superan el valor límite en un grupo de usuarios.
Objetivo: detectar la limitación controlada de la actualización de tokens que podría interrumpir las sesiones.
Criterios de PromQL:
sum({__name__="TokenRefreshThrottles", "@instrumentation.@name"="cloudwatch.aws/cognito", UserPool="your-user-pool",UserPoolClient="your-user-pool-client"}) >THRESHOLDValor límite recomendado:
THRESHOLD(incrustado en la consulta)Justificación del valor límite: se establece según la tasa aceptable de limitación controlada para las operaciones de actualización de tokens.
Intervalo de evaluación: 60
Periodo pendiente: 300
Periodo de recuperación: 300
- FederationThrottles
-
Etiquetas: UserPool, UserPoolClient, IdentityProvider
Descripción de la alarma: alarma que se activa cuando los eventos de limitación controlada de la federación superan el valor límite para un proveedor de identidades de un grupo de usuarios.
Objetivo: detectar la limitación controlada de la federación que podría impedir el inicio de sesión federado.
Criterios de PromQL:
sum({__name__="FederationThrottles", "@instrumentation.@name"="cloudwatch.aws/cognito", UserPool="your-user-pool",UserPoolClient="your-user-pool-client",IdentityProvider="your-identity-provider"}) >THRESHOLDValor límite recomendado:
THRESHOLD(incrustado en la consulta)Justificación del valor límite: se establece según la tasa aceptable de limitación controlada para las operaciones de federación.
Intervalo de evaluación: 60
Periodo pendiente: 300
Periodo de recuperación: 300
DynamoDB
- AccountProvisionedReadCapacityUtilization
-
Etiquetas: ninguna
Descripción de la alarma: alarma que se activa cuando el uso de la capacidad de lectura aprovisionada a nivel de cuenta supera el 80 %.
Objetivo: detectar cuándo la capacidad de lectura aprovisionada se aproxima a los límites de la cuenta.
Criterios de PromQL:
max({__name__="AccountProvisionedReadCapacityUtilization", "@instrumentation.@name"="cloudwatch.aws/dynamodb"}) > 80Valor límite recomendado: 80 (incrustado en la consulta)
Justificación del valor límite: con un uso del 80 %, queda un margen limitado antes de alcanzar los límites de la cuenta.
Intervalo de evaluación: 300
Periodo pendiente: 600
Periodo de recuperación: 600
- AccountProvisionedWriteCapacityUtilization
-
Etiquetas: ninguna
Descripción de la alarma: alarma que se activa cuando el uso de la capacidad de escritura aprovisionada a nivel de cuenta supera el 80 %.
Objetivo: detectar cuándo la capacidad de escritura aprovisionada se aproxima a los límites de la cuenta.
Criterios de PromQL:
max({__name__="AccountProvisionedWriteCapacityUtilization", "@instrumentation.@name"="cloudwatch.aws/dynamodb"}) > 80Valor límite recomendado: 80 (incrustado en la consulta)
Justificación del valor límite: con un uso del 80 %, queda un margen limitado antes de alcanzar los límites de la cuenta.
Intervalo de evaluación: 300
Periodo pendiente: 600
Periodo de recuperación: 600
- AgeOfOldestUnreplicatedRecord
-
Etiquetas: TableName, DelegatedOperation
Descripción de la alarma: alarma que se activa cuando la antigüedad del registro no replicado más antiguo supera el valor límite.
Objetivo: detectar retrasos en la replicación que podrían generar datos obsoletos en las tablas globales.
Criterios de PromQL:
max({__name__="AgeOfOldestUnreplicatedRecord", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name",DelegatedOperation="your-operation"}) >THRESHOLDValor límite recomendado:
THRESHOLD(incrustado en la consulta)Justificación del valor límite: se establece según los requisitos de actualidad de la replicación.
Intervalo de evaluación: 300
Periodo pendiente: 900
Periodo de recuperación: 900
- FailedToReplicateRecordCount
-
Etiquetas: TableName, DelegatedOperation
Descripción de la alarma: alarma que se activa cuando algún registro no se replica en una tabla global.
Objetivo: detectar errores de replicación que provoquen incoherencias en los datos entre regiones.
Criterios de PromQL:
sum({__name__="FailedToReplicateRecordCount", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name",DelegatedOperation="your-operation"}) > 0Valor límite recomendado: 0 (incrustado en la consulta)
Justificación del valor límite: cualquier error de replicación indica problemas de coherencia de datos que requieren atención inmediata.
Intervalo de evaluación: 60
Periodo pendiente: 60
Período de recuperación: 60
- ReadThrottleEvents
-
Etiquetas: TableName
Descripción de la alarma: alarma que se activa cuando los eventos de limitación controlada de lectura superan el valor límite de una tabla.
Objetivo: detectar una limitación controlada de lectura que indique una capacidad aprovisionada insuficiente.
Criterios de PromQL:
sum({__name__="ReadThrottleEvents", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name"}) >THRESHOLDValor límite recomendado:
THRESHOLD(incrustado en la consulta)Justificación del valor límite: se establece según el número aceptable de eventos de limitación controlada en las operaciones de lectura.
Intervalo de evaluación: 60
Periodo pendiente: 300
Periodo de recuperación: 300
- ReadThrottleEvents (GSI)
-
Etiquetas: TableName, GlobalSecondaryIndexName
Descripción de la alarma: alarma que se activa cuando los eventos de limitación controlada de lectura superan el valor límite de un índice secundario global.
Objetivo: detectar la limitación controlada de lectura en un GSI que indique una capacidad insuficiente del índice.
Criterios de PromQL:
sum({__name__="ReadThrottleEvents", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name",GlobalSecondaryIndexName="your-index-name"}) >THRESHOLDValor límite recomendado:
THRESHOLD(incrustado en la consulta)Justificación del valor límite: se establece según el número aceptable de eventos de limitación controlada en las operaciones de lectura del GSI.
Intervalo de evaluación: 60
Periodo pendiente: 300
Periodo de recuperación: 300
- ReplicationLatency
-
Etiquetas:TableName, ReceivingRegion
Descripción de la alarma: alarma que se activa cuando la latencia promedio de replicación supera el valor límite de una tabla global.
Objetivo: detectar una latencia alta de replicación que podría provocar lecturas de datos obsoletos en las regiones de réplica.
Criterios de PromQL:
avg({__name__="ReplicationLatency", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name",ReceivingRegion="your-receiving-region"}) >THRESHOLDValor límite recomendado:
THRESHOLD(incrustado en la consulta)Justificación del valor límite: se establece según los requisitos de actualidad de los datos de las regiones de réplica.
Intervalo de evaluación: 60
Periodo pendiente: 900
Periodo de recuperación: 900
- SuccessfulRequestLatency
-
Etiquetas: TableName, Operation
Descripción de la alarma: alarma que se activa cuando la latencia promedio de las solicitudes completadas correctamente supera el valor límite de una operación de tabla.
Objetivo: detectar una latencia alta en las operaciones de DynamoDB que afecte al rendimiento de la aplicación.
Criterios de PromQL:
avg({__name__="SuccessfulRequestLatency", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name",Operation="your-operation"}) >THRESHOLDValor límite recomendado:
THRESHOLD(incrustado en la consulta)Justificación del valor límite: se establece según el acuerdo de nivel de servicio (SLA) de latencia de la operación específica de DynamoDB.
Intervalo de evaluación: 60
Periodo pendiente: 600
Periodo de recuperación: 600
- SystemErrors
-
Etiquetas: TableName
Descripción de la alarma: alarma que se activa cuando los errores del sistema superan el valor límite de una tabla.
Objetivo: detectar errores del servicio de DynamoDB que afecten a la disponibilidad de la tabla.
Criterios de PromQL:
sum({__name__="SystemErrors", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name"}) >THRESHOLDValor límite recomendado:
THRESHOLD(incrustado en la consulta)Justificación del valor límite: se establece según el número aceptable de errores del sistema para la tabla.
Intervalo de evaluación: 60
Periodo pendiente: 900
Periodo de recuperación: 900
- ThrottledPutRecordCount
-
Etiquetas: TableName, DelegatedOperation
Descripción de la alarma: alarma que se activa cuando el número de operaciones de inserción sujetas a limitación controlada supera el valor límite de una tabla.
Objetivo: detectar operaciones de inserción sujetas a limitación controlada que podrían provocar la pérdida de datos en las operaciones de streaming.
Criterios de PromQL:
max({__name__="ThrottledPutRecordCount", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name",DelegatedOperation="your-operation"}) >THRESHOLDValor límite recomendado:
THRESHOLD(incrustado en la consulta)Justificación del valor límite: se establece según el número aceptable de eventos de limitación controlada en las operaciones de inserción en streaming.
Intervalo de evaluación: 60
Periodo pendiente: 600
Periodo de recuperación: 600
- UserErrors
-
Etiquetas: ninguna
Descripción de la alarma: alarma que se activa cuando los errores del usuario superan el valor límite en la cuenta.
Objetivo: detectar tasas altas de errores del cliente, como errores de validación o de comprobaciones condicionales.
Criterios de PromQL:
sum({__name__="UserErrors", "@instrumentation.@name"="cloudwatch.aws/dynamodb"}) >THRESHOLDValor límite recomendado:
THRESHOLD(incrustado en la consulta)Justificación del valor límite: se establece según la tasa de errores aceptable para los fallos de las solicitudes del cliente.
Intervalo de evaluación: 60
Periodo pendiente: 600
Periodo de recuperación: 600
- WriteThrottleEvents
-
Etiquetas: TableName
Descripción de la alarma: alarma que se activa cuando los eventos de limitación controlada de escritura superan el valor límite de una tabla.
Objetivo: detectar la limitación controlada de las operaciones de escritura que indique que la capacidad aprovisionada es insuficiente.
Criterios de PromQL:
sum({__name__="WriteThrottleEvents", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name"}) >THRESHOLDValor límite recomendado:
THRESHOLD(incrustado en la consulta)Justificación del valor límite: se establece según el número aceptable de eventos de limitación controlada en las operaciones de escritura.
Intervalo de evaluación: 60
Periodo pendiente: 300
Periodo de recuperación: 300
- WriteThrottleEvents (GSI)
-
Etiquetas: TableName, GlobalSecondaryIndexName
Descripción de la alarma: alarma que se activa cuando los eventos de limitación controlada de escritura superan el valor límite de un índice secundario global.
Objetivo: detectar la limitación controlada de las operaciones de escritura en un GSI que indique que la capacidad del índice es insuficiente.
Criterios de PromQL:
sum({__name__="WriteThrottleEvents", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name",GlobalSecondaryIndexName="your-index-name"}) >THRESHOLDValor límite recomendado:
THRESHOLD(incrustado en la consulta)Justificación del valor límite: se establece según el número aceptable de eventos de limitación controlada en las operaciones de escritura del GSI.
Intervalo de evaluación: 60
Periodo pendiente: 300
Periodo de recuperación: 300
EBS
- VolumeStalledIOCheck
-
Etiquetas: VolumeId, InstanceId
Descripción de la alarma: alarma que se activa cuando un volumen de EBS informa de un error en la comprobación de operaciones de E/S bloqueadas.
Objetivo: detectar operaciones de E/S bloqueadas en volúmenes de EBS, lo que puede indicar una degradación del volumen.
Criterios de PromQL:
max({__name__="VolumeStalledIOCheck", "@instrumentation.@name"="cloudwatch.aws/ebs", VolumeId="your-volume-id",InstanceId="your-instance-id"}) >= 1Valor límite recomendado: 1 (incrustado en la consulta)
Justificación del valor límite: un valor de 1 o superior indica que el volumen presenta operaciones de E/S bloqueadas, lo que requiere una investigación inmediata.
Intervalo de evaluación: 60
Periodo pendiente: 600
Periodo de recuperación: 600
Amazon Elastic Compute Cloud
- CPUUtilization
-
Etiquetas: InstanceId
Descripción de la alarma: alarma que se activa cuando el uso promedio de la CPU supera el 80 % en una instancia de EC2.
Objetivo: detectar un uso elevado de la CPU.
Criterios de PromQL:
avg({__name__="CPUUtilization", "@instrumentation.@name"="cloudwatch.aws/ec2", InstanceId="your-instance-id"}) > 80Valor límite recomendado: 80 (incrustado en la consulta)
Justificación del valor límite: el valor límite del 80 % deja margen antes de que la CPU alcance la saturación.
Intervalo de evaluación: 300
Periodo pendiente: 900
Periodo de recuperación: 900
- StatusCheckFailed
-
Etiquetas: InstanceId
Descripción de la alarma: alarma que se activa cuando falla una comprobación de estado de la instancia o del sistema en una instancia de EC2.
Objetivo: detectar problemas de estado de la instancia o del sistema.
Criterios de PromQL:
max({__name__="StatusCheckFailed", "@instrumentation.@name"="cloudwatch.aws/ec2", InstanceId="your-instance-id"}) >= 1Valor límite recomendado: 1 (incrustado en la consulta)
Justificación del valor límite: cualquier error en una comprobación de estado requiere una investigación.
Intervalo de evaluación: 300
Periodo pendiente: 600
Periodo de recuperación: 600
- StatusCheckFailed_AttachedEBS
-
Etiquetas: InstanceId
Descripción de la alarma: alarma que se activa cuando una instancia de EC2 deja de poder acceder a un volumen de EBS asociado.
Objetivo: detectar volúmenes de EBS inaccesibles.
Criterios de PromQL:
max({__name__="StatusCheckFailed_AttachedEBS", "@instrumentation.@name"="cloudwatch.aws/ec2", InstanceId="your-instance-id"}) >= 1Valor límite recomendado: 1 (incrustado en la consulta)
Justificación del valor límite: los volúmenes inaccesibles provocan errores de E/S.
Intervalo de evaluación: 60
Periodo pendiente: 600
Periodo de recuperación: 600
Amazon ECS
- CPUReservation
-
Etiquetas: ClusterName
Descripción de la alarma: alarma que se activa cuando la reserva promedio de CPU supera el 80 % en un clúster de ECS.
Objetivo: detectar cuándo el clúster se aproxima a su capacidad de CPU.
Criterios de PromQL:
avg({__name__="CPUReservation", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="your-cluster-name"}) > 80Valor límite recomendado: 80 (incrustado en la consulta)
Justificación del valor límite: una reserva del 80 % deja poco margen para tareas nuevas.
Intervalo de evaluación: 60
Periodo pendiente: 300
Periodo de recuperación: 300
- CPUUtilization
-
Etiquetas: ClusterName, ServiceName
Descripción de la alarma: alarma que se activa cuando el uso promedio de la CPU supera el 80 % en un servicio de ECS.
Objetivo: detectar un uso elevado de la CPU en el servicio de ECS.
Criterios de PromQL:
avg({__name__="CPUUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="your-cluster-name",ServiceName="your-service-name"}) > 80Valor límite recomendado: 80 (incrustado en la consulta)
Justificación del valor límite: un valor del 80 % deja margen antes de que la CPU alcance la saturación.
Intervalo de evaluación: 60
Periodo pendiente: 300
Periodo de recuperación: 300
- EBSFilesystemUtilization
-
Etiquetas: ClusterName, ServiceName
Descripción de la alarma: alarma que se activa cuando el uso promedio del sistema de archivos de EBS supera el 80 % en un servicio de ECS.
Objetivo: detectar un uso elevado del almacenamiento de EBS.
Criterios de PromQL:
avg({__name__="EBSFilesystemUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="your-cluster-name",ServiceName="your-service-name"}) > 80Valor límite recomendado: 80 (incrustado en la consulta)
Justificación del valor límite: un valor del 80 % deja margen antes de que la CPU alcance la saturación.
Intervalo de evaluación: 60
Periodo pendiente: 300
Periodo de recuperación: 300
- MemoryReservation
-
Etiquetas: ClusterName
Descripción de la alarma: alarma que se activa cuando la reserva promedio de memoria supera el 80 % en un clúster de ECS.
Objetivo: detectar cuándo el clúster se aproxima al límite de su capacidad de memoria.
Criterios de PromQL:
avg({__name__="MemoryReservation", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="your-cluster-name"}) > 80Valor límite recomendado: 80 (incrustado en la consulta)
Justificación del valor límite: una reserva del 80 % deja poco margen para tareas nuevas.
Intervalo de evaluación: 60
Periodo pendiente: 300
Periodo de recuperación: 300
- MemoryUtilization
-
Etiquetas: ClusterName, ServiceName
Descripción de la alarma: alarma que se activa cuando el uso promedio de la memoria supera el 80 % en un servicio de ECS.
Objetivo: detectar un uso elevado de la memoria.
Criterios de PromQL:
avg({__name__="MemoryUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="your-cluster-name",ServiceName="your-service-name"}) > 80Valor límite recomendado: 80 (incrustado en la consulta)
Justificación del valor límite: un valor del 80 % deja margen antes de que la CPU alcance la saturación.
Intervalo de evaluación: 60
Periodo pendiente: 300
Periodo de recuperación: 300
- HTTPCode_Target_5XX_Count
-
Etiquetas: ClusterName, ServiceName
Descripción de la alarma: alarma que se activa cuando el número de errores HTTP 5XX supera el valor límite en un servicio de ECS.
Objetivo: detectar un número elevado de errores del servidor.
Criterios de PromQL:
sum({__name__="HTTPCode_Target_5XX_Count", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="your-cluster-name",ServiceName="your-service-name"}) >THRESHOLDValor límite recomendado:
THRESHOLD(incrustado en la consulta)Justificación del valor límite: se establece según el valor de referencia de la tasa de errores habitual de la aplicación.
Intervalo de evaluación: 60
Periodo pendiente: 300
Periodo de recuperación: 300
- TargetResponseTime
-
Etiquetas: ClusterName, ServiceName
Descripción de la alarma: alarma que se activa cuando el tiempo promedio de respuesta del destino supera el valor límite en un servicio de ECS.
Objetivo: detectar un tiempo de respuesta elevado del destino.
Criterios de PromQL:
avg({__name__="TargetResponseTime", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="your-cluster-name",ServiceName="your-service-name"}) >THRESHOLDValor límite recomendado:
THRESHOLD(incrustado en la consulta)Justificación del valor límite: se establece según los requisitos de latencia aceptable de la aplicación.
Intervalo de evaluación: 60
Periodo pendiente: 300
Periodo de recuperación: 300
Información de contenedores de Amazon ECS
- EphemeralStorageUtilized
-
Etiquetas: ClusterName, ServiceName
Descripción de la alarma: alarma que se activa cuando el uso promedio del almacenamiento efímero supera el valor límite en las tareas de Fargate.
Objetivo: detectar un uso elevado del almacenamiento efímero en las tareas de Fargate.
Criterios de PromQL:
avg({__name__="EphemeralStorageUtilized", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name",ServiceName="your-service-name"}) >THRESHOLDValor límite recomendado:
THRESHOLD(incrustado en la consulta)Justificación del valor límite: se establece según el almacenamiento efímero asignado a las tareas.
Intervalo de evaluación: 60
Periodo pendiente: 300
Periodo de recuperación: 300
- RunningTaskCount
-
Etiquetas: ClusterName, ServiceName
Descripción de la alarma: alarma que se activa cuando el número de tareas en ejecución se reduce a cero en un servicio de ECS.
Objetivo: detectar cuando no hay ninguna tarea en ejecución.
Criterios de PromQL:
avg({__name__="RunningTaskCount", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name",ServiceName="your-service-name"}) <= 0Valor límite recomendado: 0 (incrustado en la consulta)
Justificación del valor límite: la ausencia de tareas en ejecución indica una interrupción del servicio.
Intervalo de evaluación: 60
Periodo pendiente: 300
Periodo de recuperación: 300
- instance_filesystem_utilization
-
Etiquetas: InstanceId, ContainerInstanceId, ClusterName
Descripción de la alarma: alarma que se activa cuando el uso promedio del sistema de archivos supera el 90 % en una instancia de contenedor.
Objetivo: detectar un uso elevado del sistema de archivos.
Criterios de PromQL:
avg({__name__="instance_filesystem_utilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", InstanceId="your-instance-id",ContainerInstanceId="your-container-instance-id",ClusterName="your-cluster-name"}) > 90Valor límite recomendado: 90 (incrustado en la consulta)
Justificación del valor límite: un uso del sistema de archivos del 90 % deja poco espacio disponible para las operaciones.
Intervalo de evaluación: 60
Periodo pendiente: 300
Periodo de recuperación: 300
Observabilidad mejorada de Información de contenedores de Amazon ECS
- TaskCpuUtilization (nivel de clúster)
-
Etiquetas: ClusterName
Descripción de la alarma: alarma que se activa cuando el uso promedio de CPU de las tareas supera el 80 % a nivel de clúster.
Objetivo: detectar un uso elevado de la CPU.
Criterios de PromQL:
avg({__name__="TaskCpuUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name"}) > 80Valor límite recomendado: 80 (incrustado en la consulta)
Justificación del valor límite: un valor del 80 % deja margen antes de que la CPU alcance la saturación.
Intervalo de evaluación: 60
Periodo pendiente: 300
Periodo de recuperación: 300
- TaskCpuUtilization (nivel de servicio)
-
Etiquetas: ClusterName, ServiceName
Descripción de la alarma: alarma que se activa cuando el uso promedio de CPU de las tareas supera el 80 % a nivel de servicio.
Objetivo: detectar un uso elevado de la CPU.
Criterios de PromQL:
avg({__name__="TaskCpuUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name",ServiceName="your-service-name"}) > 80Valor límite recomendado: 80 (incrustado en la consulta)
Justificación del valor límite: un valor del 80 % deja margen antes de que la CPU alcance la saturación.
Intervalo de evaluación: 60
Periodo pendiente: 300
Periodo de recuperación: 300
- TaskMemoryUtilization (nivel de clúster)
-
Etiquetas: ClusterName
Descripción de la alarma: alarma que se activa cuando el uso promedio de memoria de las tareas supera el 80 % a nivel de clúster.
Objetivo: detectar un uso elevado de la memoria.
Criterios de PromQL:
avg({__name__="TaskMemoryUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name"}) > 80Valor límite recomendado: 80 (incrustado en la consulta)
Justificación del valor límite: un valor del 80 % deja margen antes de que la CPU alcance la saturación.
Intervalo de evaluación: 60
Periodo pendiente: 300
Periodo de recuperación: 300
- TaskMemoryUtilization (nivel de servicio)
-
Etiquetas: ClusterName, ServiceName
Descripción de la alarma: alarma que se activa cuando el uso promedio de memoria de las tareas supera el 80 % a nivel de servicio.
Objetivo: detectar un uso elevado de la memoria.
Criterios de PromQL:
avg({__name__="TaskMemoryUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name",ServiceName="your-service-name"}) > 80Valor límite recomendado: 80 (incrustado en la consulta)
Justificación del valor límite: un valor del 80 % deja margen antes de que la CPU alcance la saturación.
Intervalo de evaluación: 60
Periodo pendiente: 300
Periodo de recuperación: 300
- ContainerCpuUtilization (nivel de clúster)
-
Etiquetas: ClusterName
Descripción de la alarma: alarma que se activa cuando el uso promedio de CPU de los contenedores supera el 80 % a nivel de clúster.
Objetivo: detectar un uso elevado de la CPU.
Criterios de PromQL:
avg({__name__="ContainerCpuUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name"}) > 80Valor límite recomendado: 80 (incrustado en la consulta)
Justificación del valor límite: un valor del 80 % deja margen antes de que la CPU alcance la saturación.
Intervalo de evaluación: 60
Periodo pendiente: 300
Periodo de recuperación: 300
- ContainerCpuUtilization (nivel de contenedor)
-
Etiquetas: ContainerName, ClusterName, ServiceName
Descripción de la alarma: alarma que se activa cuando el uso promedio de CPU de los contenedores supera el 80 % a nivel de contenedor.
Objetivo: detectar un uso elevado de la CPU.
Criterios de PromQL:
avg({__name__="ContainerCpuUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ContainerName="your-container-name",ClusterName="your-cluster-name",ServiceName="your-service-name"}) > 80Valor límite recomendado: 80 (incrustado en la consulta)
Justificación del valor límite: un valor del 80 % deja margen antes de que la CPU alcance la saturación.
Intervalo de evaluación: 60
Periodo pendiente: 300
Periodo de recuperación: 300
- ContainerMemoryUtilization (nivel de clúster)
-
Etiquetas: ClusterName
Descripción de la alarma: alarma que se activa cuando el uso promedio de memoria de los contenedores supera el 80 % a nivel de clúster.
Objetivo: detectar un uso elevado de la memoria.
Criterios de PromQL:
avg({__name__="ContainerMemoryUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name"}) > 80Valor límite recomendado: 80 (incrustado en la consulta)
Justificación del valor límite: un valor del 80 % deja margen antes de que la CPU alcance la saturación.
Intervalo de evaluación: 60
Periodo pendiente: 300
Periodo de recuperación: 300
- ContainerMemoryUtilization (nivel de contenedor)
-
Etiquetas: ContainerName, ClusterName, ServiceName
Descripción de la alarma: alarma que se activa cuando el uso promedio de memoria de los contenedores supera el 80 % a nivel de contenedor.
Objetivo: detectar un uso elevado de la memoria.
Criterios de PromQL:
avg({__name__="ContainerMemoryUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ContainerName="your-container-name",ClusterName="your-cluster-name",ServiceName="your-service-name"}) > 80Valor límite recomendado: 80 (incrustado en la consulta)
Justificación del valor límite: un valor del 80 % deja margen antes de que la CPU alcance la saturación.
Intervalo de evaluación: 60
Periodo pendiente: 300
Periodo de recuperación: 300
- TaskEBSfilesystemUtilization
-
Etiquetas: ClusterName, ServiceName
Descripción de la alarma: alarma que se activa cuando el uso promedio del sistema de archivos de EBS supera el 80 % en las tareas.
Objetivo: detectar un uso elevado del sistema de archivos de EBS.
Criterios de PromQL:
avg({__name__="TaskEBSfilesystemUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name",ServiceName="your-service-name"}) > 80Valor límite recomendado: 80 (incrustado en la consulta)
Justificación del valor límite: un valor del 80 % deja margen antes de que la CPU alcance la saturación.
Intervalo de evaluación: 60
Periodo pendiente: 300
Periodo de recuperación: 300
- TaskEphemeralStorageUtilization (nivel de clúster)
-
Etiquetas: ClusterName
Descripción de la alarma: alarma que se activa cuando el uso promedio del almacenamiento efímero supera el 80 % a nivel de clúster.
Objetivo: detectar un uso elevado del almacenamiento efímero.
Criterios de PromQL:
avg({__name__="TaskEphemeralStorageUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name"}) > 80Valor límite recomendado: 80 (incrustado en la consulta)
Justificación del valor límite: un valor del 80 % deja margen antes de que la CPU alcance la saturación.
Intervalo de evaluación: 60
Periodo pendiente: 300
Periodo de recuperación: 300
- TaskEphemeralStorageUtilization (nivel de servicio)
-
Etiquetas: ClusterName, ServiceName
Descripción de la alarma: alarma que se activa cuando el uso promedio del almacenamiento efímero supera el 80 % a nivel de servicio.
Objetivo: detectar un uso elevado del almacenamiento efímero.
Criterios de PromQL:
avg({__name__="TaskEphemeralStorageUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name",ServiceName="your-service-name"}) > 80Valor límite recomendado: 80 (incrustado en la consulta)
Justificación del valor límite: un valor del 80 % deja margen antes de que la CPU alcance la saturación.
Intervalo de evaluación: 60
Periodo pendiente: 300
Periodo de recuperación: 300
Amazon EFS
- PercentIOLimit
-
Etiquetas: FileSystemId
Descripción de la alarma: alarma que se activa cuando un sistema de archivos de EFS alcanza el 100 % de su límite de operaciones de E/S.
Objetivo: detectar cuándo el sistema de archivos alcanza su límite de operaciones de E/S.
Criterios de PromQL:
avg({__name__="PercentIOLimit", "@instrumentation.@name"="cloudwatch.aws/efs", FileSystemId="your-filesystem-id"}) >= 100Valor límite recomendado: 100 (incrustado en la consulta)
Justificación del valor límite: al alcanzar el 100 %, el sistema de archivos se convierte en un cuello de botella.
Intervalo de evaluación: 60
Periodo pendiente: 900
Periodo de recuperación: 900
- BurstCreditBalance
-
Etiquetas: FileSystemId
Descripción de la alarma: alarma que se activa cuando el saldo de créditos de ampliación se reduce a cero en un sistema de archivos de EFS.
Objetivo: detectar el agotamiento de los créditos de ampliación que provoca una disminución del rendimiento.
Criterios de PromQL:
avg({__name__="BurstCreditBalance", "@instrumentation.@name"="cloudwatch.aws/efs", FileSystemId="your-filesystem-id"}) <= 0Valor límite recomendado: 0 (incrustado en la consulta)
Justificación del valor límite: un saldo de cero créditos reduce el rendimiento.
Intervalo de evaluación: 60
Periodo pendiente: 900
Periodo de recuperación: 900
Información de contenedores de Amazon EKS
- node_cpu_utilization
-
Etiquetas: ClusterName
Descripción de la alarma: alarma que se activa cuando el uso máximo de CPU supera el 80 % en los nodos de trabajo de EKS.
Objetivo: detectar un uso elevado de CPU en los nodos de trabajo.
Criterios de PromQL:
max({__name__="node_cpu_utilization", "@instrumentation.@name"="cloudwatch.aws/eks-containerinsights", ClusterName="your-cluster-name"}) > 80Valor límite recomendado: 80 (incrustado en la consulta)
Justificación del valor límite: un valor del 80 % deja margen antes de que la CPU alcance la saturación.
Intervalo de evaluación: 60
Periodo pendiente: 300
Periodo de recuperación: 300
- node_filesystem_utilization
-
Etiquetas: ClusterName
Descripción de la alarma: alarma que se activa cuando el uso máximo del sistema de archivos supera el valor límite en los nodos de trabajo de EKS.
Objetivo: detectar un uso elevado del sistema de archivos en los nodos de trabajo.
Criterios de PromQL:
max({__name__="node_filesystem_utilization", "@instrumentation.@name"="cloudwatch.aws/eks-containerinsights", ClusterName="your-cluster-name"}) >THRESHOLDValor límite recomendado:
THRESHOLD(incrustado en la consulta)Justificación del valor límite: se establece según la capacidad de almacenamiento de los nodos y sus patrones de uso.
Intervalo de evaluación: 60
Periodo pendiente: 300
Periodo de recuperación: 300
- node_memory_utilization
-
Etiquetas: ClusterName
Descripción de la alarma: alarma que se activa cuando el uso máximo de memoria supera el 80 % en los nodos de trabajo de EKS.
Objetivo: detectar un uso elevado de memoria en los nodos de trabajo.
Criterios de PromQL:
max({__name__="node_memory_utilization", "@instrumentation.@name"="cloudwatch.aws/eks-containerinsights", ClusterName="your-cluster-name"}) > 80Valor límite recomendado: 80 (incrustado en la consulta)
Justificación del valor límite: un valor del 80 % deja margen antes de que la CPU alcance la saturación.
Intervalo de evaluación: 60
Periodo pendiente: 300
Periodo de recuperación: 300
- pod_cpu_utilization_over_pod_limit
-
Etiquetas: ClusterName, Namespace, Service
Descripción de la alarma: alarma que se activa cuando el uso de CPU de un pod supera el 80 % de su límite.
Objetivo: detectar pods que se aproximan a sus límites de CPU.
Criterios de PromQL:
max({__name__="pod_cpu_utilization_over_pod_limit", "@instrumentation.@name"="cloudwatch.aws/eks-containerinsights", ClusterName="your-cluster-name",Namespace="your-namespace",Service="your-service"}) > 80Valor límite recomendado: 80 (incrustado en la consulta)
Justificación del valor límite: un uso del 80 % deja margen antes de que se produzca una limitación controlada.
Intervalo de evaluación: 60
Periodo pendiente: 300
Periodo de recuperación: 300
- pod_memory_utilization_over_pod_limit
-
Etiquetas: ClusterName, Namespace, Service
Descripción de la alarma: alarma que se activa cuando el uso de memoria de un pod supera el 80 % de su límite.
Objetivo: detectar pods que se aproximan a sus límites de memoria.
Criterios de PromQL:
max({__name__="pod_memory_utilization_over_pod_limit", "@instrumentation.@name"="cloudwatch.aws/eks-containerinsights", ClusterName="your-cluster-name",Namespace="your-namespace",Service="your-service"}) > 80Valor límite recomendado: 80 (incrustado en la consulta)
Justificación del valor límite: un uso del 80 % deja margen antes de que se produzca un OOMKill.
Intervalo de evaluación: 60
Periodo pendiente: 300
Periodo de recuperación: 300
Amazon ElastiCache
- CPUUtilization
-
Etiquetas: CacheClusterId, CacheNodeId
Descripción de la alarma: alarma que se activa cuando el uso promedio de CPU supera el valor límite en un nodo de ElastiCache.
Objetivo: detectar un uso elevado de CPU en la instancia.
Criterios de PromQL:
avg({__name__="CPUUtilization", "@instrumentation.@name"="cloudwatch.aws/elasticache", CacheClusterId="your-cache-cluster-id",CacheNodeId="your-cache-node-id"}) >THRESHOLDValor límite recomendado:
THRESHOLD(incrustado en la consulta)Justificación del valor límite: se establece según el tipo de nodo y las características de la carga de trabajo.
Intervalo de evaluación: 60
Periodo pendiente: 300
Periodo de recuperación: 300
- CurrConnections
-
Etiquetas: CacheClusterId, CacheNodeId
Descripción de la alarma: alarma que se activa cuando el número de conexiones supera el valor límite en un nodo de ElastiCache.
Objetivo: detectar un número elevado de conexiones.
Criterios de PromQL:
avg({__name__="CurrConnections", "@instrumentation.@name"="cloudwatch.aws/elasticache", CacheClusterId="your-cache-cluster-id",CacheNodeId="your-cache-node-id"}) >THRESHOLDValor límite recomendado:
THRESHOLD(incrustado en la consulta)Justificación del valor límite: se establece según el tamaño previsto del grupo de conexiones y las necesidades de la aplicación.
Intervalo de evaluación: 60
Periodo pendiente: 600
Periodo de recuperación: 600
- DatabaseMemoryUsagePercentage
-
Etiquetas: CacheClusterId
Descripción de la alarma: alarma que se activa cuando el uso de memoria de la base de datos supera el valor límite en un clúster de ElastiCache.
Objetivo: detectar un uso elevado de memoria para evitar errores de escritura.
Criterios de PromQL:
avg({__name__="DatabaseMemoryUsagePercentage", "@instrumentation.@name"="cloudwatch.aws/elasticache", CacheClusterId="your-cache-cluster-id"}) >THRESHOLDValor límite recomendado:
THRESHOLD(incrustado en la consulta)Justificación del valor límite: se establece según la política de expulsión y la criticidad de los datos.
Intervalo de evaluación: 60
Periodo pendiente: 300
Periodo de recuperación: 300
- EngineCPUUtilization
-
Etiquetas: CacheClusterId
Descripción de la alarma alarma que se activa cuando el uso de CPU del motor de Redis supera el 90 % en un clúster de ElastiCache.
Objetivo: detectar un uso elevado de CPU del motor de Redis.
Criterios de PromQL:
avg({__name__="EngineCPUUtilization", "@instrumentation.@name"="cloudwatch.aws/elasticache", CacheClusterId="your-cache-cluster-id"}) > 90Valor límite recomendado: 90 (incrustado en la consulta)
Justificación del valor límite: Redis utiliza un solo subproceso; un uso superior al 90 % indica saturación.
Intervalo de evaluación: 60
Periodo pendiente: 300
Periodo de recuperación: 300
- ReplicationLag
-
Etiquetas: CacheClusterId
Descripción de la alarma: alarma que se activa cuando el retraso de replicación supera el valor límite en un clúster de ElastiCache.
Objetivo: detectar retrasos en la replicación que afecten a la coherencia de datos.
Criterios de PromQL:
avg({__name__="ReplicationLag", "@instrumentation.@name"="cloudwatch.aws/elasticache", CacheClusterId="your-cache-cluster-id"}) >THRESHOLDValor límite recomendado:
THRESHOLD(incrustado en la consulta)Justificación del valor límite: se establece según la tolerancia de la aplicación a las lecturas de datos obsoletos.
Intervalo de evaluación: 60
Periodo pendiente: 900
Periodo de recuperación: 900
GPU elásticas
- GPUConnectivityCheckFailed
-
Etiquetas: InstanceId, EGPUId
Descripción de la alarma: alarma que se activa cuando el acelerador Elastic Graphics pierde la conectividad con la instancia.
Objetivo: detectar problemas de conectividad con el acelerador de Elastic Graphics.
Criterios de PromQL:
max({__name__="GPUConnectivityCheckFailed", "@instrumentation.@name"="cloudwatch.aws/elasticgpus", InstanceId="your-instance-id",EGPUId="your-egpu-id"}) > 0Valor límite recomendado: 0 (incrustado en la consulta)
Justificación del valor límite: cualquier error de conectividad requiere una investigación.
Intervalo de evaluación: 300
Periodo pendiente: 900
Periodo de recuperación: 900
- GPUHealthCheckFailed
-
Etiquetas: InstanceId, EGPUId
Descripción de la alarma: alarma que se activa cuando falla una comprobación de estado del acelerador de Elastic Graphics.
Objetivo: detectar un estado incorrecto del acelerador de Elastic Graphics.
Criterios de PromQL:
max({__name__="GPUHealthCheckFailed", "@instrumentation.@name"="cloudwatch.aws/elasticgpus", InstanceId="your-instance-id",EGPUId="your-egpu-id"}) > 0Valor límite recomendado: 0 (incrustado en la consulta)
Justificación del valor límite: los errores en las comprobaciones de estado indican problemas con el acelerador.
Intervalo de evaluación: 300
Periodo pendiente: 900
Periodo de recuperación: 900
Programador de Amazon EventBridge
- TargetErrorThrottledCount
-
Descripción de la alarma: alarma que se activa cuando las invocaciones de destino programadas están sujetas a limitación controlada.
Objetivo: detectar la limitación controlada del destino que provoca retrasos en la programación.
Criterios de PromQL:
sum({__name__="TargetErrorThrottledCount", "@instrumentation.@name"="cloudwatch.aws/scheduler"}) > 0Valor límite recomendado: 0 (incrustado en la consulta)
Justificación del valor límite: cualquier limitación controlada indica problemas de capacidad del destino.
Intervalo de evaluación: 60
Periodo pendiente: 900
Periodo de recuperación: 900
- InvocationThrottleCount
-
Descripción de la alarma: alarma que se activa cuando las invocaciones del programador están sujetas a limitación controlada.
Objetivo: detectar la limitación controlada de las invocaciones del programador.
Criterios de PromQL:
sum({__name__="InvocationThrottleCount", "@instrumentation.@name"="cloudwatch.aws/scheduler"}) > 0Valor límite recomendado: 0 (incrustado en la consulta)
Justificación del valor límite: la limitación controlada retrasa las ejecuciones programadas.
Intervalo de evaluación: 60
Periodo pendiente: 900
Periodo de recuperación: 900
- InvocationDroppedCount
-
Descripción de la alarma: alarma que se activa cuando se descartan invocaciones programadas.
Objetivo: detectar invocaciones descartadas.
Criterios de PromQL:
sum({__name__="InvocationDroppedCount", "@instrumentation.@name"="cloudwatch.aws/scheduler"}) > 0Valor límite recomendado: 0 (incrustado en la consulta)
Justificación del valor límite: las invocaciones descartadas representan eventos programados que no se ejecutaron.
Intervalo de evaluación: 60
Periodo pendiente: 60
Período de recuperación: 60
- InvocationsFailedToBeSentToDeadLetterCount
-
Descripción de la alarma: alarma que se activa cuando las invocaciones fallidas no se pueden enviar a la cola de mensajes fallidos.
Objetivo:detectar errores de entrega a la cola de mensajes fallidos (DLQ).
Criterios de PromQL:
sum({__name__="InvocationsFailedToBeSentToDeadLetterCount", "@instrumentation.@name"="cloudwatch.aws/scheduler"}) > 0Valor límite recomendado: 0 (incrustado en la consulta)
Justificación del valor límite: un error de entrega a la DLQ implica la pérdida de información sobre el error.
Intervalo de evaluación: 60
Periodo pendiente: 900
Periodo de recuperación: 900
Amazon Kinesis Data Streams
- GetRecords.IteratorAgeMilliseconds
-
Etiquetas: StreamName
Descripción de la alarma: alarma que se activa cuando la antigüedad del iterador del consumidor supera el valor límite en un flujo de Kinesis.
Objetivo: detectar datos cuyo retraso se aproxima al período de retención, con el consiguiente riesgo de pérdida de datos.
Criterios de PromQL:
max({__name__="GetRecords.IteratorAgeMilliseconds", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="your-stream-name"}) >THRESHOLDValor límite recomendado:
THRESHOLD(incrustado en la consulta)Justificación del valor límite: se establece según un porcentaje del período de retención del flujo.
Intervalo de evaluación: 60
Periodo pendiente: 900
Periodo de recuperación: 900
- GetRecords.Success
-
Etiquetas: StreamName
Descripción de la alarma: alarma que se activa cuando la tasa de éxito de GetRecords cae por debajo del valor límite en un flujo de Kinesis.
Objetivo: detectar errores en la recuperación de datos por parte de los consumidores.
Criterios de PromQL:
avg({__name__="GetRecords.Success", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="your-stream-name"}) <THRESHOLDValor límite recomendado:
THRESHOLD(incrustado en la consulta)Justificación del valor límite: se establece según la tasa de éxito esperada.
Intervalo de evaluación: 60
Periodo pendiente: 300
Periodo de recuperación: 300
- PutRecord.Success
-
Etiquetas: StreamName
Descripción de la alarma: alarma que se activa cuando la tasa de éxito de PutRecord cae por debajo del valor límite en un flujo de Kinesis.
Objetivo: detectar errores en la ingesta de datos por parte de los productores.
Criterios de PromQL:
avg({__name__="PutRecord.Success", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="your-stream-name"}) <THRESHOLDValor límite recomendado:
THRESHOLD(incrustado en la consulta)Justificación del valor límite: se establece según la tasa de éxito esperada.
Intervalo de evaluación: 60
Periodo pendiente: 300
Periodo de recuperación: 300
- PutRecords.FailedRecords
-
Etiquetas: StreamName
Descripción de la alarma: alarma que se activa cuando las operaciones de inserción por lotes generan registros con errores en un flujo de Kinesis.
Objetivo: detectar errores en las operaciones de inserción por lotes.
Criterios de PromQL:
sum({__name__="PutRecords.FailedRecords", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="your-stream-name"}) >THRESHOLDValor límite recomendado:
THRESHOLD(incrustado en la consulta)Justificación del valor límite: se establece según el número aceptable de errores.
Intervalo de evaluación: 60
Periodo pendiente: 300
Periodo de recuperación: 300
- ReadProvisionedThroughputExceeded
-
Etiquetas: StreamName
Descripción de la alarma: alarma que se activa cuando las lecturas del consumidor superan el rendimiento aprovisionado de un flujo de Kinesis.
Objetivo: detectar la limitación controlada de las lecturas del consumidor.
Criterios de PromQL:
avg({__name__="ReadProvisionedThroughputExceeded", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="your-stream-name"}) >THRESHOLDValor límite recomendado:
THRESHOLD(incrustado en la consulta)Justificación del valor límite: cualquier limitación controlada sostenida indica que se necesita más capacidad.
Intervalo de evaluación: 60
Periodo pendiente: 300
Periodo de recuperación: 300
- SubscribeToShardEvent.MillisBehindLatest
-
Etiquetas: StreamName, ConsumerName
Descripción de la alarma: alarma que se activa cuando un consumidor con distribución mejorada se retrasa respecto al registro más reciente.
Objetivo: detectar retrasos en el procesamiento del consumidor con distribución mejorada.
Criterios de PromQL:
avg({__name__="SubscribeToShardEvent.MillisBehindLatest", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="your-stream-name",ConsumerName="your-consumer-name"}) >THRESHOLDValor límite recomendado:
THRESHOLD(incrustado en la consulta)Justificación del valor límite: se establece según el retraso de procesamiento aceptable.
Intervalo de evaluación: 60
Periodo pendiente: 300
Periodo de recuperación: 300
- WriteProvisionedThroughputExceeded
-
Etiquetas: StreamName
Descripción de la alarma: alarma que se activa cuando las escrituras del productor superan el rendimiento aprovisionado de un flujo de Kinesis.
Objetivo: detectar la limitación controlada de las escrituras del productor.
Criterios de PromQL:
avg({__name__="WriteProvisionedThroughputExceeded", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="your-stream-name"}) >THRESHOLDValor límite recomendado:
THRESHOLD(incrustado en la consulta)Justificación del valor límite: una limitación controlada sostenida indica que se necesita más capacidad.
Intervalo de evaluación: 60
Periodo pendiente: 300
Periodo de recuperación: 300
AWS Lambda
- ClaimedAccountConcurrency
-
Descripción de la alarma: alarma que se activa cuando la simultaneidad reclamada de la cuenta supera el valor límite.
Objetivo: detectar cuándo la cuenta se aproxima a la cuota de simultaneidad.
Criterios de PromQL:
max({__name__="ClaimedAccountConcurrency", "@instrumentation.@name"="cloudwatch.aws/lambda"}) >THRESHOLDValor límite recomendado:
THRESHOLD(incrustado en la consulta)Justificación del valor límite: se establece como un porcentaje del límite regional de simultaneidad.
Intervalo de evaluación: 60
Periodo pendiente: 600
Periodo de recuperación: 600
- Errores
-
Etiquetas: FunctionName
Descripción de la alarma: alarma que se activa cuando el número de errores de una función de Lambda supera el valor límite.
Objetivo: detectar un número elevado de errores de la función.
Criterios de PromQL:
sum({__name__="Errors", "@instrumentation.@name"="cloudwatch.aws/lambda", FunctionName="your-function-name"}) >THRESHOLDValor límite recomendado:
THRESHOLD(incrustado en la consulta)Justificación del valor límite: se establece según el volumen de errores aceptable.
Intervalo de evaluación: 60
Periodo pendiente: 180
Periodo de recuperación: 300
- Limitaciones
-
Etiquetas: FunctionName
Descripción de la alarma: alarma que se activa cuando las invocaciones de una función de Lambda están sujetas a limitación controlada.
Objetivo: detectar la limitación controlada de las invocaciones de la función.
Criterios de PromQL:
sum({__name__="Throttles", "@instrumentation.@name"="cloudwatch.aws/lambda", FunctionName="your-function-name"}) >THRESHOLDValor límite recomendado:
THRESHOLD(incrustado en la consulta)Justificación del valor límite: la limitación controlada indica que se alcanzó el límite de simultaneidad.
Intervalo de evaluación: 60
Periodo pendiente: 300
Periodo de recuperación: 300
- Duración
-
Etiquetas: FunctionName
Descripción de la alarma: alarma que se activa cuando la duración p90 de una función supera el valor límite en una función de Lambda.
Objetivo: detectar invocaciones de funciones de larga duración.
Criterios de PromQL:
histogram_quantile(0.9, {__name__="Duration", "@instrumentation.@name"="cloudwatch.aws/lambda", FunctionName="your-function-name"}) >THRESHOLDValor límite recomendado:
THRESHOLD(incrustado en la consulta)Justificación del valor límite: se establece en relación con el tiempo de espera de la función.
Intervalo de evaluación: 60
Periodo pendiente: 900
Periodo de recuperación: 900
- ConcurrentExecutions
-
Etiquetas: FunctionName
Descripción de la alarma: alarma que se activa cuando las ejecuciones simultáneas superan el valor límite de una función de Lambda.
Objetivo: detectar cuándo la función se aproxima a sus límites de simultaneidad.
Criterios de PromQL:
max({__name__="ConcurrentExecutions", "@instrumentation.@name"="cloudwatch.aws/lambda", FunctionName="your-function-name"}) >THRESHOLDValor límite recomendado:
THRESHOLD(incrustado en la consulta)Justificación del valor límite: se establece como un porcentaje de la simultaneidad reservada.
Intervalo de evaluación: 60
Periodo pendiente: 600
Periodo de recuperación: 600
AWS LambdaConocimientos en
- memory_utilization
-
Etiquetas: function_name
Descripción de la alarma: alarma que se activa cuando el uso promedio de memoria supera el 90 % en una función de Lambda.
Objetivo: detectar cuándo la función se aproxima al límite de memoria configurado.
Criterios de PromQL:
avg({__name__="memory_utilization", "@instrumentation.@name"="cloudwatch.aws/lambda-insights", function_name="your-function-name"}) > 90Valor límite recomendado: 90 (incrustado en la consulta)
Justificación del valor límite: un uso superior al 90 % aumenta el riesgo de errores por falta de memoria.
Intervalo de evaluación: 60
Periodo pendiente: 600
Periodo de recuperación: 600
Puerta de enlace NAT
- ErrorPortAllocation
-
Etiquetas: NatGatewayId
Descripción de la alarma: alarma que se activa cuando la puerta de enlace NAT no puede asignar un puerto para conexiones nuevas.
Objetivo:detectar errores de asignación de puertos que impiden establecer conexiones nuevas.
Criterios de PromQL:
sum({__name__="ErrorPortAllocation", "@instrumentation.@name"="cloudwatch.aws/natgateway", NatGatewayId="your-nat-gateway-id"}) > 0Valor límite recomendado: 0 (incrustado en la consulta)
Justificación del valor límite: cualquier error de asignación afecta a la conectividad.
Intervalo de evaluación: 60
Periodo pendiente: 900
Periodo de recuperación: 900
- PacketsDropCount
-
Etiquetas: NatGatewayId
Descripción de la alarma: alarma que se activa cuando la puerta de enlace NAT descarta paquetes por encima del valor límite.
Objetivo: detectar descartes de paquetes que indiquen problemas de capacidad o conectividad.
Criterios de PromQL:
sum({__name__="PacketsDropCount", "@instrumentation.@name"="cloudwatch.aws/natgateway", NatGatewayId="your-nat-gateway-id"}) >THRESHOLDValor límite recomendado:
THRESHOLD(incrustado en la consulta)Justificación del valor límite: se establece según la tasa de descarte aceptable.
Intervalo de evaluación: 60
Periodo pendiente: 300
Periodo de recuperación: 300
Puntos de conexión de AWS PrivateLink
- PacketsDropped
-
Etiquetas: VpcId, VpcEndpointId, EndpointType, SubnetId, ServiceName
Descripción de la alarma: alarma que se activa cuando un punto de conexión de VPC descarta paquetes por encima del valor límite.
Objetivo: detectar un punto de conexión o servicio de punto de conexión en mal estado.
Criterios de PromQL:
sum({__name__="PacketsDropped", "@instrumentation.@name"="cloudwatch.aws/privatelinkendpoints", VpcId="your-vpc-id",VpcEndpointId="your-vpc-endpoint-id",EndpointType="your-endpoint-type",SubnetId="your-subnet-id",ServiceName="your-service-name"}) >THRESHOLDValor límite recomendado:
THRESHOLD(incrustado en la consulta)Justificación del valor límite: se establece según la tasa de descarte aceptable.
Intervalo de evaluación: 60
Periodo pendiente: 300
Periodo de recuperación: 300
Servicios de AWS PrivateLink
- RstPacketsSent
-
Etiquetas: ServiceId, LoadBalancerArn, Az
Descripción de la alarma: alarma que se activa cuando la tasa de paquetes RST supera el valor límite de un servicio de punto de conexión.
Objetivo:detectar destinos en mal estado del servicio de punto de conexión.
Criterios de PromQL:
sum({__name__="RstPacketsSent", "@instrumentation.@name"="cloudwatch.aws/privatelinkservices", ServiceId="SVC",LoadBalancerArn="LB",Az="AZ"}) >THRESHOLDValor límite recomendado:
THRESHOLD(incrustado en la consulta)Justificación del valor límite: se establece según una tasa aceptable de paquetes RST.
Intervalo de evaluación: 60
Periodo pendiente: 300
Periodo de recuperación: 300
RDS
- CPUUtilization
-
Etiquetas: DBInstanceIdentifier
Descripción de la alarma: alarma que se activa cuando el uso promedio de CPU supera el 90 % en una instancia de RDS.
Objetivo: detectar un uso elevado de CPU que pueda degradar el rendimiento.
Criterios de PromQL:
avg({__name__="CPUUtilization", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > 90Valor límite recomendado: 90 (incrustado en la consulta)
Justificación del valor límite: un valor del 90 % indica que está cerca de alcanzar la saturación.
Intervalo de evaluación: 60
Periodo pendiente: 300
Periodo de recuperación: 300
- DatabaseConnections
-
Etiquetas: DBInstanceIdentifier
Descripción de la alarma: alarma que se activa cuando el número de conexiones a la base de datos supera el valor límite de una instancia de RDS.
Objetivo: evitar que se rechacen conexiones al alcanzar el límite máximo.
Criterios de PromQL:
avg({__name__="DatabaseConnections", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) >THRESHOLDValor límite recomendado:
THRESHOLD(incrustado en la consulta)Justificación del valor límite: se establece como un porcentaje del parámetro max_connections.
Intervalo de evaluación: 60
Periodo pendiente: 300
Periodo de recuperación: 300
- EBSByteBalance%
-
Etiquetas: DBInstanceIdentifier
Descripción de la alarma: alarma que se activa cuando el saldo de bytes de EBS cae por debajo del 10 % en una instancia de RDS.
Objetivo: detectar un nivel bajo de créditos de rendimiento que pueda provocar cuellos de botella.
Criterios de PromQL:
avg({__name__="EBSByteBalance%", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) < 10Valor límite recomendado: 10 (incrustado en la consulta)
Justificación del valor límite: un valor inferior al 10 % conlleva el riesgo de una degradación del rendimiento.
Intervalo de evaluación: 60
Periodo pendiente: 180
Periodo de recuperación: 180
- EBSIOBalance%
-
Etiquetas: DBInstanceIdentifier
Descripción de la alarma: alarma que se activa cuando el saldo de operaciones de E/S de EBS cae por debajo del 10 % en una instancia de RDS.
Objetivo: detectar un nivel bajo de créditos de operaciones de entrada/salida por segundo (IOPS) que pueda provocar cuellos de botella.
Criterios de PromQL:
avg({__name__="EBSIOBalance%", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) < 10Valor límite recomendado: 10 (incrustado en la consulta)
Justificación del valor límite: un valor inferior al 10 % conlleva el riesgo de una degradación de las operaciones de entrada/salida por segundo (IOPS).
Intervalo de evaluación: 60
Periodo pendiente: 180
Periodo de recuperación: 180
- FreeableMemory
-
Etiquetas: DBInstanceIdentifier
Descripción de la alarma: alarma que se activa cuando la memoria disponible cae por debajo del valor límite en una instancia de RDS.
Objetivo: evitar que la falta de memoria provoque el rechazo de conexiones.
Criterios de PromQL:
avg({__name__="FreeableMemory", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) <THRESHOLDValor límite recomendado:
THRESHOLD(incrustado en la consulta)Justificación del valor límite: se establece según la memoria de la clase de instancia.
Intervalo de evaluación: 60
Periodo pendiente: 900
Periodo de recuperación: 900
- FreeLocalStorage
-
Etiquetas: DBInstanceIdentifier
Descripción de la alarma: alarma que se activa cuando el almacenamiento local disponible cae por debajo del valor límite en una instancia de Aurora.
Objetivo: evitar que se agote el almacenamiento local de Aurora.
Criterios de PromQL:
avg({__name__="FreeLocalStorage", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) <THRESHOLDValor límite recomendado:
THRESHOLD(incrustado en la consulta)Justificación del valor límite: se establece según el mínimo necesario para las operaciones.
Intervalo de evaluación: 60
Periodo pendiente: 300
Periodo de recuperación: 300
- FreeStorageSpace
-
Etiquetas: DBInstanceIdentifier
Descripción de la alarma: alarma que se activa cuando el espacio de almacenamiento disponible cae por debajo del valor límite en una instancia de RDS.
Objetivo: evitar tiempo de inactividad causado por el agotamiento del almacenamiento.
Criterios de PromQL:
min({__name__="FreeStorageSpace", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) <THRESHOLDValor límite recomendado:
THRESHOLD(incrustado en la consulta)Justificación del valor límite: se establece según la tasa de crecimiento del almacenamiento y el tamaño aprovisionado.
Intervalo de evaluación: 60
Periodo pendiente: 300
Periodo de recuperación: 300
- MaximumUsedTransactionIDs
-
Etiquetas: DBInstanceIdentifier
Descripción de la alarma: alarma que se activa cuando el número máximo de ID de transacción utilizados supera los 1000 millones en una instancia de RDS.
Objetivo: evitar el reinicio cíclico de los ID de transacción de PostgreSQL.
Criterios de PromQL:
avg({__name__="MaximumUsedTransactionIDs", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > 1000000000Valor límite recomendado: 1000000000 (incrustado en la consulta)
Justificación del valor límite: un valor de 1000 millones indica que se aproxima el riesgo de reinicio cíclico.
Intervalo de evaluación: 60
Periodo pendiente: 60
Período de recuperación: 60
- ReadLatency
-
Etiquetas: DBInstanceIdentifier
Descripción de la alarma: alarma que se activa cuando la latencia de lectura p90 supera el valor límite en una instancia de RDS.
Objetivo: detectar una latencia de lectura elevada que indique problemas de disco.
Criterios de PromQL:
histogram_quantile(0.9, {__name__="ReadLatency", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) >THRESHOLDValor límite recomendado:
THRESHOLD(incrustado en la consulta)Justificación del valor límite: se establece según la latencia aceptable para la aplicación.
Intervalo de evaluación: 60
Periodo pendiente: 300
Periodo de recuperación: 300
- ReplicaLag
-
Etiquetas: DBInstanceIdentifier
Descripción de la alarma: alarma que se activa cuando el retraso de replicación supera los 60 segundos en una réplica de lectura de RDS.
Objetivo: detectar retrasos en la replicación que puedan provocar la pérdida de datos.
Criterios de PromQL:
max({__name__="ReplicaLag", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > 60Valor límite recomendado: 60 (incrustado en la consulta)
Justificación del valor límite: un retraso de 60 segundos es significativo para la mayoría de las cargas de trabajo.
Intervalo de evaluación: 60
Periodo pendiente: 600
Periodo de recuperación: 600
- WriteLatency
-
Etiquetas: DBInstanceIdentifier
Descripción de la alarma: alarma que se activa cuando la latencia de escritura p90 supera el valor límite en una instancia de RDS.
Objetivo: detectar una latencia de escritura elevada que indique problemas de disco.
Criterios de PromQL:
histogram_quantile(0.9, {__name__="WriteLatency", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) >THRESHOLDValor límite recomendado:
THRESHOLD(incrustado en la consulta)Justificación del valor límite: se establece según la latencia aceptable para la aplicación.
Intervalo de evaluación: 60
Periodo pendiente: 300
Periodo de recuperación: 300
- DBLoad
-
Etiquetas: DBInstanceIdentifier
Descripción de la alarma: alarma que se activa cuando la carga promedio de la base de datos supera el valor límite en una instancia de RDS.
Objetivo: detectar una carga elevada de la base de datos que degrade el rendimiento.
Criterios de PromQL:
avg({__name__="DBLoad", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) >THRESHOLDValor límite recomendado:
THRESHOLD(incrustado en la consulta)Justificación del valor límite: se establece en un múltiplo del número de vCPU.
Intervalo de evaluación: 60
Periodo pendiente: 900
Periodo de recuperación: 900
- AuroraVolumeBytesLeftTotal
-
Etiquetas: DBClusterIdentifier
Descripción de la alarma: alarma que se activa cuando los bytes de almacenamiento restantes de un clúster de Aurora caen por debajo del valor límite.
Objetivo: evitar que se agote el almacenamiento del clúster de Aurora.
Criterios de PromQL:
avg({__name__="AuroraVolumeBytesLeftTotal", "@instrumentation.@name"="cloudwatch.aws/rds", DBClusterIdentifier="CLUSTER"}) <THRESHOLDValor límite recomendado:
THRESHOLD(incrustado en la consulta)Justificación del valor límite: se establece según la tasa de crecimiento.
Intervalo de evaluación: 60
Periodo pendiente: 300
Periodo de recuperación: 300
- AuroraBinlogReplicaLag
-
Etiquetas: DBClusterIdentifier
Descripción de la alarma: alarma que se activa cuando el retraso de la réplica de binlog de Aurora indica un estado de error.
Objetivo: detectar errores de replicación de la instancia de escritura.
Criterios de PromQL:
avg({__name__="AuroraBinlogReplicaLag", "@instrumentation.@name"="cloudwatch.aws/rds", DBClusterIdentifier="CLUSTER"}) <= -1Valor límite recomendado: 1 (incrustado en la consulta)
Justificación del valor límite: un valor de 1 indica un estado de error.
Intervalo de evaluación: 60
Período pendiente: 120
Periodo de recuperación: 120
- BlockedTransactions
-
Etiquetas: DBInstanceIdentifier
Descripción de la alarma: alarma que se activa cuando el número de transacciones bloqueadas supera el valor límite en una instancia de RDS.
Objetivo: detectar el bloqueo de transacciones que provoque una degradación del rendimiento.
Criterios de PromQL:
avg({__name__="BlockedTransactions", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) >THRESHOLDValor límite recomendado:
THRESHOLD(incrustado en la consulta)Justificación del valor límite: se establece según el número aceptable de transacciones bloqueadas.
Intervalo de evaluación: 60
Periodo pendiente: 300
Periodo de recuperación: 300
- BufferCacheHitRatio
-
Etiquetas: DBInstanceIdentifier
Descripción de la alarma: alarma que se activa cuando la tasa de aciertos de la caché de búfer cae por debajo del 80 % en una instancia de RDS.
Objetivo: detectar una baja eficiencia de la caché que provoque una disminución del rendimiento.
Criterios de PromQL:
avg({__name__="BufferCacheHitRatio", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) < 80Valor límite recomendado: 80 (incrustado en la consulta)
Justificación del valor límite: un valor inferior al 80 % indica un uso excesivo de las operaciones de operaciones de E/S de disco.
Intervalo de evaluación: 60
Periodo pendiente: 600
Periodo de recuperación: 600
- EngineUptime
-
Etiquetas: DBClusterIdentifier
Descripción de la alarma: alarma que se activa cuando el tiempo de actividad del motor cae a cero, lo que indica el reinicio de una instancia de escritura de Aurora.
Objetivo: detectar un tiempo de inactividad o un bloqueo de la instancia de escritura de Aurora.
Criterios de PromQL:
avg({__name__="EngineUptime", "@instrumentation.@name"="cloudwatch.aws/rds", DBClusterIdentifier="CLUSTER"}) <= 0Valor límite recomendado: 0 (incrustado en la consulta)
Justificación del valor límite: un tiempo de actividad de cero indica un reinicio de la instancia.
Intervalo de evaluación: 60
Período pendiente: 120
Periodo de recuperación: 120
- RollbackSegmentHistoryListLength
-
Etiquetas: DBInstanceIdentifier
Descripción de la alarma: alarma que se activa cuando la longitud de la lista de historial de segmentos de reversión supera 1 millón en una instancia de Aurora.
Objetivo: detectar un historial de reversión elevado que provoque una degradación del rendimiento de la CPU.
Criterios de PromQL:
avg({__name__="RollbackSegmentHistoryListLength", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > 1000000Valor límite recomendado: 1000000 (incrustado en la consulta)
Justificación del valor límite: un valor superior a 1 millón provoca problemas de rendimiento.
Intervalo de evaluación: 60
Periodo pendiente: 300
Periodo de recuperación: 300
- StorageNetworkThroughput
-
Etiquetas: DBClusterIdentifier
Descripción de la alarma: alarma que se activa cuando el rendimiento de la red de almacenamiento supera el valor límite en un clúster de Aurora.
Objetivo: detectar un rendimiento elevado que pueda provocar el descarte de paquetes de red.
Criterios de PromQL:
avg({__name__="StorageNetworkThroughput", "@instrumentation.@name"="cloudwatch.aws/rds", DBClusterIdentifier="CLUSTER"}) >THRESHOLDValor límite recomendado:
THRESHOLD(incrustado en la consulta)Justificación del valor límite: se establece según la capacidad de red de la instancia.
Intervalo de evaluación: 60
Periodo pendiente: 300
Periodo de recuperación: 300
Route 53
- HealthCheckStatus
-
Etiquetas: HealthCheckId
Descripción de la alarma: alarma que se activa cuando una comprobación de estado de Route 53 informa de un punto de conexión en mal estado.
Objetivo: detectar puntos de conexión en mal estado mediante las comprobaciones de estado de Route 53.
Criterios de PromQL:
avg({__name__="HealthCheckStatus", "@instrumentation.@name"="cloudwatch.aws/route53", HealthCheckId="HC"}) < 1Valor límite recomendado: 1 (incrustado en la consulta)
Justificación del valor límite: un valor inferior a 1 indica que el punto de conexión no supera las comprobaciones de estado.
Intervalo de evaluación: 60
Periodo pendiente: 180
Periodo de recuperación: 180
S3
- 4xxErrors
-
Etiquetas: BucketName, FilterId
Descripción de la alarma: alarma que se activa cuando la tasa de errores 4xx supera el 5 % en un bucket de S3.
Objetivo: detectar tasas anómalas de errores del cliente.
Criterios de PromQL:
avg({__name__="4xxErrors", "@instrumentation.@name"="cloudwatch.aws/s3", BucketName="BUCKET",FilterId="FILTER"}) > 0.05Valor límite recomendado: 0,05 (incrustado en la consulta)
Justificación del valor límite: un valor superior al 5 % indica problemas de configuración o acceso.
Intervalo de evaluación: 60
Periodo pendiente: 900
Periodo de recuperación: 900
- 5xxErrors
-
Etiquetas: BucketName, FilterId
Descripción de la alarma: alarma que se activa cuando la tasa de errores 5xx supera el 5 % en un bucket de S3.
Objetivo: detectar errores del servidor que afecten a la aplicación.
Criterios de PromQL:
avg({__name__="5xxErrors", "@instrumentation.@name"="cloudwatch.aws/s3", BucketName="BUCKET",FilterId="FILTER"}) > 0.05Valor límite recomendado: 0,05 (incrustado en la consulta)
Justificación del valor límite: un valor superior al 5 % indica problemas con el servicio S3.
Intervalo de evaluación: 60
Periodo pendiente: 900
Periodo de recuperación: 900
- OperationsFailedReplication
-
Etiquetas: SourceBucket, DestinationBucket, RuleId
Descripción de la alarma: alarma que se activa cuando fallan las operaciones de replicación de S3 de un bucket.
Objetivo: detectar errores de replicación que puedan provocar incoherencias en los datos.
Criterios de PromQL:
max({__name__="OperationsFailedReplication", "@instrumentation.@name"="cloudwatch.aws/s3", SourceBucket="SRC",DestinationBucket="DST",RuleId="RULE"}) > 0Valor límite recomendado: 0 (incrustado en la consulta)
Justificación del valor límite: cualquier error de replicación requiere una investigación.
Intervalo de evaluación: 60
Periodo pendiente: 300
Periodo de recuperación: 300
S3 Object Lambda
- 4xxErrors
-
Etiquetas: AccessPointName, DataSourceARN
Descripción de la alarma: alarma que se activa cuando la tasa de errores 4xx supera el 5 % en un punto de acceso de S3 Object Lambda.
Objetivo: detectar tasas anómalas de errores del cliente en Object Lambda.
Criterios de PromQL:
avg({__name__="4xxErrors", "@instrumentation.@name"="cloudwatch.aws/s3objectlambda", AccessPointName="AP",DataSourceARN="ARN"}) > 0.05Valor límite recomendado: 0,05 (incrustado en la consulta)
Justificación del valor límite: un valor superior al 5 % indica problemas de configuración.
Intervalo de evaluación: 60
Periodo pendiente: 900
Periodo de recuperación: 900
- 5xxErrors
-
Etiquetas: AccessPointName, DataSourceARN
Descripción de la alarma: alarma que se activa cuando la tasa de errores 5xx supera el 5 % en un punto de acceso de S3 Object Lambda.
Objetivo: detectar errores del servidor en Object Lambda.
Criterios de PromQL:
avg({__name__="5xxErrors", "@instrumentation.@name"="cloudwatch.aws/s3objectlambda", AccessPointName="AP",DataSourceARN="ARN"}) > 0.05Valor límite recomendado: 0,05 (incrustado en la consulta)
Justificación del valor límite: un valor superior al 5 % indica problemas con Lambda o S3.
Intervalo de evaluación: 60
Periodo pendiente: 900
Periodo de recuperación: 900
- LambdaResponse4xx
-
Etiquetas: AccessPointName, DataSourceARN
Descripción de la alarma: alarma que se activa cuando la tasa de respuestas 4xx de la función de Lambda supera el 5 % en un punto de acceso de S3 Object Lambda.
Objetivo: detectar errores del cliente de la función de Lambda.
Criterios de PromQL:
avg({__name__="LambdaResponse4xx", "@instrumentation.@name"="cloudwatch.aws/s3objectlambda", AccessPointName="AP",DataSourceARN="ARN"}) > 0.05Valor límite recomendado: 0,05 (incrustado en la consulta)
Justificación del valor límite: un valor superior al 5 % indica problemas con la función de Lambda.
Intervalo de evaluación: 60
Periodo pendiente: 900
Periodo de recuperación: 900
SNS
- NumberOfMessagesPublished
-
Etiquetas: TopicName
Descripción de la alarma: alarma que se activa cuando el número de mensajes publicados cae por debajo del valor límite en un tema de SNS.
Objetivo: detectar una disminución significativa del volumen de publicación.
Criterios de PromQL:
sum({__name__="NumberOfMessagesPublished", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) <THRESHOLDValor límite recomendado:
THRESHOLD(incrustado en la consulta)Justificación del valor límite: se establece según el volumen mínimo de tráfico esperado.
Intervalo de evaluación: 60
Periodo pendiente: 300
Periodo de recuperación: 300
- NumberOfNotificationsDelivered
-
Etiquetas: TopicName
Descripción de la alarma: alarma que se activa cuando el número de notificaciones entregadas cae por debajo del valor límite en un tema de SNS.
Objetivo: detectar una disminución del volumen de entrega de notificaciones.
Criterios de PromQL:
sum({__name__="NumberOfNotificationsDelivered", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) <THRESHOLDValor límite recomendado:
THRESHOLD(incrustado en la consulta)Justificación del valor límite: se establece según el número mínimo de entregas esperado.
Intervalo de evaluación: 60
Periodo pendiente: 300
Periodo de recuperación: 300
- NumberOfNotificationsFailed
-
Etiquetas: TopicName
Descripción de la alarma: alarma que se activa cuando el número de errores de entrega de notificaciones supera el valor límite en un tema de SNS.
Objetivo: detectar errores de entrega.
Criterios de PromQL:
sum({__name__="NumberOfNotificationsFailed", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) >THRESHOLDValor límite recomendado:
THRESHOLD(incrustado en la consulta)Justificación del valor límite: se establece según la tasa de errores aceptable.
Intervalo de evaluación: 60
Periodo pendiente: 300
Periodo de recuperación: 300
- NumberOfNotificationsFilteredOut-InvalidAttributes
-
Etiquetas: TopicName
Descripción de la alarma: alarma que se activa cuando se filtran notificaciones debido a atributos de mensaje no válidos.
Objetivo: detectar atributos de mensaje no válidos.
Criterios de PromQL:
sum({__name__="NumberOfNotificationsFilteredOut-InvalidAttributes", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) > 0Valor límite recomendado: 0 (incrustado en la consulta)
Justificación del valor límite: cualquier filtrado debido a atributos no válidos indica una configuración incorrecta.
Intervalo de evaluación: 60
Periodo pendiente: 300
Periodo de recuperación: 300
- NumberOfNotificationsFilteredOut-InvalidMessageBody
-
Etiquetas: TopicName
Descripción de la alarma: alarma que se activa cuando se filtran notificaciones debido a cuerpos de mensaje no válidos.
Objetivo: detectar cuerpos de mensaje no válidos.
Criterios de PromQL:
sum({__name__="NumberOfNotificationsFilteredOut-InvalidMessageBody", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) > 0Valor límite recomendado: 0 (incrustado en la consulta)
Justificación del valor límite: cualquier filtrado debido a atributos no válidos indica una configuración incorrecta.
Intervalo de evaluación: 60
Periodo pendiente: 300
Periodo de recuperación: 300
- NumberOfNotificationsRedrivenToDlq
-
Etiquetas: TopicName
Descripción de la alarma: alarma que se activa cuando se envían notificaciones a la cola de mensajes fallidos de un tema de SNS.
Objetivo: detectar mensajes enviados a la cola de mensajes fallidos (DLQ).
Criterios de PromQL:
sum({__name__="NumberOfNotificationsRedrivenToDlq", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) > 0Valor límite recomendado: 0 (incrustado en la consulta)
Justificación del valor límite: cualquier mensaje enviado a la cola de mensajes fallidos (DLQ) indica problemas de entrega.
Intervalo de evaluación: 60
Periodo pendiente: 300
Periodo de recuperación: 300
- NumberOfNotificationsFailedToRedriveToDlq
-
Etiquetas: TopicName
Descripción de la alarma: alarma que se activa cuando las notificaciones no se pueden enviar a la cola de mensajes fallidos de un tema de SNS.
Objetivo:detectar errores de entrega a la cola de mensajes fallidos (DLQ).
Criterios de PromQL:
sum({__name__="NumberOfNotificationsFailedToRedriveToDlq", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) > 0Valor límite recomendado: 0 (incrustado en la consulta)
Justificación del valor límite: un error de entrega a la cola de mensajes fallidos (DLQ) implica la pérdida del seguimiento de errores.
Intervalo de evaluación: 60
Periodo pendiente: 300
Periodo de recuperación: 300
- SMSMonthToDateSpentUSD
-
Etiquetas: TopicName
Descripción de la alarma: alarma que se activa cuando el gasto en SMS se aproxima a la cuota de la cuenta para un tema de SNS.
Objetivo: detectar cuándo el gasto en SMS se aproxima a la cuota.
Criterios de PromQL:
max({__name__="SMSMonthToDateSpentUSD", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) >THRESHOLDValor límite recomendado:
THRESHOLD(incrustado en la consulta)Justificación del valor límite: se establece según la cuota de gasto en SMS de la cuenta.
Intervalo de evaluación: 60
Periodo pendiente: 300
Periodo de recuperación: 300
- SMSSuccessRate
-
Etiquetas: TopicName
Descripción de la alarma: alarma que se activa cuando la tasa de entregas correctas de SMS cae por debajo del valor límite en un tema de SNS.
Objetivo: detectar una disminución de las entregas de SMS.
Criterios de PromQL:
avg({__name__="SMSSuccessRate", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) <THRESHOLDValor límite recomendado:
THRESHOLD(incrustado en la consulta)Justificación del valor límite: se establece según la tasa de entrega aceptable.
Intervalo de evaluación: 60
Periodo pendiente: 300
Periodo de recuperación: 300
SQS
- ApproximateAgeOfOldestMessage
-
Etiquetas: QueueName
Descripción de la alarma: alarma que se activa cuando la antigüedad del mensaje más antiguo supera el valor límite en una cola de SQS.
Objetivo: detectar mensajes que no se procesan con la rapidez necesaria.
Criterios de PromQL:
max({__name__="ApproximateAgeOfOldestMessage", "@instrumentation.@name"="cloudwatch.aws/sqs", QueueName="QUEUE"}) >THRESHOLDValor límite recomendado:
THRESHOLD(incrustado en la consulta)Justificación del valor límite: se establece según el tiempo de procesamiento de mensajes aceptable.
Intervalo de evaluación: 60
Periodo pendiente: 900
Periodo de recuperación: 900
- ApproximateNumberOfMessagesNotVisible
-
Etiquetas: QueueName
Descripción de la alarma: alarma que se activa cuando el número de mensajes en tránsito supera el valor límite en una cola de SQS.
Objetivo: detectar un número elevado de mensajes en tránsito que indique problemas con los consumidores.
Criterios de PromQL:
avg({__name__="ApproximateNumberOfMessagesNotVisible", "@instrumentation.@name"="cloudwatch.aws/sqs", QueueName="QUEUE"}) >THRESHOLDValor límite recomendado:
THRESHOLD(incrustado en la consulta)Justificación del valor límite: se establece según el volumen de procesamiento previsto.
Intervalo de evaluación: 60
Periodo pendiente: 900
Periodo de recuperación: 900
- ApproximateNumberOfMessagesVisible
-
Etiquetas: QueueName
Descripción de la alarma: alarma que se activa cuando el número de mensajes visibles supera el valor límite de una cola de SQS.
Objetivo: detectar una acumulación de mensajes que indique que los consumidores procesan los mensajes con lentitud.
Criterios de PromQL:
avg({__name__="ApproximateNumberOfMessagesVisible", "@instrumentation.@name"="cloudwatch.aws/sqs", QueueName="QUEUE"}) >THRESHOLDValor límite recomendado:
THRESHOLD(incrustado en la consulta)Justificación del valor límite: se establece según la profundidad prevista de la cola.
Intervalo de evaluación: 60
Periodo pendiente: 900
Periodo de recuperación: 900
- NumberOfMessagesSent
-
Etiquetas: QueueName
Descripción de la alarma: alarma que se activa cuando no se envían mensajes a una cola de SQS.
Objetivo: detectar cuándo los productores dejan de enviar mensajes.
Criterios de PromQL:
sum({__name__="NumberOfMessagesSent", "@instrumentation.@name"="cloudwatch.aws/sqs", QueueName="QUEUE"}) <= 0Valor límite recomendado: 0 (incrustado en la consulta)
Justificación del valor límite: la ausencia de mensajes indica un error del productor.
Intervalo de evaluación: 60
Periodo pendiente: 900
Periodo de recuperación: 900
VPN
- TunnelState (nivel de VPN)
-
Etiquetas: VpnId
Descripción de la alarma: alarma que se activa cuando al menos un túnel de VPN se encuentra en estado inactivo.
Objetivo: detectar si al menos un túnel se encuentra en estado inactivo.
Criterios de PromQL:
min({__name__="TunnelState", "@instrumentation.@name"="cloudwatch.aws/vpn", VpnId="VPN"}) < 1Valor límite recomendado: 1 (incrustado en la consulta)
Justificación del valor límite: un valor inferior a 1 indica que el túnel está inactivo.
Intervalo de evaluación: 300
Periodo pendiente: 900
Periodo de recuperación: 900
- TunnelState (nivel del túnel)
-
Etiquetas: TunnelIpAddress
Descripción de la alarma: alarma que se activa cuando un túnel de VPN específico se encuentra en estado inactivo.
Objetivo: detectar si un túnel específico se encuentra en estado inactivo.
Criterios de PromQL:
min({__name__="TunnelState", "@instrumentation.@name"="cloudwatch.aws/vpn", TunnelIpAddress="IP"}) < 1Valor límite recomendado: 1 (incrustado en la consulta)
Justificación del valor límite: un valor inferior a 1 indica que el túnel está inactivo.
Intervalo de evaluación: 300
Periodo pendiente: 900
Periodo de recuperación: 900