Alarmes PromQL recomendados
Utilize esses alarmes PromQL como equivalentes aos alarmes clássicos recomendados. Eles monitoram as mesmas métricas usando consultas instantâneas do PromQL que são avaliadas em relação às métricas ingeridas através do endpoint OTLP do CloudWatch.
Os alarmes PromQL utilizam EvaluationCriteria com PromQLCriteria. Ao contrário dos alarmes métricos clássicos, o limite é incorporado diretamente na expressão de consulta do PromQL.
-
Período pendente — A duração em segundos que uma série temporal deve ser violada continuamente antes o alarme mude para o estado ALARM.
-
Período de recuperação — A duração em segundos em que todas as séries temporais devem parar de ser violadas antes que o alarme retorne ao estado OK.
-
Intervalo de avaliação — Frequência, em segundos, com a qual o CloudWatch executa a consulta PromQL.
nota
Esses alarmes exigem métricas publicadas através do endpoint OTLP do CloudWatch. Para obter mais informações, consulte Alarmes do PromQL.
Você também pode implantar esses alarmes usando AWS CloudFormation. Utilize as propriedades EvaluationCriteria e PromQLCriteria no recurso AWS::CloudWatch::Alarm.
Tópicos
API Gateway
API REST
- 4XXError
-
Rótulos: ApiName, Stage
Descrição do alarme: alarme quando a taxa média de erro 4XX excede 5% para um estágio da API REST.
Intenção: detectar uma alta taxa de erro do cliente, indicando problemas na solicitação.
Critérios do PromQL:
avg({__name__="4XXError", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiName="your-api-name",Stage="your-stage"}) > 0.05Limite recomendado: 0,05 (incorporado na consulta)
Justificativa do limite: detecta uma taxa de erro do cliente superior a 5%, o que indica falhas significativas na solicitação.
Intervalo de avaliação: 60
Período de pendência: 300
Período de recuperação: 300
- 5XXError
-
Rótulos: ApiName, Stage
Descrição do alarme: alarme quando a taxa média de erro 5XX excede 5% para um estágio da API REST.
Intenção: detectar uma alta taxa de erro do servidor indicando falhas no backend.
Critérios do PromQL:
avg({__name__="5XXError", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiName="your-api-name",Stage="your-stage"}) > 0.05Limite recomendado: 0,05 (incorporado na consulta)
Justificativa do limite: detecta uma taxa de erro do servidor superior a 5%, o que requer investigação imediata.
Intervalo de avaliação: 60
Período de pendência: 180
Período de recuperação: 300
- Latência
-
Rótulos: ApiName, Stage
Descrição do alarme: alarme quando a latência p90 excede 2500 ms para um estágio da API REST.
Intenção: detectar a alta latência de p90 que afeta a experiência do usuário.
Critérios do PromQL:
histogram_quantile(0.9, {__name__="Latency", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiName="your-api-name",Stage="your-stage"}) > 2500Limite recomendado: 2500 (incorporado na consulta)
Justificativa do limite: uma latência de p90 acima de 2500 ms indica tempos de resposta reduzidos para a maioria das solicitações.
Intervalo de avaliação: 60
Período de pendência: 300
Período de recuperação: 300
- Contagem
-
Rótulos: ApiName, Stage
Descrição do alarme: alarme quando a contagem total de solicitações cai abaixo da linha de base esperada para um estágio da API REST.
Intenção: detectar baixo volume de tráfego que possa indicar problemas de roteamento ou disponibilidade.
Critérios do PromQL:
sum({__name__="Count", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiName="your-api-name",Stage="your-stage"}) <THRESHOLDLimite recomendado:
THRESHOLD(incorporado na consulta)Justificativa do limite: definir conforme a linha de base de tráfego esperada para detectar quedas inesperadas.
Intervalo de avaliação: 60
Período de pendência: 600
Período de recuperação: 300
API HTTP
- 4xx
-
Rótulos: ApiId, Stage
Descrição do alarme: alarme quando a taxa média de erro 4xx excede 5% para um estágio de API HTTP.
Intenção: detectar uma alta taxa de erro do cliente nos endpoints da API HTTP.
Critérios do PromQL:
avg({__name__="4xx", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="your-api-id",Stage="your-stage"}) > 0.05Limite recomendado: 0,05 (incorporado na consulta)
Justificativa do limite: detecta uma taxa de erro do cliente superior a 5%.
Intervalo de avaliação: 60
Período de pendência: 300
Período de recuperação: 300
- 5xx
-
Rótulos: ApiId, Stage
Descrição do alarme: alarme quando a taxa média de erro 5xx excede 5% para um estágio de API HTTP.
Intenção: detectar uma alta taxa de erro do servidor nos endpoints da API HTTP.
Critérios do PromQL:
avg({__name__="5xx", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="your-api-id",Stage="your-stage"}) > 0.05Limite recomendado: 0,05 (incorporado na consulta)
Justificativa do limite: detecta uma taxa de erro do servidor superior a 5% que requer investigação.
Intervalo de avaliação: 60
Período de pendência: 180
Período de recuperação: 300
- Latência
-
Rótulos: ApiId, Stage
Descrição do alarme: alarme quando a latência p90 excede 2500 ms para um estágio de API HTTP.
Intenção: detectar alta latência de p90 em endpoints da API HTTP.
Critérios do PromQL:
histogram_quantile(0.9, {__name__="Latency", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="your-api-id",Stage="your-stage"}) > 2500Limite recomendado: 2500 (incorporado na consulta)
Justificativa do limite: uma latência de p90 acima de 2500 ms indica tempos de resposta degradados.
Intervalo de avaliação: 60
Período de pendência: 300
Período de recuperação: 300
- IntegrationLatency
-
Rótulos: ApiId, Stage
Descrição do alarme: alarme quando a latência de integração do p90 excede 2000 ms para um estágio de API HTTP.
Intenção: detectar a alta latência de integração de backend que afeta os tempos de resposta.
Critérios do PromQL:
histogram_quantile(0.9, {__name__="IntegrationLatency", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="your-api-id",Stage="your-stage"}) > 2000Limite recomendado: 2000 (incorporado na consulta)
Justificativa do limite: uma latência de integração p90 acima de 2.000 ms indica lentidão no backend.
Intervalo de avaliação: 60
Período de pendência: 300
Período de recuperação: 300
- Contagem
-
Rótulos: ApiId, Stage
Descrição do alarme: alarme quando a contagem total de solicitações cai abaixo da linha de base esperada para um estágio da API HTTP.
Intenção: detectar baixo volume de tráfego que possa indicar problemas de roteamento ou disponibilidade.
Critérios do PromQL:
sum({__name__="Count", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="your-api-id",Stage="your-stage"}) <THRESHOLDLimite recomendado:
THRESHOLD(incorporado na consulta)Justificativa do limite: definir conforme a linha de base de tráfego esperada para detectar quedas inesperadas.
Intervalo de avaliação: 60
Período de pendência: 600
Período de recuperação: 300
API WebSocket
- ClientError
-
Rótulos: ApiId, Stage
Descrição do alarme: alarme quando a taxa média de erro do cliente excede 5% para um estágio da API de WebSocket.
Intenção: detectar uma alta taxa de erro do cliente nas conexões da API de WebSocket.
Critérios do PromQL:
avg({__name__="ClientError", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="your-api-id",Stage="your-stage"}) > 0.05Limite recomendado: 0,05 (incorporado na consulta)
Justificativa do limite: detecta uma taxa de erro do cliente superior a 5% nas conexões WebSocket.
Intervalo de avaliação: 60
Período de pendência: 300
Período de recuperação: 300
- ExecutionError
-
Rótulos: ApiId, Stage
Descrição do alarme: alarme quando a taxa média de erro de execução excede 5% para um estágio da API de WebSocket.
Intenção: detectar alta taxa de erro de execução do lado do servidor nas APIs de WebSocket.
Critérios do PromQL:
avg({__name__="ExecutionError", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="your-api-id",Stage="your-stage"}) > 0.05Limite recomendado: 0,05 (incorporado na consulta)
Justificativa do limite: detecta taxa de erro de execução superior a 5% que requer investigação.
Intervalo de avaliação: 60
Período de pendência: 180
Período de recuperação: 300
- IntegrationLatency
-
Rótulos: ApiId, Stage
Descrição do alarme: alarme quando a latência de integração do p90 excede 2000 ms para um estágio da API de WebSocket.
Intenção: detectar alta latência de integração de backend nas rotas da API de WebSocket.
Critérios do PromQL:
histogram_quantile(0.9, {__name__="IntegrationLatency", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="your-api-id",Stage="your-stage"}) > 2000Limite recomendado: 2000 (incorporado na consulta)
Justificativa do limite: uma latência de integração p90 acima de 2.000 ms indica lentidão no backend.
Intervalo de avaliação: 60
Período de pendência: 300
Período de recuperação: 300
- MessageCount
-
Rótulos: ApiId, Stage
Descrição do alarme: alarme quando a contagem total de mensagens cai abaixo da linha de base esperada para um estágio da API de WebSocket.
Intenção: detectar um volume baixo de mensagens que possa indicar problemas de conexão ou roteamento.
Critérios do PromQL:
sum({__name__="MessageCount", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="your-api-id",Stage="your-stage"}) <THRESHOLDLimite recomendado:
THRESHOLD(incorporado na consulta)Justificativa do limite: definir com base no volume esperado de mensagens para detectar quedas inesperadas.
Intervalo de avaliação: 60
Período de pendência: 600
Período de recuperação: 300
ajuste de escala automático
- GroupInServiceCapacity
-
Rótulos: AutoScalingGroupName
Descrição do alarme: alarme quando a capacidade média em serviço cai abaixo do mínimo esperado para um grupo do Auto Scaling.
Intenção: detectar a baixa disponibilidade devido a falhas de inicialização ou instâncias encerradas.
Critérios do PromQL:
avg({__name__="GroupInServiceCapacity", "@instrumentation.@name"="cloudwatch.aws/autoscaling", AutoScalingGroupName="your-auto-scaling-group-name"}) <THRESHOLDLimite recomendado:
THRESHOLD(incorporado na consulta)Justificativa do limite: definir com base na capacidade mínima desejada para detectar falhas de inicialização ou instâncias insuficientes.
Intervalo de avaliação: 60
Período de pendência: 600
Período de recuperação: 600
Certificate Manager
- DaysToExpiry
-
Rótulos: CertificateArn
Descrição do alarme: alarme quando os dias mínimos para a expiração do certificado caem para 44 dias ou menos.
Intenção: alerta proativo de expiração do certificado para permitir tempo para a renovação.
Critérios do PromQL:
min({__name__="DaysToExpiry", "@instrumentation.@name"="cloudwatch.aws/certificatemanager", CertificateArn="your-certificate-arn"}) <= 44Limite recomendado: 44 (incorporado na consulta)
Justificativa do limite: fornece prazo suficiente antes da expiração do certificado para concluir o processo de renovação.
Intervalo de avaliação: 86400
Período de pendência: 86400
Período de recuperação: 86400
CloudFront
- 5xxErrorRate
-
Rótulos: DistributionId
Descrição do alarme: alarme quando a taxa média de erros 5xx excede o limite para uma distribuição do CloudFront.
Intenção: detectar a alta taxa de erros de origem ou do CloudFront que afeta a entrega de conteúdo.
Critérios do PromQL:
avg({__name__="5xxErrorRate", "@instrumentation.@name"="cloudwatch.aws/cloudfront", DistributionId="your-distribution-id"}) >THRESHOLDLimite recomendado:
THRESHOLD(incorporado na consulta)Justificativa do limite: definir com base em sua taxa de erro aceitável para entrega de conteúdo.
Intervalo de avaliação: 60
Período de pendência: 300
Período de recuperação: 300
- OriginLatency
-
Rótulos: DistributionId
Descrição do alarme: alarme quando a latência de origem do p90 excede o limite para uma distribuição do CloudFront.
Intenção: detectar a alta latência de resposta de origem que afeta o desempenho da entrega de conteúdo.
Critérios do PromQL:
histogram_quantile(0.9, {__name__="OriginLatency", "@instrumentation.@name"="cloudwatch.aws/cloudfront", DistributionId="your-distribution-id"}) >THRESHOLDLimite recomendado:
THRESHOLD(incorporado na consulta)Justificativa do limite: definir com base no tempo de resposta de origem esperado e na estratégia de armazenamento em cache.
Intervalo de avaliação: 60
Período de pendência: 300
Período de recuperação: 300
- FunctionValidationErrors
-
Rótulos: DistributionId, FunctionName
Descrição do alarme: alarme quando ocorrer algum erro de validação de função do CloudFront.
Intenção: detectar falhas na validação da função do CloudFront que impedem a execução da função.
Critérios do PromQL:
sum({__name__="FunctionValidationErrors", "@instrumentation.@name"="cloudwatch.aws/cloudfront", DistributionId="your-distribution-id",FunctionName="your-function-name"}) > 0Limite recomendado: 0 (incorporado na consulta)
Justificativa do limite: qualquer erro de validação indica um problema de configuração da função que requer atenção.
Intervalo de avaliação: 60
Período de pendência: 120
Período de recuperação: 120
- FunctionExecutionErrors
-
Rótulos: DistributionId, FunctionName
Descrição do alarme: alarme quando ocorrer algum erro de execução de função do CloudFront.
Intenção: detectar falhas de runtime no CloudFront Functions que afetam o processamento da solicitação.
Critérios do PromQL:
sum({__name__="FunctionExecutionErrors", "@instrumentation.@name"="cloudwatch.aws/cloudfront", DistributionId="your-distribution-id",FunctionName="your-function-name"}) > 0Limite recomendado: 0 (incorporado na consulta)
Justificativa do limite: qualquer erro de execução indica um problema de runtime no código da função.
Intervalo de avaliação: 60
Período de pendência: 300
Período de recuperação: 300
- FunctionThrottles
-
Rótulos: DistributionId, FunctionName
Descrição do alarme: alarme quando ocorre algum controle de utilização de função do CloudFront.
Intenção: detectar o controle de utilização de funções do CloudFront que pode degradar o processamento da solicitação.
Critérios do PromQL:
sum({__name__="FunctionThrottles", "@instrumentation.@name"="cloudwatch.aws/cloudfront", DistributionId="your-distribution-id",FunctionName="your-function-name"}) > 0Limite recomendado: 0 (incorporado na consulta)
Justificativa do limite: qualquer controle de utilização indica que a função está atingindo os limites de computação.
Intervalo de avaliação: 60
Período de pendência: 300
Período de recuperação: 300
Cognito
- SignUpThrottles
-
Rótulos: UserPool, UserPoolClient
Descrição do alarme: alarme quando os eventos de controle de utilização de inscrição excedem o limite de um grupo de usuários.
Intenção: detectar o controle de utilização de inscrições que impede o registro de novos usuários.
Critérios do PromQL:
sum({__name__="SignUpThrottles", "@instrumentation.@name"="cloudwatch.aws/cognito", UserPool="your-user-pool",UserPoolClient="your-user-pool-client"}) >THRESHOLDLimite recomendado:
THRESHOLD(incorporado na consulta)Justificativa do limite: definir com base em sua taxa de controle de utilização aceitável para operações de inscrição.
Intervalo de avaliação: 60
Período de pendência: 300
Período de recuperação: 300
- SignInThrottles
-
Rótulos: UserPool, UserPoolClient
Descrição do alarme: alarme quando os eventos de controle de utilização de login excedem o limite de um grupo de usuários.
Intenção: detectar o controle de utilização de login que impede a autenticação do usuário.
Critérios do PromQL:
sum({__name__="SignInThrottles", "@instrumentation.@name"="cloudwatch.aws/cognito", UserPool="your-user-pool",UserPoolClient="your-user-pool-client"}) >THRESHOLDLimite recomendado:
THRESHOLD(incorporado na consulta)Justificativa do limite: definir com base em sua taxa de controle de utilização aceitável para operações de login.
Intervalo de avaliação: 60
Período de pendência: 300
Período de recuperação: 300
- TokenRefreshThrottles
-
Rótulos: UserPool, UserPoolClient
Descrição do alarme: alarme quando os eventos de controle de utilização de atualização de token excedem o limite de um grupo de usuários.
Intenção: detectar o controle de utilização de atualização de tokens que pode causar interrupções na sessão.
Critérios do PromQL:
sum({__name__="TokenRefreshThrottles", "@instrumentation.@name"="cloudwatch.aws/cognito", UserPool="your-user-pool",UserPoolClient="your-user-pool-client"}) >THRESHOLDLimite recomendado:
THRESHOLD(incorporado na consulta)Justificativa do limite: definir com base em sua taxa de controle de utilização aceitável para operações de atualização de token.
Intervalo de avaliação: 60
Período de pendência: 300
Período de recuperação: 300
- FederationThrottles
-
Rótulos: UserPool, UserPoolClient, IdentityProvider
Descrição do alarme: alarme quando os eventos de controle de utilização de federação excedem o limite de um provedor de identidade de grupo de usuários.
Intenção: detectar o controle de utilização da federação que pode impedir o login federado.
Critérios do PromQL:
sum({__name__="FederationThrottles", "@instrumentation.@name"="cloudwatch.aws/cognito", UserPool="your-user-pool",UserPoolClient="your-user-pool-client",IdentityProvider="your-identity-provider"}) >THRESHOLDLimite recomendado:
THRESHOLD(incorporado na consulta)Justificativa do limite: definir com base em sua taxa de controle de utilização aceitável para operações de federação.
Intervalo de avaliação: 60
Período de pendência: 300
Período de recuperação: 300
DynamoDB
- AccountProvisionedReadCapacityUtilization
-
Rótulos: nenhum
Descrição do alarme: alarme quando a utilização da capacidade de leitura provisionada em nível de conta excede 80%.
Intenção: detectar quando a capacidade de leitura provisionada se aproxima dos limites da conta.
Critérios do PromQL:
max({__name__="AccountProvisionedReadCapacityUtilization", "@instrumentation.@name"="cloudwatch.aws/dynamodb"}) > 80Limite recomendado: 80 (incorporado na consulta)
Justificativa do limite: com 80% de utilização, você tem espaço livre limitado antes de atingir os limites da conta.
Intervalo de avaliação: 300
Período de pendência: 600
Período de recuperação: 600
- AccountProvisionedWriteCapacityUtilization
-
Rótulos: nenhum
Descrição do alarme: alarme quando a utilização da capacidade de gravação provisionada em nível de conta excede 80%.
Intenção: detectar quando a capacidade de gravação provisionada se aproxima dos limites da conta.
Critérios do PromQL:
max({__name__="AccountProvisionedWriteCapacityUtilization", "@instrumentation.@name"="cloudwatch.aws/dynamodb"}) > 80Limite recomendado: 80 (incorporado na consulta)
Justificativa do limite: com 80% de utilização, você tem espaço livre limitado antes de atingir os limites da conta.
Intervalo de avaliação: 300
Período de pendência: 600
Período de recuperação: 600
- AgeOfOldestUnreplicatedRecord
-
Rótulos: TableName, DelegatedOperation
Descrição do alarme: alarme quando a idade do registro não replicado mais antigo excede o limite.
Intenção: detectar atrasos na replicação que podem causar dados obsoletos em tabelas globais.
Critérios do PromQL:
max({__name__="AgeOfOldestUnreplicatedRecord", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name",DelegatedOperation="your-operation"}) >THRESHOLDLimite recomendado:
THRESHOLD(incorporado na consulta)Justificativa do limite: definir com base em seus requisitos de atualização de replicação.
Intervalo de avaliação: 300
Período de pendência: 900
Período de recuperação: 900
- FailedToReplicateRecordCount
-
Rótulos: TableName, DelegatedOperation
Descrição do alarme: alarme quando algum registro falha na replicação em uma tabela global.
Intenção: detectar falhas de replicação que causam inconsistência de dados em todas as regiões.
Critérios do PromQL:
sum({__name__="FailedToReplicateRecordCount", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name",DelegatedOperation="your-operation"}) > 0Limite recomendado: 0 (incorporado na consulta)
Justificativa do limite: qualquer falha na replicação indica problemas de consistência de dados que exigem atenção imediata.
Intervalo de avaliação: 60
Período de pendência: 60
Período de recuperação: 60
- ReadThrottleEvents
-
Rótulos: TableName
Descrição do alarme: alarme quando os eventos de controle de utilização de leitura excedem o limite de uma tabela.
Intenção: detectar o controle de utilização de leitura que indica capacidade provisionada insuficiente.
Critérios do PromQL:
sum({__name__="ReadThrottleEvents", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name"}) >THRESHOLDLimite recomendado:
THRESHOLD(incorporado na consulta)Justificativa do limite: definir com base na contagem de controle de utilização aceitável para operações de leitura.
Intervalo de avaliação: 60
Período de pendência: 300
Período de recuperação: 300
- ReadThrottleEvents (GSI)
-
Rótulos: TableName, GlobalSecondaryIndexName
Descrição do alarme: alarme quando os eventos de controle de utilização de leitura excedem o limite de um índice secundário global.
Intenção: detectar o controle de utilização de leitura em um GSI que indique capacidade de indexação insuficiente.
Critérios do PromQL:
sum({__name__="ReadThrottleEvents", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name",GlobalSecondaryIndexName="your-index-name"}) >THRESHOLDLimite recomendado:
THRESHOLD(incorporado na consulta)Justificativa do limite: definir com base na contagem de controle de utilização aceitável para operações de leitura de GSI.
Intervalo de avaliação: 60
Período de pendência: 300
Período de recuperação: 300
- ReplicationLatency
-
Rótulos: TableName, ReceivingRegion
Descrição do alarme: alarme quando a latência média de replicação excede o limite de uma tabela global.
Intenção: detectar a alta latência de replicação que pode causar leituras obsoletas em regiões de réplica.
Critérios do PromQL:
avg({__name__="ReplicationLatency", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name",ReceivingRegion="your-receiving-region"}) >THRESHOLDLimite recomendado:
THRESHOLD(incorporado na consulta)Justificativa do limite: definir com base em seus requisitos de atualização de dados para regiões de réplica.
Intervalo de avaliação: 60
Período de pendência: 900
Período de recuperação: 900
- SuccessfulRequestLatency
-
Rótulos: TableName, Operation
Descrição do alarme: alarme quando a latência média de uma solicitação bem-sucedida excede o limite para uma operação de tabela.
Intenção: detectar a alta latência nas operações do DynamoDB que afetam o desempenho do aplicativo.
Critérios do PromQL:
avg({__name__="SuccessfulRequestLatency", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name",Operation="your-operation"}) >THRESHOLDLimite recomendado:
THRESHOLD(incorporado na consulta)Justificativa do limite: definir com base no seu SLA de latência para a operação específica do DynamoDB.
Intervalo de avaliação: 60
Período de pendência: 600
Período de recuperação: 600
- SystemErrors
-
Rótulos: TableName
Descrição do alarme: alarme quando os erros do sistema excedem o limite de uma tabela.
Intenção: detectar erros do lado do serviço do DynamoDB que afetam a disponibilidade da tabela.
Critérios do PromQL:
sum({__name__="SystemErrors", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name"}) >THRESHOLDLimite recomendado:
THRESHOLD(incorporado na consulta)Justificativa do limite: definir com base na contagem aceitável de erros do sistema para a tabela.
Intervalo de avaliação: 60
Período de pendência: 900
Período de recuperação: 900
- ThrottledPutRecordCount
-
Rótulos: TableName, DelegatedOperation
Descrição do alarme: alarme quando a contagem de registros de put com controle de utilização excede o limite de uma tabela.
Intenção: detectar puts com controle de utilização que podem causar perda de dados nas operações de streaming.
Critérios do PromQL:
max({__name__="ThrottledPutRecordCount", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name",DelegatedOperation="your-operation"}) >THRESHOLDLimite recomendado:
THRESHOLD(incorporado na consulta)Justificativa do limite: definir com base na contagem aceitável de controle de utilização para operações de put de streaming.
Intervalo de avaliação: 60
Período de pendência: 600
Período de recuperação: 600
- UserErrors
-
Rótulos: nenhum
Descrição do alarme: alarme quando os erros do usuário excedem o limite em toda a conta.
Intenção: detectar altas taxas de erros do cliente, como falhas de validação ou verificação condicional.
Critérios do PromQL:
sum({__name__="UserErrors", "@instrumentation.@name"="cloudwatch.aws/dynamodb"}) >THRESHOLDLimite recomendado:
THRESHOLD(incorporado na consulta)Justificativa do limite: definir com base em sua taxa de erro aceitável para falhas de solicitação do lado do cliente.
Intervalo de avaliação: 60
Período de pendência: 600
Período de recuperação: 600
- WriteThrottleEvents
-
Rótulos: TableName
Descrição do alarme: alarme quando eventos de controle de utilização de gravação excedem o limite de uma tabela.
Intenção: detectar o controle de utilização de gravação que indica capacidade provisionada insuficiente.
Critérios do PromQL:
sum({__name__="WriteThrottleEvents", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name"}) >THRESHOLDLimite recomendado:
THRESHOLD(incorporado na consulta)Justificativa do limite: definir com base na contagem de controle de utilização aceitável para operações de gravação.
Intervalo de avaliação: 60
Período de pendência: 300
Período de recuperação: 300
- WriteThrottleEvents (GSI)
-
Rótulos: TableName, GlobalSecondaryIndexName
Descrição do alarme: alarme quando os eventos de controle de utilização de gravação excedem o limite de um índice secundário global.
Intenção: detectar o controle de utilização de gravação em um GSI que indique capacidade de indexação insuficiente.
Critérios do PromQL:
sum({__name__="WriteThrottleEvents", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name",GlobalSecondaryIndexName="your-index-name"}) >THRESHOLDLimite recomendado:
THRESHOLD(incorporado na consulta)Justificativa do limite: definir com base na contagem de controle de utilização aceitável para operações de gravação de GSI.
Intervalo de avaliação: 60
Período de pendência: 300
Período de recuperação: 300
EBS
- VolumeStalledIOCheck
-
Rótulos: VolumeId, InstanceId
Descrição do alarme: alarme quando um volume do EBS relata uma falha na verificação de E/S paralisada.
Intenção: detectar E/S paralisada em volumes do EBS que indique comprometimento do volume.
Critérios do PromQL:
max({__name__="VolumeStalledIOCheck", "@instrumentation.@name"="cloudwatch.aws/ebs", VolumeId="your-volume-id",InstanceId="your-instance-id"}) >= 1Limite recomendado: 1 (incorporado na consulta)
Justificativa do limite: um valor de 1 ou maior indica que o volume tem E/S paralisada, exigindo investigação imediata.
Intervalo de avaliação: 60
Período de pendência: 600
Período de recuperação: 600
Amazon Elastic Compute Cloud
- CPUUtilization
-
Rótulos: InstanceId
Descrição do alarme: alarme quando a utilização média da CPU excede 80% para uma instância do EC2.
Intenção: detectar a alta utilização da CPU.
Critérios do PromQL:
avg({__name__="CPUUtilization", "@instrumentation.@name"="cloudwatch.aws/ec2", InstanceId="your-instance-id"}) > 80Limite recomendado: 80 (incorporado na consulta)
Justificativa do limite: o limite de 80% fornece espaço livre antes da saturação.
Intervalo de avaliação: 300
Período de pendência: 900
Período de recuperação: 900
- StatusCheckFailed
-
Rótulos: InstanceId
Descrição do alarme: alarme quando uma verificação de integridade da instância ou do sistema falha em uma instância do EC2.
Intenção: detectar problemas de integridade da instância ou do sistema.
Critérios do PromQL:
max({__name__="StatusCheckFailed", "@instrumentation.@name"="cloudwatch.aws/ec2", InstanceId="your-instance-id"}) >= 1Limite recomendado: 1 (incorporado na consulta)
Justificativa do limite: qualquer falha na verificação de status requer investigação.
Intervalo de avaliação: 300
Período de pendência: 600
Período de recuperação: 600
- StatusCheckFailed_AttachedEBS
-
Rótulos: InstanceId
Descrição do alarme: alarme quando um volume EBS conectado se torna inacessível para uma instância do EC2.
Intenção: detectar volumes inacessíveis do EBS.
Critérios do PromQL:
max({__name__="StatusCheckFailed_AttachedEBS", "@instrumentation.@name"="cloudwatch.aws/ec2", InstanceId="your-instance-id"}) >= 1Limite recomendado: 1 (incorporado na consulta)
Justificativa do limite: volumes inacessíveis causam falhas de E/S.
Intervalo de avaliação: 60
Período de pendência: 600
Período de recuperação: 600
Amazon ECS
- CPUReservation
-
Rótulos: ClusterName
Descrição do alarme: alarme quando a reserva média de CPU excede 80% para um cluster ECS.
Intenção: detectar que o cluster está se aproximando da capacidade da CPU.
Critérios do PromQL:
avg({__name__="CPUReservation", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="your-cluster-name"}) > 80Limite recomendado: 80 (incorporado na consulta)
Justificativa do limite: 80% de reserva indica espaço limitado para novas tarefas.
Intervalo de avaliação: 60
Período de pendência: 300
Período de recuperação: 300
- CPUUtilization
-
Rótulos: ClusterName, ServiceName
Descrição do alarme: alarme quando a utilização média da CPU excede 80% para um serviço do ECS.
Intenção: esse alarme é usado para detectar a alta utilização da CPU no serviço do ECS.
Critérios do PromQL:
avg({__name__="CPUUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="your-cluster-name",ServiceName="your-service-name"}) > 80Limite recomendado: 80 (incorporado na consulta)
Justificativa do limite: 80% fornece uma margem de segurança antes da saturação.
Intervalo de avaliação: 60
Período de pendência: 300
Período de recuperação: 300
- EBSFilesystemUtilization
-
Rótulos: ClusterName, ServiceName
Descrição do alarme: alarme quando a utilização média do sistema de arquivos EBS excede 80% para um serviço do ECS.
Intenção: detectar a alta utilização do armazenamento do EBS.
Critérios do PromQL:
avg({__name__="EBSFilesystemUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="your-cluster-name",ServiceName="your-service-name"}) > 80Limite recomendado: 80 (incorporado na consulta)
Justificativa do limite: 80% fornece uma margem de segurança antes da saturação.
Intervalo de avaliação: 60
Período de pendência: 300
Período de recuperação: 300
- MemoryReservation
-
Rótulos: ClusterName
Descrição do alarme: alarme quando a reserva média de memória excede 80% para um cluster ECS.
Intenção: detectar que o cluster está se aproximando da capacidade de memória.
Critérios do PromQL:
avg({__name__="MemoryReservation", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="your-cluster-name"}) > 80Limite recomendado: 80 (incorporado na consulta)
Justificativa do limite: 80% de reserva indica espaço limitado para novas tarefas.
Intervalo de avaliação: 60
Período de pendência: 300
Período de recuperação: 300
- MemoryUtilization
-
Rótulos: ClusterName, ServiceName
Descrição do alarme: alarme quando a utilização média da memória excede 80% para um serviço do ECS.
Intenção: detectar alta utilização de memória.
Critérios do PromQL:
avg({__name__="MemoryUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="your-cluster-name",ServiceName="your-service-name"}) > 80Limite recomendado: 80 (incorporado na consulta)
Justificativa do limite: 80% fornece uma margem de segurança antes da saturação.
Intervalo de avaliação: 60
Período de pendência: 300
Período de recuperação: 300
- HTTPCode_Target_5XX_Count
-
Rótulos: ClusterName, ServiceName
Descrição do alarme: alarme quando a contagem de erros HTTP 5XX excede o limite de um serviço do ECS.
Intenção: detectar uma alta contagem de erros do lado do servidor.
Critérios do PromQL:
sum({__name__="HTTPCode_Target_5XX_Count", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="your-cluster-name",ServiceName="your-service-name"}) >THRESHOLDLimite recomendado:
THRESHOLD(incorporado na consulta)Justificativa do limite: definir conforme a linha de base da taxa de erro normal do seu aplicativo.
Intervalo de avaliação: 60
Período de pendência: 300
Período de recuperação: 300
- TargetResponseTime
-
Rótulos: ClusterName, ServiceName
Descrição do alarme: alarme quando o tempo médio de resposta alvo excede o limite de um serviço do ECS.
Intenção: detectar o alto tempo de resposta do alvo.
Critérios do PromQL:
avg({__name__="TargetResponseTime", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="your-cluster-name",ServiceName="your-service-name"}) >THRESHOLDLimite recomendado:
THRESHOLD(incorporado na consulta)Justificativa do limite: definir com base nos requisitos de latência aceitáveis do seu aplicativo.
Intervalo de avaliação: 60
Período de pendência: 300
Período de recuperação: 300
Amazon ECS Container Insights
- EphemeralStorageUtilized
-
Rótulos: ClusterName, ServiceName
Descrição do alarme: alarme quando o uso médio de armazenamento efêmero excede o limite para tarefas do Fargate.
Intenção: detectar o alto uso de armazenamento efêmero para tarefas do Fargate.
Critérios do PromQL:
avg({__name__="EphemeralStorageUtilized", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name",ServiceName="your-service-name"}) >THRESHOLDLimite recomendado:
THRESHOLD(incorporado na consulta)Justificativa do limite: definir com base na alocação de armazenamento efêmero da sua tarefa.
Intervalo de avaliação: 60
Período de pendência: 300
Período de recuperação: 300
- RunningTaskCount
-
Rótulos: ClusterName, ServiceName
Descrição do alarme: alarme quando a contagem de tarefas em execução cai para zero para um serviço do ECS.
Intenção: detectar quando nenhuma tarefa está em execução.
Critérios do PromQL:
avg({__name__="RunningTaskCount", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name",ServiceName="your-service-name"}) <= 0Limite recomendado: 0 (incorporado na consulta)
Justificativa do limite: nenhuma tarefa em execução indica uma interrupção do serviço.
Intervalo de avaliação: 60
Período de pendência: 300
Período de recuperação: 300
- instance_filesystem_utilization
-
Rótulos: InstanceId, ContainerInstanceId,ClusterName
Descrição do alarme: alarme quando a utilização média do sistema de arquivos excede 90% em uma instância de contêiner.
Intenção: detectar a alta utilização do sistema de arquivos.
Critérios do PromQL:
avg({__name__="instance_filesystem_utilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", InstanceId="your-instance-id",ContainerInstanceId="your-container-instance-id",ClusterName="your-cluster-name"}) > 90Limite recomendado: 90 (incorporado na consulta)
Justificativa do limite: 90% da utilização do sistema de arquivos deixa um espaço mínimo para operações.
Intervalo de avaliação: 60
Período de pendência: 300
Período de recuperação: 300
Observabilidade aprimorada do Amazon ECS Container Insights
- TaskCpuUtilization (nível de cluster)
-
Rótulos: ClusterName
Descrição do alarme: alarme quando a utilização média da CPU da tarefa excede 80% no nível do cluster.
Intenção: detectar a alta utilização da CPU.
Critérios do PromQL:
avg({__name__="TaskCpuUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name"}) > 80Limite recomendado: 80 (incorporado na consulta)
Justificativa do limite: 80% fornece uma margem de segurança antes da saturação.
Intervalo de avaliação: 60
Período de pendência: 300
Período de recuperação: 300
- TaskCpuUtilization (nível de serviço)
-
Rótulos: ClusterName, ServiceName
Descrição do alarme: alarme quando a utilização média da CPU da tarefa excede 80% no nível do serviço.
Intenção: detectar a alta utilização da CPU.
Critérios do PromQL:
avg({__name__="TaskCpuUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name",ServiceName="your-service-name"}) > 80Limite recomendado: 80 (incorporado na consulta)
Justificativa do limite: 80% fornece uma margem de segurança antes da saturação.
Intervalo de avaliação: 60
Período de pendência: 300
Período de recuperação: 300
- TaskMemoryUtilization (nível de cluster)
-
Rótulos: ClusterName
Descrição do alarme: alarme quando a utilização média da memória da tarefa excede 80% no nível do cluster.
Intenção: detectar alta utilização de memória.
Critérios do PromQL:
avg({__name__="TaskMemoryUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name"}) > 80Limite recomendado: 80 (incorporado na consulta)
Justificativa do limite: 80% fornece uma margem de segurança antes da saturação.
Intervalo de avaliação: 60
Período de pendência: 300
Período de recuperação: 300
- TaskMemoryUtilization (nível de serviço)
-
Rótulos: ClusterName, ServiceName
Descrição do alarme: alarme quando a utilização média da memória da tarefa excede 80% no nível do serviço.
Intenção: detectar alta utilização de memória.
Critérios do PromQL:
avg({__name__="TaskMemoryUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name",ServiceName="your-service-name"}) > 80Limite recomendado: 80 (incorporado na consulta)
Justificativa do limite: 80% fornece uma margem de segurança antes da saturação.
Intervalo de avaliação: 60
Período de pendência: 300
Período de recuperação: 300
- ContainerCpuUtilization (nível de cluster)
-
Rótulos: ClusterName
Descrição do alarme: alarme quando a utilização média de CPU do contêiner excede 80% no nível do cluster.
Intenção: detectar a alta utilização da CPU.
Critérios do PromQL:
avg({__name__="ContainerCpuUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name"}) > 80Limite recomendado: 80 (incorporado na consulta)
Justificativa do limite: 80% fornece uma margem de segurança antes da saturação.
Intervalo de avaliação: 60
Período de pendência: 300
Período de recuperação: 300
- ContainerCpuUtilization (nível do contêiner)
-
Rótulos: ContainerName, ClusterName, ServiceName
Descrição do alarme: alarme quando a utilização média de CPU do contêiner excede 80% no nível do contêiner.
Intenção: detectar a alta utilização da CPU.
Critérios do PromQL:
avg({__name__="ContainerCpuUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ContainerName="your-container-name",ClusterName="your-cluster-name",ServiceName="your-service-name"}) > 80Limite recomendado: 80 (incorporado na consulta)
Justificativa do limite: 80% fornece uma margem de segurança antes da saturação.
Intervalo de avaliação: 60
Período de pendência: 300
Período de recuperação: 300
- ContainerMemoryUtilization (nível de cluster)
-
Rótulos: ClusterName
Descrição do alarme: alarme quando a utilização média de memória do contêiner excede 80% no nível do cluster.
Intenção: detectar alta utilização de memória.
Critérios do PromQL:
avg({__name__="ContainerMemoryUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name"}) > 80Limite recomendado: 80 (incorporado na consulta)
Justificativa do limite: 80% fornece uma margem de segurança antes da saturação.
Intervalo de avaliação: 60
Período de pendência: 300
Período de recuperação: 300
- ContainerMemoryUtilization (nível de contêiner)
-
Rótulos: ContainerName, ClusterName, ServiceName
Descrição do alarme: alarme quando a utilização média de memória do contêiner excede 80% no nível do contêiner.
Intenção: detectar alta utilização de memória.
Critérios do PromQL:
avg({__name__="ContainerMemoryUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ContainerName="your-container-name",ClusterName="your-cluster-name",ServiceName="your-service-name"}) > 80Limite recomendado: 80 (incorporado na consulta)
Justificativa do limite: 80% fornece uma margem de segurança antes da saturação.
Intervalo de avaliação: 60
Período de pendência: 300
Período de recuperação: 300
- TaskEBSfilesystemUtilization
-
Rótulos: ClusterName, ServiceName
Descrição do alarme: alarme quando a utilização média do sistema de arquivos EBS excede 80% para tarefas.
Intenção: detectar a alta utilização do sistema de arquivos EBS.
Critérios do PromQL:
avg({__name__="TaskEBSfilesystemUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name",ServiceName="your-service-name"}) > 80Limite recomendado: 80 (incorporado na consulta)
Justificativa do limite: 80% fornece uma margem de segurança antes da saturação.
Intervalo de avaliação: 60
Período de pendência: 300
Período de recuperação: 300
- TaskEphemeralStorageUtilization (nível de cluster)
-
Rótulos: ClusterName
Descrição do alarme: alarme quando a utilização média do armazenamento efêmero excede 80% no nível do cluster.
Intenção: detectar a alta utilização do armazenamento efêmero.
Critérios do PromQL:
avg({__name__="TaskEphemeralStorageUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name"}) > 80Limite recomendado: 80 (incorporado na consulta)
Justificativa do limite: 80% fornece uma margem de segurança antes da saturação.
Intervalo de avaliação: 60
Período de pendência: 300
Período de recuperação: 300
- TaskEphemeralStorageUtilization (nível de serviço)
-
Rótulos: ClusterName, ServiceName
Descrição do alarme: alarme quando a utilização média do armazenamento efêmero excede 80% no nível do serviço.
Intenção: detectar a alta utilização do armazenamento efêmero.
Critérios do PromQL:
avg({__name__="TaskEphemeralStorageUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name",ServiceName="your-service-name"}) > 80Limite recomendado: 80 (incorporado na consulta)
Justificativa do limite: 80% fornece uma margem de segurança antes da saturação.
Intervalo de avaliação: 60
Período de pendência: 300
Período de recuperação: 300
Amazon EFS
- PercentIOLimit
-
Rótulos: FileSystemId
Descrição do alarme: alarme quando um sistema de arquivos EFS atinge 100% de seu limite de E/S.
Intenção: detectar quando o sistema de arquivos atinge o limite de E/S.
Critérios do PromQL:
avg({__name__="PercentIOLimit", "@instrumentation.@name"="cloudwatch.aws/efs", FileSystemId="your-filesystem-id"}) >= 100Limite recomendado: 100 (incorporado na consulta)
Justificativa do limite: em 100%, o sistema de arquivos se torna um gargalo.
Intervalo de avaliação: 60
Período de pendência: 900
Período de recuperação: 900
- BurstCreditBalance
-
Rótulos: FileSystemId
Descrição do alarme: alarme quando o saldo de crédito de expansão cai para zero em um sistema de arquivos EFS.
Intenção: detectar créditos de expansão esgotados que causam lentidão no throughput.
Critérios do PromQL:
avg({__name__="BurstCreditBalance", "@instrumentation.@name"="cloudwatch.aws/efs", FileSystemId="your-filesystem-id"}) <= 0Limite recomendado: 0 (incorporado na consulta)
Justificativa do limite: um saldo zerado de créditos causa redução no throughput.
Intervalo de avaliação: 60
Período de pendência: 900
Período de recuperação: 900
Amazon EKS Container Insights
- node_cpu_utilization
-
Rótulos: ClusterName
Descrição do alarme: alarme quando a utilização máxima da CPU excede 80% nos nós de processamento do EKS.
Intenção: detectar alta utilização de CPU nos nós de processamento.
Critérios do PromQL:
max({__name__="node_cpu_utilization", "@instrumentation.@name"="cloudwatch.aws/eks-containerinsights", ClusterName="your-cluster-name"}) > 80Limite recomendado: 80 (incorporado na consulta)
Justificativa do limite: 80% fornece uma margem de segurança antes da saturação.
Intervalo de avaliação: 60
Período de pendência: 300
Período de recuperação: 300
- node_filesystem_utilization
-
Rótulos: ClusterName
Descrição do alarme: alarme quando a utilização máxima do sistema de arquivos excede o limite nos nós de processamento do EKS.
Intenção: detectar o alto uso do sistema de arquivos nos nós de processamento.
Critérios do PromQL:
max({__name__="node_filesystem_utilization", "@instrumentation.@name"="cloudwatch.aws/eks-containerinsights", ClusterName="your-cluster-name"}) >THRESHOLDLimite recomendado:
THRESHOLD(incorporado na consulta)Justificativa do limite: definir com base na capacidade de armazenamento e nos padrões de uso do seu nó.
Intervalo de avaliação: 60
Período de pendência: 300
Período de recuperação: 300
- node_memory_utilization
-
Rótulos: ClusterName
Descrição do alarme: alarme quando a utilização máxima da memória excede 80% nos nós de processamento do EKS.
Intenção: detectar alta utilização de memória nos nós de processamento.
Critérios do PromQL:
max({__name__="node_memory_utilization", "@instrumentation.@name"="cloudwatch.aws/eks-containerinsights", ClusterName="your-cluster-name"}) > 80Limite recomendado: 80 (incorporado na consulta)
Justificativa do limite: 80% fornece uma margem de segurança antes da saturação.
Intervalo de avaliação: 60
Período de pendência: 300
Período de recuperação: 300
- pod_cpu_utilization_over_pod_limit
-
Rótulos: ClusterName, Namespace, Service
Descrição do alarme: alarme quando a utilização da CPU do pod excede 80% de seu limite.
Intenção: detectar pods que se aproximam dos limites da CPU.
Critérios do PromQL:
max({__name__="pod_cpu_utilization_over_pod_limit", "@instrumentation.@name"="cloudwatch.aws/eks-containerinsights", ClusterName="your-cluster-name",Namespace="your-namespace",Service="your-service"}) > 80Limite recomendado: 80 (incorporado na consulta)
Justificativa do limite: 80% fornece uma margem de segurança antes que o controle de utilização ocorra.
Intervalo de avaliação: 60
Período de pendência: 300
Período de recuperação: 300
- pod_memory_utilization_over_pod_limit
-
Rótulos: ClusterName, Namespace, Service
Descrição do alarme: alarme quando a utilização da memória do pod excede 80% de seu limite.
Intenção: detectar pods que se aproximam dos limites da memória.
Critérios do PromQL:
max({__name__="pod_memory_utilization_over_pod_limit", "@instrumentation.@name"="cloudwatch.aws/eks-containerinsights", ClusterName="your-cluster-name",Namespace="your-namespace",Service="your-service"}) > 80Limite recomendado: 80 (incorporado na consulta)
Justificativa do limite: 80% fornece uma margem de segurança antes que o OOMKill ocorra.
Intervalo de avaliação: 60
Período de pendência: 300
Período de recuperação: 300
Amazon ElastiCache
- CPUUtilization
-
Rótulos: CacheClusterId, CacheNodeId
Descrição do alarme: alarme quando a utilização média da CPU excede o limite de um nó do ElastiCache.
Intenção: detectar alta utilização de CPU em toda a instância.
Critérios do PromQL:
avg({__name__="CPUUtilization", "@instrumentation.@name"="cloudwatch.aws/elasticache", CacheClusterId="your-cache-cluster-id",CacheNodeId="your-cache-node-id"}) >THRESHOLDLimite recomendado:
THRESHOLD(incorporado na consulta)Justificativa do limite: definir com base no tipo de nó e nas características da workload.
Intervalo de avaliação: 60
Período de pendência: 300
Período de recuperação: 300
- CurrConnections
-
Rótulos: CacheClusterId, CacheNodeId
Descrição do alarme: alarme quando a contagem de conexões excede o limite de um nó do ElastiCache.
Intenção: detectar altas contagens de conexões.
Critérios do PromQL:
avg({__name__="CurrConnections", "@instrumentation.@name"="cloudwatch.aws/elasticache", CacheClusterId="your-cache-cluster-id",CacheNodeId="your-cache-node-id"}) >THRESHOLDLimite recomendado:
THRESHOLD(incorporado na consulta)Justificativa do limite: configure com base no tamanho esperado do pool de conexões e nas necessidades do aplicativo.
Intervalo de avaliação: 60
Período de pendência: 600
Período de recuperação: 600
- DatabaseMemoryUsagePercentage
-
Rótulos: CacheClusterId
Descrição do alarme: alarme quando o uso da memória do banco de dados excede o limite de um cluster do ElastiCache.
Intenção: detectar alto uso de memória para evitar falhas de gravação.
Critérios do PromQL:
avg({__name__="DatabaseMemoryUsagePercentage", "@instrumentation.@name"="cloudwatch.aws/elasticache", CacheClusterId="your-cache-cluster-id"}) >THRESHOLDLimite recomendado:
THRESHOLD(incorporado na consulta)Justificativa do limite: definir com base na sua política de remoção e na criticidade dos dados.
Intervalo de avaliação: 60
Período de pendência: 300
Período de recuperação: 300
- EngineCPUUtilization
-
Rótulos: CacheClusterId
Descrição do alarme: alarme quando a utilização da CPU do mecanismo Redis excede 90% para um cluster do ElastiCache.
Intenção: detectar a alta utilização da CPU do mecanismo Redis.
Critérios do PromQL:
avg({__name__="EngineCPUUtilization", "@instrumentation.@name"="cloudwatch.aws/elasticache", CacheClusterId="your-cache-cluster-id"}) > 90Limite recomendado: 90 (incorporado na consulta)
Justificativa do limite: o Redis é de thread único; mais de 90% indica saturação.
Intervalo de avaliação: 60
Período de pendência: 300
Período de recuperação: 300
- ReplicationLag
-
Rótulos: CacheClusterId
Descrição do alarme: alarme quando o atraso na replicação excede o limite de um cluster do ElastiCache.
Intenção: detectar o atraso na replicação que afeta a consistência de dados.
Critérios do PromQL:
avg({__name__="ReplicationLag", "@instrumentation.@name"="cloudwatch.aws/elasticache", CacheClusterId="your-cache-cluster-id"}) >THRESHOLDLimite recomendado:
THRESHOLD(incorporado na consulta)Justificativa do limite: definir com base na tolerância do seu aplicativo para leituras obsoletas.
Intervalo de avaliação: 60
Período de pendência: 900
Período de recuperação: 900
GPUs elásticas
- GPUConnectivityCheckFailed
-
Rótulos: InstanceId, EGPUId
Descrição do alarme: alarme quando o acelerador Elastic Graphics perde a conectividade com a instância.
Intenção: detectar problemas de conectividade com o acelerador Elastic Graphics.
Critérios do PromQL:
max({__name__="GPUConnectivityCheckFailed", "@instrumentation.@name"="cloudwatch.aws/elasticgpus", InstanceId="your-instance-id",EGPUId="your-egpu-id"}) > 0Limite recomendado: 0 (incorporado na consulta)
Justificativa do limite: qualquer falha de conectividade requer investigação.
Intervalo de avaliação: 300
Período de pendência: 900
Período de recuperação: 900
- GPUHealthCheckFailed
-
Rótulos: InstanceId, EGPUId
Descrição do alarme: alarme quando uma verificação de integridade do acelerador Elastic Graphics falha.
Intenção: detectar que o acelerador Elastic Graphics não está íntegro.
Critérios do PromQL:
max({__name__="GPUHealthCheckFailed", "@instrumentation.@name"="cloudwatch.aws/elasticgpus", InstanceId="your-instance-id",EGPUId="your-egpu-id"}) > 0Limite recomendado: 0 (incorporado na consulta)
Justificativa do limite: falhas na verificação de integridade indicam problemas no acelerador.
Intervalo de avaliação: 300
Período de pendência: 900
Período de recuperação: 900
Agendador do Amazon EventBridge
- TargetErrorThrottledCount
-
Descrição do alarme: alarme quando as invocações de destino programadas passam por controle de utilização.
Intenção: detectar o controle de utilização de destino que causa atrasos no cronograma.
Critérios do PromQL:
sum({__name__="TargetErrorThrottledCount", "@instrumentation.@name"="cloudwatch.aws/scheduler"}) > 0Limite recomendado: 0 (incorporado na consulta)
Justificativa do limite: qualquer controle de utilização indica problemas de capacidade do destino.
Intervalo de avaliação: 60
Período de pendência: 900
Período de recuperação: 900
- InvocationThrottleCount
-
Descrição do alarme: alarme quando as invocações do Agendador passam por controle de utilização.
Intenção: detectar o controle de utilização de invocação do Agendador.
Critérios do PromQL:
sum({__name__="InvocationThrottleCount", "@instrumentation.@name"="cloudwatch.aws/scheduler"}) > 0Limite recomendado: 0 (incorporado na consulta)
Justificativa do limite: o controle de utilização atrasa as execuções programadas.
Intervalo de avaliação: 60
Período de pendência: 900
Período de recuperação: 900
- InvocationDroppedCount
-
Descrição do alarme: alarme quando as invocações programadas são descartadas.
Intenção: detectar invocações descartadas.
Critérios do PromQL:
sum({__name__="InvocationDroppedCount", "@instrumentation.@name"="cloudwatch.aws/scheduler"}) > 0Limite recomendado: 0 (incorporado na consulta)
Justificativa do limite: invocações descartadas representam eventos programados perdidos.
Intervalo de avaliação: 60
Período de pendência: 60
Período de recuperação: 60
- InvocationsFailedToBeSentToDeadLetterCount
-
Descrição do alarme: alarme quando invocações com falha não podem ser enviadas para a fila de mensagens não entregues.
Intenção: detectar falhas na entrega do DLQ.
Critérios do PromQL:
sum({__name__="InvocationsFailedToBeSentToDeadLetterCount", "@instrumentation.@name"="cloudwatch.aws/scheduler"}) > 0Limite recomendado: 0 (incorporado na consulta)
Justificativa do limite: falha na entrega do DLQ significa perda de informações de erro.
Intervalo de avaliação: 60
Período de pendência: 900
Período de recuperação: 900
Amazon Kinesis Data Streams
- GetRecords.IteratorAgeMilliseconds
-
Rótulos: StreamName
Descrição do alarme: alarme quando a idade do iterador do consumidor excede o limite para um stream do Kinesis.
Intenção: detectar dados atrasados no período de retenção, correndo o risco de perda de dados.
Critérios do PromQL:
max({__name__="GetRecords.IteratorAgeMilliseconds", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="your-stream-name"}) >THRESHOLDLimite recomendado:
THRESHOLD(incorporado na consulta)Justificativa do limite: definir com base na porcentagem do período de retenção do stream.
Intervalo de avaliação: 60
Período de pendência: 900
Período de recuperação: 900
- GetRecords.Success
-
Rótulos: StreamName
Descrição do alarme: alarme quando a taxa de sucesso do GetRecords cai abaixo do limite de um stream do Kinesis.
Intenção: detectar falhas na recuperação do consumidor.
Critérios do PromQL:
avg({__name__="GetRecords.Success", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="your-stream-name"}) <THRESHOLDLimite recomendado:
THRESHOLD(incorporado na consulta)Justificativa do limite: definir com base na taxa de sucesso esperada.
Intervalo de avaliação: 60
Período de pendência: 300
Período de recuperação: 300
- PutRecord.Success
-
Rótulos: StreamName
Descrição do alarme: alarme quando a taxa de sucesso do PutRecord cai abaixo do limite de um stream do Kinesis.
Intenção: detectar falhas na ingestão do produtor.
Critérios do PromQL:
avg({__name__="PutRecord.Success", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="your-stream-name"}) <THRESHOLDLimite recomendado:
THRESHOLD(incorporado na consulta)Justificativa do limite: definir com base na taxa de sucesso esperada.
Intervalo de avaliação: 60
Período de pendência: 300
Período de recuperação: 300
- PutRecords.FailedRecords
-
Rótulos: StreamName
Descrição do alarme: alarme quando as operações de put em lote produzem registros com falha para um stream do Kinesis.
Intenção: detectar falhas no put em lote.
Critérios do PromQL:
sum({__name__="PutRecords.FailedRecords", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="your-stream-name"}) >THRESHOLDLimite recomendado:
THRESHOLD(incorporado na consulta)Justificativa do limite: definir com base na contagem de falhas aceitável.
Intervalo de avaliação: 60
Período de pendência: 300
Período de recuperação: 300
- ReadProvisionedThroughputExceeded
-
Rótulos: StreamName
Descrição do alarme: alarme quando as leituras do consumidor excedem o throughput provisionado para um stream do Kinesis.
Intenção: detectar o controle de utilização de leitura do consumidor.
Critérios do PromQL:
avg({__name__="ReadProvisionedThroughputExceeded", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="your-stream-name"}) >THRESHOLDLimite recomendado:
THRESHOLD(incorporado na consulta)Justificativa do limite: qualquer controle de utilização sustentado indica necessidades de capacidade.
Intervalo de avaliação: 60
Período de pendência: 300
Período de recuperação: 300
- SubscribeToShardEvent.MillisBehindLatest
-
Rótulos: StreamName, ConsumerName
Descrição do alarme: alarme quando um consumidor de fan-out aprimorado fica atrás do último registro.
Intenção: detectar o atraso no processamento do consumidor de fan-out aprimorado.
Critérios do PromQL:
avg({__name__="SubscribeToShardEvent.MillisBehindLatest", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="your-stream-name",ConsumerName="your-consumer-name"}) >THRESHOLDLimite recomendado:
THRESHOLD(incorporado na consulta)Justificativa do limite: definir com base no atraso de processamento aceitável.
Intervalo de avaliação: 60
Período de pendência: 300
Período de recuperação: 300
- WriteProvisionedThroughputExceeded
-
Rótulos: StreamName
Descrição do alarme: alarme quando as gravações do produtor excedem o throughput provisionado para um stream do Kinesis.
Intenção: detectar o controle de utilização de gravação do produtor.
Critérios do PromQL:
avg({__name__="WriteProvisionedThroughputExceeded", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="your-stream-name"}) >THRESHOLDLimite recomendado:
THRESHOLD(incorporado na consulta)Justificativa do limite: o controle de utilização sustentado indica necessidades de capacidade.
Intervalo de avaliação: 60
Período de pendência: 300
Período de recuperação: 300
AWS Lambda
- ClaimedAccountConcurrency
-
Descrição do alarme: alarme quando a simultaneidade da conta reivindicada excede o limite.
Intenção: detectar uma conta que está se aproximando da cota de simultaneidade.
Critérios do PromQL:
max({__name__="ClaimedAccountConcurrency", "@instrumentation.@name"="cloudwatch.aws/lambda"}) >THRESHOLDLimite recomendado:
THRESHOLD(incorporado na consulta)Justificativa do limite: definir a porcentagem do limite regional de simultaneidade.
Intervalo de avaliação: 60
Período de pendência: 600
Período de recuperação: 600
- Erros
-
Rótulos: FunctionName
Descrição do alarme: alarme quando a contagem de erros da função excede o limite de uma função do Lambda.
Intenção: detectar uma alta contagem de erros de função.
Critérios do PromQL:
sum({__name__="Errors", "@instrumentation.@name"="cloudwatch.aws/lambda", FunctionName="your-function-name"}) >THRESHOLDLimite recomendado:
THRESHOLD(incorporado na consulta)Justificativa do limite: definir com base no volume de erros aceitável.
Intervalo de avaliação: 60
Período de pendência: 180
Período de recuperação: 300
- Controles de utilização
-
Rótulos: FunctionName
Descrição do alarme: alarme quando as invocações de função passam por um controle de utilização para uma função do Lambda.
Intenção: detectar o controle de utilização da invocação de função.
Critérios do PromQL:
sum({__name__="Throttles", "@instrumentation.@name"="cloudwatch.aws/lambda", FunctionName="your-function-name"}) >THRESHOLDLimite recomendado:
THRESHOLD(incorporado na consulta)Justificativa do limite: o controle de utilização indica que o limite de simultaneidade foi atingido.
Intervalo de avaliação: 60
Período de pendência: 300
Período de recuperação: 300
- Duração
-
Rótulos: FunctionName
Descrição do alarme: alarme quando a duração da função p90 excede o limite para uma função do Lambda.
Intenção: detectar invocações de funções de longa duração.
Critérios do PromQL:
histogram_quantile(0.9, {__name__="Duration", "@instrumentation.@name"="cloudwatch.aws/lambda", FunctionName="your-function-name"}) >THRESHOLDLimite recomendado:
THRESHOLD(incorporado na consulta)Justificativa do limite: definir em relação ao tempo limite da função.
Intervalo de avaliação: 60
Período de pendência: 900
Período de recuperação: 900
- ConcurrentExecutions
-
Rótulos: FunctionName
Descrição do alarme: alarme quando as execuções simultâneas excedem o limite de uma função do Lambda.
Intenção: detectar uma função que se aproxima dos limites de simultaneidade.
Critérios do PromQL:
max({__name__="ConcurrentExecutions", "@instrumentation.@name"="cloudwatch.aws/lambda", FunctionName="your-function-name"}) >THRESHOLDLimite recomendado:
THRESHOLD(incorporado na consulta)Justificativa do limite: definir a porcentagem da simultaneidade reservada.
Intervalo de avaliação: 60
Período de pendência: 600
Período de recuperação: 600
AWS LambdaInsights do
- memory_utilization
-
Rótulos: function_name
Descrição do alarme: alarme quando a utilização média da memória excede 90% para uma função do Lambda.
Intenção: detectar uma função que se aproxima do limite de memória configurado.
Critérios do PromQL:
avg({__name__="memory_utilization", "@instrumentation.@name"="cloudwatch.aws/lambda-insights", function_name="your-function-name"}) > 90Limite recomendado: 90 (incorporado na consulta)
Justificativa do limite: acima de 90% corre o risco de falhas de falta de memória.
Intervalo de avaliação: 60
Período de pendência: 600
Período de recuperação: 600
NAT Gateway
- ErrorPortAllocation
-
Rótulos: NatGatewayId
Descrição do alarme: alarme quando o gateway NAT não consegue alocar uma porta para novas conexões.
Intenção: detectar falhas na alocação de portas que impedem novas conexões.
Critérios do PromQL:
sum({__name__="ErrorPortAllocation", "@instrumentation.@name"="cloudwatch.aws/natgateway", NatGatewayId="your-nat-gateway-id"}) > 0Limite recomendado: 0 (incorporado na consulta)
Justificativa do limite: qualquer falha de alocação afeta a conectividade.
Intervalo de avaliação: 60
Período de pendência: 900
Período de recuperação: 900
- PacketsDropCount
-
Rótulos: NatGatewayId
Descrição do alarme: alarme quando o gateway NAT descarta pacotes que excedem o limite.
Intenção: detectar descarte de pacotes que indicam problemas de capacidade ou conectividade.
Critérios do PromQL:
sum({__name__="PacketsDropCount", "@instrumentation.@name"="cloudwatch.aws/natgateway", NatGatewayId="your-nat-gateway-id"}) >THRESHOLDLimite recomendado:
THRESHOLD(incorporado na consulta)Justificativa do limite: definir com base na taxa de descarte aceitável.
Intervalo de avaliação: 60
Período de pendência: 300
Período de recuperação: 300
Endpoints do PrivateLink da AWS
- PacketsDropped
-
Rótulos: VpcId, VpcEndpointId, EndpointType, SubnetId, ServiceName
Descrição do alarme: alarme quando um endpoint da VPC descarta pacotes que excedem o limite.
Intenção: detectar endpoint ou serviço de endpoint não íntegro.
Critérios do PromQL:
sum({__name__="PacketsDropped", "@instrumentation.@name"="cloudwatch.aws/privatelinkendpoints", VpcId="your-vpc-id",VpcEndpointId="your-vpc-endpoint-id",EndpointType="your-endpoint-type",SubnetId="your-subnet-id",ServiceName="your-service-name"}) >THRESHOLDLimite recomendado:
THRESHOLD(incorporado na consulta)Justificativa do limite: definir com base na taxa de descarte aceitável.
Intervalo de avaliação: 60
Período de pendência: 300
Período de recuperação: 300
Serviços do PrivateLink da AWS
- RstPacketsSent
-
Rótulos: ServiceId, LoadBalancerArn, Az
Descrição do alarme: alarme quando a taxa do pacote RST excede o limite de um serviço de endpoint.
Intenção: detectar destinos não íntegros de um serviço de endpoint.
Critérios do PromQL:
sum({__name__="RstPacketsSent", "@instrumentation.@name"="cloudwatch.aws/privatelinkservices", ServiceId="SVC",LoadBalancerArn="LB",Az="AZ"}) >THRESHOLDLimite recomendado:
THRESHOLD(incorporado na consulta)Justificativa do limite: definir com base na taxa de pacotes RST aceitável.
Intervalo de avaliação: 60
Período de pendência: 300
Período de recuperação: 300
RDS
- CPUUtilization
-
Rótulos: DBInstanceIdentifier
Descrição do alarme: alarme quando a utilização média da CPU excede 90% para uma instância do RDS.
Intenção: detectar alto uso da CPU evitando a degradação do desempenho.
Critérios do PromQL:
avg({__name__="CPUUtilization", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > 90Limite recomendado: 90 (incorporado na consulta)
Justificativa do limite: 90% indica quase saturação.
Intervalo de avaliação: 60
Período de pendência: 300
Período de recuperação: 300
- DatabaseConnections
-
Rótulos: DBInstanceIdentifier
Descrição do alarme: alarme quando as conexões do banco de dados excedem o limite de uma instância do RDS.
Intenção: evitar conexões rejeitadas no limite máximo.
Critérios do PromQL:
avg({__name__="DatabaseConnections", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) >THRESHOLDLimite recomendado:
THRESHOLD(incorporado na consulta)Justificativa do limite: definir como porcentagem do parâmetro max_connections.
Intervalo de avaliação: 60
Período de pendência: 300
Período de recuperação: 300
- EBSByteBalance%
-
Rótulos: DBInstanceIdentifier
Descrição do alarme: alarme quando o saldo de bytes do EBS cai abaixo de 10% em uma instância do RDS.
Intenção: detectar créditos baixos de throughput que causam gargalos.
Critérios do PromQL:
avg({__name__="EBSByteBalance%", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) < 10Limite recomendado: 10 (incorporado na consulta)
Justificativa do limite: abaixo de 10% corre o risco de degradação do throughput.
Intervalo de avaliação: 60
Período de pendência: 180
Período de recuperação: 180
- EBSIOBalance%
-
Rótulos: DBInstanceIdentifier
Descrição do alarme: alarme quando o saldo de E/S do EBS cai abaixo de 10% para uma instância do RDS.
Intenção: detectar créditos baixos de IOPS que causam gargalos.
Critérios do PromQL:
avg({__name__="EBSIOBalance%", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) < 10Limite recomendado: 10 (incorporado na consulta)
Justificativa do limite: abaixo de 10% corre o risco de degradação do IOPS.
Intervalo de avaliação: 60
Período de pendência: 180
Período de recuperação: 180
- FreeableMemory
-
Rótulos: DBInstanceIdentifier
Descrição do alarme: alarme quando a memória liberável cai abaixo do limite de uma instância do RDS.
Intenção: evitar que a falta de memória cause conexões rejeitadas.
Critérios do PromQL:
avg({__name__="FreeableMemory", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) <THRESHOLDLimite recomendado:
THRESHOLD(incorporado na consulta)Justificativa do limite: definir com base na memória da classe de instância.
Intervalo de avaliação: 60
Período de pendência: 900
Período de recuperação: 900
- FreeLocalStorage
-
Rótulos: DBInstanceIdentifier
Descrição do alarme: alarme quando o armazenamento local livre cai abaixo do limite para uma instância do Aurora.
Intenção: evitar o esgotamento do armazenamento local do Aurora.
Critérios do PromQL:
avg({__name__="FreeLocalStorage", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) <THRESHOLDLimite recomendado:
THRESHOLD(incorporado na consulta)Justificativa do limite: definir com base no mínimo necessário para as operações.
Intervalo de avaliação: 60
Período de pendência: 300
Período de recuperação: 300
- FreeStorageSpace
-
Rótulos: DBInstanceIdentifier
Descrição do alarme: alarme quando o espaço livre de armazenamento cai abaixo do limite de uma instância do RDS.
Intenção: evitar o tempo de inatividade total do armazenamento.
Critérios do PromQL:
min({__name__="FreeStorageSpace", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) <THRESHOLDLimite recomendado:
THRESHOLD(incorporado na consulta)Justificativa do limite: definir com base na taxa de crescimento do armazenamento e no tamanho provisionado.
Intervalo de avaliação: 60
Período de pendência: 300
Período de recuperação: 300
- MaximumUsedTransactionIDs
-
Rótulos: DBInstanceIdentifier
Descrição do alarme: alarme quando o máximo de IDs de transação usados excede 1 bilhão para uma instância do RDS.
Intenção: evitar o encapsulamento do ID de transação do PostgreSQL.
Critérios do PromQL:
avg({__name__="MaximumUsedTransactionIDs", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > 1000000000Limite recomendado: 1000000000 (incorporado na consulta)
Justificativa do limite: 1 bilhão indica a aproximação de um perigo de encapsulamento.
Intervalo de avaliação: 60
Período de pendência: 60
Período de recuperação: 60
- ReadLatency
-
Rótulos: DBInstanceIdentifier
Descrição do alarme: alarme quando a latência de leitura p90 excede o limite de uma instância do RDS.
Intenção: detectar alta latência de leitura indicando problemas no disco.
Critérios do PromQL:
histogram_quantile(0.9, {__name__="ReadLatency", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) >THRESHOLDLimite recomendado:
THRESHOLD(incorporado na consulta)Justificativa do limite: definir com base na latência aceitável do aplicativo.
Intervalo de avaliação: 60
Período de pendência: 300
Período de recuperação: 300
- ReplicaLag
-
Rótulos: DBInstanceIdentifier
Descrição do alarme: alarme quando o atraso de replicação excede 60 segundos para uma réplica de leitura do RDS.
Intenção: detectar atrasos na replicação que representam risco de perda de dados.
Critérios do PromQL:
max({__name__="ReplicaLag", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > 60Limite recomendado: 60 (incorporado na consulta)
Justificativa do limite: 60 segundos representam um atraso significativo para a maioria das workloads.
Intervalo de avaliação: 60
Período de pendência: 600
Período de recuperação: 600
- WriteLatency
-
Rótulos: DBInstanceIdentifier
Descrição do alarme: alarme quando a latência de gravação p90 excede o limite de uma instância do RDS.
Intenção: detectar alta latência de gravação indicando problemas no disco.
Critérios do PromQL:
histogram_quantile(0.9, {__name__="WriteLatency", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) >THRESHOLDLimite recomendado:
THRESHOLD(incorporado na consulta)Justificativa do limite: definir com base na latência aceitável do aplicativo.
Intervalo de avaliação: 60
Período de pendência: 300
Período de recuperação: 300
- DBLoad
-
Rótulos: DBInstanceIdentifier
Descrição do alarme: alarme quando a carga média do banco de dados excede o limite de uma instância do RDS.
Intenção: detectar a alta carga do banco de dados que prejudica o desempenho.
Critérios do PromQL:
avg({__name__="DBLoad", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) >THRESHOLDLimite recomendado:
THRESHOLD(incorporado na consulta)Justificativa do limite: definir como múltiplo da contagem de vCPUs.
Intervalo de avaliação: 60
Período de pendência: 900
Período de recuperação: 900
- AuroraVolumeBytesLeftTotal
-
Rótulos: DBClusterIdentifier
Descrição do alarme: alarme quando os bytes restantes de armazenamento do cluster do Aurora caem abaixo do limite.
Intenção: evitar o esgotamento do armazenamento do cluster do Aurora.
Critérios do PromQL:
avg({__name__="AuroraVolumeBytesLeftTotal", "@instrumentation.@name"="cloudwatch.aws/rds", DBClusterIdentifier="CLUSTER"}) <THRESHOLDLimite recomendado:
THRESHOLD(incorporado na consulta)Justificativa do limite: definir com base na taxa de crescimento.
Intervalo de avaliação: 60
Período de pendência: 300
Período de recuperação: 300
- AuroraBinlogReplicaLag
-
Rótulos: DBClusterIdentifier
Descrição do alarme: alarme quando o atraso na réplica do log binário do Aurora indica um estado de erro.
Intenção: detectar erros de replicação da instância do gravador.
Critérios do PromQL:
avg({__name__="AuroraBinlogReplicaLag", "@instrumentation.@name"="cloudwatch.aws/rds", DBClusterIdentifier="CLUSTER"}) <= -1Limite recomendado: -1 (incorporado na consulta)
Justificativa do limite: -1 indica estado de erro.
Intervalo de avaliação: 60
Período de pendência: 120
Período de recuperação: 120
- BlockedTransactions
-
Rótulos: DBInstanceIdentifier
Descrição do alarme: alarme quando a contagem de transações bloqueadas excede o limite de uma instância do RDS.
Intenção: detectar o bloqueio de transações que causa degradação do desempenho.
Critérios do PromQL:
avg({__name__="BlockedTransactions", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) >THRESHOLDLimite recomendado:
THRESHOLD(incorporado na consulta)Justificativa do limite: definir com base na contagem aceitável de transações bloqueadas.
Intervalo de avaliação: 60
Período de pendência: 300
Período de recuperação: 300
- BufferCacheHitRatio
-
Rótulos: DBInstanceIdentifier
Descrição do alarme: alarme quando a taxa de acerto do cache de buffers cai abaixo de 80% em uma instância do RDS.
Intenção: detectar a baixa eficiência do cache que causa diminuição no desempenho.
Critérios do PromQL:
avg({__name__="BufferCacheHitRatio", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) < 80Limite recomendado: 80 (incorporado na consulta)
Justificativa do limite: abaixo de 80% indica excesso de E/S de disco.
Intervalo de avaliação: 60
Período de pendência: 600
Período de recuperação: 600
- EngineUptime
-
Rótulos: DBClusterIdentifier
Descrição do alarme: alarme quando o tempo de atividade do mecanismo cai para zero, indicando a reinicialização do gravador Aurora.
Intenção: detectar o tempo de inatividade ou a falha da instância do gravador Aurora.
Critérios do PromQL:
avg({__name__="EngineUptime", "@instrumentation.@name"="cloudwatch.aws/rds", DBClusterIdentifier="CLUSTER"}) <= 0Limite recomendado: 0 (incorporado na consulta)
Justificativa do limite: tempo de atividade zero indica reinicialização da instância.
Intervalo de avaliação: 60
Período de pendência: 120
Período de recuperação: 120
- RollbackSegmentHistoryListLength
-
Rótulos: DBInstanceIdentifier
Descrição do alarme: alarme quando o comprimento da lista do histórico do segmento de reversão excede 1 milhão para uma instância do Aurora.
Intenção: detectar um alto histórico de reversão que causa degradação da CPU.
Critérios do PromQL:
avg({__name__="RollbackSegmentHistoryListLength", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > 1000000Limite recomendado: 1000000 (incorporado na consulta)
Justificativa do limite: acima de 1 milhão causa problemas de desempenho.
Intervalo de avaliação: 60
Período de pendência: 300
Período de recuperação: 300
- StorageNetworkThroughput
-
Rótulos: DBClusterIdentifier
Descrição do alarme: alarme quando o throughput da rede de armazenamento excede o limite de um cluster do Aurora.
Intenção: detectar alto throughput com risco de descarte de pacotes de rede.
Critérios do PromQL:
avg({__name__="StorageNetworkThroughput", "@instrumentation.@name"="cloudwatch.aws/rds", DBClusterIdentifier="CLUSTER"}) >THRESHOLDLimite recomendado:
THRESHOLD(incorporado na consulta)Justificativa do limite: definir com base na capacidade da rede da instância.
Intervalo de avaliação: 60
Período de pendência: 300
Período de recuperação: 300
Route 53
- HealthCheckStatus
-
Rótulos: HealthCheckId
Descrição do alarme: alarme quando uma verificação de integridade do Route 53 relata um endpoint não íntegro.
Intenção: detectar endpoints não íntegros por meio dos verificadores de integridade do Route 53.
Critérios do PromQL:
avg({__name__="HealthCheckStatus", "@instrumentation.@name"="cloudwatch.aws/route53", HealthCheckId="HC"}) < 1Limite recomendado: 1 (incorporado na consulta)
Justificativa do limite: abaixo de 1 indica que o endpoint está falhando nas verificações de integridade.
Intervalo de avaliação: 60
Período de pendência: 180
Período de recuperação: 180
S3
- 4xxErrors
-
Rótulos: BucketName, FilterId
Descrição do alarme: alarme quando a taxa de erro 4xx exceder 5% para um bucket S3.
Intenção: detectar taxas de erro anormais do cliente.
Critérios do PromQL:
avg({__name__="4xxErrors", "@instrumentation.@name"="cloudwatch.aws/s3", BucketName="BUCKET",FilterId="FILTER"}) > 0.05Limite recomendado: 0,05 (incorporado na consulta)
Justificativa do limite: acima de 5% indica problemas de configuração ou acesso.
Intervalo de avaliação: 60
Período de pendência: 900
Período de recuperação: 900
- 5xxErrors
-
Rótulos: BucketName, FilterId
Descrição do alarme: alarme quando a taxa de erro 5xx exceder 5% para um bucket S3.
Intenção: detectar erros do lado do servidor que afetam o aplicativo.
Critérios do PromQL:
avg({__name__="5xxErrors", "@instrumentation.@name"="cloudwatch.aws/s3", BucketName="BUCKET",FilterId="FILTER"}) > 0.05Limite recomendado: 0,05 (incorporado na consulta)
Justificativa do limite: acima de 5% indica problemas de serviço do S3.
Intervalo de avaliação: 60
Período de pendência: 900
Período de recuperação: 900
- OperationsFailedReplication
-
Rótulos: SourceBucket, DestinationBucket, RuleId
Descrição do alarme: alarme quando as operações de replicação do S3 falham em um bucket.
Intenção: detectar falhas de replicação que correm o risco de inconsistência de dados.
Critérios do PromQL:
max({__name__="OperationsFailedReplication", "@instrumentation.@name"="cloudwatch.aws/s3", SourceBucket="SRC",DestinationBucket="DST",RuleId="RULE"}) > 0Limite recomendado: 0 (incorporado na consulta)
Justificativa do limite: qualquer falha na replicação requer investigação.
Intervalo de avaliação: 60
Período de pendência: 300
Período de recuperação: 300
S3 Object Lambda
- 4xxErrors
-
Rótulos: AccessPointName, DataSourceARN
Descrição do alarme: alarme quando a taxa de erro 4xx exceder 5% para um ponto de acesso do S3 Object Lambda.
Intenção: detectar taxas de erro anormais do cliente para o Object Lambda.
Critérios do PromQL:
avg({__name__="4xxErrors", "@instrumentation.@name"="cloudwatch.aws/s3objectlambda", AccessPointName="AP",DataSourceARN="ARN"}) > 0.05Limite recomendado: 0,05 (incorporado na consulta)
Justificativa do limite: acima de 5% indica problemas de configuração.
Intervalo de avaliação: 60
Período de pendência: 900
Período de recuperação: 900
- 5xxErrors
-
Rótulos: AccessPointName, DataSourceARN
Descrição do alarme: alarme quando a taxa de erro 5xx exceder 5% para um ponto de acesso do S3 Object Lambda.
Intenção: detectar erros do lado do servidor no Object Lambda.
Critérios do PromQL:
avg({__name__="5xxErrors", "@instrumentation.@name"="cloudwatch.aws/s3objectlambda", AccessPointName="AP",DataSourceARN="ARN"}) > 0.05Limite recomendado: 0,05 (incorporado na consulta)
Justificativa do limite: acima de 5% indica problemas com Lambda ou S3.
Intervalo de avaliação: 60
Período de pendência: 900
Período de recuperação: 900
- LambdaResponse4xx
-
Rótulos: AccessPointName, DataSourceARN
Descrição do alarme: alarme quando a taxa de resposta 4xx da função do Lambda exceder 5% para um ponto de acesso do S3 Object Lambda.
Intenção: detectar erros do cliente da função do Lambda.
Critérios do PromQL:
avg({__name__="LambdaResponse4xx", "@instrumentation.@name"="cloudwatch.aws/s3objectlambda", AccessPointName="AP",DataSourceARN="ARN"}) > 0.05Limite recomendado: 0,05 (incorporado na consulta)
Justificativa do limite: acima de 5% indica problemas na função do Lambda.
Intervalo de avaliação: 60
Período de pendência: 900
Período de recuperação: 900
SNS
- NumberOfMessagesPublished
-
Rótulos: TopicName
Descrição do alarme: alarme quando o número de mensagens publicadas cai abaixo do limite de um tópico do SNS.
Intenção: detectar uma queda significativa no volume de publicações.
Critérios do PromQL:
sum({__name__="NumberOfMessagesPublished", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) <THRESHOLDLimite recomendado:
THRESHOLD(incorporado na consulta)Justificativa do limite: definir com base no tráfego mínimo esperado.
Intervalo de avaliação: 60
Período de pendência: 300
Período de recuperação: 300
- NumberOfNotificationsDelivered
-
Rótulos: TopicName
Descrição do alarme: alarme quando o número de notificações entregues cai abaixo do limite de um tópico do SNS.
Intenção: detectar queda no volume de entrega de notificações.
Critérios do PromQL:
sum({__name__="NumberOfNotificationsDelivered", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) <THRESHOLDLimite recomendado:
THRESHOLD(incorporado na consulta)Justificativa do limite: definir com base nas entregas mínimas esperadas.
Intervalo de avaliação: 60
Período de pendência: 300
Período de recuperação: 300
- NumberOfNotificationsFailed
-
Rótulos: TopicName
Descrição do alarme: alarme quando a contagem de falha na entrega de notificações excede o limite para um tópico do SNS.
Intenção: detectar falhas na entrega.
Critérios do PromQL:
sum({__name__="NumberOfNotificationsFailed", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) >THRESHOLDLimite recomendado:
THRESHOLD(incorporado na consulta)Justificativa do limite: definir com base na taxa de falha aceitável.
Intervalo de avaliação: 60
Período de pendência: 300
Período de recuperação: 300
- NumberOfNotificationsFilteredOut-InvalidAttributes
-
Rótulos: TopicName
Descrição do alarme: alarme quando as notificações são filtradas devido a atributos de mensagem inválidos.
Intenção: detectar atributos de mensagem inválidos.
Critérios do PromQL:
sum({__name__="NumberOfNotificationsFilteredOut-InvalidAttributes", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) > 0Limite recomendado: 0 (incorporado na consulta)
Justificativa do limite: qualquer filtro inválido indica configuração incorreta.
Intervalo de avaliação: 60
Período de pendência: 300
Período de recuperação: 300
- NumberOfNotificationsFilteredOut-InvalidMessageBody
-
Rótulos: TopicName
Descrição do alarme: alarme quando as notificações são filtradas devido a corpos de mensagens inválidos.
Intenção: detectar corpos de mensagens inválidos.
Critérios do PromQL:
sum({__name__="NumberOfNotificationsFilteredOut-InvalidMessageBody", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) > 0Limite recomendado: 0 (incorporado na consulta)
Justificativa do limite: qualquer filtro inválido indica configuração incorreta.
Intervalo de avaliação: 60
Período de pendência: 300
Período de recuperação: 300
- NumberOfNotificationsRedrivenToDlq
-
Rótulos: TopicName
Descrição do alarme: alarme quando as notificações são enviadas para a fila de mensagens não entregues de um tópico do SNS.
Intenção: detectar mensagens enviadas para a fila de mensagens não entregues.
Critérios do PromQL:
sum({__name__="NumberOfNotificationsRedrivenToDlq", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) > 0Limite recomendado: 0 (incorporado na consulta)
Justificativa do limite: qualquer mensagem de DLQ indica problemas de entrega.
Intervalo de avaliação: 60
Período de pendência: 300
Período de recuperação: 300
- NumberOfNotificationsFailedToRedriveToDlq
-
Rótulos: TopicName
Descrição do alarme: alarme quando as notificações não são enviadas para a fila de mensagens não entregues de um tópico do SNS.
Intenção: detectar falhas na entrega do DLQ.
Critérios do PromQL:
sum({__name__="NumberOfNotificationsFailedToRedriveToDlq", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) > 0Limite recomendado: 0 (incorporado na consulta)
Justificativa do limite: a falha na DLQ significa perda do rastreamento de erros.
Intervalo de avaliação: 60
Período de pendência: 300
Período de recuperação: 300
- SMSMonthToDateSpentUSD
-
Rótulos: TopicName
Descrição do alarme: alarme quando os gastos com SMS se aproximam da cota da conta para um tópico do SNS.
Intenção: detectar gastos com SMS se aproximando da cota.
Critérios do PromQL:
max({__name__="SMSMonthToDateSpentUSD", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) >THRESHOLDLimite recomendado:
THRESHOLD(incorporado na consulta)Justificativa do limite: definir com base na cota de SMS da conta.
Intervalo de avaliação: 60
Período de pendência: 300
Período de recuperação: 300
- SMSSuccessRate
-
Rótulos: TopicName
Descrição do alarme: alarme quando a taxa de sucesso da entrega de SMS cai abaixo do limite para um tópico do SNS.
Intenção: detectar falhas nas entregas de SMS.
Critérios do PromQL:
avg({__name__="SMSSuccessRate", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) <THRESHOLDLimite recomendado:
THRESHOLD(incorporado na consulta)Justificativa do limite: definir com base na taxa de entrega aceitável.
Intervalo de avaliação: 60
Período de pendência: 300
Período de recuperação: 300
SQS
- ApproximateAgeOfOldestMessage
-
Rótulos: QueueName
Descrição do alarme: alarme quando a idade da mensagem mais antiga excede o limite de uma fila SQS.
Intenção: detectar mensagens não processadas com rapidez suficiente.
Critérios do PromQL:
max({__name__="ApproximateAgeOfOldestMessage", "@instrumentation.@name"="cloudwatch.aws/sqs", QueueName="QUEUE"}) >THRESHOLDLimite recomendado:
THRESHOLD(incorporado na consulta)Justificativa do limite: definir com base no tempo aceitável de processamento de mensagens.
Intervalo de avaliação: 60
Período de pendência: 900
Período de recuperação: 900
- ApproximateNumberOfMessagesNotVisible
-
Rótulos: QueueName
Descrição do alarme: alarme quando o número de mensagens em trânsito excede o limite de uma fila SQS.
Intenção: detectar muitas mensagens em trânsito indicando problemas do consumidor.
Critérios do PromQL:
avg({__name__="ApproximateNumberOfMessagesNotVisible", "@instrumentation.@name"="cloudwatch.aws/sqs", QueueName="QUEUE"}) >THRESHOLDLimite recomendado:
THRESHOLD(incorporado na consulta)Justificativa do limite: definir com base no volume de processamento esperado.
Intervalo de avaliação: 60
Período de pendência: 900
Período de recuperação: 900
- ApproximateNumberOfMessagesVisible
-
Rótulos: QueueName
Descrição do alarme: alarme quando o número de mensagens visíveis excede o limite de uma fila SQS.
Intenção: detectar o acúmulo de mensagens indicando consumidores lentos.
Critérios do PromQL:
avg({__name__="ApproximateNumberOfMessagesVisible", "@instrumentation.@name"="cloudwatch.aws/sqs", QueueName="QUEUE"}) >THRESHOLDLimite recomendado:
THRESHOLD(incorporado na consulta)Justificativa do limite: definir com base na profundidade esperada da fila.
Intervalo de avaliação: 60
Período de pendência: 900
Período de recuperação: 900
- NumberOfMessagesSent
-
Rótulos: QueueName
Descrição do alarme: alarme quando nenhuma mensagem é enviada para uma fila SQS.
Intenção: detectar que os produtores pararam de enviar mensagens.
Critérios do PromQL:
sum({__name__="NumberOfMessagesSent", "@instrumentation.@name"="cloudwatch.aws/sqs", QueueName="QUEUE"}) <= 0Limite recomendado: 0 (incorporado na consulta)
Justificativa do limite: zero mensagens indica falha do produtor.
Intervalo de avaliação: 60
Período de pendência: 900
Período de recuperação: 900
VPN
- TunnelState (nível de VPN)
-
Rótulos: VpnId
Descrição do alarme: alarme quando pelo menos um túnel VPN está inativo.
Intenção: detectar pelo menos um túnel no estado DOWN (inativo).
Critérios do PromQL:
min({__name__="TunnelState", "@instrumentation.@name"="cloudwatch.aws/vpn", VpnId="VPN"}) < 1Limite recomendado: 1 (incorporado na consulta)
Justificativa do limite: abaixo de 1 significa que o túnel está inativo.
Intervalo de avaliação: 300
Período de pendência: 900
Período de recuperação: 900
- TunnelState (nível do túnel)
-
Rótulos: TunnelIpAddress
Descrição do alarme: alarme quando um túnel VPN específico está em um estado DOWN (inativo).
Intenção: detectar um túnel específico no estado DOWN.
Critérios do PromQL:
min({__name__="TunnelState", "@instrumentation.@name"="cloudwatch.aws/vpn", TunnelIpAddress="IP"}) < 1Limite recomendado: 1 (incorporado na consulta)
Justificativa do limite: abaixo de 1 significa que o túnel está inativo.
Intervalo de avaliação: 300
Período de pendência: 900
Período de recuperação: 900