View a markdown version of this page

Allarmi ProMQL consigliati - Amazon CloudWatch

Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.

Allarmi ProMQL consigliati

Usa questi allarmi ProMQL come equivalenti dei classici allarmi consigliati. Monitorano le stesse metriche utilizzando le query istantanee ProMQL che vengono valutate rispetto alle metriche inserite tramite l'endpoint OTLP. CloudWatch

Gli EvaluationCriteria PromQLCriteria allarmi ProMQL vengono utilizzati con. A differenza dei classici allarmi metrici, la soglia è incorporata direttamente nell'espressione di query ProMQL.

  • Periodo in sospeso: la durata in secondi che una serie temporale deve superare continuamente prima che l'allarme passi allo stato ALARM.

  • Periodo di ripristino: la durata in secondi in cui tutte le serie temporali devono cessare di superare prima che l'allarme ritorni allo stato OK.

  • Intervallo di valutazione: con quale frequenza, in secondi, CloudWatch viene eseguita la query ProMQL.

Nota

Questi allarmi richiedono metriche pubblicate tramite l'endpoint OTLP. CloudWatch Per ulteriori informazioni, consulta Allarmi ProMQL.

È possibile distribuire questi allarmi utilizzando. AWS CloudFormation Usa le PromQLCriteria proprietà EvaluationCriteria and sulla risorsa. AWS::CloudWatch::Alarm

API REST

4XXError

Etichette: ApiName, Stage

Descrizione dell'allarme: allarme quando il tasso medio di errore 4XX supera il 5% per una fase dell'API REST.

Intento: rileva un elevato tasso di errore del cliente che indica problemi relativi alle richieste.

Criteri ProMQL: avg({__name__="4XXError", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiName="your-api-name",Stage="your-stage"}) > 0.05

Soglia consigliata: 0,05 (incorporata nella query)

Giustificazione della soglia: rileva un tasso di errore del cliente superiore al 5%, il che indica errori significativi nelle richieste.

Intervallo di valutazione: 60

Periodo in sospeso: 300

Periodo di recupero: 300

5XXError

Etichette: ApiName, Stage

Descrizione dell'allarme: allarme quando il tasso medio di errore 5XX supera il 5% per una fase dell'API REST.

Intento: rileva un elevato tasso di errore del server che indica errori di backend.

Criteri ProMQL: avg({__name__="5XXError", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiName="your-api-name",Stage="your-stage"}) > 0.05

Soglia consigliata: 0,05 (incorporata nella query)

Giustificazione della soglia: rileva un tasso di errore del server superiore al 5%, che richiede un'indagine immediata.

Intervallo di valutazione: 60

Periodo in sospeso: 180

Periodo di recupero: 300

Latenza

Etichette: ApiName, Stage

Descrizione dell'allarme: allarme quando la latenza p90 supera i 2500 ms per una fase dell'API REST.

Intento: rilevare un'elevata latenza p90 che influisce sull'esperienza utente.

Criteri ProMQL: histogram_quantile(0.9, {__name__="Latency", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiName="your-api-name",Stage="your-stage"}) > 2500

Soglia consigliata: 2500 (incorporata nella query)

Giustificazione della soglia: una latenza p90 superiore a 2500 ms indica tempi di risposta ridotti per la maggior parte delle richieste.

Intervallo di valutazione: 60

Periodo in sospeso: 300

Periodo di recupero: 300

Conteggio

Etichette: ApiName, Stage

Descrizione dell'allarme: allarme quando il numero totale di richieste scende al di sotto della linea di base prevista per una fase dell'API REST.

Intento: rileva un volume di traffico basso che potrebbe indicare problemi di routing o disponibilità.

Criteri ProMQL: sum({__name__="Count", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiName="your-api-name",Stage="your-stage"}) < THRESHOLD

Soglia consigliata: THRESHOLD (incorporata nella query)

Giustificazione della soglia: impostata in base alla linea di base del traffico prevista per rilevare cali imprevisti.

Intervallo di valutazione: 60

Periodo in sospeso: 600

Periodo di recupero: 300

API HTTP

4xx

Etichette: ApiId, Stage

Descrizione dell'allarme: allarme quando il tasso medio di errore 4xx supera il 5% per una fase dell'API HTTP.

Intento: rileva un elevato tasso di errore dei client sugli endpoint dell'API HTTP.

Criteri ProMQL: avg({__name__="4xx", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="your-api-id",Stage="your-stage"}) > 0.05

Soglia consigliata: 0,05 (incorporata nella query)

Giustificazione della soglia: rileva un tasso di errore del cliente superiore al 5%.

Intervallo di valutazione: 60

Periodo in sospeso: 300

Periodo di recupero: 300

5xx

Etichette: ApiId, Stage

Descrizione dell'allarme: allarme quando il tasso medio di errore 5xx supera il 5% per una fase dell'API HTTP.

Intento: rileva un elevato tasso di errore del server sugli endpoint dell'API HTTP.

Criteri ProMQL: avg({__name__="5xx", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="your-api-id",Stage="your-stage"}) > 0.05

Soglia consigliata: 0,05 (incorporata nella query)

Giustificazione della soglia: rileva un tasso di errore del server superiore al 5% che richiede un'indagine.

Intervallo di valutazione: 60

Periodo in sospeso: 180

Periodo di recupero: 300

Latenza

Etichette: ApiId, Stage

Descrizione dell'allarme: allarme quando la latenza p90 supera i 2500 ms per una fase di API HTTP.

Intento: rileva una latenza p90 elevata sugli endpoint dell'API HTTP.

Criteri ProMQL: histogram_quantile(0.9, {__name__="Latency", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="your-api-id",Stage="your-stage"}) > 2500

Soglia consigliata: 2500 (incorporata nella query)

Giustificazione della soglia: una latenza p90 superiore a 2500 ms indica tempi di risposta ridotti.

Intervallo di valutazione: 60

Periodo in sospeso: 300

Periodo di recupero: 300

IntegrationLatency

Etichette: ApiId, Stage

Descrizione dell'allarme: allarme quando la latenza di integrazione p90 supera i 2000 ms per una fase di API HTTP.

Intento: rileva un'elevata latenza di integrazione del backend che influisce sui tempi di risposta.

Criteri ProMQL: histogram_quantile(0.9, {__name__="IntegrationLatency", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="your-api-id",Stage="your-stage"}) > 2000

Soglia consigliata: 2000 (incorporata nella query)

Giustificazione della soglia: una latenza di integrazione p90 superiore a 2000 ms indica una lentezza del backend.

Intervallo di valutazione: 60

Periodo in sospeso: 300

Periodo di recupero: 300

Conteggio

Etichette: ApiId, Stage

Descrizione dell'allarme: avviso quando il numero totale di richieste scende al di sotto della linea di base prevista per una fase dell'API HTTP.

Intento: rileva un volume di traffico basso che potrebbe indicare problemi di routing o disponibilità.

Criteri ProMQL: sum({__name__="Count", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="your-api-id",Stage="your-stage"}) < THRESHOLD

Soglia consigliata: THRESHOLD (incorporata nella query)

Giustificazione della soglia: impostata in base alla linea di base del traffico prevista per rilevare cali imprevisti.

Intervallo di valutazione: 60

Periodo in sospeso: 600

Periodo di recupero: 300

WebSocket API

ClientError

Etichette: ApiId, Stage

Descrizione dell'allarme: allarme quando il tasso medio di errore del client supera il 5% per una fase WebSocket API.

Intento: rileva un elevato tasso di errore del cliente sulle connessioni WebSocket API.

Criteri ProMQL: avg({__name__="ClientError", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="your-api-id",Stage="your-stage"}) > 0.05

Soglia consigliata: 0,05 (incorporata nella query)

Giustificazione della soglia: rileva un tasso di errore del client superiore al 5% sulle connessioni. WebSocket

Intervallo di valutazione: 60

Periodo in sospeso: 300

Periodo di recupero: 300

ExecutionError

Etichette: ApiId, Stage

Descrizione dell'allarme: allarme quando il tasso medio di errore di esecuzione supera il 5% per una fase WebSocket API.

Intento: rileva un elevato tasso di errore di esecuzione lato server sulle API. WebSocket

Criteri ProMQL: avg({__name__="ExecutionError", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="your-api-id",Stage="your-stage"}) > 0.05

Soglia consigliata: 0,05 (incorporata nella query)

Giustificazione della soglia: rileva un tasso di errore di esecuzione superiore al 5% che richiede un'indagine.

Intervallo di valutazione: 60

Periodo in sospeso: 180

Periodo di recupero: 300

IntegrationLatency

Etichette: ApiId, Stage

Descrizione dell'allarme: allarme quando la latenza di integrazione p90 supera i 2000 ms per una WebSocket fase API.

Intento: rileva un'elevata latenza di integrazione del backend sulle route delle API. WebSocket

Criteri ProMQL: histogram_quantile(0.9, {__name__="IntegrationLatency", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="your-api-id",Stage="your-stage"}) > 2000

Soglia consigliata: 2000 (incorporata nella query)

Giustificazione della soglia: una latenza di integrazione p90 superiore a 2000 ms indica una lentezza del backend.

Intervallo di valutazione: 60

Periodo in sospeso: 300

Periodo di recupero: 300

MessageCount

Etichette: ApiId, Stage

Descrizione dell'allarme: avviso quando il numero totale dei messaggi scende al di sotto della linea di base prevista per una fase WebSocket API.

Intento: rilevare un volume di messaggi basso che potrebbe indicare problemi di connessione o routing.

Criteri ProMQL: sum({__name__="MessageCount", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="your-api-id",Stage="your-stage"}) < THRESHOLD

Soglia consigliata: THRESHOLD (incorporata nella query)

Giustificazione della soglia: impostata in base al volume di messaggi previsto per rilevare cali imprevisti.

Intervallo di valutazione: 60

Periodo in sospeso: 600

Periodo di recupero: 300

GroupInServiceCapacity

Etichette: AutoScalingGroupName

Descrizione dell'allarme: si attiva quando la capacità media in servizio scende al di sotto del minimo previsto per un gruppo Auto Scaling.

Intento: rilevare una bassa disponibilità dovuta a errori di avvio o istanze terminate.

Criteri ProMQL: avg({__name__="GroupInServiceCapacity", "@instrumentation.@name"="cloudwatch.aws/autoscaling", AutoScalingGroupName="your-auto-scaling-group-name"}) < THRESHOLD

Soglia consigliata: THRESHOLD (incorporata nella query)

Giustificazione della soglia: impostata in base alla capacità minima desiderata per rilevare errori di avvio o istanze insufficienti.

Intervallo di valutazione: 60

Periodo in sospeso: 600

Periodo di recupero: 600

DaysToExpiry

Etichette: CertificateArn

Descrizione dell'allarme: avviso quando il periodo minimo di scadenza del certificato scende a 44 giorni o meno.

Intento: avviso proattivo di scadenza del certificato per consentire il rinnovo.

Criteri ProMQL: min({__name__="DaysToExpiry", "@instrumentation.@name"="cloudwatch.aws/certificatemanager", CertificateArn="your-certificate-arn"}) <= 44

Soglia consigliata: 44 (incorporata nella query)

Giustificazione della soglia: fornisce un lasso di tempo sufficiente prima della scadenza del certificato per completare il processo di rinnovo.

Intervallo di valutazione: 86400

Periodo in sospeso: 86400

Periodo di recupero: 86400

5xxErrorRate

Etichette: DistributionId

Descrizione dell'allarme: allarme quando il tasso di errore medio di 5xx supera la soglia per una CloudFront distribuzione.

Intento: rileva un'origine o un tasso di CloudFront errore elevato che influisce sulla distribuzione dei contenuti.

Criteri ProMQL: avg({__name__="5xxErrorRate", "@instrumentation.@name"="cloudwatch.aws/cloudfront", DistributionId="your-distribution-id"}) > THRESHOLD

Soglia consigliata: THRESHOLD (incorporata nella query)

Giustificazione della soglia: impostata in base al tasso di errore accettabile per la distribuzione dei contenuti.

Intervallo di valutazione: 60

Periodo in sospeso: 300

Periodo di recupero: 300

OriginLatency

Etichette: DistributionId

Descrizione dell'allarme: allarme quando la latenza di origine p90 supera la soglia per una distribuzione. CloudFront

Intento: rileva un'elevata latenza di risposta all'origine che influisce sulle prestazioni di distribuzione dei contenuti.

Criteri ProMQL: histogram_quantile(0.9, {__name__="OriginLatency", "@instrumentation.@name"="cloudwatch.aws/cloudfront", DistributionId="your-distribution-id"}) > THRESHOLD

Soglia consigliata: THRESHOLD (incorporata nella query)

Giustificazione della soglia: impostata in base al tempo di risposta di origine previsto e alla strategia di memorizzazione nella cache.

Intervallo di valutazione: 60

Periodo in sospeso: 300

Periodo di recupero: 300

FunctionValidationErrors

Etichette: DistributionId, FunctionName

Descrizione dell'allarme: allarme quando si verificano errori di convalida della CloudFront funzione.

Intento: rileva gli errori di convalida delle CloudFront funzioni che ne impediscono l'esecuzione.

Criteri ProMQL: sum({__name__="FunctionValidationErrors", "@instrumentation.@name"="cloudwatch.aws/cloudfront", DistributionId="your-distribution-id",FunctionName="your-function-name"}) > 0

Soglia consigliata: 0 (incorporata nella query)

Giustificazione della soglia: qualsiasi errore di convalida indica un problema di configurazione della funzione che richiede attenzione.

Intervallo di valutazione: 60

Periodo in sospeso: 120

Periodo di recupero: 120

FunctionExecutionErrors

Etichette: DistributionId, FunctionName

Descrizione dell'allarme: allarme quando si verificano errori di esecuzione della CloudFront funzione.

Intento: rileva gli errori di runtime nelle CloudFront funzioni che influiscono sull'elaborazione delle richieste.

Criteri ProMQL: sum({__name__="FunctionExecutionErrors", "@instrumentation.@name"="cloudwatch.aws/cloudfront", DistributionId="your-distribution-id",FunctionName="your-function-name"}) > 0

Soglia consigliata: 0 (incorporata nella query)

Giustificazione della soglia: qualsiasi errore di esecuzione indica un problema di runtime nel codice della funzione.

Intervallo di valutazione: 60

Periodo in sospeso: 300

Periodo di recupero: 300

FunctionThrottles

Etichette: DistributionId, FunctionName

Descrizione dell'allarme: Allarme in caso di limitazione di una CloudFront funzione.

Intento: rileva la limitazione delle CloudFront funzioni che potrebbe compromettere l'elaborazione delle richieste.

Criteri ProMQL: sum({__name__="FunctionThrottles", "@instrumentation.@name"="cloudwatch.aws/cloudfront", DistributionId="your-distribution-id",FunctionName="your-function-name"}) > 0

Soglia consigliata: 0 (incorporata nella query)

Giustificazione della soglia: qualsiasi limitazione indica che la funzione sta raggiungendo i limiti di calcolo.

Intervallo di valutazione: 60

Periodo in sospeso: 300

Periodo di recupero: 300

SignUpThrottles

Etichette: UserPool, UserPoolClient

Descrizione dell'allarme: allarme quando gli eventi di limitazione della registrazione superano la soglia per un pool di utenti.

Intento: rileva la limitazione delle iscrizioni che impedisce la registrazione di nuovi utenti.

Criteri ProMQL: sum({__name__="SignUpThrottles", "@instrumentation.@name"="cloudwatch.aws/cognito", UserPool="your-user-pool",UserPoolClient="your-user-pool-client"}) > THRESHOLD

Soglia consigliata: THRESHOLD (incorporata nella query)

Giustificazione della soglia: impostata in base alla velocità di accelerazione accettabile per le operazioni di registrazione.

Intervallo di valutazione: 60

Periodo in sospeso: 300

Periodo di recupero: 300

SignInThrottles

Etichette: UserPool, UserPoolClient

Descrizione dell'allarme: allarme quando gli eventi di limitazione dell'accesso superano la soglia per un pool di utenti.

Intento: rileva la limitazione dell'accesso che impedisce l'autenticazione dell'utente.

Criteri ProMQL: sum({__name__="SignInThrottles", "@instrumentation.@name"="cloudwatch.aws/cognito", UserPool="your-user-pool",UserPoolClient="your-user-pool-client"}) > THRESHOLD

Soglia consigliata: THRESHOLD (incorporata nella query)

Giustificazione della soglia: impostata in base alla velocità di accelerazione accettabile per le operazioni di accesso.

Intervallo di valutazione: 60

Periodo in sospeso: 300

Periodo di recupero: 300

TokenRefreshThrottles

Etichette: UserPool, UserPoolClient

Descrizione dell'allarme: allarme quando gli eventi di limitazione dell'aggiornamento del token superano la soglia per un pool di utenti.

Intento: rileva la limitazione dell'aggiornamento dei token che potrebbe causare interruzioni della sessione.

Criteri ProMQL: sum({__name__="TokenRefreshThrottles", "@instrumentation.@name"="cloudwatch.aws/cognito", UserPool="your-user-pool",UserPoolClient="your-user-pool-client"}) > THRESHOLD

Soglia consigliata: THRESHOLD (incorporata nella query)

Giustificazione della soglia: impostata in base alla frequenza di accelerazione accettabile per le operazioni di aggiornamento dei token.

Intervallo di valutazione: 60

Periodo in sospeso: 300

Periodo di recupero: 300

FederationThrottles

Etichette: UserPool, UserPoolClient, IdentityProvider

Descrizione dell'allarme: allarme quando gli eventi di limitazione della federazione superano la soglia per un provider di identità del pool di utenti.

Intento: rilevare la limitazione della federazione che potrebbe impedire l'accesso federato.

Criteri ProMQL: sum({__name__="FederationThrottles", "@instrumentation.@name"="cloudwatch.aws/cognito", UserPool="your-user-pool",UserPoolClient="your-user-pool-client",IdentityProvider="your-identity-provider"}) > THRESHOLD

Soglia consigliata: THRESHOLD (incorporata nella query)

Giustificazione della soglia: impostata in base alla velocità di accelerazione accettabile per le operazioni di federazione.

Intervallo di valutazione: 60

Periodo in sospeso: 300

Periodo di recupero: 300

AccountProvisionedReadCapacityUtilization

Etichette: nessuna

Descrizione dell'allarme: allarme quando l'utilizzo della capacità di lettura assegnata a livello di account supera l'80%.

Intento: rileva quando la capacità di lettura assegnata si avvicina ai limiti dell'account.

Criteri ProMQL: max({__name__="AccountProvisionedReadCapacityUtilization", "@instrumentation.@name"="cloudwatch.aws/dynamodb"}) > 80

Soglia consigliata: 80 (incorporata nella query)

Giustificazione della soglia: con un utilizzo dell'80%, hai un margine di manovra limitato prima di raggiungere i limiti dell'account.

Intervallo di valutazione: 300

Periodo in sospeso: 600

Periodo di recupero: 600

AccountProvisionedWriteCapacityUtilization

Etichette: nessuna

Descrizione dell'allarme: allarme quando l'utilizzo della capacità di scrittura assegnata a livello di account supera l'80%.

Intento: rileva quando la capacità di scrittura assegnata si avvicina ai limiti dell'account.

Criteri ProMQL: max({__name__="AccountProvisionedWriteCapacityUtilization", "@instrumentation.@name"="cloudwatch.aws/dynamodb"}) > 80

Soglia consigliata: 80 (incorporata nella query)

Giustificazione della soglia: con un utilizzo dell'80%, hai un margine di manovra limitato prima di raggiungere i limiti dell'account.

Intervallo di valutazione: 300

Periodo in sospeso: 600

Periodo di recupero: 600

AgeOfOldestUnreplicatedRecord

Etichette: TableName, DelegatedOperation

Descrizione dell'allarme: allarme quando l'età del record non replicato più vecchio supera la soglia.

Intento: rilevare il ritardo di replica che potrebbe causare dati obsoleti nelle tabelle globali.

Criteri ProMQL: max({__name__="AgeOfOldestUnreplicatedRecord", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name",DelegatedOperation="your-operation"}) > THRESHOLD

Soglia consigliata: THRESHOLD (incorporata nella query)

Giustificazione della soglia: impostata in base ai requisiti di aggiornamento della replica.

Intervallo di valutazione: 300

Periodo in sospeso: 900

Periodo di recupero: 900

FailedToReplicateRecordCount

Etichette: TableName, DelegatedOperation

Descrizione dell'allarme: allarme quando i record non vengono replicati in una tabella globale.

Intento: rilevare gli errori di replica che causano incoerenza dei dati tra le regioni.

Criteri ProMQL: sum({__name__="FailedToReplicateRecordCount", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name",DelegatedOperation="your-operation"}) > 0

Soglia consigliata: 0 (incorporata nella query)

Giustificazione della soglia: qualsiasi replica non riuscita indica problemi di coerenza dei dati che richiedono un intervento immediato.

Intervallo di valutazione: 60

Periodo in sospeso: 60

Periodo di recupero: 60

ReadThrottleEvents

Etichette: TableName

Descrizione dell'allarme: allarme quando gli eventi dell'acceleratore di lettura superano la soglia indicata in una tabella.

Intento: rileva la limitazione della lettura che indica una capacità fornita insufficiente.

Criteri ProMQL: sum({__name__="ReadThrottleEvents", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name"}) > THRESHOLD

Soglia consigliata: THRESHOLD (incorporata nella query)

Giustificazione della soglia: impostata in base al numero di acceleratori accettabile per le operazioni di lettura.

Intervallo di valutazione: 60

Periodo in sospeso: 300

Periodo di recupero: 300

ReadThrottleEvents (GSI)

Etichette: TableName, GlobalSecondaryIndexName

Descrizione dell'allarme: allarme quando gli eventi di accelerazione della lettura superano la soglia di un indice secondario globale.

Intento: rileva la limitazione della lettura su un GSI che indica una capacità dell'indice insufficiente.

Criteri ProMQL: sum({__name__="ReadThrottleEvents", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name",GlobalSecondaryIndexName="your-index-name"}) > THRESHOLD

Soglia consigliata: THRESHOLD (incorporata nella query)

Giustificazione della soglia: impostata in base al numero di accelerazioni accettabile per le operazioni di lettura GSI.

Intervallo di valutazione: 60

Periodo in sospeso: 300

Periodo di recupero: 300

ReplicationLatency

Etichette: TableName, ReceivingRegion

Descrizione dell'allarme: allarme quando la latenza media di replica supera la soglia per una tabella globale.

Intento: rileva un'elevata latenza di replica che potrebbe causare letture obsolete nelle regioni di replica.

Criteri ProMQL: avg({__name__="ReplicationLatency", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name",ReceivingRegion="your-receiving-region"}) > THRESHOLD

Soglia consigliata: THRESHOLD (incorporata nella query)

Giustificazione della soglia: impostata in base ai requisiti di aggiornamento dei dati per le regioni di replica.

Intervallo di valutazione: 60

Periodo di attesa: 900

Periodo di recupero: 900

SuccessfulRequestLatency

Etichette: TableName, Operazione

Descrizione dell'allarme: allarme quando la latenza media delle richieste riuscite supera la soglia per un'operazione sulla tabella.

Intento: rileva una latenza elevata sulle operazioni DynamoDB che influisce sulle prestazioni delle applicazioni.

Criteri ProMQL: avg({__name__="SuccessfulRequestLatency", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name",Operation="your-operation"}) > THRESHOLD

Soglia consigliata: THRESHOLD (incorporata nella query)

Giustificazione della soglia: impostata in base allo SLA di latenza per l'operazione specifica di DynamoDB.

Intervallo di valutazione: 60

Periodo in sospeso: 600

Periodo di recupero: 600

SystemErrors

Etichette: TableName

Descrizione dell'allarme: allarme quando gli errori di sistema superano la soglia prevista per una tabella.

Intento: rilevare gli errori sul lato dei servizi di DynamoDB che influiscono sulla disponibilità delle tabelle.

Criteri ProMQL: sum({__name__="SystemErrors", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name"}) > THRESHOLD

Soglia consigliata: THRESHOLD (incorporata nella query)

Giustificazione della soglia: impostata in base al numero di errori di sistema accettabile per la tabella.

Intervallo di valutazione: 60

Periodo di attesa: 900

Periodo di recupero: 900

ThrottledPutRecordCount

Etichette: TableName, DelegatedOperation

Descrizione dell'allarme: allarme quando la limitazione del conteggio dei record di put supera la soglia consentita per una tabella.

Intento: rileva i put limitati che potrebbero causare la perdita di dati nelle operazioni di streaming.

Criteri ProMQL: max({__name__="ThrottledPutRecordCount", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name",DelegatedOperation="your-operation"}) > THRESHOLD

Soglia consigliata: THRESHOLD (incorporata nella query)

Giustificazione della soglia: impostata in base al numero di accelerazioni accettabile per le operazioni di streaming put.

Intervallo di valutazione: 60

Periodo in sospeso: 600

Periodo di recupero: 600

UserErrors

Etichette: nessuna

Descrizione dell'allarme: allarme quando gli errori dell'utente superano la soglia dell'account.

Intento: rilevare alti tassi di errori dei clienti, ad esempio errori di convalida o controllo condizionale.

Criteri ProMQL: sum({__name__="UserErrors", "@instrumentation.@name"="cloudwatch.aws/dynamodb"}) > THRESHOLD

Soglia consigliata: THRESHOLD (incorporata nella query)

Giustificazione della soglia: impostata in base al tasso di errore accettabile per le richieste non riuscite sul lato client.

Intervallo di valutazione: 60

Periodo in sospeso: 600

Periodo di recupero: 600

WriteThrottleEvents

Etichette: TableName

Descrizione dell'allarme: allarme quando gli eventi di accelerazione della scrittura superano la soglia indicata in una tabella.

Intento: rileva la limitazione della scrittura che indica una capacità fornita insufficiente.

Criteri ProMQL: sum({__name__="WriteThrottleEvents", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name"}) > THRESHOLD

Soglia consigliata: THRESHOLD (incorporata nella query)

Giustificazione della soglia: impostata in base al numero di accelerazioni accettabile per le operazioni di scrittura.

Intervallo di valutazione: 60

Periodo in sospeso: 300

Periodo di recupero: 300

WriteThrottleEvents (GSI)

Etichette: TableName, GlobalSecondaryIndexName

Descrizione dell'allarme: allarme quando gli eventi di accelerazione della scrittura superano la soglia di un indice secondario globale.

Intento: rileva la limitazione della scrittura su un GSI che indica una capacità di indice insufficiente.

Criteri ProMQL: sum({__name__="WriteThrottleEvents", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name",GlobalSecondaryIndexName="your-index-name"}) > THRESHOLD

Soglia consigliata: THRESHOLD (incorporata nella query)

Giustificazione della soglia: impostata in base al numero di accelerazioni accettabile per le operazioni di scrittura GSI.

Intervallo di valutazione: 60

Periodo in sospeso: 300

Periodo di recupero: 300

VolumeStalledIOCheck

Etichette: VolumeId, InstanceId

Descrizione dell'allarme: allarme quando un volume EBS segnala un fallimento del I/O controllo in stallo.

Intento: rilevare volumi EBS bloccati che I/O indicano una riduzione del volume.

Criteri ProMQL: max({__name__="VolumeStalledIOCheck", "@instrumentation.@name"="cloudwatch.aws/ebs", VolumeId="your-volume-id",InstanceId="your-instance-id"}) >= 1

Soglia consigliata: 1 (incorporata nella query)

Giustificazione della soglia: un valore pari o superiore a 1 indica che il volume è in stallo I/O e richiede un'indagine immediata.

Intervallo di valutazione: 60

Periodo in sospeso: 600

Periodo di recupero: 600

CPUUtilization

Etichette: InstanceId

Descrizione dell'allarme: allarme quando l'utilizzo medio della CPU supera l'80% per un'istanza EC2.

Intento: rilevare un elevato utilizzo della CPU.

Criteri ProMQL: avg({__name__="CPUUtilization", "@instrumentation.@name"="cloudwatch.aws/ec2", InstanceId="your-instance-id"}) > 80

Soglia consigliata: 80 (incorporata nella query)

Giustificazione della soglia: la soglia dell'80% dà spazio alla testa prima della saturazione.

Intervallo di valutazione: 300

Periodo in sospeso: 900

Periodo di recupero: 900

StatusCheckFailed

Etichette: InstanceId

Descrizione dell'allarme: allarme quando un controllo dello stato di un'istanza o del sistema fallisce per un'istanza EC2.

Intento: rilevare problemi di integrità dell'istanza o del sistema.

Criteri ProMQL: max({__name__="StatusCheckFailed", "@instrumentation.@name"="cloudwatch.aws/ec2", InstanceId="your-instance-id"}) >= 1

Soglia consigliata: 1 (incorporata nella query)

Giustificazione della soglia: qualsiasi errore nel controllo dello stato richiede un'indagine.

Intervallo di valutazione: 300

Periodo in sospeso: 600

Periodo di recupero: 600

StatusCheckFailedEBS _allegati

Etichette: InstanceId

Descrizione dell'allarme: allarme quando un volume EBS collegato diventa irraggiungibile per un'istanza EC2.

Intento: rilevare volumi EBS irraggiungibili.

Criteri ProMQL: max({__name__="StatusCheckFailed_AttachedEBS", "@instrumentation.@name"="cloudwatch.aws/ec2", InstanceId="your-instance-id"}) >= 1

Soglia consigliata: 1 (incorporata nella query)

Giustificazione della soglia: i volumi irraggiungibili causano guasti. I/O

Intervallo di valutazione: 60

Periodo in sospeso: 600

Periodo di recupero: 600

CPUReservation

Etichette: ClusterName

Descrizione dell'allarme: allarme quando la prenotazione media della CPU supera l'80% per un cluster ECS.

Intento: rilevare un cluster che si avvicina alla capacità della CPU.

Criteri ProMQL: avg({__name__="CPUReservation", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="your-cluster-name"}) > 80

Soglia consigliata: 80 (incorporata nella query)

Giustificazione della soglia: una prenotazione dell'80% indica un margine di manovra limitato per nuove attività.

Intervallo di valutazione: 60

Periodo in sospeso: 300

Periodo di recupero: 300

CPUUtilization

Etichette: ClusterName, ServiceName

Descrizione dell'allarme: allarme quando l'utilizzo medio della CPU supera l'80% per un servizio ECS.

Intento: rilevare un elevato utilizzo della CPU per il servizio ECS.

Criteri ProMQL: avg({__name__="CPUUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="your-cluster-name",ServiceName="your-service-name"}) > 80

Soglia consigliata: 80 (incorporata nella query)

Giustificazione della soglia: l'80% fornisce un margine di manovra prima della saturazione.

Intervallo di valutazione: 60

Periodo in sospeso: 300

Periodo di recupero: 300

EBSFilesystemUtilization

Etichette: ClusterName, ServiceName

Descrizione dell'allarme: allarme quando l'utilizzo medio del file system EBS supera l'80% per un servizio ECS.

Intento: rilevare un elevato utilizzo dello storage EBS.

Criteri ProMQL: avg({__name__="EBSFilesystemUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="your-cluster-name",ServiceName="your-service-name"}) > 80

Soglia consigliata: 80 (incorporata nella query)

Giustificazione della soglia: l'80% fornisce un margine di manovra prima della saturazione.

Intervallo di valutazione: 60

Periodo in sospeso: 300

Periodo di recupero: 300

MemoryReservation

Etichette: ClusterName

Descrizione dell'allarme: allarme quando la prenotazione media di memoria supera l'80% per un cluster ECS.

Intento: rilevare un cluster che si avvicina alla capacità di memoria.

Criteri ProMQL: avg({__name__="MemoryReservation", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="your-cluster-name"}) > 80

Soglia consigliata: 80 (incorporata nella query)

Giustificazione della soglia: una prenotazione dell'80% indica un margine di manovra limitato per nuove attività.

Intervallo di valutazione: 60

Periodo in sospeso: 300

Periodo di recupero: 300

MemoryUtilization

Etichette: ClusterName, ServiceName

Descrizione dell'allarme: allarme quando l'utilizzo medio della memoria supera l'80% per un servizio ECS.

Intento: rilevare un utilizzo elevato della memoria.

Criteri ProMQL: avg({__name__="MemoryUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="your-cluster-name",ServiceName="your-service-name"}) > 80

Soglia consigliata: 80 (incorporata nella query)

Giustificazione della soglia: l'80% fornisce un margine di manovra prima della saturazione.

Intervallo di valutazione: 60

Periodo in sospeso: 300

Periodo di recupero: 300

HTTP Code_Target _5XX_COUNT

Etichette:, ClusterName ServiceName

Descrizione dell'allarme: allarme quando il conteggio degli errori HTTP 5XX supera la soglia per un servizio ECS.

Intento: rileva un numero elevato di errori sul lato server.

Criteri ProMQL: sum({__name__="HTTPCode_Target_5XX_Count", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="your-cluster-name",ServiceName="your-service-name"}) > THRESHOLD

Soglia consigliata: THRESHOLD (incorporata nella query)

Giustificazione della soglia: impostata in base al normale tasso di errore dell'applicazione.

Intervallo di valutazione: 60

Periodo in sospeso: 300

Periodo di recupero: 300

TargetResponseTime

Etichette: ClusterName, ServiceName

Descrizione dell'allarme: allarme quando il tempo di risposta medio previsto supera la soglia per un servizio ECS.

Intento: rilevare un tempo di risposta target elevato.

Criteri ProMQL: avg({__name__="TargetResponseTime", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="your-cluster-name",ServiceName="your-service-name"}) > THRESHOLD

Soglia consigliata: THRESHOLD (incorporata nella query)

Giustificazione della soglia: impostata in base ai requisiti di latenza accettabili dell'applicazione.

Intervallo di valutazione: 60

Periodo in sospeso: 300

Periodo di recupero: 300

EphemeralStorageUtilized

Etichette: ClusterName, ServiceName

Descrizione dell'allarme: allarme quando l'utilizzo medio temporaneo dello spazio di archiviazione supera la soglia per le attività di Fargate.

Intento: rileva un elevato utilizzo temporaneo dello spazio di archiviazione per le attività di Fargate.

Criteri ProMQL: avg({__name__="EphemeralStorageUtilized", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name",ServiceName="your-service-name"}) > THRESHOLD

Soglia consigliata: THRESHOLD (incorporata nella query)

Giustificazione della soglia: impostata in base all'allocazione di archiviazione effimera dell'attività.

Intervallo di valutazione: 60

Periodo in sospeso: 300

Periodo di recupero: 300

RunningTaskCount

Etichette: ClusterName, ServiceName

Descrizione dell'allarme: allarme quando il conteggio delle attività in esecuzione scende a zero per un servizio ECS.

Intento: rileva quando non è in esecuzione alcuna attività.

Criteri ProMQL: avg({__name__="RunningTaskCount", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name",ServiceName="your-service-name"}) <= 0

Soglia consigliata: 0 (incorporata nella query)

Giustificazione della soglia: zero attività in esecuzione indica un'interruzione del servizio.

Intervallo di valutazione: 60

Periodo in sospeso: 300

Periodo di recupero: 300

instance_filesystem_utilization

Etichette: InstanceId, ContainerInstanceId, ClusterName

Descrizione dell'allarme: allarme quando l'utilizzo medio del file system supera il 90% su un'istanza del contenitore.

Intento: rilevare un elevato utilizzo del file system.

Criteri ProMQL: avg({__name__="instance_filesystem_utilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", InstanceId="your-instance-id",ContainerInstanceId="your-container-instance-id",ClusterName="your-cluster-name"}) > 90

Soglia consigliata: 90 (incorporata nella query)

Giustificazione della soglia: l'utilizzo del 90% del file system lascia uno spazio minimo per le operazioni.

Intervallo di valutazione: 60

Periodo in sospeso: 300

Periodo di recupero: 300

TaskCpuUtilization (a livello di cluster)

Etichette: ClusterName

Descrizione dell'allarme: allarme quando l'utilizzo medio della CPU dell'attività supera l'80% a livello di cluster.

Intento: rilevare un elevato utilizzo della CPU.

Criteri ProMQL: avg({__name__="TaskCpuUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name"}) > 80

Soglia consigliata: 80 (incorporata nella query)

Giustificazione della soglia: l'80% fornisce un margine di manovra prima della saturazione.

Intervallo di valutazione: 60

Periodo in sospeso: 300

Periodo di recupero: 300

TaskCpuUtilization (livello di servizio)

Etichette: ClusterName, ServiceName

Descrizione dell'allarme: allarme quando l'utilizzo medio della CPU dell'attività supera l'80% a livello di servizio.

Intento: rilevare un elevato utilizzo della CPU.

Criteri ProMQL: avg({__name__="TaskCpuUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name",ServiceName="your-service-name"}) > 80

Soglia consigliata: 80 (incorporata nella query)

Giustificazione della soglia: l'80% fornisce un margine di manovra prima della saturazione.

Intervallo di valutazione: 60

Periodo in sospeso: 300

Periodo di recupero: 300

TaskMemoryUtilization (livello di cluster)

Etichette: ClusterName

Descrizione dell'allarme: allarme quando l'utilizzo medio della memoria delle attività supera l'80% a livello di cluster.

Intento: rilevare un utilizzo elevato della memoria.

Criteri ProMQL: avg({__name__="TaskMemoryUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name"}) > 80

Soglia consigliata: 80 (incorporata nella query)

Giustificazione della soglia: l'80% fornisce un margine di manovra prima della saturazione.

Intervallo di valutazione: 60

Periodo in sospeso: 300

Periodo di recupero: 300

TaskMemoryUtilization (livello di servizio)

Etichette: ClusterName, ServiceName

Descrizione dell'allarme: allarme quando l'utilizzo medio della memoria delle attività supera l'80% a livello di servizio.

Intento: rilevare un utilizzo elevato della memoria.

Criteri ProMQL: avg({__name__="TaskMemoryUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name",ServiceName="your-service-name"}) > 80

Soglia consigliata: 80 (incorporata nella query)

Giustificazione della soglia: l'80% fornisce un margine di manovra prima della saturazione.

Intervallo di valutazione: 60

Periodo in sospeso: 300

Periodo di recupero: 300

ContainerCpuUtilization (livello di cluster)

Etichette: ClusterName

Descrizione dell'allarme: allarme quando l'utilizzo medio della CPU del contenitore supera l'80% a livello di cluster.

Intento: rilevare un elevato utilizzo della CPU.

Criteri ProMQL: avg({__name__="ContainerCpuUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name"}) > 80

Soglia consigliata: 80 (incorporata nella query)

Giustificazione della soglia: l'80% fornisce un margine di manovra prima della saturazione.

Intervallo di valutazione: 60

Periodo in sospeso: 300

Periodo di recupero: 300

ContainerCpuUtilization (livello del contenitore)

Etichette: ContainerName, ClusterName, ServiceName

Descrizione dell'allarme: allarme quando l'utilizzo medio della CPU del contenitore supera l'80% a livello di contenitore.

Intento: rilevare un elevato utilizzo della CPU.

Criteri ProMQL: avg({__name__="ContainerCpuUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ContainerName="your-container-name",ClusterName="your-cluster-name",ServiceName="your-service-name"}) > 80

Soglia consigliata: 80 (incorporata nella query)

Giustificazione della soglia: l'80% fornisce un margine di manovra prima della saturazione.

Intervallo di valutazione: 60

Periodo in sospeso: 300

Periodo di recupero: 300

ContainerMemoryUtilization (livello di cluster)

Etichette: ClusterName

Descrizione dell'allarme: allarme quando l'utilizzo medio della memoria del contenitore supera l'80% a livello di cluster.

Intento: rilevare un utilizzo elevato della memoria.

Criteri ProMQL: avg({__name__="ContainerMemoryUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name"}) > 80

Soglia consigliata: 80 (incorporata nella query)

Giustificazione della soglia: l'80% fornisce un margine di manovra prima della saturazione.

Intervallo di valutazione: 60

Periodo in sospeso: 300

Periodo di recupero: 300

ContainerMemoryUtilization (livello del contenitore)

Etichette: ContainerName, ClusterName, ServiceName

Descrizione dell'allarme: allarme quando l'utilizzo medio della memoria del contenitore supera l'80% a livello di contenitore.

Intento: rilevare un utilizzo elevato della memoria.

Criteri ProMQL: avg({__name__="ContainerMemoryUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ContainerName="your-container-name",ClusterName="your-cluster-name",ServiceName="your-service-name"}) > 80

Soglia consigliata: 80 (incorporata nella query)

Giustificazione della soglia: l'80% fornisce un margine di manovra prima della saturazione.

Intervallo di valutazione: 60

Periodo in sospeso: 300

Periodo di recupero: 300

TaskEBSfilesystemUtilization

Etichette: ClusterName, ServiceName

Descrizione dell'allarme: allarme quando l'utilizzo medio del file system EBS supera l'80% per le attività.

Intento: rilevare un elevato utilizzo del file system EBS.

Criteri ProMQL: avg({__name__="TaskEBSfilesystemUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name",ServiceName="your-service-name"}) > 80

Soglia consigliata: 80 (incorporata nella query)

Giustificazione della soglia: l'80% fornisce un margine di manovra prima della saturazione.

Intervallo di valutazione: 60

Periodo in sospeso: 300

Periodo di recupero: 300

TaskEphemeralStorageUtilization (livello di cluster)

Etichette: ClusterName

Descrizione dell'allarme: allarme quando l'utilizzo medio temporaneo dello storage supera l'80% a livello di cluster.

Intento: rilevare un elevato utilizzo temporaneo dello storage.

Criteri ProMQL: avg({__name__="TaskEphemeralStorageUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name"}) > 80

Soglia consigliata: 80 (incorporata nella query)

Giustificazione della soglia: l'80% fornisce un margine di manovra prima della saturazione.

Intervallo di valutazione: 60

Periodo in sospeso: 300

Periodo di recupero: 300

TaskEphemeralStorageUtilization (livello di servizio)

Etichette: ClusterName, ServiceName

Descrizione dell'allarme: allarme quando l'utilizzo medio temporaneo dello storage supera l'80% a livello di servizio.

Intento: rilevare un elevato utilizzo temporaneo dello storage.

Criteri ProMQL: avg({__name__="TaskEphemeralStorageUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name",ServiceName="your-service-name"}) > 80

Soglia consigliata: 80 (incorporata nella query)

Giustificazione della soglia: l'80% fornisce un margine di manovra prima della saturazione.

Intervallo di valutazione: 60

Periodo in sospeso: 300

Periodo di recupero: 300

PercentIOLimit

Etichette: FileSystemId

Descrizione dell'allarme: allarme quando un file system EFS raggiunge il 100% del suo limite. I/O

Intento: rileva quando il file system raggiunge il limite. I/O

Criteri ProMQL: avg({__name__="PercentIOLimit", "@instrumentation.@name"="cloudwatch.aws/efs", FileSystemId="your-filesystem-id"}) >= 100

Soglia consigliata: 100 (incorporata nella query)

Giustificazione della soglia: al 100% il filesystem diventa un collo di bottiglia.

Intervallo di valutazione: 60

Periodo di attesa: 900

Periodo di recupero: 900

BurstCreditBalance

Etichette: FileSystemId

Descrizione dell'allarme: allarme quando il saldo del credito a raffica scende a zero per un file system EFS.

Intento: rilevare i crediti burst esauriti che causano un rallentamento del throughput.

Criteri ProMQL: avg({__name__="BurstCreditBalance", "@instrumentation.@name"="cloudwatch.aws/efs", FileSystemId="your-filesystem-id"}) <= 0

Soglia consigliata: 0 (incorporata nella query)

Giustificazione della soglia: zero crediti causa una riduzione della produttività.

Intervallo di valutazione: 60

Periodo di attesa: 900

Periodo di recupero: 900

node_cpu_utilization

Etichette: ClusterName

Descrizione dell'allarme: allarme quando l'utilizzo massimo della CPU supera l'80% sui nodi di lavoro EKS.

Intento: rileva una CPU elevata sui nodi di lavoro.

Criteri ProMQL: max({__name__="node_cpu_utilization", "@instrumentation.@name"="cloudwatch.aws/eks-containerinsights", ClusterName="your-cluster-name"}) > 80

Soglia consigliata: 80 (incorporata nella query)

Giustificazione della soglia: l'80% fornisce un margine di manovra prima della saturazione.

Intervallo di valutazione: 60

Periodo in sospeso: 300

Periodo di recupero: 300

node_filesystem_utilization

Etichette: ClusterName

Descrizione dell'allarme: allarme quando l'utilizzo massimo del file system supera la soglia sui nodi di lavoro EKS.

Intento: rilevare un elevato utilizzo del file system sui nodi di lavoro.

Criteri ProMQL: max({__name__="node_filesystem_utilization", "@instrumentation.@name"="cloudwatch.aws/eks-containerinsights", ClusterName="your-cluster-name"}) > THRESHOLD

Soglia consigliata: THRESHOLD (incorporata nella query)

Giustificazione della soglia: impostata in base alla capacità di archiviazione e ai modelli di utilizzo del nodo.

Intervallo di valutazione: 60

Periodo in sospeso: 300

Periodo di recupero: 300

node_memory_utilization

Etichette: ClusterName

Descrizione dell'allarme: allarme quando l'utilizzo massimo della memoria supera l'80% sui nodi di lavoro EKS.

Intento: rilevare una quantità elevata di memoria sui nodi di lavoro.

Criteri ProMQL: max({__name__="node_memory_utilization", "@instrumentation.@name"="cloudwatch.aws/eks-containerinsights", ClusterName="your-cluster-name"}) > 80

Soglia consigliata: 80 (incorporata nella query)

Giustificazione della soglia: l'80% fornisce un margine di manovra prima della saturazione.

Intervallo di valutazione: 60

Periodo in sospeso: 300

Periodo di recupero: 300

pod_cpu_utilization_over_pod_limit

Etichette: ClusterName, Namespace, Service

Descrizione dell'allarme: allarme quando l'utilizzo della CPU del pod supera l'80% del limite.

Intento: rileva i pod che si avvicinano ai limiti della CPU.

Criteri ProMQL: max({__name__="pod_cpu_utilization_over_pod_limit", "@instrumentation.@name"="cloudwatch.aws/eks-containerinsights", ClusterName="your-cluster-name",Namespace="your-namespace",Service="your-service"}) > 80

Soglia consigliata: 80 (incorporata nella query)

Giustificazione della soglia: l'80% offre un margine di manovra prima che si verifichi la limitazione.

Intervallo di valutazione: 60

Periodo in sospeso: 300

Periodo di recupero: 300

pod_memory_utilization_over_pod_limit

Etichette: ClusterName, Namespace, Service

Descrizione dell'allarme: allarme quando l'utilizzo della memoria del pod supera l'80% del limite.

Intento: rileva i pod che si avvicinano ai limiti di memoria.

Criteri ProMQL: max({__name__="pod_memory_utilization_over_pod_limit", "@instrumentation.@name"="cloudwatch.aws/eks-containerinsights", ClusterName="your-cluster-name",Namespace="your-namespace",Service="your-service"}) > 80

Soglia consigliata: 80 (incorporata nella query)

Giustificazione della soglia: l'80% offre un margine di manovra prima che si verifichi OOMkill.

Intervallo di valutazione: 60

Periodo in sospeso: 300

Periodo di recupero: 300

CPUUtilization

Etichette: CacheClusterId, CacheNodeId

Descrizione dell'allarme: allarme quando l'utilizzo medio della CPU supera la soglia per un ElastiCache nodo.

Intento: rileva una CPU elevata in tutta l'istanza.

Criteri ProMQL: avg({__name__="CPUUtilization", "@instrumentation.@name"="cloudwatch.aws/elasticache", CacheClusterId="your-cache-cluster-id",CacheNodeId="your-cache-node-id"}) > THRESHOLD

Soglia consigliata: THRESHOLD (incorporata nella query)

Giustificazione della soglia: impostata in base al tipo di nodo e alle caratteristiche del carico di lavoro.

Intervallo di valutazione: 60

Periodo in sospeso: 300

Periodo di recupero: 300

CurrConnections

Etichette: CacheClusterId, CacheNodeId

Descrizione dell'allarme: allarme quando il numero di connessioni supera la soglia per un ElastiCache nodo.

Intento: rileva un numero elevato di connessioni.

Criteri ProMQL: avg({__name__="CurrConnections", "@instrumentation.@name"="cloudwatch.aws/elasticache", CacheClusterId="your-cache-cluster-id",CacheNodeId="your-cache-node-id"}) > THRESHOLD

Soglia consigliata: THRESHOLD (incorporata nella query)

Giustificazione della soglia: impostata in base alle dimensioni previste del pool di connessioni e alle esigenze dell'applicazione.

Intervallo di valutazione: 60

Periodo in sospeso: 600

Periodo di recupero: 600

DatabaseMemoryUsagePercentage

Etichette: CacheClusterId

Descrizione dell'allarme: allarme quando l'utilizzo della memoria del database supera la soglia per un ElastiCache cluster.

Intento: rileva un utilizzo elevato della memoria per prevenire errori di scrittura.

Criteri ProMQL: avg({__name__="DatabaseMemoryUsagePercentage", "@instrumentation.@name"="cloudwatch.aws/elasticache", CacheClusterId="your-cache-cluster-id"}) > THRESHOLD

Soglia consigliata: THRESHOLD (incorporata nella query)

Giustificazione della soglia: impostata in base alla politica di sfratto e alla criticità dei dati.

Intervallo di valutazione: 60

Periodo in sospeso: 300

Periodo di recupero: 300

EngineCPUUtilization

Etichette: CacheClusterId

Descrizione dell'allarme: allarme quando l'utilizzo della CPU del motore Redis supera il 90% per un cluster. ElastiCache

Intento: rileva un elevato utilizzo della CPU del motore Redis.

Criteri ProMQL: avg({__name__="EngineCPUUtilization", "@instrumentation.@name"="cloudwatch.aws/elasticache", CacheClusterId="your-cache-cluster-id"}) > 90

Soglia consigliata: 90 (incorporata nella query)

Giustificazione della soglia: Redis è a thread singolo; un valore superiore al 90% indica una saturazione.

Intervallo di valutazione: 60

Periodo in sospeso: 300

Periodo di recupero: 300

ReplicationLag

Etichette: CacheClusterId

Descrizione dell'allarme: allarme quando il ritardo di replica supera la soglia per un cluster. ElastiCache

Intento: rilevare il ritardo di replica che influisce sulla coerenza dei dati.

Criteri ProMQL: avg({__name__="ReplicationLag", "@instrumentation.@name"="cloudwatch.aws/elasticache", CacheClusterId="your-cache-cluster-id"}) > THRESHOLD

Soglia consigliata: THRESHOLD (incorporata nella query)

Giustificazione della soglia: impostata in base alla tolleranza dell'applicazione per le letture obsolete.

Intervallo di valutazione: 60

Periodo di attesa: 900

Periodo di recupero: 900

GPUConnectivityCheckFailed

Etichette: InstanceId, eGPUID

Descrizione dell'allarme: allarme quando l'acceleratore Elastic Graphics perde la connettività all'istanza.

Intento: rilevare problemi di connettività all'acceleratore Elastic Graphics.

Criteri ProMQL: max({__name__="GPUConnectivityCheckFailed", "@instrumentation.@name"="cloudwatch.aws/elasticgpus", InstanceId="your-instance-id",EGPUId="your-egpu-id"}) > 0

Soglia consigliata: 0 (incorporata nella query)

Giustificazione della soglia: qualsiasi errore di connettività richiede un'indagine.

Intervallo di valutazione: 300

Periodo in sospeso: 900

Periodo di recupero: 900

GPUHealthCheckFailed

Etichette: InstanceId, eGPUID

Descrizione dell'allarme: avviso in caso di esito negativo di un controllo dello stato dell'acceleratore Elastic Graphics.

Intento: rilevare un acceleratore Elastic Graphics non funzionante.

Criteri ProMQL: max({__name__="GPUHealthCheckFailed", "@instrumentation.@name"="cloudwatch.aws/elasticgpus", InstanceId="your-instance-id",EGPUId="your-egpu-id"}) > 0

Soglia consigliata: 0 (incorporata nella query)

Giustificazione della soglia: gli errori del controllo dello stato indicano problemi con l'acceleratore.

Intervallo di valutazione: 300

Periodo in sospeso: 900

Periodo di recupero: 900

TargetErrorThrottledCount

Descrizione dell'allarme: allarme quando le chiamate agli obiettivi programmati vengono limitate.

Intento: rileva la limitazione del target che causa ritardi nella pianificazione.

Criteri ProMQL: sum({__name__="TargetErrorThrottledCount", "@instrumentation.@name"="cloudwatch.aws/scheduler"}) > 0

Soglia consigliata: 0 (incorporata nella query)

Giustificazione della soglia: qualsiasi limitazione indica problemi di capacità target.

Intervallo di valutazione: 60

Periodo di attesa: 900

Periodo di recupero: 900

InvocationThrottleCount

Descrizione dell'allarme: allarme quando le chiamate dello Scheduler vengono limitate.

Intento: rilevare la limitazione delle chiamate di Scheduler.

Criteri ProMQL: sum({__name__="InvocationThrottleCount", "@instrumentation.@name"="cloudwatch.aws/scheduler"}) > 0

Soglia consigliata: 0 (incorporata nella query)

Giustificazione della soglia: la limitazione ritarda le esecuzioni programmate.

Intervallo di valutazione: 60

Periodo di attesa: 900

Periodo di recupero: 900

InvocationDroppedCount

Descrizione dell'allarme: allarme quando le chiamate programmate vengono interrotte.

Intento: rileva le chiamate interrotte.

Criteri ProMQL: sum({__name__="InvocationDroppedCount", "@instrumentation.@name"="cloudwatch.aws/scheduler"}) > 0

Soglia consigliata: 0 (incorporata nella query)

Giustificazione della soglia: le chiamate interrotte rappresentano eventi programmati persi.

Intervallo di valutazione: 60

Periodo in sospeso: 60

Periodo di recupero: 60

InvocationsFailedToBeSentToDeadLetterCount

Descrizione dell'allarme: allarme quando le chiamate non riuscite non possono essere inviate alla coda delle lettere morte.

Intento: rilevare errori di consegna DLQ.

Criteri ProMQL: sum({__name__="InvocationsFailedToBeSentToDeadLetterCount", "@instrumentation.@name"="cloudwatch.aws/scheduler"}) > 0

Soglia consigliata: 0 (incorporata nella query)

Giustificazione della soglia: la mancata consegna del DLQ comporta la perdita delle informazioni sull'errore.

Intervallo di valutazione: 60

Periodo di attesa: 900

Periodo di recupero: 900

GetRecords.IteratorAgeMilliseconds

Etichette: StreamName

Descrizione dell'allarme: allarme quando l'età dell'iteratore consumer supera la soglia per uno stream Kinesis.

Intento: rilevare i dati che non rispettano il periodo di conservazione rischiando di perderli.

Criteri ProMQL: max({__name__="GetRecords.IteratorAgeMilliseconds", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="your-stream-name"}) > THRESHOLD

Soglia consigliata: THRESHOLD (incorporata nella query)

Giustificazione della soglia: impostata in base alla percentuale del periodo di conservazione dello stream.

Intervallo di valutazione: 60

Periodo di attesa: 900

Periodo di recupero: 900

GetRecords.Success

Etichette: StreamName

Descrizione dell'allarme: si attiva quando la percentuale di GetRecords successo scende al di sotto della soglia di uno stream Kinesis.

Intento: rilevare gli errori di recupero da parte dei consumatori.

Criteri ProMQL: avg({__name__="GetRecords.Success", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="your-stream-name"}) < THRESHOLD

Soglia consigliata: THRESHOLD (incorporata nella query)

Giustificazione della soglia: impostata in base alla percentuale di successo prevista.

Intervallo di valutazione: 60

Periodo in sospeso: 300

Periodo di recupero: 300

PutRecord.Success

Etichette: StreamName

Descrizione dell'allarme: si attiva quando la percentuale di PutRecord successo scende al di sotto della soglia di uno stream Kinesis.

Obiettivo: rilevare eventuali errori di ingestione da parte del produttore.

Criteri ProMQL: avg({__name__="PutRecord.Success", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="your-stream-name"}) < THRESHOLD

Soglia consigliata: THRESHOLD (incorporata nella query)

Giustificazione della soglia: impostata in base alla percentuale di successo prevista.

Intervallo di valutazione: 60

Periodo in sospeso: 300

Periodo di recupero: 300

PutRecords.FailedRecords

Etichette: StreamName

Descrizione dell'allarme: allarme quando le operazioni di batch put producono record non riusciti per uno stream Kinesis.

Intento: rilevare errori di batch put.

Criteri ProMQL: sum({__name__="PutRecords.FailedRecords", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="your-stream-name"}) > THRESHOLD

Soglia consigliata: THRESHOLD (incorporata nella query)

Giustificazione della soglia: impostata in base al numero di errori accettabile.

Intervallo di valutazione: 60

Periodo in sospeso: 300

Periodo di recupero: 300

ReadProvisionedThroughputExceeded

Etichette: StreamName

Descrizione dell'allarme: allarme quando le letture degli utenti superano il throughput previsto per uno stream Kinesis.

Intento: rilevare la limitazione della lettura da parte dei consumatori.

Criteri ProMQL: avg({__name__="ReadProvisionedThroughputExceeded", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="your-stream-name"}) > THRESHOLD

Soglia consigliata: THRESHOLD (incorporata nella query)

Giustificazione della soglia: qualsiasi limitazione prolungata indica il fabbisogno di capacità.

Intervallo di valutazione: 60

Periodo in sospeso: 300

Periodo di recupero: 300

SubscribeToShardEvent.MillisBehindLatest

Etichette: StreamName, ConsumerName

Descrizione dell'allarme: Allarme quando un consumatore che si affanna di più è in ritardo rispetto all'ultimo record.

Intento: rilevare un maggiore ritardo di elaborazione da parte dei consumatori.

Criteri ProMQL: avg({__name__="SubscribeToShardEvent.MillisBehindLatest", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="your-stream-name",ConsumerName="your-consumer-name"}) > THRESHOLD

Soglia consigliata: THRESHOLD (incorporata nella query)

Giustificazione della soglia: impostata in base a un ritardo di elaborazione accettabile.

Intervallo di valutazione: 60

Periodo in sospeso: 300

Periodo di recupero: 300

WriteProvisionedThroughputExceeded

Etichette: StreamName

Descrizione dell'allarme: allarme quando le scritture del produttore superano il throughput previsto per uno stream Kinesis.

Intento: rileva la limitazione della scrittura da parte del produttore.

Criteri ProMQL: avg({__name__="WriteProvisionedThroughputExceeded", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="your-stream-name"}) > THRESHOLD

Soglia consigliata: THRESHOLD (incorporata nella query)

Giustificazione della soglia: la limitazione prolungata indica il fabbisogno di capacità.

Intervallo di valutazione: 60

Periodo in sospeso: 300

Periodo di recupero: 300

ClaimedAccountConcurrency

Descrizione dell'allarme: allarme quando la concorrenza dichiarata dell'account supera la soglia.

Intento: rileva che l'account si avvicina alla quota di concorrenza.

Criteri ProMQL: max({__name__="ClaimedAccountConcurrency", "@instrumentation.@name"="cloudwatch.aws/lambda"}) > THRESHOLD

Soglia consigliata: THRESHOLD (incorporata nella query)

Giustificazione della soglia: impostata sulla percentuale del limite di concorrenza regionale.

Intervallo di valutazione: 60

Periodo in sospeso: 600

Periodo di recupero: 600

Errori

Etichette: FunctionName

Descrizione dell'allarme: allarme quando il conteggio degli errori di funzione supera la soglia per una funzione Lambda.

Intento: rilevare un numero elevato di errori di funzione.

Criteri ProMQL: sum({__name__="Errors", "@instrumentation.@name"="cloudwatch.aws/lambda", FunctionName="your-function-name"}) > THRESHOLD

Soglia consigliata: THRESHOLD (incorporata nella query)

Giustificazione della soglia: impostata in base al volume di errore accettabile.

Intervallo di valutazione: 60

Periodo in sospeso: 180

Periodo di recupero: 300

Throttles

Etichette: FunctionName

Descrizione dell'allarme: allarme quando le chiamate di funzione vengono limitate per una funzione Lambda.

Intento: rilevare la limitazione delle chiamate alla funzione.

Criteri ProMQL: sum({__name__="Throttles", "@instrumentation.@name"="cloudwatch.aws/lambda", FunctionName="your-function-name"}) > THRESHOLD

Soglia consigliata: THRESHOLD (incorporata nella query)

Giustificazione della soglia: la limitazione indica il raggiungimento del limite di concorrenza.

Intervallo di valutazione: 60

Periodo in sospeso: 300

Periodo di recupero: 300

Durata

Etichette: FunctionName

Descrizione dell'allarme: allarme quando la durata della funzione p90 supera la soglia per una funzione Lambda.

Intento: rileva le chiamate di funzioni di lunga durata.

Criteri ProMQL: histogram_quantile(0.9, {__name__="Duration", "@instrumentation.@name"="cloudwatch.aws/lambda", FunctionName="your-function-name"}) > THRESHOLD

Soglia consigliata: THRESHOLD (incorporata nella query)

Giustificazione della soglia: impostata in relazione al timeout della funzione.

Intervallo di valutazione: 60

Periodo di attesa: 900

Periodo di recupero: 900

ConcurrentExecutions

Etichette: FunctionName

Descrizione dell'allarme: allarme quando le esecuzioni simultanee superano la soglia per una funzione Lambda.

Intento: rilevare una funzione che si avvicina ai limiti di concorrenza.

Criteri ProMQL: max({__name__="ConcurrentExecutions", "@instrumentation.@name"="cloudwatch.aws/lambda", FunctionName="your-function-name"}) > THRESHOLD

Soglia consigliata: THRESHOLD (incorporata nella query)

Giustificazione della soglia: impostata sulla percentuale di concorrenza riservata.

Intervallo di valutazione: 60

Periodo in sospeso: 600

Periodo di recupero: 600

memory_utilization

Etichette: function_name

Descrizione dell'allarme: allarme quando l'utilizzo medio della memoria supera il 90% per una funzione Lambda.

Intento: rileva la funzione che si avvicina al limite di memoria configurato.

Criteri ProMQL: avg({__name__="memory_utilization", "@instrumentation.@name"="cloudwatch.aws/lambda-insights", function_name="your-function-name"}) > 90

Soglia consigliata: 90 (incorporata nella query)

Giustificazione della soglia: una soglia superiore al 90% comporta il rischio di esaurimento della memoria.

Intervallo di valutazione: 60

Periodo in sospeso: 600

Periodo di recupero: 600

ErrorPortAllocation

Etichette: NatGatewayId

Descrizione dell'allarme: allarme quando il gateway NAT non riesce ad allocare una porta per nuove connessioni.

Intento: rilevare gli errori di allocazione delle porte che impediscono nuove connessioni.

Criteri ProMQL: sum({__name__="ErrorPortAllocation", "@instrumentation.@name"="cloudwatch.aws/natgateway", NatGatewayId="your-nat-gateway-id"}) > 0

Soglia consigliata: 0 (incorporata nella query)

Giustificazione della soglia: qualsiasi errore di allocazione influisce sulla connettività.

Intervallo di valutazione: 60

Periodo di attesa: 900

Periodo di recupero: 900

PacketsDropCount

Etichette: NatGatewayId

Descrizione dell'allarme: allarme quando il gateway NAT rilascia pacchetti che superano la soglia.

Intento: rileva le cadute di pacchetti che indicano problemi di capacità o connettività.

Criteri ProMQL: sum({__name__="PacketsDropCount", "@instrumentation.@name"="cloudwatch.aws/natgateway", NatGatewayId="your-nat-gateway-id"}) > THRESHOLD

Soglia consigliata: THRESHOLD (incorporata nella query)

Giustificazione della soglia: impostata in base al tasso di caduta accettabile.

Intervallo di valutazione: 60

Periodo in sospeso: 300

Periodo di recupero: 300

PacketsDropped

Etichette: VpcId, VpcEndpointId,, EndpointType, SubnetId ServiceName

Descrizione dell'allarme: allarme quando un endpoint VPC rilascia pacchetti che superano la soglia.

Intento: rilevare un endpoint o un servizio endpoint non integro.

Criteri ProMQL: sum({__name__="PacketsDropped", "@instrumentation.@name"="cloudwatch.aws/privatelinkendpoints", VpcId="your-vpc-id",VpcEndpointId="your-vpc-endpoint-id",EndpointType="your-endpoint-type",SubnetId="your-subnet-id",ServiceName="your-service-name"}) > THRESHOLD

Soglia consigliata: THRESHOLD (incorporata nella query)

Giustificazione della soglia: impostata in base al tasso di caduta accettabile.

Intervallo di valutazione: 60

Periodo in sospeso: 300

Periodo di recupero: 300

RstPacketsSent

Etichette: ServiceId, LoadBalancerArn, Az

Descrizione dell'allarme: allarme quando la velocità dei pacchetti RST supera la soglia per un servizio endpoint.

Intento: rilevare obiettivi non integri del servizio endpoint.

Criteri ProMQL: sum({__name__="RstPacketsSent", "@instrumentation.@name"="cloudwatch.aws/privatelinkservices", ServiceId="SVC",LoadBalancerArn="LB",Az="AZ"}) > THRESHOLD

Soglia consigliata: THRESHOLD (incorporata nella query)

Giustificazione della soglia: impostata in base a una velocità di pacchetti RST accettabile.

Intervallo di valutazione: 60

Periodo in sospeso: 300

Periodo di recupero: 300

CPUUtilization

Etichette: DBInstanceIdentifier

Descrizione dell'allarme: allarme quando l'utilizzo medio della CPU supera il 90% per un'istanza RDS.

Intento: rileva una CPU elevata prevenendo il degrado delle prestazioni.

Criteri ProMQL: avg({__name__="CPUUtilization", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > 90

Soglia consigliata: 90 (incorporata nella query)

Giustificazione della soglia: il 90% indica una saturazione prossima.

Intervallo di valutazione: 60

Periodo in sospeso: 300

Periodo di recupero: 300

DatabaseConnections

Etichette: DBInstanceIdentifier

Descrizione dell'allarme: allarme quando le connessioni al database superano la soglia per un'istanza RDS.

Intento: impedire che le connessioni rifiutate raggiungano il limite massimo.

Criteri ProMQL: avg({__name__="DatabaseConnections", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > THRESHOLD

Soglia consigliata: THRESHOLD (incorporata nella query)

Giustificazione della soglia: impostata sulla percentuale del parametro max_connections.

Intervallo di valutazione: 60

Periodo in sospeso: 300

Periodo di recupero: 300

EBSByteBalance%

Etichette: DBInstanceIdentifier

Descrizione dell'allarme: allarme quando il saldo di byte EBS scende al di sotto del 10% per un'istanza RDS.

Intento: rilevare crediti a bassa produttività che causano strozzature.

Criteri ProMQL: avg({__name__="EBSByteBalance%", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) < 10

Soglia consigliata: 10 (incorporata nella query)

Giustificazione della soglia: al di sotto del 10% si rischia una degradazione della produttività.

Intervallo di valutazione: 60

Periodo in sospeso: 180

Periodo di recupero: 180

EBSIOBalance%

Etichette: DBInstanceIdentifier

Descrizione dell'allarme: allarme quando il saldo I/O di EBS scende al di sotto del 10% per un'istanza RDS.

Intento: rilevare crediti IOPS bassi che causano strozzature.

Criteri ProMQL: avg({__name__="EBSIOBalance%", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) < 10

Soglia consigliata: 10 (incorporata nella query)

Giustificazione della soglia: al di sotto del 10% si rischia una degradazione dell'IOPS.

Intervallo di valutazione: 60

Periodo in sospeso: 180

Periodo di recupero: 180

FreeableMemory

Etichette: DBInstanceIdentifier

Descrizione dell'allarme: allarme quando la memoria liberabile scende al di sotto della soglia per un'istanza RDS.

Intento: evitare che l'esaurimento della memoria causi il rifiuto delle connessioni.

Criteri ProMQL: avg({__name__="FreeableMemory", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) < THRESHOLD

Soglia consigliata: THRESHOLD (incorporata nella query)

Giustificazione della soglia: impostata in base alla memoria della classe di istanza.

Intervallo di valutazione: 60

Periodo di attesa: 900

Periodo di recupero: 900

FreeLocalStorage

Etichette: DBInstanceIdentifier

Descrizione dell'allarme: si attiva quando l'archiviazione locale gratuita scende al di sotto della soglia per un'istanza Aurora.

Intento: impedire l'esaurimento dello storage locale di Aurora.

Criteri ProMQL: avg({__name__="FreeLocalStorage", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) < THRESHOLD

Soglia consigliata: THRESHOLD (incorporata nella query)

Giustificazione della soglia: impostata in base al minimo richiesto per le operazioni.

Intervallo di valutazione: 60

Periodo in sospeso: 300

Periodo di recupero: 300

FreeStorageSpace

Etichette: DBInstanceIdentifier

Descrizione dell'allarme: allarme quando lo spazio di archiviazione libero scende al di sotto della soglia per un'istanza RDS.

Intento: prevenire i tempi di inattività completi dello storage.

Criteri ProMQL: min({__name__="FreeStorageSpace", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) < THRESHOLD

Soglia consigliata: THRESHOLD (incorporata nella query)

Giustificazione della soglia: impostata in base al tasso di crescita dello storage e alle dimensioni previste.

Intervallo di valutazione: 60

Periodo in sospeso: 300

Periodo di recupero: 300

MaximumUsedTransactionIDs

Etichette: DBInstanceIdentifier

Descrizione dell'allarme: allarme quando il numero massimo di ID di transazione utilizzati supera 1 miliardo per un'istanza RDS.

Intento: impedire la sovrapposizione degli ID delle transazioni PostgreSQL.

Criteri ProMQL: avg({__name__="MaximumUsedTransactionIDs", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > 1000000000

Soglia consigliata: 1000000000 (incorporata nella query)

Giustificazione della soglia: 1 miliardo indica un pericolo imminente.

Intervallo di valutazione: 60

Periodo in sospeso: 60

Periodo di recupero: 60

ReadLatency

Etichette: DBInstanceIdentifier

Descrizione dell'allarme: allarme quando la latenza di lettura di p90 supera la soglia per un'istanza RDS.

Intento: rileva un'elevata latenza di lettura che indica problemi con il disco.

Criteri ProMQL: histogram_quantile(0.9, {__name__="ReadLatency", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > THRESHOLD

Soglia consigliata: THRESHOLD (incorporata nella query)

Giustificazione della soglia: impostata in base alla latenza accettabile dell'applicazione.

Intervallo di valutazione: 60

Periodo in sospeso: 300

Periodo di recupero: 300

ReplicaLag

Etichette: DBInstanceIdentifier

Descrizione dell'allarme: allarme quando il ritardo di replica supera i 60 secondi per una replica di lettura RDS.

Intento: rilevare il ritardo nella replica con il rischio di perdita dei dati.

Criteri ProMQL: max({__name__="ReplicaLag", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > 60

Soglia consigliata: 60 (incorporata nella query)

Giustificazione della soglia: 60 secondi rappresentano un ritardo significativo per la maggior parte dei carichi di lavoro.

Intervallo di valutazione: 60

Periodo in sospeso: 600

Periodo di recupero: 600

WriteLatency

Etichette: DBInstanceIdentifier

Descrizione dell'allarme: allarme quando la latenza di scrittura p90 supera la soglia per un'istanza RDS.

Intento: rileva un'elevata latenza di scrittura che indica problemi con il disco.

Criteri ProMQL: histogram_quantile(0.9, {__name__="WriteLatency", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > THRESHOLD

Soglia consigliata: THRESHOLD (incorporata nella query)

Giustificazione della soglia: impostata in base alla latenza accettabile dell'applicazione.

Intervallo di valutazione: 60

Periodo in sospeso: 300

Periodo di recupero: 300

DBLoad

Etichette: DBInstanceIdentifier

Descrizione dell'allarme: allarme quando il carico medio del database supera la soglia per un'istanza RDS.

Intento: rilevare un carico elevato del database che riduce le prestazioni.

Criteri ProMQL: avg({__name__="DBLoad", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > THRESHOLD

Soglia consigliata: THRESHOLD (incorporata nella query)

Giustificazione della soglia: impostata su un numero multiplo del numero di vCPU.

Intervallo di valutazione: 60

Periodo di attesa: 900

Periodo di recupero: 900

AuroraVolumeBytesLeftTotal

Etichette: DBClusterIdentifier

Descrizione dell'allarme: si attiva quando i byte di archiviazione rimanenti del cluster Aurora scendono al di sotto della soglia.

Intento: impedire l'esaurimento dello storage del cluster Aurora.

Criteri ProMQL: avg({__name__="AuroraVolumeBytesLeftTotal", "@instrumentation.@name"="cloudwatch.aws/rds", DBClusterIdentifier="CLUSTER"}) < THRESHOLD

Soglia consigliata: THRESHOLD (incorporata nella query)

Giustificazione della soglia: impostata in base al tasso di crescita.

Intervallo di valutazione: 60

Periodo in sospeso: 300

Periodo di recupero: 300

AuroraBinlogReplicaLag

Etichette: DBClusterIdentifier

Descrizione dell'allarme: allarme quando il ritardo di replica di Aurora binlog indica uno stato di errore.

Intento: rilevare gli errori di replica delle istanze di writer.

Criteri ProMQL: avg({__name__="AuroraBinlogReplicaLag", "@instrumentation.@name"="cloudwatch.aws/rds", DBClusterIdentifier="CLUSTER"}) <= -1

Soglia consigliata: -1 (incorporata nella query)

Giustificazione della soglia: -1 indica lo stato di errore.

Intervallo di valutazione: 60

Periodo in sospeso: 120

Periodo di recupero: 120

BlockedTransactions

Etichette: DBInstanceIdentifier

Descrizione dell'allarme: allarme quando il conteggio delle transazioni bloccate supera la soglia per un'istanza RDS.

Intento: rilevare il blocco delle transazioni che causa un peggioramento delle prestazioni.

Criteri ProMQL: avg({__name__="BlockedTransactions", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > THRESHOLD

Soglia consigliata: THRESHOLD (incorporata nella query)

Giustificazione della soglia: impostata in base al numero di transazioni bloccate accettabile.

Intervallo di valutazione: 60

Periodo in sospeso: 300

Periodo di recupero: 300

BufferCacheHitRatio

Etichette: DBInstanceIdentifier

Descrizione dell'allarme: allarme quando l'hit ratio del buffer cache scende al di sotto dell'80% per un'istanza RDS.

Intento: rilevare una bassa efficienza della cache che causa una riduzione delle prestazioni.

Criteri ProMQL: avg({__name__="BufferCacheHitRatio", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) < 80

Soglia consigliata: 80 (incorporata nella query)

Giustificazione della soglia: inferiore all'80% indica un numero eccessivo di dischi I/O.

Intervallo di valutazione: 60

Periodo in sospeso: 600

Periodo di recupero: 600

EngineUptime

Etichette: DBClusterIdentifier

Descrizione dell'allarme: allarme quando il tempo di attività del motore scende a zero, indicando il riavvio dello scrittore Aurora.

Intento: rilevare i tempi di inattività o l'arresto anomalo dell'istanza di Aurora writer.

Criteri ProMQL: avg({__name__="EngineUptime", "@instrumentation.@name"="cloudwatch.aws/rds", DBClusterIdentifier="CLUSTER"}) <= 0

Soglia consigliata: 0 (incorporata nella query)

Giustificazione della soglia: il tempo di attività zero indica il riavvio dell'istanza.

Intervallo di valutazione: 60

Periodo in sospeso: 120

Periodo di recupero: 120

RollbackSegmentHistoryListLength

Etichette: DBInstanceIdentifier

Descrizione dell'allarme: si attiva quando la lunghezza dell'elenco della cronologia dei segmenti di rollback supera 1 milione per un'istanza Aurora.

Intento: rileva una cronologia di rollback elevata che causa il degrado della CPU.

Criteri ProMQL: avg({__name__="RollbackSegmentHistoryListLength", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > 1000000

Soglia consigliata: 1000000 (incorporata nella query)

Giustificazione della soglia: una soglia superiore a 1 milione causa problemi di prestazioni.

Intervallo di valutazione: 60

Periodo in sospeso: 300

Periodo di recupero: 300

StorageNetworkThroughput

Etichette: DBClusterIdentifier

Descrizione dell'allarme: allarme quando il throughput della rete di storage supera la soglia per un cluster Aurora.

Intento: rilevare un throughput elevato con il rischio di interruzioni dei pacchetti di rete.

Criteri ProMQL: avg({__name__="StorageNetworkThroughput", "@instrumentation.@name"="cloudwatch.aws/rds", DBClusterIdentifier="CLUSTER"}) > THRESHOLD

Soglia consigliata: THRESHOLD (incorporata nella query)

Giustificazione della soglia: impostata in base alla capacità di rete dell'istanza.

Intervallo di valutazione: 60

Periodo in sospeso: 300

Periodo di recupero: 300

HealthCheckStatus

Etichette: HealthCheckId

Descrizione dell'allarme: allarme quando un controllo dello stato di Route 53 riporta un endpoint non integro.

Intento: rilevare gli endpoint non integri utilizzando gli strumenti di controllo dello stato di Route 53.

Criteri ProMQL: avg({__name__="HealthCheckStatus", "@instrumentation.@name"="cloudwatch.aws/route53", HealthCheckId="HC"}) < 1

Soglia consigliata: 1 (incorporata nella query)

Giustificazione della soglia: un valore inferiore a 1 indica che l'endpoint non supera i controlli sanitari.

Intervallo di valutazione: 60

Periodo in sospeso: 180

Periodo di recupero: 180

4xxErrors

Etichette: BucketName, FilterId

Descrizione dell'allarme: allarme quando il tasso di errore 4xx supera il 5% per un bucket S3.

Intento: rilevare tassi di errore anomali dei clienti.

Criteri ProMQL: avg({__name__="4xxErrors", "@instrumentation.@name"="cloudwatch.aws/s3", BucketName="BUCKET",FilterId="FILTER"}) > 0.05

Soglia consigliata: 0,05 (incorporata nella query)

Giustificazione della soglia: un valore superiore al 5% indica problemi di configurazione o accesso.

Intervallo di valutazione: 60

Periodo di attesa: 900

Periodo di recupero: 900

5xxErrors

Etichette: BucketName, FilterId

Descrizione dell'allarme: allarme quando il tasso di errore 5xx supera il 5% per un bucket S3.

Intento: rilevare gli errori sul lato server che riguardano l'applicazione.

Criteri ProMQL: avg({__name__="5xxErrors", "@instrumentation.@name"="cloudwatch.aws/s3", BucketName="BUCKET",FilterId="FILTER"}) > 0.05

Soglia consigliata: 0,05 (incorporata nella query)

Giustificazione della soglia: un valore superiore al 5% indica problemi con il servizio S3.

Intervallo di valutazione: 60

Periodo di attesa: 900

Periodo di recupero: 900

OperationsFailedReplication

Etichette: SourceBucket, DestinationBucket, RuleId

Descrizione dell'allarme: allarme quando le operazioni di replica S3 falliscono per un bucket.

Intento: rilevare gli errori di replica che rischiano l'incoerenza dei dati.

Criteri ProMQL: max({__name__="OperationsFailedReplication", "@instrumentation.@name"="cloudwatch.aws/s3", SourceBucket="SRC",DestinationBucket="DST",RuleId="RULE"}) > 0

Soglia consigliata: 0 (incorporata nella query)

Giustificazione della soglia: qualsiasi replica non riuscita richiede un'indagine.

Intervallo di valutazione: 60

Periodo in sospeso: 300

Periodo di recupero: 300

4xxErrors

Etichette: AccessPointName, DataSource ARN

Descrizione dell'allarme: allarme quando il tasso di errore 4xx supera il 5% per un access point S3 Object Lambda.

Intento: rileva tassi di errore anomali dei client per Object Lambda.

Criteri ProMQL: avg({__name__="4xxErrors", "@instrumentation.@name"="cloudwatch.aws/s3objectlambda", AccessPointName="AP",DataSourceARN="ARN"}) > 0.05

Soglia consigliata: 0,05 (incorporata nella query)

Giustificazione della soglia: un valore superiore al 5% indica problemi di configurazione.

Intervallo di valutazione: 60

Periodo di attesa: 900

Periodo di recupero: 900

5xxErrors

Etichette: AccessPointName, DataSource ARN

Descrizione dell'allarme: allarme quando il tasso di errore 5xx supera il 5% per un access point S3 Object Lambda.

Intento: rileva gli errori sul lato server in Object Lambda.

Criteri ProMQL: avg({__name__="5xxErrors", "@instrumentation.@name"="cloudwatch.aws/s3objectlambda", AccessPointName="AP",DataSourceARN="ARN"}) > 0.05

Soglia consigliata: 0,05 (incorporata nella query)

Giustificazione della soglia: un valore superiore al 5% indica problemi relativi a Lambda o S3.

Intervallo di valutazione: 60

Periodo di attesa: 900

Periodo di recupero: 900

LambdaResponse4xx

Etichette: AccessPointName, DataSource ARN

Descrizione dell'allarme: allarme quando il tasso di risposta della funzione Lambda 4xx supera il 5% per un access point S3 Object Lambda.

Intento: rilevare gli errori del client della funzione Lambda.

Criteri ProMQL: avg({__name__="LambdaResponse4xx", "@instrumentation.@name"="cloudwatch.aws/s3objectlambda", AccessPointName="AP",DataSourceARN="ARN"}) > 0.05

Soglia consigliata: 0,05 (incorporata nella query)

Giustificazione della soglia: un valore superiore al 5% indica problemi relativi alla funzione Lambda.

Intervallo di valutazione: 60

Periodo di attesa: 900

Periodo di recupero: 900

NumberOfMessagesPublished

Etichette: TopicName

Descrizione dell'allarme: avviso quando il numero di messaggi pubblicati scende al di sotto della soglia per un argomento SNS.

Intento: rileva un calo significativo del volume di pubblicazione.

Criteri ProMQL: sum({__name__="NumberOfMessagesPublished", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) < THRESHOLD

Soglia consigliata: THRESHOLD (incorporata nella query)

Giustificazione della soglia: impostata in base al traffico minimo previsto.

Intervallo di valutazione: 60

Periodo in sospeso: 300

Periodo di recupero: 300

NumberOfNotificationsDelivered

Etichette: TopicName

Descrizione dell'allarme: allarme quando il numero di notifiche inviate scende al di sotto della soglia per un argomento SNS.

Intento: rileva un calo del volume di invio delle notifiche.

Criteri ProMQL: sum({__name__="NumberOfNotificationsDelivered", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) < THRESHOLD

Soglia consigliata: THRESHOLD (incorporata nella query)

Giustificazione della soglia: impostata in base alle consegne minime previste.

Intervallo di valutazione: 60

Periodo in sospeso: 300

Periodo di recupero: 300

NumberOfNotificationsFailed

Etichette: TopicName

Descrizione dell'allarme: allarme quando il numero di notifiche non riuscite a recapitare supera la soglia per un argomento SNS.

Intento: rilevare gli errori di consegna.

Criteri ProMQL: sum({__name__="NumberOfNotificationsFailed", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) > THRESHOLD

Soglia consigliata: THRESHOLD (incorporata nella query)

Giustificazione della soglia: impostata in base al tasso di errore accettabile.

Intervallo di valutazione: 60

Periodo in sospeso: 300

Periodo di recupero: 300

NumberOfNotificationsFilteredOut-InvalidAttributes

Etichette: TopicName

Descrizione dell'allarme: allarme quando le notifiche vengono filtrate a causa di attributi del messaggio non validi.

Intento: rileva gli attributi dei messaggi non validi.

Criteri ProMQL: sum({__name__="NumberOfNotificationsFilteredOut-InvalidAttributes", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) > 0

Soglia consigliata: 0 (incorporata nella query)

Giustificazione della soglia: qualsiasi filtro non valido indica una configurazione errata.

Intervallo di valutazione: 60

Periodo in sospeso: 300

Periodo di recupero: 300

NumberOfNotificationsFilteredOut-InvalidMessageBody

Etichette: TopicName

Descrizione dell'allarme: allarme quando le notifiche vengono filtrate a causa di messaggi non validi.

Intento: rileva i corpi dei messaggi non validi.

Criteri ProMQL: sum({__name__="NumberOfNotificationsFilteredOut-InvalidMessageBody", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) > 0

Soglia consigliata: 0 (incorporata nella query)

Giustificazione della soglia: qualsiasi filtro non valido indica una configurazione errata.

Intervallo di valutazione: 60

Periodo in sospeso: 300

Periodo di recupero: 300

NumberOfNotificationsRedrivenToDlq

Etichette: TopicName

Descrizione dell'allarme: allarme quando le notifiche vengono inviate alla coda delle lettere morte per un argomento SNS.

Intento: rileva i messaggi inviati alla coda delle lettere morte.

Criteri ProMQL: sum({__name__="NumberOfNotificationsRedrivenToDlq", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) > 0

Soglia consigliata: 0 (incorporata nella query)

Giustificazione della soglia: qualsiasi messaggio DLQ indica problemi di consegna.

Intervallo di valutazione: 60

Periodo in sospeso: 300

Periodo di recupero: 300

NumberOfNotificationsFailedToRedriveToDlq

Etichette: TopicName

Descrizione dell'allarme: allarme quando le notifiche non vengono inviate alla coda delle lettere morte per un argomento SNS.

Intento: rilevare errori di consegna DLQ.

Criteri ProMQL: sum({__name__="NumberOfNotificationsFailedToRedriveToDlq", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) > 0

Soglia consigliata: 0 (incorporata nella query)

Giustificazione della soglia: un DLQ non riuscito significa perdita del tracciamento degli errori.

Intervallo di valutazione: 60

Periodo di attesa: 300

Periodo di recupero: 300

SMSMonthToDateSpentUSD

Etichette: TopicName

Descrizione dell'allarme: allarme quando la spesa via SMS si avvicina alla quota dell'account per un argomento SNS.

Intento: rileva che la spesa per SMS si avvicina alla quota.

Criteri ProMQL: max({__name__="SMSMonthToDateSpentUSD", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) > THRESHOLD

Soglia consigliata: THRESHOLD (incorporata nella query)

Giustificazione della soglia: impostata in base alla quota SMS dell'account.

Intervallo di valutazione: 60

Periodo in sospeso: 300

Periodo di recupero: 300

SMSSuccessRate

Etichette: TopicName

Descrizione dell'allarme: allarme quando la percentuale di successo della consegna degli SMS scende al di sotto della soglia per un argomento SNS.

Intento: rilevare le consegne di SMS non riuscite.

Criteri ProMQL: avg({__name__="SMSSuccessRate", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) < THRESHOLD

Soglia consigliata: THRESHOLD (incorporata nella query)

Giustificazione della soglia: impostata in base a un tasso di consegna accettabile.

Intervallo di valutazione: 60

Periodo in sospeso: 300

Periodo di recupero: 300

ApproximateAgeOfOldestMessage

Etichette: QueueName

Descrizione dell'allarme: allarme quando l'età del messaggio più vecchio supera la soglia per una coda SQS.

Intento: rileva i messaggi che non vengono elaborati con sufficiente rapidità.

Criteri ProMQL: max({__name__="ApproximateAgeOfOldestMessage", "@instrumentation.@name"="cloudwatch.aws/sqs", QueueName="QUEUE"}) > THRESHOLD

Soglia consigliata: THRESHOLD (incorporata nella query)

Giustificazione della soglia: impostata in base al tempo di elaborazione dei messaggi accettabile.

Intervallo di valutazione: 60

Periodo di attesa: 900

Periodo di recupero: 900

ApproximateNumberOfMessagesNotVisible

Etichette: QueueName

Descrizione dell'allarme: allarme quando il numero di messaggi in volo supera la soglia per una coda SQS.

Intento: rilevare i messaggi in volo ad alta frequenza che indicano problemi con i consumatori.

Criteri ProMQL: avg({__name__="ApproximateNumberOfMessagesNotVisible", "@instrumentation.@name"="cloudwatch.aws/sqs", QueueName="QUEUE"}) > THRESHOLD

Soglia consigliata: THRESHOLD (incorporata nella query)

Giustificazione della soglia: impostata in base al volume di elaborazione previsto.

Intervallo di valutazione: 60

Periodo di attesa: 900

Periodo di recupero: 900

ApproximateNumberOfMessagesVisible

Etichette: QueueName

Descrizione dell'allarme: allarme quando il numero di messaggi visibili supera la soglia per una coda SQS.

Intento: rilevare un arretrato di messaggi indicante la lentezza dei consumatori.

Criteri ProMQL: avg({__name__="ApproximateNumberOfMessagesVisible", "@instrumentation.@name"="cloudwatch.aws/sqs", QueueName="QUEUE"}) > THRESHOLD

Soglia consigliata: THRESHOLD (incorporata nella query)

Giustificazione della soglia: impostata in base alla profondità della coda prevista.

Intervallo di valutazione: 60

Periodo di attesa: 900

Periodo di recupero: 900

NumberOfMessagesSent

Etichette: QueueName

Descrizione dell'allarme: allarme quando nessun messaggio viene inviato a una coda SQS.

Intento: rilevare che i produttori hanno smesso di inviare messaggi.

Criteri ProMQL: sum({__name__="NumberOfMessagesSent", "@instrumentation.@name"="cloudwatch.aws/sqs", QueueName="QUEUE"}) <= 0

Soglia consigliata: 0 (incorporata nella query)

Giustificazione della soglia: zero messaggi indica un errore del produttore.

Intervallo di valutazione: 60

Periodo di attesa: 900

Periodo di recupero: 900

TunnelState (livello VPN)

Etichette: VpnId

Descrizione dell'allarme: allarme quando almeno un tunnel VPN è in stato DOWN.

Intento: rileva almeno un tunnel in stato DOWN.

Criteri ProMQL: min({__name__="TunnelState", "@instrumentation.@name"="cloudwatch.aws/vpn", VpnId="VPN"}) < 1

Soglia consigliata: 1 (incorporata nella query)

Giustificazione della soglia: un valore inferiore a 1 indica che il tunnel non è attivo.

Intervallo di valutazione: 300

Periodo in sospeso: 900

Periodo di recupero: 900

TunnelState (Livello del tunnel)

Etichette: TunnelIpAddress

Descrizione dell'allarme: allarme quando uno specifico tunnel VPN è in stato DOWN.

Intento: rileva un tunnel specifico in stato DOWN.

Criteri ProMQL: min({__name__="TunnelState", "@instrumentation.@name"="cloudwatch.aws/vpn", TunnelIpAddress="IP"}) < 1

Soglia consigliata: 1 (incorporata nella query)

Giustificazione della soglia: un valore inferiore a 1 indica che il tunnel non è attivo.

Intervallo di valutazione: 300

Periodo in sospeso: 900

Periodo di recupero: 900