Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.
Allarmi ProMQL consigliati
Usa questi allarmi ProMQL come equivalenti dei classici allarmi consigliati. Monitorano le stesse metriche utilizzando le query istantanee ProMQL che vengono valutate rispetto alle metriche inserite tramite l'endpoint OTLP. CloudWatch
Gli EvaluationCriteria PromQLCriteria allarmi ProMQL vengono utilizzati con. A differenza dei classici allarmi metrici, la soglia è incorporata direttamente nell'espressione di query ProMQL.
-
Periodo in sospeso: la durata in secondi che una serie temporale deve superare continuamente prima che l'allarme passi allo stato ALARM.
-
Periodo di ripristino: la durata in secondi in cui tutte le serie temporali devono cessare di superare prima che l'allarme ritorni allo stato OK.
-
Intervallo di valutazione: con quale frequenza, in secondi, CloudWatch viene eseguita la query ProMQL.
Nota
Questi allarmi richiedono metriche pubblicate tramite l'endpoint OTLP. CloudWatch Per ulteriori informazioni, consulta Allarmi ProMQL.
È possibile distribuire questi allarmi utilizzando. AWS CloudFormation Usa le PromQLCriteria proprietà EvaluationCriteria and sulla risorsa. AWS::CloudWatch::Alarm
Argomenti
Gateway API
API REST
- 4XXError
-
Etichette: ApiName, Stage
Descrizione dell'allarme: allarme quando il tasso medio di errore 4XX supera il 5% per una fase dell'API REST.
Intento: rileva un elevato tasso di errore del cliente che indica problemi relativi alle richieste.
Criteri ProMQL:
avg({__name__="4XXError", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiName="your-api-name",Stage="your-stage"}) > 0.05Soglia consigliata: 0,05 (incorporata nella query)
Giustificazione della soglia: rileva un tasso di errore del cliente superiore al 5%, il che indica errori significativi nelle richieste.
Intervallo di valutazione: 60
Periodo in sospeso: 300
Periodo di recupero: 300
- 5XXError
-
Etichette: ApiName, Stage
Descrizione dell'allarme: allarme quando il tasso medio di errore 5XX supera il 5% per una fase dell'API REST.
Intento: rileva un elevato tasso di errore del server che indica errori di backend.
Criteri ProMQL:
avg({__name__="5XXError", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiName="your-api-name",Stage="your-stage"}) > 0.05Soglia consigliata: 0,05 (incorporata nella query)
Giustificazione della soglia: rileva un tasso di errore del server superiore al 5%, che richiede un'indagine immediata.
Intervallo di valutazione: 60
Periodo in sospeso: 180
Periodo di recupero: 300
- Latenza
-
Etichette: ApiName, Stage
Descrizione dell'allarme: allarme quando la latenza p90 supera i 2500 ms per una fase dell'API REST.
Intento: rilevare un'elevata latenza p90 che influisce sull'esperienza utente.
Criteri ProMQL:
histogram_quantile(0.9, {__name__="Latency", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiName="your-api-name",Stage="your-stage"}) > 2500Soglia consigliata: 2500 (incorporata nella query)
Giustificazione della soglia: una latenza p90 superiore a 2500 ms indica tempi di risposta ridotti per la maggior parte delle richieste.
Intervallo di valutazione: 60
Periodo in sospeso: 300
Periodo di recupero: 300
- Conteggio
-
Etichette: ApiName, Stage
Descrizione dell'allarme: allarme quando il numero totale di richieste scende al di sotto della linea di base prevista per una fase dell'API REST.
Intento: rileva un volume di traffico basso che potrebbe indicare problemi di routing o disponibilità.
Criteri ProMQL:
sum({__name__="Count", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiName="your-api-name",Stage="your-stage"}) <THRESHOLDSoglia consigliata:
THRESHOLD(incorporata nella query)Giustificazione della soglia: impostata in base alla linea di base del traffico prevista per rilevare cali imprevisti.
Intervallo di valutazione: 60
Periodo in sospeso: 600
Periodo di recupero: 300
API HTTP
- 4xx
-
Etichette: ApiId, Stage
Descrizione dell'allarme: allarme quando il tasso medio di errore 4xx supera il 5% per una fase dell'API HTTP.
Intento: rileva un elevato tasso di errore dei client sugli endpoint dell'API HTTP.
Criteri ProMQL:
avg({__name__="4xx", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="your-api-id",Stage="your-stage"}) > 0.05Soglia consigliata: 0,05 (incorporata nella query)
Giustificazione della soglia: rileva un tasso di errore del cliente superiore al 5%.
Intervallo di valutazione: 60
Periodo in sospeso: 300
Periodo di recupero: 300
- 5xx
-
Etichette: ApiId, Stage
Descrizione dell'allarme: allarme quando il tasso medio di errore 5xx supera il 5% per una fase dell'API HTTP.
Intento: rileva un elevato tasso di errore del server sugli endpoint dell'API HTTP.
Criteri ProMQL:
avg({__name__="5xx", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="your-api-id",Stage="your-stage"}) > 0.05Soglia consigliata: 0,05 (incorporata nella query)
Giustificazione della soglia: rileva un tasso di errore del server superiore al 5% che richiede un'indagine.
Intervallo di valutazione: 60
Periodo in sospeso: 180
Periodo di recupero: 300
- Latenza
-
Etichette: ApiId, Stage
Descrizione dell'allarme: allarme quando la latenza p90 supera i 2500 ms per una fase di API HTTP.
Intento: rileva una latenza p90 elevata sugli endpoint dell'API HTTP.
Criteri ProMQL:
histogram_quantile(0.9, {__name__="Latency", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="your-api-id",Stage="your-stage"}) > 2500Soglia consigliata: 2500 (incorporata nella query)
Giustificazione della soglia: una latenza p90 superiore a 2500 ms indica tempi di risposta ridotti.
Intervallo di valutazione: 60
Periodo in sospeso: 300
Periodo di recupero: 300
- IntegrationLatency
-
Etichette: ApiId, Stage
Descrizione dell'allarme: allarme quando la latenza di integrazione p90 supera i 2000 ms per una fase di API HTTP.
Intento: rileva un'elevata latenza di integrazione del backend che influisce sui tempi di risposta.
Criteri ProMQL:
histogram_quantile(0.9, {__name__="IntegrationLatency", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="your-api-id",Stage="your-stage"}) > 2000Soglia consigliata: 2000 (incorporata nella query)
Giustificazione della soglia: una latenza di integrazione p90 superiore a 2000 ms indica una lentezza del backend.
Intervallo di valutazione: 60
Periodo in sospeso: 300
Periodo di recupero: 300
- Conteggio
-
Etichette: ApiId, Stage
Descrizione dell'allarme: avviso quando il numero totale di richieste scende al di sotto della linea di base prevista per una fase dell'API HTTP.
Intento: rileva un volume di traffico basso che potrebbe indicare problemi di routing o disponibilità.
Criteri ProMQL:
sum({__name__="Count", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="your-api-id",Stage="your-stage"}) <THRESHOLDSoglia consigliata:
THRESHOLD(incorporata nella query)Giustificazione della soglia: impostata in base alla linea di base del traffico prevista per rilevare cali imprevisti.
Intervallo di valutazione: 60
Periodo in sospeso: 600
Periodo di recupero: 300
WebSocket API
- ClientError
-
Etichette: ApiId, Stage
Descrizione dell'allarme: allarme quando il tasso medio di errore del client supera il 5% per una fase WebSocket API.
Intento: rileva un elevato tasso di errore del cliente sulle connessioni WebSocket API.
Criteri ProMQL:
avg({__name__="ClientError", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="your-api-id",Stage="your-stage"}) > 0.05Soglia consigliata: 0,05 (incorporata nella query)
Giustificazione della soglia: rileva un tasso di errore del client superiore al 5% sulle connessioni. WebSocket
Intervallo di valutazione: 60
Periodo in sospeso: 300
Periodo di recupero: 300
- ExecutionError
-
Etichette: ApiId, Stage
Descrizione dell'allarme: allarme quando il tasso medio di errore di esecuzione supera il 5% per una fase WebSocket API.
Intento: rileva un elevato tasso di errore di esecuzione lato server sulle API. WebSocket
Criteri ProMQL:
avg({__name__="ExecutionError", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="your-api-id",Stage="your-stage"}) > 0.05Soglia consigliata: 0,05 (incorporata nella query)
Giustificazione della soglia: rileva un tasso di errore di esecuzione superiore al 5% che richiede un'indagine.
Intervallo di valutazione: 60
Periodo in sospeso: 180
Periodo di recupero: 300
- IntegrationLatency
-
Etichette: ApiId, Stage
Descrizione dell'allarme: allarme quando la latenza di integrazione p90 supera i 2000 ms per una WebSocket fase API.
Intento: rileva un'elevata latenza di integrazione del backend sulle route delle API. WebSocket
Criteri ProMQL:
histogram_quantile(0.9, {__name__="IntegrationLatency", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="your-api-id",Stage="your-stage"}) > 2000Soglia consigliata: 2000 (incorporata nella query)
Giustificazione della soglia: una latenza di integrazione p90 superiore a 2000 ms indica una lentezza del backend.
Intervallo di valutazione: 60
Periodo in sospeso: 300
Periodo di recupero: 300
- MessageCount
-
Etichette: ApiId, Stage
Descrizione dell'allarme: avviso quando il numero totale dei messaggi scende al di sotto della linea di base prevista per una fase WebSocket API.
Intento: rilevare un volume di messaggi basso che potrebbe indicare problemi di connessione o routing.
Criteri ProMQL:
sum({__name__="MessageCount", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="your-api-id",Stage="your-stage"}) <THRESHOLDSoglia consigliata:
THRESHOLD(incorporata nella query)Giustificazione della soglia: impostata in base al volume di messaggi previsto per rilevare cali imprevisti.
Intervallo di valutazione: 60
Periodo in sospeso: 600
Periodo di recupero: 300
Auto Scaling
- GroupInServiceCapacity
-
Etichette: AutoScalingGroupName
Descrizione dell'allarme: si attiva quando la capacità media in servizio scende al di sotto del minimo previsto per un gruppo Auto Scaling.
Intento: rilevare una bassa disponibilità dovuta a errori di avvio o istanze terminate.
Criteri ProMQL:
avg({__name__="GroupInServiceCapacity", "@instrumentation.@name"="cloudwatch.aws/autoscaling", AutoScalingGroupName="your-auto-scaling-group-name"}) <THRESHOLDSoglia consigliata:
THRESHOLD(incorporata nella query)Giustificazione della soglia: impostata in base alla capacità minima desiderata per rilevare errori di avvio o istanze insufficienti.
Intervallo di valutazione: 60
Periodo in sospeso: 600
Periodo di recupero: 600
Gestore dei certificati
- DaysToExpiry
-
Etichette: CertificateArn
Descrizione dell'allarme: avviso quando il periodo minimo di scadenza del certificato scende a 44 giorni o meno.
Intento: avviso proattivo di scadenza del certificato per consentire il rinnovo.
Criteri ProMQL:
min({__name__="DaysToExpiry", "@instrumentation.@name"="cloudwatch.aws/certificatemanager", CertificateArn="your-certificate-arn"}) <= 44Soglia consigliata: 44 (incorporata nella query)
Giustificazione della soglia: fornisce un lasso di tempo sufficiente prima della scadenza del certificato per completare il processo di rinnovo.
Intervallo di valutazione: 86400
Periodo in sospeso: 86400
Periodo di recupero: 86400
CloudFront
- 5xxErrorRate
-
Etichette: DistributionId
Descrizione dell'allarme: allarme quando il tasso di errore medio di 5xx supera la soglia per una CloudFront distribuzione.
Intento: rileva un'origine o un tasso di CloudFront errore elevato che influisce sulla distribuzione dei contenuti.
Criteri ProMQL:
avg({__name__="5xxErrorRate", "@instrumentation.@name"="cloudwatch.aws/cloudfront", DistributionId="your-distribution-id"}) >THRESHOLDSoglia consigliata:
THRESHOLD(incorporata nella query)Giustificazione della soglia: impostata in base al tasso di errore accettabile per la distribuzione dei contenuti.
Intervallo di valutazione: 60
Periodo in sospeso: 300
Periodo di recupero: 300
- OriginLatency
-
Etichette: DistributionId
Descrizione dell'allarme: allarme quando la latenza di origine p90 supera la soglia per una distribuzione. CloudFront
Intento: rileva un'elevata latenza di risposta all'origine che influisce sulle prestazioni di distribuzione dei contenuti.
Criteri ProMQL:
histogram_quantile(0.9, {__name__="OriginLatency", "@instrumentation.@name"="cloudwatch.aws/cloudfront", DistributionId="your-distribution-id"}) >THRESHOLDSoglia consigliata:
THRESHOLD(incorporata nella query)Giustificazione della soglia: impostata in base al tempo di risposta di origine previsto e alla strategia di memorizzazione nella cache.
Intervallo di valutazione: 60
Periodo in sospeso: 300
Periodo di recupero: 300
- FunctionValidationErrors
-
Etichette: DistributionId, FunctionName
Descrizione dell'allarme: allarme quando si verificano errori di convalida della CloudFront funzione.
Intento: rileva gli errori di convalida delle CloudFront funzioni che ne impediscono l'esecuzione.
Criteri ProMQL:
sum({__name__="FunctionValidationErrors", "@instrumentation.@name"="cloudwatch.aws/cloudfront", DistributionId="your-distribution-id",FunctionName="your-function-name"}) > 0Soglia consigliata: 0 (incorporata nella query)
Giustificazione della soglia: qualsiasi errore di convalida indica un problema di configurazione della funzione che richiede attenzione.
Intervallo di valutazione: 60
Periodo in sospeso: 120
Periodo di recupero: 120
- FunctionExecutionErrors
-
Etichette: DistributionId, FunctionName
Descrizione dell'allarme: allarme quando si verificano errori di esecuzione della CloudFront funzione.
Intento: rileva gli errori di runtime nelle CloudFront funzioni che influiscono sull'elaborazione delle richieste.
Criteri ProMQL:
sum({__name__="FunctionExecutionErrors", "@instrumentation.@name"="cloudwatch.aws/cloudfront", DistributionId="your-distribution-id",FunctionName="your-function-name"}) > 0Soglia consigliata: 0 (incorporata nella query)
Giustificazione della soglia: qualsiasi errore di esecuzione indica un problema di runtime nel codice della funzione.
Intervallo di valutazione: 60
Periodo in sospeso: 300
Periodo di recupero: 300
- FunctionThrottles
-
Etichette: DistributionId, FunctionName
Descrizione dell'allarme: Allarme in caso di limitazione di una CloudFront funzione.
Intento: rileva la limitazione delle CloudFront funzioni che potrebbe compromettere l'elaborazione delle richieste.
Criteri ProMQL:
sum({__name__="FunctionThrottles", "@instrumentation.@name"="cloudwatch.aws/cloudfront", DistributionId="your-distribution-id",FunctionName="your-function-name"}) > 0Soglia consigliata: 0 (incorporata nella query)
Giustificazione della soglia: qualsiasi limitazione indica che la funzione sta raggiungendo i limiti di calcolo.
Intervallo di valutazione: 60
Periodo in sospeso: 300
Periodo di recupero: 300
Cognito
- SignUpThrottles
-
Etichette: UserPool, UserPoolClient
Descrizione dell'allarme: allarme quando gli eventi di limitazione della registrazione superano la soglia per un pool di utenti.
Intento: rileva la limitazione delle iscrizioni che impedisce la registrazione di nuovi utenti.
Criteri ProMQL:
sum({__name__="SignUpThrottles", "@instrumentation.@name"="cloudwatch.aws/cognito", UserPool="your-user-pool",UserPoolClient="your-user-pool-client"}) >THRESHOLDSoglia consigliata:
THRESHOLD(incorporata nella query)Giustificazione della soglia: impostata in base alla velocità di accelerazione accettabile per le operazioni di registrazione.
Intervallo di valutazione: 60
Periodo in sospeso: 300
Periodo di recupero: 300
- SignInThrottles
-
Etichette: UserPool, UserPoolClient
Descrizione dell'allarme: allarme quando gli eventi di limitazione dell'accesso superano la soglia per un pool di utenti.
Intento: rileva la limitazione dell'accesso che impedisce l'autenticazione dell'utente.
Criteri ProMQL:
sum({__name__="SignInThrottles", "@instrumentation.@name"="cloudwatch.aws/cognito", UserPool="your-user-pool",UserPoolClient="your-user-pool-client"}) >THRESHOLDSoglia consigliata:
THRESHOLD(incorporata nella query)Giustificazione della soglia: impostata in base alla velocità di accelerazione accettabile per le operazioni di accesso.
Intervallo di valutazione: 60
Periodo in sospeso: 300
Periodo di recupero: 300
- TokenRefreshThrottles
-
Etichette: UserPool, UserPoolClient
Descrizione dell'allarme: allarme quando gli eventi di limitazione dell'aggiornamento del token superano la soglia per un pool di utenti.
Intento: rileva la limitazione dell'aggiornamento dei token che potrebbe causare interruzioni della sessione.
Criteri ProMQL:
sum({__name__="TokenRefreshThrottles", "@instrumentation.@name"="cloudwatch.aws/cognito", UserPool="your-user-pool",UserPoolClient="your-user-pool-client"}) >THRESHOLDSoglia consigliata:
THRESHOLD(incorporata nella query)Giustificazione della soglia: impostata in base alla frequenza di accelerazione accettabile per le operazioni di aggiornamento dei token.
Intervallo di valutazione: 60
Periodo in sospeso: 300
Periodo di recupero: 300
- FederationThrottles
-
Etichette: UserPool, UserPoolClient, IdentityProvider
Descrizione dell'allarme: allarme quando gli eventi di limitazione della federazione superano la soglia per un provider di identità del pool di utenti.
Intento: rilevare la limitazione della federazione che potrebbe impedire l'accesso federato.
Criteri ProMQL:
sum({__name__="FederationThrottles", "@instrumentation.@name"="cloudwatch.aws/cognito", UserPool="your-user-pool",UserPoolClient="your-user-pool-client",IdentityProvider="your-identity-provider"}) >THRESHOLDSoglia consigliata:
THRESHOLD(incorporata nella query)Giustificazione della soglia: impostata in base alla velocità di accelerazione accettabile per le operazioni di federazione.
Intervallo di valutazione: 60
Periodo in sospeso: 300
Periodo di recupero: 300
DynamoDB
- AccountProvisionedReadCapacityUtilization
-
Etichette: nessuna
Descrizione dell'allarme: allarme quando l'utilizzo della capacità di lettura assegnata a livello di account supera l'80%.
Intento: rileva quando la capacità di lettura assegnata si avvicina ai limiti dell'account.
Criteri ProMQL:
max({__name__="AccountProvisionedReadCapacityUtilization", "@instrumentation.@name"="cloudwatch.aws/dynamodb"}) > 80Soglia consigliata: 80 (incorporata nella query)
Giustificazione della soglia: con un utilizzo dell'80%, hai un margine di manovra limitato prima di raggiungere i limiti dell'account.
Intervallo di valutazione: 300
Periodo in sospeso: 600
Periodo di recupero: 600
- AccountProvisionedWriteCapacityUtilization
-
Etichette: nessuna
Descrizione dell'allarme: allarme quando l'utilizzo della capacità di scrittura assegnata a livello di account supera l'80%.
Intento: rileva quando la capacità di scrittura assegnata si avvicina ai limiti dell'account.
Criteri ProMQL:
max({__name__="AccountProvisionedWriteCapacityUtilization", "@instrumentation.@name"="cloudwatch.aws/dynamodb"}) > 80Soglia consigliata: 80 (incorporata nella query)
Giustificazione della soglia: con un utilizzo dell'80%, hai un margine di manovra limitato prima di raggiungere i limiti dell'account.
Intervallo di valutazione: 300
Periodo in sospeso: 600
Periodo di recupero: 600
- AgeOfOldestUnreplicatedRecord
-
Etichette: TableName, DelegatedOperation
Descrizione dell'allarme: allarme quando l'età del record non replicato più vecchio supera la soglia.
Intento: rilevare il ritardo di replica che potrebbe causare dati obsoleti nelle tabelle globali.
Criteri ProMQL:
max({__name__="AgeOfOldestUnreplicatedRecord", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name",DelegatedOperation="your-operation"}) >THRESHOLDSoglia consigliata:
THRESHOLD(incorporata nella query)Giustificazione della soglia: impostata in base ai requisiti di aggiornamento della replica.
Intervallo di valutazione: 300
Periodo in sospeso: 900
Periodo di recupero: 900
- FailedToReplicateRecordCount
-
Etichette: TableName, DelegatedOperation
Descrizione dell'allarme: allarme quando i record non vengono replicati in una tabella globale.
Intento: rilevare gli errori di replica che causano incoerenza dei dati tra le regioni.
Criteri ProMQL:
sum({__name__="FailedToReplicateRecordCount", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name",DelegatedOperation="your-operation"}) > 0Soglia consigliata: 0 (incorporata nella query)
Giustificazione della soglia: qualsiasi replica non riuscita indica problemi di coerenza dei dati che richiedono un intervento immediato.
Intervallo di valutazione: 60
Periodo in sospeso: 60
Periodo di recupero: 60
- ReadThrottleEvents
-
Etichette: TableName
Descrizione dell'allarme: allarme quando gli eventi dell'acceleratore di lettura superano la soglia indicata in una tabella.
Intento: rileva la limitazione della lettura che indica una capacità fornita insufficiente.
Criteri ProMQL:
sum({__name__="ReadThrottleEvents", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name"}) >THRESHOLDSoglia consigliata:
THRESHOLD(incorporata nella query)Giustificazione della soglia: impostata in base al numero di acceleratori accettabile per le operazioni di lettura.
Intervallo di valutazione: 60
Periodo in sospeso: 300
Periodo di recupero: 300
- ReadThrottleEvents (GSI)
-
Etichette: TableName, GlobalSecondaryIndexName
Descrizione dell'allarme: allarme quando gli eventi di accelerazione della lettura superano la soglia di un indice secondario globale.
Intento: rileva la limitazione della lettura su un GSI che indica una capacità dell'indice insufficiente.
Criteri ProMQL:
sum({__name__="ReadThrottleEvents", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name",GlobalSecondaryIndexName="your-index-name"}) >THRESHOLDSoglia consigliata:
THRESHOLD(incorporata nella query)Giustificazione della soglia: impostata in base al numero di accelerazioni accettabile per le operazioni di lettura GSI.
Intervallo di valutazione: 60
Periodo in sospeso: 300
Periodo di recupero: 300
- ReplicationLatency
-
Etichette: TableName, ReceivingRegion
Descrizione dell'allarme: allarme quando la latenza media di replica supera la soglia per una tabella globale.
Intento: rileva un'elevata latenza di replica che potrebbe causare letture obsolete nelle regioni di replica.
Criteri ProMQL:
avg({__name__="ReplicationLatency", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name",ReceivingRegion="your-receiving-region"}) >THRESHOLDSoglia consigliata:
THRESHOLD(incorporata nella query)Giustificazione della soglia: impostata in base ai requisiti di aggiornamento dei dati per le regioni di replica.
Intervallo di valutazione: 60
Periodo di attesa: 900
Periodo di recupero: 900
- SuccessfulRequestLatency
-
Etichette: TableName, Operazione
Descrizione dell'allarme: allarme quando la latenza media delle richieste riuscite supera la soglia per un'operazione sulla tabella.
Intento: rileva una latenza elevata sulle operazioni DynamoDB che influisce sulle prestazioni delle applicazioni.
Criteri ProMQL:
avg({__name__="SuccessfulRequestLatency", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name",Operation="your-operation"}) >THRESHOLDSoglia consigliata:
THRESHOLD(incorporata nella query)Giustificazione della soglia: impostata in base allo SLA di latenza per l'operazione specifica di DynamoDB.
Intervallo di valutazione: 60
Periodo in sospeso: 600
Periodo di recupero: 600
- SystemErrors
-
Etichette: TableName
Descrizione dell'allarme: allarme quando gli errori di sistema superano la soglia prevista per una tabella.
Intento: rilevare gli errori sul lato dei servizi di DynamoDB che influiscono sulla disponibilità delle tabelle.
Criteri ProMQL:
sum({__name__="SystemErrors", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name"}) >THRESHOLDSoglia consigliata:
THRESHOLD(incorporata nella query)Giustificazione della soglia: impostata in base al numero di errori di sistema accettabile per la tabella.
Intervallo di valutazione: 60
Periodo di attesa: 900
Periodo di recupero: 900
- ThrottledPutRecordCount
-
Etichette: TableName, DelegatedOperation
Descrizione dell'allarme: allarme quando la limitazione del conteggio dei record di put supera la soglia consentita per una tabella.
Intento: rileva i put limitati che potrebbero causare la perdita di dati nelle operazioni di streaming.
Criteri ProMQL:
max({__name__="ThrottledPutRecordCount", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name",DelegatedOperation="your-operation"}) >THRESHOLDSoglia consigliata:
THRESHOLD(incorporata nella query)Giustificazione della soglia: impostata in base al numero di accelerazioni accettabile per le operazioni di streaming put.
Intervallo di valutazione: 60
Periodo in sospeso: 600
Periodo di recupero: 600
- UserErrors
-
Etichette: nessuna
Descrizione dell'allarme: allarme quando gli errori dell'utente superano la soglia dell'account.
Intento: rilevare alti tassi di errori dei clienti, ad esempio errori di convalida o controllo condizionale.
Criteri ProMQL:
sum({__name__="UserErrors", "@instrumentation.@name"="cloudwatch.aws/dynamodb"}) >THRESHOLDSoglia consigliata:
THRESHOLD(incorporata nella query)Giustificazione della soglia: impostata in base al tasso di errore accettabile per le richieste non riuscite sul lato client.
Intervallo di valutazione: 60
Periodo in sospeso: 600
Periodo di recupero: 600
- WriteThrottleEvents
-
Etichette: TableName
Descrizione dell'allarme: allarme quando gli eventi di accelerazione della scrittura superano la soglia indicata in una tabella.
Intento: rileva la limitazione della scrittura che indica una capacità fornita insufficiente.
Criteri ProMQL:
sum({__name__="WriteThrottleEvents", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name"}) >THRESHOLDSoglia consigliata:
THRESHOLD(incorporata nella query)Giustificazione della soglia: impostata in base al numero di accelerazioni accettabile per le operazioni di scrittura.
Intervallo di valutazione: 60
Periodo in sospeso: 300
Periodo di recupero: 300
- WriteThrottleEvents (GSI)
-
Etichette: TableName, GlobalSecondaryIndexName
Descrizione dell'allarme: allarme quando gli eventi di accelerazione della scrittura superano la soglia di un indice secondario globale.
Intento: rileva la limitazione della scrittura su un GSI che indica una capacità di indice insufficiente.
Criteri ProMQL:
sum({__name__="WriteThrottleEvents", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name",GlobalSecondaryIndexName="your-index-name"}) >THRESHOLDSoglia consigliata:
THRESHOLD(incorporata nella query)Giustificazione della soglia: impostata in base al numero di accelerazioni accettabile per le operazioni di scrittura GSI.
Intervallo di valutazione: 60
Periodo in sospeso: 300
Periodo di recupero: 300
EBS
- VolumeStalledIOCheck
-
Etichette: VolumeId, InstanceId
Descrizione dell'allarme: allarme quando un volume EBS segnala un fallimento del I/O controllo in stallo.
Intento: rilevare volumi EBS bloccati che I/O indicano una riduzione del volume.
Criteri ProMQL:
max({__name__="VolumeStalledIOCheck", "@instrumentation.@name"="cloudwatch.aws/ebs", VolumeId="your-volume-id",InstanceId="your-instance-id"}) >= 1Soglia consigliata: 1 (incorporata nella query)
Giustificazione della soglia: un valore pari o superiore a 1 indica che il volume è in stallo I/O e richiede un'indagine immediata.
Intervallo di valutazione: 60
Periodo in sospeso: 600
Periodo di recupero: 600
Amazon Elastic Compute Cloud
- CPUUtilization
-
Etichette: InstanceId
Descrizione dell'allarme: allarme quando l'utilizzo medio della CPU supera l'80% per un'istanza EC2.
Intento: rilevare un elevato utilizzo della CPU.
Criteri ProMQL:
avg({__name__="CPUUtilization", "@instrumentation.@name"="cloudwatch.aws/ec2", InstanceId="your-instance-id"}) > 80Soglia consigliata: 80 (incorporata nella query)
Giustificazione della soglia: la soglia dell'80% dà spazio alla testa prima della saturazione.
Intervallo di valutazione: 300
Periodo in sospeso: 900
Periodo di recupero: 900
- StatusCheckFailed
-
Etichette: InstanceId
Descrizione dell'allarme: allarme quando un controllo dello stato di un'istanza o del sistema fallisce per un'istanza EC2.
Intento: rilevare problemi di integrità dell'istanza o del sistema.
Criteri ProMQL:
max({__name__="StatusCheckFailed", "@instrumentation.@name"="cloudwatch.aws/ec2", InstanceId="your-instance-id"}) >= 1Soglia consigliata: 1 (incorporata nella query)
Giustificazione della soglia: qualsiasi errore nel controllo dello stato richiede un'indagine.
Intervallo di valutazione: 300
Periodo in sospeso: 600
Periodo di recupero: 600
- StatusCheckFailedEBS _allegati
-
Etichette: InstanceId
Descrizione dell'allarme: allarme quando un volume EBS collegato diventa irraggiungibile per un'istanza EC2.
Intento: rilevare volumi EBS irraggiungibili.
Criteri ProMQL:
max({__name__="StatusCheckFailed_AttachedEBS", "@instrumentation.@name"="cloudwatch.aws/ec2", InstanceId="your-instance-id"}) >= 1Soglia consigliata: 1 (incorporata nella query)
Giustificazione della soglia: i volumi irraggiungibili causano guasti. I/O
Intervallo di valutazione: 60
Periodo in sospeso: 600
Periodo di recupero: 600
Amazon ECS
- CPUReservation
-
Etichette: ClusterName
Descrizione dell'allarme: allarme quando la prenotazione media della CPU supera l'80% per un cluster ECS.
Intento: rilevare un cluster che si avvicina alla capacità della CPU.
Criteri ProMQL:
avg({__name__="CPUReservation", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="your-cluster-name"}) > 80Soglia consigliata: 80 (incorporata nella query)
Giustificazione della soglia: una prenotazione dell'80% indica un margine di manovra limitato per nuove attività.
Intervallo di valutazione: 60
Periodo in sospeso: 300
Periodo di recupero: 300
- CPUUtilization
-
Etichette: ClusterName, ServiceName
Descrizione dell'allarme: allarme quando l'utilizzo medio della CPU supera l'80% per un servizio ECS.
Intento: rilevare un elevato utilizzo della CPU per il servizio ECS.
Criteri ProMQL:
avg({__name__="CPUUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="your-cluster-name",ServiceName="your-service-name"}) > 80Soglia consigliata: 80 (incorporata nella query)
Giustificazione della soglia: l'80% fornisce un margine di manovra prima della saturazione.
Intervallo di valutazione: 60
Periodo in sospeso: 300
Periodo di recupero: 300
- EBSFilesystemUtilization
-
Etichette: ClusterName, ServiceName
Descrizione dell'allarme: allarme quando l'utilizzo medio del file system EBS supera l'80% per un servizio ECS.
Intento: rilevare un elevato utilizzo dello storage EBS.
Criteri ProMQL:
avg({__name__="EBSFilesystemUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="your-cluster-name",ServiceName="your-service-name"}) > 80Soglia consigliata: 80 (incorporata nella query)
Giustificazione della soglia: l'80% fornisce un margine di manovra prima della saturazione.
Intervallo di valutazione: 60
Periodo in sospeso: 300
Periodo di recupero: 300
- MemoryReservation
-
Etichette: ClusterName
Descrizione dell'allarme: allarme quando la prenotazione media di memoria supera l'80% per un cluster ECS.
Intento: rilevare un cluster che si avvicina alla capacità di memoria.
Criteri ProMQL:
avg({__name__="MemoryReservation", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="your-cluster-name"}) > 80Soglia consigliata: 80 (incorporata nella query)
Giustificazione della soglia: una prenotazione dell'80% indica un margine di manovra limitato per nuove attività.
Intervallo di valutazione: 60
Periodo in sospeso: 300
Periodo di recupero: 300
- MemoryUtilization
-
Etichette: ClusterName, ServiceName
Descrizione dell'allarme: allarme quando l'utilizzo medio della memoria supera l'80% per un servizio ECS.
Intento: rilevare un utilizzo elevato della memoria.
Criteri ProMQL:
avg({__name__="MemoryUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="your-cluster-name",ServiceName="your-service-name"}) > 80Soglia consigliata: 80 (incorporata nella query)
Giustificazione della soglia: l'80% fornisce un margine di manovra prima della saturazione.
Intervallo di valutazione: 60
Periodo in sospeso: 300
Periodo di recupero: 300
- HTTP Code_Target _5XX_COUNT
-
Etichette:, ClusterName ServiceName
Descrizione dell'allarme: allarme quando il conteggio degli errori HTTP 5XX supera la soglia per un servizio ECS.
Intento: rileva un numero elevato di errori sul lato server.
Criteri ProMQL:
sum({__name__="HTTPCode_Target_5XX_Count", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="your-cluster-name",ServiceName="your-service-name"}) >THRESHOLDSoglia consigliata:
THRESHOLD(incorporata nella query)Giustificazione della soglia: impostata in base al normale tasso di errore dell'applicazione.
Intervallo di valutazione: 60
Periodo in sospeso: 300
Periodo di recupero: 300
- TargetResponseTime
-
Etichette: ClusterName, ServiceName
Descrizione dell'allarme: allarme quando il tempo di risposta medio previsto supera la soglia per un servizio ECS.
Intento: rilevare un tempo di risposta target elevato.
Criteri ProMQL:
avg({__name__="TargetResponseTime", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="your-cluster-name",ServiceName="your-service-name"}) >THRESHOLDSoglia consigliata:
THRESHOLD(incorporata nella query)Giustificazione della soglia: impostata in base ai requisiti di latenza accettabili dell'applicazione.
Intervallo di valutazione: 60
Periodo in sospeso: 300
Periodo di recupero: 300
Amazon ECS Container Insights
- EphemeralStorageUtilized
-
Etichette: ClusterName, ServiceName
Descrizione dell'allarme: allarme quando l'utilizzo medio temporaneo dello spazio di archiviazione supera la soglia per le attività di Fargate.
Intento: rileva un elevato utilizzo temporaneo dello spazio di archiviazione per le attività di Fargate.
Criteri ProMQL:
avg({__name__="EphemeralStorageUtilized", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name",ServiceName="your-service-name"}) >THRESHOLDSoglia consigliata:
THRESHOLD(incorporata nella query)Giustificazione della soglia: impostata in base all'allocazione di archiviazione effimera dell'attività.
Intervallo di valutazione: 60
Periodo in sospeso: 300
Periodo di recupero: 300
- RunningTaskCount
-
Etichette: ClusterName, ServiceName
Descrizione dell'allarme: allarme quando il conteggio delle attività in esecuzione scende a zero per un servizio ECS.
Intento: rileva quando non è in esecuzione alcuna attività.
Criteri ProMQL:
avg({__name__="RunningTaskCount", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name",ServiceName="your-service-name"}) <= 0Soglia consigliata: 0 (incorporata nella query)
Giustificazione della soglia: zero attività in esecuzione indica un'interruzione del servizio.
Intervallo di valutazione: 60
Periodo in sospeso: 300
Periodo di recupero: 300
- instance_filesystem_utilization
-
Etichette: InstanceId, ContainerInstanceId, ClusterName
Descrizione dell'allarme: allarme quando l'utilizzo medio del file system supera il 90% su un'istanza del contenitore.
Intento: rilevare un elevato utilizzo del file system.
Criteri ProMQL:
avg({__name__="instance_filesystem_utilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", InstanceId="your-instance-id",ContainerInstanceId="your-container-instance-id",ClusterName="your-cluster-name"}) > 90Soglia consigliata: 90 (incorporata nella query)
Giustificazione della soglia: l'utilizzo del 90% del file system lascia uno spazio minimo per le operazioni.
Intervallo di valutazione: 60
Periodo in sospeso: 300
Periodo di recupero: 300
Osservabilità migliorata di Amazon ECS Container Insights
- TaskCpuUtilization (a livello di cluster)
-
Etichette: ClusterName
Descrizione dell'allarme: allarme quando l'utilizzo medio della CPU dell'attività supera l'80% a livello di cluster.
Intento: rilevare un elevato utilizzo della CPU.
Criteri ProMQL:
avg({__name__="TaskCpuUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name"}) > 80Soglia consigliata: 80 (incorporata nella query)
Giustificazione della soglia: l'80% fornisce un margine di manovra prima della saturazione.
Intervallo di valutazione: 60
Periodo in sospeso: 300
Periodo di recupero: 300
- TaskCpuUtilization (livello di servizio)
-
Etichette: ClusterName, ServiceName
Descrizione dell'allarme: allarme quando l'utilizzo medio della CPU dell'attività supera l'80% a livello di servizio.
Intento: rilevare un elevato utilizzo della CPU.
Criteri ProMQL:
avg({__name__="TaskCpuUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name",ServiceName="your-service-name"}) > 80Soglia consigliata: 80 (incorporata nella query)
Giustificazione della soglia: l'80% fornisce un margine di manovra prima della saturazione.
Intervallo di valutazione: 60
Periodo in sospeso: 300
Periodo di recupero: 300
- TaskMemoryUtilization (livello di cluster)
-
Etichette: ClusterName
Descrizione dell'allarme: allarme quando l'utilizzo medio della memoria delle attività supera l'80% a livello di cluster.
Intento: rilevare un utilizzo elevato della memoria.
Criteri ProMQL:
avg({__name__="TaskMemoryUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name"}) > 80Soglia consigliata: 80 (incorporata nella query)
Giustificazione della soglia: l'80% fornisce un margine di manovra prima della saturazione.
Intervallo di valutazione: 60
Periodo in sospeso: 300
Periodo di recupero: 300
- TaskMemoryUtilization (livello di servizio)
-
Etichette: ClusterName, ServiceName
Descrizione dell'allarme: allarme quando l'utilizzo medio della memoria delle attività supera l'80% a livello di servizio.
Intento: rilevare un utilizzo elevato della memoria.
Criteri ProMQL:
avg({__name__="TaskMemoryUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name",ServiceName="your-service-name"}) > 80Soglia consigliata: 80 (incorporata nella query)
Giustificazione della soglia: l'80% fornisce un margine di manovra prima della saturazione.
Intervallo di valutazione: 60
Periodo in sospeso: 300
Periodo di recupero: 300
- ContainerCpuUtilization (livello di cluster)
-
Etichette: ClusterName
Descrizione dell'allarme: allarme quando l'utilizzo medio della CPU del contenitore supera l'80% a livello di cluster.
Intento: rilevare un elevato utilizzo della CPU.
Criteri ProMQL:
avg({__name__="ContainerCpuUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name"}) > 80Soglia consigliata: 80 (incorporata nella query)
Giustificazione della soglia: l'80% fornisce un margine di manovra prima della saturazione.
Intervallo di valutazione: 60
Periodo in sospeso: 300
Periodo di recupero: 300
- ContainerCpuUtilization (livello del contenitore)
-
Etichette: ContainerName, ClusterName, ServiceName
Descrizione dell'allarme: allarme quando l'utilizzo medio della CPU del contenitore supera l'80% a livello di contenitore.
Intento: rilevare un elevato utilizzo della CPU.
Criteri ProMQL:
avg({__name__="ContainerCpuUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ContainerName="your-container-name",ClusterName="your-cluster-name",ServiceName="your-service-name"}) > 80Soglia consigliata: 80 (incorporata nella query)
Giustificazione della soglia: l'80% fornisce un margine di manovra prima della saturazione.
Intervallo di valutazione: 60
Periodo in sospeso: 300
Periodo di recupero: 300
- ContainerMemoryUtilization (livello di cluster)
-
Etichette: ClusterName
Descrizione dell'allarme: allarme quando l'utilizzo medio della memoria del contenitore supera l'80% a livello di cluster.
Intento: rilevare un utilizzo elevato della memoria.
Criteri ProMQL:
avg({__name__="ContainerMemoryUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name"}) > 80Soglia consigliata: 80 (incorporata nella query)
Giustificazione della soglia: l'80% fornisce un margine di manovra prima della saturazione.
Intervallo di valutazione: 60
Periodo in sospeso: 300
Periodo di recupero: 300
- ContainerMemoryUtilization (livello del contenitore)
-
Etichette: ContainerName, ClusterName, ServiceName
Descrizione dell'allarme: allarme quando l'utilizzo medio della memoria del contenitore supera l'80% a livello di contenitore.
Intento: rilevare un utilizzo elevato della memoria.
Criteri ProMQL:
avg({__name__="ContainerMemoryUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ContainerName="your-container-name",ClusterName="your-cluster-name",ServiceName="your-service-name"}) > 80Soglia consigliata: 80 (incorporata nella query)
Giustificazione della soglia: l'80% fornisce un margine di manovra prima della saturazione.
Intervallo di valutazione: 60
Periodo in sospeso: 300
Periodo di recupero: 300
- TaskEBSfilesystemUtilization
-
Etichette: ClusterName, ServiceName
Descrizione dell'allarme: allarme quando l'utilizzo medio del file system EBS supera l'80% per le attività.
Intento: rilevare un elevato utilizzo del file system EBS.
Criteri ProMQL:
avg({__name__="TaskEBSfilesystemUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name",ServiceName="your-service-name"}) > 80Soglia consigliata: 80 (incorporata nella query)
Giustificazione della soglia: l'80% fornisce un margine di manovra prima della saturazione.
Intervallo di valutazione: 60
Periodo in sospeso: 300
Periodo di recupero: 300
- TaskEphemeralStorageUtilization (livello di cluster)
-
Etichette: ClusterName
Descrizione dell'allarme: allarme quando l'utilizzo medio temporaneo dello storage supera l'80% a livello di cluster.
Intento: rilevare un elevato utilizzo temporaneo dello storage.
Criteri ProMQL:
avg({__name__="TaskEphemeralStorageUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name"}) > 80Soglia consigliata: 80 (incorporata nella query)
Giustificazione della soglia: l'80% fornisce un margine di manovra prima della saturazione.
Intervallo di valutazione: 60
Periodo in sospeso: 300
Periodo di recupero: 300
- TaskEphemeralStorageUtilization (livello di servizio)
-
Etichette: ClusterName, ServiceName
Descrizione dell'allarme: allarme quando l'utilizzo medio temporaneo dello storage supera l'80% a livello di servizio.
Intento: rilevare un elevato utilizzo temporaneo dello storage.
Criteri ProMQL:
avg({__name__="TaskEphemeralStorageUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name",ServiceName="your-service-name"}) > 80Soglia consigliata: 80 (incorporata nella query)
Giustificazione della soglia: l'80% fornisce un margine di manovra prima della saturazione.
Intervallo di valutazione: 60
Periodo in sospeso: 300
Periodo di recupero: 300
Amazon EFS
- PercentIOLimit
-
Etichette: FileSystemId
Descrizione dell'allarme: allarme quando un file system EFS raggiunge il 100% del suo limite. I/O
Intento: rileva quando il file system raggiunge il limite. I/O
Criteri ProMQL:
avg({__name__="PercentIOLimit", "@instrumentation.@name"="cloudwatch.aws/efs", FileSystemId="your-filesystem-id"}) >= 100Soglia consigliata: 100 (incorporata nella query)
Giustificazione della soglia: al 100% il filesystem diventa un collo di bottiglia.
Intervallo di valutazione: 60
Periodo di attesa: 900
Periodo di recupero: 900
- BurstCreditBalance
-
Etichette: FileSystemId
Descrizione dell'allarme: allarme quando il saldo del credito a raffica scende a zero per un file system EFS.
Intento: rilevare i crediti burst esauriti che causano un rallentamento del throughput.
Criteri ProMQL:
avg({__name__="BurstCreditBalance", "@instrumentation.@name"="cloudwatch.aws/efs", FileSystemId="your-filesystem-id"}) <= 0Soglia consigliata: 0 (incorporata nella query)
Giustificazione della soglia: zero crediti causa una riduzione della produttività.
Intervallo di valutazione: 60
Periodo di attesa: 900
Periodo di recupero: 900
Amazon EKS Container Insights
- node_cpu_utilization
-
Etichette: ClusterName
Descrizione dell'allarme: allarme quando l'utilizzo massimo della CPU supera l'80% sui nodi di lavoro EKS.
Intento: rileva una CPU elevata sui nodi di lavoro.
Criteri ProMQL:
max({__name__="node_cpu_utilization", "@instrumentation.@name"="cloudwatch.aws/eks-containerinsights", ClusterName="your-cluster-name"}) > 80Soglia consigliata: 80 (incorporata nella query)
Giustificazione della soglia: l'80% fornisce un margine di manovra prima della saturazione.
Intervallo di valutazione: 60
Periodo in sospeso: 300
Periodo di recupero: 300
- node_filesystem_utilization
-
Etichette: ClusterName
Descrizione dell'allarme: allarme quando l'utilizzo massimo del file system supera la soglia sui nodi di lavoro EKS.
Intento: rilevare un elevato utilizzo del file system sui nodi di lavoro.
Criteri ProMQL:
max({__name__="node_filesystem_utilization", "@instrumentation.@name"="cloudwatch.aws/eks-containerinsights", ClusterName="your-cluster-name"}) >THRESHOLDSoglia consigliata:
THRESHOLD(incorporata nella query)Giustificazione della soglia: impostata in base alla capacità di archiviazione e ai modelli di utilizzo del nodo.
Intervallo di valutazione: 60
Periodo in sospeso: 300
Periodo di recupero: 300
- node_memory_utilization
-
Etichette: ClusterName
Descrizione dell'allarme: allarme quando l'utilizzo massimo della memoria supera l'80% sui nodi di lavoro EKS.
Intento: rilevare una quantità elevata di memoria sui nodi di lavoro.
Criteri ProMQL:
max({__name__="node_memory_utilization", "@instrumentation.@name"="cloudwatch.aws/eks-containerinsights", ClusterName="your-cluster-name"}) > 80Soglia consigliata: 80 (incorporata nella query)
Giustificazione della soglia: l'80% fornisce un margine di manovra prima della saturazione.
Intervallo di valutazione: 60
Periodo in sospeso: 300
Periodo di recupero: 300
- pod_cpu_utilization_over_pod_limit
-
Etichette: ClusterName, Namespace, Service
Descrizione dell'allarme: allarme quando l'utilizzo della CPU del pod supera l'80% del limite.
Intento: rileva i pod che si avvicinano ai limiti della CPU.
Criteri ProMQL:
max({__name__="pod_cpu_utilization_over_pod_limit", "@instrumentation.@name"="cloudwatch.aws/eks-containerinsights", ClusterName="your-cluster-name",Namespace="your-namespace",Service="your-service"}) > 80Soglia consigliata: 80 (incorporata nella query)
Giustificazione della soglia: l'80% offre un margine di manovra prima che si verifichi la limitazione.
Intervallo di valutazione: 60
Periodo in sospeso: 300
Periodo di recupero: 300
- pod_memory_utilization_over_pod_limit
-
Etichette: ClusterName, Namespace, Service
Descrizione dell'allarme: allarme quando l'utilizzo della memoria del pod supera l'80% del limite.
Intento: rileva i pod che si avvicinano ai limiti di memoria.
Criteri ProMQL:
max({__name__="pod_memory_utilization_over_pod_limit", "@instrumentation.@name"="cloudwatch.aws/eks-containerinsights", ClusterName="your-cluster-name",Namespace="your-namespace",Service="your-service"}) > 80Soglia consigliata: 80 (incorporata nella query)
Giustificazione della soglia: l'80% offre un margine di manovra prima che si verifichi OOMkill.
Intervallo di valutazione: 60
Periodo in sospeso: 300
Periodo di recupero: 300
Amazon ElastiCache
- CPUUtilization
-
Etichette: CacheClusterId, CacheNodeId
Descrizione dell'allarme: allarme quando l'utilizzo medio della CPU supera la soglia per un ElastiCache nodo.
Intento: rileva una CPU elevata in tutta l'istanza.
Criteri ProMQL:
avg({__name__="CPUUtilization", "@instrumentation.@name"="cloudwatch.aws/elasticache", CacheClusterId="your-cache-cluster-id",CacheNodeId="your-cache-node-id"}) >THRESHOLDSoglia consigliata:
THRESHOLD(incorporata nella query)Giustificazione della soglia: impostata in base al tipo di nodo e alle caratteristiche del carico di lavoro.
Intervallo di valutazione: 60
Periodo in sospeso: 300
Periodo di recupero: 300
- CurrConnections
-
Etichette: CacheClusterId, CacheNodeId
Descrizione dell'allarme: allarme quando il numero di connessioni supera la soglia per un ElastiCache nodo.
Intento: rileva un numero elevato di connessioni.
Criteri ProMQL:
avg({__name__="CurrConnections", "@instrumentation.@name"="cloudwatch.aws/elasticache", CacheClusterId="your-cache-cluster-id",CacheNodeId="your-cache-node-id"}) >THRESHOLDSoglia consigliata:
THRESHOLD(incorporata nella query)Giustificazione della soglia: impostata in base alle dimensioni previste del pool di connessioni e alle esigenze dell'applicazione.
Intervallo di valutazione: 60
Periodo in sospeso: 600
Periodo di recupero: 600
- DatabaseMemoryUsagePercentage
-
Etichette: CacheClusterId
Descrizione dell'allarme: allarme quando l'utilizzo della memoria del database supera la soglia per un ElastiCache cluster.
Intento: rileva un utilizzo elevato della memoria per prevenire errori di scrittura.
Criteri ProMQL:
avg({__name__="DatabaseMemoryUsagePercentage", "@instrumentation.@name"="cloudwatch.aws/elasticache", CacheClusterId="your-cache-cluster-id"}) >THRESHOLDSoglia consigliata:
THRESHOLD(incorporata nella query)Giustificazione della soglia: impostata in base alla politica di sfratto e alla criticità dei dati.
Intervallo di valutazione: 60
Periodo in sospeso: 300
Periodo di recupero: 300
- EngineCPUUtilization
-
Etichette: CacheClusterId
Descrizione dell'allarme: allarme quando l'utilizzo della CPU del motore Redis supera il 90% per un cluster. ElastiCache
Intento: rileva un elevato utilizzo della CPU del motore Redis.
Criteri ProMQL:
avg({__name__="EngineCPUUtilization", "@instrumentation.@name"="cloudwatch.aws/elasticache", CacheClusterId="your-cache-cluster-id"}) > 90Soglia consigliata: 90 (incorporata nella query)
Giustificazione della soglia: Redis è a thread singolo; un valore superiore al 90% indica una saturazione.
Intervallo di valutazione: 60
Periodo in sospeso: 300
Periodo di recupero: 300
- ReplicationLag
-
Etichette: CacheClusterId
Descrizione dell'allarme: allarme quando il ritardo di replica supera la soglia per un cluster. ElastiCache
Intento: rilevare il ritardo di replica che influisce sulla coerenza dei dati.
Criteri ProMQL:
avg({__name__="ReplicationLag", "@instrumentation.@name"="cloudwatch.aws/elasticache", CacheClusterId="your-cache-cluster-id"}) >THRESHOLDSoglia consigliata:
THRESHOLD(incorporata nella query)Giustificazione della soglia: impostata in base alla tolleranza dell'applicazione per le letture obsolete.
Intervallo di valutazione: 60
Periodo di attesa: 900
Periodo di recupero: 900
GPU elastiche
- GPUConnectivityCheckFailed
-
Etichette: InstanceId, eGPUID
Descrizione dell'allarme: allarme quando l'acceleratore Elastic Graphics perde la connettività all'istanza.
Intento: rilevare problemi di connettività all'acceleratore Elastic Graphics.
Criteri ProMQL:
max({__name__="GPUConnectivityCheckFailed", "@instrumentation.@name"="cloudwatch.aws/elasticgpus", InstanceId="your-instance-id",EGPUId="your-egpu-id"}) > 0Soglia consigliata: 0 (incorporata nella query)
Giustificazione della soglia: qualsiasi errore di connettività richiede un'indagine.
Intervallo di valutazione: 300
Periodo in sospeso: 900
Periodo di recupero: 900
- GPUHealthCheckFailed
-
Etichette: InstanceId, eGPUID
Descrizione dell'allarme: avviso in caso di esito negativo di un controllo dello stato dell'acceleratore Elastic Graphics.
Intento: rilevare un acceleratore Elastic Graphics non funzionante.
Criteri ProMQL:
max({__name__="GPUHealthCheckFailed", "@instrumentation.@name"="cloudwatch.aws/elasticgpus", InstanceId="your-instance-id",EGPUId="your-egpu-id"}) > 0Soglia consigliata: 0 (incorporata nella query)
Giustificazione della soglia: gli errori del controllo dello stato indicano problemi con l'acceleratore.
Intervallo di valutazione: 300
Periodo in sospeso: 900
Periodo di recupero: 900
Amazon EventBridge Scheduler
- TargetErrorThrottledCount
-
Descrizione dell'allarme: allarme quando le chiamate agli obiettivi programmati vengono limitate.
Intento: rileva la limitazione del target che causa ritardi nella pianificazione.
Criteri ProMQL:
sum({__name__="TargetErrorThrottledCount", "@instrumentation.@name"="cloudwatch.aws/scheduler"}) > 0Soglia consigliata: 0 (incorporata nella query)
Giustificazione della soglia: qualsiasi limitazione indica problemi di capacità target.
Intervallo di valutazione: 60
Periodo di attesa: 900
Periodo di recupero: 900
- InvocationThrottleCount
-
Descrizione dell'allarme: allarme quando le chiamate dello Scheduler vengono limitate.
Intento: rilevare la limitazione delle chiamate di Scheduler.
Criteri ProMQL:
sum({__name__="InvocationThrottleCount", "@instrumentation.@name"="cloudwatch.aws/scheduler"}) > 0Soglia consigliata: 0 (incorporata nella query)
Giustificazione della soglia: la limitazione ritarda le esecuzioni programmate.
Intervallo di valutazione: 60
Periodo di attesa: 900
Periodo di recupero: 900
- InvocationDroppedCount
-
Descrizione dell'allarme: allarme quando le chiamate programmate vengono interrotte.
Intento: rileva le chiamate interrotte.
Criteri ProMQL:
sum({__name__="InvocationDroppedCount", "@instrumentation.@name"="cloudwatch.aws/scheduler"}) > 0Soglia consigliata: 0 (incorporata nella query)
Giustificazione della soglia: le chiamate interrotte rappresentano eventi programmati persi.
Intervallo di valutazione: 60
Periodo in sospeso: 60
Periodo di recupero: 60
- InvocationsFailedToBeSentToDeadLetterCount
-
Descrizione dell'allarme: allarme quando le chiamate non riuscite non possono essere inviate alla coda delle lettere morte.
Intento: rilevare errori di consegna DLQ.
Criteri ProMQL:
sum({__name__="InvocationsFailedToBeSentToDeadLetterCount", "@instrumentation.@name"="cloudwatch.aws/scheduler"}) > 0Soglia consigliata: 0 (incorporata nella query)
Giustificazione della soglia: la mancata consegna del DLQ comporta la perdita delle informazioni sull'errore.
Intervallo di valutazione: 60
Periodo di attesa: 900
Periodo di recupero: 900
Flusso di dati Amazon Kinesis
- GetRecords.IteratorAgeMilliseconds
-
Etichette: StreamName
Descrizione dell'allarme: allarme quando l'età dell'iteratore consumer supera la soglia per uno stream Kinesis.
Intento: rilevare i dati che non rispettano il periodo di conservazione rischiando di perderli.
Criteri ProMQL:
max({__name__="GetRecords.IteratorAgeMilliseconds", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="your-stream-name"}) >THRESHOLDSoglia consigliata:
THRESHOLD(incorporata nella query)Giustificazione della soglia: impostata in base alla percentuale del periodo di conservazione dello stream.
Intervallo di valutazione: 60
Periodo di attesa: 900
Periodo di recupero: 900
- GetRecords.Success
-
Etichette: StreamName
Descrizione dell'allarme: si attiva quando la percentuale di GetRecords successo scende al di sotto della soglia di uno stream Kinesis.
Intento: rilevare gli errori di recupero da parte dei consumatori.
Criteri ProMQL:
avg({__name__="GetRecords.Success", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="your-stream-name"}) <THRESHOLDSoglia consigliata:
THRESHOLD(incorporata nella query)Giustificazione della soglia: impostata in base alla percentuale di successo prevista.
Intervallo di valutazione: 60
Periodo in sospeso: 300
Periodo di recupero: 300
- PutRecord.Success
-
Etichette: StreamName
Descrizione dell'allarme: si attiva quando la percentuale di PutRecord successo scende al di sotto della soglia di uno stream Kinesis.
Obiettivo: rilevare eventuali errori di ingestione da parte del produttore.
Criteri ProMQL:
avg({__name__="PutRecord.Success", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="your-stream-name"}) <THRESHOLDSoglia consigliata:
THRESHOLD(incorporata nella query)Giustificazione della soglia: impostata in base alla percentuale di successo prevista.
Intervallo di valutazione: 60
Periodo in sospeso: 300
Periodo di recupero: 300
- PutRecords.FailedRecords
-
Etichette: StreamName
Descrizione dell'allarme: allarme quando le operazioni di batch put producono record non riusciti per uno stream Kinesis.
Intento: rilevare errori di batch put.
Criteri ProMQL:
sum({__name__="PutRecords.FailedRecords", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="your-stream-name"}) >THRESHOLDSoglia consigliata:
THRESHOLD(incorporata nella query)Giustificazione della soglia: impostata in base al numero di errori accettabile.
Intervallo di valutazione: 60
Periodo in sospeso: 300
Periodo di recupero: 300
- ReadProvisionedThroughputExceeded
-
Etichette: StreamName
Descrizione dell'allarme: allarme quando le letture degli utenti superano il throughput previsto per uno stream Kinesis.
Intento: rilevare la limitazione della lettura da parte dei consumatori.
Criteri ProMQL:
avg({__name__="ReadProvisionedThroughputExceeded", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="your-stream-name"}) >THRESHOLDSoglia consigliata:
THRESHOLD(incorporata nella query)Giustificazione della soglia: qualsiasi limitazione prolungata indica il fabbisogno di capacità.
Intervallo di valutazione: 60
Periodo in sospeso: 300
Periodo di recupero: 300
- SubscribeToShardEvent.MillisBehindLatest
-
Etichette: StreamName, ConsumerName
Descrizione dell'allarme: Allarme quando un consumatore che si affanna di più è in ritardo rispetto all'ultimo record.
Intento: rilevare un maggiore ritardo di elaborazione da parte dei consumatori.
Criteri ProMQL:
avg({__name__="SubscribeToShardEvent.MillisBehindLatest", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="your-stream-name",ConsumerName="your-consumer-name"}) >THRESHOLDSoglia consigliata:
THRESHOLD(incorporata nella query)Giustificazione della soglia: impostata in base a un ritardo di elaborazione accettabile.
Intervallo di valutazione: 60
Periodo in sospeso: 300
Periodo di recupero: 300
- WriteProvisionedThroughputExceeded
-
Etichette: StreamName
Descrizione dell'allarme: allarme quando le scritture del produttore superano il throughput previsto per uno stream Kinesis.
Intento: rileva la limitazione della scrittura da parte del produttore.
Criteri ProMQL:
avg({__name__="WriteProvisionedThroughputExceeded", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="your-stream-name"}) >THRESHOLDSoglia consigliata:
THRESHOLD(incorporata nella query)Giustificazione della soglia: la limitazione prolungata indica il fabbisogno di capacità.
Intervallo di valutazione: 60
Periodo in sospeso: 300
Periodo di recupero: 300
AWS Lambda
- ClaimedAccountConcurrency
-
Descrizione dell'allarme: allarme quando la concorrenza dichiarata dell'account supera la soglia.
Intento: rileva che l'account si avvicina alla quota di concorrenza.
Criteri ProMQL:
max({__name__="ClaimedAccountConcurrency", "@instrumentation.@name"="cloudwatch.aws/lambda"}) >THRESHOLDSoglia consigliata:
THRESHOLD(incorporata nella query)Giustificazione della soglia: impostata sulla percentuale del limite di concorrenza regionale.
Intervallo di valutazione: 60
Periodo in sospeso: 600
Periodo di recupero: 600
- Errori
-
Etichette: FunctionName
Descrizione dell'allarme: allarme quando il conteggio degli errori di funzione supera la soglia per una funzione Lambda.
Intento: rilevare un numero elevato di errori di funzione.
Criteri ProMQL:
sum({__name__="Errors", "@instrumentation.@name"="cloudwatch.aws/lambda", FunctionName="your-function-name"}) >THRESHOLDSoglia consigliata:
THRESHOLD(incorporata nella query)Giustificazione della soglia: impostata in base al volume di errore accettabile.
Intervallo di valutazione: 60
Periodo in sospeso: 180
Periodo di recupero: 300
- Throttles
-
Etichette: FunctionName
Descrizione dell'allarme: allarme quando le chiamate di funzione vengono limitate per una funzione Lambda.
Intento: rilevare la limitazione delle chiamate alla funzione.
Criteri ProMQL:
sum({__name__="Throttles", "@instrumentation.@name"="cloudwatch.aws/lambda", FunctionName="your-function-name"}) >THRESHOLDSoglia consigliata:
THRESHOLD(incorporata nella query)Giustificazione della soglia: la limitazione indica il raggiungimento del limite di concorrenza.
Intervallo di valutazione: 60
Periodo in sospeso: 300
Periodo di recupero: 300
- Durata
-
Etichette: FunctionName
Descrizione dell'allarme: allarme quando la durata della funzione p90 supera la soglia per una funzione Lambda.
Intento: rileva le chiamate di funzioni di lunga durata.
Criteri ProMQL:
histogram_quantile(0.9, {__name__="Duration", "@instrumentation.@name"="cloudwatch.aws/lambda", FunctionName="your-function-name"}) >THRESHOLDSoglia consigliata:
THRESHOLD(incorporata nella query)Giustificazione della soglia: impostata in relazione al timeout della funzione.
Intervallo di valutazione: 60
Periodo di attesa: 900
Periodo di recupero: 900
- ConcurrentExecutions
-
Etichette: FunctionName
Descrizione dell'allarme: allarme quando le esecuzioni simultanee superano la soglia per una funzione Lambda.
Intento: rilevare una funzione che si avvicina ai limiti di concorrenza.
Criteri ProMQL:
max({__name__="ConcurrentExecutions", "@instrumentation.@name"="cloudwatch.aws/lambda", FunctionName="your-function-name"}) >THRESHOLDSoglia consigliata:
THRESHOLD(incorporata nella query)Giustificazione della soglia: impostata sulla percentuale di concorrenza riservata.
Intervallo di valutazione: 60
Periodo in sospeso: 600
Periodo di recupero: 600
AWS Lambda Approfondimenti
- memory_utilization
-
Etichette: function_name
Descrizione dell'allarme: allarme quando l'utilizzo medio della memoria supera il 90% per una funzione Lambda.
Intento: rileva la funzione che si avvicina al limite di memoria configurato.
Criteri ProMQL:
avg({__name__="memory_utilization", "@instrumentation.@name"="cloudwatch.aws/lambda-insights", function_name="your-function-name"}) > 90Soglia consigliata: 90 (incorporata nella query)
Giustificazione della soglia: una soglia superiore al 90% comporta il rischio di esaurimento della memoria.
Intervallo di valutazione: 60
Periodo in sospeso: 600
Periodo di recupero: 600
Gateway NAT
- ErrorPortAllocation
-
Etichette: NatGatewayId
Descrizione dell'allarme: allarme quando il gateway NAT non riesce ad allocare una porta per nuove connessioni.
Intento: rilevare gli errori di allocazione delle porte che impediscono nuove connessioni.
Criteri ProMQL:
sum({__name__="ErrorPortAllocation", "@instrumentation.@name"="cloudwatch.aws/natgateway", NatGatewayId="your-nat-gateway-id"}) > 0Soglia consigliata: 0 (incorporata nella query)
Giustificazione della soglia: qualsiasi errore di allocazione influisce sulla connettività.
Intervallo di valutazione: 60
Periodo di attesa: 900
Periodo di recupero: 900
- PacketsDropCount
-
Etichette: NatGatewayId
Descrizione dell'allarme: allarme quando il gateway NAT rilascia pacchetti che superano la soglia.
Intento: rileva le cadute di pacchetti che indicano problemi di capacità o connettività.
Criteri ProMQL:
sum({__name__="PacketsDropCount", "@instrumentation.@name"="cloudwatch.aws/natgateway", NatGatewayId="your-nat-gateway-id"}) >THRESHOLDSoglia consigliata:
THRESHOLD(incorporata nella query)Giustificazione della soglia: impostata in base al tasso di caduta accettabile.
Intervallo di valutazione: 60
Periodo in sospeso: 300
Periodo di recupero: 300
AWS PrivateLink endpoint
- PacketsDropped
-
Etichette: VpcId, VpcEndpointId,, EndpointType, SubnetId ServiceName
Descrizione dell'allarme: allarme quando un endpoint VPC rilascia pacchetti che superano la soglia.
Intento: rilevare un endpoint o un servizio endpoint non integro.
Criteri ProMQL:
sum({__name__="PacketsDropped", "@instrumentation.@name"="cloudwatch.aws/privatelinkendpoints", VpcId="your-vpc-id",VpcEndpointId="your-vpc-endpoint-id",EndpointType="your-endpoint-type",SubnetId="your-subnet-id",ServiceName="your-service-name"}) >THRESHOLDSoglia consigliata:
THRESHOLD(incorporata nella query)Giustificazione della soglia: impostata in base al tasso di caduta accettabile.
Intervallo di valutazione: 60
Periodo in sospeso: 300
Periodo di recupero: 300
AWS PrivateLink servizi
- RstPacketsSent
-
Etichette: ServiceId, LoadBalancerArn, Az
Descrizione dell'allarme: allarme quando la velocità dei pacchetti RST supera la soglia per un servizio endpoint.
Intento: rilevare obiettivi non integri del servizio endpoint.
Criteri ProMQL:
sum({__name__="RstPacketsSent", "@instrumentation.@name"="cloudwatch.aws/privatelinkservices", ServiceId="SVC",LoadBalancerArn="LB",Az="AZ"}) >THRESHOLDSoglia consigliata:
THRESHOLD(incorporata nella query)Giustificazione della soglia: impostata in base a una velocità di pacchetti RST accettabile.
Intervallo di valutazione: 60
Periodo in sospeso: 300
Periodo di recupero: 300
RDS
- CPUUtilization
-
Etichette: DBInstanceIdentifier
Descrizione dell'allarme: allarme quando l'utilizzo medio della CPU supera il 90% per un'istanza RDS.
Intento: rileva una CPU elevata prevenendo il degrado delle prestazioni.
Criteri ProMQL:
avg({__name__="CPUUtilization", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > 90Soglia consigliata: 90 (incorporata nella query)
Giustificazione della soglia: il 90% indica una saturazione prossima.
Intervallo di valutazione: 60
Periodo in sospeso: 300
Periodo di recupero: 300
- DatabaseConnections
-
Etichette: DBInstanceIdentifier
Descrizione dell'allarme: allarme quando le connessioni al database superano la soglia per un'istanza RDS.
Intento: impedire che le connessioni rifiutate raggiungano il limite massimo.
Criteri ProMQL:
avg({__name__="DatabaseConnections", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) >THRESHOLDSoglia consigliata:
THRESHOLD(incorporata nella query)Giustificazione della soglia: impostata sulla percentuale del parametro max_connections.
Intervallo di valutazione: 60
Periodo in sospeso: 300
Periodo di recupero: 300
- EBSByteBalance%
-
Etichette: DBInstanceIdentifier
Descrizione dell'allarme: allarme quando il saldo di byte EBS scende al di sotto del 10% per un'istanza RDS.
Intento: rilevare crediti a bassa produttività che causano strozzature.
Criteri ProMQL:
avg({__name__="EBSByteBalance%", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) < 10Soglia consigliata: 10 (incorporata nella query)
Giustificazione della soglia: al di sotto del 10% si rischia una degradazione della produttività.
Intervallo di valutazione: 60
Periodo in sospeso: 180
Periodo di recupero: 180
- EBSIOBalance%
-
Etichette: DBInstanceIdentifier
Descrizione dell'allarme: allarme quando il saldo I/O di EBS scende al di sotto del 10% per un'istanza RDS.
Intento: rilevare crediti IOPS bassi che causano strozzature.
Criteri ProMQL:
avg({__name__="EBSIOBalance%", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) < 10Soglia consigliata: 10 (incorporata nella query)
Giustificazione della soglia: al di sotto del 10% si rischia una degradazione dell'IOPS.
Intervallo di valutazione: 60
Periodo in sospeso: 180
Periodo di recupero: 180
- FreeableMemory
-
Etichette: DBInstanceIdentifier
Descrizione dell'allarme: allarme quando la memoria liberabile scende al di sotto della soglia per un'istanza RDS.
Intento: evitare che l'esaurimento della memoria causi il rifiuto delle connessioni.
Criteri ProMQL:
avg({__name__="FreeableMemory", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) <THRESHOLDSoglia consigliata:
THRESHOLD(incorporata nella query)Giustificazione della soglia: impostata in base alla memoria della classe di istanza.
Intervallo di valutazione: 60
Periodo di attesa: 900
Periodo di recupero: 900
- FreeLocalStorage
-
Etichette: DBInstanceIdentifier
Descrizione dell'allarme: si attiva quando l'archiviazione locale gratuita scende al di sotto della soglia per un'istanza Aurora.
Intento: impedire l'esaurimento dello storage locale di Aurora.
Criteri ProMQL:
avg({__name__="FreeLocalStorage", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) <THRESHOLDSoglia consigliata:
THRESHOLD(incorporata nella query)Giustificazione della soglia: impostata in base al minimo richiesto per le operazioni.
Intervallo di valutazione: 60
Periodo in sospeso: 300
Periodo di recupero: 300
- FreeStorageSpace
-
Etichette: DBInstanceIdentifier
Descrizione dell'allarme: allarme quando lo spazio di archiviazione libero scende al di sotto della soglia per un'istanza RDS.
Intento: prevenire i tempi di inattività completi dello storage.
Criteri ProMQL:
min({__name__="FreeStorageSpace", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) <THRESHOLDSoglia consigliata:
THRESHOLD(incorporata nella query)Giustificazione della soglia: impostata in base al tasso di crescita dello storage e alle dimensioni previste.
Intervallo di valutazione: 60
Periodo in sospeso: 300
Periodo di recupero: 300
- MaximumUsedTransactionIDs
-
Etichette: DBInstanceIdentifier
Descrizione dell'allarme: allarme quando il numero massimo di ID di transazione utilizzati supera 1 miliardo per un'istanza RDS.
Intento: impedire la sovrapposizione degli ID delle transazioni PostgreSQL.
Criteri ProMQL:
avg({__name__="MaximumUsedTransactionIDs", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > 1000000000Soglia consigliata: 1000000000 (incorporata nella query)
Giustificazione della soglia: 1 miliardo indica un pericolo imminente.
Intervallo di valutazione: 60
Periodo in sospeso: 60
Periodo di recupero: 60
- ReadLatency
-
Etichette: DBInstanceIdentifier
Descrizione dell'allarme: allarme quando la latenza di lettura di p90 supera la soglia per un'istanza RDS.
Intento: rileva un'elevata latenza di lettura che indica problemi con il disco.
Criteri ProMQL:
histogram_quantile(0.9, {__name__="ReadLatency", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) >THRESHOLDSoglia consigliata:
THRESHOLD(incorporata nella query)Giustificazione della soglia: impostata in base alla latenza accettabile dell'applicazione.
Intervallo di valutazione: 60
Periodo in sospeso: 300
Periodo di recupero: 300
- ReplicaLag
-
Etichette: DBInstanceIdentifier
Descrizione dell'allarme: allarme quando il ritardo di replica supera i 60 secondi per una replica di lettura RDS.
Intento: rilevare il ritardo nella replica con il rischio di perdita dei dati.
Criteri ProMQL:
max({__name__="ReplicaLag", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > 60Soglia consigliata: 60 (incorporata nella query)
Giustificazione della soglia: 60 secondi rappresentano un ritardo significativo per la maggior parte dei carichi di lavoro.
Intervallo di valutazione: 60
Periodo in sospeso: 600
Periodo di recupero: 600
- WriteLatency
-
Etichette: DBInstanceIdentifier
Descrizione dell'allarme: allarme quando la latenza di scrittura p90 supera la soglia per un'istanza RDS.
Intento: rileva un'elevata latenza di scrittura che indica problemi con il disco.
Criteri ProMQL:
histogram_quantile(0.9, {__name__="WriteLatency", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) >THRESHOLDSoglia consigliata:
THRESHOLD(incorporata nella query)Giustificazione della soglia: impostata in base alla latenza accettabile dell'applicazione.
Intervallo di valutazione: 60
Periodo in sospeso: 300
Periodo di recupero: 300
- DBLoad
-
Etichette: DBInstanceIdentifier
Descrizione dell'allarme: allarme quando il carico medio del database supera la soglia per un'istanza RDS.
Intento: rilevare un carico elevato del database che riduce le prestazioni.
Criteri ProMQL:
avg({__name__="DBLoad", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) >THRESHOLDSoglia consigliata:
THRESHOLD(incorporata nella query)Giustificazione della soglia: impostata su un numero multiplo del numero di vCPU.
Intervallo di valutazione: 60
Periodo di attesa: 900
Periodo di recupero: 900
- AuroraVolumeBytesLeftTotal
-
Etichette: DBClusterIdentifier
Descrizione dell'allarme: si attiva quando i byte di archiviazione rimanenti del cluster Aurora scendono al di sotto della soglia.
Intento: impedire l'esaurimento dello storage del cluster Aurora.
Criteri ProMQL:
avg({__name__="AuroraVolumeBytesLeftTotal", "@instrumentation.@name"="cloudwatch.aws/rds", DBClusterIdentifier="CLUSTER"}) <THRESHOLDSoglia consigliata:
THRESHOLD(incorporata nella query)Giustificazione della soglia: impostata in base al tasso di crescita.
Intervallo di valutazione: 60
Periodo in sospeso: 300
Periodo di recupero: 300
- AuroraBinlogReplicaLag
-
Etichette: DBClusterIdentifier
Descrizione dell'allarme: allarme quando il ritardo di replica di Aurora binlog indica uno stato di errore.
Intento: rilevare gli errori di replica delle istanze di writer.
Criteri ProMQL:
avg({__name__="AuroraBinlogReplicaLag", "@instrumentation.@name"="cloudwatch.aws/rds", DBClusterIdentifier="CLUSTER"}) <= -1Soglia consigliata: -1 (incorporata nella query)
Giustificazione della soglia: -1 indica lo stato di errore.
Intervallo di valutazione: 60
Periodo in sospeso: 120
Periodo di recupero: 120
- BlockedTransactions
-
Etichette: DBInstanceIdentifier
Descrizione dell'allarme: allarme quando il conteggio delle transazioni bloccate supera la soglia per un'istanza RDS.
Intento: rilevare il blocco delle transazioni che causa un peggioramento delle prestazioni.
Criteri ProMQL:
avg({__name__="BlockedTransactions", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) >THRESHOLDSoglia consigliata:
THRESHOLD(incorporata nella query)Giustificazione della soglia: impostata in base al numero di transazioni bloccate accettabile.
Intervallo di valutazione: 60
Periodo in sospeso: 300
Periodo di recupero: 300
- BufferCacheHitRatio
-
Etichette: DBInstanceIdentifier
Descrizione dell'allarme: allarme quando l'hit ratio del buffer cache scende al di sotto dell'80% per un'istanza RDS.
Intento: rilevare una bassa efficienza della cache che causa una riduzione delle prestazioni.
Criteri ProMQL:
avg({__name__="BufferCacheHitRatio", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) < 80Soglia consigliata: 80 (incorporata nella query)
Giustificazione della soglia: inferiore all'80% indica un numero eccessivo di dischi I/O.
Intervallo di valutazione: 60
Periodo in sospeso: 600
Periodo di recupero: 600
- EngineUptime
-
Etichette: DBClusterIdentifier
Descrizione dell'allarme: allarme quando il tempo di attività del motore scende a zero, indicando il riavvio dello scrittore Aurora.
Intento: rilevare i tempi di inattività o l'arresto anomalo dell'istanza di Aurora writer.
Criteri ProMQL:
avg({__name__="EngineUptime", "@instrumentation.@name"="cloudwatch.aws/rds", DBClusterIdentifier="CLUSTER"}) <= 0Soglia consigliata: 0 (incorporata nella query)
Giustificazione della soglia: il tempo di attività zero indica il riavvio dell'istanza.
Intervallo di valutazione: 60
Periodo in sospeso: 120
Periodo di recupero: 120
- RollbackSegmentHistoryListLength
-
Etichette: DBInstanceIdentifier
Descrizione dell'allarme: si attiva quando la lunghezza dell'elenco della cronologia dei segmenti di rollback supera 1 milione per un'istanza Aurora.
Intento: rileva una cronologia di rollback elevata che causa il degrado della CPU.
Criteri ProMQL:
avg({__name__="RollbackSegmentHistoryListLength", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > 1000000Soglia consigliata: 1000000 (incorporata nella query)
Giustificazione della soglia: una soglia superiore a 1 milione causa problemi di prestazioni.
Intervallo di valutazione: 60
Periodo in sospeso: 300
Periodo di recupero: 300
- StorageNetworkThroughput
-
Etichette: DBClusterIdentifier
Descrizione dell'allarme: allarme quando il throughput della rete di storage supera la soglia per un cluster Aurora.
Intento: rilevare un throughput elevato con il rischio di interruzioni dei pacchetti di rete.
Criteri ProMQL:
avg({__name__="StorageNetworkThroughput", "@instrumentation.@name"="cloudwatch.aws/rds", DBClusterIdentifier="CLUSTER"}) >THRESHOLDSoglia consigliata:
THRESHOLD(incorporata nella query)Giustificazione della soglia: impostata in base alla capacità di rete dell'istanza.
Intervallo di valutazione: 60
Periodo in sospeso: 300
Periodo di recupero: 300
Route 53
- HealthCheckStatus
-
Etichette: HealthCheckId
Descrizione dell'allarme: allarme quando un controllo dello stato di Route 53 riporta un endpoint non integro.
Intento: rilevare gli endpoint non integri utilizzando gli strumenti di controllo dello stato di Route 53.
Criteri ProMQL:
avg({__name__="HealthCheckStatus", "@instrumentation.@name"="cloudwatch.aws/route53", HealthCheckId="HC"}) < 1Soglia consigliata: 1 (incorporata nella query)
Giustificazione della soglia: un valore inferiore a 1 indica che l'endpoint non supera i controlli sanitari.
Intervallo di valutazione: 60
Periodo in sospeso: 180
Periodo di recupero: 180
S3
- 4xxErrors
-
Etichette: BucketName, FilterId
Descrizione dell'allarme: allarme quando il tasso di errore 4xx supera il 5% per un bucket S3.
Intento: rilevare tassi di errore anomali dei clienti.
Criteri ProMQL:
avg({__name__="4xxErrors", "@instrumentation.@name"="cloudwatch.aws/s3", BucketName="BUCKET",FilterId="FILTER"}) > 0.05Soglia consigliata: 0,05 (incorporata nella query)
Giustificazione della soglia: un valore superiore al 5% indica problemi di configurazione o accesso.
Intervallo di valutazione: 60
Periodo di attesa: 900
Periodo di recupero: 900
- 5xxErrors
-
Etichette: BucketName, FilterId
Descrizione dell'allarme: allarme quando il tasso di errore 5xx supera il 5% per un bucket S3.
Intento: rilevare gli errori sul lato server che riguardano l'applicazione.
Criteri ProMQL:
avg({__name__="5xxErrors", "@instrumentation.@name"="cloudwatch.aws/s3", BucketName="BUCKET",FilterId="FILTER"}) > 0.05Soglia consigliata: 0,05 (incorporata nella query)
Giustificazione della soglia: un valore superiore al 5% indica problemi con il servizio S3.
Intervallo di valutazione: 60
Periodo di attesa: 900
Periodo di recupero: 900
- OperationsFailedReplication
-
Etichette: SourceBucket, DestinationBucket, RuleId
Descrizione dell'allarme: allarme quando le operazioni di replica S3 falliscono per un bucket.
Intento: rilevare gli errori di replica che rischiano l'incoerenza dei dati.
Criteri ProMQL:
max({__name__="OperationsFailedReplication", "@instrumentation.@name"="cloudwatch.aws/s3", SourceBucket="SRC",DestinationBucket="DST",RuleId="RULE"}) > 0Soglia consigliata: 0 (incorporata nella query)
Giustificazione della soglia: qualsiasi replica non riuscita richiede un'indagine.
Intervallo di valutazione: 60
Periodo in sospeso: 300
Periodo di recupero: 300
S3 Object Lambda
- 4xxErrors
-
Etichette: AccessPointName, DataSource ARN
Descrizione dell'allarme: allarme quando il tasso di errore 4xx supera il 5% per un access point S3 Object Lambda.
Intento: rileva tassi di errore anomali dei client per Object Lambda.
Criteri ProMQL:
avg({__name__="4xxErrors", "@instrumentation.@name"="cloudwatch.aws/s3objectlambda", AccessPointName="AP",DataSourceARN="ARN"}) > 0.05Soglia consigliata: 0,05 (incorporata nella query)
Giustificazione della soglia: un valore superiore al 5% indica problemi di configurazione.
Intervallo di valutazione: 60
Periodo di attesa: 900
Periodo di recupero: 900
- 5xxErrors
-
Etichette: AccessPointName, DataSource ARN
Descrizione dell'allarme: allarme quando il tasso di errore 5xx supera il 5% per un access point S3 Object Lambda.
Intento: rileva gli errori sul lato server in Object Lambda.
Criteri ProMQL:
avg({__name__="5xxErrors", "@instrumentation.@name"="cloudwatch.aws/s3objectlambda", AccessPointName="AP",DataSourceARN="ARN"}) > 0.05Soglia consigliata: 0,05 (incorporata nella query)
Giustificazione della soglia: un valore superiore al 5% indica problemi relativi a Lambda o S3.
Intervallo di valutazione: 60
Periodo di attesa: 900
Periodo di recupero: 900
- LambdaResponse4xx
-
Etichette: AccessPointName, DataSource ARN
Descrizione dell'allarme: allarme quando il tasso di risposta della funzione Lambda 4xx supera il 5% per un access point S3 Object Lambda.
Intento: rilevare gli errori del client della funzione Lambda.
Criteri ProMQL:
avg({__name__="LambdaResponse4xx", "@instrumentation.@name"="cloudwatch.aws/s3objectlambda", AccessPointName="AP",DataSourceARN="ARN"}) > 0.05Soglia consigliata: 0,05 (incorporata nella query)
Giustificazione della soglia: un valore superiore al 5% indica problemi relativi alla funzione Lambda.
Intervallo di valutazione: 60
Periodo di attesa: 900
Periodo di recupero: 900
SNS
- NumberOfMessagesPublished
-
Etichette: TopicName
Descrizione dell'allarme: avviso quando il numero di messaggi pubblicati scende al di sotto della soglia per un argomento SNS.
Intento: rileva un calo significativo del volume di pubblicazione.
Criteri ProMQL:
sum({__name__="NumberOfMessagesPublished", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) <THRESHOLDSoglia consigliata:
THRESHOLD(incorporata nella query)Giustificazione della soglia: impostata in base al traffico minimo previsto.
Intervallo di valutazione: 60
Periodo in sospeso: 300
Periodo di recupero: 300
- NumberOfNotificationsDelivered
-
Etichette: TopicName
Descrizione dell'allarme: allarme quando il numero di notifiche inviate scende al di sotto della soglia per un argomento SNS.
Intento: rileva un calo del volume di invio delle notifiche.
Criteri ProMQL:
sum({__name__="NumberOfNotificationsDelivered", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) <THRESHOLDSoglia consigliata:
THRESHOLD(incorporata nella query)Giustificazione della soglia: impostata in base alle consegne minime previste.
Intervallo di valutazione: 60
Periodo in sospeso: 300
Periodo di recupero: 300
- NumberOfNotificationsFailed
-
Etichette: TopicName
Descrizione dell'allarme: allarme quando il numero di notifiche non riuscite a recapitare supera la soglia per un argomento SNS.
Intento: rilevare gli errori di consegna.
Criteri ProMQL:
sum({__name__="NumberOfNotificationsFailed", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) >THRESHOLDSoglia consigliata:
THRESHOLD(incorporata nella query)Giustificazione della soglia: impostata in base al tasso di errore accettabile.
Intervallo di valutazione: 60
Periodo in sospeso: 300
Periodo di recupero: 300
- NumberOfNotificationsFilteredOut-InvalidAttributes
-
Etichette: TopicName
Descrizione dell'allarme: allarme quando le notifiche vengono filtrate a causa di attributi del messaggio non validi.
Intento: rileva gli attributi dei messaggi non validi.
Criteri ProMQL:
sum({__name__="NumberOfNotificationsFilteredOut-InvalidAttributes", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) > 0Soglia consigliata: 0 (incorporata nella query)
Giustificazione della soglia: qualsiasi filtro non valido indica una configurazione errata.
Intervallo di valutazione: 60
Periodo in sospeso: 300
Periodo di recupero: 300
- NumberOfNotificationsFilteredOut-InvalidMessageBody
-
Etichette: TopicName
Descrizione dell'allarme: allarme quando le notifiche vengono filtrate a causa di messaggi non validi.
Intento: rileva i corpi dei messaggi non validi.
Criteri ProMQL:
sum({__name__="NumberOfNotificationsFilteredOut-InvalidMessageBody", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) > 0Soglia consigliata: 0 (incorporata nella query)
Giustificazione della soglia: qualsiasi filtro non valido indica una configurazione errata.
Intervallo di valutazione: 60
Periodo in sospeso: 300
Periodo di recupero: 300
- NumberOfNotificationsRedrivenToDlq
-
Etichette: TopicName
Descrizione dell'allarme: allarme quando le notifiche vengono inviate alla coda delle lettere morte per un argomento SNS.
Intento: rileva i messaggi inviati alla coda delle lettere morte.
Criteri ProMQL:
sum({__name__="NumberOfNotificationsRedrivenToDlq", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) > 0Soglia consigliata: 0 (incorporata nella query)
Giustificazione della soglia: qualsiasi messaggio DLQ indica problemi di consegna.
Intervallo di valutazione: 60
Periodo in sospeso: 300
Periodo di recupero: 300
- NumberOfNotificationsFailedToRedriveToDlq
-
Etichette: TopicName
Descrizione dell'allarme: allarme quando le notifiche non vengono inviate alla coda delle lettere morte per un argomento SNS.
Intento: rilevare errori di consegna DLQ.
Criteri ProMQL:
sum({__name__="NumberOfNotificationsFailedToRedriveToDlq", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) > 0Soglia consigliata: 0 (incorporata nella query)
Giustificazione della soglia: un DLQ non riuscito significa perdita del tracciamento degli errori.
Intervallo di valutazione: 60
Periodo di attesa: 300
Periodo di recupero: 300
- SMSMonthToDateSpentUSD
-
Etichette: TopicName
Descrizione dell'allarme: allarme quando la spesa via SMS si avvicina alla quota dell'account per un argomento SNS.
Intento: rileva che la spesa per SMS si avvicina alla quota.
Criteri ProMQL:
max({__name__="SMSMonthToDateSpentUSD", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) >THRESHOLDSoglia consigliata:
THRESHOLD(incorporata nella query)Giustificazione della soglia: impostata in base alla quota SMS dell'account.
Intervallo di valutazione: 60
Periodo in sospeso: 300
Periodo di recupero: 300
- SMSSuccessRate
-
Etichette: TopicName
Descrizione dell'allarme: allarme quando la percentuale di successo della consegna degli SMS scende al di sotto della soglia per un argomento SNS.
Intento: rilevare le consegne di SMS non riuscite.
Criteri ProMQL:
avg({__name__="SMSSuccessRate", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) <THRESHOLDSoglia consigliata:
THRESHOLD(incorporata nella query)Giustificazione della soglia: impostata in base a un tasso di consegna accettabile.
Intervallo di valutazione: 60
Periodo in sospeso: 300
Periodo di recupero: 300
SQS
- ApproximateAgeOfOldestMessage
-
Etichette: QueueName
Descrizione dell'allarme: allarme quando l'età del messaggio più vecchio supera la soglia per una coda SQS.
Intento: rileva i messaggi che non vengono elaborati con sufficiente rapidità.
Criteri ProMQL:
max({__name__="ApproximateAgeOfOldestMessage", "@instrumentation.@name"="cloudwatch.aws/sqs", QueueName="QUEUE"}) >THRESHOLDSoglia consigliata:
THRESHOLD(incorporata nella query)Giustificazione della soglia: impostata in base al tempo di elaborazione dei messaggi accettabile.
Intervallo di valutazione: 60
Periodo di attesa: 900
Periodo di recupero: 900
- ApproximateNumberOfMessagesNotVisible
-
Etichette: QueueName
Descrizione dell'allarme: allarme quando il numero di messaggi in volo supera la soglia per una coda SQS.
Intento: rilevare i messaggi in volo ad alta frequenza che indicano problemi con i consumatori.
Criteri ProMQL:
avg({__name__="ApproximateNumberOfMessagesNotVisible", "@instrumentation.@name"="cloudwatch.aws/sqs", QueueName="QUEUE"}) >THRESHOLDSoglia consigliata:
THRESHOLD(incorporata nella query)Giustificazione della soglia: impostata in base al volume di elaborazione previsto.
Intervallo di valutazione: 60
Periodo di attesa: 900
Periodo di recupero: 900
- ApproximateNumberOfMessagesVisible
-
Etichette: QueueName
Descrizione dell'allarme: allarme quando il numero di messaggi visibili supera la soglia per una coda SQS.
Intento: rilevare un arretrato di messaggi indicante la lentezza dei consumatori.
Criteri ProMQL:
avg({__name__="ApproximateNumberOfMessagesVisible", "@instrumentation.@name"="cloudwatch.aws/sqs", QueueName="QUEUE"}) >THRESHOLDSoglia consigliata:
THRESHOLD(incorporata nella query)Giustificazione della soglia: impostata in base alla profondità della coda prevista.
Intervallo di valutazione: 60
Periodo di attesa: 900
Periodo di recupero: 900
- NumberOfMessagesSent
-
Etichette: QueueName
Descrizione dell'allarme: allarme quando nessun messaggio viene inviato a una coda SQS.
Intento: rilevare che i produttori hanno smesso di inviare messaggi.
Criteri ProMQL:
sum({__name__="NumberOfMessagesSent", "@instrumentation.@name"="cloudwatch.aws/sqs", QueueName="QUEUE"}) <= 0Soglia consigliata: 0 (incorporata nella query)
Giustificazione della soglia: zero messaggi indica un errore del produttore.
Intervallo di valutazione: 60
Periodo di attesa: 900
Periodo di recupero: 900
VPN
- TunnelState (livello VPN)
-
Etichette: VpnId
Descrizione dell'allarme: allarme quando almeno un tunnel VPN è in stato DOWN.
Intento: rileva almeno un tunnel in stato DOWN.
Criteri ProMQL:
min({__name__="TunnelState", "@instrumentation.@name"="cloudwatch.aws/vpn", VpnId="VPN"}) < 1Soglia consigliata: 1 (incorporata nella query)
Giustificazione della soglia: un valore inferiore a 1 indica che il tunnel non è attivo.
Intervallo di valutazione: 300
Periodo in sospeso: 900
Periodo di recupero: 900
- TunnelState (Livello del tunnel)
-
Etichette: TunnelIpAddress
Descrizione dell'allarme: allarme quando uno specifico tunnel VPN è in stato DOWN.
Intento: rileva un tunnel specifico in stato DOWN.
Criteri ProMQL:
min({__name__="TunnelState", "@instrumentation.@name"="cloudwatch.aws/vpn", TunnelIpAddress="IP"}) < 1Soglia consigliata: 1 (incorporata nella query)
Giustificazione della soglia: un valore inferiore a 1 indica che il tunnel non è attivo.
Intervallo di valutazione: 300
Periodo in sospeso: 900
Periodo di recupero: 900