Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.
Empfohlene PromQL-Alarme
Verwenden Sie diese PromQL-Alarme als Äquivalente zu den klassischen empfohlenen Alarmen. Sie überwachen dieselben Metriken mithilfe von PromQL-Sofortabfragen, die anhand der über den OTLP-Endpunkt aufgenommenen Metriken ausgewertet werden. CloudWatch
PromQL-Alarme werden mit verwendet. EvaluationCriteria PromQLCriteria Im Gegensatz zu klassischen metrischen Alarmen ist der Schwellenwert direkt in den PromQL-Abfrageausdruck eingebettet.
-
Wartezeit — Die Dauer in Sekunden, die eine Zeitreihe kontinuierlich überschreiten muss, bevor der Alarm in den ALARM-Zustand übergeht.
-
Wiederherstellungszeitraum — Die Dauer in Sekunden, die alle Zeitreihen nicht mehr durchbrechen müssen, bevor der Alarm wieder in den Zustand OK zurückkehrt.
-
Testintervall — Gibt an, wie oft (in Sekunden) die PromQL-Abfrage CloudWatch ausgeführt wird.
Anmerkung
Für diese Alarme sind Metriken erforderlich, die über den CloudWatch OTLP-Endpunkt veröffentlicht werden. Weitere Informationen finden Sie unter PromQL-Alarme.
Sie können diese Alarme mithilfe AWS CloudFormation von bereitstellen. Verwenden Sie die PromQLCriteria Eigenschaften EvaluationCriteria und für die AWS::CloudWatch::Alarm Ressource.
API Gateway
REST-API
- 4XXError
-
Beschriftungen: ApiName, Stufe
Beschreibung des Alarms: Alarm, wenn die durchschnittliche 4XX-Fehlerrate in einer REST-API-Phase 5% übersteigt.
Absicht: Erkennt eine hohe Client-Fehlerrate, die auf Probleme mit Anfragen hinweist.
PromQL-Kriterien:
avg({__name__="4XXError", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiName="your-api-name",Stage="your-stage"}) > 0.05Empfohlener Schwellenwert: 0,05 (eingebettet in die Abfrage)
Rechtfertigung des Schwellenwerts: Erkennt eine Client-Fehlerrate von über 5%, was auf signifikante Anforderungsfehler hindeutet.
Bewertungsintervall: 60
Wartezeit: 300
Erholungsphase: 300
- 5XXError
-
Beschriftungen: ApiName, Stufe
Beschreibung des Alarms: Alarm, wenn die durchschnittliche 5XX-Fehlerrate in einer REST-API-Phase 5% übersteigt.
Absicht: Erkennt eine hohe Serverfehlerrate, die auf Backend-Ausfälle hindeutet.
PromQL-Kriterien:
avg({__name__="5XXError", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiName="your-api-name",Stage="your-stage"}) > 0.05Empfohlener Schwellenwert: 0,05 (eingebettet in die Abfrage)
Rechtfertigung des Schwellenwerts: Erkennt eine Serverfehlerrate von über 5%, weshalb eine sofortige Untersuchung erforderlich ist.
Bewertungsintervall: 60
Wartezeit: 180
Erholungszeit: 300
- Latency
-
Beschriftungen: ApiName, Stufe
Alarmbeschreibung: Alarm, wenn die p90-Latenz für eine REST-API-Stufe 2500 ms überschreitet.
Absicht: Erkennt eine hohe p90-Latenz, die das Nutzererlebnis beeinträchtigt.
PromQL-Kriterien:
histogram_quantile(0.9, {__name__="Latency", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiName="your-api-name",Stage="your-stage"}) > 2500Empfohlener Schwellenwert: 2500 (eingebettet in die Abfrage)
Rechtfertigung des Schwellenwerts: Eine p90-Latenz von über 2500 ms weist auf verringerte Antwortzeiten für die meisten Anfragen hin.
Bewertungsintervall: 60
Wartezeit: 300
Erholungsphase: 300
- Count
-
Beschriftungen: ApiName, Stufe
Beschreibung des Alarms: Alarm, wenn die Gesamtzahl der Anfragen unter den erwarteten Ausgangswert für eine REST-API-Phase fällt.
Absicht: Erkennt ein niedriges Verkehrsaufkommen, das auf Routing- oder Verfügbarkeitsprobleme hinweisen könnte.
PromQL-Kriterien:
sum({__name__="Count", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiName="your-api-name",Stage="your-stage"}) <THRESHOLDEmpfohlener Schwellenwert:
THRESHOLD(in die Abfrage eingebettet)Rechtfertigung des Schwellenwerts: Legen Sie ihn auf der Grundlage Ihrer erwarteten Verkehrsbasislinie fest, um unerwartete Verkehrsrückgänge zu erkennen.
Bewertungsintervall: 60
Wartezeit: 600
Erholungsphase: 300
HTTP-API
- 4xx
-
Beschriftungen: ApiId, Bühne
Beschreibung des Alarms: Alarm, wenn die durchschnittliche 4xx-Fehlerrate in einer HTTP-API-Stufe 5% übersteigt.
Absicht: Erkennt eine hohe Client-Fehlerrate auf HTTP-API-Endpunkten.
PromQL-Kriterien:
avg({__name__="4xx", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="your-api-id",Stage="your-stage"}) > 0.05Empfohlener Schwellenwert: 0,05 (eingebettet in die Abfrage)
Begründung des Schwellenwerts: Erkennt eine Client-Fehlerrate von über 5%.
Bewertungsintervall: 60
Wartezeit: 300
Erholungsphase: 300
- 5xx
-
Beschriftungen: ApiId, Stufe
Beschreibung des Alarms: Alarm, wenn die durchschnittliche 5xx-Fehlerrate in einer HTTP-API-Stufe 5% übersteigt.
Absicht: Erkennt eine hohe Serverfehlerrate auf HTTP-API-Endpunkten.
PromQL-Kriterien:
avg({__name__="5xx", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="your-api-id",Stage="your-stage"}) > 0.05Empfohlener Schwellenwert: 0,05 (eingebettet in die Abfrage)
Rechtfertigung des Schwellenwerts: Erkennt eine Serverfehlerrate von über 5%, die untersucht werden müssen.
Bewertungsintervall: 60
Wartezeit: 180
Erholungszeit: 300
- Latency
-
Beschriftungen: ApiId, Stufe
Alarmbeschreibung: Alarm, wenn die p90-Latenz für eine HTTP-API-Stufe 2500 ms überschreitet.
Absicht: Erkennt eine hohe p90-Latenz auf HTTP-API-Endpunkten.
PromQL-Kriterien:
histogram_quantile(0.9, {__name__="Latency", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="your-api-id",Stage="your-stage"}) > 2500Empfohlener Schwellenwert: 2500 (eingebettet in die Abfrage)
Rechtfertigung des Schwellenwerts: Eine p90-Latenz von über 2500 ms weist auf eine Verschlechterung der Reaktionszeiten hin.
Bewertungsintervall: 60
Wartezeit: 300
Erholungsphase: 300
- IntegrationLatency
-
Beschriftungen: ApiId, Stufe
Beschreibung des Alarms: Alarm, wenn die Latenz der p90-Integration in einer HTTP-API-Stufe 2000 ms überschreitet.
Absicht: Erkennt eine hohe Latenz bei der Backend-Integration, die sich auf die Reaktionszeiten auswirkt.
PromQL-Kriterien:
histogram_quantile(0.9, {__name__="IntegrationLatency", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="your-api-id",Stage="your-stage"}) > 2000Empfohlener Schwellenwert: 2000 (eingebettet in die Abfrage)
Rechtfertigung des Schwellenwerts: Eine p90-Integrationslatenz von über 2000 ms weist auf eine Langsamkeit des Back-Ends hin.
Bewertungsintervall: 60
Wartezeit: 300
Erholungsphase: 300
- Count
-
Beschriftungen: ApiId, Stufe
Beschreibung des Alarms: Alarm, wenn die Gesamtzahl der Anfragen unter den erwarteten Ausgangswert für eine HTTP-API-Stufe fällt.
Absicht: Erkennt ein niedriges Verkehrsaufkommen, das auf Routing- oder Verfügbarkeitsprobleme hinweisen könnte.
PromQL-Kriterien:
sum({__name__="Count", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="your-api-id",Stage="your-stage"}) <THRESHOLDEmpfohlener Schwellenwert:
THRESHOLD(in die Abfrage eingebettet)Rechtfertigung des Schwellenwerts: Legen Sie ihn auf der Grundlage Ihrer erwarteten Verkehrsbasislinie fest, um unerwartete Verkehrsrückgänge zu erkennen.
Bewertungsintervall: 60
Wartezeit: 600
Erholungsphase: 300
WebSocket API
- ClientError
-
Beschriftungen: ApiId, Stufe
Beschreibung des Alarms: Alarm, wenn die durchschnittliche Client-Fehlerrate in einer WebSocket API-Stufe 5% übersteigt.
Absicht: Erkennt eine hohe Client-Fehlerrate bei WebSocket API-Verbindungen.
PromQL-Kriterien:
avg({__name__="ClientError", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="your-api-id",Stage="your-stage"}) > 0.05Empfohlener Schwellenwert: 0,05 (in die Abfrage eingebettet)
Rechtfertigung des Schwellenwerts: Erkennt eine Client-Fehlerrate von über 5% bei WebSocket Verbindungen.
Bewertungsintervall: 60
Wartezeit: 300
Erholungsphase: 300
- ExecutionError
-
Beschriftungen: ApiId, Stufe
Beschreibung des Alarms: Alarm, wenn die durchschnittliche Ausführungsfehlerrate in einer WebSocket API-Stufe 5% übersteigt.
Absicht: Erkennt eine hohe serverseitige Ausführungsfehlerrate bei WebSocket APIs.
PromQL-Kriterien:
avg({__name__="ExecutionError", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="your-api-id",Stage="your-stage"}) > 0.05Empfohlener Schwellenwert: 0,05 (eingebettet in die Abfrage)
Rechtfertigung des Schwellenwerts: Erkennt eine Ausführungsfehlerrate von mehr als 5%, die untersucht werden müssen.
Bewertungsintervall: 60
Wartezeit: 180
Erholungszeit: 300
- IntegrationLatency
-
Beschriftungen: ApiId, Stufe
Beschreibung des Alarms: Alarm, wenn die Latenz der p90-Integration für eine WebSocket API-Stufe 2000 ms überschreitet.
Absicht: Erkennt eine hohe Latenz bei der Backend-Integration auf WebSocket API-Routen.
PromQL-Kriterien:
histogram_quantile(0.9, {__name__="IntegrationLatency", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="your-api-id",Stage="your-stage"}) > 2000Empfohlener Schwellenwert: 2000 (eingebettet in die Abfrage)
Rechtfertigung des Schwellenwerts: Eine p90-Integrationslatenz von über 2000 ms weist auf eine Langsamkeit des Back-Ends hin.
Bewertungsintervall: 60
Wartezeit: 300
Erholungsphase: 300
- MessageCount
-
Beschriftungen: ApiId, Stufe
Beschreibung des Alarms: Alarm, wenn die Gesamtzahl der Nachrichten unter den erwarteten Ausgangswert für eine WebSocket API-Phase fällt.
Absicht: Erkennt ein niedriges Nachrichtenvolumen, das auf Verbindungs- oder Routing-Probleme hinweisen könnte.
PromQL-Kriterien:
sum({__name__="MessageCount", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="your-api-id",Stage="your-stage"}) <THRESHOLDEmpfohlener Schwellenwert:
THRESHOLD(in die Abfrage eingebettet)Rechtfertigung des Schwellenwerts: Wird auf der Grundlage Ihres erwarteten Nachrichtenvolumens festgelegt, um unerwartete Rückgänge zu erkennen.
Bewertungsintervall: 60
Wartezeit: 600
Erholungsphase: 300
Auto Scaling
- GroupInServiceCapacity
-
Etiketten: AutoScalingGroupName
Alarmbeschreibung: Alarm, wenn die durchschnittliche Kapazität im Betrieb unter das erwartete Minimum für eine Auto Scaling-Gruppe fällt.
Absicht: Erkennen Sie eine geringe Verfügbarkeit aufgrund von Startfehlern oder beendeten Instances.
PromQL-Kriterien:
avg({__name__="GroupInServiceCapacity", "@instrumentation.@name"="cloudwatch.aws/autoscaling", AutoScalingGroupName="your-auto-scaling-group-name"}) <THRESHOLDEmpfohlener Schwellenwert:
THRESHOLD(in die Abfrage eingebettet)Begründung des Schwellenwerts: Dieser Wert wird auf der Grundlage Ihrer gewünschten Mindestkapazität festgelegt, um Startfehler oder unzureichende Instances zu erkennen.
Bewertungsintervall: 60
Wartezeit: 600
Erholungsphase: 600
Zertifikatsmanager
- DaysToExpiry
-
Beschriftungen: CertificateArn
Beschreibung des Alarms: Alarm, wenn die Mindestdauer der Tage bis zum Ablauf des Zertifikats auf 44 Tage oder weniger sinkt.
Absicht: Proaktive Warnung vor Ablauf des Zertifikats, um Zeit für die Verlängerung zu haben.
PromQL-Kriterien:
min({__name__="DaysToExpiry", "@instrumentation.@name"="cloudwatch.aws/certificatemanager", CertificateArn="your-certificate-arn"}) <= 44Empfohlener Schwellenwert: 44 (eingebettet in die Abfrage)
Begründung des Schwellenwerts: Bietet ausreichend Vorlaufzeit bis zum Ablauf des Zertifikats, um den Erneuerungsprozess abzuschließen.
Bewertungsintervall: 86400
Wartezeit: 86400
Erholungsphase: 86400
CloudFront
- 5xxErrorRate
-
Etiketten: DistributionId
Beschreibung des Alarms: Alarm, wenn die durchschnittliche Fehlerrate von 5xx den Schwellenwert für eine CloudFront Verteilung überschreitet.
Absicht: Erkennt eine hohe Herkunft oder eine hohe CloudFront Fehlerrate, die sich auf die Inhaltsbereitstellung auswirkt.
PromQL-Kriterien:
avg({__name__="5xxErrorRate", "@instrumentation.@name"="cloudwatch.aws/cloudfront", DistributionId="your-distribution-id"}) >THRESHOLDEmpfohlener Schwellenwert:
THRESHOLD(in die Abfrage eingebettet)Begründung des Schwellenwerts: Dieser Wert wird auf der Grundlage Ihrer akzeptablen Fehlerquote bei der Bereitstellung von Inhalten festgelegt.
Bewertungsintervall: 60
Wartezeit: 300
Erholungsphase: 300
- OriginLatency
-
Etiketten: DistributionId
Beschreibung des Alarms: Alarm, wenn die P90-Ursprungslatenz den Schwellenwert für eine CloudFront Verteilung überschreitet.
Absicht: Erkennt eine hohe Latenz bei der Ursprungsantwort, die die Leistung bei der Inhaltsbereitstellung beeinträchtigt.
PromQL-Kriterien:
histogram_quantile(0.9, {__name__="OriginLatency", "@instrumentation.@name"="cloudwatch.aws/cloudfront", DistributionId="your-distribution-id"}) >THRESHOLDEmpfohlener Schwellenwert:
THRESHOLD(in die Abfrage eingebettet)Rechtfertigung des Schwellenwerts: Dieser Wert wird auf der Grundlage Ihrer erwarteten Antwortzeit bei der Herkunft und der Caching-Strategie festgelegt.
Bewertungsintervall: 60
Wartezeit: 300
Erholungsphase: 300
- FunctionValidationErrors
-
Etiketten: DistributionId, FunctionName
Beschreibung des Alarms: Alarm, wenn bei der CloudFront Funktionsüberprüfung Fehler auftreten.
Absicht: Erkennen Sie Fehler bei der CloudFront Funktionsüberprüfung, die die Funktionsausführung verhindern.
PromQL-Kriterien:
sum({__name__="FunctionValidationErrors", "@instrumentation.@name"="cloudwatch.aws/cloudfront", DistributionId="your-distribution-id",FunctionName="your-function-name"}) > 0Empfohlener Schwellenwert: 0 (eingebettet in die Abfrage)
Rechtfertigung des Schwellenwerts: Jeder Überprüfungsfehler weist auf ein Problem mit der Funktionskonfiguration hin, das Aufmerksamkeit erfordert.
Bewertungsintervall: 60
Wartezeit: 120
Erholungszeitraum: 120
- FunctionExecutionErrors
-
Etiketten: DistributionId, FunctionName
Beschreibung des Alarms: Alarm, wenn Fehler bei der CloudFront Funktionsausführung auftreten.
Absicht: Erkennt Laufzeitfehler in CloudFront Funktionen, die sich auf die Anforderungsverarbeitung auswirken.
PromQL-Kriterien:
sum({__name__="FunctionExecutionErrors", "@instrumentation.@name"="cloudwatch.aws/cloudfront", DistributionId="your-distribution-id",FunctionName="your-function-name"}) > 0Empfohlener Schwellenwert: 0 (eingebettet in die Abfrage)
Rechtfertigung des Schwellenwerts: Jeder Ausführungsfehler weist auf ein Laufzeitproblem im Funktionscode hin.
Bewertungsintervall: 60
Wartezeit: 300
Erholungsphase: 300
- FunctionThrottles
-
Etiketten: DistributionId, FunctionName
Beschreibung des Alarms: Alarm, wenn eine CloudFront Funktionsdrosselung auftritt.
Absicht: Erkennen Sie CloudFront Funktionseinschränkungen, die die Anforderungsverarbeitung beeinträchtigen könnten.
PromQL-Kriterien:
sum({__name__="FunctionThrottles", "@instrumentation.@name"="cloudwatch.aws/cloudfront", DistributionId="your-distribution-id",FunctionName="your-function-name"}) > 0Empfohlener Schwellenwert: 0 (eingebettet in die Abfrage)
Begründung des Schwellenwerts: Jede Drosselung deutet darauf hin, dass die Funktion die Rechengrenzen erreicht.
Bewertungsintervall: 60
Wartezeit: 300
Erholungsphase: 300
Cognito
- SignUpThrottles
-
Etiketten: UserPool, UserPoolClient
Beschreibung des Alarms: Alarm, wenn Ereignisse bei der Anmeldedrosselung den Schwellenwert für einen Benutzerpool überschreiten.
Absicht: Erkennt eine Drosselung der Registrierung, die neue Benutzerregistrierungen verhindert.
PromQL-Kriterien:
sum({__name__="SignUpThrottles", "@instrumentation.@name"="cloudwatch.aws/cognito", UserPool="your-user-pool",UserPoolClient="your-user-pool-client"}) >THRESHOLDEmpfohlener Schwellenwert:
THRESHOLD(in die Abfrage eingebettet)Begründung des Schwellenwerts: Dieser Wert wird auf der Grundlage Ihrer akzeptablen Drosselungsrate für Anmeldevorgänge festgelegt.
Bewertungsintervall: 60
Wartezeit: 300
Erholungsphase: 300
- SignInThrottles
-
Etiketten: UserPool, UserPoolClient
Beschreibung des Alarms: Alarm, wenn Ereignisse bei der Anmeldedrosselung den Schwellenwert für einen Benutzerpool überschreiten.
Absicht: Erkennt eine Drosselung der Anmeldung, die eine Benutzerauthentifizierung verhindert.
PromQL-Kriterien:
sum({__name__="SignInThrottles", "@instrumentation.@name"="cloudwatch.aws/cognito", UserPool="your-user-pool",UserPoolClient="your-user-pool-client"}) >THRESHOLDEmpfohlener Schwellenwert:
THRESHOLD(in die Abfrage eingebettet)Begründung des Schwellenwerts: Dieser Wert wird auf der Grundlage Ihrer akzeptablen Drosselrate für Anmeldevorgänge festgelegt.
Bewertungsintervall: 60
Wartezeit: 300
Erholungsphase: 300
- TokenRefreshThrottles
-
Etiketten: UserPool, UserPoolClient
Alarmbeschreibung: Alarm, wenn Drosselungsereignisse bei der Token-Aktualisierung den Schwellenwert für einen Benutzerpool überschreiten.
Absicht: Erkennt eine Drosselung der Token-Aktualisierung, die zu Sitzungsunterbrechungen führen kann.
PromQL-Kriterien:
sum({__name__="TokenRefreshThrottles", "@instrumentation.@name"="cloudwatch.aws/cognito", UserPool="your-user-pool",UserPoolClient="your-user-pool-client"}) >THRESHOLDEmpfohlener Schwellenwert:
THRESHOLD(in die Abfrage eingebettet)Begründung des Schwellenwerts: Dieser Wert wird auf der Grundlage Ihrer akzeptablen Drosselungsrate für Token-Aktualisierungsvorgänge festgelegt.
Bewertungsintervall: 60
Wartezeit: 300
Erholungsphase: 300
- FederationThrottles
-
Etiketten: UserPool UserPoolClient, IdentityProvider
Beschreibung des Alarms: Alarm, wenn Federation Throttle-Ereignisse den Schwellenwert für einen Identitätsanbieter für einen Benutzerpool überschreiten.
Absicht: Es wird eine Verbunddrosselung erkannt, die eine Verbundanmeldung verhindern könnte.
PromQL-Kriterien:
sum({__name__="FederationThrottles", "@instrumentation.@name"="cloudwatch.aws/cognito", UserPool="your-user-pool",UserPoolClient="your-user-pool-client",IdentityProvider="your-identity-provider"}) >THRESHOLDEmpfohlener Schwellenwert:
THRESHOLD(in die Abfrage eingebettet)Begründung des Schwellenwerts: Dieser Wert wird auf der Grundlage Ihrer akzeptablen Drosselungsrate für Verbundoperationen festgelegt.
Bewertungsintervall: 60
Wartezeit: 300
Erholungsphase: 300
DynamoDB
- AccountProvisionedReadCapacityUtilization
-
Beschriftungen: Keine
Beschreibung des Alarms: Alarm, wenn die Auslastung der bereitgestellten Lesekapazität auf Kontoebene 80% übersteigt.
Absicht: Erkennt, wenn sich die bereitgestellte Lesekapazität den Kontogrenzen nähert.
PromQL-Kriterien:
max({__name__="AccountProvisionedReadCapacityUtilization", "@instrumentation.@name"="cloudwatch.aws/dynamodb"}) > 80Empfohlener Schwellenwert: 80 (eingebettet in die Abfrage)
Begründung des Schwellenwerts: Bei einer Auslastung von 80% haben Sie nur begrenzten Spielraum, bevor Sie die Kontolimits erreichen.
Bewertungsintervall: 300
Wartezeit: 600
Erholungsphase: 600
- AccountProvisionedWriteCapacityUtilization
-
Beschriftungen: Keine
Beschreibung des Alarms: Alarm, wenn die auf Kontoebene bereitgestellte Schreibkapazität mehr als 80% ausnutzt.
Absicht: Erkennt, wenn sich die bereitgestellte Schreibkapazität den Kontogrenzen nähert.
PromQL-Kriterien:
max({__name__="AccountProvisionedWriteCapacityUtilization", "@instrumentation.@name"="cloudwatch.aws/dynamodb"}) > 80Empfohlener Schwellenwert: 80 (eingebettet in die Abfrage)
Begründung des Schwellenwerts: Bei einer Auslastung von 80% haben Sie nur begrenzten Spielraum, bevor Sie die Kontolimits erreichen.
Bewertungsintervall: 300
Wartezeit: 600
Erholungsphase: 600
- AgeOfOldestUnreplicatedRecord
-
Etiketten: TableName, DelegatedOperation
Beschreibung des Alarms: Alarm, wenn das Alter des ältesten nicht replizierten Datensatzes den Schwellenwert überschreitet.
Absicht: Erkennt Verzögerungen bei der Replikation, die zu veralteten Daten in globalen Tabellen führen könnten.
PromQL-Kriterien:
max({__name__="AgeOfOldestUnreplicatedRecord", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name",DelegatedOperation="your-operation"}) >THRESHOLDEmpfohlener Schwellenwert:
THRESHOLD(in die Abfrage eingebettet)Begründung des Schwellenwerts: Dieser Wert wird auf der Grundlage Ihrer Anforderungen an die Aktualität der Replikation festgelegt.
Bewertungsintervall: 300
Wartezeit: 900
Erholungsphase: 900
- FailedToReplicateRecordCount
-
Etiketten: TableName, DelegatedOperation
Beschreibung des Alarms: Alarm, wenn Datensätze in einer globalen Tabelle nicht repliziert werden können.
Absicht: Erkennung von Replikationsfehlern, die zu Dateninkonsistenzen zwischen Regionen führen.
PromQL-Kriterien:
sum({__name__="FailedToReplicateRecordCount", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name",DelegatedOperation="your-operation"}) > 0Empfohlener Schwellenwert: 0 (eingebettet in die Abfrage)
Rechtfertigung des Schwellenwerts: Jede fehlgeschlagene Replikation weist auf Probleme mit der Datenkonsistenz hin, die sofortige Aufmerksamkeit erfordern.
Bewertungsintervall: 60
Wartezeit: 60
Erholungsphase: 60
- ReadThrottleEvents
-
Beschriftungen: TableName
Beschreibung des Alarms: Alarm, wenn Read-Throttle-Ereignisse den Schwellenwert für eine Tabelle überschreiten.
Absicht: Es wird eine Lesedrosselung erkannt, die auf eine unzureichende bereitgestellte Kapazität hinweist.
PromQL-Kriterien:
sum({__name__="ReadThrottleEvents", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name"}) >THRESHOLDEmpfohlener Schwellenwert:
THRESHOLD(in die Abfrage eingebettet)Begründung des Schwellenwerts: Dieser Wert wird auf der Grundlage Ihrer akzeptablen Drosselzahl für Lesevorgänge festgelegt.
Bewertungsintervall: 60
Wartezeit: 300
Erholungsphase: 300
- ReadThrottleEvents (GSI)
-
Etiketten: TableName, GlobalSecondaryIndexName
Beschreibung des Alarms: Alarm, wenn Read-Throttle-Ereignisse den Schwellenwert für einen globalen sekundären Index überschreiten.
Absicht: Es wird eine Lesedrosselung auf einem GSI erkannt, die auf eine unzureichende Indexkapazität hinweist.
PromQL-Kriterien:
sum({__name__="ReadThrottleEvents", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name",GlobalSecondaryIndexName="your-index-name"}) >THRESHOLDEmpfohlener Schwellenwert:
THRESHOLD(in die Abfrage eingebettet)Begründung des Schwellenwerts: Dieser Wert wird auf der Grundlage Ihrer akzeptablen Drosselzahl für GSI-Lesevorgänge festgelegt.
Bewertungsintervall: 60
Wartezeit: 300
Erholungsphase: 300
- ReplicationLatency
-
Etiketten: TableName, ReceivingRegion
Beschreibung des Alarms: Alarm, wenn die durchschnittliche Replikationslatenz den Schwellenwert für eine globale Tabelle überschreitet.
Absicht: Erkennt eine hohe Replikationslatenz, die zu veralteten Lesevorgängen in Replikatregionen führen kann.
PromQL-Kriterien:
avg({__name__="ReplicationLatency", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name",ReceivingRegion="your-receiving-region"}) >THRESHOLDEmpfohlener Schwellenwert:
THRESHOLD(in die Abfrage eingebettet)Begründung des Schwellenwerts: Dieser Wert wird auf der Grundlage Ihrer Anforderungen an die Aktualität der Daten für Replikatregionen festgelegt.
Bewertungsintervall: 60
Wartezeit: 900
Erholungsphase: 900
- SuccessfulRequestLatency
-
Etiketten: TableName, Bedienung
Alarmbeschreibung: Alarm, wenn die durchschnittliche erfolgreiche Anforderungslatenz den Schwellenwert für eine Tabellenoperation überschreitet.
Absicht: Erkennt hohe Latenzen bei DynamoDB-Vorgängen, die sich auf die Anwendungsleistung auswirken.
PromQL-Kriterien:
avg({__name__="SuccessfulRequestLatency", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name",Operation="your-operation"}) >THRESHOLDEmpfohlener Schwellenwert:
THRESHOLD(in die Abfrage eingebettet)Begründung des Schwellenwerts: Dieser Wert wird auf der Grundlage Ihres Latenz-SLA für den jeweiligen DynamoDB-Vorgang festgelegt.
Bewertungsintervall: 60
Wartezeit: 600
Erholungsphase: 600
- SystemErrors
-
Beschriftungen: TableName
Beschreibung des Alarms: Alarm, wenn Systemfehler den Schwellenwert für eine Tabelle überschreiten.
Absicht: Erkennt dienstseitige DynamoDB-Fehler, die sich auf die Tabellenverfügbarkeit auswirken.
PromQL-Kriterien:
sum({__name__="SystemErrors", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name"}) >THRESHOLDEmpfohlener Schwellenwert:
THRESHOLD(in die Abfrage eingebettet)Begründung des Schwellenwerts: Dieser Wert wird auf der Grundlage Ihrer akzeptablen Anzahl von Systemfehlern für die Tabelle festgelegt.
Bewertungsintervall: 60
Wartezeit: 900
Erholungsphase: 900
- ThrottledPutRecordCount
-
Etiketten: TableName, DelegatedOperation
Beschreibung des Alarms: Alarm, wenn die Anzahl der Datensätze gedrosselt wird, den Schwellenwert für eine Tabelle überschreitet.
Absicht: Erkennt gedrosselte Puts, die bei Streaming-Vorgängen zu Datenverlust führen könnten.
PromQL-Kriterien:
max({__name__="ThrottledPutRecordCount", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name",DelegatedOperation="your-operation"}) >THRESHOLDEmpfohlener Schwellenwert:
THRESHOLD(in die Abfrage eingebettet)Begründung des Schwellenwerts: Dieser Wert wird auf der Grundlage Ihrer akzeptablen Anzahl an Drosselungen für Streaming-Put-Operationen festgelegt.
Bewertungsintervall: 60
Wartezeit: 600
Erholungsphase: 600
- UserErrors
-
Beschriftungen: Keine
Beschreibung des Alarms: Alarm, wenn Benutzerfehler den Schwellenwert für das gesamte Konto überschreiten.
Absicht: Erkennen Sie eine hohe Anzahl von Kundenfehlern, wie z. B. fehlgeschlagene Validierungs- oder Bedingungsprüfungen.
PromQL-Kriterien:
sum({__name__="UserErrors", "@instrumentation.@name"="cloudwatch.aws/dynamodb"}) >THRESHOLDEmpfohlener Schwellenwert:
THRESHOLD(in die Abfrage eingebettet)Begründung des Schwellenwerts: Dieser Wert wird auf der Grundlage Ihrer akzeptablen Fehlerrate für clientseitige Anforderungsfehler festgelegt.
Bewertungsintervall: 60
Wartezeit: 600
Erholungsphase: 600
- WriteThrottleEvents
-
Beschriftungen: TableName
Beschreibung des Alarms: Alarm, wenn Write-Throttle-Ereignisse den Schwellenwert für eine Tabelle überschreiten.
Absicht: Es wird eine Schreibdrosselung erkannt, die auf eine unzureichende bereitgestellte Kapazität hinweist.
PromQL-Kriterien:
sum({__name__="WriteThrottleEvents", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name"}) >THRESHOLDEmpfohlener Schwellenwert:
THRESHOLD(in die Abfrage eingebettet)Begründung des Schwellenwerts: Dieser Wert wird auf der Grundlage Ihrer akzeptablen Anzahl an Drosselungen für Schreibvorgänge festgelegt.
Bewertungsintervall: 60
Wartezeit: 300
Erholungsphase: 300
- WriteThrottleEvents (GSI)
-
Etiketten: TableName, GlobalSecondaryIndexName
Beschreibung des Alarms: Alarm, wenn Write-Throttle-Ereignisse den Schwellenwert für einen globalen sekundären Index überschreiten.
Absicht: Es wird eine Schreibdrosselung auf einem GSI erkannt, die auf eine unzureichende Indexkapazität hinweist.
PromQL-Kriterien:
sum({__name__="WriteThrottleEvents", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name",GlobalSecondaryIndexName="your-index-name"}) >THRESHOLDEmpfohlener Schwellenwert:
THRESHOLD(in die Abfrage eingebettet)Begründung des Schwellenwerts: Dieser Wert wird auf der Grundlage Ihrer akzeptablen Drosselzahl für GSI-Schreibvorgänge festgelegt.
Bewertungsintervall: 60
Wartezeit: 300
Erholungsphase: 300
EBS
- VolumeStalledIOCheck
-
Etiketten: VolumeId, InstanceId
Beschreibung des Alarms: Alarm, wenn ein EBS-Volume einen fehlgeschlagenen I/O Check meldet.
Absicht: Erkennt Blockaden I/O auf EBS-Datenträgern, die auf eine Beeinträchtigung der Lautstärke hinweisen.
PromQL-Kriterien:
max({__name__="VolumeStalledIOCheck", "@instrumentation.@name"="cloudwatch.aws/ebs", VolumeId="your-volume-id",InstanceId="your-instance-id"}) >= 1Empfohlener Schwellenwert: 1 (eingebettet in die Abfrage)
Begründung des Schwellenwerts: Ein Wert von 1 oder höher bedeutet, dass das Volumen ins Stocken geraten ist I/O und eine sofortige Untersuchung erforderlich ist.
Bewertungsintervall: 60
Wartezeit: 600
Erholungsphase: 600
Amazon Elastic Compute Cloud
- CPUUtilization
-
Beschriftungen: InstanceId
Alarmbeschreibung: Alarm, wenn die durchschnittliche CPU-Auslastung für eine EC2-Instance 80% übersteigt.
Absicht: Erkennung einer hohen CPU-Auslastung.
PromQL-Kriterien:
avg({__name__="CPUUtilization", "@instrumentation.@name"="cloudwatch.aws/ec2", InstanceId="your-instance-id"}) > 80Empfohlener Schwellenwert: 80 (eingebettet in die Abfrage)
Begründung des Schwellenwerts: Der Schwellenwert von 80% gibt Spielraum vor der Sättigung.
Bewertungsintervall: 300
Wartezeit: 900
Erholungsphase: 900
- StatusCheckFailed
-
Beschriftungen: InstanceId
Alarmbeschreibung: Alarm, wenn eine Instance oder eine Systemstatusüberprüfung für eine EC2-Instance fehlschlägt.
Absicht: Erkennung von Instance- oder Systemintegritätsproblemen.
PromQL-Kriterien:
max({__name__="StatusCheckFailed", "@instrumentation.@name"="cloudwatch.aws/ec2", InstanceId="your-instance-id"}) >= 1Empfohlener Schwellenwert: 1 (eingebettet in die Abfrage)
Begründung des Schwellenwerts: Jeder Fehler bei der Statusüberprüfung muss untersucht werden.
Bewertungsintervall: 300
Wartezeit: 600
Erholungsphase: 600
- StatusCheckFailed_Angehängte EBS
-
Beschriftungen: InstanceId
Alarmbeschreibung: Alarm, wenn ein angeschlossenes EBS-Volume für eine EC2-Instance nicht mehr erreichbar ist.
Absicht: Erkennung unerreichbarer EBS-Volumes.
PromQL-Kriterien:
max({__name__="StatusCheckFailed_AttachedEBS", "@instrumentation.@name"="cloudwatch.aws/ec2", InstanceId="your-instance-id"}) >= 1Empfohlener Schwellenwert: 1 (eingebettet in die Abfrage)
Begründung des Schwellenwerts: Nicht erreichbare Volumes führen zu I/O Ausfällen.
Bewertungsintervall: 60
Wartezeit: 600
Erholungsphase: 600
Amazon ECS
- CPUReservation
-
Beschriftungen: ClusterName
Beschreibung des Alarms: Alarm, wenn die durchschnittliche CPU-Reservierung für einen ECS-Cluster 80% übersteigt.
Absicht: Erkennt den Cluster, der sich der CPU-Kapazität nähert.
PromQL-Kriterien:
avg({__name__="CPUReservation", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="your-cluster-name"}) > 80Empfohlener Schwellenwert: 80 (eingebettet in die Abfrage)
Begründung für den Schwellenwert: Eine Reservierung von 80% deutet auf begrenzten Spielraum für neue Aufgaben hin.
Bewertungsintervall: 60
Wartezeit: 300
Erholungsphase: 300
- CPUUtilization
-
Etiketten: ClusterName, ServiceName
Beschreibung des Alarms: Alarm, wenn die durchschnittliche CPU-Auslastung für einen ECS-Dienst 80% übersteigt.
Absicht: Erkennt eine hohe CPU-Auslastung für den ECS-Dienst.
PromQL-Kriterien:
avg({__name__="CPUUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="your-cluster-name",ServiceName="your-service-name"}) > 80Empfohlener Schwellenwert: 80 (eingebettet in die Abfrage)
Begründung des Schwellenwerts: Bei 80% besteht Spielraum vor der Sättigung.
Bewertungsintervall: 60
Wartezeit: 300
Erholungsphase: 300
- EBSFilesystemUtilization
-
Etiketten: ClusterName, ServiceName
Beschreibung des Alarms: Alarm, wenn die durchschnittliche Auslastung des EBS-Dateisystems für einen ECS-Dienst 80% übersteigt.
Absicht: Erkennung einer hohen EBS-Speicherauslastung.
PromQL-Kriterien:
avg({__name__="EBSFilesystemUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="your-cluster-name",ServiceName="your-service-name"}) > 80Empfohlener Schwellenwert: 80 (eingebettet in die Abfrage)
Begründung des Schwellenwerts: Bei 80% besteht Spielraum vor der Sättigung.
Bewertungsintervall: 60
Wartezeit: 300
Erholungsphase: 300
- MemoryReservation
-
Etiketten: ClusterName
Alarmbeschreibung: Alarm, wenn die durchschnittliche Speicherreservierung für einen ECS-Cluster 80% übersteigt.
Absicht: Erkennt den Cluster, der sich der Speicherkapazität nähert.
PromQL-Kriterien:
avg({__name__="MemoryReservation", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="your-cluster-name"}) > 80Empfohlener Schwellenwert: 80 (eingebettet in die Abfrage)
Begründung des Schwellenwerts: Eine Reservierung von 80% deutet auf begrenzten Spielraum für neue Aufgaben hin.
Bewertungsintervall: 60
Wartezeit: 300
Erholungsphase: 300
- MemoryUtilization
-
Etiketten: ClusterName, ServiceName
Beschreibung des Alarms: Alarm, wenn die durchschnittliche Speicherauslastung für einen ECS-Dienst 80% übersteigt.
Absicht: Erkennung einer hohen Speicherauslastung.
PromQL-Kriterien:
avg({__name__="MemoryUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="your-cluster-name",ServiceName="your-service-name"}) > 80Empfohlener Schwellenwert: 80 (eingebettet in die Abfrage)
Begründung des Schwellenwerts: Bei 80% besteht Spielraum vor der Sättigung.
Bewertungsintervall: 60
Wartezeit: 300
Erholungsphase: 300
- HTTP Code_Target _5xx_COUNT
-
Beschriftungen:, ClusterName ServiceName
Alarmbeschreibung: Alarm, wenn die Anzahl der HTTP 5XX-Fehler den Schwellenwert für einen ECS-Dienst überschreitet.
Absicht: Erkennt eine hohe serverseitige Fehleranzahl.
PromQL-Kriterien:
sum({__name__="HTTPCode_Target_5XX_Count", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="your-cluster-name",ServiceName="your-service-name"}) >THRESHOLDEmpfohlener Schwellenwert:
THRESHOLD(in die Abfrage eingebettet)Begründung des Schwellenwerts: Dieser Wert wird auf der Grundlage der normalen Fehlerquote Ihrer Anwendung festgelegt.
Bewertungsintervall: 60
Wartezeit: 300
Erholungsphase: 300
- TargetResponseTime
-
Etiketten: ClusterName, ServiceName
Alarmbeschreibung: Alarm, wenn die durchschnittliche Zielreaktionszeit den Schwellenwert für einen ECS-Service überschreitet.
Absicht: Erkennt eine hohe Zielreaktionszeit.
PromQL-Kriterien:
avg({__name__="TargetResponseTime", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="your-cluster-name",ServiceName="your-service-name"}) >THRESHOLDEmpfohlener Schwellenwert:
THRESHOLD(in die Abfrage eingebettet)Begründung des Schwellenwerts: Wird auf der Grundlage der akzeptablen Latenzanforderungen Ihrer Anwendung festgelegt.
Bewertungsintervall: 60
Wartezeit: 300
Erholungsphase: 300
Einblicke in Amazon ECS Container
- EphemeralStorageUtilized
-
Beschriftungen: ClusterName, ServiceName
Beschreibung des Alarms: Alarm, wenn die durchschnittliche Nutzung kurzlebigen Speichers den Schwellenwert für Fargate-Aufgaben überschreitet.
Absicht: Erkennt eine hohe Auslastung des kurzlebigen Speichers für Fargate-Aufgaben.
PromQL-Kriterien:
avg({__name__="EphemeralStorageUtilized", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name",ServiceName="your-service-name"}) >THRESHOLDEmpfohlener Schwellenwert:
THRESHOLD(in die Abfrage eingebettet)Begründung des Schwellenwerts: Dieser Wert wird auf der Grundlage der temporären Speicherzuweisung Ihrer Aufgabe festgelegt.
Bewertungsintervall: 60
Wartezeit: 300
Erholungsphase: 300
- RunningTaskCount
-
Etiketten: ClusterName, ServiceName
Beschreibung des Alarms: Alarm, wenn die Anzahl der laufenden Aufgaben für einen ECS-Dienst auf Null fällt.
Absicht: Erkennt, wenn keine Aufgaben ausgeführt werden.
PromQL-Kriterien:
avg({__name__="RunningTaskCount", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name",ServiceName="your-service-name"}) <= 0Empfohlener Schwellenwert: 0 (eingebettet in die Abfrage)
Rechtfertigung des Schwellenwerts: Wenn keine Aufgaben ausgeführt werden, deutet dies auf einen Serviceausfall hin.
Bewertungsintervall: 60
Wartezeit: 300
Erholungsphase: 300
- instance_filesystem_utilization
-
Etiketten: InstanceId ContainerInstanceId, ClusterName
Beschreibung des Alarms: Alarm, wenn die durchschnittliche Dateisystemauslastung auf einer Container-Instance 90% übersteigt.
Absicht: Erkennung einer hohen Dateisystemauslastung.
PromQL-Kriterien:
avg({__name__="instance_filesystem_utilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", InstanceId="your-instance-id",ContainerInstanceId="your-container-instance-id",ClusterName="your-cluster-name"}) > 90Empfohlener Schwellenwert: 90 (eingebettet in die Abfrage)
Rechtfertigung des Schwellenwerts: Bei 90% der Dateisystemauslastung bleibt nur wenig Platz für Operationen.
Bewertungsintervall: 60
Wartezeit: 300
Erholungsphase: 300
Amazon ECS Container Insights verbesserte die Beobachtbarkeit
- TaskCpuUtilization (Cluster-Ebene)
-
Beschriftungen: ClusterName
Beschreibung des Alarms: Alarm, wenn die durchschnittliche CPU-Auslastung der Aufgabe auf Cluster-Ebene 80% übersteigt.
Absicht: Erkennt eine hohe CPU-Auslastung.
PromQL-Kriterien:
avg({__name__="TaskCpuUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name"}) > 80Empfohlener Schwellenwert: 80 (eingebettet in die Abfrage)
Begründung des Schwellenwerts: Bei 80% besteht Spielraum vor der Sättigung.
Bewertungsintervall: 60
Wartezeit: 300
Erholungsphase: 300
- TaskCpuUtilization (Serviceniveau)
-
Etiketten: ClusterName, ServiceName
Beschreibung des Alarms: Alarm, wenn die durchschnittliche CPU-Auslastung der Aufgabe auf Service-Ebene 80% übersteigt.
Absicht: Erkennung einer hohen CPU-Auslastung.
PromQL-Kriterien:
avg({__name__="TaskCpuUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name",ServiceName="your-service-name"}) > 80Empfohlener Schwellenwert: 80 (eingebettet in die Abfrage)
Begründung des Schwellenwerts: Bei 80% besteht Spielraum vor der Sättigung.
Bewertungsintervall: 60
Wartezeit: 300
Erholungsphase: 300
- TaskMemoryUtilization (Cluster-Ebene)
-
Beschriftungen: ClusterName
Beschreibung des Alarms: Alarm, wenn die durchschnittliche Arbeitsspeicherauslastung der Aufgabe auf Cluster-Ebene 80% übersteigt.
Absicht: Erkennt eine hohe Speicherauslastung.
PromQL-Kriterien:
avg({__name__="TaskMemoryUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name"}) > 80Empfohlener Schwellenwert: 80 (eingebettet in die Abfrage)
Begründung des Schwellenwerts: Bei 80% besteht Spielraum vor der Sättigung.
Bewertungsintervall: 60
Wartezeit: 300
Erholungsphase: 300
- TaskMemoryUtilization (Serviceniveau)
-
Etiketten: ClusterName, ServiceName
Beschreibung des Alarms: Alarm, wenn die durchschnittliche Arbeitsspeicherauslastung der Aufgabe auf Service-Ebene 80% übersteigt.
Absicht: Erkennung einer hohen Speicherauslastung.
PromQL-Kriterien:
avg({__name__="TaskMemoryUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name",ServiceName="your-service-name"}) > 80Empfohlener Schwellenwert: 80 (eingebettet in die Abfrage)
Begründung des Schwellenwerts: Bei 80% besteht Spielraum vor der Sättigung.
Bewertungsintervall: 60
Wartezeit: 300
Erholungsphase: 300
- ContainerCpuUtilization (Cluster-Ebene)
-
Beschriftungen: ClusterName
Beschreibung des Alarms: Alarm, wenn die durchschnittliche CPU-Auslastung des Containers auf Cluster-Ebene 80% übersteigt.
Absicht: Erkennung einer hohen CPU-Auslastung.
PromQL-Kriterien:
avg({__name__="ContainerCpuUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name"}) > 80Empfohlener Schwellenwert: 80 (eingebettet in die Abfrage)
Begründung des Schwellenwerts: Bei 80% besteht Spielraum vor der Sättigung.
Bewertungsintervall: 60
Wartezeit: 300
Erholungsphase: 300
- ContainerCpuUtilization (Containerebene)
-
Beschriftungen: ContainerName ClusterName, ServiceName
Beschreibung des Alarms: Alarm, wenn die durchschnittliche CPU-Auslastung des Containers auf Containerebene 80% übersteigt.
Absicht: Erkennung einer hohen CPU-Auslastung.
PromQL-Kriterien:
avg({__name__="ContainerCpuUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ContainerName="your-container-name",ClusterName="your-cluster-name",ServiceName="your-service-name"}) > 80Empfohlener Schwellenwert: 80 (eingebettet in die Abfrage)
Begründung des Schwellenwerts: Bei 80% besteht Spielraum vor der Sättigung.
Bewertungsintervall: 60
Wartezeit: 300
Erholungsphase: 300
- ContainerMemoryUtilization (Cluster-Ebene)
-
Beschriftungen: ClusterName
Alarmbeschreibung: Alarm, wenn die durchschnittliche Speicherauslastung des Containers auf Cluster-Ebene 80% übersteigt.
Absicht: Erkennung einer hohen Speicherauslastung.
PromQL-Kriterien:
avg({__name__="ContainerMemoryUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name"}) > 80Empfohlener Schwellenwert: 80 (eingebettet in die Abfrage)
Begründung des Schwellenwerts: Bei 80% besteht Spielraum vor der Sättigung.
Bewertungsintervall: 60
Wartezeit: 300
Erholungsphase: 300
- ContainerMemoryUtilization (Containerebene)
-
Beschriftungen: ContainerName ClusterName, ServiceName
Beschreibung des Alarms: Alarm, wenn die durchschnittliche Speicherauslastung des Containers auf Containerebene 80% übersteigt.
Absicht: Erkennung einer hohen Speicherauslastung.
PromQL-Kriterien:
avg({__name__="ContainerMemoryUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ContainerName="your-container-name",ClusterName="your-cluster-name",ServiceName="your-service-name"}) > 80Empfohlener Schwellenwert: 80 (eingebettet in die Abfrage)
Begründung des Schwellenwerts: Bei 80% besteht Spielraum vor der Sättigung.
Bewertungsintervall: 60
Wartezeit: 300
Erholungsphase: 300
- TaskEBSfilesystemUtilization
-
Etiketten: ClusterName, ServiceName
Beschreibung des Alarms: Alarm, wenn die durchschnittliche Auslastung des EBS-Dateisystems für Aufgaben 80% übersteigt.
Absicht: Erkennt eine hohe Auslastung des EBS-Dateisystems.
PromQL-Kriterien:
avg({__name__="TaskEBSfilesystemUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name",ServiceName="your-service-name"}) > 80Empfohlener Schwellenwert: 80 (eingebettet in die Abfrage)
Begründung des Schwellenwerts: Bei 80% besteht Spielraum vor der Sättigung.
Bewertungsintervall: 60
Wartezeit: 300
Erholungsphase: 300
- TaskEphemeralStorageUtilization (Cluster-Ebene)
-
Beschriftungen: ClusterName
Beschreibung des Alarms: Alarm, wenn die durchschnittliche Auslastung des kurzlebigen Speichers auf Cluster-Ebene 80% übersteigt.
Absicht: Erkennt eine hohe Auslastung des kurzlebigen Speichers.
PromQL-Kriterien:
avg({__name__="TaskEphemeralStorageUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name"}) > 80Empfohlener Schwellenwert: 80 (eingebettet in die Abfrage)
Begründung des Schwellenwerts: Bei 80% besteht Spielraum vor der Sättigung.
Bewertungsintervall: 60
Wartezeit: 300
Erholungsphase: 300
- TaskEphemeralStorageUtilization (Serviceniveau)
-
Etiketten: ClusterName, ServiceName
Beschreibung des Alarms: Alarm, wenn die durchschnittliche Auslastung des kurzlebigen Speichers auf Service-Ebene 80% übersteigt.
Absicht: Erkennt eine hohe Auslastung kurzlebigen Speichers.
PromQL-Kriterien:
avg({__name__="TaskEphemeralStorageUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name",ServiceName="your-service-name"}) > 80Empfohlener Schwellenwert: 80 (eingebettet in die Abfrage)
Begründung des Schwellenwerts: Bei 80% besteht Spielraum vor der Sättigung.
Bewertungsintervall: 60
Wartezeit: 300
Erholungsphase: 300
Amazon EFS
- PercentIOLimit
-
Etiketten: FileSystemId
Beschreibung des Alarms: Alarm, wenn ein EFS-Dateisystem 100% seines I/O Grenzwerts erreicht.
Absicht: Erkennt, wenn das Dateisystem das Limit erreicht I/O .
PromQL-Kriterien:
avg({__name__="PercentIOLimit", "@instrumentation.@name"="cloudwatch.aws/efs", FileSystemId="your-filesystem-id"}) >= 100Empfohlener Schwellenwert: 100 (eingebettet in die Abfrage)
Begründung des Schwellenwerts: Bei einem Wert von 100% wird das Dateisystem zu einem Engpass.
Bewertungsintervall: 60
Wartezeit: 900
Erholungsphase: 900
- BurstCreditBalance
-
Beschriftungen: FileSystemId
Alarmbeschreibung: Alarm, wenn das Burst-Guthaben für ein EFS-Dateisystem auf Null fällt.
Absicht: Erkennt aufgebrauchte Burst-Credits, die zu einer Verlangsamung des Durchsatzes führen.
PromQL-Kriterien:
avg({__name__="BurstCreditBalance", "@instrumentation.@name"="cloudwatch.aws/efs", FileSystemId="your-filesystem-id"}) <= 0Empfohlener Schwellenwert: 0 (eingebettet in die Abfrage)
Begründung für den Schwellenwert: Null Credits führen zu einem verringerten Durchsatz.
Bewertungsintervall: 60
Wartezeit: 900
Erholungsphase: 900
Amazon EKS Container Insights
- node_cpu_utilization
-
Beschriftungen: ClusterName
Alarmbeschreibung: Alarm, wenn die maximale CPU-Auslastung auf EKS-Worker-Knoten 80% überschreitet.
Absicht: Erkennt eine hohe CPU-Auslastung auf Worker-Knoten.
PromQL-Kriterien:
max({__name__="node_cpu_utilization", "@instrumentation.@name"="cloudwatch.aws/eks-containerinsights", ClusterName="your-cluster-name"}) > 80Empfohlener Schwellenwert: 80 (eingebettet in die Abfrage)
Begründung des Schwellenwerts: Bei 80% besteht Spielraum vor der Sättigung.
Bewertungsintervall: 60
Wartezeit: 300
Erholungsphase: 300
- node_filesystem_utilization
-
Etiketten: ClusterName
Alarmbeschreibung: Alarm, wenn die maximale Dateisystemauslastung den Schwellenwert auf EKS-Worker-Knoten überschreitet.
Absicht: Erkennt eine hohe Dateisystemauslastung auf Worker-Knoten.
PromQL-Kriterien:
max({__name__="node_filesystem_utilization", "@instrumentation.@name"="cloudwatch.aws/eks-containerinsights", ClusterName="your-cluster-name"}) >THRESHOLDEmpfohlener Schwellenwert:
THRESHOLD(in die Abfrage eingebettet)Begründung des Schwellenwerts: Dieser Wert wird auf der Grundlage der Speicherkapazität und der Nutzungsmuster Ihres Knotens festgelegt.
Bewertungsintervall: 60
Wartezeit: 300
Erholungsphase: 300
- node_memory_utilization
-
Etiketten: ClusterName
Alarmbeschreibung: Alarm, wenn die maximale Speicherauslastung auf EKS-Worker-Knoten 80% überschreitet.
Absicht: Erkennen Sie einen hohen Speicherbedarf auf Worker-Knoten.
PromQL-Kriterien:
max({__name__="node_memory_utilization", "@instrumentation.@name"="cloudwatch.aws/eks-containerinsights", ClusterName="your-cluster-name"}) > 80Empfohlener Schwellenwert: 80 (eingebettet in die Abfrage)
Begründung des Schwellenwerts: Bei 80% besteht Spielraum vor der Sättigung.
Bewertungsintervall: 60
Wartezeit: 300
Erholungsphase: 300
- pod_cpu_utilization_over_pod_limit
-
Beschriftungen: ClusterName, Namespace, Dienst
Beschreibung des Alarms: Alarm, wenn die CPU-Auslastung des Pods 80% des Grenzwerts überschreitet.
Absicht: Erkennt Pods, die sich den CPU-Grenzwerten nähern.
PromQL-Kriterien:
max({__name__="pod_cpu_utilization_over_pod_limit", "@instrumentation.@name"="cloudwatch.aws/eks-containerinsights", ClusterName="your-cluster-name",Namespace="your-namespace",Service="your-service"}) > 80Empfohlener Schwellenwert: 80 (eingebettet in die Abfrage)
Begründung des Schwellenwerts: 80% geben Spielraum, bevor eine Drosselung erfolgt.
Bewertungsintervall: 60
Wartezeit: 300
Erholungsphase: 300
- pod_memory_utilization_over_pod_limit
-
Beschriftungen: ClusterName, Namespace, Dienst
Beschreibung des Alarms: Alarm, wenn die Speicherauslastung des Pods 80% des Grenzwerts überschreitet.
Absicht: Erkennt Pods, die sich der Speicherbegrenzung nähern.
PromQL-Kriterien:
max({__name__="pod_memory_utilization_over_pod_limit", "@instrumentation.@name"="cloudwatch.aws/eks-containerinsights", ClusterName="your-cluster-name",Namespace="your-namespace",Service="your-service"}) > 80Empfohlener Schwellenwert: 80 (eingebettet in die Abfrage)
Begründung des Schwellenwerts: 80% geben Spielraum, bevor OomKill auftritt.
Bewertungsintervall: 60
Wartezeit: 300
Erholungsphase: 300
Amazon ElastiCache
- CPUUtilization
-
Etiketten: CacheClusterId, CacheNodeId
Beschreibung des Alarms: Alarm, wenn die durchschnittliche CPU-Auslastung den Schwellenwert für einen ElastiCache Knoten überschreitet.
Absicht: Erkennt eine hohe CPU-Auslastung in der gesamten Instanz.
PromQL-Kriterien:
avg({__name__="CPUUtilization", "@instrumentation.@name"="cloudwatch.aws/elasticache", CacheClusterId="your-cache-cluster-id",CacheNodeId="your-cache-node-id"}) >THRESHOLDEmpfohlener Schwellenwert:
THRESHOLD(in die Abfrage eingebettet)Begründung des Schwellenwerts: Dieser Wert wird auf der Grundlage Ihres Knotentyps und Ihrer Workload-Merkmale festgelegt.
Bewertungsintervall: 60
Wartezeit: 300
Erholungsphase: 300
- CurrConnections
-
Etiketten: CacheClusterId, CacheNodeId
Beschreibung des Alarms: Alarm, wenn die Anzahl der Verbindungen den Schwellenwert für einen ElastiCache Knoten überschreitet.
Absicht: Erkennt hohe Verbindungszahlen.
PromQL-Kriterien:
avg({__name__="CurrConnections", "@instrumentation.@name"="cloudwatch.aws/elasticache", CacheClusterId="your-cache-cluster-id",CacheNodeId="your-cache-node-id"}) >THRESHOLDEmpfohlener Schwellenwert:
THRESHOLD(in die Abfrage eingebettet)Begründung des Schwellenwerts: Dieser Wert wird auf der Grundlage Ihrer erwarteten Größe des Verbindungspools und der Anwendungsanforderungen festgelegt.
Bewertungsintervall: 60
Wartezeit: 600
Erholungsphase: 600
- DatabaseMemoryUsagePercentage
-
Beschriftungen: CacheClusterId
Beschreibung des Alarms: Alarm, wenn die Nutzung des Datenbankspeichers den Schwellenwert für einen ElastiCache Cluster überschreitet.
Absicht: Ermitteln Sie eine hohe Speicherauslastung, um Schreibfehler zu vermeiden.
PromQL-Kriterien:
avg({__name__="DatabaseMemoryUsagePercentage", "@instrumentation.@name"="cloudwatch.aws/elasticache", CacheClusterId="your-cache-cluster-id"}) >THRESHOLDEmpfohlener Schwellenwert:
THRESHOLD(in die Abfrage eingebettet)Begründung des Schwellenwerts: Dieser Wert wird auf der Grundlage Ihrer Räumungsrichtlinien und der Wichtigkeit Ihrer Daten festgelegt.
Bewertungsintervall: 60
Wartezeit: 300
Erholungsphase: 300
- EngineCPUUtilization
-
Etiketten: CacheClusterId
Beschreibung des Alarms: Alarm, wenn die CPU-Auslastung der Redis-Engine für einen ElastiCache Cluster 90% übersteigt.
Absicht: Erkennt eine hohe CPU-Auslastung der Redis-Engine.
PromQL-Kriterien:
avg({__name__="EngineCPUUtilization", "@instrumentation.@name"="cloudwatch.aws/elasticache", CacheClusterId="your-cache-cluster-id"}) > 90Empfohlener Schwellenwert: 90 (eingebettet in die Abfrage)
Begründung des Schwellenwerts: Redis arbeitet mit einem Thread-System. Ein Wert von über 90% weist auf eine Sättigung hin.
Bewertungsintervall: 60
Wartezeit: 300
Erholungsphase: 300
- ReplicationLag
-
Etiketten: CacheClusterId
Beschreibung des Alarms: Alarm, wenn die Replikationsverzögerung den Schwellenwert für einen ElastiCache Cluster überschreitet.
Absicht: Erkennen Sie Verzögerungen bei der Replikation, die sich auf die Datenkonsistenz auswirken.
PromQL-Kriterien:
avg({__name__="ReplicationLag", "@instrumentation.@name"="cloudwatch.aws/elasticache", CacheClusterId="your-cache-cluster-id"}) >THRESHOLDEmpfohlener Schwellenwert:
THRESHOLD(in die Abfrage eingebettet)Begründung des Schwellenwerts: Dieser Wert wird auf der Grundlage der Toleranz Ihrer Anwendung für veraltete Lesevorgänge festgelegt.
Bewertungsintervall: 60
Wartezeit: 900
Erholungsphase: 900
Elastic GPUs
- GPUConnectivityCheckFailed
-
Beschriftungen: InstanceId, egPUID
Alarmbeschreibung: Alarm, wenn der Elastic Graphics-Beschleuniger die Konnektivität zur Instance verliert.
Absicht: Erkennt Verbindungsprobleme mit dem Elastic Graphics Accelerator.
PromQL-Kriterien:
max({__name__="GPUConnectivityCheckFailed", "@instrumentation.@name"="cloudwatch.aws/elasticgpus", InstanceId="your-instance-id",EGPUId="your-egpu-id"}) > 0Empfohlener Schwellenwert: 0 (eingebettet in die Abfrage)
Begründung des Schwellenwerts: Jeder Verbindungsfehler muss untersucht werden.
Bewertungsintervall: 300
Wartezeit: 900
Erholungsphase: 900
- GPUHealthCheckFailed
-
Beschriftungen: InstanceId, egPUID
Beschreibung des Alarms: Alarm, wenn eine Integritätsprüfung des Elastic Graphics-Beschleunigers fehlschlägt.
Absicht: Erkennt einen fehlerhaften Elastic Graphics Accelerator.
PromQL-Kriterien:
max({__name__="GPUHealthCheckFailed", "@instrumentation.@name"="cloudwatch.aws/elasticgpus", InstanceId="your-instance-id",EGPUId="your-egpu-id"}) > 0Empfohlener Schwellenwert: 0 (eingebettet in die Abfrage)
Begründung des Schwellenwerts: Fehlgeschlagene Integritätsprüfungen deuten auf Probleme mit dem Gaspedal hin.
Bewertungsintervall: 300
Wartezeit: 900
Erholungsphase: 900
Amazon EventBridge Scheduler
- TargetErrorThrottledCount
-
Beschreibung des Alarms: Alarm, wenn die Aufrufe von Zeitplanzielen gedrosselt werden.
Absicht: Erkennt eine Zieldrosselung, die zu Zeitplanverzögerungen führt.
PromQL-Kriterien:
sum({__name__="TargetErrorThrottledCount", "@instrumentation.@name"="cloudwatch.aws/scheduler"}) > 0Empfohlener Schwellenwert: 0 (eingebettet in die Abfrage)
Begründung des Schwellenwerts: Jede Drosselung deutet auf Probleme mit der Zielkapazität hin.
Bewertungsintervall: 60
Wartezeit: 900
Erholungsphase: 900
- InvocationThrottleCount
-
Alarmbeschreibung: Alarm, wenn Scheduler-Aufrufe gedrosselt werden.
Absicht: Erkennt die Drosselung des Scheduler-Aufrufs.
PromQL-Kriterien:
sum({__name__="InvocationThrottleCount", "@instrumentation.@name"="cloudwatch.aws/scheduler"}) > 0Empfohlener Schwellenwert: 0 (eingebettet in die Abfrage)
Begründung des Schwellenwerts: Die Drosselung verzögert geplante Ausführungen.
Bewertungsintervall: 60
Wartezeit: 900
Erholungsphase: 900
- InvocationDroppedCount
-
Beschreibung des Alarms: Alarm, wenn geplante Aufrufe unterbrochen werden.
Absicht: Erkennt unterbrochene Aufrufe.
PromQL-Kriterien:
sum({__name__="InvocationDroppedCount", "@instrumentation.@name"="cloudwatch.aws/scheduler"}) > 0Empfohlener Schwellenwert: 0 (eingebettet in die Abfrage)
Rechtfertigung des Schwellenwerts: Verworfene Aufrufe stehen für verloren gegangene geplante Ereignisse.
Bewertungsintervall: 60
Wartezeit: 60
Erholungsphase: 60
- InvocationsFailedToBeSentToDeadLetterCount
-
Beschreibung des Alarms: Alarm, wenn fehlgeschlagene Aufrufe nicht an die Warteschlange gesendet werden können.
Absicht: Erkennung von DLQ-Zustellungsfehlern.
PromQL-Kriterien:
sum({__name__="InvocationsFailedToBeSentToDeadLetterCount", "@instrumentation.@name"="cloudwatch.aws/scheduler"}) > 0Empfohlener Schwellenwert: 0 (eingebettet in die Abfrage)
Rechtfertigung des Schwellenwerts: Eine fehlgeschlagene DLQ-Lieferung bedeutet, dass Fehlerinformationen verloren gegangen sind.
Bewertungsintervall: 60
Wartezeit: 900
Erholungsphase: 900
Amazon Kinesis Data Streams
- GetRecords.IteratorAgeMilliseconds
-
Beschriftungen: StreamName
Beschreibung des Alarms: Alarm, wenn das Alter des Consumer-Iterators den Schwellenwert für einen Kinesis-Stream überschreitet.
Absicht: Erkennung von Daten, deren Aufbewahrungszeitraum überschritten wird, wodurch das Risiko eines Datenverlusts besteht.
PromQL-Kriterien:
max({__name__="GetRecords.IteratorAgeMilliseconds", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="your-stream-name"}) >THRESHOLDEmpfohlener Schwellenwert:
THRESHOLD(in die Abfrage eingebettet)Begründung des Schwellenwerts: Wird auf der Grundlage des Prozentsatzes der Stream-Aufbewahrungsdauer festgelegt.
Bewertungsintervall: 60
Wartezeit: 900
Erholungsphase: 900
- GetRecords.Success
-
Beschriftungen: StreamName
Beschreibung des Alarms: Alarm, wenn die GetRecords Erfolgsrate unter den Schwellenwert für einen Kinesis-Stream fällt.
Absicht: Erkennung von Fehlern beim Abrufen durch Verbraucher.
PromQL-Kriterien:
avg({__name__="GetRecords.Success", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="your-stream-name"}) <THRESHOLDEmpfohlener Schwellenwert:
THRESHOLD(in die Abfrage eingebettet)Begründung des Schwellenwerts: Wird auf der Grundlage der erwarteten Erfolgsquote festgelegt.
Bewertungsintervall: 60
Wartezeit: 300
Erholungsphase: 300
- PutRecord.Success
-
Etiketten: StreamName
Beschreibung des Alarms: Alarm, wenn die PutRecord Erfolgsrate unter den Schwellenwert für einen Kinesis-Stream fällt.
Absicht: Erkennt Fehler bei der Aufnahme durch den Producer.
PromQL-Kriterien:
avg({__name__="PutRecord.Success", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="your-stream-name"}) <THRESHOLDEmpfohlener Schwellenwert:
THRESHOLD(in die Abfrage eingebettet)Begründung des Schwellenwerts: Wird auf der Grundlage der erwarteten Erfolgsquote festgelegt.
Bewertungsintervall: 60
Wartezeit: 300
Erholungsphase: 300
- PutRecords.FailedRecords
-
Etiketten: StreamName
Alarmbeschreibung: Alarm, wenn Batch-Put-Operationen zu fehlgeschlagenen Datensätzen für einen Kinesis-Stream führen.
Absicht: Erkennung von Batch-Put-Fehlern.
PromQL-Kriterien:
sum({__name__="PutRecords.FailedRecords", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="your-stream-name"}) >THRESHOLDEmpfohlener Schwellenwert:
THRESHOLD(in die Abfrage eingebettet)Begründung des Schwellenwerts: Wird auf der Grundlage der akzeptablen Fehleranzahl festgelegt.
Bewertungsintervall: 60
Wartezeit: 300
Erholungsphase: 300
- ReadProvisionedThroughputExceeded
-
Etiketten: StreamName
Beschreibung des Alarms: Alarm, wenn die Lesevorgänge des Verbrauchers den bereitgestellten Durchsatz für einen Kinesis-Stream überschreiten.
Absicht: Erkennt eine Drosselung der Lesevorgänge durch Verbraucher.
PromQL-Kriterien:
avg({__name__="ReadProvisionedThroughputExceeded", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="your-stream-name"}) >THRESHOLDEmpfohlener Schwellenwert:
THRESHOLD(in die Abfrage eingebettet)Begründung des Schwellenwerts: Jede anhaltende Drosselung weist auf einen Kapazitätsbedarf hin.
Bewertungsintervall: 60
Wartezeit: 300
Erholungsphase: 300
- SubscribeToShardEvent.MillisBehindLatest
-
Etiketten: StreamName, ConsumerName
Beschreibung des Alarms: Alarm, wenn ein Verbraucher mit verstärktem Fan-Out hinter den letzten Rekord zurückfällt.
Absicht: Es wird eine Verzögerung bei der Verarbeitung durch Verbraucher mit verstärktem Fan-Out erkannt.
PromQL-Kriterien:
avg({__name__="SubscribeToShardEvent.MillisBehindLatest", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="your-stream-name",ConsumerName="your-consumer-name"}) >THRESHOLDEmpfohlener Schwellenwert:
THRESHOLD(in die Abfrage eingebettet)Begründung des Schwellenwerts: Wird auf der Grundlage einer akzeptablen Verarbeitungsverzögerung festgelegt.
Bewertungsintervall: 60
Wartezeit: 300
Erholungsphase: 300
- WriteProvisionedThroughputExceeded
-
Etiketten: StreamName
Beschreibung des Alarms: Alarm, wenn Producer-Schreibvorgänge den bereitgestellten Durchsatz für einen Kinesis-Stream überschreiten.
Absicht: Erkennt die Drosselung beim Schreiben durch den Producer.
PromQL-Kriterien:
avg({__name__="WriteProvisionedThroughputExceeded", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="your-stream-name"}) >THRESHOLDEmpfohlener Schwellenwert:
THRESHOLD(in die Abfrage eingebettet)Begründung des Schwellenwerts: Eine anhaltende Drosselung weist auf einen Kapazitätsbedarf hin.
Bewertungsintervall: 60
Wartezeit: 300
Erholungsphase: 300
AWS Lambda
- ClaimedAccountConcurrency
-
Beschreibung des Alarms: Alarm, wenn die Anzahl der beanspruchten Konten den Schwellenwert überschreitet.
Absicht: Erkennt ein Konto, das sich dem Kontingent an Parallelität nähert.
PromQL-Kriterien:
max({__name__="ClaimedAccountConcurrency", "@instrumentation.@name"="cloudwatch.aws/lambda"}) >THRESHOLDEmpfohlener Schwellenwert:
THRESHOLD(in die Abfrage eingebettet)Begründung des Schwellenwerts: Auf den Prozentsatz des regionalen Grenzwerts für Parallelität festgelegt.
Bewertungsintervall: 60
Wartezeit: 600
Erholungsphase: 600
- Fehler
-
Beschriftungen: FunctionName
Alarmbeschreibung: Alarm, wenn die Anzahl der Funktionsfehler den Schwellenwert für eine Lambda-Funktion überschreitet.
Absicht: Erkennt eine hohe Anzahl von Funktionsfehlern.
PromQL-Kriterien:
sum({__name__="Errors", "@instrumentation.@name"="cloudwatch.aws/lambda", FunctionName="your-function-name"}) >THRESHOLDEmpfohlener Schwellenwert:
THRESHOLD(in die Abfrage eingebettet)Begründung des Schwellenwerts: Wird auf der Grundlage des akzeptablen Fehlervolumens festgelegt.
Bewertungsintervall: 60
Wartezeit: 180
Erholungszeit: 300
- Drosselungen
-
Etiketten: FunctionName
Alarmbeschreibung: Alarm, wenn Funktionsaufrufe für eine Lambda-Funktion gedrosselt werden.
Absicht: Erkennt die Drosselung des Funktionsaufrufs.
PromQL-Kriterien:
sum({__name__="Throttles", "@instrumentation.@name"="cloudwatch.aws/lambda", FunctionName="your-function-name"}) >THRESHOLDEmpfohlener Schwellenwert:
THRESHOLD(in die Abfrage eingebettet)Begründung des Schwellenwerts: Die Drosselung zeigt an, dass das Parallelitätslimit erreicht wurde.
Bewertungsintervall: 60
Wartezeit: 300
Erholungsphase: 300
- Duration (Dauer)
-
Etiketten: FunctionName
Alarmbeschreibung: Alarm, wenn die Dauer der p90-Funktion den Schwellenwert für eine Lambda-Funktion überschreitet.
Absicht: Erkennung lang andauernder Funktionsaufrufe.
PromQL-Kriterien:
histogram_quantile(0.9, {__name__="Duration", "@instrumentation.@name"="cloudwatch.aws/lambda", FunctionName="your-function-name"}) >THRESHOLDEmpfohlener Schwellenwert:
THRESHOLD(in die Abfrage eingebettet)Begründung des Schwellenwerts: Wird relativ zum Funktions-Timeout festgelegt.
Bewertungsintervall: 60
Wartezeit: 900
Erholungsphase: 900
- ConcurrentExecutions
-
Beschriftungen: FunctionName
Alarmbeschreibung: Alarm, wenn gleichzeitige Ausführungen den Schwellenwert für eine Lambda-Funktion überschreiten.
Absicht: Erkennt eine Funktion, die sich den Grenzwerten für die Parallelität nähert.
PromQL-Kriterien:
max({__name__="ConcurrentExecutions", "@instrumentation.@name"="cloudwatch.aws/lambda", FunctionName="your-function-name"}) >THRESHOLDEmpfohlener Schwellenwert:
THRESHOLD(in die Abfrage eingebettet)Begründung des Schwellenwerts: Auf den Prozentsatz der reservierten Parallelität festgelegt.
Bewertungsintervall: 60
Wartezeit: 600
Erholungsphase: 600
AWS Lambda Insights
- memory_utilization
-
Beschriftungen: Funktionsname
Alarmbeschreibung: Alarm, wenn die durchschnittliche Speicherauslastung für eine Lambda-Funktion 90% übersteigt.
Absicht: Erkennt die Funktion, die sich dem konfigurierten Speicherlimit nähert.
PromQL-Kriterien:
avg({__name__="memory_utilization", "@instrumentation.@name"="cloudwatch.aws/lambda-insights", function_name="your-function-name"}) > 90Empfohlener Schwellenwert: 90 (eingebettet in die Abfrage)
Begründung des Schwellenwerts: Bei über 90% besteht das Risiko, dass nicht genügend Arbeitsspeicher zur Verfügung steht.
Bewertungsintervall: 60
Wartezeit: 600
Erholungsphase: 600
NAT-Gateway
- ErrorPortAllocation
-
Beschriftungen: NatGatewayId
Beschreibung des Alarms: Alarm, wenn das NAT-Gateway keinen Port für neue Verbindungen zuweisen kann.
Absicht: Erkennt Fehler bei der Portzuweisung und verhindert so, dass neue Verbindungen hergestellt werden.
PromQL-Kriterien:
sum({__name__="ErrorPortAllocation", "@instrumentation.@name"="cloudwatch.aws/natgateway", NatGatewayId="your-nat-gateway-id"}) > 0Empfohlener Schwellenwert: 0 (eingebettet in die Abfrage)
Begründung des Schwellenwerts: Jeder Fehler bei der Zuweisung wirkt sich auf die Konnektivität aus.
Bewertungsintervall: 60
Wartezeit: 900
Erholungsphase: 900
- PacketsDropCount
-
Beschriftungen: NatGatewayId
Alarmbeschreibung: Alarm, wenn das NAT-Gateway Pakete verwirft, die den Schwellenwert überschreiten.
Absicht: Erkennt Paketverluste, die auf Kapazitäts- oder Verbindungsprobleme hinweisen.
PromQL-Kriterien:
sum({__name__="PacketsDropCount", "@instrumentation.@name"="cloudwatch.aws/natgateway", NatGatewayId="your-nat-gateway-id"}) >THRESHOLDEmpfohlener Schwellenwert:
THRESHOLD(in die Abfrage eingebettet)Begründung des Schwellenwerts: Wird auf der Grundlage einer akzeptablen Drop-Rate festgelegt.
Bewertungsintervall: 60
Wartezeit: 300
Erholungsphase: 300
AWS PrivateLink Endpunkte
- PacketsDropped
-
Beschriftungen: VpcId, VpcEndpointId, EndpointType, SubnetId ServiceName
Alarmbeschreibung: Alarm, wenn ein VPC-Endpunkt Pakete verwirft, die den Schwellenwert überschreiten.
Absicht: Erkennt einen fehlerhaften Endpunkt oder Endpunktdienst.
PromQL-Kriterien:
sum({__name__="PacketsDropped", "@instrumentation.@name"="cloudwatch.aws/privatelinkendpoints", VpcId="your-vpc-id",VpcEndpointId="your-vpc-endpoint-id",EndpointType="your-endpoint-type",SubnetId="your-subnet-id",ServiceName="your-service-name"}) >THRESHOLDEmpfohlener Schwellenwert:
THRESHOLD(in die Abfrage eingebettet)Begründung des Schwellenwerts: Wird auf der Grundlage einer akzeptablen Drop-Rate festgelegt.
Bewertungsintervall: 60
Wartezeit: 300
Erholungsphase: 300
AWS PrivateLink dienstleistungen
- RstPacketsSent
-
Etiketten: ServiceId LoadBalancerArn, Az
Alarmbeschreibung: Alarm, wenn die RST-Paketrate den Schwellenwert für einen Endpunktdienst überschreitet.
Absicht: Erkennung fehlerhafter Ziele des Endpunktdienstes.
PromQL-Kriterien:
sum({__name__="RstPacketsSent", "@instrumentation.@name"="cloudwatch.aws/privatelinkservices", ServiceId="SVC",LoadBalancerArn="LB",Az="AZ"}) >THRESHOLDEmpfohlener Schwellenwert:
THRESHOLD(in die Abfrage eingebettet)Rechtfertigung des Schwellenwerts: Wird auf der Grundlage einer akzeptablen RST-Paketrate festgelegt.
Bewertungsintervall: 60
Wartezeit: 300
Erholungsphase: 300
RDS
- CPUUtilization
-
Etiketten: DBInstanceIdentifier
Alarmbeschreibung: Alarm, wenn die durchschnittliche CPU-Auslastung für eine RDS-Instance 90% übersteigt.
Absicht: Erkennt eine hohe CPU-Auslastung und verhindert so Leistungseinbußen.
PromQL-Kriterien:
avg({__name__="CPUUtilization", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > 90Empfohlener Schwellenwert: 90 (eingebettet in die Abfrage)
Begründung des Schwellenwerts: 90% bedeuten, dass die Sättigung fast erreicht ist.
Bewertungsintervall: 60
Wartezeit: 300
Erholungsphase: 300
- DatabaseConnections
-
Etiketten: DBInstanceIdentifier
Beschreibung des Alarms: Alarm, wenn Datenbankverbindungen den Schwellenwert für eine RDS-Instance überschreiten.
Absicht: Abgelehnte Verbindungen bis zum Höchstwert verhindern.
PromQL-Kriterien:
avg({__name__="DatabaseConnections", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) >THRESHOLDEmpfohlener Schwellenwert:
THRESHOLD(in die Abfrage eingebettet)Begründung des Schwellenwerts: Auf den Prozentsatz des Parameters max_connections gesetzt.
Bewertungsintervall: 60
Wartezeit: 300
Erholungsphase: 300
- EBSByteBalance%
-
Etiketten: DBInstanceIdentifier
Beschreibung des Alarms: Alarm, wenn das EBS-Byteguthaben für eine RDS-Instance unter 10% fällt.
Absicht: Erkennung von Gutschriften mit niedrigem Durchsatz, die zu Engpässen führen.
PromQL-Kriterien:
avg({__name__="EBSByteBalance%", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) < 10Empfohlener Schwellenwert: 10 (eingebettet in die Abfrage)
Begründung des Schwellenwerts: Bei einem Wert unter 10% besteht die Gefahr einer Verschlechterung des Durchsatzes.
Bewertungsintervall: 60
Wartezeit: 180
Erholungszeit: 180
- EBSIOBalance%
-
Etiketten: DBInstanceIdentifier
Beschreibung des Alarms: Alarm, wenn die EBS-I/O-Balance für eine RDS-Instance unter 10% fällt.
Absicht: Erkennen Sie niedrige IOPS-Credits, die zu Engpässen führen.
PromQL-Kriterien:
avg({__name__="EBSIOBalance%", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) < 10Empfohlener Schwellenwert: 10 (eingebettet in die Abfrage)
Begründung des Schwellenwerts: Bei einem Wert unter 10% besteht die Gefahr einer Verschlechterung der IOPS.
Bewertungsintervall: 60
Wartezeit: 180
Erholungszeit: 180
- FreeableMemory
-
Etiketten: DBInstanceIdentifier
Beschreibung des Alarms: Alarm, wenn der freigebbare Speicher unter den Schwellenwert für eine RDS-Instance fällt.
Absicht: Verhindern Sie, dass aufgrund von Speichermangel Verbindungen abgewiesen werden.
PromQL-Kriterien:
avg({__name__="FreeableMemory", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) <THRESHOLDEmpfohlener Schwellenwert:
THRESHOLD(in die Abfrage eingebettet)Begründung des Schwellenwerts: Wird auf der Grundlage des Speichers der Instanzklasse festgelegt.
Bewertungsintervall: 60
Wartezeit: 900
Erholungsphase: 900
- FreeLocalStorage
-
Beschriftungen: DBInstanceIdentifier
Beschreibung des Alarms: Alarm, wenn der freie lokale Speicher unter den Schwellenwert für eine Aurora-Instance fällt.
Absicht: Verhindern Sie die Erschöpfung des lokalen Aurora-Speichers.
PromQL-Kriterien:
avg({__name__="FreeLocalStorage", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) <THRESHOLDEmpfohlener Schwellenwert:
THRESHOLD(in die Abfrage eingebettet)Begründung des Schwellenwerts: Wird auf der Grundlage des Mindestwerts festgelegt, der für Operationen erforderlich ist.
Bewertungsintervall: 60
Wartezeit: 300
Erholungsphase: 300
- FreeStorageSpace
-
Etiketten: DBInstanceIdentifier
Beschreibung des Alarms: Alarm, wenn der freie Speicherplatz unter den Schwellenwert für eine RDS-Instance fällt.
Absicht: Vermeiden Sie Ausfallzeiten bei vollem Speicher.
PromQL-Kriterien:
min({__name__="FreeStorageSpace", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) <THRESHOLDEmpfohlener Schwellenwert:
THRESHOLD(in die Abfrage eingebettet)Begründung des Schwellenwerts: Dieser Wert wird auf der Grundlage der Wachstumsrate des Speichers und der bereitgestellten Größe festgelegt.
Bewertungsintervall: 60
Wartezeit: 300
Erholungsphase: 300
- MaximumUsedTransactionIDs
-
Etiketten: DBInstanceIdentifier
Beschreibung des Alarms: Alarm, wenn die maximal verwendeten Transaktions-IDs für eine RDS-Instance 1 Milliarde überschreiten.
Absicht: Verhindern Sie den Wrapararound der PostgreSQL-Transaktions-IDs.
PromQL-Kriterien:
avg({__name__="MaximumUsedTransactionIDs", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > 1000000000Empfohlener Schwellenwert: 1000000000 (eingebettet in die Abfrage)
Begründung des Schwellenwerts: 1 Milliarde deutet darauf hin, dass sich eine Rundumgefahr nähert.
Bewertungsintervall: 60
Wartezeit: 60
Erholungsphase: 60
- ReadLatency
-
Beschriftungen: DBInstanceIdentifier
Alarmbeschreibung: Alarm, wenn die Leselatenz von p90 den Schwellenwert für eine RDS-Instance überschreitet.
Absicht: Erkennt eine hohe Leselatenz, die auf Festplattenprobleme hinweist.
PromQL-Kriterien:
histogram_quantile(0.9, {__name__="ReadLatency", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) >THRESHOLDEmpfohlener Schwellenwert:
THRESHOLD(in die Abfrage eingebettet)Begründung des Schwellenwerts: Wird auf der Grundlage einer akzeptablen Anwendungslatenz festgelegt.
Bewertungsintervall: 60
Wartezeit: 300
Erholungsphase: 300
- ReplicaLag
-
Etiketten: DBInstanceIdentifier
Beschreibung des Alarms: Alarm, wenn die Replikationsverzögerung für ein RDS-Read-Replikat 60 Sekunden überschreitet.
Absicht: Erkennen Sie Verzögerungen bei der Replikation, die zu Datenverlust führen können.
PromQL-Kriterien:
max({__name__="ReplicaLag", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > 60Empfohlener Schwellenwert: 60 (eingebettet in die Abfrage)
Rechtfertigung des Schwellenwerts: 60 Sekunden stellen bei den meisten Workloads eine erhebliche Verzögerung dar.
Bewertungsintervall: 60
Wartezeit: 600
Erholungsphase: 600
- WriteLatency
-
Beschriftungen: DBInstanceIdentifier
Alarmbeschreibung: Alarm, wenn die p90-Schreiblatenz den Schwellenwert für eine RDS-Instance überschreitet.
Absicht: Erkennt eine hohe Schreiblatenz, die auf Festplattenprobleme hinweist.
PromQL-Kriterien:
histogram_quantile(0.9, {__name__="WriteLatency", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) >THRESHOLDEmpfohlener Schwellenwert:
THRESHOLD(in die Abfrage eingebettet)Begründung des Schwellenwerts: Wird auf der Grundlage einer akzeptablen Anwendungslatenz festgelegt.
Bewertungsintervall: 60
Wartezeit: 300
Erholungsphase: 300
- DBLoad
-
Etiketten: DBInstanceIdentifier
Alarmbeschreibung: Alarm, wenn die durchschnittliche Datenbanklast den Schwellenwert für eine RDS-Instance überschreitet.
Absicht: Erkennt eine hohe Datenbanklast, die die Leistung beeinträchtigt.
PromQL-Kriterien:
avg({__name__="DBLoad", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) >THRESHOLDEmpfohlener Schwellenwert:
THRESHOLD(in die Abfrage eingebettet)Begründung des Schwellenwerts: Auf ein Vielfaches der vCPU-Anzahl festgelegt.
Bewertungsintervall: 60
Wartezeit: 900
Erholungsphase: 900
- AuroraVolumeBytesLeftTotal
-
Beschriftungen: DBClusterIdentifier
Alarmbeschreibung: Alarm, wenn die verbleibenden Speicherbytes des Aurora-Clusters unter den Schwellenwert fallen.
Absicht: Verhindern Sie die Erschöpfung des Aurora-Cluster-Speichers.
PromQL-Kriterien:
avg({__name__="AuroraVolumeBytesLeftTotal", "@instrumentation.@name"="cloudwatch.aws/rds", DBClusterIdentifier="CLUSTER"}) <THRESHOLDEmpfohlener Schwellenwert:
THRESHOLD(in die Abfrage eingebettet)Begründung des Schwellenwerts: Wird auf der Grundlage der Wachstumsrate festgelegt.
Bewertungsintervall: 60
Wartezeit: 300
Erholungsphase: 300
- AuroraBinlogReplicaLag
-
Etiketten: DBClusterIdentifier
Alarmbeschreibung: Alarm, wenn die Verzögerung der Aurora-Binlog-Replikation auf einen Fehlerstatus hinweist.
Absicht: Fehler bei der Replikation der Writer-Instance erkennen.
PromQL-Kriterien:
avg({__name__="AuroraBinlogReplicaLag", "@instrumentation.@name"="cloudwatch.aws/rds", DBClusterIdentifier="CLUSTER"}) <= -1Empfohlener Schwellenwert: -1 (eingebettet in die Abfrage)
Rechtfertigung des Schwellenwerts: -1 gibt den Fehlerstatus an.
Bewertungsintervall: 60
Wartezeit: 120
Erholungszeitraum: 120
- BlockedTransactions
-
Beschriftungen: DBInstanceIdentifier
Beschreibung des Alarms: Alarm, wenn die Anzahl blockierter Transaktionen den Schwellenwert für eine RDS-Instance überschreitet.
Absicht: Erkennen Sie Transaktionsblockierungen, die zu Leistungseinbußen führen.
PromQL-Kriterien:
avg({__name__="BlockedTransactions", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) >THRESHOLDEmpfohlener Schwellenwert:
THRESHOLD(in die Abfrage eingebettet)Begründung des Schwellenwerts: Wird auf der Grundlage der akzeptablen Anzahl blockierter Transaktionen festgelegt.
Bewertungsintervall: 60
Wartezeit: 300
Erholungsphase: 300
- BufferCacheHitRatio
-
Etiketten: DBInstanceIdentifier
Beschreibung des Alarms: Alarm, wenn die Trefferquote im Puffercache für eine RDS-Instance unter 80% fällt.
Absicht: Erkennt eine niedrige Cache-Effizienz, die zu Leistungseinbußen führt.
PromQL-Kriterien:
avg({__name__="BufferCacheHitRatio", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) < 80Empfohlener Schwellenwert: 80 (eingebettet in die Abfrage)
Begründung des Schwellenwerts: Ein Wert unter 80% weist auf zu viel Speicherplatz hin I/O.
Bewertungsintervall: 60
Wartezeit: 600
Erholungsphase: 600
- EngineUptime
-
Beschriftungen: DBClusterIdentifier
Beschreibung des Alarms: Alarm, wenn die Betriebszeit des Motors auf Null fällt, was auf einen Neustart des Aurora-Schreibers hindeutet.
Absicht: Erkennt Ausfallzeiten oder Abstürze der Aurora-Writer-Instanz.
PromQL-Kriterien:
avg({__name__="EngineUptime", "@instrumentation.@name"="cloudwatch.aws/rds", DBClusterIdentifier="CLUSTER"}) <= 0Empfohlener Schwellenwert: 0 (eingebettet in die Abfrage)
Rechtfertigung des Schwellenwerts: Eine Verfügbarkeit von Null bedeutet einen Neustart der Instanz.
Bewertungsintervall: 60
Wartezeit: 120
Erholungszeitraum: 120
- RollbackSegmentHistoryListLength
-
Beschriftungen: DBInstanceIdentifier
Alarmbeschreibung: Alarm, wenn die Länge der Liste des Rollback-Segmentverlaufs für eine Aurora-Instance 1 Million überschreitet.
Absicht: Erkennt einen hohen Rollback-Verlauf, der zu einer Verschlechterung der CPU-Leistung führt.
PromQL-Kriterien:
avg({__name__="RollbackSegmentHistoryListLength", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > 1000000Empfohlener Schwellenwert: 1000000 (eingebettet in die Abfrage)
Begründung für den Schwellenwert: Ein Wert über 1 Mio. führt zu Leistungsproblemen.
Bewertungsintervall: 60
Wartezeit: 300
Erholungsphase: 300
- StorageNetworkThroughput
-
Etiketten: DBClusterIdentifier
Beschreibung des Alarms: Alarm, wenn der Durchsatz im Speichernetzwerk den Schwellenwert für einen Aurora-Cluster überschreitet.
Absicht: Erkennen Sie einen hohen Durchsatz, bei dem das Risiko eines Paketausfalls im Netzwerk besteht.
PromQL-Kriterien:
avg({__name__="StorageNetworkThroughput", "@instrumentation.@name"="cloudwatch.aws/rds", DBClusterIdentifier="CLUSTER"}) >THRESHOLDEmpfohlener Schwellenwert:
THRESHOLD(in die Abfrage eingebettet)Begründung des Schwellenwerts: Wird auf der Grundlage der Netzwerkkapazität der Instanz festgelegt.
Bewertungsintervall: 60
Wartezeit: 300
Erholungsphase: 300
Route 53
- HealthCheckStatus
-
Etiketten: HealthCheckId
Beschreibung des Alarms: Alarm, wenn bei einer Route 53-Zustandsprüfung ein fehlerhafter Endpunkt gemeldet wird.
Absicht: Erkennen Sie fehlerhafte Endpunkte mithilfe von Route 53-Integritätsprüfungen.
PromQL-Kriterien:
avg({__name__="HealthCheckStatus", "@instrumentation.@name"="cloudwatch.aws/route53", HealthCheckId="HC"}) < 1Empfohlener Schwellenwert: 1 (eingebettet in die Abfrage)
Begründung des Schwellenwerts: Ein Wert unter 1 bedeutet, dass der Endpunkt die Zustandsprüfungen nicht bestanden hat.
Bewertungsintervall: 60
Wartezeit: 180
Erholungszeit: 180
S3
- 4xxErrors
-
Etiketten: BucketName, FilterId
Beschreibung des Alarms: Alarm, wenn die 4xx-Fehlerrate für einen S3-Bucket 5% übersteigt.
Absicht: Erkennung ungewöhnlicher Client-Fehlerraten.
PromQL-Kriterien:
avg({__name__="4xxErrors", "@instrumentation.@name"="cloudwatch.aws/s3", BucketName="BUCKET",FilterId="FILTER"}) > 0.05Empfohlener Schwellenwert: 0,05 (eingebettet in die Abfrage)
Begründung des Schwellenwerts: Ein Wert von über 5% weist auf Probleme bei der Einrichtung oder beim Zugriff hin.
Bewertungsintervall: 60
Wartezeit: 900
Erholungsphase: 900
- 5xxErrors
-
Etiketten: BucketName, FilterId
Beschreibung des Alarms: Alarm, wenn die 5xx-Fehlerrate für einen S3-Bucket 5% übersteigt.
Absicht: Erkennt serverseitige Fehler, die sich auf die Anwendung auswirken.
PromQL-Kriterien:
avg({__name__="5xxErrors", "@instrumentation.@name"="cloudwatch.aws/s3", BucketName="BUCKET",FilterId="FILTER"}) > 0.05Empfohlener Schwellenwert: 0,05 (eingebettet in die Abfrage)
Begründung des Schwellenwerts: Über 5% deuten auf S3-Serviceprobleme hin.
Bewertungsintervall: 60
Wartezeit: 900
Erholungsphase: 900
- OperationsFailedReplication
-
Etiketten: SourceBucket DestinationBucket, RuleId
Beschreibung des Alarms: Alarm, wenn S3-Replikationsvorgänge für einen Bucket fehlschlagen.
Absicht: Erkennen Sie Replikationsfehler, die zu Dateninkonsistenzen führen könnten.
PromQL-Kriterien:
max({__name__="OperationsFailedReplication", "@instrumentation.@name"="cloudwatch.aws/s3", SourceBucket="SRC",DestinationBucket="DST",RuleId="RULE"}) > 0Empfohlener Schwellenwert: 0 (eingebettet in die Abfrage)
Begründung des Schwellenwerts: Jede fehlgeschlagene Replikation muss untersucht werden.
Bewertungsintervall: 60
Wartezeit: 300
Erholungsphase: 300
S3 Object Lambda
- 4xxErrors
-
Etiketten: AccessPointName, DataSource ARN
Beschreibung des Alarms: Alarm, wenn die 4xx-Fehlerrate für einen S3 Object Lambda-Zugangspunkt 5% übersteigt.
Absicht: Erkennung ungewöhnlicher Client-Fehlerraten für Object Lambda.
PromQL-Kriterien:
avg({__name__="4xxErrors", "@instrumentation.@name"="cloudwatch.aws/s3objectlambda", AccessPointName="AP",DataSourceARN="ARN"}) > 0.05Empfohlener Schwellenwert: 0,05 (eingebettet in die Abfrage)
Begründung des Schwellenwerts: Ein Wert über 5% weist auf Probleme bei der Einrichtung hin.
Bewertungsintervall: 60
Wartezeit: 900
Erholungsphase: 900
- 5xxErrors
-
Etiketten: AccessPointName, DataSource ARN
Beschreibung des Alarms: Alarm, wenn die 5xx-Fehlerrate für einen S3 Object Lambda-Zugangspunkt 5% übersteigt.
Absicht: Erkennt serverseitige Fehler in Object Lambda.
PromQL-Kriterien:
avg({__name__="5xxErrors", "@instrumentation.@name"="cloudwatch.aws/s3objectlambda", AccessPointName="AP",DataSourceARN="ARN"}) > 0.05Empfohlener Schwellenwert: 0,05 (eingebettet in die Abfrage)
Begründung des Schwellenwerts: Über 5% deuten auf Lambda- oder S3-Probleme hin.
Bewertungsintervall: 60
Wartezeit: 900
Erholungsphase: 900
- LambdaResponse4xx
-
Etiketten: AccessPointName, DataSource ARN
Beschreibung des Alarms: Alarm, wenn die Antwortrate der Lambda-Funktion 4xx für einen S3 Object Lambda-Zugangspunkt 5% überschreitet.
Absicht: Ermitteln Sie Client-Fehler mit der Lambda-Funktion.
PromQL-Kriterien:
avg({__name__="LambdaResponse4xx", "@instrumentation.@name"="cloudwatch.aws/s3objectlambda", AccessPointName="AP",DataSourceARN="ARN"}) > 0.05Empfohlener Schwellenwert: 0,05 (eingebettet in die Abfrage)
Begründung des Schwellenwerts: Über 5% deuten auf Probleme mit der Lambda-Funktion hin.
Bewertungsintervall: 60
Wartezeit: 900
Erholungsphase: 900
SNS
- NumberOfMessagesPublished
-
Beschriftungen: TopicName
Beschreibung des Alarms: Alarm, wenn die Anzahl der veröffentlichten Nachrichten unter den Schwellenwert für ein SNS-Thema fällt.
Absicht: Ermitteln Sie einen deutlichen Rückgang des Veröffentlichungsvolumens.
PromQL-Kriterien:
sum({__name__="NumberOfMessagesPublished", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) <THRESHOLDEmpfohlener Schwellenwert:
THRESHOLD(in die Abfrage eingebettet)Begründung des Schwellenwerts: Wird auf der Grundlage des zu erwartenden Mindestverkehrs festgelegt.
Bewertungsintervall: 60
Wartezeit: 300
Erholungsphase: 300
- NumberOfNotificationsDelivered
-
Etiketten: TopicName
Beschreibung des Alarms: Alarm, wenn die Anzahl der zugestellten Benachrichtigungen unter den Schwellenwert für ein SNS-Thema fällt.
Absicht: Stellen Sie fest, dass das Volumen der Benachrichtigungen zurückgeht.
PromQL-Kriterien:
sum({__name__="NumberOfNotificationsDelivered", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) <THRESHOLDEmpfohlener Schwellenwert:
THRESHOLD(in die Abfrage eingebettet)Begründung des Schwellenwerts: Wird auf der Grundlage der zu erwartenden Mindestlieferungen festgelegt.
Bewertungsintervall: 60
Wartezeit: 300
Erholungsphase: 300
- NumberOfNotificationsFailed
-
Etiketten: TopicName
Beschreibung des Alarms: Alarm, wenn die Anzahl der fehlgeschlagenen Benachrichtigungen den Schwellenwert für ein SNS-Thema überschreitet.
Absicht: Fehler bei der Zustellung erkennen.
PromQL-Kriterien:
sum({__name__="NumberOfNotificationsFailed", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) >THRESHOLDEmpfohlener Schwellenwert:
THRESHOLD(in die Abfrage eingebettet)Begründung des Schwellenwerts: Wird auf der Grundlage einer akzeptablen Ausfallrate festgelegt.
Bewertungsintervall: 60
Wartezeit: 300
Erholungsphase: 300
- NumberOfNotificationsFilteredOut-InvalidAttributes
-
Etiketten: TopicName
Beschreibung des Alarms: Alarm, wenn Benachrichtigungen aufgrund ungültiger Nachrichtenattribute herausgefiltert werden.
Absicht: Ungültige Nachrichtenattribute erkennen.
PromQL-Kriterien:
sum({__name__="NumberOfNotificationsFilteredOut-InvalidAttributes", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) > 0Empfohlener Schwellenwert: 0 (eingebettet in die Abfrage)
Begründung des Schwellenwerts: Jeder ungültige Filter weist auf eine Fehlkonfiguration hin.
Bewertungsintervall: 60
Wartezeit: 300
Erholungsphase: 300
- NumberOfNotificationsFilteredOut-InvalidMessageBody
-
Etiketten: TopicName
Beschreibung des Alarms: Alarm, wenn Benachrichtigungen aufgrund ungültiger Nachrichtentexte herausgefiltert werden.
Absicht: Ungültige Nachrichtentexte erkennen.
PromQL-Kriterien:
sum({__name__="NumberOfNotificationsFilteredOut-InvalidMessageBody", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) > 0Empfohlener Schwellenwert: 0 (eingebettet in die Abfrage)
Begründung des Schwellenwerts: Jeder ungültige Filter weist auf eine Fehlkonfiguration hin.
Bewertungsintervall: 60
Wartezeit: 300
Erholungsphase: 300
- NumberOfNotificationsRedrivenToDlq
-
Etiketten: TopicName
Beschreibung des Alarms: Alarm, wenn Benachrichtigungen für ein SNS-Thema an die Warteschlange mit unzustellbaren Nachrichten gesendet werden.
Absicht: Erkennt Nachrichten, die an eine Warteschlange mit unleserlichen Nachrichten gesendet wurden.
PromQL-Kriterien:
sum({__name__="NumberOfNotificationsRedrivenToDlq", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) > 0Empfohlener Schwellenwert: 0 (eingebettet in die Abfrage)
Begründung des Schwellenwerts: Jede DLQ-Nachricht weist auf Probleme bei der Zustellung hin.
Bewertungsintervall: 60
Wartezeit: 300
Erholungsphase: 300
- NumberOfNotificationsFailedToRedriveToDlq
-
Etiketten: TopicName
Beschreibung des Alarms: Alarm, wenn bei einem SNS-Thema keine Benachrichtigungen an die Warteschlange für unzustellbare Nachrichten gesendet werden.
Absicht: Erkennung von DLQ-Zustellungsfehlern.
PromQL-Kriterien:
sum({__name__="NumberOfNotificationsFailedToRedriveToDlq", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) > 0Empfohlener Schwellenwert: 0 (eingebettet in die Abfrage)
Rechtfertigung des Schwellenwerts: Ein fehlgeschlagener DLQ bedeutet, dass die Fehlerverfolgung verloren geht.
Bewertungsintervall: 60
Wartezeit: 300
Erholungsphase: 300
- SMSMonthToDateSpentUSD
-
Etiketten: TopicName
Beschreibung des Alarms: Alarm, wenn sich die SMS-Ausgaben dem Kontingent für ein SNS-Thema nähern.
Absicht: Erkennen Sie, dass sich die SMS-Ausgaben dem Kontingent nähern.
PromQL-Kriterien:
max({__name__="SMSMonthToDateSpentUSD", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) >THRESHOLDEmpfohlener Schwellenwert:
THRESHOLD(in die Abfrage eingebettet)Begründung des Schwellenwerts: Wird auf der Grundlage des SMS-Kontingents des Kontos festgelegt.
Bewertungsintervall: 60
Wartezeit: 300
Erholungsphase: 300
- SMSSuccessRate
-
Etiketten: TopicName
Beschreibung des Alarms: Alarm, wenn die Erfolgsrate der SMS-Zustellung unter den Schwellenwert für ein SNS-Thema fällt.
Absicht: Erkennung fehlgeschlagener SMS-Zustellungen.
PromQL-Kriterien:
avg({__name__="SMSSuccessRate", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) <THRESHOLDEmpfohlener Schwellenwert:
THRESHOLD(in die Abfrage eingebettet)Begründung des Schwellenwerts: Wird auf der Grundlage einer akzeptablen Versandrate festgelegt.
Bewertungsintervall: 60
Wartezeit: 300
Erholungsphase: 300
SQS
- ApproximateAgeOfOldestMessage
-
Etiketten: QueueName
Beschreibung des Alarms: Alarm, wenn das Alter der ältesten Nachricht den Schwellenwert für eine SQS-Warteschlange überschreitet.
Absicht: Erkennt Nachrichten, die nicht schnell genug verarbeitet werden.
PromQL-Kriterien:
max({__name__="ApproximateAgeOfOldestMessage", "@instrumentation.@name"="cloudwatch.aws/sqs", QueueName="QUEUE"}) >THRESHOLDEmpfohlener Schwellenwert:
THRESHOLD(in die Abfrage eingebettet)Rechtfertigung des Schwellenwerts: Wird auf der Grundlage einer akzeptablen Verarbeitungszeit für Nachrichten festgelegt.
Bewertungsintervall: 60
Wartezeit: 900
Erholungsphase: 900
- ApproximateNumberOfMessagesNotVisible
-
Beschriftungen: QueueName
Beschreibung des Alarms: Alarm, wenn die Anzahl der Nachrichten während des Fluges den Schwellenwert für eine SQS-Warteschlange überschreitet.
Absicht: Erkennt viele Meldungen während des Fluges, die auf Verbraucherprobleme hinweisen.
PromQL-Kriterien:
avg({__name__="ApproximateNumberOfMessagesNotVisible", "@instrumentation.@name"="cloudwatch.aws/sqs", QueueName="QUEUE"}) >THRESHOLDEmpfohlener Schwellenwert:
THRESHOLD(in die Abfrage eingebettet)Begründung des Schwellenwerts: Wird auf der Grundlage des erwarteten Verarbeitungsvolumens festgelegt.
Bewertungsintervall: 60
Wartezeit: 900
Erholungsphase: 900
- ApproximateNumberOfMessagesVisible
-
Beschriftungen: QueueName
Alarmbeschreibung: Alarm, wenn die Anzahl der sichtbaren Nachrichten den Schwellenwert für eine SQS-Warteschlange überschreitet.
Absicht: Erkennen Sie einen Nachrichtenstau, der auf langsame Verbraucher hinweist.
PromQL-Kriterien:
avg({__name__="ApproximateNumberOfMessagesVisible", "@instrumentation.@name"="cloudwatch.aws/sqs", QueueName="QUEUE"}) >THRESHOLDEmpfohlener Schwellenwert:
THRESHOLD(in die Abfrage eingebettet)Begründung des Schwellenwerts: Wird auf der Grundlage der erwarteten Warteschlangentiefe festgelegt.
Bewertungsintervall: 60
Wartezeit: 900
Erholungsphase: 900
- NumberOfMessagesSent
-
Beschriftungen: QueueName
Alarmbeschreibung: Alarm, wenn keine Nachrichten an eine SQS-Warteschlange gesendet werden.
Absicht: Detect Producers haben aufgehört, Nachrichten zu senden.
PromQL-Kriterien:
sum({__name__="NumberOfMessagesSent", "@instrumentation.@name"="cloudwatch.aws/sqs", QueueName="QUEUE"}) <= 0Empfohlener Schwellenwert: 0 (eingebettet in die Abfrage)
Begründung für den Schwellenwert: Null Meldungen deuten auf einen Ausfall des Herstellers hin.
Bewertungsintervall: 60
Wartezeit: 900
Erholungsphase: 900
VPN
- TunnelState (VPN-Ebene)
-
Beschriftungen: VpnId
Beschreibung des Alarms: Alarm, wenn sich mindestens ein VPN-Tunnel im Status DOWN befindet.
Absicht: Erkennt mindestens einen Tunnel im Status DOWN.
PromQL-Kriterien:
min({__name__="TunnelState", "@instrumentation.@name"="cloudwatch.aws/vpn", VpnId="VPN"}) < 1Empfohlener Schwellenwert: 1 (eingebettet in die Abfrage)
Begründung des Schwellenwerts: Unter 1 bedeutet, dass der Tunnel ausgefallen ist.
Bewertungsintervall: 300
Wartezeit: 900
Erholungsphase: 900
- TunnelState (Tunnelebene)
-
Beschriftungen: TunnelIpAddress
Beschreibung des Alarms: Alarm, wenn sich ein bestimmter VPN-Tunnel im Status DOWN befindet.
Absicht: Erkennt einen bestimmten Tunnel im Status DOWN.
PromQL-Kriterien:
min({__name__="TunnelState", "@instrumentation.@name"="cloudwatch.aws/vpn", TunnelIpAddress="IP"}) < 1Empfohlener Schwellenwert: 1 (eingebettet in die Abfrage)
Begründung des Schwellenwerts: Unter 1 bedeutet, dass der Tunnel ausgefallen ist.
Bewertungsintervall: 300
Wartezeit: 900
Erholungsphase: 900