View a markdown version of this page

Empfohlene PromQL-Alarme - Amazon CloudWatch

Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.

Empfohlene PromQL-Alarme

Verwenden Sie diese PromQL-Alarme als Äquivalente zu den klassischen empfohlenen Alarmen. Sie überwachen dieselben Metriken mithilfe von PromQL-Sofortabfragen, die anhand der über den OTLP-Endpunkt aufgenommenen Metriken ausgewertet werden. CloudWatch

PromQL-Alarme werden mit verwendet. EvaluationCriteria PromQLCriteria Im Gegensatz zu klassischen metrischen Alarmen ist der Schwellenwert direkt in den PromQL-Abfrageausdruck eingebettet.

  • Wartezeit — Die Dauer in Sekunden, die eine Zeitreihe kontinuierlich überschreiten muss, bevor der Alarm in den ALARM-Zustand übergeht.

  • Wiederherstellungszeitraum — Die Dauer in Sekunden, die alle Zeitreihen nicht mehr durchbrechen müssen, bevor der Alarm wieder in den Zustand OK zurückkehrt.

  • Testintervall — Gibt an, wie oft (in Sekunden) die PromQL-Abfrage CloudWatch ausgeführt wird.

Anmerkung

Für diese Alarme sind Metriken erforderlich, die über den CloudWatch OTLP-Endpunkt veröffentlicht werden. Weitere Informationen finden Sie unter PromQL-Alarme.

Sie können diese Alarme mithilfe AWS CloudFormation von bereitstellen. Verwenden Sie die PromQLCriteria Eigenschaften EvaluationCriteria und für die AWS::CloudWatch::Alarm Ressource.

REST-API

4XXError

Beschriftungen: ApiName, Stufe

Beschreibung des Alarms: Alarm, wenn die durchschnittliche 4XX-Fehlerrate in einer REST-API-Phase 5% übersteigt.

Absicht: Erkennt eine hohe Client-Fehlerrate, die auf Probleme mit Anfragen hinweist.

PromQL-Kriterien: avg({__name__="4XXError", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiName="your-api-name",Stage="your-stage"}) > 0.05

Empfohlener Schwellenwert: 0,05 (eingebettet in die Abfrage)

Rechtfertigung des Schwellenwerts: Erkennt eine Client-Fehlerrate von über 5%, was auf signifikante Anforderungsfehler hindeutet.

Bewertungsintervall: 60

Wartezeit: 300

Erholungsphase: 300

5XXError

Beschriftungen: ApiName, Stufe

Beschreibung des Alarms: Alarm, wenn die durchschnittliche 5XX-Fehlerrate in einer REST-API-Phase 5% übersteigt.

Absicht: Erkennt eine hohe Serverfehlerrate, die auf Backend-Ausfälle hindeutet.

PromQL-Kriterien: avg({__name__="5XXError", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiName="your-api-name",Stage="your-stage"}) > 0.05

Empfohlener Schwellenwert: 0,05 (eingebettet in die Abfrage)

Rechtfertigung des Schwellenwerts: Erkennt eine Serverfehlerrate von über 5%, weshalb eine sofortige Untersuchung erforderlich ist.

Bewertungsintervall: 60

Wartezeit: 180

Erholungszeit: 300

Latency

Beschriftungen: ApiName, Stufe

Alarmbeschreibung: Alarm, wenn die p90-Latenz für eine REST-API-Stufe 2500 ms überschreitet.

Absicht: Erkennt eine hohe p90-Latenz, die das Nutzererlebnis beeinträchtigt.

PromQL-Kriterien: histogram_quantile(0.9, {__name__="Latency", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiName="your-api-name",Stage="your-stage"}) > 2500

Empfohlener Schwellenwert: 2500 (eingebettet in die Abfrage)

Rechtfertigung des Schwellenwerts: Eine p90-Latenz von über 2500 ms weist auf verringerte Antwortzeiten für die meisten Anfragen hin.

Bewertungsintervall: 60

Wartezeit: 300

Erholungsphase: 300

Count

Beschriftungen: ApiName, Stufe

Beschreibung des Alarms: Alarm, wenn die Gesamtzahl der Anfragen unter den erwarteten Ausgangswert für eine REST-API-Phase fällt.

Absicht: Erkennt ein niedriges Verkehrsaufkommen, das auf Routing- oder Verfügbarkeitsprobleme hinweisen könnte.

PromQL-Kriterien: sum({__name__="Count", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiName="your-api-name",Stage="your-stage"}) < THRESHOLD

Empfohlener Schwellenwert: THRESHOLD (in die Abfrage eingebettet)

Rechtfertigung des Schwellenwerts: Legen Sie ihn auf der Grundlage Ihrer erwarteten Verkehrsbasislinie fest, um unerwartete Verkehrsrückgänge zu erkennen.

Bewertungsintervall: 60

Wartezeit: 600

Erholungsphase: 300

HTTP-API

4xx

Beschriftungen: ApiId, Bühne

Beschreibung des Alarms: Alarm, wenn die durchschnittliche 4xx-Fehlerrate in einer HTTP-API-Stufe 5% übersteigt.

Absicht: Erkennt eine hohe Client-Fehlerrate auf HTTP-API-Endpunkten.

PromQL-Kriterien: avg({__name__="4xx", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="your-api-id",Stage="your-stage"}) > 0.05

Empfohlener Schwellenwert: 0,05 (eingebettet in die Abfrage)

Begründung des Schwellenwerts: Erkennt eine Client-Fehlerrate von über 5%.

Bewertungsintervall: 60

Wartezeit: 300

Erholungsphase: 300

5xx

Beschriftungen: ApiId, Stufe

Beschreibung des Alarms: Alarm, wenn die durchschnittliche 5xx-Fehlerrate in einer HTTP-API-Stufe 5% übersteigt.

Absicht: Erkennt eine hohe Serverfehlerrate auf HTTP-API-Endpunkten.

PromQL-Kriterien: avg({__name__="5xx", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="your-api-id",Stage="your-stage"}) > 0.05

Empfohlener Schwellenwert: 0,05 (eingebettet in die Abfrage)

Rechtfertigung des Schwellenwerts: Erkennt eine Serverfehlerrate von über 5%, die untersucht werden müssen.

Bewertungsintervall: 60

Wartezeit: 180

Erholungszeit: 300

Latency

Beschriftungen: ApiId, Stufe

Alarmbeschreibung: Alarm, wenn die p90-Latenz für eine HTTP-API-Stufe 2500 ms überschreitet.

Absicht: Erkennt eine hohe p90-Latenz auf HTTP-API-Endpunkten.

PromQL-Kriterien: histogram_quantile(0.9, {__name__="Latency", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="your-api-id",Stage="your-stage"}) > 2500

Empfohlener Schwellenwert: 2500 (eingebettet in die Abfrage)

Rechtfertigung des Schwellenwerts: Eine p90-Latenz von über 2500 ms weist auf eine Verschlechterung der Reaktionszeiten hin.

Bewertungsintervall: 60

Wartezeit: 300

Erholungsphase: 300

IntegrationLatency

Beschriftungen: ApiId, Stufe

Beschreibung des Alarms: Alarm, wenn die Latenz der p90-Integration in einer HTTP-API-Stufe 2000 ms überschreitet.

Absicht: Erkennt eine hohe Latenz bei der Backend-Integration, die sich auf die Reaktionszeiten auswirkt.

PromQL-Kriterien: histogram_quantile(0.9, {__name__="IntegrationLatency", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="your-api-id",Stage="your-stage"}) > 2000

Empfohlener Schwellenwert: 2000 (eingebettet in die Abfrage)

Rechtfertigung des Schwellenwerts: Eine p90-Integrationslatenz von über 2000 ms weist auf eine Langsamkeit des Back-Ends hin.

Bewertungsintervall: 60

Wartezeit: 300

Erholungsphase: 300

Count

Beschriftungen: ApiId, Stufe

Beschreibung des Alarms: Alarm, wenn die Gesamtzahl der Anfragen unter den erwarteten Ausgangswert für eine HTTP-API-Stufe fällt.

Absicht: Erkennt ein niedriges Verkehrsaufkommen, das auf Routing- oder Verfügbarkeitsprobleme hinweisen könnte.

PromQL-Kriterien: sum({__name__="Count", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="your-api-id",Stage="your-stage"}) < THRESHOLD

Empfohlener Schwellenwert: THRESHOLD (in die Abfrage eingebettet)

Rechtfertigung des Schwellenwerts: Legen Sie ihn auf der Grundlage Ihrer erwarteten Verkehrsbasislinie fest, um unerwartete Verkehrsrückgänge zu erkennen.

Bewertungsintervall: 60

Wartezeit: 600

Erholungsphase: 300

WebSocket API

ClientError

Beschriftungen: ApiId, Stufe

Beschreibung des Alarms: Alarm, wenn die durchschnittliche Client-Fehlerrate in einer WebSocket API-Stufe 5% übersteigt.

Absicht: Erkennt eine hohe Client-Fehlerrate bei WebSocket API-Verbindungen.

PromQL-Kriterien: avg({__name__="ClientError", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="your-api-id",Stage="your-stage"}) > 0.05

Empfohlener Schwellenwert: 0,05 (in die Abfrage eingebettet)

Rechtfertigung des Schwellenwerts: Erkennt eine Client-Fehlerrate von über 5% bei WebSocket Verbindungen.

Bewertungsintervall: 60

Wartezeit: 300

Erholungsphase: 300

ExecutionError

Beschriftungen: ApiId, Stufe

Beschreibung des Alarms: Alarm, wenn die durchschnittliche Ausführungsfehlerrate in einer WebSocket API-Stufe 5% übersteigt.

Absicht: Erkennt eine hohe serverseitige Ausführungsfehlerrate bei WebSocket APIs.

PromQL-Kriterien: avg({__name__="ExecutionError", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="your-api-id",Stage="your-stage"}) > 0.05

Empfohlener Schwellenwert: 0,05 (eingebettet in die Abfrage)

Rechtfertigung des Schwellenwerts: Erkennt eine Ausführungsfehlerrate von mehr als 5%, die untersucht werden müssen.

Bewertungsintervall: 60

Wartezeit: 180

Erholungszeit: 300

IntegrationLatency

Beschriftungen: ApiId, Stufe

Beschreibung des Alarms: Alarm, wenn die Latenz der p90-Integration für eine WebSocket API-Stufe 2000 ms überschreitet.

Absicht: Erkennt eine hohe Latenz bei der Backend-Integration auf WebSocket API-Routen.

PromQL-Kriterien: histogram_quantile(0.9, {__name__="IntegrationLatency", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="your-api-id",Stage="your-stage"}) > 2000

Empfohlener Schwellenwert: 2000 (eingebettet in die Abfrage)

Rechtfertigung des Schwellenwerts: Eine p90-Integrationslatenz von über 2000 ms weist auf eine Langsamkeit des Back-Ends hin.

Bewertungsintervall: 60

Wartezeit: 300

Erholungsphase: 300

MessageCount

Beschriftungen: ApiId, Stufe

Beschreibung des Alarms: Alarm, wenn die Gesamtzahl der Nachrichten unter den erwarteten Ausgangswert für eine WebSocket API-Phase fällt.

Absicht: Erkennt ein niedriges Nachrichtenvolumen, das auf Verbindungs- oder Routing-Probleme hinweisen könnte.

PromQL-Kriterien: sum({__name__="MessageCount", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="your-api-id",Stage="your-stage"}) < THRESHOLD

Empfohlener Schwellenwert: THRESHOLD (in die Abfrage eingebettet)

Rechtfertigung des Schwellenwerts: Wird auf der Grundlage Ihres erwarteten Nachrichtenvolumens festgelegt, um unerwartete Rückgänge zu erkennen.

Bewertungsintervall: 60

Wartezeit: 600

Erholungsphase: 300

GroupInServiceCapacity

Etiketten: AutoScalingGroupName

Alarmbeschreibung: Alarm, wenn die durchschnittliche Kapazität im Betrieb unter das erwartete Minimum für eine Auto Scaling-Gruppe fällt.

Absicht: Erkennen Sie eine geringe Verfügbarkeit aufgrund von Startfehlern oder beendeten Instances.

PromQL-Kriterien: avg({__name__="GroupInServiceCapacity", "@instrumentation.@name"="cloudwatch.aws/autoscaling", AutoScalingGroupName="your-auto-scaling-group-name"}) < THRESHOLD

Empfohlener Schwellenwert: THRESHOLD (in die Abfrage eingebettet)

Begründung des Schwellenwerts: Dieser Wert wird auf der Grundlage Ihrer gewünschten Mindestkapazität festgelegt, um Startfehler oder unzureichende Instances zu erkennen.

Bewertungsintervall: 60

Wartezeit: 600

Erholungsphase: 600

DaysToExpiry

Beschriftungen: CertificateArn

Beschreibung des Alarms: Alarm, wenn die Mindestdauer der Tage bis zum Ablauf des Zertifikats auf 44 Tage oder weniger sinkt.

Absicht: Proaktive Warnung vor Ablauf des Zertifikats, um Zeit für die Verlängerung zu haben.

PromQL-Kriterien: min({__name__="DaysToExpiry", "@instrumentation.@name"="cloudwatch.aws/certificatemanager", CertificateArn="your-certificate-arn"}) <= 44

Empfohlener Schwellenwert: 44 (eingebettet in die Abfrage)

Begründung des Schwellenwerts: Bietet ausreichend Vorlaufzeit bis zum Ablauf des Zertifikats, um den Erneuerungsprozess abzuschließen.

Bewertungsintervall: 86400

Wartezeit: 86400

Erholungsphase: 86400

5xxErrorRate

Etiketten: DistributionId

Beschreibung des Alarms: Alarm, wenn die durchschnittliche Fehlerrate von 5xx den Schwellenwert für eine CloudFront Verteilung überschreitet.

Absicht: Erkennt eine hohe Herkunft oder eine hohe CloudFront Fehlerrate, die sich auf die Inhaltsbereitstellung auswirkt.

PromQL-Kriterien: avg({__name__="5xxErrorRate", "@instrumentation.@name"="cloudwatch.aws/cloudfront", DistributionId="your-distribution-id"}) > THRESHOLD

Empfohlener Schwellenwert: THRESHOLD (in die Abfrage eingebettet)

Begründung des Schwellenwerts: Dieser Wert wird auf der Grundlage Ihrer akzeptablen Fehlerquote bei der Bereitstellung von Inhalten festgelegt.

Bewertungsintervall: 60

Wartezeit: 300

Erholungsphase: 300

OriginLatency

Etiketten: DistributionId

Beschreibung des Alarms: Alarm, wenn die P90-Ursprungslatenz den Schwellenwert für eine CloudFront Verteilung überschreitet.

Absicht: Erkennt eine hohe Latenz bei der Ursprungsantwort, die die Leistung bei der Inhaltsbereitstellung beeinträchtigt.

PromQL-Kriterien: histogram_quantile(0.9, {__name__="OriginLatency", "@instrumentation.@name"="cloudwatch.aws/cloudfront", DistributionId="your-distribution-id"}) > THRESHOLD

Empfohlener Schwellenwert: THRESHOLD (in die Abfrage eingebettet)

Rechtfertigung des Schwellenwerts: Dieser Wert wird auf der Grundlage Ihrer erwarteten Antwortzeit bei der Herkunft und der Caching-Strategie festgelegt.

Bewertungsintervall: 60

Wartezeit: 300

Erholungsphase: 300

FunctionValidationErrors

Etiketten: DistributionId, FunctionName

Beschreibung des Alarms: Alarm, wenn bei der CloudFront Funktionsüberprüfung Fehler auftreten.

Absicht: Erkennen Sie Fehler bei der CloudFront Funktionsüberprüfung, die die Funktionsausführung verhindern.

PromQL-Kriterien: sum({__name__="FunctionValidationErrors", "@instrumentation.@name"="cloudwatch.aws/cloudfront", DistributionId="your-distribution-id",FunctionName="your-function-name"}) > 0

Empfohlener Schwellenwert: 0 (eingebettet in die Abfrage)

Rechtfertigung des Schwellenwerts: Jeder Überprüfungsfehler weist auf ein Problem mit der Funktionskonfiguration hin, das Aufmerksamkeit erfordert.

Bewertungsintervall: 60

Wartezeit: 120

Erholungszeitraum: 120

FunctionExecutionErrors

Etiketten: DistributionId, FunctionName

Beschreibung des Alarms: Alarm, wenn Fehler bei der CloudFront Funktionsausführung auftreten.

Absicht: Erkennt Laufzeitfehler in CloudFront Funktionen, die sich auf die Anforderungsverarbeitung auswirken.

PromQL-Kriterien: sum({__name__="FunctionExecutionErrors", "@instrumentation.@name"="cloudwatch.aws/cloudfront", DistributionId="your-distribution-id",FunctionName="your-function-name"}) > 0

Empfohlener Schwellenwert: 0 (eingebettet in die Abfrage)

Rechtfertigung des Schwellenwerts: Jeder Ausführungsfehler weist auf ein Laufzeitproblem im Funktionscode hin.

Bewertungsintervall: 60

Wartezeit: 300

Erholungsphase: 300

FunctionThrottles

Etiketten: DistributionId, FunctionName

Beschreibung des Alarms: Alarm, wenn eine CloudFront Funktionsdrosselung auftritt.

Absicht: Erkennen Sie CloudFront Funktionseinschränkungen, die die Anforderungsverarbeitung beeinträchtigen könnten.

PromQL-Kriterien: sum({__name__="FunctionThrottles", "@instrumentation.@name"="cloudwatch.aws/cloudfront", DistributionId="your-distribution-id",FunctionName="your-function-name"}) > 0

Empfohlener Schwellenwert: 0 (eingebettet in die Abfrage)

Begründung des Schwellenwerts: Jede Drosselung deutet darauf hin, dass die Funktion die Rechengrenzen erreicht.

Bewertungsintervall: 60

Wartezeit: 300

Erholungsphase: 300

SignUpThrottles

Etiketten: UserPool, UserPoolClient

Beschreibung des Alarms: Alarm, wenn Ereignisse bei der Anmeldedrosselung den Schwellenwert für einen Benutzerpool überschreiten.

Absicht: Erkennt eine Drosselung der Registrierung, die neue Benutzerregistrierungen verhindert.

PromQL-Kriterien: sum({__name__="SignUpThrottles", "@instrumentation.@name"="cloudwatch.aws/cognito", UserPool="your-user-pool",UserPoolClient="your-user-pool-client"}) > THRESHOLD

Empfohlener Schwellenwert: THRESHOLD (in die Abfrage eingebettet)

Begründung des Schwellenwerts: Dieser Wert wird auf der Grundlage Ihrer akzeptablen Drosselungsrate für Anmeldevorgänge festgelegt.

Bewertungsintervall: 60

Wartezeit: 300

Erholungsphase: 300

SignInThrottles

Etiketten: UserPool, UserPoolClient

Beschreibung des Alarms: Alarm, wenn Ereignisse bei der Anmeldedrosselung den Schwellenwert für einen Benutzerpool überschreiten.

Absicht: Erkennt eine Drosselung der Anmeldung, die eine Benutzerauthentifizierung verhindert.

PromQL-Kriterien: sum({__name__="SignInThrottles", "@instrumentation.@name"="cloudwatch.aws/cognito", UserPool="your-user-pool",UserPoolClient="your-user-pool-client"}) > THRESHOLD

Empfohlener Schwellenwert: THRESHOLD (in die Abfrage eingebettet)

Begründung des Schwellenwerts: Dieser Wert wird auf der Grundlage Ihrer akzeptablen Drosselrate für Anmeldevorgänge festgelegt.

Bewertungsintervall: 60

Wartezeit: 300

Erholungsphase: 300

TokenRefreshThrottles

Etiketten: UserPool, UserPoolClient

Alarmbeschreibung: Alarm, wenn Drosselungsereignisse bei der Token-Aktualisierung den Schwellenwert für einen Benutzerpool überschreiten.

Absicht: Erkennt eine Drosselung der Token-Aktualisierung, die zu Sitzungsunterbrechungen führen kann.

PromQL-Kriterien: sum({__name__="TokenRefreshThrottles", "@instrumentation.@name"="cloudwatch.aws/cognito", UserPool="your-user-pool",UserPoolClient="your-user-pool-client"}) > THRESHOLD

Empfohlener Schwellenwert: THRESHOLD (in die Abfrage eingebettet)

Begründung des Schwellenwerts: Dieser Wert wird auf der Grundlage Ihrer akzeptablen Drosselungsrate für Token-Aktualisierungsvorgänge festgelegt.

Bewertungsintervall: 60

Wartezeit: 300

Erholungsphase: 300

FederationThrottles

Etiketten: UserPool UserPoolClient, IdentityProvider

Beschreibung des Alarms: Alarm, wenn Federation Throttle-Ereignisse den Schwellenwert für einen Identitätsanbieter für einen Benutzerpool überschreiten.

Absicht: Es wird eine Verbunddrosselung erkannt, die eine Verbundanmeldung verhindern könnte.

PromQL-Kriterien: sum({__name__="FederationThrottles", "@instrumentation.@name"="cloudwatch.aws/cognito", UserPool="your-user-pool",UserPoolClient="your-user-pool-client",IdentityProvider="your-identity-provider"}) > THRESHOLD

Empfohlener Schwellenwert: THRESHOLD (in die Abfrage eingebettet)

Begründung des Schwellenwerts: Dieser Wert wird auf der Grundlage Ihrer akzeptablen Drosselungsrate für Verbundoperationen festgelegt.

Bewertungsintervall: 60

Wartezeit: 300

Erholungsphase: 300

AccountProvisionedReadCapacityUtilization

Beschriftungen: Keine

Beschreibung des Alarms: Alarm, wenn die Auslastung der bereitgestellten Lesekapazität auf Kontoebene 80% übersteigt.

Absicht: Erkennt, wenn sich die bereitgestellte Lesekapazität den Kontogrenzen nähert.

PromQL-Kriterien: max({__name__="AccountProvisionedReadCapacityUtilization", "@instrumentation.@name"="cloudwatch.aws/dynamodb"}) > 80

Empfohlener Schwellenwert: 80 (eingebettet in die Abfrage)

Begründung des Schwellenwerts: Bei einer Auslastung von 80% haben Sie nur begrenzten Spielraum, bevor Sie die Kontolimits erreichen.

Bewertungsintervall: 300

Wartezeit: 600

Erholungsphase: 600

AccountProvisionedWriteCapacityUtilization

Beschriftungen: Keine

Beschreibung des Alarms: Alarm, wenn die auf Kontoebene bereitgestellte Schreibkapazität mehr als 80% ausnutzt.

Absicht: Erkennt, wenn sich die bereitgestellte Schreibkapazität den Kontogrenzen nähert.

PromQL-Kriterien: max({__name__="AccountProvisionedWriteCapacityUtilization", "@instrumentation.@name"="cloudwatch.aws/dynamodb"}) > 80

Empfohlener Schwellenwert: 80 (eingebettet in die Abfrage)

Begründung des Schwellenwerts: Bei einer Auslastung von 80% haben Sie nur begrenzten Spielraum, bevor Sie die Kontolimits erreichen.

Bewertungsintervall: 300

Wartezeit: 600

Erholungsphase: 600

AgeOfOldestUnreplicatedRecord

Etiketten: TableName, DelegatedOperation

Beschreibung des Alarms: Alarm, wenn das Alter des ältesten nicht replizierten Datensatzes den Schwellenwert überschreitet.

Absicht: Erkennt Verzögerungen bei der Replikation, die zu veralteten Daten in globalen Tabellen führen könnten.

PromQL-Kriterien: max({__name__="AgeOfOldestUnreplicatedRecord", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name",DelegatedOperation="your-operation"}) > THRESHOLD

Empfohlener Schwellenwert: THRESHOLD (in die Abfrage eingebettet)

Begründung des Schwellenwerts: Dieser Wert wird auf der Grundlage Ihrer Anforderungen an die Aktualität der Replikation festgelegt.

Bewertungsintervall: 300

Wartezeit: 900

Erholungsphase: 900

FailedToReplicateRecordCount

Etiketten: TableName, DelegatedOperation

Beschreibung des Alarms: Alarm, wenn Datensätze in einer globalen Tabelle nicht repliziert werden können.

Absicht: Erkennung von Replikationsfehlern, die zu Dateninkonsistenzen zwischen Regionen führen.

PromQL-Kriterien: sum({__name__="FailedToReplicateRecordCount", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name",DelegatedOperation="your-operation"}) > 0

Empfohlener Schwellenwert: 0 (eingebettet in die Abfrage)

Rechtfertigung des Schwellenwerts: Jede fehlgeschlagene Replikation weist auf Probleme mit der Datenkonsistenz hin, die sofortige Aufmerksamkeit erfordern.

Bewertungsintervall: 60

Wartezeit: 60

Erholungsphase: 60

ReadThrottleEvents

Beschriftungen: TableName

Beschreibung des Alarms: Alarm, wenn Read-Throttle-Ereignisse den Schwellenwert für eine Tabelle überschreiten.

Absicht: Es wird eine Lesedrosselung erkannt, die auf eine unzureichende bereitgestellte Kapazität hinweist.

PromQL-Kriterien: sum({__name__="ReadThrottleEvents", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name"}) > THRESHOLD

Empfohlener Schwellenwert: THRESHOLD (in die Abfrage eingebettet)

Begründung des Schwellenwerts: Dieser Wert wird auf der Grundlage Ihrer akzeptablen Drosselzahl für Lesevorgänge festgelegt.

Bewertungsintervall: 60

Wartezeit: 300

Erholungsphase: 300

ReadThrottleEvents (GSI)

Etiketten: TableName, GlobalSecondaryIndexName

Beschreibung des Alarms: Alarm, wenn Read-Throttle-Ereignisse den Schwellenwert für einen globalen sekundären Index überschreiten.

Absicht: Es wird eine Lesedrosselung auf einem GSI erkannt, die auf eine unzureichende Indexkapazität hinweist.

PromQL-Kriterien: sum({__name__="ReadThrottleEvents", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name",GlobalSecondaryIndexName="your-index-name"}) > THRESHOLD

Empfohlener Schwellenwert: THRESHOLD (in die Abfrage eingebettet)

Begründung des Schwellenwerts: Dieser Wert wird auf der Grundlage Ihrer akzeptablen Drosselzahl für GSI-Lesevorgänge festgelegt.

Bewertungsintervall: 60

Wartezeit: 300

Erholungsphase: 300

ReplicationLatency

Etiketten: TableName, ReceivingRegion

Beschreibung des Alarms: Alarm, wenn die durchschnittliche Replikationslatenz den Schwellenwert für eine globale Tabelle überschreitet.

Absicht: Erkennt eine hohe Replikationslatenz, die zu veralteten Lesevorgängen in Replikatregionen führen kann.

PromQL-Kriterien: avg({__name__="ReplicationLatency", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name",ReceivingRegion="your-receiving-region"}) > THRESHOLD

Empfohlener Schwellenwert: THRESHOLD (in die Abfrage eingebettet)

Begründung des Schwellenwerts: Dieser Wert wird auf der Grundlage Ihrer Anforderungen an die Aktualität der Daten für Replikatregionen festgelegt.

Bewertungsintervall: 60

Wartezeit: 900

Erholungsphase: 900

SuccessfulRequestLatency

Etiketten: TableName, Bedienung

Alarmbeschreibung: Alarm, wenn die durchschnittliche erfolgreiche Anforderungslatenz den Schwellenwert für eine Tabellenoperation überschreitet.

Absicht: Erkennt hohe Latenzen bei DynamoDB-Vorgängen, die sich auf die Anwendungsleistung auswirken.

PromQL-Kriterien: avg({__name__="SuccessfulRequestLatency", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name",Operation="your-operation"}) > THRESHOLD

Empfohlener Schwellenwert: THRESHOLD (in die Abfrage eingebettet)

Begründung des Schwellenwerts: Dieser Wert wird auf der Grundlage Ihres Latenz-SLA für den jeweiligen DynamoDB-Vorgang festgelegt.

Bewertungsintervall: 60

Wartezeit: 600

Erholungsphase: 600

SystemErrors

Beschriftungen: TableName

Beschreibung des Alarms: Alarm, wenn Systemfehler den Schwellenwert für eine Tabelle überschreiten.

Absicht: Erkennt dienstseitige DynamoDB-Fehler, die sich auf die Tabellenverfügbarkeit auswirken.

PromQL-Kriterien: sum({__name__="SystemErrors", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name"}) > THRESHOLD

Empfohlener Schwellenwert: THRESHOLD (in die Abfrage eingebettet)

Begründung des Schwellenwerts: Dieser Wert wird auf der Grundlage Ihrer akzeptablen Anzahl von Systemfehlern für die Tabelle festgelegt.

Bewertungsintervall: 60

Wartezeit: 900

Erholungsphase: 900

ThrottledPutRecordCount

Etiketten: TableName, DelegatedOperation

Beschreibung des Alarms: Alarm, wenn die Anzahl der Datensätze gedrosselt wird, den Schwellenwert für eine Tabelle überschreitet.

Absicht: Erkennt gedrosselte Puts, die bei Streaming-Vorgängen zu Datenverlust führen könnten.

PromQL-Kriterien: max({__name__="ThrottledPutRecordCount", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name",DelegatedOperation="your-operation"}) > THRESHOLD

Empfohlener Schwellenwert: THRESHOLD (in die Abfrage eingebettet)

Begründung des Schwellenwerts: Dieser Wert wird auf der Grundlage Ihrer akzeptablen Anzahl an Drosselungen für Streaming-Put-Operationen festgelegt.

Bewertungsintervall: 60

Wartezeit: 600

Erholungsphase: 600

UserErrors

Beschriftungen: Keine

Beschreibung des Alarms: Alarm, wenn Benutzerfehler den Schwellenwert für das gesamte Konto überschreiten.

Absicht: Erkennen Sie eine hohe Anzahl von Kundenfehlern, wie z. B. fehlgeschlagene Validierungs- oder Bedingungsprüfungen.

PromQL-Kriterien: sum({__name__="UserErrors", "@instrumentation.@name"="cloudwatch.aws/dynamodb"}) > THRESHOLD

Empfohlener Schwellenwert: THRESHOLD (in die Abfrage eingebettet)

Begründung des Schwellenwerts: Dieser Wert wird auf der Grundlage Ihrer akzeptablen Fehlerrate für clientseitige Anforderungsfehler festgelegt.

Bewertungsintervall: 60

Wartezeit: 600

Erholungsphase: 600

WriteThrottleEvents

Beschriftungen: TableName

Beschreibung des Alarms: Alarm, wenn Write-Throttle-Ereignisse den Schwellenwert für eine Tabelle überschreiten.

Absicht: Es wird eine Schreibdrosselung erkannt, die auf eine unzureichende bereitgestellte Kapazität hinweist.

PromQL-Kriterien: sum({__name__="WriteThrottleEvents", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name"}) > THRESHOLD

Empfohlener Schwellenwert: THRESHOLD (in die Abfrage eingebettet)

Begründung des Schwellenwerts: Dieser Wert wird auf der Grundlage Ihrer akzeptablen Anzahl an Drosselungen für Schreibvorgänge festgelegt.

Bewertungsintervall: 60

Wartezeit: 300

Erholungsphase: 300

WriteThrottleEvents (GSI)

Etiketten: TableName, GlobalSecondaryIndexName

Beschreibung des Alarms: Alarm, wenn Write-Throttle-Ereignisse den Schwellenwert für einen globalen sekundären Index überschreiten.

Absicht: Es wird eine Schreibdrosselung auf einem GSI erkannt, die auf eine unzureichende Indexkapazität hinweist.

PromQL-Kriterien: sum({__name__="WriteThrottleEvents", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name",GlobalSecondaryIndexName="your-index-name"}) > THRESHOLD

Empfohlener Schwellenwert: THRESHOLD (in die Abfrage eingebettet)

Begründung des Schwellenwerts: Dieser Wert wird auf der Grundlage Ihrer akzeptablen Drosselzahl für GSI-Schreibvorgänge festgelegt.

Bewertungsintervall: 60

Wartezeit: 300

Erholungsphase: 300

VolumeStalledIOCheck

Etiketten: VolumeId, InstanceId

Beschreibung des Alarms: Alarm, wenn ein EBS-Volume einen fehlgeschlagenen I/O Check meldet.

Absicht: Erkennt Blockaden I/O auf EBS-Datenträgern, die auf eine Beeinträchtigung der Lautstärke hinweisen.

PromQL-Kriterien: max({__name__="VolumeStalledIOCheck", "@instrumentation.@name"="cloudwatch.aws/ebs", VolumeId="your-volume-id",InstanceId="your-instance-id"}) >= 1

Empfohlener Schwellenwert: 1 (eingebettet in die Abfrage)

Begründung des Schwellenwerts: Ein Wert von 1 oder höher bedeutet, dass das Volumen ins Stocken geraten ist I/O und eine sofortige Untersuchung erforderlich ist.

Bewertungsintervall: 60

Wartezeit: 600

Erholungsphase: 600

CPUUtilization

Beschriftungen: InstanceId

Alarmbeschreibung: Alarm, wenn die durchschnittliche CPU-Auslastung für eine EC2-Instance 80% übersteigt.

Absicht: Erkennung einer hohen CPU-Auslastung.

PromQL-Kriterien: avg({__name__="CPUUtilization", "@instrumentation.@name"="cloudwatch.aws/ec2", InstanceId="your-instance-id"}) > 80

Empfohlener Schwellenwert: 80 (eingebettet in die Abfrage)

Begründung des Schwellenwerts: Der Schwellenwert von 80% gibt Spielraum vor der Sättigung.

Bewertungsintervall: 300

Wartezeit: 900

Erholungsphase: 900

StatusCheckFailed

Beschriftungen: InstanceId

Alarmbeschreibung: Alarm, wenn eine Instance oder eine Systemstatusüberprüfung für eine EC2-Instance fehlschlägt.

Absicht: Erkennung von Instance- oder Systemintegritätsproblemen.

PromQL-Kriterien: max({__name__="StatusCheckFailed", "@instrumentation.@name"="cloudwatch.aws/ec2", InstanceId="your-instance-id"}) >= 1

Empfohlener Schwellenwert: 1 (eingebettet in die Abfrage)

Begründung des Schwellenwerts: Jeder Fehler bei der Statusüberprüfung muss untersucht werden.

Bewertungsintervall: 300

Wartezeit: 600

Erholungsphase: 600

StatusCheckFailed_Angehängte EBS

Beschriftungen: InstanceId

Alarmbeschreibung: Alarm, wenn ein angeschlossenes EBS-Volume für eine EC2-Instance nicht mehr erreichbar ist.

Absicht: Erkennung unerreichbarer EBS-Volumes.

PromQL-Kriterien: max({__name__="StatusCheckFailed_AttachedEBS", "@instrumentation.@name"="cloudwatch.aws/ec2", InstanceId="your-instance-id"}) >= 1

Empfohlener Schwellenwert: 1 (eingebettet in die Abfrage)

Begründung des Schwellenwerts: Nicht erreichbare Volumes führen zu I/O Ausfällen.

Bewertungsintervall: 60

Wartezeit: 600

Erholungsphase: 600

CPUReservation

Beschriftungen: ClusterName

Beschreibung des Alarms: Alarm, wenn die durchschnittliche CPU-Reservierung für einen ECS-Cluster 80% übersteigt.

Absicht: Erkennt den Cluster, der sich der CPU-Kapazität nähert.

PromQL-Kriterien: avg({__name__="CPUReservation", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="your-cluster-name"}) > 80

Empfohlener Schwellenwert: 80 (eingebettet in die Abfrage)

Begründung für den Schwellenwert: Eine Reservierung von 80% deutet auf begrenzten Spielraum für neue Aufgaben hin.

Bewertungsintervall: 60

Wartezeit: 300

Erholungsphase: 300

CPUUtilization

Etiketten: ClusterName, ServiceName

Beschreibung des Alarms: Alarm, wenn die durchschnittliche CPU-Auslastung für einen ECS-Dienst 80% übersteigt.

Absicht: Erkennt eine hohe CPU-Auslastung für den ECS-Dienst.

PromQL-Kriterien: avg({__name__="CPUUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="your-cluster-name",ServiceName="your-service-name"}) > 80

Empfohlener Schwellenwert: 80 (eingebettet in die Abfrage)

Begründung des Schwellenwerts: Bei 80% besteht Spielraum vor der Sättigung.

Bewertungsintervall: 60

Wartezeit: 300

Erholungsphase: 300

EBSFilesystemUtilization

Etiketten: ClusterName, ServiceName

Beschreibung des Alarms: Alarm, wenn die durchschnittliche Auslastung des EBS-Dateisystems für einen ECS-Dienst 80% übersteigt.

Absicht: Erkennung einer hohen EBS-Speicherauslastung.

PromQL-Kriterien: avg({__name__="EBSFilesystemUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="your-cluster-name",ServiceName="your-service-name"}) > 80

Empfohlener Schwellenwert: 80 (eingebettet in die Abfrage)

Begründung des Schwellenwerts: Bei 80% besteht Spielraum vor der Sättigung.

Bewertungsintervall: 60

Wartezeit: 300

Erholungsphase: 300

MemoryReservation

Etiketten: ClusterName

Alarmbeschreibung: Alarm, wenn die durchschnittliche Speicherreservierung für einen ECS-Cluster 80% übersteigt.

Absicht: Erkennt den Cluster, der sich der Speicherkapazität nähert.

PromQL-Kriterien: avg({__name__="MemoryReservation", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="your-cluster-name"}) > 80

Empfohlener Schwellenwert: 80 (eingebettet in die Abfrage)

Begründung des Schwellenwerts: Eine Reservierung von 80% deutet auf begrenzten Spielraum für neue Aufgaben hin.

Bewertungsintervall: 60

Wartezeit: 300

Erholungsphase: 300

MemoryUtilization

Etiketten: ClusterName, ServiceName

Beschreibung des Alarms: Alarm, wenn die durchschnittliche Speicherauslastung für einen ECS-Dienst 80% übersteigt.

Absicht: Erkennung einer hohen Speicherauslastung.

PromQL-Kriterien: avg({__name__="MemoryUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="your-cluster-name",ServiceName="your-service-name"}) > 80

Empfohlener Schwellenwert: 80 (eingebettet in die Abfrage)

Begründung des Schwellenwerts: Bei 80% besteht Spielraum vor der Sättigung.

Bewertungsintervall: 60

Wartezeit: 300

Erholungsphase: 300

HTTP Code_Target _5xx_COUNT

Beschriftungen:, ClusterName ServiceName

Alarmbeschreibung: Alarm, wenn die Anzahl der HTTP 5XX-Fehler den Schwellenwert für einen ECS-Dienst überschreitet.

Absicht: Erkennt eine hohe serverseitige Fehleranzahl.

PromQL-Kriterien: sum({__name__="HTTPCode_Target_5XX_Count", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="your-cluster-name",ServiceName="your-service-name"}) > THRESHOLD

Empfohlener Schwellenwert: THRESHOLD (in die Abfrage eingebettet)

Begründung des Schwellenwerts: Dieser Wert wird auf der Grundlage der normalen Fehlerquote Ihrer Anwendung festgelegt.

Bewertungsintervall: 60

Wartezeit: 300

Erholungsphase: 300

TargetResponseTime

Etiketten: ClusterName, ServiceName

Alarmbeschreibung: Alarm, wenn die durchschnittliche Zielreaktionszeit den Schwellenwert für einen ECS-Service überschreitet.

Absicht: Erkennt eine hohe Zielreaktionszeit.

PromQL-Kriterien: avg({__name__="TargetResponseTime", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="your-cluster-name",ServiceName="your-service-name"}) > THRESHOLD

Empfohlener Schwellenwert: THRESHOLD (in die Abfrage eingebettet)

Begründung des Schwellenwerts: Wird auf der Grundlage der akzeptablen Latenzanforderungen Ihrer Anwendung festgelegt.

Bewertungsintervall: 60

Wartezeit: 300

Erholungsphase: 300

EphemeralStorageUtilized

Beschriftungen: ClusterName, ServiceName

Beschreibung des Alarms: Alarm, wenn die durchschnittliche Nutzung kurzlebigen Speichers den Schwellenwert für Fargate-Aufgaben überschreitet.

Absicht: Erkennt eine hohe Auslastung des kurzlebigen Speichers für Fargate-Aufgaben.

PromQL-Kriterien: avg({__name__="EphemeralStorageUtilized", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name",ServiceName="your-service-name"}) > THRESHOLD

Empfohlener Schwellenwert: THRESHOLD (in die Abfrage eingebettet)

Begründung des Schwellenwerts: Dieser Wert wird auf der Grundlage der temporären Speicherzuweisung Ihrer Aufgabe festgelegt.

Bewertungsintervall: 60

Wartezeit: 300

Erholungsphase: 300

RunningTaskCount

Etiketten: ClusterName, ServiceName

Beschreibung des Alarms: Alarm, wenn die Anzahl der laufenden Aufgaben für einen ECS-Dienst auf Null fällt.

Absicht: Erkennt, wenn keine Aufgaben ausgeführt werden.

PromQL-Kriterien: avg({__name__="RunningTaskCount", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name",ServiceName="your-service-name"}) <= 0

Empfohlener Schwellenwert: 0 (eingebettet in die Abfrage)

Rechtfertigung des Schwellenwerts: Wenn keine Aufgaben ausgeführt werden, deutet dies auf einen Serviceausfall hin.

Bewertungsintervall: 60

Wartezeit: 300

Erholungsphase: 300

instance_filesystem_utilization

Etiketten: InstanceId ContainerInstanceId, ClusterName

Beschreibung des Alarms: Alarm, wenn die durchschnittliche Dateisystemauslastung auf einer Container-Instance 90% übersteigt.

Absicht: Erkennung einer hohen Dateisystemauslastung.

PromQL-Kriterien: avg({__name__="instance_filesystem_utilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", InstanceId="your-instance-id",ContainerInstanceId="your-container-instance-id",ClusterName="your-cluster-name"}) > 90

Empfohlener Schwellenwert: 90 (eingebettet in die Abfrage)

Rechtfertigung des Schwellenwerts: Bei 90% der Dateisystemauslastung bleibt nur wenig Platz für Operationen.

Bewertungsintervall: 60

Wartezeit: 300

Erholungsphase: 300

TaskCpuUtilization (Cluster-Ebene)

Beschriftungen: ClusterName

Beschreibung des Alarms: Alarm, wenn die durchschnittliche CPU-Auslastung der Aufgabe auf Cluster-Ebene 80% übersteigt.

Absicht: Erkennt eine hohe CPU-Auslastung.

PromQL-Kriterien: avg({__name__="TaskCpuUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name"}) > 80

Empfohlener Schwellenwert: 80 (eingebettet in die Abfrage)

Begründung des Schwellenwerts: Bei 80% besteht Spielraum vor der Sättigung.

Bewertungsintervall: 60

Wartezeit: 300

Erholungsphase: 300

TaskCpuUtilization (Serviceniveau)

Etiketten: ClusterName, ServiceName

Beschreibung des Alarms: Alarm, wenn die durchschnittliche CPU-Auslastung der Aufgabe auf Service-Ebene 80% übersteigt.

Absicht: Erkennung einer hohen CPU-Auslastung.

PromQL-Kriterien: avg({__name__="TaskCpuUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name",ServiceName="your-service-name"}) > 80

Empfohlener Schwellenwert: 80 (eingebettet in die Abfrage)

Begründung des Schwellenwerts: Bei 80% besteht Spielraum vor der Sättigung.

Bewertungsintervall: 60

Wartezeit: 300

Erholungsphase: 300

TaskMemoryUtilization (Cluster-Ebene)

Beschriftungen: ClusterName

Beschreibung des Alarms: Alarm, wenn die durchschnittliche Arbeitsspeicherauslastung der Aufgabe auf Cluster-Ebene 80% übersteigt.

Absicht: Erkennt eine hohe Speicherauslastung.

PromQL-Kriterien: avg({__name__="TaskMemoryUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name"}) > 80

Empfohlener Schwellenwert: 80 (eingebettet in die Abfrage)

Begründung des Schwellenwerts: Bei 80% besteht Spielraum vor der Sättigung.

Bewertungsintervall: 60

Wartezeit: 300

Erholungsphase: 300

TaskMemoryUtilization (Serviceniveau)

Etiketten: ClusterName, ServiceName

Beschreibung des Alarms: Alarm, wenn die durchschnittliche Arbeitsspeicherauslastung der Aufgabe auf Service-Ebene 80% übersteigt.

Absicht: Erkennung einer hohen Speicherauslastung.

PromQL-Kriterien: avg({__name__="TaskMemoryUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name",ServiceName="your-service-name"}) > 80

Empfohlener Schwellenwert: 80 (eingebettet in die Abfrage)

Begründung des Schwellenwerts: Bei 80% besteht Spielraum vor der Sättigung.

Bewertungsintervall: 60

Wartezeit: 300

Erholungsphase: 300

ContainerCpuUtilization (Cluster-Ebene)

Beschriftungen: ClusterName

Beschreibung des Alarms: Alarm, wenn die durchschnittliche CPU-Auslastung des Containers auf Cluster-Ebene 80% übersteigt.

Absicht: Erkennung einer hohen CPU-Auslastung.

PromQL-Kriterien: avg({__name__="ContainerCpuUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name"}) > 80

Empfohlener Schwellenwert: 80 (eingebettet in die Abfrage)

Begründung des Schwellenwerts: Bei 80% besteht Spielraum vor der Sättigung.

Bewertungsintervall: 60

Wartezeit: 300

Erholungsphase: 300

ContainerCpuUtilization (Containerebene)

Beschriftungen: ContainerName ClusterName, ServiceName

Beschreibung des Alarms: Alarm, wenn die durchschnittliche CPU-Auslastung des Containers auf Containerebene 80% übersteigt.

Absicht: Erkennung einer hohen CPU-Auslastung.

PromQL-Kriterien: avg({__name__="ContainerCpuUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ContainerName="your-container-name",ClusterName="your-cluster-name",ServiceName="your-service-name"}) > 80

Empfohlener Schwellenwert: 80 (eingebettet in die Abfrage)

Begründung des Schwellenwerts: Bei 80% besteht Spielraum vor der Sättigung.

Bewertungsintervall: 60

Wartezeit: 300

Erholungsphase: 300

ContainerMemoryUtilization (Cluster-Ebene)

Beschriftungen: ClusterName

Alarmbeschreibung: Alarm, wenn die durchschnittliche Speicherauslastung des Containers auf Cluster-Ebene 80% übersteigt.

Absicht: Erkennung einer hohen Speicherauslastung.

PromQL-Kriterien: avg({__name__="ContainerMemoryUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name"}) > 80

Empfohlener Schwellenwert: 80 (eingebettet in die Abfrage)

Begründung des Schwellenwerts: Bei 80% besteht Spielraum vor der Sättigung.

Bewertungsintervall: 60

Wartezeit: 300

Erholungsphase: 300

ContainerMemoryUtilization (Containerebene)

Beschriftungen: ContainerName ClusterName, ServiceName

Beschreibung des Alarms: Alarm, wenn die durchschnittliche Speicherauslastung des Containers auf Containerebene 80% übersteigt.

Absicht: Erkennung einer hohen Speicherauslastung.

PromQL-Kriterien: avg({__name__="ContainerMemoryUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ContainerName="your-container-name",ClusterName="your-cluster-name",ServiceName="your-service-name"}) > 80

Empfohlener Schwellenwert: 80 (eingebettet in die Abfrage)

Begründung des Schwellenwerts: Bei 80% besteht Spielraum vor der Sättigung.

Bewertungsintervall: 60

Wartezeit: 300

Erholungsphase: 300

TaskEBSfilesystemUtilization

Etiketten: ClusterName, ServiceName

Beschreibung des Alarms: Alarm, wenn die durchschnittliche Auslastung des EBS-Dateisystems für Aufgaben 80% übersteigt.

Absicht: Erkennt eine hohe Auslastung des EBS-Dateisystems.

PromQL-Kriterien: avg({__name__="TaskEBSfilesystemUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name",ServiceName="your-service-name"}) > 80

Empfohlener Schwellenwert: 80 (eingebettet in die Abfrage)

Begründung des Schwellenwerts: Bei 80% besteht Spielraum vor der Sättigung.

Bewertungsintervall: 60

Wartezeit: 300

Erholungsphase: 300

TaskEphemeralStorageUtilization (Cluster-Ebene)

Beschriftungen: ClusterName

Beschreibung des Alarms: Alarm, wenn die durchschnittliche Auslastung des kurzlebigen Speichers auf Cluster-Ebene 80% übersteigt.

Absicht: Erkennt eine hohe Auslastung des kurzlebigen Speichers.

PromQL-Kriterien: avg({__name__="TaskEphemeralStorageUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name"}) > 80

Empfohlener Schwellenwert: 80 (eingebettet in die Abfrage)

Begründung des Schwellenwerts: Bei 80% besteht Spielraum vor der Sättigung.

Bewertungsintervall: 60

Wartezeit: 300

Erholungsphase: 300

TaskEphemeralStorageUtilization (Serviceniveau)

Etiketten: ClusterName, ServiceName

Beschreibung des Alarms: Alarm, wenn die durchschnittliche Auslastung des kurzlebigen Speichers auf Service-Ebene 80% übersteigt.

Absicht: Erkennt eine hohe Auslastung kurzlebigen Speichers.

PromQL-Kriterien: avg({__name__="TaskEphemeralStorageUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name",ServiceName="your-service-name"}) > 80

Empfohlener Schwellenwert: 80 (eingebettet in die Abfrage)

Begründung des Schwellenwerts: Bei 80% besteht Spielraum vor der Sättigung.

Bewertungsintervall: 60

Wartezeit: 300

Erholungsphase: 300

PercentIOLimit

Etiketten: FileSystemId

Beschreibung des Alarms: Alarm, wenn ein EFS-Dateisystem 100% seines I/O Grenzwerts erreicht.

Absicht: Erkennt, wenn das Dateisystem das Limit erreicht I/O .

PromQL-Kriterien: avg({__name__="PercentIOLimit", "@instrumentation.@name"="cloudwatch.aws/efs", FileSystemId="your-filesystem-id"}) >= 100

Empfohlener Schwellenwert: 100 (eingebettet in die Abfrage)

Begründung des Schwellenwerts: Bei einem Wert von 100% wird das Dateisystem zu einem Engpass.

Bewertungsintervall: 60

Wartezeit: 900

Erholungsphase: 900

BurstCreditBalance

Beschriftungen: FileSystemId

Alarmbeschreibung: Alarm, wenn das Burst-Guthaben für ein EFS-Dateisystem auf Null fällt.

Absicht: Erkennt aufgebrauchte Burst-Credits, die zu einer Verlangsamung des Durchsatzes führen.

PromQL-Kriterien: avg({__name__="BurstCreditBalance", "@instrumentation.@name"="cloudwatch.aws/efs", FileSystemId="your-filesystem-id"}) <= 0

Empfohlener Schwellenwert: 0 (eingebettet in die Abfrage)

Begründung für den Schwellenwert: Null Credits führen zu einem verringerten Durchsatz.

Bewertungsintervall: 60

Wartezeit: 900

Erholungsphase: 900

node_cpu_utilization

Beschriftungen: ClusterName

Alarmbeschreibung: Alarm, wenn die maximale CPU-Auslastung auf EKS-Worker-Knoten 80% überschreitet.

Absicht: Erkennt eine hohe CPU-Auslastung auf Worker-Knoten.

PromQL-Kriterien: max({__name__="node_cpu_utilization", "@instrumentation.@name"="cloudwatch.aws/eks-containerinsights", ClusterName="your-cluster-name"}) > 80

Empfohlener Schwellenwert: 80 (eingebettet in die Abfrage)

Begründung des Schwellenwerts: Bei 80% besteht Spielraum vor der Sättigung.

Bewertungsintervall: 60

Wartezeit: 300

Erholungsphase: 300

node_filesystem_utilization

Etiketten: ClusterName

Alarmbeschreibung: Alarm, wenn die maximale Dateisystemauslastung den Schwellenwert auf EKS-Worker-Knoten überschreitet.

Absicht: Erkennt eine hohe Dateisystemauslastung auf Worker-Knoten.

PromQL-Kriterien: max({__name__="node_filesystem_utilization", "@instrumentation.@name"="cloudwatch.aws/eks-containerinsights", ClusterName="your-cluster-name"}) > THRESHOLD

Empfohlener Schwellenwert: THRESHOLD (in die Abfrage eingebettet)

Begründung des Schwellenwerts: Dieser Wert wird auf der Grundlage der Speicherkapazität und der Nutzungsmuster Ihres Knotens festgelegt.

Bewertungsintervall: 60

Wartezeit: 300

Erholungsphase: 300

node_memory_utilization

Etiketten: ClusterName

Alarmbeschreibung: Alarm, wenn die maximale Speicherauslastung auf EKS-Worker-Knoten 80% überschreitet.

Absicht: Erkennen Sie einen hohen Speicherbedarf auf Worker-Knoten.

PromQL-Kriterien: max({__name__="node_memory_utilization", "@instrumentation.@name"="cloudwatch.aws/eks-containerinsights", ClusterName="your-cluster-name"}) > 80

Empfohlener Schwellenwert: 80 (eingebettet in die Abfrage)

Begründung des Schwellenwerts: Bei 80% besteht Spielraum vor der Sättigung.

Bewertungsintervall: 60

Wartezeit: 300

Erholungsphase: 300

pod_cpu_utilization_over_pod_limit

Beschriftungen: ClusterName, Namespace, Dienst

Beschreibung des Alarms: Alarm, wenn die CPU-Auslastung des Pods 80% des Grenzwerts überschreitet.

Absicht: Erkennt Pods, die sich den CPU-Grenzwerten nähern.

PromQL-Kriterien: max({__name__="pod_cpu_utilization_over_pod_limit", "@instrumentation.@name"="cloudwatch.aws/eks-containerinsights", ClusterName="your-cluster-name",Namespace="your-namespace",Service="your-service"}) > 80

Empfohlener Schwellenwert: 80 (eingebettet in die Abfrage)

Begründung des Schwellenwerts: 80% geben Spielraum, bevor eine Drosselung erfolgt.

Bewertungsintervall: 60

Wartezeit: 300

Erholungsphase: 300

pod_memory_utilization_over_pod_limit

Beschriftungen: ClusterName, Namespace, Dienst

Beschreibung des Alarms: Alarm, wenn die Speicherauslastung des Pods 80% des Grenzwerts überschreitet.

Absicht: Erkennt Pods, die sich der Speicherbegrenzung nähern.

PromQL-Kriterien: max({__name__="pod_memory_utilization_over_pod_limit", "@instrumentation.@name"="cloudwatch.aws/eks-containerinsights", ClusterName="your-cluster-name",Namespace="your-namespace",Service="your-service"}) > 80

Empfohlener Schwellenwert: 80 (eingebettet in die Abfrage)

Begründung des Schwellenwerts: 80% geben Spielraum, bevor OomKill auftritt.

Bewertungsintervall: 60

Wartezeit: 300

Erholungsphase: 300

CPUUtilization

Etiketten: CacheClusterId, CacheNodeId

Beschreibung des Alarms: Alarm, wenn die durchschnittliche CPU-Auslastung den Schwellenwert für einen ElastiCache Knoten überschreitet.

Absicht: Erkennt eine hohe CPU-Auslastung in der gesamten Instanz.

PromQL-Kriterien: avg({__name__="CPUUtilization", "@instrumentation.@name"="cloudwatch.aws/elasticache", CacheClusterId="your-cache-cluster-id",CacheNodeId="your-cache-node-id"}) > THRESHOLD

Empfohlener Schwellenwert: THRESHOLD (in die Abfrage eingebettet)

Begründung des Schwellenwerts: Dieser Wert wird auf der Grundlage Ihres Knotentyps und Ihrer Workload-Merkmale festgelegt.

Bewertungsintervall: 60

Wartezeit: 300

Erholungsphase: 300

CurrConnections

Etiketten: CacheClusterId, CacheNodeId

Beschreibung des Alarms: Alarm, wenn die Anzahl der Verbindungen den Schwellenwert für einen ElastiCache Knoten überschreitet.

Absicht: Erkennt hohe Verbindungszahlen.

PromQL-Kriterien: avg({__name__="CurrConnections", "@instrumentation.@name"="cloudwatch.aws/elasticache", CacheClusterId="your-cache-cluster-id",CacheNodeId="your-cache-node-id"}) > THRESHOLD

Empfohlener Schwellenwert: THRESHOLD (in die Abfrage eingebettet)

Begründung des Schwellenwerts: Dieser Wert wird auf der Grundlage Ihrer erwarteten Größe des Verbindungspools und der Anwendungsanforderungen festgelegt.

Bewertungsintervall: 60

Wartezeit: 600

Erholungsphase: 600

DatabaseMemoryUsagePercentage

Beschriftungen: CacheClusterId

Beschreibung des Alarms: Alarm, wenn die Nutzung des Datenbankspeichers den Schwellenwert für einen ElastiCache Cluster überschreitet.

Absicht: Ermitteln Sie eine hohe Speicherauslastung, um Schreibfehler zu vermeiden.

PromQL-Kriterien: avg({__name__="DatabaseMemoryUsagePercentage", "@instrumentation.@name"="cloudwatch.aws/elasticache", CacheClusterId="your-cache-cluster-id"}) > THRESHOLD

Empfohlener Schwellenwert: THRESHOLD (in die Abfrage eingebettet)

Begründung des Schwellenwerts: Dieser Wert wird auf der Grundlage Ihrer Räumungsrichtlinien und der Wichtigkeit Ihrer Daten festgelegt.

Bewertungsintervall: 60

Wartezeit: 300

Erholungsphase: 300

EngineCPUUtilization

Etiketten: CacheClusterId

Beschreibung des Alarms: Alarm, wenn die CPU-Auslastung der Redis-Engine für einen ElastiCache Cluster 90% übersteigt.

Absicht: Erkennt eine hohe CPU-Auslastung der Redis-Engine.

PromQL-Kriterien: avg({__name__="EngineCPUUtilization", "@instrumentation.@name"="cloudwatch.aws/elasticache", CacheClusterId="your-cache-cluster-id"}) > 90

Empfohlener Schwellenwert: 90 (eingebettet in die Abfrage)

Begründung des Schwellenwerts: Redis arbeitet mit einem Thread-System. Ein Wert von über 90% weist auf eine Sättigung hin.

Bewertungsintervall: 60

Wartezeit: 300

Erholungsphase: 300

ReplicationLag

Etiketten: CacheClusterId

Beschreibung des Alarms: Alarm, wenn die Replikationsverzögerung den Schwellenwert für einen ElastiCache Cluster überschreitet.

Absicht: Erkennen Sie Verzögerungen bei der Replikation, die sich auf die Datenkonsistenz auswirken.

PromQL-Kriterien: avg({__name__="ReplicationLag", "@instrumentation.@name"="cloudwatch.aws/elasticache", CacheClusterId="your-cache-cluster-id"}) > THRESHOLD

Empfohlener Schwellenwert: THRESHOLD (in die Abfrage eingebettet)

Begründung des Schwellenwerts: Dieser Wert wird auf der Grundlage der Toleranz Ihrer Anwendung für veraltete Lesevorgänge festgelegt.

Bewertungsintervall: 60

Wartezeit: 900

Erholungsphase: 900

GPUConnectivityCheckFailed

Beschriftungen: InstanceId, egPUID

Alarmbeschreibung: Alarm, wenn der Elastic Graphics-Beschleuniger die Konnektivität zur Instance verliert.

Absicht: Erkennt Verbindungsprobleme mit dem Elastic Graphics Accelerator.

PromQL-Kriterien: max({__name__="GPUConnectivityCheckFailed", "@instrumentation.@name"="cloudwatch.aws/elasticgpus", InstanceId="your-instance-id",EGPUId="your-egpu-id"}) > 0

Empfohlener Schwellenwert: 0 (eingebettet in die Abfrage)

Begründung des Schwellenwerts: Jeder Verbindungsfehler muss untersucht werden.

Bewertungsintervall: 300

Wartezeit: 900

Erholungsphase: 900

GPUHealthCheckFailed

Beschriftungen: InstanceId, egPUID

Beschreibung des Alarms: Alarm, wenn eine Integritätsprüfung des Elastic Graphics-Beschleunigers fehlschlägt.

Absicht: Erkennt einen fehlerhaften Elastic Graphics Accelerator.

PromQL-Kriterien: max({__name__="GPUHealthCheckFailed", "@instrumentation.@name"="cloudwatch.aws/elasticgpus", InstanceId="your-instance-id",EGPUId="your-egpu-id"}) > 0

Empfohlener Schwellenwert: 0 (eingebettet in die Abfrage)

Begründung des Schwellenwerts: Fehlgeschlagene Integritätsprüfungen deuten auf Probleme mit dem Gaspedal hin.

Bewertungsintervall: 300

Wartezeit: 900

Erholungsphase: 900

TargetErrorThrottledCount

Beschreibung des Alarms: Alarm, wenn die Aufrufe von Zeitplanzielen gedrosselt werden.

Absicht: Erkennt eine Zieldrosselung, die zu Zeitplanverzögerungen führt.

PromQL-Kriterien: sum({__name__="TargetErrorThrottledCount", "@instrumentation.@name"="cloudwatch.aws/scheduler"}) > 0

Empfohlener Schwellenwert: 0 (eingebettet in die Abfrage)

Begründung des Schwellenwerts: Jede Drosselung deutet auf Probleme mit der Zielkapazität hin.

Bewertungsintervall: 60

Wartezeit: 900

Erholungsphase: 900

InvocationThrottleCount

Alarmbeschreibung: Alarm, wenn Scheduler-Aufrufe gedrosselt werden.

Absicht: Erkennt die Drosselung des Scheduler-Aufrufs.

PromQL-Kriterien: sum({__name__="InvocationThrottleCount", "@instrumentation.@name"="cloudwatch.aws/scheduler"}) > 0

Empfohlener Schwellenwert: 0 (eingebettet in die Abfrage)

Begründung des Schwellenwerts: Die Drosselung verzögert geplante Ausführungen.

Bewertungsintervall: 60

Wartezeit: 900

Erholungsphase: 900

InvocationDroppedCount

Beschreibung des Alarms: Alarm, wenn geplante Aufrufe unterbrochen werden.

Absicht: Erkennt unterbrochene Aufrufe.

PromQL-Kriterien: sum({__name__="InvocationDroppedCount", "@instrumentation.@name"="cloudwatch.aws/scheduler"}) > 0

Empfohlener Schwellenwert: 0 (eingebettet in die Abfrage)

Rechtfertigung des Schwellenwerts: Verworfene Aufrufe stehen für verloren gegangene geplante Ereignisse.

Bewertungsintervall: 60

Wartezeit: 60

Erholungsphase: 60

InvocationsFailedToBeSentToDeadLetterCount

Beschreibung des Alarms: Alarm, wenn fehlgeschlagene Aufrufe nicht an die Warteschlange gesendet werden können.

Absicht: Erkennung von DLQ-Zustellungsfehlern.

PromQL-Kriterien: sum({__name__="InvocationsFailedToBeSentToDeadLetterCount", "@instrumentation.@name"="cloudwatch.aws/scheduler"}) > 0

Empfohlener Schwellenwert: 0 (eingebettet in die Abfrage)

Rechtfertigung des Schwellenwerts: Eine fehlgeschlagene DLQ-Lieferung bedeutet, dass Fehlerinformationen verloren gegangen sind.

Bewertungsintervall: 60

Wartezeit: 900

Erholungsphase: 900

GetRecords.IteratorAgeMilliseconds

Beschriftungen: StreamName

Beschreibung des Alarms: Alarm, wenn das Alter des Consumer-Iterators den Schwellenwert für einen Kinesis-Stream überschreitet.

Absicht: Erkennung von Daten, deren Aufbewahrungszeitraum überschritten wird, wodurch das Risiko eines Datenverlusts besteht.

PromQL-Kriterien: max({__name__="GetRecords.IteratorAgeMilliseconds", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="your-stream-name"}) > THRESHOLD

Empfohlener Schwellenwert: THRESHOLD (in die Abfrage eingebettet)

Begründung des Schwellenwerts: Wird auf der Grundlage des Prozentsatzes der Stream-Aufbewahrungsdauer festgelegt.

Bewertungsintervall: 60

Wartezeit: 900

Erholungsphase: 900

GetRecords.Success

Beschriftungen: StreamName

Beschreibung des Alarms: Alarm, wenn die GetRecords Erfolgsrate unter den Schwellenwert für einen Kinesis-Stream fällt.

Absicht: Erkennung von Fehlern beim Abrufen durch Verbraucher.

PromQL-Kriterien: avg({__name__="GetRecords.Success", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="your-stream-name"}) < THRESHOLD

Empfohlener Schwellenwert: THRESHOLD (in die Abfrage eingebettet)

Begründung des Schwellenwerts: Wird auf der Grundlage der erwarteten Erfolgsquote festgelegt.

Bewertungsintervall: 60

Wartezeit: 300

Erholungsphase: 300

PutRecord.Success

Etiketten: StreamName

Beschreibung des Alarms: Alarm, wenn die PutRecord Erfolgsrate unter den Schwellenwert für einen Kinesis-Stream fällt.

Absicht: Erkennt Fehler bei der Aufnahme durch den Producer.

PromQL-Kriterien: avg({__name__="PutRecord.Success", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="your-stream-name"}) < THRESHOLD

Empfohlener Schwellenwert: THRESHOLD (in die Abfrage eingebettet)

Begründung des Schwellenwerts: Wird auf der Grundlage der erwarteten Erfolgsquote festgelegt.

Bewertungsintervall: 60

Wartezeit: 300

Erholungsphase: 300

PutRecords.FailedRecords

Etiketten: StreamName

Alarmbeschreibung: Alarm, wenn Batch-Put-Operationen zu fehlgeschlagenen Datensätzen für einen Kinesis-Stream führen.

Absicht: Erkennung von Batch-Put-Fehlern.

PromQL-Kriterien: sum({__name__="PutRecords.FailedRecords", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="your-stream-name"}) > THRESHOLD

Empfohlener Schwellenwert: THRESHOLD (in die Abfrage eingebettet)

Begründung des Schwellenwerts: Wird auf der Grundlage der akzeptablen Fehleranzahl festgelegt.

Bewertungsintervall: 60

Wartezeit: 300

Erholungsphase: 300

ReadProvisionedThroughputExceeded

Etiketten: StreamName

Beschreibung des Alarms: Alarm, wenn die Lesevorgänge des Verbrauchers den bereitgestellten Durchsatz für einen Kinesis-Stream überschreiten.

Absicht: Erkennt eine Drosselung der Lesevorgänge durch Verbraucher.

PromQL-Kriterien: avg({__name__="ReadProvisionedThroughputExceeded", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="your-stream-name"}) > THRESHOLD

Empfohlener Schwellenwert: THRESHOLD (in die Abfrage eingebettet)

Begründung des Schwellenwerts: Jede anhaltende Drosselung weist auf einen Kapazitätsbedarf hin.

Bewertungsintervall: 60

Wartezeit: 300

Erholungsphase: 300

SubscribeToShardEvent.MillisBehindLatest

Etiketten: StreamName, ConsumerName

Beschreibung des Alarms: Alarm, wenn ein Verbraucher mit verstärktem Fan-Out hinter den letzten Rekord zurückfällt.

Absicht: Es wird eine Verzögerung bei der Verarbeitung durch Verbraucher mit verstärktem Fan-Out erkannt.

PromQL-Kriterien: avg({__name__="SubscribeToShardEvent.MillisBehindLatest", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="your-stream-name",ConsumerName="your-consumer-name"}) > THRESHOLD

Empfohlener Schwellenwert: THRESHOLD (in die Abfrage eingebettet)

Begründung des Schwellenwerts: Wird auf der Grundlage einer akzeptablen Verarbeitungsverzögerung festgelegt.

Bewertungsintervall: 60

Wartezeit: 300

Erholungsphase: 300

WriteProvisionedThroughputExceeded

Etiketten: StreamName

Beschreibung des Alarms: Alarm, wenn Producer-Schreibvorgänge den bereitgestellten Durchsatz für einen Kinesis-Stream überschreiten.

Absicht: Erkennt die Drosselung beim Schreiben durch den Producer.

PromQL-Kriterien: avg({__name__="WriteProvisionedThroughputExceeded", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="your-stream-name"}) > THRESHOLD

Empfohlener Schwellenwert: THRESHOLD (in die Abfrage eingebettet)

Begründung des Schwellenwerts: Eine anhaltende Drosselung weist auf einen Kapazitätsbedarf hin.

Bewertungsintervall: 60

Wartezeit: 300

Erholungsphase: 300

ClaimedAccountConcurrency

Beschreibung des Alarms: Alarm, wenn die Anzahl der beanspruchten Konten den Schwellenwert überschreitet.

Absicht: Erkennt ein Konto, das sich dem Kontingent an Parallelität nähert.

PromQL-Kriterien: max({__name__="ClaimedAccountConcurrency", "@instrumentation.@name"="cloudwatch.aws/lambda"}) > THRESHOLD

Empfohlener Schwellenwert: THRESHOLD (in die Abfrage eingebettet)

Begründung des Schwellenwerts: Auf den Prozentsatz des regionalen Grenzwerts für Parallelität festgelegt.

Bewertungsintervall: 60

Wartezeit: 600

Erholungsphase: 600

Fehler

Beschriftungen: FunctionName

Alarmbeschreibung: Alarm, wenn die Anzahl der Funktionsfehler den Schwellenwert für eine Lambda-Funktion überschreitet.

Absicht: Erkennt eine hohe Anzahl von Funktionsfehlern.

PromQL-Kriterien: sum({__name__="Errors", "@instrumentation.@name"="cloudwatch.aws/lambda", FunctionName="your-function-name"}) > THRESHOLD

Empfohlener Schwellenwert: THRESHOLD (in die Abfrage eingebettet)

Begründung des Schwellenwerts: Wird auf der Grundlage des akzeptablen Fehlervolumens festgelegt.

Bewertungsintervall: 60

Wartezeit: 180

Erholungszeit: 300

Drosselungen

Etiketten: FunctionName

Alarmbeschreibung: Alarm, wenn Funktionsaufrufe für eine Lambda-Funktion gedrosselt werden.

Absicht: Erkennt die Drosselung des Funktionsaufrufs.

PromQL-Kriterien: sum({__name__="Throttles", "@instrumentation.@name"="cloudwatch.aws/lambda", FunctionName="your-function-name"}) > THRESHOLD

Empfohlener Schwellenwert: THRESHOLD (in die Abfrage eingebettet)

Begründung des Schwellenwerts: Die Drosselung zeigt an, dass das Parallelitätslimit erreicht wurde.

Bewertungsintervall: 60

Wartezeit: 300

Erholungsphase: 300

Duration (Dauer)

Etiketten: FunctionName

Alarmbeschreibung: Alarm, wenn die Dauer der p90-Funktion den Schwellenwert für eine Lambda-Funktion überschreitet.

Absicht: Erkennung lang andauernder Funktionsaufrufe.

PromQL-Kriterien: histogram_quantile(0.9, {__name__="Duration", "@instrumentation.@name"="cloudwatch.aws/lambda", FunctionName="your-function-name"}) > THRESHOLD

Empfohlener Schwellenwert: THRESHOLD (in die Abfrage eingebettet)

Begründung des Schwellenwerts: Wird relativ zum Funktions-Timeout festgelegt.

Bewertungsintervall: 60

Wartezeit: 900

Erholungsphase: 900

ConcurrentExecutions

Beschriftungen: FunctionName

Alarmbeschreibung: Alarm, wenn gleichzeitige Ausführungen den Schwellenwert für eine Lambda-Funktion überschreiten.

Absicht: Erkennt eine Funktion, die sich den Grenzwerten für die Parallelität nähert.

PromQL-Kriterien: max({__name__="ConcurrentExecutions", "@instrumentation.@name"="cloudwatch.aws/lambda", FunctionName="your-function-name"}) > THRESHOLD

Empfohlener Schwellenwert: THRESHOLD (in die Abfrage eingebettet)

Begründung des Schwellenwerts: Auf den Prozentsatz der reservierten Parallelität festgelegt.

Bewertungsintervall: 60

Wartezeit: 600

Erholungsphase: 600

memory_utilization

Beschriftungen: Funktionsname

Alarmbeschreibung: Alarm, wenn die durchschnittliche Speicherauslastung für eine Lambda-Funktion 90% übersteigt.

Absicht: Erkennt die Funktion, die sich dem konfigurierten Speicherlimit nähert.

PromQL-Kriterien: avg({__name__="memory_utilization", "@instrumentation.@name"="cloudwatch.aws/lambda-insights", function_name="your-function-name"}) > 90

Empfohlener Schwellenwert: 90 (eingebettet in die Abfrage)

Begründung des Schwellenwerts: Bei über 90% besteht das Risiko, dass nicht genügend Arbeitsspeicher zur Verfügung steht.

Bewertungsintervall: 60

Wartezeit: 600

Erholungsphase: 600

ErrorPortAllocation

Beschriftungen: NatGatewayId

Beschreibung des Alarms: Alarm, wenn das NAT-Gateway keinen Port für neue Verbindungen zuweisen kann.

Absicht: Erkennt Fehler bei der Portzuweisung und verhindert so, dass neue Verbindungen hergestellt werden.

PromQL-Kriterien: sum({__name__="ErrorPortAllocation", "@instrumentation.@name"="cloudwatch.aws/natgateway", NatGatewayId="your-nat-gateway-id"}) > 0

Empfohlener Schwellenwert: 0 (eingebettet in die Abfrage)

Begründung des Schwellenwerts: Jeder Fehler bei der Zuweisung wirkt sich auf die Konnektivität aus.

Bewertungsintervall: 60

Wartezeit: 900

Erholungsphase: 900

PacketsDropCount

Beschriftungen: NatGatewayId

Alarmbeschreibung: Alarm, wenn das NAT-Gateway Pakete verwirft, die den Schwellenwert überschreiten.

Absicht: Erkennt Paketverluste, die auf Kapazitäts- oder Verbindungsprobleme hinweisen.

PromQL-Kriterien: sum({__name__="PacketsDropCount", "@instrumentation.@name"="cloudwatch.aws/natgateway", NatGatewayId="your-nat-gateway-id"}) > THRESHOLD

Empfohlener Schwellenwert: THRESHOLD (in die Abfrage eingebettet)

Begründung des Schwellenwerts: Wird auf der Grundlage einer akzeptablen Drop-Rate festgelegt.

Bewertungsintervall: 60

Wartezeit: 300

Erholungsphase: 300

PacketsDropped

Beschriftungen: VpcId, VpcEndpointId, EndpointType, SubnetId ServiceName

Alarmbeschreibung: Alarm, wenn ein VPC-Endpunkt Pakete verwirft, die den Schwellenwert überschreiten.

Absicht: Erkennt einen fehlerhaften Endpunkt oder Endpunktdienst.

PromQL-Kriterien: sum({__name__="PacketsDropped", "@instrumentation.@name"="cloudwatch.aws/privatelinkendpoints", VpcId="your-vpc-id",VpcEndpointId="your-vpc-endpoint-id",EndpointType="your-endpoint-type",SubnetId="your-subnet-id",ServiceName="your-service-name"}) > THRESHOLD

Empfohlener Schwellenwert: THRESHOLD (in die Abfrage eingebettet)

Begründung des Schwellenwerts: Wird auf der Grundlage einer akzeptablen Drop-Rate festgelegt.

Bewertungsintervall: 60

Wartezeit: 300

Erholungsphase: 300

RstPacketsSent

Etiketten: ServiceId LoadBalancerArn, Az

Alarmbeschreibung: Alarm, wenn die RST-Paketrate den Schwellenwert für einen Endpunktdienst überschreitet.

Absicht: Erkennung fehlerhafter Ziele des Endpunktdienstes.

PromQL-Kriterien: sum({__name__="RstPacketsSent", "@instrumentation.@name"="cloudwatch.aws/privatelinkservices", ServiceId="SVC",LoadBalancerArn="LB",Az="AZ"}) > THRESHOLD

Empfohlener Schwellenwert: THRESHOLD (in die Abfrage eingebettet)

Rechtfertigung des Schwellenwerts: Wird auf der Grundlage einer akzeptablen RST-Paketrate festgelegt.

Bewertungsintervall: 60

Wartezeit: 300

Erholungsphase: 300

CPUUtilization

Etiketten: DBInstanceIdentifier

Alarmbeschreibung: Alarm, wenn die durchschnittliche CPU-Auslastung für eine RDS-Instance 90% übersteigt.

Absicht: Erkennt eine hohe CPU-Auslastung und verhindert so Leistungseinbußen.

PromQL-Kriterien: avg({__name__="CPUUtilization", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > 90

Empfohlener Schwellenwert: 90 (eingebettet in die Abfrage)

Begründung des Schwellenwerts: 90% bedeuten, dass die Sättigung fast erreicht ist.

Bewertungsintervall: 60

Wartezeit: 300

Erholungsphase: 300

DatabaseConnections

Etiketten: DBInstanceIdentifier

Beschreibung des Alarms: Alarm, wenn Datenbankverbindungen den Schwellenwert für eine RDS-Instance überschreiten.

Absicht: Abgelehnte Verbindungen bis zum Höchstwert verhindern.

PromQL-Kriterien: avg({__name__="DatabaseConnections", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > THRESHOLD

Empfohlener Schwellenwert: THRESHOLD (in die Abfrage eingebettet)

Begründung des Schwellenwerts: Auf den Prozentsatz des Parameters max_connections gesetzt.

Bewertungsintervall: 60

Wartezeit: 300

Erholungsphase: 300

EBSByteBalance%

Etiketten: DBInstanceIdentifier

Beschreibung des Alarms: Alarm, wenn das EBS-Byteguthaben für eine RDS-Instance unter 10% fällt.

Absicht: Erkennung von Gutschriften mit niedrigem Durchsatz, die zu Engpässen führen.

PromQL-Kriterien: avg({__name__="EBSByteBalance%", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) < 10

Empfohlener Schwellenwert: 10 (eingebettet in die Abfrage)

Begründung des Schwellenwerts: Bei einem Wert unter 10% besteht die Gefahr einer Verschlechterung des Durchsatzes.

Bewertungsintervall: 60

Wartezeit: 180

Erholungszeit: 180

EBSIOBalance%

Etiketten: DBInstanceIdentifier

Beschreibung des Alarms: Alarm, wenn die EBS-I/O-Balance für eine RDS-Instance unter 10% fällt.

Absicht: Erkennen Sie niedrige IOPS-Credits, die zu Engpässen führen.

PromQL-Kriterien: avg({__name__="EBSIOBalance%", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) < 10

Empfohlener Schwellenwert: 10 (eingebettet in die Abfrage)

Begründung des Schwellenwerts: Bei einem Wert unter 10% besteht die Gefahr einer Verschlechterung der IOPS.

Bewertungsintervall: 60

Wartezeit: 180

Erholungszeit: 180

FreeableMemory

Etiketten: DBInstanceIdentifier

Beschreibung des Alarms: Alarm, wenn der freigebbare Speicher unter den Schwellenwert für eine RDS-Instance fällt.

Absicht: Verhindern Sie, dass aufgrund von Speichermangel Verbindungen abgewiesen werden.

PromQL-Kriterien: avg({__name__="FreeableMemory", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) < THRESHOLD

Empfohlener Schwellenwert: THRESHOLD (in die Abfrage eingebettet)

Begründung des Schwellenwerts: Wird auf der Grundlage des Speichers der Instanzklasse festgelegt.

Bewertungsintervall: 60

Wartezeit: 900

Erholungsphase: 900

FreeLocalStorage

Beschriftungen: DBInstanceIdentifier

Beschreibung des Alarms: Alarm, wenn der freie lokale Speicher unter den Schwellenwert für eine Aurora-Instance fällt.

Absicht: Verhindern Sie die Erschöpfung des lokalen Aurora-Speichers.

PromQL-Kriterien: avg({__name__="FreeLocalStorage", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) < THRESHOLD

Empfohlener Schwellenwert: THRESHOLD (in die Abfrage eingebettet)

Begründung des Schwellenwerts: Wird auf der Grundlage des Mindestwerts festgelegt, der für Operationen erforderlich ist.

Bewertungsintervall: 60

Wartezeit: 300

Erholungsphase: 300

FreeStorageSpace

Etiketten: DBInstanceIdentifier

Beschreibung des Alarms: Alarm, wenn der freie Speicherplatz unter den Schwellenwert für eine RDS-Instance fällt.

Absicht: Vermeiden Sie Ausfallzeiten bei vollem Speicher.

PromQL-Kriterien: min({__name__="FreeStorageSpace", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) < THRESHOLD

Empfohlener Schwellenwert: THRESHOLD (in die Abfrage eingebettet)

Begründung des Schwellenwerts: Dieser Wert wird auf der Grundlage der Wachstumsrate des Speichers und der bereitgestellten Größe festgelegt.

Bewertungsintervall: 60

Wartezeit: 300

Erholungsphase: 300

MaximumUsedTransactionIDs

Etiketten: DBInstanceIdentifier

Beschreibung des Alarms: Alarm, wenn die maximal verwendeten Transaktions-IDs für eine RDS-Instance 1 Milliarde überschreiten.

Absicht: Verhindern Sie den Wrapararound der PostgreSQL-Transaktions-IDs.

PromQL-Kriterien: avg({__name__="MaximumUsedTransactionIDs", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > 1000000000

Empfohlener Schwellenwert: 1000000000 (eingebettet in die Abfrage)

Begründung des Schwellenwerts: 1 Milliarde deutet darauf hin, dass sich eine Rundumgefahr nähert.

Bewertungsintervall: 60

Wartezeit: 60

Erholungsphase: 60

ReadLatency

Beschriftungen: DBInstanceIdentifier

Alarmbeschreibung: Alarm, wenn die Leselatenz von p90 den Schwellenwert für eine RDS-Instance überschreitet.

Absicht: Erkennt eine hohe Leselatenz, die auf Festplattenprobleme hinweist.

PromQL-Kriterien: histogram_quantile(0.9, {__name__="ReadLatency", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > THRESHOLD

Empfohlener Schwellenwert: THRESHOLD (in die Abfrage eingebettet)

Begründung des Schwellenwerts: Wird auf der Grundlage einer akzeptablen Anwendungslatenz festgelegt.

Bewertungsintervall: 60

Wartezeit: 300

Erholungsphase: 300

ReplicaLag

Etiketten: DBInstanceIdentifier

Beschreibung des Alarms: Alarm, wenn die Replikationsverzögerung für ein RDS-Read-Replikat 60 Sekunden überschreitet.

Absicht: Erkennen Sie Verzögerungen bei der Replikation, die zu Datenverlust führen können.

PromQL-Kriterien: max({__name__="ReplicaLag", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > 60

Empfohlener Schwellenwert: 60 (eingebettet in die Abfrage)

Rechtfertigung des Schwellenwerts: 60 Sekunden stellen bei den meisten Workloads eine erhebliche Verzögerung dar.

Bewertungsintervall: 60

Wartezeit: 600

Erholungsphase: 600

WriteLatency

Beschriftungen: DBInstanceIdentifier

Alarmbeschreibung: Alarm, wenn die p90-Schreiblatenz den Schwellenwert für eine RDS-Instance überschreitet.

Absicht: Erkennt eine hohe Schreiblatenz, die auf Festplattenprobleme hinweist.

PromQL-Kriterien: histogram_quantile(0.9, {__name__="WriteLatency", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > THRESHOLD

Empfohlener Schwellenwert: THRESHOLD (in die Abfrage eingebettet)

Begründung des Schwellenwerts: Wird auf der Grundlage einer akzeptablen Anwendungslatenz festgelegt.

Bewertungsintervall: 60

Wartezeit: 300

Erholungsphase: 300

DBLoad

Etiketten: DBInstanceIdentifier

Alarmbeschreibung: Alarm, wenn die durchschnittliche Datenbanklast den Schwellenwert für eine RDS-Instance überschreitet.

Absicht: Erkennt eine hohe Datenbanklast, die die Leistung beeinträchtigt.

PromQL-Kriterien: avg({__name__="DBLoad", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > THRESHOLD

Empfohlener Schwellenwert: THRESHOLD (in die Abfrage eingebettet)

Begründung des Schwellenwerts: Auf ein Vielfaches der vCPU-Anzahl festgelegt.

Bewertungsintervall: 60

Wartezeit: 900

Erholungsphase: 900

AuroraVolumeBytesLeftTotal

Beschriftungen: DBClusterIdentifier

Alarmbeschreibung: Alarm, wenn die verbleibenden Speicherbytes des Aurora-Clusters unter den Schwellenwert fallen.

Absicht: Verhindern Sie die Erschöpfung des Aurora-Cluster-Speichers.

PromQL-Kriterien: avg({__name__="AuroraVolumeBytesLeftTotal", "@instrumentation.@name"="cloudwatch.aws/rds", DBClusterIdentifier="CLUSTER"}) < THRESHOLD

Empfohlener Schwellenwert: THRESHOLD (in die Abfrage eingebettet)

Begründung des Schwellenwerts: Wird auf der Grundlage der Wachstumsrate festgelegt.

Bewertungsintervall: 60

Wartezeit: 300

Erholungsphase: 300

AuroraBinlogReplicaLag

Etiketten: DBClusterIdentifier

Alarmbeschreibung: Alarm, wenn die Verzögerung der Aurora-Binlog-Replikation auf einen Fehlerstatus hinweist.

Absicht: Fehler bei der Replikation der Writer-Instance erkennen.

PromQL-Kriterien: avg({__name__="AuroraBinlogReplicaLag", "@instrumentation.@name"="cloudwatch.aws/rds", DBClusterIdentifier="CLUSTER"}) <= -1

Empfohlener Schwellenwert: -1 (eingebettet in die Abfrage)

Rechtfertigung des Schwellenwerts: -1 gibt den Fehlerstatus an.

Bewertungsintervall: 60

Wartezeit: 120

Erholungszeitraum: 120

BlockedTransactions

Beschriftungen: DBInstanceIdentifier

Beschreibung des Alarms: Alarm, wenn die Anzahl blockierter Transaktionen den Schwellenwert für eine RDS-Instance überschreitet.

Absicht: Erkennen Sie Transaktionsblockierungen, die zu Leistungseinbußen führen.

PromQL-Kriterien: avg({__name__="BlockedTransactions", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > THRESHOLD

Empfohlener Schwellenwert: THRESHOLD (in die Abfrage eingebettet)

Begründung des Schwellenwerts: Wird auf der Grundlage der akzeptablen Anzahl blockierter Transaktionen festgelegt.

Bewertungsintervall: 60

Wartezeit: 300

Erholungsphase: 300

BufferCacheHitRatio

Etiketten: DBInstanceIdentifier

Beschreibung des Alarms: Alarm, wenn die Trefferquote im Puffercache für eine RDS-Instance unter 80% fällt.

Absicht: Erkennt eine niedrige Cache-Effizienz, die zu Leistungseinbußen führt.

PromQL-Kriterien: avg({__name__="BufferCacheHitRatio", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) < 80

Empfohlener Schwellenwert: 80 (eingebettet in die Abfrage)

Begründung des Schwellenwerts: Ein Wert unter 80% weist auf zu viel Speicherplatz hin I/O.

Bewertungsintervall: 60

Wartezeit: 600

Erholungsphase: 600

EngineUptime

Beschriftungen: DBClusterIdentifier

Beschreibung des Alarms: Alarm, wenn die Betriebszeit des Motors auf Null fällt, was auf einen Neustart des Aurora-Schreibers hindeutet.

Absicht: Erkennt Ausfallzeiten oder Abstürze der Aurora-Writer-Instanz.

PromQL-Kriterien: avg({__name__="EngineUptime", "@instrumentation.@name"="cloudwatch.aws/rds", DBClusterIdentifier="CLUSTER"}) <= 0

Empfohlener Schwellenwert: 0 (eingebettet in die Abfrage)

Rechtfertigung des Schwellenwerts: Eine Verfügbarkeit von Null bedeutet einen Neustart der Instanz.

Bewertungsintervall: 60

Wartezeit: 120

Erholungszeitraum: 120

RollbackSegmentHistoryListLength

Beschriftungen: DBInstanceIdentifier

Alarmbeschreibung: Alarm, wenn die Länge der Liste des Rollback-Segmentverlaufs für eine Aurora-Instance 1 Million überschreitet.

Absicht: Erkennt einen hohen Rollback-Verlauf, der zu einer Verschlechterung der CPU-Leistung führt.

PromQL-Kriterien: avg({__name__="RollbackSegmentHistoryListLength", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > 1000000

Empfohlener Schwellenwert: 1000000 (eingebettet in die Abfrage)

Begründung für den Schwellenwert: Ein Wert über 1 Mio. führt zu Leistungsproblemen.

Bewertungsintervall: 60

Wartezeit: 300

Erholungsphase: 300

StorageNetworkThroughput

Etiketten: DBClusterIdentifier

Beschreibung des Alarms: Alarm, wenn der Durchsatz im Speichernetzwerk den Schwellenwert für einen Aurora-Cluster überschreitet.

Absicht: Erkennen Sie einen hohen Durchsatz, bei dem das Risiko eines Paketausfalls im Netzwerk besteht.

PromQL-Kriterien: avg({__name__="StorageNetworkThroughput", "@instrumentation.@name"="cloudwatch.aws/rds", DBClusterIdentifier="CLUSTER"}) > THRESHOLD

Empfohlener Schwellenwert: THRESHOLD (in die Abfrage eingebettet)

Begründung des Schwellenwerts: Wird auf der Grundlage der Netzwerkkapazität der Instanz festgelegt.

Bewertungsintervall: 60

Wartezeit: 300

Erholungsphase: 300

HealthCheckStatus

Etiketten: HealthCheckId

Beschreibung des Alarms: Alarm, wenn bei einer Route 53-Zustandsprüfung ein fehlerhafter Endpunkt gemeldet wird.

Absicht: Erkennen Sie fehlerhafte Endpunkte mithilfe von Route 53-Integritätsprüfungen.

PromQL-Kriterien: avg({__name__="HealthCheckStatus", "@instrumentation.@name"="cloudwatch.aws/route53", HealthCheckId="HC"}) < 1

Empfohlener Schwellenwert: 1 (eingebettet in die Abfrage)

Begründung des Schwellenwerts: Ein Wert unter 1 bedeutet, dass der Endpunkt die Zustandsprüfungen nicht bestanden hat.

Bewertungsintervall: 60

Wartezeit: 180

Erholungszeit: 180

4xxErrors

Etiketten: BucketName, FilterId

Beschreibung des Alarms: Alarm, wenn die 4xx-Fehlerrate für einen S3-Bucket 5% übersteigt.

Absicht: Erkennung ungewöhnlicher Client-Fehlerraten.

PromQL-Kriterien: avg({__name__="4xxErrors", "@instrumentation.@name"="cloudwatch.aws/s3", BucketName="BUCKET",FilterId="FILTER"}) > 0.05

Empfohlener Schwellenwert: 0,05 (eingebettet in die Abfrage)

Begründung des Schwellenwerts: Ein Wert von über 5% weist auf Probleme bei der Einrichtung oder beim Zugriff hin.

Bewertungsintervall: 60

Wartezeit: 900

Erholungsphase: 900

5xxErrors

Etiketten: BucketName, FilterId

Beschreibung des Alarms: Alarm, wenn die 5xx-Fehlerrate für einen S3-Bucket 5% übersteigt.

Absicht: Erkennt serverseitige Fehler, die sich auf die Anwendung auswirken.

PromQL-Kriterien: avg({__name__="5xxErrors", "@instrumentation.@name"="cloudwatch.aws/s3", BucketName="BUCKET",FilterId="FILTER"}) > 0.05

Empfohlener Schwellenwert: 0,05 (eingebettet in die Abfrage)

Begründung des Schwellenwerts: Über 5% deuten auf S3-Serviceprobleme hin.

Bewertungsintervall: 60

Wartezeit: 900

Erholungsphase: 900

OperationsFailedReplication

Etiketten: SourceBucket DestinationBucket, RuleId

Beschreibung des Alarms: Alarm, wenn S3-Replikationsvorgänge für einen Bucket fehlschlagen.

Absicht: Erkennen Sie Replikationsfehler, die zu Dateninkonsistenzen führen könnten.

PromQL-Kriterien: max({__name__="OperationsFailedReplication", "@instrumentation.@name"="cloudwatch.aws/s3", SourceBucket="SRC",DestinationBucket="DST",RuleId="RULE"}) > 0

Empfohlener Schwellenwert: 0 (eingebettet in die Abfrage)

Begründung des Schwellenwerts: Jede fehlgeschlagene Replikation muss untersucht werden.

Bewertungsintervall: 60

Wartezeit: 300

Erholungsphase: 300

4xxErrors

Etiketten: AccessPointName, DataSource ARN

Beschreibung des Alarms: Alarm, wenn die 4xx-Fehlerrate für einen S3 Object Lambda-Zugangspunkt 5% übersteigt.

Absicht: Erkennung ungewöhnlicher Client-Fehlerraten für Object Lambda.

PromQL-Kriterien: avg({__name__="4xxErrors", "@instrumentation.@name"="cloudwatch.aws/s3objectlambda", AccessPointName="AP",DataSourceARN="ARN"}) > 0.05

Empfohlener Schwellenwert: 0,05 (eingebettet in die Abfrage)

Begründung des Schwellenwerts: Ein Wert über 5% weist auf Probleme bei der Einrichtung hin.

Bewertungsintervall: 60

Wartezeit: 900

Erholungsphase: 900

5xxErrors

Etiketten: AccessPointName, DataSource ARN

Beschreibung des Alarms: Alarm, wenn die 5xx-Fehlerrate für einen S3 Object Lambda-Zugangspunkt 5% übersteigt.

Absicht: Erkennt serverseitige Fehler in Object Lambda.

PromQL-Kriterien: avg({__name__="5xxErrors", "@instrumentation.@name"="cloudwatch.aws/s3objectlambda", AccessPointName="AP",DataSourceARN="ARN"}) > 0.05

Empfohlener Schwellenwert: 0,05 (eingebettet in die Abfrage)

Begründung des Schwellenwerts: Über 5% deuten auf Lambda- oder S3-Probleme hin.

Bewertungsintervall: 60

Wartezeit: 900

Erholungsphase: 900

LambdaResponse4xx

Etiketten: AccessPointName, DataSource ARN

Beschreibung des Alarms: Alarm, wenn die Antwortrate der Lambda-Funktion 4xx für einen S3 Object Lambda-Zugangspunkt 5% überschreitet.

Absicht: Ermitteln Sie Client-Fehler mit der Lambda-Funktion.

PromQL-Kriterien: avg({__name__="LambdaResponse4xx", "@instrumentation.@name"="cloudwatch.aws/s3objectlambda", AccessPointName="AP",DataSourceARN="ARN"}) > 0.05

Empfohlener Schwellenwert: 0,05 (eingebettet in die Abfrage)

Begründung des Schwellenwerts: Über 5% deuten auf Probleme mit der Lambda-Funktion hin.

Bewertungsintervall: 60

Wartezeit: 900

Erholungsphase: 900

NumberOfMessagesPublished

Beschriftungen: TopicName

Beschreibung des Alarms: Alarm, wenn die Anzahl der veröffentlichten Nachrichten unter den Schwellenwert für ein SNS-Thema fällt.

Absicht: Ermitteln Sie einen deutlichen Rückgang des Veröffentlichungsvolumens.

PromQL-Kriterien: sum({__name__="NumberOfMessagesPublished", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) < THRESHOLD

Empfohlener Schwellenwert: THRESHOLD (in die Abfrage eingebettet)

Begründung des Schwellenwerts: Wird auf der Grundlage des zu erwartenden Mindestverkehrs festgelegt.

Bewertungsintervall: 60

Wartezeit: 300

Erholungsphase: 300

NumberOfNotificationsDelivered

Etiketten: TopicName

Beschreibung des Alarms: Alarm, wenn die Anzahl der zugestellten Benachrichtigungen unter den Schwellenwert für ein SNS-Thema fällt.

Absicht: Stellen Sie fest, dass das Volumen der Benachrichtigungen zurückgeht.

PromQL-Kriterien: sum({__name__="NumberOfNotificationsDelivered", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) < THRESHOLD

Empfohlener Schwellenwert: THRESHOLD (in die Abfrage eingebettet)

Begründung des Schwellenwerts: Wird auf der Grundlage der zu erwartenden Mindestlieferungen festgelegt.

Bewertungsintervall: 60

Wartezeit: 300

Erholungsphase: 300

NumberOfNotificationsFailed

Etiketten: TopicName

Beschreibung des Alarms: Alarm, wenn die Anzahl der fehlgeschlagenen Benachrichtigungen den Schwellenwert für ein SNS-Thema überschreitet.

Absicht: Fehler bei der Zustellung erkennen.

PromQL-Kriterien: sum({__name__="NumberOfNotificationsFailed", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) > THRESHOLD

Empfohlener Schwellenwert: THRESHOLD (in die Abfrage eingebettet)

Begründung des Schwellenwerts: Wird auf der Grundlage einer akzeptablen Ausfallrate festgelegt.

Bewertungsintervall: 60

Wartezeit: 300

Erholungsphase: 300

NumberOfNotificationsFilteredOut-InvalidAttributes

Etiketten: TopicName

Beschreibung des Alarms: Alarm, wenn Benachrichtigungen aufgrund ungültiger Nachrichtenattribute herausgefiltert werden.

Absicht: Ungültige Nachrichtenattribute erkennen.

PromQL-Kriterien: sum({__name__="NumberOfNotificationsFilteredOut-InvalidAttributes", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) > 0

Empfohlener Schwellenwert: 0 (eingebettet in die Abfrage)

Begründung des Schwellenwerts: Jeder ungültige Filter weist auf eine Fehlkonfiguration hin.

Bewertungsintervall: 60

Wartezeit: 300

Erholungsphase: 300

NumberOfNotificationsFilteredOut-InvalidMessageBody

Etiketten: TopicName

Beschreibung des Alarms: Alarm, wenn Benachrichtigungen aufgrund ungültiger Nachrichtentexte herausgefiltert werden.

Absicht: Ungültige Nachrichtentexte erkennen.

PromQL-Kriterien: sum({__name__="NumberOfNotificationsFilteredOut-InvalidMessageBody", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) > 0

Empfohlener Schwellenwert: 0 (eingebettet in die Abfrage)

Begründung des Schwellenwerts: Jeder ungültige Filter weist auf eine Fehlkonfiguration hin.

Bewertungsintervall: 60

Wartezeit: 300

Erholungsphase: 300

NumberOfNotificationsRedrivenToDlq

Etiketten: TopicName

Beschreibung des Alarms: Alarm, wenn Benachrichtigungen für ein SNS-Thema an die Warteschlange mit unzustellbaren Nachrichten gesendet werden.

Absicht: Erkennt Nachrichten, die an eine Warteschlange mit unleserlichen Nachrichten gesendet wurden.

PromQL-Kriterien: sum({__name__="NumberOfNotificationsRedrivenToDlq", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) > 0

Empfohlener Schwellenwert: 0 (eingebettet in die Abfrage)

Begründung des Schwellenwerts: Jede DLQ-Nachricht weist auf Probleme bei der Zustellung hin.

Bewertungsintervall: 60

Wartezeit: 300

Erholungsphase: 300

NumberOfNotificationsFailedToRedriveToDlq

Etiketten: TopicName

Beschreibung des Alarms: Alarm, wenn bei einem SNS-Thema keine Benachrichtigungen an die Warteschlange für unzustellbare Nachrichten gesendet werden.

Absicht: Erkennung von DLQ-Zustellungsfehlern.

PromQL-Kriterien: sum({__name__="NumberOfNotificationsFailedToRedriveToDlq", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) > 0

Empfohlener Schwellenwert: 0 (eingebettet in die Abfrage)

Rechtfertigung des Schwellenwerts: Ein fehlgeschlagener DLQ bedeutet, dass die Fehlerverfolgung verloren geht.

Bewertungsintervall: 60

Wartezeit: 300

Erholungsphase: 300

SMSMonthToDateSpentUSD

Etiketten: TopicName

Beschreibung des Alarms: Alarm, wenn sich die SMS-Ausgaben dem Kontingent für ein SNS-Thema nähern.

Absicht: Erkennen Sie, dass sich die SMS-Ausgaben dem Kontingent nähern.

PromQL-Kriterien: max({__name__="SMSMonthToDateSpentUSD", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) > THRESHOLD

Empfohlener Schwellenwert: THRESHOLD (in die Abfrage eingebettet)

Begründung des Schwellenwerts: Wird auf der Grundlage des SMS-Kontingents des Kontos festgelegt.

Bewertungsintervall: 60

Wartezeit: 300

Erholungsphase: 300

SMSSuccessRate

Etiketten: TopicName

Beschreibung des Alarms: Alarm, wenn die Erfolgsrate der SMS-Zustellung unter den Schwellenwert für ein SNS-Thema fällt.

Absicht: Erkennung fehlgeschlagener SMS-Zustellungen.

PromQL-Kriterien: avg({__name__="SMSSuccessRate", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) < THRESHOLD

Empfohlener Schwellenwert: THRESHOLD (in die Abfrage eingebettet)

Begründung des Schwellenwerts: Wird auf der Grundlage einer akzeptablen Versandrate festgelegt.

Bewertungsintervall: 60

Wartezeit: 300

Erholungsphase: 300

ApproximateAgeOfOldestMessage

Etiketten: QueueName

Beschreibung des Alarms: Alarm, wenn das Alter der ältesten Nachricht den Schwellenwert für eine SQS-Warteschlange überschreitet.

Absicht: Erkennt Nachrichten, die nicht schnell genug verarbeitet werden.

PromQL-Kriterien: max({__name__="ApproximateAgeOfOldestMessage", "@instrumentation.@name"="cloudwatch.aws/sqs", QueueName="QUEUE"}) > THRESHOLD

Empfohlener Schwellenwert: THRESHOLD (in die Abfrage eingebettet)

Rechtfertigung des Schwellenwerts: Wird auf der Grundlage einer akzeptablen Verarbeitungszeit für Nachrichten festgelegt.

Bewertungsintervall: 60

Wartezeit: 900

Erholungsphase: 900

ApproximateNumberOfMessagesNotVisible

Beschriftungen: QueueName

Beschreibung des Alarms: Alarm, wenn die Anzahl der Nachrichten während des Fluges den Schwellenwert für eine SQS-Warteschlange überschreitet.

Absicht: Erkennt viele Meldungen während des Fluges, die auf Verbraucherprobleme hinweisen.

PromQL-Kriterien: avg({__name__="ApproximateNumberOfMessagesNotVisible", "@instrumentation.@name"="cloudwatch.aws/sqs", QueueName="QUEUE"}) > THRESHOLD

Empfohlener Schwellenwert: THRESHOLD (in die Abfrage eingebettet)

Begründung des Schwellenwerts: Wird auf der Grundlage des erwarteten Verarbeitungsvolumens festgelegt.

Bewertungsintervall: 60

Wartezeit: 900

Erholungsphase: 900

ApproximateNumberOfMessagesVisible

Beschriftungen: QueueName

Alarmbeschreibung: Alarm, wenn die Anzahl der sichtbaren Nachrichten den Schwellenwert für eine SQS-Warteschlange überschreitet.

Absicht: Erkennen Sie einen Nachrichtenstau, der auf langsame Verbraucher hinweist.

PromQL-Kriterien: avg({__name__="ApproximateNumberOfMessagesVisible", "@instrumentation.@name"="cloudwatch.aws/sqs", QueueName="QUEUE"}) > THRESHOLD

Empfohlener Schwellenwert: THRESHOLD (in die Abfrage eingebettet)

Begründung des Schwellenwerts: Wird auf der Grundlage der erwarteten Warteschlangentiefe festgelegt.

Bewertungsintervall: 60

Wartezeit: 900

Erholungsphase: 900

NumberOfMessagesSent

Beschriftungen: QueueName

Alarmbeschreibung: Alarm, wenn keine Nachrichten an eine SQS-Warteschlange gesendet werden.

Absicht: Detect Producers haben aufgehört, Nachrichten zu senden.

PromQL-Kriterien: sum({__name__="NumberOfMessagesSent", "@instrumentation.@name"="cloudwatch.aws/sqs", QueueName="QUEUE"}) <= 0

Empfohlener Schwellenwert: 0 (eingebettet in die Abfrage)

Begründung für den Schwellenwert: Null Meldungen deuten auf einen Ausfall des Herstellers hin.

Bewertungsintervall: 60

Wartezeit: 900

Erholungsphase: 900

TunnelState (VPN-Ebene)

Beschriftungen: VpnId

Beschreibung des Alarms: Alarm, wenn sich mindestens ein VPN-Tunnel im Status DOWN befindet.

Absicht: Erkennt mindestens einen Tunnel im Status DOWN.

PromQL-Kriterien: min({__name__="TunnelState", "@instrumentation.@name"="cloudwatch.aws/vpn", VpnId="VPN"}) < 1

Empfohlener Schwellenwert: 1 (eingebettet in die Abfrage)

Begründung des Schwellenwerts: Unter 1 bedeutet, dass der Tunnel ausgefallen ist.

Bewertungsintervall: 300

Wartezeit: 900

Erholungsphase: 900

TunnelState (Tunnelebene)

Beschriftungen: TunnelIpAddress

Beschreibung des Alarms: Alarm, wenn sich ein bestimmter VPN-Tunnel im Status DOWN befindet.

Absicht: Erkennt einen bestimmten Tunnel im Status DOWN.

PromQL-Kriterien: min({__name__="TunnelState", "@instrumentation.@name"="cloudwatch.aws/vpn", TunnelIpAddress="IP"}) < 1

Empfohlener Schwellenwert: 1 (eingebettet in die Abfrage)

Begründung des Schwellenwerts: Unter 1 bedeutet, dass der Tunnel ausgefallen ist.

Bewertungsintervall: 300

Wartezeit: 900

Erholungsphase: 900