

Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.

# Empfohlene PromQL-Alarme
<a name="Recommended_PromQL_Alarms"></a>

Verwenden Sie diese PromQL-Alarme als Äquivalente zu den klassischen empfohlenen Alarmen. Sie überwachen dieselben Metriken mithilfe von PromQL-Sofortabfragen, die anhand der über den OTLP-Endpunkt aufgenommenen Metriken ausgewertet werden. CloudWatch 

PromQL-Alarme werden mit verwendet. `EvaluationCriteria` `PromQLCriteria` Im Gegensatz zu klassischen metrischen Alarmen ist der Schwellenwert direkt in den PromQL-Abfrageausdruck eingebettet.
+ **Wartezeit ** — Die Dauer in Sekunden, die eine Zeitreihe kontinuierlich überschreiten muss, bevor der Alarm in den ALARM-Zustand übergeht.
+ **Wiederherstellungszeitraum ** — Die Dauer in Sekunden, die alle Zeitreihen nicht mehr durchbrechen müssen, bevor der Alarm wieder in den Zustand OK zurückkehrt.
+ **Testintervall ** — Gibt an, wie oft (in Sekunden) die PromQL-Abfrage CloudWatch ausgeführt wird.

**Anmerkung**  
Für diese Alarme sind Metriken erforderlich, die über den CloudWatch OTLP-Endpunkt veröffentlicht werden. Weitere Informationen finden Sie unter [PromQL-Alarme](alarm-promql.md).

Sie können diese Alarme mithilfe AWS CloudFormation von bereitstellen. Verwenden Sie die `PromQLCriteria` Eigenschaften `EvaluationCriteria` und für die `AWS::CloudWatch::Alarm` Ressource.

**Topics**
+ [API Gateway](#Recommended_PromQL_ApiGateway)
+ [Auto Scaling](#Recommended_PromQL_AutoScaling)
+ [Zertifikatsmanager](#Recommended_PromQL_CertificateManager)
+ [CloudFront](#Recommended_PromQL_CloudFront)
+ [Cognito](#Recommended_PromQL_Cognito)
+ [DynamoDB](#Recommended_PromQL_DynamoDB)
+ [EBS](#Recommended_PromQL_EBS)
+ [Amazon Elastic Compute Cloud](#Recommended_PromQL_EC2)
+ [Amazon ECS](#Recommended_PromQL_ECS)
+ [Einblicke in Amazon ECS Container](#Recommended_PromQL_ECS_ContainerInsights)
+ [Amazon ECS Container Insights verbesserte die Beobachtbarkeit](#Recommended_PromQL_ECS_ContainerInsights_Enhanced)
+ [Amazon EFS](#Recommended_PromQL_EFS)
+ [Amazon EKS Container Insights](#Recommended_PromQL_EKS)
+ [Amazon ElastiCache](#Recommended_PromQL_ElastiCache)
+ [Elastic GPUs](#Recommended_PromQL_ElasticGPUs)
+ [Amazon EventBridge Scheduler](#Recommended_PromQL_Scheduler)
+ [Amazon Kinesis Data Streams](#Recommended_PromQL_Kinesis)
+ [AWS Lambda](#Recommended_PromQL_Lambda)
+ [AWS Lambda Insights](#Recommended_PromQL_LambdaInsights)
+ [NAT-Gateway](#Recommended_PromQL_NATGateway)
+ [AWS PrivateLink Endpunkte](#Recommended_PromQL_PrivateLinkEndpoints)
+ [AWS PrivateLink dienstleistungen](#Recommended_PromQL_PrivateLinkServices)
+ [RDS](#Recommended_PromQL_RDS)
+ [Route 53](#Recommended_PromQL_Route53)
+ [S3](#Recommended_PromQL_S3)
+ [S3 Object Lambda](#Recommended_PromQL_S3ObjectLambda)
+ [SNS](#Recommended_PromQL_SNS)
+ [SQS](#Recommended_PromQL_SQS)
+ [VPN](#Recommended_PromQL_VPN)

## API Gateway
<a name="Recommended_PromQL_ApiGateway"></a>

**REST-API **

**4XXError**  
**Beschriftungen: **ApiName, Stufe  
**Beschreibung des ** Alarms: Alarm, wenn die durchschnittliche 4XX-Fehlerrate in einer REST-API-Phase 5% übersteigt.  
**Absicht: ** Erkennt eine hohe Client-Fehlerrate, die auf Probleme mit Anfragen hinweist.  
**PromQL-Kriterien: ** `avg({__name__="4XXError", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiName="{{your-api-name}}",Stage="{{your-stage}}"}) > 0.05`  
**Empfohlener Schwellenwert: ** 0,05 (eingebettet in die Abfrage)  
**Rechtfertigung des Schwellenwerts: ** Erkennt eine Client-Fehlerrate von über 5%, was auf signifikante Anforderungsfehler hindeutet.  
**Bewertungsintervall: ** 60  
**Wartezeit: ** 300  
**Erholungsphase: ** 300

**5XXError**  
**Beschriftungen: **ApiName, Stufe  
**Beschreibung des ** Alarms: Alarm, wenn die durchschnittliche 5XX-Fehlerrate in einer REST-API-Phase 5% übersteigt.  
**Absicht: ** Erkennt eine hohe Serverfehlerrate, die auf Backend-Ausfälle hindeutet.  
**PromQL-Kriterien: ** `avg({__name__="5XXError", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiName="{{your-api-name}}",Stage="{{your-stage}}"}) > 0.05`  
**Empfohlener Schwellenwert: ** 0,05 (eingebettet in die Abfrage)  
**Rechtfertigung des Schwellenwerts: ** Erkennt eine Serverfehlerrate von über 5%, weshalb eine sofortige Untersuchung erforderlich ist.  
**Bewertungsintervall: ** 60  
**Wartezeit: ** 180  
**Erholungszeit: ** 300

**Latency**  
**Beschriftungen: **ApiName, Stufe  
**Alarmbeschreibung: ** Alarm, wenn die p90-Latenz für eine REST-API-Stufe 2500 ms überschreitet.  
**Absicht: ** Erkennt eine hohe p90-Latenz, die das Nutzererlebnis beeinträchtigt.  
**PromQL-Kriterien: ** `histogram_quantile(0.9, {__name__="Latency", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiName="{{your-api-name}}",Stage="{{your-stage}}"}) > 2500`  
**Empfohlener Schwellenwert: ** 2500 (eingebettet in die Abfrage)  
**Rechtfertigung des Schwellenwerts: ** Eine p90-Latenz von über 2500 ms weist auf verringerte Antwortzeiten für die meisten Anfragen hin.  
**Bewertungsintervall: 60 **  
**Wartezeit: ** 300  
**Erholungsphase: ** 300

**Count**  
**Beschriftungen: **ApiName, Stufe  
**Beschreibung des ** Alarms: Alarm, wenn die Gesamtzahl der Anfragen unter den erwarteten Ausgangswert für eine REST-API-Phase fällt.  
**Absicht: ** Erkennt ein niedriges Verkehrsaufkommen, das auf Routing- oder Verfügbarkeitsprobleme hinweisen könnte.  
**PromQL-Kriterien: ** `sum({__name__="Count", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiName="{{your-api-name}}",Stage="{{your-stage}}"}) < {{THRESHOLD}}`  
**Empfohlener Schwellenwert: ** {{THRESHOLD}} (in die Abfrage eingebettet)  
**Rechtfertigung des Schwellenwerts: ** Legen Sie ihn auf der Grundlage Ihrer erwarteten Verkehrsbasislinie fest, um unerwartete Verkehrsrückgänge zu erkennen.  
**Bewertungsintervall: ** 60  
**Wartezeit: ** 600  
**Erholungsphase: ** 300

**HTTP-API **

**4xx**  
**Beschriftungen: **ApiId, Bühne  
**Beschreibung des ** Alarms: Alarm, wenn die durchschnittliche 4xx-Fehlerrate in einer HTTP-API-Stufe 5% übersteigt.  
**Absicht: ** Erkennt eine hohe Client-Fehlerrate auf HTTP-API-Endpunkten.  
**PromQL-Kriterien: ** `avg({__name__="4xx", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="{{your-api-id}}",Stage="{{your-stage}}"}) > 0.05`  
**Empfohlener Schwellenwert: ** 0,05 (eingebettet in die Abfrage)  
**Begründung des Schwellenwerts: ** Erkennt eine Client-Fehlerrate von über 5%.  
**Bewertungsintervall: ** 60  
**Wartezeit: ** 300  
**Erholungsphase: ** 300

**5xx**  
**Beschriftungen: **ApiId, Stufe  
**Beschreibung des ** Alarms: Alarm, wenn die durchschnittliche 5xx-Fehlerrate in einer HTTP-API-Stufe 5% übersteigt.  
**Absicht: ** Erkennt eine hohe Serverfehlerrate auf HTTP-API-Endpunkten.  
**PromQL-Kriterien: ** `avg({__name__="5xx", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="{{your-api-id}}",Stage="{{your-stage}}"}) > 0.05`  
**Empfohlener Schwellenwert: ** 0,05 (eingebettet in die Abfrage)  
**Rechtfertigung des Schwellenwerts: ** Erkennt eine Serverfehlerrate von über 5%, die untersucht werden müssen.  
**Bewertungsintervall: ** 60  
**Wartezeit: ** 180  
**Erholungszeit: ** 300

**Latency**  
**Beschriftungen: **ApiId, Stufe  
**Alarmbeschreibung: ** Alarm, wenn die p90-Latenz für eine HTTP-API-Stufe 2500 ms überschreitet.  
**Absicht: ** Erkennt eine hohe p90-Latenz auf HTTP-API-Endpunkten.  
**PromQL-Kriterien: ** `histogram_quantile(0.9, {__name__="Latency", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="{{your-api-id}}",Stage="{{your-stage}}"}) > 2500`  
**Empfohlener Schwellenwert: ** 2500 (eingebettet in die Abfrage)  
**Rechtfertigung des Schwellenwerts: ** Eine p90-Latenz von über 2500 ms weist auf eine Verschlechterung der Reaktionszeiten hin.  
**Bewertungsintervall: 60 **  
**Wartezeit: ** 300  
**Erholungsphase: ** 300

**IntegrationLatency**  
**Beschriftungen: **ApiId, Stufe  
**Beschreibung des ** Alarms: Alarm, wenn die Latenz der p90-Integration in einer HTTP-API-Stufe 2000 ms überschreitet.  
**Absicht: ** Erkennt eine hohe Latenz bei der Backend-Integration, die sich auf die Reaktionszeiten auswirkt.  
**PromQL-Kriterien: ** `histogram_quantile(0.9, {__name__="IntegrationLatency", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="{{your-api-id}}",Stage="{{your-stage}}"}) > 2000`  
**Empfohlener Schwellenwert: ** 2000 (eingebettet in die Abfrage)  
**Rechtfertigung des Schwellenwerts: ** Eine p90-Integrationslatenz von über 2000 ms weist auf eine Langsamkeit des Back-Ends hin.  
**Bewertungsintervall: 60 **  
**Wartezeit: ** 300  
**Erholungsphase: ** 300

**Count**  
**Beschriftungen: **ApiId, Stufe  
**Beschreibung des ** Alarms: Alarm, wenn die Gesamtzahl der Anfragen unter den erwarteten Ausgangswert für eine HTTP-API-Stufe fällt.  
**Absicht: ** Erkennt ein niedriges Verkehrsaufkommen, das auf Routing- oder Verfügbarkeitsprobleme hinweisen könnte.  
**PromQL-Kriterien: ** `sum({__name__="Count", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="{{your-api-id}}",Stage="{{your-stage}}"}) < {{THRESHOLD}}`  
**Empfohlener Schwellenwert: ** {{THRESHOLD}} (in die Abfrage eingebettet)  
**Rechtfertigung des Schwellenwerts: ** Legen Sie ihn auf der Grundlage Ihrer erwarteten Verkehrsbasislinie fest, um unerwartete Verkehrsrückgänge zu erkennen.  
**Bewertungsintervall: ** 60  
**Wartezeit: ** 600  
**Erholungsphase: ** 300

**WebSocket API**

**ClientError**  
**Beschriftungen: **ApiId, Stufe  
**Beschreibung des ** Alarms: Alarm, wenn die durchschnittliche Client-Fehlerrate in einer WebSocket API-Stufe 5% übersteigt.  
**Absicht: ** Erkennt eine hohe Client-Fehlerrate bei WebSocket API-Verbindungen.  
**PromQL-Kriterien: ** `avg({__name__="ClientError", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="{{your-api-id}}",Stage="{{your-stage}}"}) > 0.05`  
**Empfohlener Schwellenwert: ** 0,05 (in die Abfrage eingebettet)  
**Rechtfertigung des Schwellenwerts: ** Erkennt eine Client-Fehlerrate von über 5% bei WebSocket Verbindungen.  
**Bewertungsintervall: ** 60  
**Wartezeit: ** 300  
**Erholungsphase: ** 300

**ExecutionError**  
**Beschriftungen: **ApiId, Stufe  
**Beschreibung des ** Alarms: Alarm, wenn die durchschnittliche Ausführungsfehlerrate in einer WebSocket API-Stufe 5% übersteigt.  
**Absicht: ** Erkennt eine hohe serverseitige Ausführungsfehlerrate bei WebSocket APIs.  
**PromQL-Kriterien: ** `avg({__name__="ExecutionError", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="{{your-api-id}}",Stage="{{your-stage}}"}) > 0.05`  
**Empfohlener Schwellenwert: ** 0,05 (eingebettet in die Abfrage)  
**Rechtfertigung des Schwellenwerts: ** Erkennt eine Ausführungsfehlerrate von mehr als 5%, die untersucht werden müssen.  
**Bewertungsintervall: ** 60  
**Wartezeit: ** 180  
**Erholungszeit: ** 300

**IntegrationLatency**  
**Beschriftungen: **ApiId, Stufe  
**Beschreibung des ** Alarms: Alarm, wenn die Latenz der p90-Integration für eine WebSocket API-Stufe 2000 ms überschreitet.  
**Absicht: ** Erkennt eine hohe Latenz bei der Backend-Integration auf WebSocket API-Routen.  
**PromQL-Kriterien: ** `histogram_quantile(0.9, {__name__="IntegrationLatency", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="{{your-api-id}}",Stage="{{your-stage}}"}) > 2000`  
**Empfohlener Schwellenwert: ** 2000 (eingebettet in die Abfrage)  
**Rechtfertigung des Schwellenwerts: ** Eine p90-Integrationslatenz von über 2000 ms weist auf eine Langsamkeit des Back-Ends hin.  
**Bewertungsintervall: 60 **  
**Wartezeit: ** 300  
**Erholungsphase: ** 300

**MessageCount**  
**Beschriftungen: **ApiId, Stufe  
**Beschreibung des ** Alarms: Alarm, wenn die Gesamtzahl der Nachrichten unter den erwarteten Ausgangswert für eine WebSocket API-Phase fällt.  
**Absicht: ** Erkennt ein niedriges Nachrichtenvolumen, das auf Verbindungs- oder Routing-Probleme hinweisen könnte.  
**PromQL-Kriterien: ** `sum({__name__="MessageCount", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="{{your-api-id}}",Stage="{{your-stage}}"}) < {{THRESHOLD}}`  
**Empfohlener Schwellenwert: ** {{THRESHOLD}} (in die Abfrage eingebettet)  
**Rechtfertigung des Schwellenwerts: ** Wird auf der Grundlage Ihres erwarteten Nachrichtenvolumens festgelegt, um unerwartete Rückgänge zu erkennen.  
**Bewertungsintervall: ** 60  
**Wartezeit: ** 600  
**Erholungsphase: ** 300

## Auto Scaling
<a name="Recommended_PromQL_AutoScaling"></a>

**GroupInServiceCapacity**  
**Etiketten: ** AutoScalingGroupName  
**Alarmbeschreibung: ** Alarm, wenn die durchschnittliche Kapazität im Betrieb unter das erwartete Minimum für eine Auto Scaling-Gruppe fällt.  
**Absicht: ** Erkennen Sie eine geringe Verfügbarkeit aufgrund von Startfehlern oder beendeten Instances.  
**PromQL-Kriterien: ** `avg({__name__="GroupInServiceCapacity", "@instrumentation.@name"="cloudwatch.aws/autoscaling", AutoScalingGroupName="{{your-auto-scaling-group-name}}"}) < {{THRESHOLD}}`  
**Empfohlener Schwellenwert: ** {{THRESHOLD}} (in die Abfrage eingebettet)  
**Begründung des Schwellenwerts: ** Dieser Wert wird auf der Grundlage Ihrer gewünschten Mindestkapazität festgelegt, um Startfehler oder unzureichende Instances zu erkennen.  
**Bewertungsintervall: ** 60  
**Wartezeit: ** 600  
**Erholungsphase: ** 600

## Zertifikatsmanager
<a name="Recommended_PromQL_CertificateManager"></a>

**DaysToExpiry**  
**Beschriftungen: ** CertificateArn  
**Beschreibung des ** Alarms: Alarm, wenn die Mindestdauer der Tage bis zum Ablauf des Zertifikats auf 44 Tage oder weniger sinkt.  
**Absicht: ** Proaktive Warnung vor Ablauf des Zertifikats, um Zeit für die Verlängerung zu haben.  
**PromQL-Kriterien: ** `min({__name__="DaysToExpiry", "@instrumentation.@name"="cloudwatch.aws/certificatemanager", CertificateArn="{{your-certificate-arn}}"}) <= 44`  
**Empfohlener Schwellenwert: ** 44 (eingebettet in die Abfrage)  
**Begründung des Schwellenwerts: ** Bietet ausreichend Vorlaufzeit bis zum Ablauf des Zertifikats, um den Erneuerungsprozess abzuschließen.  
**Bewertungsintervall: ** 86400  
**Wartezeit: 86400 **  
**Erholungsphase: 86400 **

## CloudFront
<a name="Recommended_PromQL_CloudFront"></a>

**5xxErrorRate**  
**Etiketten: ** DistributionId  
**Beschreibung des ** Alarms: Alarm, wenn die durchschnittliche Fehlerrate von 5xx den Schwellenwert für eine CloudFront Verteilung überschreitet.  
**Absicht: ** Erkennt eine hohe Herkunft oder eine hohe CloudFront Fehlerrate, die sich auf die Inhaltsbereitstellung auswirkt.  
**PromQL-Kriterien: ** `avg({__name__="5xxErrorRate", "@instrumentation.@name"="cloudwatch.aws/cloudfront", DistributionId="{{your-distribution-id}}"}) > {{THRESHOLD}}`  
**Empfohlener Schwellenwert: ** {{THRESHOLD}} (in die Abfrage eingebettet)  
**Begründung des Schwellenwerts: ** Dieser Wert wird auf der Grundlage Ihrer akzeptablen Fehlerquote bei der Bereitstellung von Inhalten festgelegt.  
**Bewertungsintervall: ** 60  
**Wartezeit: ** 300  
**Erholungsphase: ** 300

**OriginLatency**  
**Etiketten: ** DistributionId  
**Beschreibung des ** Alarms: Alarm, wenn die P90-Ursprungslatenz den Schwellenwert für eine CloudFront Verteilung überschreitet.  
**Absicht: ** Erkennt eine hohe Latenz bei der Ursprungsantwort, die die Leistung bei der Inhaltsbereitstellung beeinträchtigt.  
**PromQL-Kriterien: ** `histogram_quantile(0.9, {__name__="OriginLatency", "@instrumentation.@name"="cloudwatch.aws/cloudfront", DistributionId="{{your-distribution-id}}"}) > {{THRESHOLD}}`  
**Empfohlener Schwellenwert: ** {{THRESHOLD}} (in die Abfrage eingebettet)  
**Rechtfertigung des Schwellenwerts: ** Dieser Wert wird auf der Grundlage Ihrer erwarteten Antwortzeit bei der Herkunft und der Caching-Strategie festgelegt.  
**Bewertungsintervall: 60 **  
**Wartezeit: ** 300  
**Erholungsphase: ** 300

**FunctionValidationErrors**  
**Etiketten: **DistributionId, FunctionName  
**Beschreibung des ** Alarms: Alarm, wenn bei der CloudFront Funktionsüberprüfung Fehler auftreten.  
**Absicht: ** Erkennen Sie Fehler bei der CloudFront Funktionsüberprüfung, die die Funktionsausführung verhindern.  
**PromQL-Kriterien: ** `sum({__name__="FunctionValidationErrors", "@instrumentation.@name"="cloudwatch.aws/cloudfront", DistributionId="{{your-distribution-id}}",FunctionName="{{your-function-name}}"}) > 0`  
**Empfohlener Schwellenwert: ** 0 (eingebettet in die Abfrage)  
**Rechtfertigung des Schwellenwerts: ** Jeder Überprüfungsfehler weist auf ein Problem mit der Funktionskonfiguration hin, das Aufmerksamkeit erfordert.  
**Bewertungsintervall: ** 60  
**Wartezeit: ** 120  
**Erholungszeitraum: ** 120

**FunctionExecutionErrors**  
**Etiketten: **DistributionId, FunctionName  
**Beschreibung des ** Alarms: Alarm, wenn Fehler bei der CloudFront Funktionsausführung auftreten.  
**Absicht: ** Erkennt Laufzeitfehler in CloudFront Funktionen, die sich auf die Anforderungsverarbeitung auswirken.  
**PromQL-Kriterien: ** `sum({__name__="FunctionExecutionErrors", "@instrumentation.@name"="cloudwatch.aws/cloudfront", DistributionId="{{your-distribution-id}}",FunctionName="{{your-function-name}}"}) > 0`  
**Empfohlener Schwellenwert: ** 0 (eingebettet in die Abfrage)  
**Rechtfertigung des Schwellenwerts: ** Jeder Ausführungsfehler weist auf ein Laufzeitproblem im Funktionscode hin.  
**Bewertungsintervall: ** 60  
**Wartezeit: ** 300  
**Erholungsphase: ** 300

**FunctionThrottles**  
**Etiketten: **DistributionId, FunctionName  
**Beschreibung des ** Alarms: Alarm, wenn eine CloudFront Funktionsdrosselung auftritt.  
**Absicht: ** Erkennen Sie CloudFront Funktionseinschränkungen, die die Anforderungsverarbeitung beeinträchtigen könnten.  
**PromQL-Kriterien: ** `sum({__name__="FunctionThrottles", "@instrumentation.@name"="cloudwatch.aws/cloudfront", DistributionId="{{your-distribution-id}}",FunctionName="{{your-function-name}}"}) > 0`  
**Empfohlener Schwellenwert: ** 0 (eingebettet in die Abfrage)  
**Begründung des Schwellenwerts: ** Jede Drosselung deutet darauf hin, dass die Funktion die Rechengrenzen erreicht.  
**Bewertungsintervall: 60 **  
**Wartezeit: ** 300  
**Erholungsphase: ** 300

## Cognito
<a name="Recommended_PromQL_Cognito"></a>

**SignUpThrottles**  
**Etiketten: **UserPool, UserPoolClient  
**Beschreibung des ** Alarms: Alarm, wenn Ereignisse bei der Anmeldedrosselung den Schwellenwert für einen Benutzerpool überschreiten.  
**Absicht: ** Erkennt eine Drosselung der Registrierung, die neue Benutzerregistrierungen verhindert.  
**PromQL-Kriterien: ** `sum({__name__="SignUpThrottles", "@instrumentation.@name"="cloudwatch.aws/cognito", UserPool="{{your-user-pool}}",UserPoolClient="{{your-user-pool-client}}"}) > {{THRESHOLD}}`  
**Empfohlener Schwellenwert: ** {{THRESHOLD}} (in die Abfrage eingebettet)  
**Begründung des Schwellenwerts: ** Dieser Wert wird auf der Grundlage Ihrer akzeptablen Drosselungsrate für Anmeldevorgänge festgelegt.  
**Bewertungsintervall: 60 **  
**Wartezeit: ** 300  
**Erholungsphase: ** 300

**SignInThrottles**  
**Etiketten: **UserPool, UserPoolClient  
**Beschreibung des ** Alarms: Alarm, wenn Ereignisse bei der Anmeldedrosselung den Schwellenwert für einen Benutzerpool überschreiten.  
**Absicht: ** Erkennt eine Drosselung der Anmeldung, die eine Benutzerauthentifizierung verhindert.  
**PromQL-Kriterien: ** `sum({__name__="SignInThrottles", "@instrumentation.@name"="cloudwatch.aws/cognito", UserPool="{{your-user-pool}}",UserPoolClient="{{your-user-pool-client}}"}) > {{THRESHOLD}}`  
**Empfohlener Schwellenwert: ** {{THRESHOLD}} (in die Abfrage eingebettet)  
**Begründung des Schwellenwerts: ** Dieser Wert wird auf der Grundlage Ihrer akzeptablen Drosselrate für Anmeldevorgänge festgelegt.  
**Bewertungsintervall: 60 **  
**Wartezeit: ** 300  
**Erholungsphase: ** 300

**TokenRefreshThrottles**  
**Etiketten: **UserPool, UserPoolClient  
**Alarmbeschreibung: ** Alarm, wenn Drosselungsereignisse bei der Token-Aktualisierung den Schwellenwert für einen Benutzerpool überschreiten.  
**Absicht: ** Erkennt eine Drosselung der Token-Aktualisierung, die zu Sitzungsunterbrechungen führen kann.  
**PromQL-Kriterien: ** `sum({__name__="TokenRefreshThrottles", "@instrumentation.@name"="cloudwatch.aws/cognito", UserPool="{{your-user-pool}}",UserPoolClient="{{your-user-pool-client}}"}) > {{THRESHOLD}}`  
**Empfohlener Schwellenwert: ** {{THRESHOLD}} (in die Abfrage eingebettet)  
**Begründung des Schwellenwerts: Dieser ** Wert wird auf der Grundlage Ihrer akzeptablen Drosselungsrate für Token-Aktualisierungsvorgänge festgelegt.  
**Bewertungsintervall: 60 **  
**Wartezeit: ** 300  
**Erholungsphase: ** 300

**FederationThrottles**  
**Etiketten: ** UserPool UserPoolClient, IdentityProvider  
**Beschreibung des ** Alarms: Alarm, wenn Federation Throttle-Ereignisse den Schwellenwert für einen Identitätsanbieter für einen Benutzerpool überschreiten.  
**Absicht: Es wird eine Verbunddrosselung ** erkannt, die eine Verbundanmeldung verhindern könnte.  
**PromQL-Kriterien: ** `sum({__name__="FederationThrottles", "@instrumentation.@name"="cloudwatch.aws/cognito", UserPool="{{your-user-pool}}",UserPoolClient="{{your-user-pool-client}}",IdentityProvider="{{your-identity-provider}}"}) > {{THRESHOLD}}`  
**Empfohlener Schwellenwert: ** {{THRESHOLD}} (in die Abfrage eingebettet)  
**Begründung des Schwellenwerts: ** Dieser Wert wird auf der Grundlage Ihrer akzeptablen Drosselungsrate für Verbundoperationen festgelegt.  
**Bewertungsintervall: 60 **  
**Wartezeit: ** 300  
**Erholungsphase: ** 300

## DynamoDB
<a name="Recommended_PromQL_DynamoDB"></a>

**AccountProvisionedReadCapacityUtilization**  
**Beschriftungen: ** Keine  
**Beschreibung des ** Alarms: Alarm, wenn die Auslastung der bereitgestellten Lesekapazität auf Kontoebene 80% übersteigt.  
**Absicht: ** Erkennt, wenn sich die bereitgestellte Lesekapazität den Kontogrenzen nähert.  
**PromQL-Kriterien: ** `max({__name__="AccountProvisionedReadCapacityUtilization", "@instrumentation.@name"="cloudwatch.aws/dynamodb"}) > 80`  
**Empfohlener Schwellenwert: ** 80 (eingebettet in die Abfrage)  
**Begründung des Schwellenwerts: ** Bei einer Auslastung von 80% haben Sie nur begrenzten Spielraum, bevor Sie die Kontolimits erreichen.  
**Bewertungsintervall: 300 **  
**Wartezeit: ** 600  
**Erholungsphase: ** 600

**AccountProvisionedWriteCapacityUtilization**  
**Beschriftungen: ** Keine  
**Beschreibung des ** Alarms: Alarm, wenn die auf Kontoebene bereitgestellte Schreibkapazität mehr als 80% ausnutzt.  
**Absicht: ** Erkennt, wenn sich die bereitgestellte Schreibkapazität den Kontogrenzen nähert.  
**PromQL-Kriterien: ** `max({__name__="AccountProvisionedWriteCapacityUtilization", "@instrumentation.@name"="cloudwatch.aws/dynamodb"}) > 80`  
**Empfohlener Schwellenwert: ** 80 (eingebettet in die Abfrage)  
**Begründung des Schwellenwerts: ** Bei einer Auslastung von 80% haben Sie nur begrenzten Spielraum, bevor Sie die Kontolimits erreichen.  
**Bewertungsintervall: 300 **  
**Wartezeit: ** 600  
**Erholungsphase: ** 600

**AgeOfOldestUnreplicatedRecord**  
**Etiketten: **TableName, DelegatedOperation  
**Beschreibung des ** Alarms: Alarm, wenn das Alter des ältesten nicht replizierten Datensatzes den Schwellenwert überschreitet.  
**Absicht: ** Erkennt Verzögerungen bei der Replikation, die zu veralteten Daten in globalen Tabellen führen könnten.  
**PromQL-Kriterien: ** `max({__name__="AgeOfOldestUnreplicatedRecord", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="{{your-table-name}}",DelegatedOperation="{{your-operation}}"}) > {{THRESHOLD}}`  
**Empfohlener Schwellenwert: ** {{THRESHOLD}} (in die Abfrage eingebettet)  
**Begründung des Schwellenwerts: Dieser ** Wert wird auf der Grundlage Ihrer Anforderungen an die Aktualität der Replikation festgelegt.  
**Bewertungsintervall: ** 300  
**Wartezeit: ** 900  
**Erholungsphase: ** 900

**FailedToReplicateRecordCount**  
**Etiketten: **TableName, DelegatedOperation  
**Beschreibung des ** Alarms: Alarm, wenn Datensätze in einer globalen Tabelle nicht repliziert werden können.  
**Absicht: ** Erkennung von Replikationsfehlern, die zu Dateninkonsistenzen zwischen Regionen führen.  
**PromQL-Kriterien: ** `sum({__name__="FailedToReplicateRecordCount", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="{{your-table-name}}",DelegatedOperation="{{your-operation}}"}) > 0`  
**Empfohlener Schwellenwert: ** 0 (eingebettet in die Abfrage)  
**Rechtfertigung des Schwellenwerts: ** Jede fehlgeschlagene Replikation weist auf Probleme mit der Datenkonsistenz hin, die sofortige Aufmerksamkeit erfordern.  
**Bewertungsintervall: ** 60  
**Wartezeit: ** 60  
**Erholungsphase: ** 60

**ReadThrottleEvents**  
**Beschriftungen: ** TableName  
**Beschreibung des ** Alarms: Alarm, wenn Read-Throttle-Ereignisse den Schwellenwert für eine Tabelle überschreiten.  
**Absicht: Es wird eine ** Lesedrosselung erkannt, die auf eine unzureichende bereitgestellte Kapazität hinweist.  
**PromQL-Kriterien: ** `sum({__name__="ReadThrottleEvents", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="{{your-table-name}}"}) > {{THRESHOLD}}`  
**Empfohlener Schwellenwert: ** {{THRESHOLD}} (in die Abfrage eingebettet)  
**Begründung des Schwellenwerts: ** Dieser Wert wird auf der Grundlage Ihrer akzeptablen Drosselzahl für Lesevorgänge festgelegt.  
**Bewertungsintervall: 60 **  
**Wartezeit: ** 300  
**Erholungsphase: ** 300

**ReadThrottleEvents (GSI) **  
**Etiketten: **TableName, GlobalSecondaryIndexName  
**Beschreibung des ** Alarms: Alarm, wenn Read-Throttle-Ereignisse den Schwellenwert für einen globalen sekundären Index überschreiten.  
**Absicht: Es wird eine ** Lesedrosselung auf einem GSI erkannt, die auf eine unzureichende Indexkapazität hinweist.  
**PromQL-Kriterien: ** `sum({__name__="ReadThrottleEvents", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="{{your-table-name}}",GlobalSecondaryIndexName="{{your-index-name}}"}) > {{THRESHOLD}}`  
**Empfohlener Schwellenwert: ** {{THRESHOLD}} (in die Abfrage eingebettet)  
**Begründung des Schwellenwerts: Dieser ** Wert wird auf der Grundlage Ihrer akzeptablen Drosselzahl für GSI-Lesevorgänge festgelegt.  
**Bewertungsintervall: 60 **  
**Wartezeit: ** 300  
**Erholungsphase: ** 300

**ReplicationLatency**  
**Etiketten: **TableName, ReceivingRegion  
**Beschreibung des ** Alarms: Alarm, wenn die durchschnittliche Replikationslatenz den Schwellenwert für eine globale Tabelle überschreitet.  
**Absicht: ** Erkennt eine hohe Replikationslatenz, die zu veralteten Lesevorgängen in Replikatregionen führen kann.  
**PromQL-Kriterien: ** `avg({__name__="ReplicationLatency", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="{{your-table-name}}",ReceivingRegion="{{your-receiving-region}}"}) > {{THRESHOLD}}`  
**Empfohlener Schwellenwert: ** {{THRESHOLD}} (in die Abfrage eingebettet)  
**Begründung des Schwellenwerts: Dieser ** Wert wird auf der Grundlage Ihrer Anforderungen an die Aktualität der Daten für Replikatregionen festgelegt.  
**Bewertungsintervall: 60 **  
**Wartezeit: ** 900  
**Erholungsphase: ** 900

**SuccessfulRequestLatency**  
**Etiketten: **TableName, Bedienung  
**Alarmbeschreibung: ** Alarm, wenn die durchschnittliche erfolgreiche Anforderungslatenz den Schwellenwert für eine Tabellenoperation überschreitet.  
**Absicht: ** Erkennt hohe Latenzen bei DynamoDB-Vorgängen, die sich auf die Anwendungsleistung auswirken.  
**PromQL-Kriterien: ** `avg({__name__="SuccessfulRequestLatency", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="{{your-table-name}}",Operation="{{your-operation}}"}) > {{THRESHOLD}}`  
**Empfohlener Schwellenwert: ** {{THRESHOLD}} (in die Abfrage eingebettet)  
**Begründung des Schwellenwerts: ** Dieser Wert wird auf der Grundlage Ihres Latenz-SLA für den jeweiligen DynamoDB-Vorgang festgelegt.  
**Bewertungsintervall: 60 **  
**Wartezeit: ** 600  
**Erholungsphase: ** 600

**SystemErrors**  
**Beschriftungen: ** TableName  
**Beschreibung des ** Alarms: Alarm, wenn Systemfehler den Schwellenwert für eine Tabelle überschreiten.  
**Absicht: ** Erkennt dienstseitige DynamoDB-Fehler, die sich auf die Tabellenverfügbarkeit auswirken.  
**PromQL-Kriterien: ** `sum({__name__="SystemErrors", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="{{your-table-name}}"}) > {{THRESHOLD}}`  
**Empfohlener Schwellenwert: ** {{THRESHOLD}} (in die Abfrage eingebettet)  
**Begründung des Schwellenwerts: ** Dieser Wert wird auf der Grundlage Ihrer akzeptablen Anzahl von Systemfehlern für die Tabelle festgelegt.  
**Bewertungsintervall: ** 60  
**Wartezeit: ** 900  
**Erholungsphase: ** 900

**ThrottledPutRecordCount**  
**Etiketten: **TableName, DelegatedOperation  
**Beschreibung des Alarms: ** Alarm, wenn die Anzahl der Datensätze gedrosselt wird, den Schwellenwert für eine Tabelle überschreitet.  
**Absicht: ** Erkennt gedrosselte Puts, die bei Streaming-Vorgängen zu Datenverlust führen könnten.  
**PromQL-Kriterien: ** `max({__name__="ThrottledPutRecordCount", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="{{your-table-name}}",DelegatedOperation="{{your-operation}}"}) > {{THRESHOLD}}`  
**Empfohlener Schwellenwert: ** {{THRESHOLD}} (in die Abfrage eingebettet)  
**Begründung des Schwellenwerts: Dieser ** Wert wird auf der Grundlage Ihrer akzeptablen Anzahl an Drosselungen für Streaming-Put-Operationen festgelegt.  
**Bewertungsintervall: 60 **  
**Wartezeit: ** 600  
**Erholungsphase: ** 600

**UserErrors**  
**Beschriftungen: ** Keine  
**Beschreibung des ** Alarms: Alarm, wenn Benutzerfehler den Schwellenwert für das gesamte Konto überschreiten.  
**Absicht: ** Erkennen Sie eine hohe Anzahl von Kundenfehlern, wie z. B. fehlgeschlagene Validierungs- oder Bedingungsprüfungen.  
**PromQL-Kriterien: ** `sum({__name__="UserErrors", "@instrumentation.@name"="cloudwatch.aws/dynamodb"}) > {{THRESHOLD}}`  
**Empfohlener Schwellenwert: ** {{THRESHOLD}} (in die Abfrage eingebettet)  
**Begründung des Schwellenwerts: Dieser ** Wert wird auf der Grundlage Ihrer akzeptablen Fehlerrate für clientseitige Anforderungsfehler festgelegt.  
**Bewertungsintervall: 60 **  
**Wartezeit: ** 600  
**Erholungsphase: ** 600

**WriteThrottleEvents**  
**Beschriftungen: ** TableName  
**Beschreibung des Alarms: ** Alarm, wenn Write-Throttle-Ereignisse den Schwellenwert für eine Tabelle überschreiten.  
**Absicht: Es wird eine Schreibdrosselung ** erkannt, die auf eine unzureichende bereitgestellte Kapazität hinweist.  
**PromQL-Kriterien: ** `sum({__name__="WriteThrottleEvents", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="{{your-table-name}}"}) > {{THRESHOLD}}`  
**Empfohlener Schwellenwert: ** {{THRESHOLD}} (in die Abfrage eingebettet)  
**Begründung des Schwellenwerts: Dieser ** Wert wird auf der Grundlage Ihrer akzeptablen Anzahl an Drosselungen für Schreibvorgänge festgelegt.  
**Bewertungsintervall: 60 **  
**Wartezeit: ** 300  
**Erholungsphase: ** 300

**WriteThrottleEvents (GSI) **  
**Etiketten: **TableName, GlobalSecondaryIndexName  
**Beschreibung des ** Alarms: Alarm, wenn Write-Throttle-Ereignisse den Schwellenwert für einen globalen sekundären Index überschreiten.  
**Absicht: Es wird eine Schreibdrosselung auf einem GSI ** erkannt, die auf eine unzureichende Indexkapazität hinweist.  
**PromQL-Kriterien: ** `sum({__name__="WriteThrottleEvents", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="{{your-table-name}}",GlobalSecondaryIndexName="{{your-index-name}}"}) > {{THRESHOLD}}`  
**Empfohlener Schwellenwert: ** {{THRESHOLD}} (in die Abfrage eingebettet)  
**Begründung des Schwellenwerts: ** Dieser Wert wird auf der Grundlage Ihrer akzeptablen Drosselzahl für GSI-Schreibvorgänge festgelegt.  
**Bewertungsintervall: 60 **  
**Wartezeit: ** 300  
**Erholungsphase: ** 300

## EBS
<a name="Recommended_PromQL_EBS"></a>

**VolumeStalledIOCheck**  
**Etiketten: **VolumeId, InstanceId  
**Beschreibung des ** Alarms: Alarm, wenn ein EBS-Volume einen fehlgeschlagenen I/O Check meldet.  
**Absicht: ** Erkennt Blockaden I/O auf EBS-Datenträgern, die auf eine Beeinträchtigung der Lautstärke hinweisen.  
**PromQL-Kriterien: ** `max({__name__="VolumeStalledIOCheck", "@instrumentation.@name"="cloudwatch.aws/ebs", VolumeId="{{your-volume-id}}",InstanceId="{{your-instance-id}}"}) >= 1`  
**Empfohlener Schwellenwert: ** 1 (eingebettet in die Abfrage)  
**Begründung des Schwellenwerts: ** Ein Wert von 1 oder höher bedeutet, dass das Volumen ins Stocken geraten ist I/O und eine sofortige Untersuchung erforderlich ist.  
**Bewertungsintervall: 60 **  
**Wartezeit: ** 600  
**Erholungsphase: ** 600

## Amazon Elastic Compute Cloud
<a name="Recommended_PromQL_EC2"></a>

**CPUUtilization**  
**Beschriftungen: ** InstanceId  
**Alarmbeschreibung: ** Alarm, wenn die durchschnittliche CPU-Auslastung für eine EC2-Instance 80% übersteigt.  
**Absicht: ** Erkennung einer hohen CPU-Auslastung.  
**PromQL-Kriterien: ** `avg({__name__="CPUUtilization", "@instrumentation.@name"="cloudwatch.aws/ec2", InstanceId="{{your-instance-id}}"}) > 80`  
**Empfohlener Schwellenwert: ** 80 (eingebettet in die Abfrage)  
**Begründung des Schwellenwerts: Der Schwellenwert von ** 80% gibt Spielraum vor der Sättigung.  
**Bewertungsintervall: 300 **  
**Wartezeit: ** 900  
**Erholungsphase: ** 900

**StatusCheckFailed**  
**Beschriftungen: ** InstanceId  
**Alarmbeschreibung: ** Alarm, wenn eine Instance oder eine Systemstatusüberprüfung für eine EC2-Instance fehlschlägt.  
**Absicht: ** Erkennung von Instance- oder Systemintegritätsproblemen.  
**PromQL-Kriterien: ** `max({__name__="StatusCheckFailed", "@instrumentation.@name"="cloudwatch.aws/ec2", InstanceId="{{your-instance-id}}"}) >= 1`  
**Empfohlener Schwellenwert: ** 1 (eingebettet in die Abfrage)  
**Begründung des Schwellenwerts: ** Jeder Fehler bei der Statusüberprüfung muss untersucht werden.  
**Bewertungsintervall: ** 300  
**Wartezeit: ** 600  
**Erholungsphase: ** 600

**StatusCheckFailed\_Angehängte EBS **  
**Beschriftungen: ** InstanceId  
**Alarmbeschreibung: ** Alarm, wenn ein angeschlossenes EBS-Volume für eine EC2-Instance nicht mehr erreichbar ist.  
**Absicht: ** Erkennung unerreichbarer EBS-Volumes.  
**PromQL-Kriterien: ** `max({__name__="StatusCheckFailed_AttachedEBS", "@instrumentation.@name"="cloudwatch.aws/ec2", InstanceId="{{your-instance-id}}"}) >= 1`  
**Empfohlener Schwellenwert: ** 1 (eingebettet in die Abfrage)  
**Begründung des Schwellenwerts: ** Nicht erreichbare Volumes führen zu I/O Ausfällen.  
**Bewertungsintervall: 60 **  
**Wartezeit: ** 600  
**Erholungsphase: ** 600

## Amazon ECS
<a name="Recommended_PromQL_ECS"></a>

**CPUReservation**  
**Beschriftungen: ** ClusterName  
**Beschreibung des ** Alarms: Alarm, wenn die durchschnittliche CPU-Reservierung für einen ECS-Cluster 80% übersteigt.  
**Absicht: ** Erkennt den Cluster, der sich der CPU-Kapazität nähert.  
**PromQL-Kriterien: ** `avg({__name__="CPUReservation", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="{{your-cluster-name}}"}) > 80`  
**Empfohlener Schwellenwert: ** 80 (eingebettet in die Abfrage)  
**Begründung für den Schwellenwert: Eine Reservierung von ** 80% deutet auf begrenzten Spielraum für neue Aufgaben hin.  
**Bewertungsintervall: 60 **  
**Wartezeit: ** 300  
**Erholungsphase: ** 300

**CPUUtilization**  
**Etiketten: **ClusterName, ServiceName  
**Beschreibung des ** Alarms: Alarm, wenn die durchschnittliche CPU-Auslastung für einen ECS-Dienst 80% übersteigt.  
**Absicht: ** Erkennt eine hohe CPU-Auslastung für den ECS-Dienst.  
**PromQL-Kriterien: ** `avg({__name__="CPUUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="{{your-cluster-name}}",ServiceName="{{your-service-name}}"}) > 80`  
**Empfohlener Schwellenwert: ** 80 (eingebettet in die Abfrage)  
**Begründung des Schwellenwerts: ** Bei 80% besteht Spielraum vor der Sättigung.  
**Bewertungsintervall: 60 **  
**Wartezeit: ** 300  
**Erholungsphase: ** 300

**EBSFilesystemUtilization**  
**Etiketten: **ClusterName, ServiceName  
**Beschreibung des ** Alarms: Alarm, wenn die durchschnittliche Auslastung des EBS-Dateisystems für einen ECS-Dienst 80% übersteigt.  
**Absicht: ** Erkennung einer hohen EBS-Speicherauslastung.  
**PromQL-Kriterien: ** `avg({__name__="EBSFilesystemUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="{{your-cluster-name}}",ServiceName="{{your-service-name}}"}) > 80`  
**Empfohlener Schwellenwert: ** 80 (eingebettet in die Abfrage)  
**Begründung des Schwellenwerts: ** Bei 80% besteht Spielraum vor der Sättigung.  
**Bewertungsintervall: 60 **  
**Wartezeit: ** 300  
**Erholungsphase: ** 300

**MemoryReservation**  
**Etiketten: ** ClusterName  
**Alarmbeschreibung: ** Alarm, wenn die durchschnittliche Speicherreservierung für einen ECS-Cluster 80% übersteigt.  
**Absicht: ** Erkennt den Cluster, der sich der Speicherkapazität nähert.  
**PromQL-Kriterien: ** `avg({__name__="MemoryReservation", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="{{your-cluster-name}}"}) > 80`  
**Empfohlener Schwellenwert: ** 80 (eingebettet in die Abfrage)  
**Begründung des Schwellenwerts: Eine Reservierung von ** 80% deutet auf begrenzten Spielraum für neue Aufgaben hin.  
**Bewertungsintervall: 60 **  
**Wartezeit: ** 300  
**Erholungsphase: ** 300

**MemoryUtilization**  
**Etiketten: **ClusterName, ServiceName  
**Beschreibung des ** Alarms: Alarm, wenn die durchschnittliche Speicherauslastung für einen ECS-Dienst 80% übersteigt.  
**Absicht: ** Erkennung einer hohen Speicherauslastung.  
**PromQL-Kriterien: ** `avg({__name__="MemoryUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="{{your-cluster-name}}",ServiceName="{{your-service-name}}"}) > 80`  
**Empfohlener Schwellenwert: ** 80 (eingebettet in die Abfrage)  
**Begründung des Schwellenwerts: ** Bei 80% besteht Spielraum vor der Sättigung.  
**Bewertungsintervall: 60 **  
**Wartezeit: ** 300  
**Erholungsphase: ** 300

**HTTP Code\_Target \_5xx\_COUNT **  
**Beschriftungen:, ** ClusterName ServiceName  
**Alarmbeschreibung: ** Alarm, wenn die Anzahl der HTTP 5XX-Fehler den Schwellenwert für einen ECS-Dienst überschreitet.  
**Absicht: ** Erkennt eine hohe serverseitige Fehleranzahl.  
**PromQL-Kriterien: ** `sum({__name__="HTTPCode_Target_5XX_Count", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="{{your-cluster-name}}",ServiceName="{{your-service-name}}"}) > {{THRESHOLD}}`  
**Empfohlener Schwellenwert: ** {{THRESHOLD}} (in die Abfrage eingebettet)  
**Begründung des Schwellenwerts: ** Dieser Wert wird auf der Grundlage der normalen Fehlerquote Ihrer Anwendung festgelegt.  
**Bewertungsintervall: ** 60  
**Wartezeit: ** 300  
**Erholungsphase: ** 300

**TargetResponseTime**  
**Etiketten: **ClusterName, ServiceName  
**Alarmbeschreibung: ** Alarm, wenn die durchschnittliche Zielreaktionszeit den Schwellenwert für einen ECS-Service überschreitet.  
**Absicht: ** Erkennt eine hohe Zielreaktionszeit.  
**PromQL-Kriterien: ** `avg({__name__="TargetResponseTime", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="{{your-cluster-name}}",ServiceName="{{your-service-name}}"}) > {{THRESHOLD}}`  
**Empfohlener Schwellenwert: ** {{THRESHOLD}} (in die Abfrage eingebettet)  
**Begründung des ** Schwellenwerts: Wird auf der Grundlage der akzeptablen Latenzanforderungen Ihrer Anwendung festgelegt.  
**Bewertungsintervall: ** 60  
**Wartezeit: ** 300  
**Erholungsphase: ** 300

## Einblicke in Amazon ECS Container
<a name="Recommended_PromQL_ECS_ContainerInsights"></a>

**EphemeralStorageUtilized**  
**Beschriftungen: **ClusterName, ServiceName  
**Beschreibung des Alarms: ** Alarm, wenn die durchschnittliche Nutzung kurzlebigen Speichers den Schwellenwert für Fargate-Aufgaben überschreitet.  
**Absicht: ** Erkennt eine hohe Auslastung des kurzlebigen Speichers für Fargate-Aufgaben.  
**PromQL-Kriterien: ** `avg({__name__="EphemeralStorageUtilized", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="{{your-cluster-name}}",ServiceName="{{your-service-name}}"}) > {{THRESHOLD}}`  
**Empfohlener Schwellenwert: ** {{THRESHOLD}} (in die Abfrage eingebettet)  
**Begründung des Schwellenwerts: ** Dieser Wert wird auf der Grundlage der temporären Speicherzuweisung Ihrer Aufgabe festgelegt.  
**Bewertungsintervall: 60 **  
**Wartezeit: ** 300  
**Erholungsphase: ** 300

**RunningTaskCount**  
**Etiketten: **ClusterName, ServiceName  
**Beschreibung des ** Alarms: Alarm, wenn die Anzahl der laufenden Aufgaben für einen ECS-Dienst auf Null fällt.  
**Absicht: ** Erkennt, wenn keine Aufgaben ausgeführt werden.  
**PromQL-Kriterien: ** `avg({__name__="RunningTaskCount", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="{{your-cluster-name}}",ServiceName="{{your-service-name}}"}) <= 0`  
**Empfohlener Schwellenwert: ** 0 (eingebettet in die Abfrage)  
**Rechtfertigung des Schwellenwerts: ** Wenn keine Aufgaben ausgeführt werden, deutet dies auf einen Serviceausfall hin.  
**Bewertungsintervall: 60 **  
**Wartezeit: ** 300  
**Erholungsphase: ** 300

**instance\_filesystem\_utilization**  
**Etiketten: ** InstanceId ContainerInstanceId, ClusterName  
**Beschreibung des Alarms: ** Alarm, wenn die durchschnittliche Dateisystemauslastung auf einer Container-Instance 90% übersteigt.  
**Absicht: ** Erkennung einer hohen Dateisystemauslastung.  
**PromQL-Kriterien: ** `avg({__name__="instance_filesystem_utilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", InstanceId="{{your-instance-id}}",ContainerInstanceId="{{your-container-instance-id}}",ClusterName="{{your-cluster-name}}"}) > 90`  
**Empfohlener Schwellenwert: ** 90 (eingebettet in die Abfrage)  
**Rechtfertigung des Schwellenwerts: ** Bei 90% der Dateisystemauslastung bleibt nur wenig Platz für Operationen.  
**Bewertungsintervall: 60 **  
**Wartezeit: ** 300  
**Erholungsphase: ** 300

## Amazon ECS Container Insights verbesserte die Beobachtbarkeit
<a name="Recommended_PromQL_ECS_ContainerInsights_Enhanced"></a>

**TaskCpuUtilization (Cluster-Ebene) **  
**Beschriftungen: ** ClusterName  
**Beschreibung des ** Alarms: Alarm, wenn die durchschnittliche CPU-Auslastung der Aufgabe auf Cluster-Ebene 80% übersteigt.  
**Absicht: ** Erkennt eine hohe CPU-Auslastung.  
**PromQL-Kriterien: ** `avg({__name__="TaskCpuUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="{{your-cluster-name}}"}) > 80`  
**Empfohlener Schwellenwert: ** 80 (eingebettet in die Abfrage)  
**Begründung des Schwellenwerts: ** Bei 80% besteht Spielraum vor der Sättigung.  
**Bewertungsintervall: 60 **  
**Wartezeit: ** 300  
**Erholungsphase: ** 300

**TaskCpuUtilization (Serviceniveau) **  
**Etiketten: **ClusterName, ServiceName  
**Beschreibung des ** Alarms: Alarm, wenn die durchschnittliche CPU-Auslastung der Aufgabe auf Service-Ebene 80% übersteigt.  
**Absicht: ** Erkennung einer hohen CPU-Auslastung.  
**PromQL-Kriterien: ** `avg({__name__="TaskCpuUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="{{your-cluster-name}}",ServiceName="{{your-service-name}}"}) > 80`  
**Empfohlener Schwellenwert: ** 80 (eingebettet in die Abfrage)  
**Begründung des Schwellenwerts: ** Bei 80% besteht Spielraum vor der Sättigung.  
**Bewertungsintervall: 60 **  
**Wartezeit: ** 300  
**Erholungsphase: ** 300

**TaskMemoryUtilization (Cluster-Ebene) **  
**Beschriftungen: ** ClusterName  
**Beschreibung des ** Alarms: Alarm, wenn die durchschnittliche Arbeitsspeicherauslastung der Aufgabe auf Cluster-Ebene 80% übersteigt.  
**Absicht: ** Erkennt eine hohe Speicherauslastung.  
**PromQL-Kriterien: ** `avg({__name__="TaskMemoryUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="{{your-cluster-name}}"}) > 80`  
**Empfohlener Schwellenwert: ** 80 (eingebettet in die Abfrage)  
**Begründung des Schwellenwerts: ** Bei 80% besteht Spielraum vor der Sättigung.  
**Bewertungsintervall: 60 **  
**Wartezeit: ** 300  
**Erholungsphase: ** 300

**TaskMemoryUtilization (Serviceniveau) **  
**Etiketten: **ClusterName, ServiceName  
**Beschreibung des ** Alarms: Alarm, wenn die durchschnittliche Arbeitsspeicherauslastung der Aufgabe auf Service-Ebene 80% übersteigt.  
**Absicht: ** Erkennung einer hohen Speicherauslastung.  
**PromQL-Kriterien: ** `avg({__name__="TaskMemoryUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="{{your-cluster-name}}",ServiceName="{{your-service-name}}"}) > 80`  
**Empfohlener Schwellenwert: ** 80 (eingebettet in die Abfrage)  
**Begründung des Schwellenwerts: ** Bei 80% besteht Spielraum vor der Sättigung.  
**Bewertungsintervall: 60 **  
**Wartezeit: ** 300  
**Erholungsphase: ** 300

**ContainerCpuUtilization (Cluster-Ebene) **  
**Beschriftungen: ** ClusterName  
**Beschreibung des ** Alarms: Alarm, wenn die durchschnittliche CPU-Auslastung des Containers auf Cluster-Ebene 80% übersteigt.  
**Absicht: ** Erkennung einer hohen CPU-Auslastung.  
**PromQL-Kriterien: ** `avg({__name__="ContainerCpuUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="{{your-cluster-name}}"}) > 80`  
**Empfohlener Schwellenwert: ** 80 (eingebettet in die Abfrage)  
**Begründung des Schwellenwerts: ** Bei 80% besteht Spielraum vor der Sättigung.  
**Bewertungsintervall: 60 **  
**Wartezeit: ** 300  
**Erholungsphase: ** 300

**ContainerCpuUtilization (Containerebene) **  
**Beschriftungen: ** ContainerName ClusterName, ServiceName  
**Beschreibung des ** Alarms: Alarm, wenn die durchschnittliche CPU-Auslastung des Containers auf Containerebene 80% übersteigt.  
**Absicht: ** Erkennung einer hohen CPU-Auslastung.  
**PromQL-Kriterien: ** `avg({__name__="ContainerCpuUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ContainerName="{{your-container-name}}",ClusterName="{{your-cluster-name}}",ServiceName="{{your-service-name}}"}) > 80`  
**Empfohlener Schwellenwert: ** 80 (eingebettet in die Abfrage)  
**Begründung des Schwellenwerts: ** Bei 80% besteht Spielraum vor der Sättigung.  
**Bewertungsintervall: 60 **  
**Wartezeit: ** 300  
**Erholungsphase: ** 300

**ContainerMemoryUtilization (Cluster-Ebene) **  
**Beschriftungen: ** ClusterName  
**Alarmbeschreibung: ** Alarm, wenn die durchschnittliche Speicherauslastung des Containers auf Cluster-Ebene 80% übersteigt.  
**Absicht: ** Erkennung einer hohen Speicherauslastung.  
**PromQL-Kriterien: ** `avg({__name__="ContainerMemoryUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="{{your-cluster-name}}"}) > 80`  
**Empfohlener Schwellenwert: ** 80 (eingebettet in die Abfrage)  
**Begründung des Schwellenwerts: ** Bei 80% besteht Spielraum vor der Sättigung.  
**Bewertungsintervall: 60 **  
**Wartezeit: ** 300  
**Erholungsphase: ** 300

**ContainerMemoryUtilization (Containerebene) **  
**Beschriftungen: ** ContainerName ClusterName, ServiceName  
**Beschreibung des ** Alarms: Alarm, wenn die durchschnittliche Speicherauslastung des Containers auf Containerebene 80% übersteigt.  
**Absicht: ** Erkennung einer hohen Speicherauslastung.  
**PromQL-Kriterien: ** `avg({__name__="ContainerMemoryUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ContainerName="{{your-container-name}}",ClusterName="{{your-cluster-name}}",ServiceName="{{your-service-name}}"}) > 80`  
**Empfohlener Schwellenwert: ** 80 (eingebettet in die Abfrage)  
**Begründung des Schwellenwerts: ** Bei 80% besteht Spielraum vor der Sättigung.  
**Bewertungsintervall: 60 **  
**Wartezeit: ** 300  
**Erholungsphase: ** 300

**TaskEBSfilesystemUtilization**  
**Etiketten: **ClusterName, ServiceName  
**Beschreibung des ** Alarms: Alarm, wenn die durchschnittliche Auslastung des EBS-Dateisystems für Aufgaben 80% übersteigt.  
**Absicht: ** Erkennt eine hohe Auslastung des EBS-Dateisystems.  
**PromQL-Kriterien: ** `avg({__name__="TaskEBSfilesystemUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="{{your-cluster-name}}",ServiceName="{{your-service-name}}"}) > 80`  
**Empfohlener Schwellenwert: ** 80 (eingebettet in die Abfrage)  
**Begründung des Schwellenwerts: ** Bei 80% besteht Spielraum vor der Sättigung.  
**Bewertungsintervall: 60 **  
**Wartezeit: ** 300  
**Erholungsphase: ** 300

**TaskEphemeralStorageUtilization (Cluster-Ebene) **  
**Beschriftungen: ** ClusterName  
**Beschreibung des ** Alarms: Alarm, wenn die durchschnittliche Auslastung des kurzlebigen Speichers auf Cluster-Ebene 80% übersteigt.  
**Absicht: ** Erkennt eine hohe Auslastung des kurzlebigen Speichers.  
**PromQL-Kriterien: ** `avg({__name__="TaskEphemeralStorageUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="{{your-cluster-name}}"}) > 80`  
**Empfohlener Schwellenwert: ** 80 (eingebettet in die Abfrage)  
**Begründung des Schwellenwerts: ** Bei 80% besteht Spielraum vor der Sättigung.  
**Bewertungsintervall: 60 **  
**Wartezeit: ** 300  
**Erholungsphase: ** 300

**TaskEphemeralStorageUtilization (Serviceniveau) **  
**Etiketten: **ClusterName, ServiceName  
**Beschreibung des ** Alarms: Alarm, wenn die durchschnittliche Auslastung des kurzlebigen Speichers auf Service-Ebene 80% übersteigt.  
**Absicht: ** Erkennt eine hohe Auslastung kurzlebigen Speichers.  
**PromQL-Kriterien: ** `avg({__name__="TaskEphemeralStorageUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="{{your-cluster-name}}",ServiceName="{{your-service-name}}"}) > 80`  
**Empfohlener Schwellenwert: ** 80 (eingebettet in die Abfrage)  
**Begründung des Schwellenwerts: ** Bei 80% besteht Spielraum vor der Sättigung.  
**Bewertungsintervall: 60 **  
**Wartezeit: ** 300  
**Erholungsphase: ** 300

## Amazon EFS
<a name="Recommended_PromQL_EFS"></a>

**PercentIOLimit**  
**Etiketten: ** FileSystemId  
**Beschreibung des ** Alarms: Alarm, wenn ein EFS-Dateisystem 100% seines I/O Grenzwerts erreicht.  
**Absicht: ** Erkennt, wenn das Dateisystem das Limit erreicht I/O .  
**PromQL-Kriterien: ** `avg({__name__="PercentIOLimit", "@instrumentation.@name"="cloudwatch.aws/efs", FileSystemId="{{your-filesystem-id}}"}) >= 100`  
**Empfohlener Schwellenwert: ** 100 (eingebettet in die Abfrage)  
**Begründung des Schwellenwerts: ** Bei einem Wert von 100% wird das Dateisystem zu einem Engpass.  
**Bewertungsintervall: 60 **  
**Wartezeit: ** 900  
**Erholungsphase: ** 900

**BurstCreditBalance**  
**Beschriftungen: ** FileSystemId  
**Alarmbeschreibung: ** Alarm, wenn das Burst-Guthaben für ein EFS-Dateisystem auf Null fällt.  
**Absicht: ** Erkennt aufgebrauchte Burst-Credits, die zu einer Verlangsamung des Durchsatzes führen.  
**PromQL-Kriterien: ** `avg({__name__="BurstCreditBalance", "@instrumentation.@name"="cloudwatch.aws/efs", FileSystemId="{{your-filesystem-id}}"}) <= 0`  
**Empfohlener Schwellenwert: ** 0 (eingebettet in die Abfrage)  
**Begründung für den Schwellenwert: ** Null Credits führen zu einem verringerten Durchsatz.  
**Bewertungsintervall: ** 60  
**Wartezeit: ** 900  
**Erholungsphase: ** 900

## Amazon EKS Container Insights
<a name="Recommended_PromQL_EKS"></a>

**node\_cpu\_utilization**  
**Beschriftungen: ** ClusterName  
**Alarmbeschreibung: ** Alarm, wenn die maximale CPU-Auslastung auf EKS-Worker-Knoten 80% überschreitet.  
**Absicht: ** Erkennt eine hohe CPU-Auslastung auf Worker-Knoten.  
**PromQL-Kriterien: ** `max({__name__="node_cpu_utilization", "@instrumentation.@name"="cloudwatch.aws/eks-containerinsights", ClusterName="{{your-cluster-name}}"}) > 80`  
**Empfohlener Schwellenwert: ** 80 (eingebettet in die Abfrage)  
**Begründung des Schwellenwerts: ** Bei 80% besteht Spielraum vor der Sättigung.  
**Bewertungsintervall: 60 **  
**Wartezeit: ** 300  
**Erholungsphase: ** 300

**node\_filesystem\_utilization**  
**Etiketten: ** ClusterName  
**Alarmbeschreibung: ** Alarm, wenn die maximale Dateisystemauslastung den Schwellenwert auf EKS-Worker-Knoten überschreitet.  
**Absicht: ** Erkennt eine hohe Dateisystemauslastung auf Worker-Knoten.  
**PromQL-Kriterien: ** `max({__name__="node_filesystem_utilization", "@instrumentation.@name"="cloudwatch.aws/eks-containerinsights", ClusterName="{{your-cluster-name}}"}) > {{THRESHOLD}}`  
**Empfohlener Schwellenwert: ** {{THRESHOLD}} (in die Abfrage eingebettet)  
**Begründung des Schwellenwerts: ** Dieser Wert wird auf der Grundlage der Speicherkapazität und der Nutzungsmuster Ihres Knotens festgelegt.  
**Bewertungsintervall: ** 60  
**Wartezeit: ** 300  
**Erholungsphase: ** 300

**node\_memory\_utilization**  
**Etiketten: ** ClusterName  
**Alarmbeschreibung: ** Alarm, wenn die maximale Speicherauslastung auf EKS-Worker-Knoten 80% überschreitet.  
**Absicht: ** Erkennen Sie einen hohen Speicherbedarf auf Worker-Knoten.  
**PromQL-Kriterien: ** `max({__name__="node_memory_utilization", "@instrumentation.@name"="cloudwatch.aws/eks-containerinsights", ClusterName="{{your-cluster-name}}"}) > 80`  
**Empfohlener Schwellenwert: ** 80 (eingebettet in die Abfrage)  
**Begründung des Schwellenwerts: ** Bei 80% besteht Spielraum vor der Sättigung.  
**Bewertungsintervall: 60 **  
**Wartezeit: ** 300  
**Erholungsphase: ** 300

**pod\_cpu\_utilization\_over\_pod\_limit**  
**Beschriftungen: **ClusterName, Namespace, Dienst  
**Beschreibung des Alarms: ** Alarm, wenn die CPU-Auslastung des Pods 80% des Grenzwerts überschreitet.  
**Absicht: ** Erkennt Pods, die sich den CPU-Grenzwerten nähern.  
**PromQL-Kriterien: ** `max({__name__="pod_cpu_utilization_over_pod_limit", "@instrumentation.@name"="cloudwatch.aws/eks-containerinsights", ClusterName="{{your-cluster-name}}",Namespace="{{your-namespace}}",Service="{{your-service}}"}) > 80`  
**Empfohlener Schwellenwert: ** 80 (eingebettet in die Abfrage)  
**Begründung des Schwellenwerts: ** 80% geben Spielraum, bevor eine Drosselung erfolgt.  
**Bewertungsintervall: 60 **  
**Wartezeit: ** 300  
**Erholungsphase: ** 300

**pod\_memory\_utilization\_over\_pod\_limit**  
**Beschriftungen: **ClusterName, Namespace, Dienst  
**Beschreibung des Alarms: ** Alarm, wenn die Speicherauslastung des Pods 80% des Grenzwerts überschreitet.  
**Absicht: ** Erkennt Pods, die sich der Speicherbegrenzung nähern.  
**PromQL-Kriterien: ** `max({__name__="pod_memory_utilization_over_pod_limit", "@instrumentation.@name"="cloudwatch.aws/eks-containerinsights", ClusterName="{{your-cluster-name}}",Namespace="{{your-namespace}}",Service="{{your-service}}"}) > 80`  
**Empfohlener Schwellenwert: ** 80 (eingebettet in die Abfrage)  
**Begründung des Schwellenwerts: ** 80% geben Spielraum, bevor OomKill auftritt.  
**Bewertungsintervall: 60 **  
**Wartezeit: ** 300  
**Erholungsphase: ** 300

## Amazon ElastiCache
<a name="Recommended_PromQL_ElastiCache"></a>

**CPUUtilization**  
**Etiketten: **CacheClusterId, CacheNodeId  
**Beschreibung des ** Alarms: Alarm, wenn die durchschnittliche CPU-Auslastung den Schwellenwert für einen ElastiCache Knoten überschreitet.  
**Absicht: ** Erkennt eine hohe CPU-Auslastung in der gesamten Instanz.  
**PromQL-Kriterien: ** `avg({__name__="CPUUtilization", "@instrumentation.@name"="cloudwatch.aws/elasticache", CacheClusterId="{{your-cache-cluster-id}}",CacheNodeId="{{your-cache-node-id}}"}) > {{THRESHOLD}}`  
**Empfohlener Schwellenwert: ** {{THRESHOLD}} (in die Abfrage eingebettet)  
**Begründung des Schwellenwerts: Dieser ** Wert wird auf der Grundlage Ihres Knotentyps und Ihrer Workload-Merkmale festgelegt.  
**Bewertungsintervall: ** 60  
**Wartezeit: ** 300  
**Erholungsphase: ** 300

**CurrConnections**  
**Etiketten: **CacheClusterId, CacheNodeId  
**Beschreibung des ** Alarms: Alarm, wenn die Anzahl der Verbindungen den Schwellenwert für einen ElastiCache Knoten überschreitet.  
**Absicht: ** Erkennt hohe Verbindungszahlen.  
**PromQL-Kriterien: ** `avg({__name__="CurrConnections", "@instrumentation.@name"="cloudwatch.aws/elasticache", CacheClusterId="{{your-cache-cluster-id}}",CacheNodeId="{{your-cache-node-id}}"}) > {{THRESHOLD}}`  
**Empfohlener Schwellenwert: ** {{THRESHOLD}} (in die Abfrage eingebettet)  
**Begründung des Schwellenwerts: ** Dieser Wert wird auf der Grundlage Ihrer erwarteten Größe des Verbindungspools und der Anwendungsanforderungen festgelegt.  
**Bewertungsintervall: ** 60  
**Wartezeit: ** 600  
**Erholungsphase: ** 600

**DatabaseMemoryUsagePercentage**  
**Beschriftungen: ** CacheClusterId  
**Beschreibung des ** Alarms: Alarm, wenn die Nutzung des Datenbankspeichers den Schwellenwert für einen ElastiCache Cluster überschreitet.  
**Absicht: ** Ermitteln Sie eine hohe Speicherauslastung, um Schreibfehler zu vermeiden.  
**PromQL-Kriterien: ** `avg({__name__="DatabaseMemoryUsagePercentage", "@instrumentation.@name"="cloudwatch.aws/elasticache", CacheClusterId="{{your-cache-cluster-id}}"}) > {{THRESHOLD}}`  
**Empfohlener Schwellenwert: ** {{THRESHOLD}} (in die Abfrage eingebettet)  
**Begründung des Schwellenwerts: ** Dieser Wert wird auf der Grundlage Ihrer Räumungsrichtlinien und der Wichtigkeit Ihrer Daten festgelegt.  
**Bewertungsintervall: 60 **  
**Wartezeit: ** 300  
**Erholungsphase: ** 300

**EngineCPUUtilization**  
**Etiketten: ** CacheClusterId  
**Beschreibung des ** Alarms: Alarm, wenn die CPU-Auslastung der Redis-Engine für einen ElastiCache Cluster 90% übersteigt.  
**Absicht: ** Erkennt eine hohe CPU-Auslastung der Redis-Engine.  
**PromQL-Kriterien: ** `avg({__name__="EngineCPUUtilization", "@instrumentation.@name"="cloudwatch.aws/elasticache", CacheClusterId="{{your-cache-cluster-id}}"}) > 90`  
**Empfohlener Schwellenwert: ** 90 (eingebettet in die Abfrage)  
**Begründung des Schwellenwerts: ** Redis arbeitet mit einem Thread-System. Ein Wert von über 90% weist auf eine Sättigung hin.  
**Bewertungsintervall: 60 **  
**Wartezeit: ** 300  
**Erholungsphase: ** 300

**ReplicationLag**  
**Etiketten: ** CacheClusterId  
**Beschreibung des ** Alarms: Alarm, wenn die Replikationsverzögerung den Schwellenwert für einen ElastiCache Cluster überschreitet.  
**Absicht: ** Erkennen Sie Verzögerungen bei der Replikation, die sich auf die Datenkonsistenz auswirken.  
**PromQL-Kriterien: ** `avg({__name__="ReplicationLag", "@instrumentation.@name"="cloudwatch.aws/elasticache", CacheClusterId="{{your-cache-cluster-id}}"}) > {{THRESHOLD}}`  
**Empfohlener Schwellenwert: ** {{THRESHOLD}} (in die Abfrage eingebettet)  
**Begründung des Schwellenwerts: ** Dieser Wert wird auf der Grundlage der Toleranz Ihrer Anwendung für veraltete Lesevorgänge festgelegt.  
**Bewertungsintervall: 60 **  
**Wartezeit: ** 900  
**Erholungsphase: ** 900

## Elastic GPUs
<a name="Recommended_PromQL_ElasticGPUs"></a>

**GPUConnectivityCheckFailed**  
**Beschriftungen: **InstanceId, egPUID  
**Alarmbeschreibung: ** Alarm, wenn der Elastic Graphics-Beschleuniger die Konnektivität zur Instance verliert.  
**Absicht: ** Erkennt Verbindungsprobleme mit dem Elastic Graphics Accelerator.  
**PromQL-Kriterien: ** `max({__name__="GPUConnectivityCheckFailed", "@instrumentation.@name"="cloudwatch.aws/elasticgpus", InstanceId="{{your-instance-id}}",EGPUId="{{your-egpu-id}}"}) > 0`  
**Empfohlener Schwellenwert: ** 0 (eingebettet in die Abfrage)  
**Begründung des Schwellenwerts: ** Jeder Verbindungsfehler muss untersucht werden.  
**Bewertungsintervall: ** 300  
**Wartezeit: ** 900  
**Erholungsphase: ** 900

**GPUHealthCheckFailed**  
**Beschriftungen: **InstanceId, egPUID  
**Beschreibung des Alarms: ** Alarm, wenn eine Integritätsprüfung des Elastic Graphics-Beschleunigers fehlschlägt.  
**Absicht: ** Erkennt einen fehlerhaften Elastic Graphics Accelerator.  
**PromQL-Kriterien: ** `max({__name__="GPUHealthCheckFailed", "@instrumentation.@name"="cloudwatch.aws/elasticgpus", InstanceId="{{your-instance-id}}",EGPUId="{{your-egpu-id}}"}) > 0`  
**Empfohlener Schwellenwert: ** 0 (eingebettet in die Abfrage)  
**Begründung des Schwellenwerts: ** Fehlgeschlagene Integritätsprüfungen deuten auf Probleme mit dem Gaspedal hin.  
**Bewertungsintervall: ** 300  
**Wartezeit: ** 900  
**Erholungsphase: ** 900

## Amazon EventBridge Scheduler
<a name="Recommended_PromQL_Scheduler"></a>

**TargetErrorThrottledCount**  
**Beschreibung des Alarms: ** Alarm, wenn die Aufrufe von Zeitplanzielen gedrosselt werden.  
**Absicht: ** Erkennt eine Zieldrosselung, die zu Zeitplanverzögerungen führt.  
**PromQL-Kriterien: ** `sum({__name__="TargetErrorThrottledCount", "@instrumentation.@name"="cloudwatch.aws/scheduler"}) > 0`  
**Empfohlener Schwellenwert: ** 0 (eingebettet in die Abfrage)  
**Begründung des Schwellenwerts: ** Jede Drosselung deutet auf Probleme mit der Zielkapazität hin.  
**Bewertungsintervall: 60 **  
**Wartezeit: ** 900  
**Erholungsphase: ** 900

**InvocationThrottleCount**  
**Alarmbeschreibung: ** Alarm, wenn Scheduler-Aufrufe gedrosselt werden.  
**Absicht: ** Erkennt die Drosselung des Scheduler-Aufrufs.  
**PromQL-Kriterien: ** `sum({__name__="InvocationThrottleCount", "@instrumentation.@name"="cloudwatch.aws/scheduler"}) > 0`  
**Empfohlener Schwellenwert: ** 0 (eingebettet in die Abfrage)  
**Begründung des Schwellenwerts: ** Die Drosselung verzögert geplante Ausführungen.  
**Bewertungsintervall: 60 **  
**Wartezeit: ** 900  
**Erholungsphase: ** 900

**InvocationDroppedCount**  
**Beschreibung des ** Alarms: Alarm, wenn geplante Aufrufe unterbrochen werden.  
**Absicht: ** Erkennt unterbrochene Aufrufe.  
**PromQL-Kriterien: ** `sum({__name__="InvocationDroppedCount", "@instrumentation.@name"="cloudwatch.aws/scheduler"}) > 0`  
**Empfohlener Schwellenwert: ** 0 (eingebettet in die Abfrage)  
**Rechtfertigung des Schwellenwerts: ** Verworfene Aufrufe stehen für verloren gegangene geplante Ereignisse.  
**Bewertungsintervall: 60 **  
**Wartezeit: ** 60  
**Erholungsphase: ** 60

**InvocationsFailedToBeSentToDeadLetterCount**  
**Beschreibung des ** Alarms: Alarm, wenn fehlgeschlagene Aufrufe nicht an die Warteschlange gesendet werden können.  
**Absicht: ** Erkennung von DLQ-Zustellungsfehlern.  
**PromQL-Kriterien: ** `sum({__name__="InvocationsFailedToBeSentToDeadLetterCount", "@instrumentation.@name"="cloudwatch.aws/scheduler"}) > 0`  
**Empfohlener Schwellenwert: ** 0 (eingebettet in die Abfrage)  
**Rechtfertigung des Schwellenwerts: Eine ** fehlgeschlagene DLQ-Lieferung bedeutet, dass Fehlerinformationen verloren gegangen sind.  
**Bewertungsintervall: 60 **  
**Wartezeit: ** 900  
**Erholungsphase: ** 900

## Amazon Kinesis Data Streams
<a name="Recommended_PromQL_Kinesis"></a>

**GetRecords.IteratorAgeMilliseconds**  
**Beschriftungen: ** StreamName  
**Beschreibung des Alarms: ** Alarm, wenn das Alter des Consumer-Iterators den Schwellenwert für einen Kinesis-Stream überschreitet.  
**Absicht: ** Erkennung von Daten, deren Aufbewahrungszeitraum überschritten wird, wodurch das Risiko eines Datenverlusts besteht.  
**PromQL-Kriterien: ** `max({__name__="GetRecords.IteratorAgeMilliseconds", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="{{your-stream-name}}"}) > {{THRESHOLD}}`  
**Empfohlener Schwellenwert: ** {{THRESHOLD}} (in die Abfrage eingebettet)  
**Begründung des Schwellenwerts: Wird auf der Grundlage des Prozentsatzes der Stream-Aufbewahrungsdauer ** festgelegt.  
**Bewertungsintervall: ** 60  
**Wartezeit: ** 900  
**Erholungsphase: ** 900

**GetRecords.Success**  
**Beschriftungen: ** StreamName  
**Beschreibung des ** Alarms: Alarm, wenn die GetRecords Erfolgsrate unter den Schwellenwert für einen Kinesis-Stream fällt.  
**Absicht: ** Erkennung von Fehlern beim Abrufen durch Verbraucher.  
**PromQL-Kriterien: ** `avg({__name__="GetRecords.Success", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="{{your-stream-name}}"}) < {{THRESHOLD}}`  
**Empfohlener Schwellenwert: ** {{THRESHOLD}} (in die Abfrage eingebettet)  
**Begründung des Schwellenwerts: ** Wird auf der Grundlage der erwarteten Erfolgsquote festgelegt.  
**Bewertungsintervall: ** 60  
**Wartezeit: ** 300  
**Erholungsphase: ** 300

**PutRecord.Success**  
**Etiketten: ** StreamName  
**Beschreibung des ** Alarms: Alarm, wenn die PutRecord Erfolgsrate unter den Schwellenwert für einen Kinesis-Stream fällt.  
**Absicht: ** Erkennt Fehler bei der Aufnahme durch den Producer.  
**PromQL-Kriterien: ** `avg({__name__="PutRecord.Success", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="{{your-stream-name}}"}) < {{THRESHOLD}}`  
**Empfohlener Schwellenwert: ** {{THRESHOLD}} (in die Abfrage eingebettet)  
**Begründung des Schwellenwerts: ** Wird auf der Grundlage der erwarteten Erfolgsquote festgelegt.  
**Bewertungsintervall: ** 60  
**Wartezeit: ** 300  
**Erholungsphase: ** 300

**PutRecords.FailedRecords**  
**Etiketten: ** StreamName  
**Alarmbeschreibung: ** Alarm, wenn Batch-Put-Operationen zu fehlgeschlagenen Datensätzen für einen Kinesis-Stream führen.  
**Absicht: ** Erkennung von Batch-Put-Fehlern.  
**PromQL-Kriterien: ** `sum({__name__="PutRecords.FailedRecords", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="{{your-stream-name}}"}) > {{THRESHOLD}}`  
**Empfohlener Schwellenwert: ** {{THRESHOLD}} (in die Abfrage eingebettet)  
**Begründung des Schwellenwerts: ** Wird auf der Grundlage der akzeptablen Fehleranzahl festgelegt.  
**Bewertungsintervall: ** 60  
**Wartezeit: ** 300  
**Erholungsphase: ** 300

**ReadProvisionedThroughputExceeded**  
**Etiketten: ** StreamName  
**Beschreibung des Alarms: ** Alarm, wenn die Lesevorgänge des Verbrauchers den bereitgestellten Durchsatz für einen Kinesis-Stream überschreiten.  
**Absicht: ** Erkennt eine Drosselung der Lesevorgänge durch Verbraucher.  
**PromQL-Kriterien: ** `avg({__name__="ReadProvisionedThroughputExceeded", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="{{your-stream-name}}"}) > {{THRESHOLD}}`  
**Empfohlener Schwellenwert: ** {{THRESHOLD}} (in die Abfrage eingebettet)  
**Begründung des Schwellenwerts: ** Jede anhaltende Drosselung weist auf einen Kapazitätsbedarf hin.  
**Bewertungsintervall: 60 **  
**Wartezeit: ** 300  
**Erholungsphase: ** 300

**SubscribeToShardEvent.MillisBehindLatest**  
**Etiketten: **StreamName, ConsumerName  
**Beschreibung des Alarms: ** Alarm, wenn ein Verbraucher mit verstärktem Fan-Out hinter den letzten Rekord zurückfällt.  
**Absicht: Es wird eine Verzögerung bei der Verarbeitung durch Verbraucher mit verstärktem Fan-Out ** erkannt.  
**PromQL-Kriterien: ** `avg({__name__="SubscribeToShardEvent.MillisBehindLatest", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="{{your-stream-name}}",ConsumerName="{{your-consumer-name}}"}) > {{THRESHOLD}}`  
**Empfohlener Schwellenwert: ** {{THRESHOLD}} (in die Abfrage eingebettet)  
**Begründung des Schwellenwerts: Wird auf der Grundlage einer akzeptablen Verarbeitungsverzögerung ** festgelegt.  
**Bewertungsintervall: ** 60  
**Wartezeit: ** 300  
**Erholungsphase: ** 300

**WriteProvisionedThroughputExceeded**  
**Etiketten: ** StreamName  
**Beschreibung des Alarms: ** Alarm, wenn Producer-Schreibvorgänge den bereitgestellten Durchsatz für einen Kinesis-Stream überschreiten.  
**Absicht: ** Erkennt die Drosselung beim Schreiben durch den Producer.  
**PromQL-Kriterien: ** `avg({__name__="WriteProvisionedThroughputExceeded", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="{{your-stream-name}}"}) > {{THRESHOLD}}`  
**Empfohlener Schwellenwert: ** {{THRESHOLD}} (in die Abfrage eingebettet)  
**Begründung des Schwellenwerts: Eine ** anhaltende Drosselung weist auf einen Kapazitätsbedarf hin.  
**Bewertungsintervall: 60 **  
**Wartezeit: ** 300  
**Erholungsphase: ** 300

## AWS Lambda
<a name="Recommended_PromQL_Lambda"></a>

**ClaimedAccountConcurrency**  
**Beschreibung des ** Alarms: Alarm, wenn die Anzahl der beanspruchten Konten den Schwellenwert überschreitet.  
**Absicht: ** Erkennt ein Konto, das sich dem Kontingent an Parallelität nähert.  
**PromQL-Kriterien: ** `max({__name__="ClaimedAccountConcurrency", "@instrumentation.@name"="cloudwatch.aws/lambda"}) > {{THRESHOLD}}`  
**Empfohlener Schwellenwert: ** {{THRESHOLD}} (in die Abfrage eingebettet)  
**Begründung des Schwellenwerts: ** Auf den Prozentsatz des regionalen Grenzwerts für Parallelität festgelegt.  
**Bewertungsintervall: 60 **  
**Wartezeit: ** 600  
**Erholungsphase: ** 600

**Fehler**  
**Beschriftungen: ** FunctionName  
**Alarmbeschreibung: ** Alarm, wenn die Anzahl der Funktionsfehler den Schwellenwert für eine Lambda-Funktion überschreitet.  
**Absicht: ** Erkennt eine hohe Anzahl von Funktionsfehlern.  
**PromQL-Kriterien: ** `sum({__name__="Errors", "@instrumentation.@name"="cloudwatch.aws/lambda", FunctionName="{{your-function-name}}"}) > {{THRESHOLD}}`  
**Empfohlener Schwellenwert: ** {{THRESHOLD}} (in die Abfrage eingebettet)  
**Begründung des Schwellenwerts: Wird auf der Grundlage des akzeptablen Fehlervolumens ** festgelegt.  
**Bewertungsintervall: ** 60  
**Wartezeit: ** 180  
**Erholungszeit: ** 300

**Drosselungen**  
**Etiketten: ** FunctionName  
**Alarmbeschreibung: ** Alarm, wenn Funktionsaufrufe für eine Lambda-Funktion gedrosselt werden.  
**Absicht: ** Erkennt die Drosselung des Funktionsaufrufs.  
**PromQL-Kriterien: ** `sum({__name__="Throttles", "@instrumentation.@name"="cloudwatch.aws/lambda", FunctionName="{{your-function-name}}"}) > {{THRESHOLD}}`  
**Empfohlener Schwellenwert: ** {{THRESHOLD}} (in die Abfrage eingebettet)  
**Begründung des Schwellenwerts: ** Die Drosselung zeigt an, dass das Parallelitätslimit erreicht wurde.  
**Bewertungsintervall: 60 **  
**Wartezeit: ** 300  
**Erholungsphase: ** 300

**Duration (Dauer)**  
**Etiketten: ** FunctionName  
**Alarmbeschreibung: ** Alarm, wenn die Dauer der p90-Funktion den Schwellenwert für eine Lambda-Funktion überschreitet.  
**Absicht: ** Erkennung lang andauernder Funktionsaufrufe.  
**PromQL-Kriterien: ** `histogram_quantile(0.9, {__name__="Duration", "@instrumentation.@name"="cloudwatch.aws/lambda", FunctionName="{{your-function-name}}"}) > {{THRESHOLD}}`  
**Empfohlener Schwellenwert: ** {{THRESHOLD}} (in die Abfrage eingebettet)  
**Begründung des Schwellenwerts: ** Wird relativ zum Funktions-Timeout festgelegt.  
**Bewertungsintervall: 60 **  
**Wartezeit: ** 900  
**Erholungsphase: ** 900

**ConcurrentExecutions**  
**Beschriftungen: ** FunctionName  
**Alarmbeschreibung: ** Alarm, wenn gleichzeitige Ausführungen den Schwellenwert für eine Lambda-Funktion überschreiten.  
**Absicht: ** Erkennt eine Funktion, die sich den Grenzwerten für die Parallelität nähert.  
**PromQL-Kriterien: ** `max({__name__="ConcurrentExecutions", "@instrumentation.@name"="cloudwatch.aws/lambda", FunctionName="{{your-function-name}}"}) > {{THRESHOLD}}`  
**Empfohlener Schwellenwert: ** {{THRESHOLD}} (in die Abfrage eingebettet)  
**Begründung des Schwellenwerts: ** Auf den Prozentsatz der reservierten Parallelität festgelegt.  
**Bewertungsintervall: 60 **  
**Wartezeit: ** 600  
**Erholungsphase: ** 600

## AWS Lambda Insights
<a name="Recommended_PromQL_LambdaInsights"></a>

**memory\_utilization**  
**Beschriftungen: ** Funktionsname  
**Alarmbeschreibung: ** Alarm, wenn die durchschnittliche Speicherauslastung für eine Lambda-Funktion 90% übersteigt.  
**Absicht: ** Erkennt die Funktion, die sich dem konfigurierten Speicherlimit nähert.  
**PromQL-Kriterien: ** `avg({__name__="memory_utilization", "@instrumentation.@name"="cloudwatch.aws/lambda-insights", function_name="{{your-function-name}}"}) > 90`  
**Empfohlener Schwellenwert: ** 90 (eingebettet in die Abfrage)  
**Begründung des Schwellenwerts: Bei ** über 90% besteht das Risiko, dass nicht genügend Arbeitsspeicher zur Verfügung steht.  
**Bewertungsintervall: 60 **  
**Wartezeit: ** 600  
**Erholungsphase: ** 600

## NAT-Gateway
<a name="Recommended_PromQL_NATGateway"></a>

**ErrorPortAllocation**  
**Beschriftungen: ** NatGatewayId  
**Beschreibung des ** Alarms: Alarm, wenn das NAT-Gateway keinen Port für neue Verbindungen zuweisen kann.  
**Absicht: ** Erkennt Fehler bei der Portzuweisung und verhindert so, dass neue Verbindungen hergestellt werden.  
**PromQL-Kriterien: ** `sum({__name__="ErrorPortAllocation", "@instrumentation.@name"="cloudwatch.aws/natgateway", NatGatewayId="{{your-nat-gateway-id}}"}) > 0`  
**Empfohlener Schwellenwert: ** 0 (eingebettet in die Abfrage)  
**Begründung des Schwellenwerts: ** Jeder Fehler bei der Zuweisung wirkt sich auf die Konnektivität aus.  
**Bewertungsintervall: ** 60  
**Wartezeit: ** 900  
**Erholungsphase: ** 900

**PacketsDropCount**  
**Beschriftungen: ** NatGatewayId  
**Alarmbeschreibung: ** Alarm, wenn das NAT-Gateway Pakete verwirft, die den Schwellenwert überschreiten.  
**Absicht: ** Erkennt Paketverluste, die auf Kapazitäts- oder Verbindungsprobleme hinweisen.  
**PromQL-Kriterien: ** `sum({__name__="PacketsDropCount", "@instrumentation.@name"="cloudwatch.aws/natgateway", NatGatewayId="{{your-nat-gateway-id}}"}) > {{THRESHOLD}}`  
**Empfohlener Schwellenwert: ** {{THRESHOLD}} (in die Abfrage eingebettet)  
**Begründung des Schwellenwerts: Wird auf der Grundlage einer akzeptablen Drop-Rate ** festgelegt.  
**Bewertungsintervall: ** 60  
**Wartezeit: ** 300  
**Erholungsphase: ** 300

## AWS PrivateLink Endpunkte
<a name="Recommended_PromQL_PrivateLinkEndpoints"></a>

**PacketsDropped**  
**Beschriftungen: **VpcId, VpcEndpointId, EndpointType, SubnetId ServiceName  
**Alarmbeschreibung: ** Alarm, wenn ein VPC-Endpunkt Pakete verwirft, die den Schwellenwert überschreiten.  
**Absicht: ** Erkennt einen fehlerhaften Endpunkt oder Endpunktdienst.  
**PromQL-Kriterien: ** `sum({__name__="PacketsDropped", "@instrumentation.@name"="cloudwatch.aws/privatelinkendpoints", VpcId="{{your-vpc-id}}",VpcEndpointId="{{your-vpc-endpoint-id}}",EndpointType="{{your-endpoint-type}}",SubnetId="{{your-subnet-id}}",ServiceName="{{your-service-name}}"}) > {{THRESHOLD}}`  
**Empfohlener Schwellenwert: ** {{THRESHOLD}} (in die Abfrage eingebettet)  
**Begründung des Schwellenwerts: Wird auf der Grundlage einer akzeptablen Drop-Rate ** festgelegt.  
**Bewertungsintervall: ** 60  
**Wartezeit: ** 300  
**Erholungsphase: ** 300

## AWS PrivateLink dienstleistungen
<a name="Recommended_PromQL_PrivateLinkServices"></a>

**RstPacketsSent**  
**Etiketten: ** ServiceId LoadBalancerArn, Az  
**Alarmbeschreibung: ** Alarm, wenn die RST-Paketrate den Schwellenwert für einen Endpunktdienst überschreitet.  
**Absicht: ** Erkennung fehlerhafter Ziele des Endpunktdienstes.  
**PromQL-Kriterien: ** `sum({__name__="RstPacketsSent", "@instrumentation.@name"="cloudwatch.aws/privatelinkservices", ServiceId="SVC",LoadBalancerArn="LB",Az="AZ"}) > {{THRESHOLD}}`  
**Empfohlener Schwellenwert: ** {{THRESHOLD}} (in die Abfrage eingebettet)  
**Rechtfertigung des Schwellenwerts: ** Wird auf der Grundlage einer akzeptablen RST-Paketrate festgelegt.  
**Bewertungsintervall: 60 **  
**Wartezeit: ** 300  
**Erholungsphase: ** 300

## RDS
<a name="Recommended_PromQL_RDS"></a>

**CPUUtilization**  
**Etiketten: ** DBInstanceIdentifier  
**Alarmbeschreibung: ** Alarm, wenn die durchschnittliche CPU-Auslastung für eine RDS-Instance 90% übersteigt.  
**Absicht: ** Erkennt eine hohe CPU-Auslastung und verhindert so Leistungseinbußen.  
**PromQL-Kriterien: ** `avg({__name__="CPUUtilization", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > 90`  
**Empfohlener Schwellenwert: ** 90 (eingebettet in die Abfrage)  
**Begründung des Schwellenwerts: ** 90% bedeuten, dass die Sättigung fast erreicht ist.  
**Bewertungsintervall: ** 60  
**Wartezeit: ** 300  
**Erholungsphase: ** 300

**DatabaseConnections**  
**Etiketten: ** DBInstanceIdentifier  
**Beschreibung des ** Alarms: Alarm, wenn Datenbankverbindungen den Schwellenwert für eine RDS-Instance überschreiten.  
**Absicht: Abgelehnte Verbindungen bis zum Höchstwert ** verhindern.  
**PromQL-Kriterien: ** `avg({__name__="DatabaseConnections", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > {{THRESHOLD}}`  
**Empfohlener Schwellenwert: ** {{THRESHOLD}} (in die Abfrage eingebettet)  
**Begründung des Schwellenwerts: ** Auf den Prozentsatz des Parameters max\_connections gesetzt.  
**Bewertungsintervall: 60 **  
**Wartezeit: ** 300  
**Erholungsphase: ** 300

**EBSByteBalance%**  
**Etiketten: ** DBInstanceIdentifier  
**Beschreibung des Alarms: ** Alarm, wenn das EBS-Byteguthaben für eine RDS-Instance unter 10% fällt.  
**Absicht: ** Erkennung von Gutschriften mit niedrigem Durchsatz, die zu Engpässen führen.  
**PromQL-Kriterien: ** `avg({__name__="EBSByteBalance%", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) < 10`  
**Empfohlener Schwellenwert: ** 10 (eingebettet in die Abfrage)  
**Begründung des Schwellenwerts: Bei einem ** Wert unter 10% besteht die Gefahr einer Verschlechterung des Durchsatzes.  
**Bewertungsintervall: ** 60  
**Wartezeit: ** 180  
**Erholungszeit: ** 180

**EBSIOBalance%**  
**Etiketten: ** DBInstanceIdentifier  
**Beschreibung des Alarms: ** Alarm, wenn die EBS-I/O-Balance für eine RDS-Instance unter 10% fällt.  
**Absicht: ** Erkennen Sie niedrige IOPS-Credits, die zu Engpässen führen.  
**PromQL-Kriterien: ** `avg({__name__="EBSIOBalance%", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) < 10`  
**Empfohlener Schwellenwert: ** 10 (eingebettet in die Abfrage)  
**Begründung des Schwellenwerts: Bei einem ** Wert unter 10% besteht die Gefahr einer Verschlechterung der IOPS.  
**Bewertungsintervall: 60 **  
**Wartezeit: ** 180  
**Erholungszeit: ** 180

**FreeableMemory**  
**Etiketten: ** DBInstanceIdentifier  
**Beschreibung des ** Alarms: Alarm, wenn der freigebbare Speicher unter den Schwellenwert für eine RDS-Instance fällt.  
**Absicht: ** Verhindern Sie, dass aufgrund von Speichermangel Verbindungen abgewiesen werden.  
**PromQL-Kriterien: ** `avg({__name__="FreeableMemory", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) < {{THRESHOLD}}`  
**Empfohlener Schwellenwert: ** {{THRESHOLD}} (in die Abfrage eingebettet)  
**Begründung des Schwellenwerts: Wird auf der Grundlage des Speichers der Instanzklasse ** festgelegt.  
**Bewertungsintervall: ** 60  
**Wartezeit: ** 900  
**Erholungsphase: ** 900

**FreeLocalStorage**  
**Beschriftungen: ** DBInstanceIdentifier  
**Beschreibung des ** Alarms: Alarm, wenn der freie lokale Speicher unter den Schwellenwert für eine Aurora-Instance fällt.  
**Absicht: ** Verhindern Sie die Erschöpfung des lokalen Aurora-Speichers.  
**PromQL-Kriterien: ** `avg({__name__="FreeLocalStorage", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) < {{THRESHOLD}}`  
**Empfohlener Schwellenwert: ** {{THRESHOLD}} (in die Abfrage eingebettet)  
**Begründung des Schwellenwerts: Wird auf der Grundlage des Mindestwerts ** festgelegt, der für Operationen erforderlich ist.  
**Bewertungsintervall: ** 60  
**Wartezeit: ** 300  
**Erholungsphase: ** 300

**FreeStorageSpace**  
**Etiketten: ** DBInstanceIdentifier  
**Beschreibung des ** Alarms: Alarm, wenn der freie Speicherplatz unter den Schwellenwert für eine RDS-Instance fällt.  
**Absicht: ** Vermeiden Sie Ausfallzeiten bei vollem Speicher.  
**PromQL-Kriterien: ** `min({__name__="FreeStorageSpace", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) < {{THRESHOLD}}`  
**Empfohlener Schwellenwert: ** {{THRESHOLD}} (in die Abfrage eingebettet)  
**Begründung des Schwellenwerts: Dieser ** Wert wird auf der Grundlage der Wachstumsrate des Speichers und der bereitgestellten Größe festgelegt.  
**Bewertungsintervall: 60 **  
**Wartezeit: ** 300  
**Erholungsphase: ** 300

**MaximumUsedTransactionIDs**  
**Etiketten: ** DBInstanceIdentifier  
**Beschreibung des ** Alarms: Alarm, wenn die maximal verwendeten Transaktions-IDs für eine RDS-Instance 1 Milliarde überschreiten.  
**Absicht: ** Verhindern Sie den Wrapararound der PostgreSQL-Transaktions-IDs.  
**PromQL-Kriterien: ** `avg({__name__="MaximumUsedTransactionIDs", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > 1000000000`  
**Empfohlener Schwellenwert: ** 1000000000 (eingebettet in die Abfrage)  
**Begründung des Schwellenwerts: ** 1 Milliarde deutet darauf hin, dass sich eine Rundumgefahr nähert.  
**Bewertungsintervall: 60 **  
**Wartezeit: ** 60  
**Erholungsphase: ** 60

**ReadLatency**  
**Beschriftungen: ** DBInstanceIdentifier  
**Alarmbeschreibung: ** Alarm, wenn die Leselatenz von p90 den Schwellenwert für eine RDS-Instance überschreitet.  
**Absicht: ** Erkennt eine hohe Leselatenz, die auf Festplattenprobleme hinweist.  
**PromQL-Kriterien: ** `histogram_quantile(0.9, {__name__="ReadLatency", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > {{THRESHOLD}}`  
**Empfohlener Schwellenwert: ** {{THRESHOLD}} (in die Abfrage eingebettet)  
**Begründung des Schwellenwerts: Wird auf der Grundlage einer akzeptablen Anwendungslatenz ** festgelegt.  
**Bewertungsintervall: ** 60  
**Wartezeit: ** 300  
**Erholungsphase: ** 300

**ReplicaLag**  
**Etiketten: ** DBInstanceIdentifier  
**Beschreibung des ** Alarms: Alarm, wenn die Replikationsverzögerung für ein RDS-Read-Replikat 60 Sekunden überschreitet.  
**Absicht: ** Erkennen Sie Verzögerungen bei der Replikation, die zu Datenverlust führen können.  
**PromQL-Kriterien: ** `max({__name__="ReplicaLag", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > 60`  
**Empfohlener Schwellenwert: ** 60 (eingebettet in die Abfrage)  
**Rechtfertigung des Schwellenwerts: ** 60 Sekunden stellen bei den meisten Workloads eine erhebliche Verzögerung dar.  
**Bewertungsintervall: 60 **  
**Wartezeit: ** 600  
**Erholungsphase: ** 600

**WriteLatency**  
**Beschriftungen: ** DBInstanceIdentifier  
**Alarmbeschreibung: ** Alarm, wenn die p90-Schreiblatenz den Schwellenwert für eine RDS-Instance überschreitet.  
**Absicht: ** Erkennt eine hohe Schreiblatenz, die auf Festplattenprobleme hinweist.  
**PromQL-Kriterien: ** `histogram_quantile(0.9, {__name__="WriteLatency", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > {{THRESHOLD}}`  
**Empfohlener Schwellenwert: ** {{THRESHOLD}} (in die Abfrage eingebettet)  
**Begründung des Schwellenwerts: Wird auf der Grundlage einer akzeptablen Anwendungslatenz ** festgelegt.  
**Bewertungsintervall: ** 60  
**Wartezeit: ** 300  
**Erholungsphase: ** 300

**DBLoad**  
**Etiketten: ** DBInstanceIdentifier  
**Alarmbeschreibung: ** Alarm, wenn die durchschnittliche Datenbanklast den Schwellenwert für eine RDS-Instance überschreitet.  
**Absicht: ** Erkennt eine hohe Datenbanklast, die die Leistung beeinträchtigt.  
**PromQL-Kriterien: ** `avg({__name__="DBLoad", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > {{THRESHOLD}}`  
**Empfohlener Schwellenwert: ** {{THRESHOLD}} (in die Abfrage eingebettet)  
**Begründung des Schwellenwerts: ** Auf ein Vielfaches der vCPU-Anzahl festgelegt.  
**Bewertungsintervall: 60 **  
**Wartezeit: ** 900  
**Erholungsphase: ** 900

**AuroraVolumeBytesLeftTotal**  
**Beschriftungen: ** DBClusterIdentifier  
**Alarmbeschreibung: ** Alarm, wenn die verbleibenden Speicherbytes des Aurora-Clusters unter den Schwellenwert fallen.  
**Absicht: ** Verhindern Sie die Erschöpfung des Aurora-Cluster-Speichers.  
**PromQL-Kriterien: ** `avg({__name__="AuroraVolumeBytesLeftTotal", "@instrumentation.@name"="cloudwatch.aws/rds", DBClusterIdentifier="CLUSTER"}) < {{THRESHOLD}}`  
**Empfohlener Schwellenwert: ** {{THRESHOLD}} (in die Abfrage eingebettet)  
**Begründung des Schwellenwerts: ** Wird auf der Grundlage der Wachstumsrate festgelegt.  
**Bewertungsintervall: ** 60  
**Wartezeit: ** 300  
**Erholungsphase: ** 300

**AuroraBinlogReplicaLag**  
**Etiketten: ** DBClusterIdentifier  
**Alarmbeschreibung: ** Alarm, wenn die Verzögerung der Aurora-Binlog-Replikation auf einen Fehlerstatus hinweist.  
**Absicht: Fehler bei der Replikation der Writer-Instance ** erkennen.  
**PromQL-Kriterien: ** `avg({__name__="AuroraBinlogReplicaLag", "@instrumentation.@name"="cloudwatch.aws/rds", DBClusterIdentifier="CLUSTER"}) <= -1`  
**Empfohlener Schwellenwert: ** -1 (eingebettet in die Abfrage)  
**Rechtfertigung des Schwellenwerts: ** -1 gibt den Fehlerstatus an.  
**Bewertungsintervall: ** 60  
**Wartezeit: ** 120  
**Erholungszeitraum: ** 120

**BlockedTransactions**  
**Beschriftungen: ** DBInstanceIdentifier  
**Beschreibung des ** Alarms: Alarm, wenn die Anzahl blockierter Transaktionen den Schwellenwert für eine RDS-Instance überschreitet.  
**Absicht: ** Erkennen Sie Transaktionsblockierungen, die zu Leistungseinbußen führen.  
**PromQL-Kriterien: ** `avg({__name__="BlockedTransactions", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > {{THRESHOLD}}`  
**Empfohlener Schwellenwert: ** {{THRESHOLD}} (in die Abfrage eingebettet)  
**Begründung des Schwellenwerts: Wird auf der Grundlage der akzeptablen Anzahl blockierter Transaktionen ** festgelegt.  
**Bewertungsintervall: ** 60  
**Wartezeit: ** 300  
**Erholungsphase: ** 300

**BufferCacheHitRatio**  
**Etiketten: ** DBInstanceIdentifier  
**Beschreibung des ** Alarms: Alarm, wenn die Trefferquote im Puffercache für eine RDS-Instance unter 80% fällt.  
**Absicht: ** Erkennt eine niedrige Cache-Effizienz, die zu Leistungseinbußen führt.  
**PromQL-Kriterien: ** `avg({__name__="BufferCacheHitRatio", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) < 80`  
**Empfohlener Schwellenwert: ** 80 (eingebettet in die Abfrage)  
**Begründung des Schwellenwerts: Ein ** Wert unter 80% weist auf zu viel Speicherplatz hin I/O.  
**Bewertungsintervall: ** 60  
**Wartezeit: ** 600  
**Erholungsphase: ** 600

**EngineUptime**  
**Beschriftungen: ** DBClusterIdentifier  
**Beschreibung des Alarms: ** Alarm, wenn die Betriebszeit des Motors auf Null fällt, was auf einen Neustart des Aurora-Schreibers hindeutet.  
**Absicht: ** Erkennt Ausfallzeiten oder Abstürze der Aurora-Writer-Instanz.  
**PromQL-Kriterien: ** `avg({__name__="EngineUptime", "@instrumentation.@name"="cloudwatch.aws/rds", DBClusterIdentifier="CLUSTER"}) <= 0`  
**Empfohlener Schwellenwert: ** 0 (eingebettet in die Abfrage)  
**Rechtfertigung des Schwellenwerts: ** Eine Verfügbarkeit von Null bedeutet einen Neustart der Instanz.  
**Bewertungsintervall: 60 **  
**Wartezeit: ** 120  
**Erholungszeitraum: ** 120

**RollbackSegmentHistoryListLength**  
**Beschriftungen: ** DBInstanceIdentifier  
**Alarmbeschreibung: ** Alarm, wenn die Länge der Liste des Rollback-Segmentverlaufs für eine Aurora-Instance 1 Million überschreitet.  
**Absicht: ** Erkennt einen hohen Rollback-Verlauf, der zu einer Verschlechterung der CPU-Leistung führt.  
**PromQL-Kriterien: ** `avg({__name__="RollbackSegmentHistoryListLength", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > 1000000`  
**Empfohlener Schwellenwert: ** 1000000 (eingebettet in die Abfrage)  
**Begründung für den Schwellenwert: Ein ** Wert über 1 Mio. führt zu Leistungsproblemen.  
**Bewertungsintervall: ** 60  
**Wartezeit: ** 300  
**Erholungsphase: ** 300

**StorageNetworkThroughput**  
**Etiketten: ** DBClusterIdentifier  
**Beschreibung des Alarms: ** Alarm, wenn der Durchsatz im Speichernetzwerk den Schwellenwert für einen Aurora-Cluster überschreitet.  
**Absicht: ** Erkennen Sie einen hohen Durchsatz, bei dem das Risiko eines Paketausfalls im Netzwerk besteht.  
**PromQL-Kriterien: ** `avg({__name__="StorageNetworkThroughput", "@instrumentation.@name"="cloudwatch.aws/rds", DBClusterIdentifier="CLUSTER"}) > {{THRESHOLD}}`  
**Empfohlener Schwellenwert: ** {{THRESHOLD}} (in die Abfrage eingebettet)  
**Begründung des Schwellenwerts: ** Wird auf der Grundlage der Netzwerkkapazität der Instanz festgelegt.  
**Bewertungsintervall: ** 60  
**Wartezeit: ** 300  
**Erholungsphase: ** 300

## Route 53
<a name="Recommended_PromQL_Route53"></a>

**HealthCheckStatus**  
**Etiketten: ** HealthCheckId  
**Beschreibung des Alarms: ** Alarm, wenn bei einer Route 53-Zustandsprüfung ein fehlerhafter Endpunkt gemeldet wird.  
**Absicht: ** Erkennen Sie fehlerhafte Endpunkte mithilfe von Route 53-Integritätsprüfungen.  
**PromQL-Kriterien: ** `avg({__name__="HealthCheckStatus", "@instrumentation.@name"="cloudwatch.aws/route53", HealthCheckId="HC"}) < 1`  
**Empfohlener Schwellenwert: ** 1 (eingebettet in die Abfrage)  
**Begründung des Schwellenwerts: Ein ** Wert unter 1 bedeutet, dass der Endpunkt die Zustandsprüfungen nicht bestanden hat.  
**Bewertungsintervall: ** 60  
**Wartezeit: ** 180  
**Erholungszeit: ** 180

## S3
<a name="Recommended_PromQL_S3"></a>

**4xxErrors**  
**Etiketten: **BucketName, FilterId  
**Beschreibung des ** Alarms: Alarm, wenn die 4xx-Fehlerrate für einen S3-Bucket 5% übersteigt.  
**Absicht: ** Erkennung ungewöhnlicher Client-Fehlerraten.  
**PromQL-Kriterien: ** `avg({__name__="4xxErrors", "@instrumentation.@name"="cloudwatch.aws/s3", BucketName="BUCKET",FilterId="FILTER"}) > 0.05`  
**Empfohlener Schwellenwert: ** 0,05 (eingebettet in die Abfrage)  
**Begründung des Schwellenwerts: Ein Wert von ** über 5% weist auf Probleme bei der Einrichtung oder beim Zugriff hin.  
**Bewertungsintervall: ** 60  
**Wartezeit: ** 900  
**Erholungsphase: ** 900

**5xxErrors**  
**Etiketten: **BucketName, FilterId  
**Beschreibung des ** Alarms: Alarm, wenn die 5xx-Fehlerrate für einen S3-Bucket 5% übersteigt.  
**Absicht: ** Erkennt serverseitige Fehler, die sich auf die Anwendung auswirken.  
**PromQL-Kriterien: ** `avg({__name__="5xxErrors", "@instrumentation.@name"="cloudwatch.aws/s3", BucketName="BUCKET",FilterId="FILTER"}) > 0.05`  
**Empfohlener Schwellenwert: ** 0,05 (eingebettet in die Abfrage)  
**Begründung des Schwellenwerts: ** Über 5% deuten auf S3-Serviceprobleme hin.  
**Bewertungsintervall: ** 60  
**Wartezeit: ** 900  
**Erholungsphase: ** 900

**OperationsFailedReplication**  
**Etiketten: ** SourceBucket DestinationBucket, RuleId  
**Beschreibung des ** Alarms: Alarm, wenn S3-Replikationsvorgänge für einen Bucket fehlschlagen.  
**Absicht: ** Erkennen Sie Replikationsfehler, die zu Dateninkonsistenzen führen könnten.  
**PromQL-Kriterien: ** `max({__name__="OperationsFailedReplication", "@instrumentation.@name"="cloudwatch.aws/s3", SourceBucket="SRC",DestinationBucket="DST",RuleId="RULE"}) > 0`  
**Empfohlener Schwellenwert: ** 0 (eingebettet in die Abfrage)  
**Begründung des Schwellenwerts: ** Jede fehlgeschlagene Replikation muss untersucht werden.  
**Bewertungsintervall: ** 60  
**Wartezeit: ** 300  
**Erholungsphase: ** 300

## S3 Object Lambda
<a name="Recommended_PromQL_S3ObjectLambda"></a>

**4xxErrors**  
**Etiketten: **AccessPointName, DataSource ARN  
**Beschreibung des ** Alarms: Alarm, wenn die 4xx-Fehlerrate für einen S3 Object Lambda-Zugangspunkt 5% übersteigt.  
**Absicht: ** Erkennung ungewöhnlicher Client-Fehlerraten für Object Lambda.  
**PromQL-Kriterien: ** `avg({__name__="4xxErrors", "@instrumentation.@name"="cloudwatch.aws/s3objectlambda", AccessPointName="AP",DataSourceARN="ARN"}) > 0.05`  
**Empfohlener Schwellenwert: ** 0,05 (eingebettet in die Abfrage)  
**Begründung des Schwellenwerts: Ein Wert ** über 5% weist auf Probleme bei der Einrichtung hin.  
**Bewertungsintervall: ** 60  
**Wartezeit: ** 900  
**Erholungsphase: ** 900

**5xxErrors**  
**Etiketten: **AccessPointName, DataSource ARN  
**Beschreibung des ** Alarms: Alarm, wenn die 5xx-Fehlerrate für einen S3 Object Lambda-Zugangspunkt 5% übersteigt.  
**Absicht: ** Erkennt serverseitige Fehler in Object Lambda.  
**PromQL-Kriterien: ** `avg({__name__="5xxErrors", "@instrumentation.@name"="cloudwatch.aws/s3objectlambda", AccessPointName="AP",DataSourceARN="ARN"}) > 0.05`  
**Empfohlener Schwellenwert: ** 0,05 (eingebettet in die Abfrage)  
**Begründung des Schwellenwerts: ** Über 5% deuten auf Lambda- oder S3-Probleme hin.  
**Bewertungsintervall: 60 **  
**Wartezeit: ** 900  
**Erholungsphase: ** 900

**LambdaResponse4xx**  
**Etiketten: **AccessPointName, DataSource ARN  
**Beschreibung des ** Alarms: Alarm, wenn die Antwortrate der Lambda-Funktion 4xx für einen S3 Object Lambda-Zugangspunkt 5% überschreitet.  
**Absicht: ** Ermitteln Sie Client-Fehler mit der Lambda-Funktion.  
**PromQL-Kriterien: ** `avg({__name__="LambdaResponse4xx", "@instrumentation.@name"="cloudwatch.aws/s3objectlambda", AccessPointName="AP",DataSourceARN="ARN"}) > 0.05`  
**Empfohlener Schwellenwert: ** 0,05 (eingebettet in die Abfrage)  
**Begründung des Schwellenwerts: ** Über 5% deuten auf Probleme mit der Lambda-Funktion hin.  
**Bewertungsintervall: 60 **  
**Wartezeit: ** 900  
**Erholungsphase: ** 900

## SNS
<a name="Recommended_PromQL_SNS"></a>

**NumberOfMessagesPublished**  
**Beschriftungen: ** TopicName  
**Beschreibung des ** Alarms: Alarm, wenn die Anzahl der veröffentlichten Nachrichten unter den Schwellenwert für ein SNS-Thema fällt.  
**Absicht: ** Ermitteln Sie einen deutlichen Rückgang des Veröffentlichungsvolumens.  
**PromQL-Kriterien: ** `sum({__name__="NumberOfMessagesPublished", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) < {{THRESHOLD}}`  
**Empfohlener Schwellenwert: ** {{THRESHOLD}} (in die Abfrage eingebettet)  
**Begründung des Schwellenwerts: ** Wird auf der Grundlage des zu erwartenden Mindestverkehrs festgelegt.  
**Bewertungsintervall: ** 60  
**Wartezeit: ** 300  
**Erholungsphase: ** 300

**NumberOfNotificationsDelivered**  
**Etiketten: ** TopicName  
**Beschreibung des ** Alarms: Alarm, wenn die Anzahl der zugestellten Benachrichtigungen unter den Schwellenwert für ein SNS-Thema fällt.  
**Absicht: Stellen Sie ** fest, dass das Volumen der Benachrichtigungen zurückgeht.  
**PromQL-Kriterien: ** `sum({__name__="NumberOfNotificationsDelivered", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) < {{THRESHOLD}}`  
**Empfohlener Schwellenwert: ** {{THRESHOLD}} (in die Abfrage eingebettet)  
**Begründung des Schwellenwerts: ** Wird auf der Grundlage der zu erwartenden Mindestlieferungen festgelegt.  
**Bewertungsintervall: ** 60  
**Wartezeit: ** 300  
**Erholungsphase: ** 300

**NumberOfNotificationsFailed**  
**Etiketten: ** TopicName  
**Beschreibung des ** Alarms: Alarm, wenn die Anzahl der fehlgeschlagenen Benachrichtigungen den Schwellenwert für ein SNS-Thema überschreitet.  
**Absicht: Fehler bei der Zustellung ** erkennen.  
**PromQL-Kriterien: ** `sum({__name__="NumberOfNotificationsFailed", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) > {{THRESHOLD}}`  
**Empfohlener Schwellenwert: ** {{THRESHOLD}} (in die Abfrage eingebettet)  
**Begründung des Schwellenwerts: ** Wird auf der Grundlage einer akzeptablen Ausfallrate festgelegt.  
**Bewertungsintervall: ** 60  
**Wartezeit: ** 300  
**Erholungsphase: ** 300

**NumberOfNotificationsFilteredOut-InvalidAttributes**  
**Etiketten: ** TopicName  
**Beschreibung des ** Alarms: Alarm, wenn Benachrichtigungen aufgrund ungültiger Nachrichtenattribute herausgefiltert werden.  
**Absicht: Ungültige Nachrichtenattribute ** erkennen.  
**PromQL-Kriterien: ** `sum({__name__="NumberOfNotificationsFilteredOut-InvalidAttributes", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) > 0`  
**Empfohlener Schwellenwert: ** 0 (eingebettet in die Abfrage)  
**Begründung des Schwellenwerts: ** Jeder ungültige Filter weist auf eine Fehlkonfiguration hin.  
**Bewertungsintervall: 60 **  
**Wartezeit: ** 300  
**Erholungsphase: ** 300

**NumberOfNotificationsFilteredOut-InvalidMessageBody**  
**Etiketten: ** TopicName  
**Beschreibung des ** Alarms: Alarm, wenn Benachrichtigungen aufgrund ungültiger Nachrichtentexte herausgefiltert werden.  
**Absicht: Ungültige Nachrichtentexte ** erkennen.  
**PromQL-Kriterien: ** `sum({__name__="NumberOfNotificationsFilteredOut-InvalidMessageBody", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) > 0`  
**Empfohlener Schwellenwert: ** 0 (eingebettet in die Abfrage)  
**Begründung des Schwellenwerts: ** Jeder ungültige Filter weist auf eine Fehlkonfiguration hin.  
**Bewertungsintervall: 60 **  
**Wartezeit: ** 300  
**Erholungsphase: ** 300

**NumberOfNotificationsRedrivenToDlq**  
**Etiketten: ** TopicName  
**Beschreibung des Alarms: ** Alarm, wenn Benachrichtigungen für ein SNS-Thema an die Warteschlange mit unzustellbaren Nachrichten gesendet werden.  
**Absicht: ** Erkennt Nachrichten, die an eine Warteschlange mit unleserlichen Nachrichten gesendet wurden.  
**PromQL-Kriterien: ** `sum({__name__="NumberOfNotificationsRedrivenToDlq", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) > 0`  
**Empfohlener Schwellenwert: ** 0 (eingebettet in die Abfrage)  
**Begründung des Schwellenwerts: ** Jede DLQ-Nachricht weist auf Probleme bei der Zustellung hin.  
**Bewertungsintervall: 60 **  
**Wartezeit: ** 300  
**Erholungsphase: ** 300

**NumberOfNotificationsFailedToRedriveToDlq**  
**Etiketten: ** TopicName  
**Beschreibung des ** Alarms: Alarm, wenn bei einem SNS-Thema keine Benachrichtigungen an die Warteschlange für unzustellbare Nachrichten gesendet werden.  
**Absicht: ** Erkennung von DLQ-Zustellungsfehlern.  
**PromQL-Kriterien: ** `sum({__name__="NumberOfNotificationsFailedToRedriveToDlq", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) > 0`  
**Empfohlener Schwellenwert: ** 0 (eingebettet in die Abfrage)  
**Rechtfertigung des Schwellenwerts: Ein ** fehlgeschlagener DLQ bedeutet, dass die Fehlerverfolgung verloren geht.  
**Bewertungsintervall: 60 **  
**Wartezeit: ** 300  
**Erholungsphase: ** 300

**SMSMonthToDateSpentUSD**  
**Etiketten: ** TopicName  
**Beschreibung des ** Alarms: Alarm, wenn sich die SMS-Ausgaben dem Kontingent für ein SNS-Thema nähern.  
**Absicht: ** Erkennen Sie, dass sich die SMS-Ausgaben dem Kontingent nähern.  
**PromQL-Kriterien: ** `max({__name__="SMSMonthToDateSpentUSD", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) > {{THRESHOLD}}`  
**Empfohlener Schwellenwert: ** {{THRESHOLD}} (in die Abfrage eingebettet)  
**Begründung des Schwellenwerts: Wird auf der Grundlage des SMS-Kontingents des Kontos ** festgelegt.  
**Bewertungsintervall: ** 60  
**Wartezeit: ** 300  
**Erholungsphase: ** 300

**SMSSuccessRate**  
**Etiketten: ** TopicName  
**Beschreibung des ** Alarms: Alarm, wenn die Erfolgsrate der SMS-Zustellung unter den Schwellenwert für ein SNS-Thema fällt.  
**Absicht: ** Erkennung fehlgeschlagener SMS-Zustellungen.  
**PromQL-Kriterien: ** `avg({__name__="SMSSuccessRate", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) < {{THRESHOLD}}`  
**Empfohlener Schwellenwert: ** {{THRESHOLD}} (in die Abfrage eingebettet)  
**Begründung des Schwellenwerts: ** Wird auf der Grundlage einer akzeptablen Versandrate festgelegt.  
**Bewertungsintervall: ** 60  
**Wartezeit: ** 300  
**Erholungsphase: ** 300

## SQS
<a name="Recommended_PromQL_SQS"></a>

**ApproximateAgeOfOldestMessage**  
**Etiketten: ** QueueName  
**Beschreibung des ** Alarms: Alarm, wenn das Alter der ältesten Nachricht den Schwellenwert für eine SQS-Warteschlange überschreitet.  
**Absicht: ** Erkennt Nachrichten, die nicht schnell genug verarbeitet werden.  
**PromQL-Kriterien: ** `max({__name__="ApproximateAgeOfOldestMessage", "@instrumentation.@name"="cloudwatch.aws/sqs", QueueName="QUEUE"}) > {{THRESHOLD}}`  
**Empfohlener Schwellenwert: ** {{THRESHOLD}} (in die Abfrage eingebettet)  
**Rechtfertigung des Schwellenwerts: ** Wird auf der Grundlage einer akzeptablen Verarbeitungszeit für Nachrichten festgelegt.  
**Bewertungsintervall: ** 60  
**Wartezeit: ** 900  
**Erholungsphase: ** 900

**ApproximateNumberOfMessagesNotVisible**  
**Beschriftungen: ** QueueName  
**Beschreibung des ** Alarms: Alarm, wenn die Anzahl der Nachrichten während des Fluges den Schwellenwert für eine SQS-Warteschlange überschreitet.  
**Absicht: ** Erkennt viele Meldungen während des Fluges, die auf Verbraucherprobleme hinweisen.  
**PromQL-Kriterien: ** `avg({__name__="ApproximateNumberOfMessagesNotVisible", "@instrumentation.@name"="cloudwatch.aws/sqs", QueueName="QUEUE"}) > {{THRESHOLD}}`  
**Empfohlener Schwellenwert: ** {{THRESHOLD}} (in die Abfrage eingebettet)  
**Begründung des Schwellenwerts: ** Wird auf der Grundlage des erwarteten Verarbeitungsvolumens festgelegt.  
**Bewertungsintervall: ** 60  
**Wartezeit: ** 900  
**Erholungsphase: ** 900

**ApproximateNumberOfMessagesVisible**  
**Beschriftungen: ** QueueName  
**Alarmbeschreibung: ** Alarm, wenn die Anzahl der sichtbaren Nachrichten den Schwellenwert für eine SQS-Warteschlange überschreitet.  
**Absicht: ** Erkennen Sie einen Nachrichtenstau, der auf langsame Verbraucher hinweist.  
**PromQL-Kriterien: ** `avg({__name__="ApproximateNumberOfMessagesVisible", "@instrumentation.@name"="cloudwatch.aws/sqs", QueueName="QUEUE"}) > {{THRESHOLD}}`  
**Empfohlener Schwellenwert: ** {{THRESHOLD}} (in die Abfrage eingebettet)  
**Begründung des Schwellenwerts: ** Wird auf der Grundlage der erwarteten Warteschlangentiefe festgelegt.  
**Bewertungsintervall: ** 60  
**Wartezeit: ** 900  
**Erholungsphase: ** 900

**NumberOfMessagesSent**  
**Beschriftungen: ** QueueName  
**Alarmbeschreibung: ** Alarm, wenn keine Nachrichten an eine SQS-Warteschlange gesendet werden.  
**Absicht: ** Detect Producers haben aufgehört, Nachrichten zu senden.  
**PromQL-Kriterien: ** `sum({__name__="NumberOfMessagesSent", "@instrumentation.@name"="cloudwatch.aws/sqs", QueueName="QUEUE"}) <= 0`  
**Empfohlener Schwellenwert: ** 0 (eingebettet in die Abfrage)  
**Begründung für den Schwellenwert: ** Null Meldungen deuten auf einen Ausfall des Herstellers hin.  
**Bewertungsintervall: ** 60  
**Wartezeit: ** 900  
**Erholungsphase: ** 900

## VPN
<a name="Recommended_PromQL_VPN"></a>

**TunnelState (VPN-Ebene) **  
**Beschriftungen: ** VpnId  
**Beschreibung des ** Alarms: Alarm, wenn sich mindestens ein VPN-Tunnel im Status DOWN befindet.  
**Absicht: ** Erkennt mindestens einen Tunnel im Status DOWN.  
**PromQL-Kriterien: ** `min({__name__="TunnelState", "@instrumentation.@name"="cloudwatch.aws/vpn", VpnId="VPN"}) < 1`  
**Empfohlener Schwellenwert: ** 1 (eingebettet in die Abfrage)  
**Begründung des Schwellenwerts: ** Unter 1 bedeutet, dass der Tunnel ausgefallen ist.  
**Bewertungsintervall: ** 300  
**Wartezeit: ** 900  
**Erholungsphase: ** 900

**TunnelState (Tunnelebene) **  
**Beschriftungen: ** TunnelIpAddress  
**Beschreibung des ** Alarms: Alarm, wenn sich ein bestimmter VPN-Tunnel im Status DOWN befindet.  
**Absicht: ** Erkennt einen bestimmten Tunnel im Status DOWN.  
**PromQL-Kriterien: ** `min({__name__="TunnelState", "@instrumentation.@name"="cloudwatch.aws/vpn", TunnelIpAddress="IP"}) < 1`  
**Empfohlener Schwellenwert: ** 1 (eingebettet in die Abfrage)  
**Begründung des Schwellenwerts: ** Unter 1 bedeutet, dass der Tunnel ausgefallen ist.  
**Bewertungsintervall: ** 300  
**Wartezeit: ** 900  
**Erholungsphase: ** 900