View a markdown version of this page

Alarm PromQL yang direkomendasikan - Amazon CloudWatch

Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.

Alarm PromQL yang direkomendasikan

Gunakan alarm PromQL ini sebagai setara dengan alarm klasik yang direkomendasikan. Mereka memantau metrik yang sama dengan menggunakan kueri instan PromQL yang dievaluasi terhadap metrik yang dicerna melalui titik akhir CloudWatch OTLP.

Alarm PromQL digunakan EvaluationCriteria dengan. PromQLCriteria Tidak seperti alarm metrik klasik, ambang batas disematkan langsung dalam ekspresi kueri PromQL.

  • Periode tertunda — Durasi dalam detik yang harus terus dilanggar oleh rangkaian waktu sebelum alarm beralih ke status ALARM.

  • Periode pemulihan — Durasi dalam detik yang semua deret waktu harus berhenti melanggar sebelum alarm kembali ke keadaan OK.

  • Interval evaluasi — Seberapa sering, dalam hitungan detik, CloudWatch menjalankan kueri PromQL.

catatan

Alarm ini memerlukan metrik yang dipublikasikan melalui titik akhir CloudWatch OTLP. Untuk informasi selengkapnya, lihat Alarm PromQL.

Anda dapat menerapkan alarm ini dengan menggunakan AWS CloudFormation. Gunakan PromQLCriteria properti EvaluationCriteria dan pada AWS::CloudWatch::Alarm sumber daya.

API REST

4XXError

Label: ApiName, Panggung

Deskripsi alarm: Alarm saat tingkat kesalahan 4XX rata-rata melebihi 5% untuk tahap REST API.

Maksud: Mendeteksi tingkat kesalahan klien yang tinggi yang menunjukkan masalah permintaan.

Kriteria PromQL: avg({__name__="4XXError", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiName="your-api-name",Stage="your-stage"}) > 0.05

Ambang batas yang disarankan: 0,05 (tertanam dalam kueri)

Pembenaran ambang batas: Men deteksi tingkat kesalahan klien yang lebih besar dari 5%, yang menunjukkan kegagalan permintaan yang signifikan.

Interval evaluasi: 60

Periode tertunda: 300

Periode pemulihan: 300

5XXError

Label: ApiName, Panggung

Deskripsi alarm: Alarm saat tingkat kesalahan 5XX rata-rata melebihi 5% untuk tahap REST API.

Maksud: Mendeteksi tingkat kesalahan server tinggi yang menunjukkan kegagalan backend.

Kriteria PromQL: avg({__name__="5XXError", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiName="your-api-name",Stage="your-stage"}) > 0.05

Ambang batas yang disarankan: 0,05 (tertanam dalam kueri)

Pembenaran ambang batas: Men deteksi tingkat kesalahan server lebih besar dari 5%, yang memerlukan penyelidikan segera.

Interval evaluasi: 60

Periode tertunda: 180

Periode pemulihan: 300

Latensi

Label: ApiName, Panggung

Deskripsi alarm: Alarm saat latensi p90 melebihi 2500 ms untuk tahap REST API.

Maksud: Mendeteksi latensi p90 tinggi yang memengaruhi pengalaman pengguna.

Kriteria PromQL: histogram_quantile(0.9, {__name__="Latency", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiName="your-api-name",Stage="your-stage"}) > 2500

Ambang batas yang disarankan: 2500 (tertanam dalam kueri)

Pembenaran ambang batas: Latensi p90 di atas 2500 ms menunjukkan waktu respons yang menurun untuk sebagian besar permintaan.

Interval evaluasi: 60

Periode tertunda: 300

Periode pemulihan: 300

Hitungan

Label: ApiName, Panggung

Deskripsi alarm: Alarm saat jumlah permintaan total turun di bawah baseline yang diharapkan untuk tahap REST API.

Maksud: Mendeteksi volume lalu lintas rendah yang mungkin mengindikasikan masalah routing atau ketersediaan.

Kriteria PromQL: sum({__name__="Count", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiName="your-api-name",Stage="your-stage"}) < THRESHOLD

Ambang batas yang disarankan: THRESHOLD (tertanam dalam kueri)

Pembenaran ambang batas: Tet apkan berdasarkan garis dasar lalu lintas yang diharapkan untuk mendeteksi penurunan tak terduga.

Interval evaluasi: 60

Periode tertunda: 600

Periode pemulihan: 300

HTTP API

4xx

Label: ApiId, Panggung

Deskripsi alarm: Alarm ketika tingkat kesalahan 4xx rata-rata melebihi 5% untuk tahap API HTTP.

Maksud: Mendeteksi tingkat kesalahan klien yang tinggi pada titik akhir API HTTP.

Kriteria PromQL: avg({__name__="4xx", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="your-api-id",Stage="your-stage"}) > 0.05

Ambang batas yang disarankan: 0,05 (tertanam dalam kueri)

Pembenaran ambang batas: Men deteksi tingkat kesalahan klien lebih besar dari 5%.

Interval evaluasi: 60

Periode tertunda: 300

Periode pemulihan: 300

5xx

Label: ApiId, Panggung

Deskripsi alarm: Alarm ketika tingkat kesalahan 5xx rata-rata melebihi 5% untuk tahap API HTTP.

Maksud: Mendeteksi tingkat kesalahan server yang tinggi pada titik akhir API HTTP.

Kriteria PromQL: avg({__name__="5xx", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="your-api-id",Stage="your-stage"}) > 0.05

Ambang batas yang disarankan: 0,05 (tertanam dalam kueri)

Pembenaran ambang batas: Men deteksi tingkat kesalahan server yang lebih besar dari 5% yang memerlukan penyelidikan.

Interval evaluasi: 60

Periode tertunda: 180

Periode pemulihan: 300

Latensi

Label: ApiId, Panggung

Deskripsi alarm: Alarm saat latensi p90 melebihi 2500 ms untuk tahap API HTTP.

Maksud: Mendeteksi latensi p90 tinggi pada titik akhir API HTTP.

Kriteria PromQL: histogram_quantile(0.9, {__name__="Latency", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="your-api-id",Stage="your-stage"}) > 2500

Ambang batas yang disarankan: 2500 (tertanam dalam kueri)

Pembenaran ambang batas: Latensi p90 di atas 2500 ms menunjukkan waktu respons yang menurun.

Interval evaluasi: 60

Periode tertunda: 300

Periode pemulihan: 300

IntegrationLatency

Label: ApiId, Panggung

Deskripsi alarm: Alarm saat latensi integrasi p90 melebihi 2000 ms untuk tahap API HTTP.

Maksud: Mendeteksi latensi integrasi backend tinggi yang mempengaruhi waktu respons.

Kriteria PromQL: histogram_quantile(0.9, {__name__="IntegrationLatency", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="your-api-id",Stage="your-stage"}) > 2000

Ambang batas yang disarankan: 2000 (tertanam dalam kueri)

Pembenaran ambang batas: Latensi integrasi p90 di atas 2000 ms menunjukkan kelambatan backend.

Interval evaluasi: 60

Periode tertunda: 300

Periode pemulihan: 300

Hitungan

Label: ApiId, Panggung

Deskripsi alarm: Alarm saat jumlah permintaan total turun di bawah baseline yang diharapkan untuk tahap API HTTP.

Maksud: Mendeteksi volume lalu lintas rendah yang mungkin mengindikasikan masalah routing atau ketersediaan.

Kriteria PromQL: sum({__name__="Count", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="your-api-id",Stage="your-stage"}) < THRESHOLD

Ambang batas yang disarankan: THRESHOLD (tertanam dalam kueri)

Pembenaran ambang batas: Tet apkan berdasarkan garis dasar lalu lintas yang diharapkan untuk mendeteksi penurunan tak terduga.

Interval evaluasi: 60

Periode tertunda: 600

Periode pemulihan: 300

WebSocket API

ClientError

Label: ApiId, Panggung

Deskripsi alarm: Alarm saat tingkat kesalahan klien rata-rata melebihi 5% untuk tahap WebSocket API.

Maksud: Mendeteksi tingkat kesalahan klien yang tinggi pada koneksi WebSocket API.

Kriteria PromQL: avg({__name__="ClientError", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="your-api-id",Stage="your-stage"}) > 0.05

Ambang batas yang disarankan: 0,05 (tertanam dalam kueri)

Pembenaran ambang batas: Men deteksi tingkat kesalahan klien yang lebih besar dari 5% pada WebSocket koneksi.

Interval evaluasi: 60

Periode tertunda: 300

Periode pemulihan: 300

ExecutionError

Label: ApiId, Panggung

Deskripsi alarm: Alarm ketika tingkat kesalahan eksekusi rata-rata melebihi 5% untuk tahap WebSocket API.

Maksud: Mendeteksi tingkat kesalahan eksekusi sisi server yang tinggi pada WebSocket API.

Kriteria PromQL: avg({__name__="ExecutionError", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="your-api-id",Stage="your-stage"}) > 0.05

Ambang batas yang disarankan: 0,05 (tertanam dalam kueri)

Pembenaran ambang batas: Mendeteksi tingkat kesalahan eksekusi yang lebih besar dari 5% yang membutuhkan penyelidikan.

Interval evaluasi: 60

Periode tertunda: 180

Periode pemulihan: 300

IntegrationLatency

Label: ApiId, Panggung

Deskripsi alarm: Alarm saat latensi integrasi p90 melebihi 2000 ms untuk tahap WebSocket API.

Maksud: Mendeteksi latensi integrasi backend tinggi pada rute WebSocket API.

Kriteria PromQL: histogram_quantile(0.9, {__name__="IntegrationLatency", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="your-api-id",Stage="your-stage"}) > 2000

Ambang batas yang disarankan: 2000 (tertanam dalam kueri)

Pembenaran ambang batas: Latensi integrasi p90 di atas 2000 ms menunjukkan kelambatan backend.

Interval evaluasi: 60

Periode tertunda: 300

Periode pemulihan: 300

MessageCount

Label: ApiId, Panggung

Deskripsi alarm: Alarm saat jumlah total pesan turun di bawah baseline yang diharapkan untuk tahap WebSocket API.

Intent: Mendeteksi volume pesan rendah yang mungkin mengindikasikan masalah koneksi atau routing.

Kriteria PromQL: sum({__name__="MessageCount", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="your-api-id",Stage="your-stage"}) < THRESHOLD

Ambang batas yang disarankan: THRESHOLD (tertanam dalam kueri)

Pembenaran ambang batas: Tet apkan berdasarkan volume pesan yang diharapkan untuk mendeteksi penurunan tak terduga.

Interval evaluasi: 60

Periode tertunda: 600

Periode pemulihan: 300

GroupInServiceCapacity

Label: AutoScalingGroupName

Deskripsi alarm: Alarm saat kapasitas rata-rata dalam layanan turun di bawah minimum yang diharapkan untuk grup Penskalaan Otomatis.

Maksud: Mendeteksi ketersediaan rendah karena kegagalan peluncuran atau instans yang dihentikan.

Kriteria PromQL: avg({__name__="GroupInServiceCapacity", "@instrumentation.@name"="cloudwatch.aws/autoscaling", AutoScalingGroupName="your-auto-scaling-group-name"}) < THRESHOLD

Ambang batas yang disarankan: THRESHOLD (tertanam dalam kueri)

Pembenaran ambang batas: Tet apkan berdasarkan kapasitas minimum yang diinginkan untuk mendeteksi kegagalan peluncuran atau instans yang tidak mencukupi.

Interval evaluasi: 60

Periode tertunda: 600

Periode pemulihan: 600

DaysToExpiry

Label: CertificateArn

Deskripsi alarm: Alarm ketika hari minimum hingga kadaluwarsa sertifikat turun menjadi 44 hari atau kurang.

Maksud: Peringatan kedaluwarsa sertifikat proaktif untuk memberikan waktu perpanjangan.

Kriteria PromQL: min({__name__="DaysToExpiry", "@instrumentation.@name"="cloudwatch.aws/certificatemanager", CertificateArn="your-certificate-arn"}) <= 44

Ambang batas yang disarankan: 44 (tertanam dalam kueri)

Pembenaran ambang batas: Men yediakan waktu tunggu yang cukup sebelum sertifikat kedaluwarsa untuk menyelesaikan proses perpanjangan.

Interval evaluasi: 86400

Periode tertunda: 86400

Periode pemulihan: 86400

5xxErrorRate

Label: DistributionId

Deskripsi alarm: Alarm ketika tingkat kesalahan 5xx rata-rata melebihi ambang batas untuk CloudFront distribusi.

Maksud: Mendeteksi tingkat asal atau CloudFront kesalahan tinggi yang mempengaruhi pengiriman konten.

Kriteria PromQL: avg({__name__="5xxErrorRate", "@instrumentation.@name"="cloudwatch.aws/cloudfront", DistributionId="your-distribution-id"}) > THRESHOLD

Ambang batas yang disarankan: THRESHOLD (tertanam dalam kueri)

Pembenaran ambang batas: Tet apkan berdasarkan tingkat kesalahan yang dapat diterima untuk pengiriman konten.

Interval evaluasi: 60

Periode tertunda: 300

Periode pemulihan: 300

OriginLatency

Label: DistributionId

Deskripsi alarm: Alarm saat latensi asal p90 melebihi ambang batas untuk CloudFront distribusi.

Maksud: Mendeteksi latensi respons asal yang tinggi yang memengaruhi kinerja pengiriman konten.

Kriteria PromQL: histogram_quantile(0.9, {__name__="OriginLatency", "@instrumentation.@name"="cloudwatch.aws/cloudfront", DistributionId="your-distribution-id"}) > THRESHOLD

Ambang batas yang disarankan: THRESHOLD (tertanam dalam kueri)

Pembenaran ambang batas: Tet apkan berdasarkan waktu respons asal yang diharapkan dan strategi caching.

Interval evaluasi: 60

Periode tertunda: 300

Periode pemulihan: 300

FunctionValidationErrors

Label: DistributionId, FunctionName

Deskripsi alarm: Alarm ketika terjadi kesalahan validasi CloudFront fungsi.

Intent: Men CloudFront deteksi kegagalan validasi fungsi yang mencegah eksekusi fungsi.

Kriteria PromQL: sum({__name__="FunctionValidationErrors", "@instrumentation.@name"="cloudwatch.aws/cloudfront", DistributionId="your-distribution-id",FunctionName="your-function-name"}) > 0

Ambang batas yang disarankan: 0 (tertanam dalam kueri)

Pembenaran ambang batas: Setiap kesalahan validasi menunjukkan masalah konfigurasi fungsi yang membutuhkan perhatian.

Interval evaluasi: 60

Periode tertunda: 120

Periode pemulihan: 120

FunctionExecutionErrors

Label: DistributionId, FunctionName

Deskripsi alarm: Alarm ketika terjadi kesalahan eksekusi CloudFront fungsi.

Intent: Mendeteksi kegagalan runtime dalam CloudFront fungsi yang memengaruhi pemrosesan permintaan.

Kriteria PromQL: sum({__name__="FunctionExecutionErrors", "@instrumentation.@name"="cloudwatch.aws/cloudfront", DistributionId="your-distribution-id",FunctionName="your-function-name"}) > 0

Ambang batas yang disarankan: 0 (tertanam dalam kueri)

Pembenaran ambang batas: Setiap kesalahan eksekusi menunjukkan masalah runtime dalam kode fungsi.

Interval evaluasi: 60

Periode tertunda: 300

Periode pemulihan: 300

FunctionThrottles

Label: DistributionId, FunctionName

Deskripsi alarm: Alarm ketika terjadi CloudFront pelambatan fungsi.

Intent: Mendeteksi pembatasan CloudFront fungsi yang mungkin menurunkan pemrosesan permintaan.

Kriteria PromQL: sum({__name__="FunctionThrottles", "@instrumentation.@name"="cloudwatch.aws/cloudfront", DistributionId="your-distribution-id",FunctionName="your-function-name"}) > 0

Ambang batas yang disarankan: 0 (tertanam dalam kueri)

Pembenaran ambang batas: Setiap pelambatan menunjukkan fungsi mencapai batas komputasi.

Interval evaluasi: 60

Periode tertunda: 300

Periode pemulihan: 300

SignUpThrottles

Label: UserPool, UserPoolClient

Deskripsi alarm: Alarm saat peristiwa throttle pendaftaran melebihi ambang batas untuk kumpulan pengguna.

Maksud: Mendeteksi pelambatan pendaftaran yang mencegah pendaftaran pengguna baru.

Kriteria PromQL: sum({__name__="SignUpThrottles", "@instrumentation.@name"="cloudwatch.aws/cognito", UserPool="your-user-pool",UserPoolClient="your-user-pool-client"}) > THRESHOLD

Ambang batas yang disarankan: THRESHOLD (tertanam dalam kueri)

Pembenaran ambang batas: Tet apkan berdasarkan tingkat throttle yang dapat diterima untuk operasi pendaftaran.

Interval evaluasi: 60

Periode tertunda: 300

Periode pemulihan: 300

SignInThrottles

Label: UserPool, UserPoolClient

Deskripsi alarm: Alarm saat peristiwa throttle masuk melebihi ambang batas untuk kumpulan pengguna.

Maksud: Mendeteksi pembatasan masuk yang mencegah otentikasi pengguna.

Kriteria PromQL: sum({__name__="SignInThrottles", "@instrumentation.@name"="cloudwatch.aws/cognito", UserPool="your-user-pool",UserPoolClient="your-user-pool-client"}) > THRESHOLD

Ambang batas yang disarankan: THRESHOLD (tertanam dalam kueri)

Pembenaran ambang batas: Tet apkan berdasarkan tingkat throttle yang dapat diterima untuk operasi masuk.

Interval evaluasi: 60

Periode tertunda: 300

Periode pemulihan: 300

TokenRefreshThrottles

Label: UserPool, UserPoolClient

Deskripsi alarm: Alarm saat peristiwa throttle refresh token melebihi ambang batas untuk kumpulan pengguna.

Maksud: Mendeteksi pelambatan penyegaran token yang dapat menyebabkan gangguan sesi.

Kriteria PromQL: sum({__name__="TokenRefreshThrottles", "@instrumentation.@name"="cloudwatch.aws/cognito", UserPool="your-user-pool",UserPoolClient="your-user-pool-client"}) > THRESHOLD

Ambang batas yang disarankan: THRESHOLD (tertanam dalam kueri)

Pembenaran ambang batas: Tet apkan berdasarkan kecepatan throttle yang dapat diterima untuk operasi penyegaran token.

Interval evaluasi: 60

Periode tertunda: 300

Periode pemulihan: 300

FederationThrottles

Label: UserPool, UserPoolClient, IdentityProvider

Deskripsi alarm: Alarm saat peristiwa throttle federasi melebihi ambang batas untuk penyedia identitas kumpulan pengguna.

Maksud: Mendeteksi pembatasan federasi yang mungkin mencegah masuk federasi.

Kriteria PromQL: sum({__name__="FederationThrottles", "@instrumentation.@name"="cloudwatch.aws/cognito", UserPool="your-user-pool",UserPoolClient="your-user-pool-client",IdentityProvider="your-identity-provider"}) > THRESHOLD

Ambang batas yang disarankan: THRESHOLD (tertanam dalam kueri)

Pembenaran ambang batas: Tet apkan berdasarkan tingkat throttle yang dapat diterima untuk operasi federasi.

Interval evaluasi: 60

Periode tertunda: 300

Periode pemulihan: 300

AccountProvisionedReadCapacityUtilization

Label: Tidak ada

Deskripsi alarm: Alarm saat pemanfaatan kapasitas baca yang disediakan tingkat akun melebihi 80%.

Maksud: Mendeteksi saat kapasitas baca yang disediakan mendekati batas akun.

Kriteria PromQL: max({__name__="AccountProvisionedReadCapacityUtilization", "@instrumentation.@name"="cloudwatch.aws/dynamodb"}) > 80

Ambang batas yang disarankan: 80 (tertanam dalam kueri)

Pembenaran ambang batas: Pada pemanfaatan 80%, Anda memiliki headroom terbatas sebelum mencapai batas akun.

Interval evaluasi: 300

Periode tertunda: 600

Periode pemulihan: 600

AccountProvisionedWriteCapacityUtilization

Label: Tidak ada

Deskripsi alarm: Alarm saat pemanfaatan kapasitas tulis yang disediakan tingkat akun melebihi 80%.

Maksud: Mendeteksi saat kapasitas tulis yang disediakan mendekati batas akun.

Kriteria PromQL: max({__name__="AccountProvisionedWriteCapacityUtilization", "@instrumentation.@name"="cloudwatch.aws/dynamodb"}) > 80

Ambang batas yang disarankan: 80 (tertanam dalam kueri)

Pembenaran ambang batas: Pada pemanfaatan 80%, Anda memiliki headroom terbatas sebelum mencapai batas akun.

Interval evaluasi: 300

Periode tertunda: 600

Periode pemulihan: 600

AgeOfOldestUnreplicatedRecord

Label: TableName, DelegatedOperation

Deskripsi alarm: Alarm saat usia catatan tertua yang tidak direplikasi melebihi ambang batas.

Maksud: Mendeteksi jeda replikasi yang mungkin menyebabkan data basi di tabel global.

Kriteria PromQL: max({__name__="AgeOfOldestUnreplicatedRecord", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name",DelegatedOperation="your-operation"}) > THRESHOLD

Ambang batas yang disarankan: THRESHOLD (tertanam dalam kueri)

Pembenaran ambang batas: Tet apkan berdasarkan persyaratan kesegaran replikasi Anda.

Interval evaluasi: 300

Periode tertunda: 900

Periode pemulihan: 900

FailedToReplicateRecordCount

Label: TableName, DelegatedOperation

Deskripsi alarm: Alarm ketika ada catatan yang gagal direplikasi dalam tabel global.

Maksud: Mendeteksi kegagalan replikasi yang menyebabkan inkonsistensi data di seluruh wilayah.

Kriteria PromQL: sum({__name__="FailedToReplicateRecordCount", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name",DelegatedOperation="your-operation"}) > 0

Ambang batas yang disarankan: 0 (tertanam dalam kueri)

Pembenaran ambang batas: Setiap replikasi yang gagal menunjukkan masalah konsistensi data yang memerlukan perhatian segera.

Interval evaluasi: 60

Periode tertunda: 60

Periode pemulihan: 60

ReadThrottleEvents

Label: TableName

Deskripsi alarm: Alarm saat membaca peristiwa throttle melebihi ambang batas untuk tabel.

Intent: Men deteksi pembatasan baca yang menunjukkan kapasitas yang disediakan tidak mencukupi.

Kriteria PromQL: sum({__name__="ReadThrottleEvents", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name"}) > THRESHOLD

Ambang batas yang disarankan: THRESHOLD (tertanam dalam kueri)

Pembenaran ambang batas: Tet apkan berdasarkan jumlah throttle yang dapat diterima untuk operasi baca.

Interval evaluasi: 60

Periode tertunda: 300

Periode pemulihan: 300

ReadThrottleEvents (GSI)

Label: TableName, GlobalSecondaryIndexName

Deskripsi alarm: Alarm saat membaca peristiwa throttle melebihi ambang batas untuk indeks sekunder global.

Intent: Mendeteksi pembatasan baca pada GSI yang menunjukkan kapasitas indeks tidak mencukupi.

Kriteria PromQL: sum({__name__="ReadThrottleEvents", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name",GlobalSecondaryIndexName="your-index-name"}) > THRESHOLD

Ambang batas yang disarankan: THRESHOLD (tertanam dalam kueri)

Pembenaran ambang batas: Tet apkan berdasarkan jumlah throttle yang dapat diterima untuk operasi baca GSI.

Interval evaluasi: 60

Periode tertunda: 300

Periode pemulihan: 300

ReplicationLatency

Label: TableName, ReceivingRegion

Deskripsi alarm: Alarm saat latensi replikasi rata-rata melebihi ambang batas untuk tabel global.

Maksud: Mendeteksi latensi replikasi tinggi yang dapat menyebabkan pembacaan basi di wilayah replika.

Kriteria PromQL: avg({__name__="ReplicationLatency", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name",ReceivingRegion="your-receiving-region"}) > THRESHOLD

Ambang batas yang disarankan: THRESHOLD (tertanam dalam kueri)

Pembenaran ambang batas: Tet apkan berdasarkan persyaratan kesegaran data Anda untuk wilayah replika.

Interval evaluasi: 60

Periode tertunda: 900

Periode pemulihan: 900

SuccessfulRequestLatency

Label: TableName, Operasi

Deskripsi alarm: Alarm ketika latensi permintaan rata-rata berhasil melebihi ambang batas untuk operasi tabel.

Intent: Mendeteksi latensi tinggi pada operasi DynamoDB yang mempengaruhi kinerja aplikasi.

Kriteria PromQL: avg({__name__="SuccessfulRequestLatency", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name",Operation="your-operation"}) > THRESHOLD

Ambang batas yang disarankan: THRESHOLD (tertanam dalam kueri)

Pembenaran ambang batas: Tet apkan berdasarkan SLA latensi Anda untuk operasi DynamoDB tertentu.

Interval evaluasi: 60

Periode tertunda: 600

Periode pemulihan: 600

SystemErrors

Label: TableName

Deskripsi alarm: Alarm ketika kesalahan sistem melebihi ambang batas untuk tabel.

Maksud: Mendeteksi kesalahan sisi layanan DynamoDB yang memengaruhi ketersediaan tabel.

Kriteria PromQL: sum({__name__="SystemErrors", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name"}) > THRESHOLD

Ambang batas yang disarankan: THRESHOLD (tertanam dalam kueri)

Pembenaran ambang batas: Tet apkan berdasarkan jumlah kesalahan sistem yang dapat diterima untuk tabel.

Interval evaluasi: 60

Periode tertunda: 900

Periode pemulihan: 900

ThrottledPutRecordCount

Label: TableName, DelegatedOperation

Deskripsi alarm: Alarm saat jumlah catatan put yang dibatasi melebihi ambang batas untuk tabel.

Maksud: Mendeteksi putaran yang dibatasi yang dapat menyebabkan hilangnya data dalam operasi streaming.

Kriteria PromQL: max({__name__="ThrottledPutRecordCount", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name",DelegatedOperation="your-operation"}) > THRESHOLD

Ambang batas yang disarankan: THRESHOLD (tertanam dalam kueri)

Pembenaran ambang batas: Tet apkan berdasarkan jumlah throttle yang dapat diterima untuk operasi put streaming.

Interval evaluasi: 60

Periode tertunda: 600

Periode pemulihan: 600

UserErrors

Label: Tidak ada

Deskripsi alarm: Alarm saat kesalahan pengguna melebihi ambang batas di seluruh akun.

Maksud: Mendeteksi tingkat kesalahan klien yang tinggi seperti validasi atau kegagalan pemeriksaan bersyarat.

Kriteria PromQL: sum({__name__="UserErrors", "@instrumentation.@name"="cloudwatch.aws/dynamodb"}) > THRESHOLD

Ambang batas yang disarankan: THRESHOLD (tertanam dalam kueri)

Pembenaran ambang batas: Tet apkan berdasarkan tingkat kesalahan yang dapat diterima untuk kegagalan permintaan sisi klien.

Interval evaluasi: 60

Periode tertunda: 600

Periode pemulihan: 600

WriteThrottleEvents

Label: TableName

Deskripsi alarm: Alarm saat menulis peristiwa throttle melebihi ambang batas untuk tabel.

Intent: Men deteksi pembatasan tulis yang menunjukkan kapasitas yang disediakan tidak mencukupi.

Kriteria PromQL: sum({__name__="WriteThrottleEvents", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name"}) > THRESHOLD

Ambang batas yang disarankan: THRESHOLD (tertanam dalam kueri)

Pembenaran ambang batas: Tet apkan berdasarkan jumlah throttle yang dapat diterima untuk operasi penulisan.

Interval evaluasi: 60

Periode tertunda: 300

Periode pemulihan: 300

WriteThrottleEvents (GSI)

Label: TableName, GlobalSecondaryIndexName

Deskripsi alarm: Alarm saat menulis peristiwa throttle melebihi ambang batas untuk indeks sekunder global.

Intent: Mendeteksi pembatasan tulis pada GSI yang menunjukkan kapasitas indeks tidak mencukupi.

Kriteria PromQL: sum({__name__="WriteThrottleEvents", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name",GlobalSecondaryIndexName="your-index-name"}) > THRESHOLD

Ambang batas yang disarankan: THRESHOLD (tertanam dalam kueri)

Pembenaran ambang batas: Tet apkan berdasarkan jumlah throttle yang dapat diterima untuk operasi penulisan GSI.

Interval evaluasi: 60

Periode tertunda: 300

Periode pemulihan: 300

VolumeStalledIOCheck

Label: VolumeId, InstanceId

Deskripsi alarm: Alarm saat volume EBS melaporkan kegagalan pemeriksaan yang terhenti I/O .

Maksud: Mendeteksi terhenti I/O pada volume EBS yang mengindikasikan penurunan volume.

Kriteria PromQL: max({__name__="VolumeStalledIOCheck", "@instrumentation.@name"="cloudwatch.aws/ebs", VolumeId="your-volume-id",InstanceId="your-instance-id"}) >= 1

Ambang batas yang disarankan: 1 (tertanam dalam kueri)

Pembenaran ambang batas: Nilai 1 atau lebih besar menunjukkan volume telah terhenti I/O, memerlukan penyelidikan segera.

Interval evaluasi: 60

Periode tertunda: 600

Periode pemulihan: 600

CPUUtilization

Label: InstanceId

Deskripsi alarm: Alarm saat pemanfaatan CPU rata-rata melebihi 80% untuk instans EC2.

Maksud: Men deteksi pemanfaatan CPU yang tinggi.

Kriteria PromQL: avg({__name__="CPUUtilization", "@instrumentation.@name"="cloudwatch.aws/ec2", InstanceId="your-instance-id"}) > 80

Ambang batas yang disarankan: 80 (tertanam dalam kueri)

Pembenaran ambang batas: Ambang batas 80% memberikan ruang kepala sebelum saturasi.

Interval evaluasi: 300

Periode tertunda: 900

Periode pemulihan: 900

StatusCheckFailed

Label: InstanceId

Deskripsi alarm: Alarm saat pemeriksaan kesehatan instans atau sistem gagal untuk instans EC2.

Maksud: Mendeteksi instans atau masalah kesehatan sistem.

Kriteria PromQL: max({__name__="StatusCheckFailed", "@instrumentation.@name"="cloudwatch.aws/ec2", InstanceId="your-instance-id"}) >= 1

Ambang batas yang disarankan: 1 (tertanam dalam kueri)

Pembenaran ambang batas: Setiap kegagalan pemeriksaan status memerlukan penyelidikan.

Interval evaluasi: 300

Periode tertunda: 600

Periode pemulihan: 600

StatusCheckFailed_AttacheBs

Label: InstanceId

Deskripsi alarm: Alarm saat volume EBS yang terpasang menjadi tidak dapat dijangkau untuk instans EC2.

Maksud: Men deteksi volume EBS yang tidak dapat dijangkau.

Kriteria PromQL: max({__name__="StatusCheckFailed_AttachedEBS", "@instrumentation.@name"="cloudwatch.aws/ec2", InstanceId="your-instance-id"}) >= 1

Ambang batas yang disarankan: 1 (tertanam dalam kueri)

Pembenaran ambang batas: Vol ume yang tidak dapat dijangkau menyebabkan kegagalan I/O .

Interval evaluasi: 60

Periode tertunda: 600

Periode pemulihan: 600

CPUReservation

Label: ClusterName

Deskripsi alarm: Alarm ketika reservasi CPU rata-rata melebihi 80% untuk cluster ECS.

Maksud: Mendeteksi cluster mendekati kapasitas CPU.

Kriteria PromQL: avg({__name__="CPUReservation", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="your-cluster-name"}) > 80

Ambang batas yang disarankan: 80 (tertanam dalam kueri)

Pembenaran ambang batas: 80% reservasi menunjukkan ruang kepala terbatas untuk tugas-tugas baru.

Interval evaluasi: 60

Periode tertunda: 300

Periode pemulihan: 300

CPUUtilization

Label: ClusterName, ServiceName

Deskripsi alarm: Alarm ketika pemanfaatan CPU rata-rata melebihi 80% untuk layanan ECS.

Maksud: Men deteksi pemanfaatan CPU yang tinggi untuk layanan ECS.

Kriteria PromQL: avg({__name__="CPUUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="your-cluster-name",ServiceName="your-service-name"}) > 80

Ambang batas yang disarankan: 80 (tertanam dalam kueri)

Pembenaran ambang batas: 80% memberikan ruang kepala sebelum saturasi.

Interval evaluasi: 60

Periode tertunda: 300

Periode pemulihan: 300

EBSFilesystemUtilization

Label: ClusterName, ServiceName

Deskripsi alarm: Alarm ketika pemanfaatan sistem file EBS rata-rata melebihi 80% untuk layanan ECS.

Maksud: Men deteksi pemanfaatan penyimpanan EBS yang tinggi.

Kriteria PromQL: avg({__name__="EBSFilesystemUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="your-cluster-name",ServiceName="your-service-name"}) > 80

Ambang batas yang disarankan: 80 (tertanam dalam kueri)

Pembenaran ambang batas: 80% memberikan ruang kepala sebelum saturasi.

Interval evaluasi: 60

Periode tertunda: 300

Periode pemulihan: 300

MemoryReservation

Label: ClusterName

Deskripsi alarm: Alarm ketika reservasi memori rata-rata melebihi 80% untuk cluster ECS.

Maksud: Mendeteksi cluster mendekati kapasitas memori.

Kriteria PromQL: avg({__name__="MemoryReservation", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="your-cluster-name"}) > 80

Ambang batas yang disarankan: 80 (tertanam dalam kueri)

Pembenaran ambang batas: 80% reservasi menunjukkan ruang kepala terbatas untuk tugas-tugas baru.

Interval evaluasi: 60

Periode tertunda: 300

Periode pemulihan: 300

MemoryUtilization

Label: ClusterName, ServiceName

Deskripsi alarm: Alarm ketika pemanfaatan memori rata-rata melebihi 80% untuk layanan ECS.

Maksud: Men deteksi pemanfaatan memori yang tinggi.

Kriteria PromQL: avg({__name__="MemoryUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="your-cluster-name",ServiceName="your-service-name"}) > 80

Ambang batas yang disarankan: 80 (tertanam dalam kueri)

Pembenaran ambang batas: 80% memberikan ruang kepala sebelum saturasi.

Interval evaluasi: 60

Periode tertunda: 300

Periode pemulihan: 300

HTTP Code_Target _5xx_Count

Label: ClusterName, ServiceName

Deskripsi alarm: Alarm saat jumlah kesalahan HTTP 5XX melebihi ambang batas untuk layanan ECS.

Maksud: Mendeteksi jumlah kesalahan sisi server yang tinggi.

Kriteria PromQL: sum({__name__="HTTPCode_Target_5XX_Count", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="your-cluster-name",ServiceName="your-service-name"}) > THRESHOLD

Ambang batas yang disarankan: THRESHOLD (tertanam dalam kueri)

Pembenaran ambang batas: Tet apkan berdasarkan baseline tingkat kesalahan normal aplikasi Anda.

Interval evaluasi: 60

Periode tertunda: 300

Periode pemulihan: 300

TargetResponseTime

Label: ClusterName, ServiceName

Deskripsi alarm: Alarm ketika waktu respons target rata-rata melebihi ambang batas untuk layanan ECS.

Maksud: Mendeteksi waktu respons target yang tinggi.

Kriteria PromQL: avg({__name__="TargetResponseTime", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="your-cluster-name",ServiceName="your-service-name"}) > THRESHOLD

Ambang batas yang disarankan: THRESHOLD (tertanam dalam kueri)

Pembenaran ambang batas: Tet apkan berdasarkan persyaratan latensi aplikasi yang dapat diterima.

Interval evaluasi: 60

Periode tertunda: 300

Periode pemulihan: 300

EphemeralStorageUtilized

Label: ClusterName, ServiceName

Deskripsi alarm: Alarm ketika penggunaan penyimpanan sementara rata-rata melebihi ambang batas untuk tugas Fargate.

Maksud: Mendeteksi penggunaan penyimpanan sementara yang tinggi untuk tugas Fargate.

Kriteria PromQL: avg({__name__="EphemeralStorageUtilized", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name",ServiceName="your-service-name"}) > THRESHOLD

Ambang batas yang disarankan: THRESHOLD (tertanam dalam kueri)

Pembenaran ambang batas: Tet apkan berdasarkan alokasi penyimpanan sementara tugas Anda.

Interval evaluasi: 60

Periode tertunda: 300

Periode pemulihan: 300

RunningTaskCount

Label: ClusterName, ServiceName

Deskripsi alarm: Alarm saat jumlah tugas yang sedang berjalan turun ke nol untuk layanan ECS.

Maksud: Mendeteksi saat tidak ada tugas yang berjalan.

Kriteria PromQL: avg({__name__="RunningTaskCount", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name",ServiceName="your-service-name"}) <= 0

Ambang batas yang disarankan: 0 (tertanam dalam kueri)

Pembenaran ambang batas: Tugas yang berjalan nol menunjukkan pemadaman layanan.

Interval evaluasi: 60

Periode tertunda: 300

Periode pemulihan: 300

instance_filesystem_utilization

Label: InstanceId, ContainerInstanceId, ClusterName

Deskripsi alarm: Alarm saat pemanfaatan sistem file rata-rata melebihi 90% pada instance kontainer.

Maksud: Men deteksi pemanfaatan sistem file yang tinggi.

Kriteria PromQL: avg({__name__="instance_filesystem_utilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", InstanceId="your-instance-id",ContainerInstanceId="your-container-instance-id",ClusterName="your-cluster-name"}) > 90

Ambang yang disarankan: 90 (tertanam dalam kueri)

Pembenaran ambang batas: 90% pemanfaatan sistem file menyisakan ruang minimal untuk operasi.

Interval evaluasi: 60

Periode tertunda: 300

Periode pemulihan: 300

TaskCpuUtilization (tingkat cluster)

Label: ClusterName

Deskripsi alarm: Alarm ketika pemanfaatan CPU tugas rata-rata melebihi 80% di tingkat cluster.

Maksud: Men deteksi pemanfaatan CPU yang tinggi.

Kriteria PromQL: avg({__name__="TaskCpuUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name"}) > 80

Ambang batas yang disarankan: 80 (tertanam dalam kueri)

Pembenaran ambang batas: 80% memberikan ruang kepala sebelum saturasi.

Interval evaluasi: 60

Periode tertunda: 300

Periode pemulihan: 300

TaskCpuUtilization (tingkat layanan)

Label: ClusterName, ServiceName

Deskripsi alarm: Alarm ketika pemanfaatan CPU tugas rata-rata melebihi 80% pada tingkat layanan.

Maksud: Men deteksi pemanfaatan CPU yang tinggi.

Kriteria PromQL: avg({__name__="TaskCpuUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name",ServiceName="your-service-name"}) > 80

Ambang batas yang disarankan: 80 (tertanam dalam kueri)

Pembenaran ambang batas: 80% memberikan ruang kepala sebelum saturasi.

Interval evaluasi: 60

Periode tertunda: 300

Periode pemulihan: 300

TaskMemoryUtilization (tingkat cluster)

Label: ClusterName

Deskripsi alarm: Alarm ketika pemanfaatan memori tugas rata-rata melebihi 80% di tingkat cluster.

Maksud: Men deteksi pemanfaatan memori yang tinggi.

Kriteria PromQL: avg({__name__="TaskMemoryUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name"}) > 80

Ambang batas yang disarankan: 80 (tertanam dalam kueri)

Pembenaran ambang batas: 80% memberikan ruang kepala sebelum saturasi.

Interval evaluasi: 60

Periode tertunda: 300

Periode pemulihan: 300

TaskMemoryUtilization (tingkat layanan)

Label: ClusterName, ServiceName

Deskripsi alarm: Alarm ketika pemanfaatan memori tugas rata-rata melebihi 80% pada tingkat layanan.

Maksud: Men deteksi pemanfaatan memori yang tinggi.

Kriteria PromQL: avg({__name__="TaskMemoryUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name",ServiceName="your-service-name"}) > 80

Ambang batas yang disarankan: 80 (tertanam dalam kueri)

Pembenaran ambang batas: 80% memberikan ruang kepala sebelum saturasi.

Interval evaluasi: 60

Periode tertunda: 300

Periode pemulihan: 300

ContainerCpuUtilization (tingkat cluster)

Label: ClusterName

Deskripsi alarm: Alarm ketika pemanfaatan CPU kontainer rata-rata melebihi 80% di tingkat cluster.

Maksud: Men deteksi pemanfaatan CPU yang tinggi.

Kriteria PromQL: avg({__name__="ContainerCpuUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name"}) > 80

Ambang batas yang disarankan: 80 (tertanam dalam kueri)

Pembenaran ambang batas: 80% memberikan ruang kepala sebelum saturasi.

Interval evaluasi: 60

Periode tertunda: 300

Periode pemulihan: 300

ContainerCpuUtilization (tingkat kontainer)

Label: ContainerName, ClusterName, ServiceName

Deskripsi alarm: Alarm ketika pemanfaatan CPU kontainer rata-rata melebihi 80% pada tingkat kontainer.

Maksud: Men deteksi pemanfaatan CPU yang tinggi.

Kriteria PromQL: avg({__name__="ContainerCpuUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ContainerName="your-container-name",ClusterName="your-cluster-name",ServiceName="your-service-name"}) > 80

Ambang batas yang disarankan: 80 (tertanam dalam kueri)

Pembenaran ambang batas: 80% memberikan ruang kepala sebelum saturasi.

Interval evaluasi: 60

Periode tertunda: 300

Periode pemulihan: 300

ContainerMemoryUtilization (tingkat cluster)

Label: ClusterName

Deskripsi alarm: Alarm ketika pemanfaatan memori kontainer rata-rata melebihi 80% di tingkat cluster.

Maksud: Men deteksi pemanfaatan memori yang tinggi.

Kriteria PromQL: avg({__name__="ContainerMemoryUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name"}) > 80

Ambang batas yang disarankan: 80 (tertanam dalam kueri)

Pembenaran ambang batas: 80% memberikan ruang kepala sebelum saturasi.

Interval evaluasi: 60

Periode tertunda: 300

Periode pemulihan: 300

ContainerMemoryUtilization (tingkat kontainer)

Label: ContainerName, ClusterName, ServiceName

Deskripsi alarm: Alarm ketika pemanfaatan memori kontainer rata-rata melebihi 80% pada tingkat kontainer.

Maksud: Men deteksi pemanfaatan memori yang tinggi.

Kriteria PromQL: avg({__name__="ContainerMemoryUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ContainerName="your-container-name",ClusterName="your-cluster-name",ServiceName="your-service-name"}) > 80

Ambang batas yang disarankan: 80 (tertanam dalam kueri)

Pembenaran ambang batas: 80% memberikan ruang kepala sebelum saturasi.

Interval evaluasi: 60

Periode tertunda: 300

Periode pemulihan: 300

TaskEBSfilesystemUtilization

Label: ClusterName, ServiceName

Deskripsi alarm: Alarm ketika pemanfaatan sistem file EBS rata-rata melebihi 80% untuk tugas.

Maksud: Men deteksi pemanfaatan sistem file EBS yang tinggi.

Kriteria PromQL: avg({__name__="TaskEBSfilesystemUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name",ServiceName="your-service-name"}) > 80

Ambang batas yang disarankan: 80 (tertanam dalam kueri)

Pembenaran ambang batas: 80% memberikan ruang kepala sebelum saturasi.

Interval evaluasi: 60

Periode tertunda: 300

Periode pemulihan: 300

TaskEphemeralStorageUtilization (tingkat cluster)

Label: ClusterName

Deskripsi alarm: Alarm ketika pemanfaatan penyimpanan sementara rata-rata melebihi 80% di tingkat cluster.

Maksud: Men deteksi pemanfaatan penyimpanan sementara yang tinggi.

Kriteria PromQL: avg({__name__="TaskEphemeralStorageUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name"}) > 80

Ambang batas yang disarankan: 80 (tertanam dalam kueri)

Pembenaran ambang batas: 80% memberikan ruang kepala sebelum saturasi.

Interval evaluasi: 60

Periode tertunda: 300

Periode pemulihan: 300

TaskEphemeralStorageUtilization (tingkat layanan)

Label: ClusterName, ServiceName

Deskripsi alarm: Alarm ketika pemanfaatan penyimpanan sementara rata-rata melebihi 80% pada tingkat layanan.

Maksud: Men deteksi pemanfaatan penyimpanan sementara yang tinggi.

Kriteria PromQL: avg({__name__="TaskEphemeralStorageUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name",ServiceName="your-service-name"}) > 80

Ambang batas yang disarankan: 80 (tertanam dalam kueri)

Pembenaran ambang batas: 80% memberikan ruang kepala sebelum saturasi.

Interval evaluasi: 60

Periode tertunda: 300

Periode pemulihan: 300

PercentIOLimit

Label: FileSystemId

Deskripsi alarm: Alarm ketika sistem file EFS mencapai 100% dari bat I/O asnya.

Maksud: Mendeteksi ketika sistem file mencapai I/O batas.

Kriteria PromQL: avg({__name__="PercentIOLimit", "@instrumentation.@name"="cloudwatch.aws/efs", FileSystemId="your-filesystem-id"}) >= 100

Ambang batas yang disarankan: 100 (tertanam dalam kueri)

Pembenaran ambang batas: Pada 100% sistem file menjadi hambatan.

Interval evaluasi: 60

Periode tertunda: 900

Periode pemulihan: 900

BurstCreditBalance

Label: FileSystemId

Deskripsi alarm: Alarm saat saldo kredit burst turun ke nol untuk sistem file EFS.

Maksud: Men deteksi kredit burst yang habis yang menyebabkan perlambatan throughput.

Kriteria PromQL: avg({__name__="BurstCreditBalance", "@instrumentation.@name"="cloudwatch.aws/efs", FileSystemId="your-filesystem-id"}) <= 0

Ambang batas yang disarankan: 0 (tertanam dalam kueri)

Pembenaran ambang batas: Nol kredit menyebabkan penurunan throughput.

Interval evaluasi: 60

Periode tertunda: 900

Periode pemulihan: 900

node_cpu_utilization

Label: ClusterName

Deskripsi alarm: Alarm ketika pemanfaatan CPU maksimum melebihi 80% pada node pekerja EKS.

Maksud: Mendeteksi CPU tinggi pada node pekerja.

Kriteria PromQL: max({__name__="node_cpu_utilization", "@instrumentation.@name"="cloudwatch.aws/eks-containerinsights", ClusterName="your-cluster-name"}) > 80

Ambang batas yang disarankan: 80 (tertanam dalam kueri)

Pembenaran ambang batas: 80% memberikan ruang kepala sebelum saturasi.

Interval evaluasi: 60

Periode tertunda: 300

Periode pemulihan: 300

node_filesystem_utilization

Label: ClusterName

Deskripsi alarm: Alarm saat pemanfaatan sistem file maksimum melebihi ambang batas pada node pekerja EKS.

Maksud: Mendeteksi penggunaan sistem file yang tinggi pada node pekerja.

Kriteria PromQL: max({__name__="node_filesystem_utilization", "@instrumentation.@name"="cloudwatch.aws/eks-containerinsights", ClusterName="your-cluster-name"}) > THRESHOLD

Ambang batas yang disarankan: THRESHOLD (tertanam dalam kueri)

Pembenaran ambang batas: Tet apkan berdasarkan kapasitas penyimpanan dan pola penggunaan node Anda.

Interval evaluasi: 60

Periode tertunda: 300

Periode pemulihan: 300

node_memory_utilization

Label: ClusterName

Deskripsi alarm: Alarm ketika pemanfaatan memori maksimum melebihi 80% pada node pekerja EKS.

Maksud: Mendeteksi memori tinggi pada node pekerja.

Kriteria PromQL: max({__name__="node_memory_utilization", "@instrumentation.@name"="cloudwatch.aws/eks-containerinsights", ClusterName="your-cluster-name"}) > 80

Ambang batas yang disarankan: 80 (tertanam dalam kueri)

Pembenaran ambang batas: 80% memberikan ruang kepala sebelum saturasi.

Interval evaluasi: 60

Periode tertunda: 300

Periode pemulihan: 300

pod_cpu_utilization_over_pod_limit

Tags: ClusterName, Namespace, Layanan

Deskripsi alarm: Alarm saat pemanfaatan CPU pod melebihi 80% dari batasnya.

Maksud: Mendeteksi pod mendekati batas CPU.

Kriteria PromQL: max({__name__="pod_cpu_utilization_over_pod_limit", "@instrumentation.@name"="cloudwatch.aws/eks-containerinsights", ClusterName="your-cluster-name",Namespace="your-namespace",Service="your-service"}) > 80

Ambang batas yang disarankan: 80 (tertanam dalam kueri)

Pembenaran ambang batas: 80% memberikan ruang kepala sebelum pelambatan terjadi.

Interval evaluasi: 60

Periode tertunda: 300

Periode pemulihan: 300

pod_memory_utilization_over_pod_limit

Tags: ClusterName, Namespace, Layanan

Deskripsi alarm: Alarm saat pemanfaatan memori pod melebihi 80% dari batasnya.

Maksud: Mendeteksi pod mendekati batas memori.

Kriteria PromQL: max({__name__="pod_memory_utilization_over_pod_limit", "@instrumentation.@name"="cloudwatch.aws/eks-containerinsights", ClusterName="your-cluster-name",Namespace="your-namespace",Service="your-service"}) > 80

Ambang batas yang disarankan: 80 (tertanam dalam kueri)

Pembenaran ambang batas: 80% memberikan ruang kepala sebelum oomKill terjadi.

Interval evaluasi: 60

Periode tertunda: 300

Periode pemulihan: 300

CPUUtilization

Label: CacheClusterId, CacheNodeId

Deskripsi alarm: Alarm ketika pemanfaatan CPU rata-rata melebihi ambang batas untuk ElastiCache node.

Intent: Mendeteksi CPU tinggi di seluruh instance.

Kriteria PromQL: avg({__name__="CPUUtilization", "@instrumentation.@name"="cloudwatch.aws/elasticache", CacheClusterId="your-cache-cluster-id",CacheNodeId="your-cache-node-id"}) > THRESHOLD

Ambang batas yang disarankan: THRESHOLD (tertanam dalam kueri)

Pembenaran ambang batas: Tet apkan berdasarkan jenis node dan karakteristik beban kerja Anda.

Interval evaluasi: 60

Periode tertunda: 300

Periode pemulihan: 300

CurrConnections

Label: CacheClusterId, CacheNodeId

Deskripsi alarm: Alarm saat jumlah koneksi melebihi ambang batas untuk ElastiCache node.

Maksud: Mendeteksi jumlah koneksi yang tinggi.

Kriteria PromQL: avg({__name__="CurrConnections", "@instrumentation.@name"="cloudwatch.aws/elasticache", CacheClusterId="your-cache-cluster-id",CacheNodeId="your-cache-node-id"}) > THRESHOLD

Ambang batas yang disarankan: THRESHOLD (tertanam dalam kueri)

Pembenaran ambang batas: Tet apkan berdasarkan ukuran kumpulan koneksi yang diharapkan dan kebutuhan aplikasi.

Interval evaluasi: 60

Periode tertunda: 600

Periode pemulihan: 600

DatabaseMemoryUsagePercentage

Label: CacheClusterId

Deskripsi alarm: Alarm saat penggunaan memori database melebihi ambang batas untuk ElastiCache cluster.

Maksud: Mendeteksi penggunaan memori yang tinggi untuk mencegah kegagalan penulisan.

Kriteria PromQL: avg({__name__="DatabaseMemoryUsagePercentage", "@instrumentation.@name"="cloudwatch.aws/elasticache", CacheClusterId="your-cache-cluster-id"}) > THRESHOLD

Ambang batas yang disarankan: THRESHOLD (tertanam dalam kueri)

Pembenaran ambang batas: Tet apkan berdasarkan kebijakan penggusuran dan kekritisan data Anda.

Interval evaluasi: 60

Periode tertunda: 300

Periode pemulihan: 300

EngineCPUUtilization

Label: CacheClusterId

Deskripsi alarm: Alarm saat pemanfaatan CPU mesin Redis melebihi 90% untuk ElastiCache cluster.

Maksud: Men deteksi pemanfaatan CPU mesin Redis yang tinggi.

Kriteria PromQL: avg({__name__="EngineCPUUtilization", "@instrumentation.@name"="cloudwatch.aws/elasticache", CacheClusterId="your-cache-cluster-id"}) > 90

Ambang yang disarankan: 90 (tertanam dalam kueri)

Pembenaran ambang batas: Redis adalah single-thread; lebih besar dari 90% menunjukkan saturasi.

Interval evaluasi: 60

Periode tertunda: 300

Periode pemulihan: 300

ReplicationLag

Label: CacheClusterId

Deskripsi alarm: Alarm saat jeda replikasi melebihi ambang batas untuk ElastiCache cluster.

Maksud: Men deteksi penundaan replikasi yang mempengaruhi konsistensi data.

Kriteria PromQL: avg({__name__="ReplicationLag", "@instrumentation.@name"="cloudwatch.aws/elasticache", CacheClusterId="your-cache-cluster-id"}) > THRESHOLD

Ambang batas yang disarankan: THRESHOLD (tertanam dalam kueri)

Pembenaran ambang batas: Tet apkan berdasarkan toleransi aplikasi Anda untuk pembacaan basi.

Interval evaluasi: 60

Periode tertunda: 900

Periode pemulihan: 900

GPUConnectivityCheckFailed

Label: InstanceId, EGpuid

Deskripsi alarm: Alarm saat akselerator Elastic Graphics kehilangan konektivitas ke instance.

Maksud: Men deteksi masalah konektivitas ke akselerator Elastic Graphics.

Kriteria PromQL: max({__name__="GPUConnectivityCheckFailed", "@instrumentation.@name"="cloudwatch.aws/elasticgpus", InstanceId="your-instance-id",EGPUId="your-egpu-id"}) > 0

Ambang batas yang disarankan: 0 (tertanam dalam kueri)

Pembenaran ambang batas: Setiap kegagalan konektivitas memerlukan penyelidikan.

Interval evaluasi: 300

Periode tertunda: 900

Periode pemulihan: 900

GPUHealthCheckFailed

Label: InstanceId, EGpuid

Deskripsi alarm: Alarm saat pemeriksaan kesehatan akselerator Elastic Graphics gagal.

Maksud: Men deteksi akselerator Grafik Elastis yang tidak sehat.

Kriteria PromQL: max({__name__="GPUHealthCheckFailed", "@instrumentation.@name"="cloudwatch.aws/elasticgpus", InstanceId="your-instance-id",EGPUId="your-egpu-id"}) > 0

Ambang batas yang disarankan: 0 (tertanam dalam kueri)

Pembenaran ambang batas: Kegagalan pemeriksaan kesehatan menunjukkan masalah akselerator.

Interval evaluasi: 300

Periode tertunda: 900

Periode pemulihan: 900

TargetErrorThrottledCount

Deskripsi alarm: Alarm saat pemanggilan target jadwal dibatasi.

Maksud: Men deteksi pelambatan target yang menyebabkan penundaan jadwal.

Kriteria PromQL: sum({__name__="TargetErrorThrottledCount", "@instrumentation.@name"="cloudwatch.aws/scheduler"}) > 0

Ambang batas yang disarankan: 0 (tertanam dalam kueri)

Pembenaran ambang batas: Setiap pelambatan menunjukkan masalah kapasitas target.

Interval evaluasi: 60

Periode tertunda: 900

Periode pemulihan: 900

InvocationThrottleCount

Deskripsi alarm: Alarm saat pemanggilan Scheduler dibatasi.

Maksud: Men deteksi pembatasan pemanggilan Penjadwal.

Kriteria PromQL: sum({__name__="InvocationThrottleCount", "@instrumentation.@name"="cloudwatch.aws/scheduler"}) > 0

Ambang batas yang disarankan: 0 (tertanam dalam kueri)

Pembenaran ambang batas: Pembatasan menunda eksekusi terjadwal.

Interval evaluasi: 60

Periode tertunda: 900

Periode pemulihan: 900

InvocationDroppedCount

Deskripsi alarm: Alarm saat pemanggilan terjadwal dijatuhkan.

Maksud: Men deteksi panggilan yang terputus.

Kriteria PromQL: sum({__name__="InvocationDroppedCount", "@instrumentation.@name"="cloudwatch.aws/scheduler"}) > 0

Ambang batas yang disarankan: 0 (tertanam dalam kueri)

Pembenaran ambang batas: Panggilan yang dibatalkan mewakili peristiwa terjadwal yang hilang.

Interval evaluasi: 60

Periode tertunda: 60

Periode pemulihan: 60

InvocationsFailedToBeSentToDeadLetterCount

Deskripsi alarm: Alarm saat pemanggilan gagal tidak dapat dikirim ke antrian huruf mati.

Maksud: Mendeteksi kegagalan pengiriman DLQ.

Kriteria PromQL: sum({__name__="InvocationsFailedToBeSentToDeadLetterCount", "@instrumentation.@name"="cloudwatch.aws/scheduler"}) > 0

Ambang batas yang disarankan: 0 (tertanam dalam kueri)

Pembenaran ambang batas: Pengiriman DLQ gagal berarti informasi kesalahan hilang.

Interval evaluasi: 60

Periode tertunda: 900

Periode pemulihan: 900

GetRecords.IteratorAgeMilliseconds

Label: StreamName

Deskripsi alarm: Alarm saat usia iterator konsumen melebihi ambang batas untuk aliran Kinesis.

Maksud: Mendeteksi data yang tertinggal dari periode retensi yang berisiko kehilangan data.

Kriteria PromQL: max({__name__="GetRecords.IteratorAgeMilliseconds", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="your-stream-name"}) > THRESHOLD

Ambang batas yang disarankan: THRESHOLD (tertanam dalam kueri)

Pembenaran ambang batas: Tet apkan berdasarkan persentase periode retensi aliran.

Interval evaluasi: 60

Periode tertunda: 900

Periode pemulihan: 900

GetRecords.Success

Label: StreamName

Deskripsi alarm: Alarm saat tingkat GetRecords keberhasilan turun di bawah ambang batas untuk aliran Kinesis.

Maksud: Mendeteksi kegagalan pengambilan konsumen.

Kriteria PromQL: avg({__name__="GetRecords.Success", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="your-stream-name"}) < THRESHOLD

Ambang batas yang disarankan: THRESHOLD (tertanam dalam kueri)

Pembenaran ambang batas: Tet apkan berdasarkan tingkat keberhasilan yang diharapkan.

Interval evaluasi: 60

Periode tertunda: 300

Periode pemulihan: 300

PutRecord.Success

Label: StreamName

Deskripsi alarm: Alarm saat tingkat PutRecord keberhasilan turun di bawah ambang batas untuk aliran Kinesis.

Maksud: Mendeteksi kegagalan konsumsi produsen.

Kriteria PromQL: avg({__name__="PutRecord.Success", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="your-stream-name"}) < THRESHOLD

Ambang batas yang disarankan: THRESHOLD (tertanam dalam kueri)

Pembenaran ambang batas: Tet apkan berdasarkan tingkat keberhasilan yang diharapkan.

Interval evaluasi: 60

Periode tertunda: 300

Periode pemulihan: 300

PutRecords.FailedRecords

Label: StreamName

Deskripsi alarm: Alarm saat operasi batch put menghasilkan catatan yang gagal untuk aliran Kinesis.

Maksud: Mendeteksi kegagalan batch put.

Kriteria PromQL: sum({__name__="PutRecords.FailedRecords", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="your-stream-name"}) > THRESHOLD

Ambang batas yang disarankan: THRESHOLD (tertanam dalam kueri)

Pembenaran ambang batas: Tet apkan berdasarkan jumlah kegagalan yang dapat diterima.

Interval evaluasi: 60

Periode tertunda: 300

Periode pemulihan: 300

ReadProvisionedThroughputExceeded

Label: StreamName

Deskripsi alarm: Alarm saat pembacaan konsumen melebihi throughput yang disediakan untuk aliran Kinesis.

Maksud: Men deteksi pembatasan pembacaan konsumen.

Kriteria PromQL: avg({__name__="ReadProvisionedThroughputExceeded", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="your-stream-name"}) > THRESHOLD

Ambang batas yang disarankan: THRESHOLD (tertanam dalam kueri)

Pembenaran ambang batas: Setiap pelambatan berkelanjutan menunjukkan kebutuhan kapasitas.

Interval evaluasi: 60

Periode tertunda: 300

Periode pemulihan: 300

SubscribeToShardEvent.MillisBehindLatest

Label: StreamName, ConsumerName

Deskripsi alarm: Alarm saat konsumen fan-out yang ditingkatkan tertinggal dari rekor terbaru.

Maksud: Mendeteksi kelambatan pemrosesan konsumen yang ditingkatkan.

Kriteria PromQL: avg({__name__="SubscribeToShardEvent.MillisBehindLatest", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="your-stream-name",ConsumerName="your-consumer-name"}) > THRESHOLD

Ambang batas yang disarankan: THRESHOLD (tertanam dalam kueri)

Pembenaran ambang batas: Tetapkan berdasarkan penundaan pemrosesan yang dapat diterima.

Interval evaluasi: 60

Periode tertunda: 300

Periode pemulihan: 300

WriteProvisionedThroughputExceeded

Label: StreamName

Deskripsi alarm: Alarm saat produsen menulis melebihi throughput yang disediakan untuk aliran Kinesis.

Maksud: Mendeteksi pembatasan tulis produsen.

Kriteria PromQL: avg({__name__="WriteProvisionedThroughputExceeded", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="your-stream-name"}) > THRESHOLD

Ambang batas yang disarankan: THRESHOLD (tertanam dalam kueri)

Pembenaran ambang batas: Pelambatan berkelanjutan menunjukkan kebutuhan kapasitas.

Interval evaluasi: 60

Periode tertunda: 300

Periode pemulihan: 300

ClaimedAccountConcurrency

Deskripsi alarm: Alarm saat konkurensi akun yang diklaim melebihi ambang batas.

Maksud: Mendeteksi akun mendekati kuota konkurensi.

Kriteria PromQL: max({__name__="ClaimedAccountConcurrency", "@instrumentation.@name"="cloudwatch.aws/lambda"}) > THRESHOLD

Ambang batas yang disarankan: THRESHOLD (tertanam dalam kueri)

Pembenaran ambang batas: Setel ke persentase batas konkurensi regional.

Interval evaluasi: 60

Periode tertunda: 600

Periode pemulihan: 600

Kesalahan

Label: FunctionName

Deskripsi alarm: Alarm ketika jumlah kesalahan fungsi melebihi ambang batas untuk fungsi Lambda.

Maksud: Mendeteksi jumlah kesalahan fungsi yang tinggi.

Kriteria PromQL: sum({__name__="Errors", "@instrumentation.@name"="cloudwatch.aws/lambda", FunctionName="your-function-name"}) > THRESHOLD

Ambang batas yang disarankan: THRESHOLD (tertanam dalam kueri)

Pembenaran ambang batas: Tet apkan berdasarkan volume kesalahan yang dapat diterima.

Interval evaluasi: 60

Periode tertunda: 180

Periode pemulihan: 300

Pembatasan

Label: FunctionName

Deskripsi alarm: Alarm saat pemanggilan fungsi dibatasi untuk fungsi Lambda.

Maksud: Men deteksi pembatasan pemanggilan fungsi.

Kriteria PromQL: sum({__name__="Throttles", "@instrumentation.@name"="cloudwatch.aws/lambda", FunctionName="your-function-name"}) > THRESHOLD

Ambang batas yang disarankan: THRESHOLD (tertanam dalam kueri)

Pembenaran ambang batas: Throttling menunjukkan batas konkurensi tercapai.

Interval evaluasi: 60

Periode tertunda: 300

Periode pemulihan: 300

Durasi

Label: FunctionName

Deskripsi alarm: Alarm ketika durasi fungsi p90 melebihi ambang batas untuk fungsi Lambda.

Maksud: Men deteksi pemanggilan fungsi yang berjalan lama.

Kriteria PromQL: histogram_quantile(0.9, {__name__="Duration", "@instrumentation.@name"="cloudwatch.aws/lambda", FunctionName="your-function-name"}) > THRESHOLD

Ambang batas yang disarankan: THRESHOLD (tertanam dalam kueri)

Pembenaran ambang batas: Tet apkan relatif ke batas waktu fungsi.

Interval evaluasi: 60

Periode tertunda: 900

Periode pemulihan: 900

ConcurrentExecutions

Label: FunctionName

Deskripsi alarm: Alarm saat eksekusi bersamaan melebihi ambang batas untuk fungsi Lambda.

Intent: Mendeteksi fungsi mendekati batas konkurensi.

Kriteria PromQL: max({__name__="ConcurrentExecutions", "@instrumentation.@name"="cloudwatch.aws/lambda", FunctionName="your-function-name"}) > THRESHOLD

Ambang batas yang disarankan: THRESHOLD (tertanam dalam kueri)

Pembenaran ambang batas: Setel ke persentase konkurensi yang dicadangkan.

Interval evaluasi: 60

Periode tertunda: 600

Periode pemulihan: 600

memory_utilization

Label: function_name

Deskripsi alarm: Alarm ketika pemanfaatan memori rata-rata melebihi 90% untuk fungsi Lambda.

Maksud: Mendeteksi fungsi mendekati batas memori yang dikonfigurasi.

Kriteria PromQL: avg({__name__="memory_utilization", "@instrumentation.@name"="cloudwatch.aws/lambda-insights", function_name="your-function-name"}) > 90

Ambang yang disarankan: 90 (tertanam dalam kueri)

Pembenaran ambang batas: Di atas 90% berisiko kegagalan memori.

Interval evaluasi: 60

Periode tertunda: 600

Periode pemulihan: 600

ErrorPortAllocation

Label: NatGatewayId

Deskripsi alarm: Alarm saat gateway NAT gagal mengalokasikan port untuk koneksi baru.

Maksud: Mendeteksi kegagalan alokasi port yang mencegah koneksi baru.

Kriteria PromQL: sum({__name__="ErrorPortAllocation", "@instrumentation.@name"="cloudwatch.aws/natgateway", NatGatewayId="your-nat-gateway-id"}) > 0

Ambang batas yang disarankan: 0 (tertanam dalam kueri)

Pembenaran ambang batas: Setiap kegagalan alokasi berdampak pada konektivitas.

Interval evaluasi: 60

Periode tertunda: 900

Periode pemulihan: 900

PacketsDropCount

Label: NatGatewayId

Deskripsi alarm: Alarm saat gateway NAT menjatuhkan paket melebihi ambang batas.

Maksud: Mendeteksi penurunan paket yang menunjukkan kapasitas atau masalah konektivitas.

Kriteria PromQL: sum({__name__="PacketsDropCount", "@instrumentation.@name"="cloudwatch.aws/natgateway", NatGatewayId="your-nat-gateway-id"}) > THRESHOLD

Ambang batas yang disarankan: THRESHOLD (tertanam dalam kueri)

Pembenaran ambang batas: Tet apkan berdasarkan tingkat penurunan yang dapat diterima.

Interval evaluasi: 60

Periode tertunda: 300

Periode pemulihan: 300

PacketsDropped

Label: VpcId, VpcEndpointId, EndpointType, SubnetId, ServiceName

Deskripsi alarm: Alarm ketika titik akhir VPC menjatuhkan paket melebihi ambang batas.

Maksud: Men deteksi titik akhir atau layanan titik akhir yang tidak sehat.

Kriteria PromQL: sum({__name__="PacketsDropped", "@instrumentation.@name"="cloudwatch.aws/privatelinkendpoints", VpcId="your-vpc-id",VpcEndpointId="your-vpc-endpoint-id",EndpointType="your-endpoint-type",SubnetId="your-subnet-id",ServiceName="your-service-name"}) > THRESHOLD

Ambang batas yang disarankan: THRESHOLD (tertanam dalam kueri)

Pembenaran ambang batas: Tet apkan berdasarkan tingkat penurunan yang dapat diterima.

Interval evaluasi: 60

Periode tertunda: 300

Periode pemulihan: 300

RstPacketsSent

Label: ServiceId, LoadBalancerArn, Az

Deskripsi alarm: Alarm saat tingkat paket RST melebihi ambang batas untuk layanan titik akhir.

Maksud: Mendeteksi target layanan titik akhir yang tidak sehat.

Kriteria PromQL: sum({__name__="RstPacketsSent", "@instrumentation.@name"="cloudwatch.aws/privatelinkservices", ServiceId="SVC",LoadBalancerArn="LB",Az="AZ"}) > THRESHOLD

Ambang batas yang disarankan: THRESHOLD (tertanam dalam kueri)

Pembenaran ambang batas: Tet apkan berdasarkan tingkat paket RST yang dapat diterima.

Interval evaluasi: 60

Periode tertunda: 300

Periode pemulihan: 300

CPUUtilization

Label: DBInstanceIdentifier

Deskripsi alarm: Alarm saat pemanfaatan CPU rata-rata melebihi 90% untuk instance RDS.

Maksud: Mendeteksi CPU tinggi mencegah penurunan kinerja.

Kriteria PromQL: avg({__name__="CPUUtilization", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > 90

Ambang yang disarankan: 90 (tertanam dalam kueri)

Pembenaran ambang batas: 90% menunjukkan mendekati saturasi.

Interval evaluasi: 60

Periode tertunda: 300

Periode pemulihan: 300

DatabaseConnections

Label: DBInstanceIdentifier

Deskripsi alarm: Alarm saat koneksi database melebihi ambang batas untuk instance RDS.

Maksud: Mencegah koneksi yang ditolak pada batas maksimum.

Kriteria PromQL: avg({__name__="DatabaseConnections", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > THRESHOLD

Ambang batas yang disarankan: THRESHOLD (tertanam dalam kueri)

Pembenaran ambang batas: Setel ke persentase parameter max_connections.

Interval evaluasi: 60

Periode tertunda: 300

Periode pemulihan: 300

EBSByteBalance%

Label: DBInstanceIdentifier

Deskripsi alarm: Alarm saat saldo byte EBS turun di bawah 10% untuk instance RDS.

Maksud: Mendeteksi kredit throughput rendah yang menyebabkan kemacetan.

Kriteria PromQL: avg({__name__="EBSByteBalance%", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) < 10

Ambang batas yang disarankan: 10 (tertanam dalam kueri)

Pembenaran ambang batas: Di bawah 10% berisiko degradasi throughput.

Interval evaluasi: 60

Periode tertunda: 180

Periode pemulihan: 180

EBSIOBalance%

Label: DBInstanceIdentifier

Deskripsi alarm: Alarm saat saldo IO EBS turun di bawah 10% untuk instance RDS.

Maksud: Men deteksi kredit IOPS rendah yang menyebabkan kemacetan.

Kriteria PromQL: avg({__name__="EBSIOBalance%", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) < 10

Ambang batas yang disarankan: 10 (tertanam dalam kueri)

Pembenaran ambang batas: Di bawah 10% berisiko degradasi IOPS.

Interval evaluasi: 60

Periode tertunda: 180

Periode pemulihan: 180

FreeableMemory

Label: DBInstanceIdentifier

Deskripsi alarm: Alarm saat memori bebas turun di bawah ambang batas untuk instance RDS.

Maksud: Menc egah kehabisan memori yang menyebabkan koneksi ditolak.

Kriteria PromQL: avg({__name__="FreeableMemory", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) < THRESHOLD

Ambang batas yang disarankan: THRESHOLD (tertanam dalam kueri)

Pembenaran ambang batas: Tet apkan berdasarkan memori kelas instance.

Interval evaluasi: 60

Periode tertunda: 900

Periode pemulihan: 900

FreeLocalStorage

Label: DBInstanceIdentifier

Deskripsi alarm: Alarm saat penyimpanan lokal gratis turun di bawah ambang batas untuk instance Aurora.

Maksud: M encegah kehabisan penyimpanan lokal Aurora.

Kriteria PromQL: avg({__name__="FreeLocalStorage", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) < THRESHOLD

Ambang batas yang disarankan: THRESHOLD (tertanam dalam kueri)

Pembenaran ambang batas: Tet apkan berdasarkan minimum yang diperlukan untuk operasi.

Interval evaluasi: 60

Periode tertunda: 300

Periode pemulihan: 300

FreeStorageSpace

Label: DBInstanceIdentifier

Deskripsi alarm: Alarm saat ruang penyimpanan kosong turun di bawah ambang batas untuk instance RDS.

Maksud: M encegah downtime penuh penyimpanan.

Kriteria PromQL: min({__name__="FreeStorageSpace", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) < THRESHOLD

Ambang batas yang disarankan: THRESHOLD (tertanam dalam kueri)

Pembenaran ambang batas: Tet apkan berdasarkan tingkat pertumbuhan penyimpanan dan ukuran yang disediakan.

Interval evaluasi: 60

Periode tertunda: 300

Periode pemulihan: 300

MaximumUsedTransactionIDs

Label: DBInstanceIdentifier

Deskripsi alarm: Alarm saat ID transaksi maksimum yang digunakan melebihi 1 miliar untuk instans RDS.

Maksud: M encegah pembungkus ID transaksi PostgreSQL.

Kriteria PromQL: avg({__name__="MaximumUsedTransactionIDs", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > 1000000000

Ambang yang disarankan: 1000000000 (tertanam dalam kueri)

Pembenaran ambang batas: 1 miliar menunjukkan bahaya yang mendekat.

Interval evaluasi: 60

Periode tertunda: 60

Periode pemulihan: 60

ReadLatency

Label: DBInstanceIdentifier

Deskripsi alarm: Alarm saat latensi baca p90 melebihi ambang batas untuk instance RDS.

Maksud: Mendeteksi latensi baca tinggi yang menunjukkan masalah disk.

Kriteria PromQL: histogram_quantile(0.9, {__name__="ReadLatency", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > THRESHOLD

Ambang batas yang disarankan: THRESHOLD (tertanam dalam kueri)

Pembenaran ambang batas: Tet apkan berdasarkan latensi aplikasi yang dapat diterima.

Interval evaluasi: 60

Periode tertunda: 300

Periode pemulihan: 300

ReplicaLag

Label: DBInstanceIdentifier

Deskripsi alarm: Alarm saat jeda replikasi melebihi 60 detik untuk replika baca RDS.

Maksud: Men deteksi penundaan replikasi yang berisiko kehilangan data.

Kriteria PromQL: max({__name__="ReplicaLag", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > 60

Ambang batas yang disarankan: 60 (tertanam dalam kueri)

Pembenaran ambang batas: 60 detik mewakili jeda yang signifikan untuk sebagian besar beban kerja.

Interval evaluasi: 60

Periode tertunda: 600

Periode pemulihan: 600

WriteLatency

Label: DBInstanceIdentifier

Deskripsi alarm: Alarm saat latensi tulis p90 melebihi ambang batas untuk instance RDS.

Maksud: Mendeteksi latensi tulis tinggi yang menunjukkan masalah disk.

Kriteria PromQL: histogram_quantile(0.9, {__name__="WriteLatency", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > THRESHOLD

Ambang batas yang disarankan: THRESHOLD (tertanam dalam kueri)

Pembenaran ambang batas: Tet apkan berdasarkan latensi aplikasi yang dapat diterima.

Interval evaluasi: 60

Periode tertunda: 300

Periode pemulihan: 300

DBLoad

Label: DBInstanceIdentifier

Deskripsi alarm: Alarm saat beban database rata-rata melebihi ambang batas untuk instance RDS.

Maksud: Mendeteksi beban database yang tinggi yang menurunkan kinerja.

Kriteria PromQL: avg({__name__="DBLoad", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > THRESHOLD

Ambang batas yang disarankan: THRESHOLD (tertanam dalam kueri)

Pembenaran ambang batas: Setel ke kelipatan jumlah vCPU.

Interval evaluasi: 60

Periode tertunda: 900

Periode pemulihan: 900

AuroraVolumeBytesLeftTotal

Label: DBClusterIdentifier

Deskripsi alarm: Alarm saat sisa byte penyimpanan cluster Aurora turun di bawah ambang batas.

Maksud: M encegah kehabisan penyimpanan cluster Aurora.

Kriteria PromQL: avg({__name__="AuroraVolumeBytesLeftTotal", "@instrumentation.@name"="cloudwatch.aws/rds", DBClusterIdentifier="CLUSTER"}) < THRESHOLD

Ambang batas yang disarankan: THRESHOLD (tertanam dalam kueri)

Pembenaran ambang batas: Tet apkan berdasarkan tingkat pertumbuhan.

Interval evaluasi: 60

Periode tertunda: 300

Periode pemulihan: 300

AuroraBinlogReplicaLag

Label: DBClusterIdentifier

Deskripsi alarm: Alarm saat jeda replika binlog Aurora menunjukkan status kesalahan.

Maksud: Mendeteksi kesalahan replikasi instance penulis.

Kriteria PromQL: avg({__name__="AuroraBinlogReplicaLag", "@instrumentation.@name"="cloudwatch.aws/rds", DBClusterIdentifier="CLUSTER"}) <= -1

Ambang yang disarankan: -1 (tertanam dalam kueri)

Pembenaran ambang batas: -1 menunjukkan keadaan kesalahan.

Interval evaluasi: 60

Periode tertunda: 120

Periode pemulihan: 120

BlockedTransactions

Label: DBInstanceIdentifier

Deskripsi alarm: Alarm saat jumlah transaksi yang diblokir melebihi ambang batas untuk instance RDS.

Maksud: Men deteksi pemblokiran transaksi yang menyebabkan penurunan kinerja.

Kriteria PromQL: avg({__name__="BlockedTransactions", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > THRESHOLD

Ambang batas yang disarankan: THRESHOLD (tertanam dalam kueri)

Pembenaran ambang batas: Tet apkan berdasarkan jumlah transaksi yang diblokir yang dapat diterima.

Interval evaluasi: 60

Periode tertunda: 300

Periode pemulihan: 300

BufferCacheHitRatio

Label: DBInstanceIdentifier

Deskripsi alarm: Alarm saat rasio hit cache buffer turun di bawah 80% untuk instance RDS.

Maksud: Mendeteksi efisiensi cache rendah yang menyebabkan penurunan kinerja.

Kriteria PromQL: avg({__name__="BufferCacheHitRatio", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) < 80

Ambang batas yang disarankan: 80 (tertanam dalam kueri)

Pembenaran ambang batas: Di bawah 80% menunjukkan disk yang berlebihan I/O.

Interval evaluasi: 60

Periode tertunda: 600

Periode pemulihan: 600

EngineUptime

Label: DBClusterIdentifier

Deskripsi alarm: Alarm saat waktu aktif mesin turun ke nol menunjukkan restart penulis Aurora.

Maksud: Mendeteksi waktu henti atau crash instans penulis Aurora.

Kriteria PromQL: avg({__name__="EngineUptime", "@instrumentation.@name"="cloudwatch.aws/rds", DBClusterIdentifier="CLUSTER"}) <= 0

Ambang batas yang disarankan: 0 (tertanam dalam kueri)

Pembenaran ambang batas: Waktu aktif nol menunjukkan restart instance.

Interval evaluasi: 60

Periode tertunda: 120

Periode pemulihan: 120

RollbackSegmentHistoryListLength

Label: DBInstanceIdentifier

Deskripsi alarm: Alarm saat panjang daftar riwayat segmen rollback melebihi 1 juta untuk instance Aurora.

Maksud: Men deteksi riwayat rollback tinggi yang menyebabkan degradasi CPU.

Kriteria PromQL: avg({__name__="RollbackSegmentHistoryListLength", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > 1000000

Ambang yang disarankan: 1000000 (tertanam dalam kueri)

Pembenaran ambang batas: Di atas 1M menyebabkan masalah kinerja.

Interval evaluasi: 60

Periode tertunda: 300

Periode pemulihan: 300

StorageNetworkThroughput

Label: DBClusterIdentifier

Deskripsi alarm: Alarm saat throughput jaringan penyimpanan melebihi ambang batas untuk cluster Aurora.

Maksud: Mendeteksi throughput tinggi yang berisiko jatuh paket jaringan.

Kriteria PromQL: avg({__name__="StorageNetworkThroughput", "@instrumentation.@name"="cloudwatch.aws/rds", DBClusterIdentifier="CLUSTER"}) > THRESHOLD

Ambang batas yang disarankan: THRESHOLD (tertanam dalam kueri)

Pembenaran ambang batas: Tet apkan berdasarkan kapasitas jaringan instance.

Interval evaluasi: 60

Periode tertunda: 300

Periode pemulihan: 300

HealthCheckStatus

Label: HealthCheckId

Deskripsi alarm: Alarm saat pemeriksaan kesehatan Route 53 melaporkan titik akhir yang tidak sehat.

Maksud: Mendeteksi titik akhir yang tidak sehat dengan menggunakan pemeriksa kesehatan Route 53.

Kriteria PromQL: avg({__name__="HealthCheckStatus", "@instrumentation.@name"="cloudwatch.aws/route53", HealthCheckId="HC"}) < 1

Ambang batas yang disarankan: 1 (tertanam dalam kueri)

Pembenaran ambang batas: Di bawah 1 menunjukkan titik akhir gagal dalam pemeriksaan kesehatan.

Interval evaluasi: 60

Periode tertunda: 180

Periode pemulihan: 180

4xxErrors

Label: BucketName, FilterId

Deskripsi alarm: Alarm saat tingkat kesalahan 4xx melebihi 5% untuk bucket S3.

Maksud: Mendeteksi tingkat kesalahan klien yang tidak normal.

Kriteria PromQL: avg({__name__="4xxErrors", "@instrumentation.@name"="cloudwatch.aws/s3", BucketName="BUCKET",FilterId="FILTER"}) > 0.05

Ambang batas yang disarankan: 0,05 (tertanam dalam kueri)

Pembenaran ambang batas: Di atas 5% menunjukkan masalah pengaturan atau akses.

Interval evaluasi: 60

Periode tertunda: 900

Periode pemulihan: 900

5xxErrors

Label: BucketName, FilterId

Deskripsi alarm: Alarm saat tingkat kesalahan 5xx melebihi 5% untuk bucket S3.

Maksud: Mendeteksi kesalahan sisi server yang mempengaruhi aplikasi.

Kriteria PromQL: avg({__name__="5xxErrors", "@instrumentation.@name"="cloudwatch.aws/s3", BucketName="BUCKET",FilterId="FILTER"}) > 0.05

Ambang batas yang disarankan: 0,05 (tertanam dalam kueri)

Pembenaran ambang batas: Di atas 5% menunjukkan masalah layanan S3.

Interval evaluasi: 60

Periode tertunda: 900

Periode pemulihan: 900

OperationsFailedReplication

Label: SourceBucket, DestinationBucket, RuleId

Deskripsi alarm: Alarm saat operasi replikasi S3 gagal untuk bucket.

Maksud: Men deteksi kegagalan replikasi yang mempertaruhkan inkonsistensi data.

Kriteria PromQL: max({__name__="OperationsFailedReplication", "@instrumentation.@name"="cloudwatch.aws/s3", SourceBucket="SRC",DestinationBucket="DST",RuleId="RULE"}) > 0

Ambang batas yang disarankan: 0 (tertanam dalam kueri)

Pembenaran ambang batas: Setiap replikasi yang gagal memerlukan penyelidikan.

Interval evaluasi: 60

Periode tertunda: 300

Periode pemulihan: 300

4xxErrors

Label: AccessPointName, DataSource ARN

Deskripsi alarm: Alarm saat tingkat kesalahan 4xx melebihi 5% untuk titik akses Lambda Objek S3.

Maksud: Mendeteksi tingkat kesalahan klien abnormal untuk Object Lambda.

Kriteria PromQL: avg({__name__="4xxErrors", "@instrumentation.@name"="cloudwatch.aws/s3objectlambda", AccessPointName="AP",DataSourceARN="ARN"}) > 0.05

Ambang batas yang disarankan: 0,05 (tertanam dalam kueri)

Pembenaran ambang batas: Di atas 5% menunjukkan masalah pengaturan.

Interval evaluasi: 60

Periode tertunda: 900

Periode pemulihan: 900

5xxErrors

Label: AccessPointName, DataSource ARN

Deskripsi alarm: Alarm saat tingkat kesalahan 5xx melebihi 5% untuk titik akses Lambda Objek S3.

Maksud: Men deteksi kesalahan sisi server di Object Lambda.

Kriteria PromQL: avg({__name__="5xxErrors", "@instrumentation.@name"="cloudwatch.aws/s3objectlambda", AccessPointName="AP",DataSourceARN="ARN"}) > 0.05

Ambang batas yang disarankan: 0,05 (tertanam dalam kueri)

Pembenaran ambang batas: Di atas 5% menunjukkan masalah Lambda atau S3.

Interval evaluasi: 60

Periode tertunda: 900

Periode pemulihan: 900

LambdaResponse4xx

Label: AccessPointName, DataSource ARN

Deskripsi alarm: Alarm ketika tingkat respons fungsi Lambda 4xx melebihi 5% untuk titik akses Lambda Objek S3.

Maksud: Mendeteksi kesalahan klien fungsi Lambda.

Kriteria PromQL: avg({__name__="LambdaResponse4xx", "@instrumentation.@name"="cloudwatch.aws/s3objectlambda", AccessPointName="AP",DataSourceARN="ARN"}) > 0.05

Ambang batas yang disarankan: 0,05 (tertanam dalam kueri)

Pembenaran ambang batas: Di atas 5% menunjukkan masalah fungsi Lambda.

Interval evaluasi: 60

Periode tertunda: 900

Periode pemulihan: 900

NumberOfMessagesPublished

Label: TopicName

Deskripsi alarm: Alarm saat jumlah pesan yang dipublikasikan turun di bawah ambang batas untuk topik SNS.

Maksud: Mendeteksi penurunan volume penerbitan yang signifikan.

Kriteria PromQL: sum({__name__="NumberOfMessagesPublished", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) < THRESHOLD

Ambang batas yang disarankan: THRESHOLD (tertanam dalam kueri)

Pembenaran ambang batas: Tet apkan berdasarkan lalu lintas minimum yang diharapkan.

Interval evaluasi: 60

Periode tertunda: 300

Periode pemulihan: 300

NumberOfNotificationsDelivered

Label: TopicName

Deskripsi alarm: Alarm saat jumlah notifikasi yang dikirimkan turun di bawah ambang batas untuk topik SNS.

Maksud: Mendeteksi penurunan volume pengiriman notifikasi.

Kriteria PromQL: sum({__name__="NumberOfNotificationsDelivered", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) < THRESHOLD

Ambang batas yang disarankan: THRESHOLD (tertanam dalam kueri)

Pembenaran ambang batas: Tet apkan berdasarkan pengiriman minimum yang diharapkan.

Interval evaluasi: 60

Periode tertunda: 300

Periode pemulihan: 300

NumberOfNotificationsFailed

Label: TopicName

Deskripsi alarm: Alarm saat jumlah pengiriman notifikasi gagal melebihi ambang batas untuk topik SNS.

Maksud: Mendeteksi kegagalan pengiriman.

Kriteria PromQL: sum({__name__="NumberOfNotificationsFailed", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) > THRESHOLD

Ambang batas yang disarankan: THRESHOLD (tertanam dalam kueri)

Pembenaran ambang batas: Tet apkan berdasarkan tingkat kegagalan yang dapat diterima.

Interval evaluasi: 60

Periode tertunda: 300

Periode pemulihan: 300

NumberOfNotificationsFilteredOut-InvalidAttributes

Label: TopicName

Deskripsi alarm: Alarm saat notifikasi disaring karena atribut pesan yang tidak valid.

Maksud: Mendeteksi atribut pesan yang tidak valid.

Kriteria PromQL: sum({__name__="NumberOfNotificationsFilteredOut-InvalidAttributes", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) > 0

Ambang batas yang disarankan: 0 (tertanam dalam kueri)

Pembenaran ambang batas: Setiap filter yang tidak valid menunjukkan kesalahan konfigurasi.

Interval evaluasi: 60

Periode tertunda: 300

Periode pemulihan: 300

NumberOfNotificationsFilteredOut-InvalidMessageBody

Label: TopicName

Deskripsi alarm: Alarm saat notifikasi disaring karena badan pesan yang tidak valid.

Maksud: Mendeteksi badan pesan yang tidak valid.

Kriteria PromQL: sum({__name__="NumberOfNotificationsFilteredOut-InvalidMessageBody", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) > 0

Ambang batas yang disarankan: 0 (tertanam dalam kueri)

Pembenaran ambang batas: Setiap filter yang tidak valid menunjukkan kesalahan konfigurasi.

Interval evaluasi: 60

Periode tertunda: 300

Periode pemulihan: 300

NumberOfNotificationsRedrivenToDlq

Label: TopicName

Deskripsi alarm: Alarm saat pemberitahuan dikirim ke antrian huruf mati untuk topik SNS.

Maksud: Mendeteksi pesan yang dikirim ke antrean surat mati.

Kriteria PromQL: sum({__name__="NumberOfNotificationsRedrivenToDlq", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) > 0

Ambang batas yang disarankan: 0 (tertanam dalam kueri)

Pembenaran ambang batas: Setiap pesan DLQ menunjukkan masalah pengiriman.

Interval evaluasi: 60

Periode tertunda: 300

Periode pemulihan: 300

NumberOfNotificationsFailedToRedriveToDlq

Label: TopicName

Deskripsi alarm: Alarm saat notifikasi gagal dikirim ke antrian huruf mati untuk topik SNS.

Maksud: Mendeteksi kegagalan pengiriman DLQ.

Kriteria PromQL: sum({__name__="NumberOfNotificationsFailedToRedriveToDlq", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) > 0

Ambang batas yang disarankan: 0 (tertanam dalam kueri)

Pembenaran ambang batas: DLQ gagal berarti pelacakan kesalahan hilang.

Interval evaluasi: 60

Periode tertunda: 300

Periode pemulihan: 300

SMSMonthToDateSpentUSD

Label: TopicName

Deskripsi alarm: Alarm saat pengeluaran SMS mendekati kuota akun untuk topik SNS.

Maksud: Men deteksi pengeluaran SMS mendekati kuota.

Kriteria PromQL: max({__name__="SMSMonthToDateSpentUSD", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) > THRESHOLD

Ambang batas yang disarankan: THRESHOLD (tertanam dalam kueri)

Pembenaran ambang batas: Tet apkan berdasarkan kuota SMS akun.

Interval evaluasi: 60

Periode tertunda: 300

Periode pemulihan: 300

SMSSuccessRate

Label: TopicName

Deskripsi alarm: Alarm saat tingkat keberhasilan pengiriman SMS turun di bawah ambang batas untuk topik SNS.

Maksud: Mendeteksi pengiriman SMS yang gagal.

Kriteria PromQL: avg({__name__="SMSSuccessRate", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) < THRESHOLD

Ambang batas yang disarankan: THRESHOLD (tertanam dalam kueri)

Pembenaran ambang batas: Tet apkan berdasarkan tingkat pengiriman yang dapat diterima.

Interval evaluasi: 60

Periode tertunda: 300

Periode pemulihan: 300

ApproximateAgeOfOldestMessage

Label: QueueName

Deskripsi alarm: Alarm saat usia pesan tertua melebihi ambang batas untuk antrian SQS.

Maksud: Mendeteksi pesan yang tidak diproses cukup cepat.

Kriteria PromQL: max({__name__="ApproximateAgeOfOldestMessage", "@instrumentation.@name"="cloudwatch.aws/sqs", QueueName="QUEUE"}) > THRESHOLD

Ambang batas yang disarankan: THRESHOLD (tertanam dalam kueri)

Pembenaran ambang batas: Tet apkan berdasarkan waktu pemrosesan pesan yang dapat diterima.

Interval evaluasi: 60

Periode tertunda: 900

Periode pemulihan: 900

ApproximateNumberOfMessagesNotVisible

Label: QueueName

Deskripsi alarm: Alarm saat jumlah pesan dalam penerbangan melebihi ambang batas untuk antrian SQS.

Maksud: Mendeteksi pesan dalam penerbangan yang tinggi yang menunjukkan masalah konsumen.

Kriteria PromQL: avg({__name__="ApproximateNumberOfMessagesNotVisible", "@instrumentation.@name"="cloudwatch.aws/sqs", QueueName="QUEUE"}) > THRESHOLD

Ambang batas yang disarankan: THRESHOLD (tertanam dalam kueri)

Pembenaran ambang batas: Tet apkan berdasarkan volume pemrosesan yang diharapkan.

Interval evaluasi: 60

Periode tertunda: 900

Periode pemulihan: 900

ApproximateNumberOfMessagesVisible

Label: QueueName

Deskripsi alarm: Alarm saat jumlah pesan yang terlihat melebihi ambang batas untuk antrian SQS.

Maksud: Mendeteksi backlog pesan yang menunjukkan konsumen lambat.

Kriteria PromQL: avg({__name__="ApproximateNumberOfMessagesVisible", "@instrumentation.@name"="cloudwatch.aws/sqs", QueueName="QUEUE"}) > THRESHOLD

Ambang batas yang disarankan: THRESHOLD (tertanam dalam kueri)

Pembenaran ambang batas: Tet apkan berdasarkan kedalaman antrian yang diharapkan.

Interval evaluasi: 60

Periode tertunda: 900

Periode pemulihan: 900

NumberOfMessagesSent

Label: QueueName

Deskripsi alarm: Alarm saat tidak ada pesan yang dikirim ke antrian SQS.

Maksud: Mendeteksi produsen berhenti mengirim pesan.

Kriteria PromQL: sum({__name__="NumberOfMessagesSent", "@instrumentation.@name"="cloudwatch.aws/sqs", QueueName="QUEUE"}) <= 0

Ambang batas yang disarankan: 0 (tertanam dalam kueri)

Pembenaran ambang batas: Pesan nol menunjukkan kegagalan produsen.

Interval evaluasi: 60

Periode tertunda: 900

Periode pemulihan: 900

TunnelState (Tingkat VPN)

Label: VpnId

Deskripsi alarm: Alarm saat setidaknya satu terowongan VPN dalam keadaan DOWN.

Maksud: Mendeteksi setidaknya satu terowongan dalam keadaan DOWN.

Kriteria PromQL: min({__name__="TunnelState", "@instrumentation.@name"="cloudwatch.aws/vpn", VpnId="VPN"}) < 1

Ambang batas yang disarankan: 1 (tertanam dalam kueri)

Pembenaran ambang batas: Di bawah 1 berarti terowongan turun.

Interval evaluasi: 300

Periode tertunda: 900

Periode pemulihan: 900

TunnelState (Tingkat terowongan)

Label: TunnelIpAddress

Deskripsi alarm: Alarm saat terowongan VPN tertentu dalam keadaan DOWN.

Maksud: Mendeteksi terowongan tertentu dalam keadaan DOWN.

Kriteria PromQL: min({__name__="TunnelState", "@instrumentation.@name"="cloudwatch.aws/vpn", TunnelIpAddress="IP"}) < 1

Ambang batas yang disarankan: 1 (tertanam dalam kueri)

Pembenaran ambang batas: Di bawah 1 berarti terowongan turun.

Interval evaluasi: 300

Periode tertunda: 900

Periode pemulihan: 900