View a markdown version of this page

推荐的 PromQL 警报 - Amazon CloudWatch

推荐的 PromQL 警报

将这些 PromQL 警报用作经典推荐警报的等效警报。它们使用 PromQL 即时查询来监控相同指标,这些查询会根据通过 CloudWatch OTLP 端点摄取的指标进行评估。

PromQL 警报使用 EvaluationCriteriaPromQLCriteria。与经典指标警报不同,阈值直接嵌入到 PromQL 查询表达式中。

  • 待处理周期:警报转换为 ALARM 状态之前时间序列必须持续违规的持续时间(以秒为单位)。

  • 恢复周期:警报恢复到 OK 状态之前所有时间序列必须停止违规的持续时间(以秒为单位)。

  • 评估间隔:CloudWatch 运行 PromQL 查询的频率(以秒为单位)。

注意

这些警报需要通过 CloudWatch OTLP 端点发布的指标。有关更多信息,请参阅 PromQL 警报

您可以使用 AWS CloudFormation 部署这些警报。请对 AWS::CloudWatch::Alarm 资源使用 EvaluationCriteriaPromQLCriteria 属性。

REST API

4XXError

标签:ApiName、Stage

警报描述:当 REST API 阶段的平均 4XX 错误率超过 5% 时发出警报。

意图:检测高客户端错误率,表明存在请求问题。

PromQL 标准:avg({__name__="4XXError", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiName="your-api-name",Stage="your-stage"}) > 0.05

推荐阈值:0.05(嵌入在查询中)

阈值理由:检测超过 5% 的客户端错误率,这表示严重的请求失败。

评估间隔:60

待处理周期:300

恢复周期:300

5XXError

标签:ApiName、Stage

警报描述:当 REST API 阶段的平均 5XX 错误率超过 5% 时发出警报。

意图:检测高服务器错误率,表明存在后端故障。

PromQL 标准:avg({__name__="5XXError", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiName="your-api-name",Stage="your-stage"}) > 0.05

推荐阈值:0.05(嵌入在查询中)

阈值理由:检测超过 5% 的服务器错误率,需要立即进行调查。

评估间隔:60

待处理周期:180

恢复周期:300

延迟

标签:ApiName、Stage

警报描述:当 REST API 阶段的 p90 延迟超过 2500 毫秒时发出警报。

意图:检测影响用户体验的高 p90 延迟。

PromQL 标准:histogram_quantile(0.9, {__name__="Latency", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiName="your-api-name",Stage="your-stage"}) > 2500

推荐阈值:2500(嵌入在查询中)

阈值理由:p90 延迟超过 2500 毫秒表示大多数请求的响应时间下降。

评估间隔:60

待处理周期:300

恢复周期:300

:计数

标签:ApiName、Stage

警报描述:当 REST API 阶段的总请求数低于预期基准时发出警报。

意图:检测低流量,可能表示存在路由或可用性问题。

PromQL 标准:sum({__name__="Count", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiName="your-api-name",Stage="your-stage"}) < THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:根据预期流量基准进行设置,以检测意外下降。

评估间隔:60

待处理周期:600

恢复周期:300

HTTP API

4xx

标签:ApiId、Stage

警报描述:当 HTTP API 阶段的平均 4xx 错误率超过 5% 时发出警报。

意图:检测 HTTP API 端点的高客户端错误率。

PromQL 标准:avg({__name__="4xx", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="your-api-id",Stage="your-stage"}) > 0.05

推荐阈值:0.05(嵌入在查询中)

阈值理由:检测超过 5% 的客户端错误率。

评估间隔:60

待处理周期:300

恢复周期:300

5xx

标签:ApiId、Stage

警报描述:当 HTTP API 阶段的平均 5xx 错误率超过 5% 时发出警报。

意图:检测 HTTP API 端点的高服务器错误率。

PromQL 标准:avg({__name__="5xx", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="your-api-id",Stage="your-stage"}) > 0.05

推荐阈值:0.05(嵌入在查询中)

阈值理由:检测超过 5% 的服务器错误率,需要进行调查。

评估间隔:60

待处理周期:180

恢复周期:300

延迟

标签:ApiId、Stage

警报描述:当 HTTP API 阶段的 p90 延迟超过 2500 毫秒时发出警报。

意图:检测 HTTP API 端点的高 p90 延迟。

PromQL 标准:histogram_quantile(0.9, {__name__="Latency", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="your-api-id",Stage="your-stage"}) > 2500

推荐阈值:2500(嵌入在查询中)

阈值理由:p90 延迟超过 2500 毫秒表示响应时间下降。

评估间隔:60

待处理周期:300

恢复周期:300

IntegrationLatency

标签:ApiId、Stage

警报描述:当 HTTP API 阶段的 p90 集成延迟超过 2000 毫秒时发出警报。

意图:检测高后端集成延迟,影响响应时间。

PromQL 标准:histogram_quantile(0.9, {__name__="IntegrationLatency", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="your-api-id",Stage="your-stage"}) > 2000

推荐阈值:2000(嵌入在查询中)

阈值理由:p90 集成延迟超过 2000 毫秒表示后端缓慢。

评估间隔:60

待处理周期:300

恢复周期:300

:计数

标签:ApiId、Stage

警报描述:当 HTTP API 阶段的总请求数低于预期基准时发出警报。

意图:检测低流量,可能表示存在路由或可用性问题。

PromQL 标准:sum({__name__="Count", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="your-api-id",Stage="your-stage"}) < THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:根据预期流量基准进行设置,以检测意外下降。

评估间隔:60

待处理周期:600

恢复周期:300

WebSocket API

ClientError

标签:ApiId、Stage

警报描述:当 WebSocket API 阶段的平均客户端错误率超过 5% 时发出警报。

意图:检测 WebSocket API 连接的高客户端错误率。

PromQL 标准:avg({__name__="ClientError", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="your-api-id",Stage="your-stage"}) > 0.05

推荐阈值:0.05(嵌入在查询中)

阈值理由:检测 WebSocket 连接超过 5% 的客户端错误率。

评估间隔:60

待处理周期:300

恢复周期:300

ExecutionError

标签:ApiId、Stage

警报描述:当 WebSocket API 阶段的平均执行错误率超过 5% 时发出警报。

意图:检测 WebSocket API 的高服务器端执行错误率。

PromQL 标准:avg({__name__="ExecutionError", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="your-api-id",Stage="your-stage"}) > 0.05

推荐阈值:0.05(嵌入在查询中)

阈值理由:检测超过 5% 的执行错误率,需要进行调查。

评估间隔:60

待处理周期:180

恢复周期:300

IntegrationLatency

标签:ApiId、Stage

警报描述:当 WebSocket API 阶段的 p90 集成延迟超过 2000 毫秒时发出警报。

意图:检测 WebSocket API 路由的高后端集成延迟。

PromQL 标准:histogram_quantile(0.9, {__name__="IntegrationLatency", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="your-api-id",Stage="your-stage"}) > 2000

推荐阈值:2000(嵌入在查询中)

阈值理由:p90 集成延迟超过 2000 毫秒表示后端缓慢。

评估间隔:60

待处理周期:300

恢复周期:300

MessageCount

标签:ApiId、Stage

警报描述:当 WebSocket API 阶段的总消息数低于预期基准时发出警报。

意图:检测低消息量,可能表示存在连接或路由问题。

PromQL 标准:sum({__name__="MessageCount", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="your-api-id",Stage="your-stage"}) < THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:根据预期消息量进行设置,以检测意外下降。

评估间隔:60

待处理周期:600

恢复周期:300

GroupInServiceCapacity

标签:AutoScalingGroupName

警报描述:当自动扩缩组的平均服务中容量低于预期最低值时发出警报。

意图:检测由于启动失败或实例终止而导致的低可用性。

PromQL 标准:avg({__name__="GroupInServiceCapacity", "@instrumentation.@name"="cloudwatch.aws/autoscaling", AutoScalingGroupName="your-auto-scaling-group-name"}) < THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:根据所需的最低容量进行设置,以检测启动失败或实例不足情形。

评估间隔:60

待处理周期:600

恢复周期:600

DaysToExpiry

标签:CertificateArn

警报描述:当证书到期的最短天数降至 44 天或更短时发出警报。

意图:主动发出证书到期警报,以便有时间进行续订。

PromQL 标准:min({__name__="DaysToExpiry", "@instrumentation.@name"="cloudwatch.aws/certificatemanager", CertificateArn="your-certificate-arn"}) <= 44

推荐阈值:44(嵌入在查询中)

阈值理由:在证书过期之前提供足够的准备时间来完成续订过程。

评估间隔:86400

待处理周期:86400

恢复周期:86400

5xxErrorRate

标签:DistributionId

警报描述:当平均 5xx 错误率超过 CloudFront 分配的阈值时发出警报。

意图:检测影响内容交付的高源或 CloudFront 错误率。

PromQL 标准:avg({__name__="5xxErrorRate", "@instrumentation.@name"="cloudwatch.aws/cloudfront", DistributionId="your-distribution-id"}) > THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:根据可接受的内容分发错误率进行设置。

评估间隔:60

待处理周期:300

恢复周期:300

OriginLatency

标签:DistributionId

警报描述:当 p90 源延迟超过 CloudFront 分配的阈值时发出警报。

意图:检测影响内容交付性能的高源响应延迟。

PromQL 标准:histogram_quantile(0.9, {__name__="OriginLatency", "@instrumentation.@name"="cloudwatch.aws/cloudfront", DistributionId="your-distribution-id"}) > THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:根据预期源响应时间和缓存策略进行设置。

评估间隔:60

待处理周期:300

恢复周期:300

FunctionValidationErrors

标签:DistributionId、FunctionName

警报描述:当发生任何 CloudFront 函数验证错误时发出警报。

意图:检测阻止函数执行的 CloudFront 函数验证失败。

PromQL 标准:sum({__name__="FunctionValidationErrors", "@instrumentation.@name"="cloudwatch.aws/cloudfront", DistributionId="your-distribution-id",FunctionName="your-function-name"}) > 0

推荐阈值:0(嵌入在查询中)

阈值理由:任何验证错误都表明存在需要注意的函数配置问题。

评估间隔:60

待处理周期:120

恢复周期:120

FunctionExecutionErrors

标签:DistributionId、FunctionName

警报描述:当发生任何 CloudFront 函数执行错误时发出警报。

意图:检测 CloudFront 函数中影响请求处理的运行时故障。

PromQL 标准:sum({__name__="FunctionExecutionErrors", "@instrumentation.@name"="cloudwatch.aws/cloudfront", DistributionId="your-distribution-id",FunctionName="your-function-name"}) > 0

推荐阈值:0(嵌入在查询中)

阈值理由:任何执行错误都表明函数代码存在运行时问题。

评估间隔:60

待处理周期:300

恢复周期:300

FunctionThrottles

标签:DistributionId、FunctionName

警报描述:当发生任何 CloudFront 函数节流时发出警报。

意图:检测可能会降低请求处理的 CloudFront 函数节流。

PromQL 标准:sum({__name__="FunctionThrottles", "@instrumentation.@name"="cloudwatch.aws/cloudfront", DistributionId="your-distribution-id",FunctionName="your-function-name"}) > 0

推荐阈值:0(嵌入在查询中)

阈值理由:任何节流都表明函数达到了计算限制。

评估间隔:60

待处理周期:300

恢复周期:300

SignUpThrottles

标签:UserPool、UserPoolClient

警报描述:当注册节流事件超过用户池的阈值时发出警报。

意图:检测阻止新用户注册的注册节流。

PromQL 标准:sum({__name__="SignUpThrottles", "@instrumentation.@name"="cloudwatch.aws/cognito", UserPool="your-user-pool",UserPoolClient="your-user-pool-client"}) > THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:根据注册操作可接受的节流率进行设置。

评估间隔:60

待处理周期:300

恢复周期:300

SignInThrottles

标签:UserPool、UserPoolClient

警报描述:当登录节流事件超过用户池的阈值时发出警报。

意图:检测阻止用户身份验证的登录节流。

PromQL 标准:sum({__name__="SignInThrottles", "@instrumentation.@name"="cloudwatch.aws/cognito", UserPool="your-user-pool",UserPoolClient="your-user-pool-client"}) > THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:根据登录操作可接受的节流率进行设置。

评估间隔:60

待处理周期:300

恢复周期:300

TokenRefreshTrott

标签:UserPool、UserPoolClient

警报描述:当令牌刷新节流事件超过用户池的阈值时发出警报。

意图:检测可能会导致会话中断的令牌刷新节流。

PromQL 标准:sum({__name__="TokenRefreshThrottles", "@instrumentation.@name"="cloudwatch.aws/cognito", UserPool="your-user-pool",UserPoolClient="your-user-pool-client"}) > THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:根据令牌刷新操作可接受的节流率进行设置。

评估间隔:60

待处理周期:300

恢复周期:300

FederationThrottles

标签:UserPool、UserPoolClient、IdentityProvider

警报描述:当联合身份验证节流事件超过用户池身份提供者的阈值时发出警报。

意图:检测可能会阻止联合登录的联合节流。

PromQL 标准:sum({__name__="FederationThrottles", "@instrumentation.@name"="cloudwatch.aws/cognito", UserPool="your-user-pool",UserPoolClient="your-user-pool-client",IdentityProvider="your-identity-provider"}) > THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:根据联合身份验证操作可接受的节流率进行设置。

评估间隔:60

待处理周期:300

恢复周期:300

AccountProvisionedReadCapacityUtilization

标签:

警报描述:当账户级别的预置读取容量利用率超过 80% 时发出警报。

意图:检测预置的读取容量何时接近账户限制。

PromQL 标准:max({__name__="AccountProvisionedReadCapacityUtilization", "@instrumentation.@name"="cloudwatch.aws/dynamodb"}) > 80

推荐阈值:80(嵌入在查询中)

阈值理由:利用率为 80% 时,在达到账户限制之前,您的余量有限。

评估间隔:300

待处理周期:600

恢复周期:600

AccountProvisionedWriteCapacityUtilization

标签:

警报描述:当账户级别的预置写入容量利用率超过 80% 时发出警报。

意图:检测预置的写入容量何时接近账户限制。

PromQL 标准:max({__name__="AccountProvisionedWriteCapacityUtilization", "@instrumentation.@name"="cloudwatch.aws/dynamodb"}) > 80

推荐阈值:80(嵌入在查询中)

阈值理由:利用率为 80% 时,在达到账户限制之前,您的余量有限。

评估间隔:300

待处理周期:600

恢复周期:600

AgeOfOldestUnreplicatedRecord

标签:TableName、DelegatedOperation

警报描述:当最早的未复制记录的期限超过阈值时发出警报。

意图:检测可能导致全局表中的数据过时的复制延迟。

PromQL 标准:max({__name__="AgeOfOldestUnreplicatedRecord", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name",DelegatedOperation="your-operation"}) > THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:根据复制新鲜度要求进行设置。

评估间隔:300

待处理周期:900

恢复周期:900

FailedToReplicateRecordCount

标签:TableName、DelegatedOperation

警报描述:当全局表中任何记录复制失败时发出警报。

意图:检测导致跨区域数据不一致的复制失败。

PromQL 标准:sum({__name__="FailedToReplicateRecordCount", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name",DelegatedOperation="your-operation"}) > 0

推荐阈值:0(嵌入在查询中)

阈值理由:任何失败的复制都表明存在数据一致性问题,需要立即关注。

评估间隔:60

待处理周期:60

恢复周期:60

ReadThrottleEvents

标签:TableName

警报描述:当读取节流事件超过表的阈值时发出警报。

意图:检测表示预置容量不足的读取节流。

PromQL 标准:sum({__name__="ReadThrottleEvents", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name"}) > THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:根据读取操作可接受的节流计数进行设置。

评估间隔:60

待处理周期:300

恢复周期:300

ReadThrottleEvents (GSI)

标签:TableName、GlobalSecondaryIndexName

警报描述:当读取节流事件超过全局二级索引的阈值时发出警报。

意图:检测 GSI 上表示索引容量不足的读取节流。

PromQL 标准:sum({__name__="ReadThrottleEvents", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name",GlobalSecondaryIndexName="your-index-name"}) > THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:根据 GSI 读取操作可接受的节流计数进行设置。

评估间隔:60

待处理周期:300

恢复周期:300

ReplicationLatency

标签:TableName、ReceivingRegion

警报描述:当平均复制延迟超过全局表的阈值时发出警报。

意图:检测可能导致副本区域读取过时的高复制延迟。

PromQL 标准:avg({__name__="ReplicationLatency", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name",ReceivingRegion="your-receiving-region"}) > THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:根据副本区域的数据新鲜度要求进行设置。

评估间隔:60

待处理周期:900

恢复周期:900

SuccessfulRequestLatency

标签:TableName、Operation

警报描述:当平均成功请求延迟超过表操作的阈值时发出警报。

意图:检测影响应用程序性能的 DynamoDB 操作高延迟。

PromQL 标准:avg({__name__="SuccessfulRequestLatency", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name",Operation="your-operation"}) > THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:根据特定 DynamoDB 操作的延迟 SLA 进行设置。

评估间隔:60

待处理周期:600

恢复周期:600

SystemErrors

标签:TableName

警报描述:当系统错误超过表的阈值时发出警报。

意图:检测影响表可用性的 DynamoDB 服务端错误。

PromQL 标准:sum({__name__="SystemErrors", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name"}) > THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:根据表可接受的系统错误计数进行设置。

评估间隔:60

待处理周期:900

恢复周期:900

ThrottledPutRecordCount

标签:TableName、DelegatedOperation

警报描述:当受限的放置记录计数超过表的阈值时发出警报。

意图:检测可能导致流式操作数据丢失的受限 put。

PromQL 标准:max({__name__="ThrottledPutRecordCount", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name",DelegatedOperation="your-operation"}) > THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:根据流式放置操作可接受的节流计数进行设置。

评估间隔:60

待处理周期:600

恢复周期:600

UserErrors

标签:

警报描述:当用户错误超过整个账户的阈值时发出警报。

意图:检测高客户端错误率,例如验证或条件检查失败。

PromQL 标准:sum({__name__="UserErrors", "@instrumentation.@name"="cloudwatch.aws/dynamodb"}) > THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:根据客户端请求失败可接受的错误率进行设置。

评估间隔:60

待处理周期:600

恢复周期:600

WriteThrottleEvents

标签:TableName

警报描述:当写入节流事件超过表的阈值时发出警报。

意图:检测表示预置容量不足的写入节流。

PromQL 标准:sum({__name__="WriteThrottleEvents", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name"}) > THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:根据写入操作可接受的节流计数进行设置。

评估间隔:60

待处理周期:300

恢复周期:300

WriteThrottleEvents (GSI)

标签:TableName、GlobalSecondaryIndexName

警报描述:当写入节流事件超过全局二级索引的阈值时发出警报。

意图:检测 GSI 上表示索引容量不足的写入节流。

PromQL 标准:sum({__name__="WriteThrottleEvents", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name",GlobalSecondaryIndexName="your-index-name"}) > THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:根据 GSI 写入操作可接受的节流计数进行设置。

评估间隔:60

待处理周期:300

恢复周期:300

VolumeStalledIOCheck

标签:VolumeId、InstanceId

警报描述:当 EBS 卷报告停滞的 I/O 检查失败时发出警报。

意图:检测 EBS 卷上停滞的 I/O,表示卷受损。

PromQL 标准:max({__name__="VolumeStalledIOCheck", "@instrumentation.@name"="cloudwatch.aws/ebs", VolumeId="your-volume-id",InstanceId="your-instance-id"}) >= 1

推荐阈值:1(嵌入在查询中)

阈值理由:1 或更大值表示卷已停滞 I/O,需要立即进行调查。

评估间隔:60

待处理周期:600

恢复周期:600

CPUUtilization

标签:InstanceId

警报描述:当 EC2 实例的平均 CPU 利用率超过 80% 时发出警报。

意图:检测高 CPU 利用率。

PromQL 标准:avg({__name__="CPUUtilization", "@instrumentation.@name"="cloudwatch.aws/ec2", InstanceId="your-instance-id"}) > 80

推荐阈值:80(嵌入在查询中)

阈值理由:80% 阈值在饱和之前留出余量。

评估间隔:300

待处理周期:900

恢复周期:900

StatusCheckFailed

标签:InstanceId

警报描述:当 EC2 实例的实例或系统运行状况检查失败时发出警报。

意图:检测实例或系统运行状况问题。

PromQL 标准:max({__name__="StatusCheckFailed", "@instrumentation.@name"="cloudwatch.aws/ec2", InstanceId="your-instance-id"}) >= 1

推荐阈值:1(嵌入在查询中)

阈值理由:任何状态检查失败都需要调查。

评估间隔:300

待处理周期:600

恢复周期:600

StatusCheckFailed_AttachedEBS

标签:InstanceId

警报描述:当附加的 EBS 卷对 EC2 实例无法访问时发出警报。

意图:检测无法访问的 EBS 卷。

PromQL 标准:max({__name__="StatusCheckFailed_AttachedEBS", "@instrumentation.@name"="cloudwatch.aws/ec2", InstanceId="your-instance-id"}) >= 1

推荐阈值:1(嵌入在查询中)

阈值理由:无法访问的卷导致 I/O 故障。

评估间隔:60

待处理周期:600

恢复周期:600

CPUReservation

标签:ClusterName

警报描述:当 ECS 集群的平均 CPU 预留率超过 80% 时发出警报。

意图:检测接近 CPU 容量的集群。

PromQL 标准:avg({__name__="CPUReservation", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="your-cluster-name"}) > 80

推荐阈值:80(嵌入在查询中)

阈值理由:80% 预留表示新任务的余量有限。

评估间隔:60

待处理周期:300

恢复周期:300

CPUUtilization

标签:ClusterName、ServiceName

警报描述:当 ECS 服务的平均 CPU 利用率超过 80% 时发出警报。

意图:检测 ECS 服务的高 CPU 利用率。

PromQL 标准:avg({__name__="CPUUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="your-cluster-name",ServiceName="your-service-name"}) > 80

推荐阈值:80(嵌入在查询中)

阈值理由:80% 在饱和之前留出余量。

评估间隔:60

待处理周期:300

恢复周期:300

EBSFilesystemUtilization

标签:ClusterName、ServiceName

警报描述:当 ECS 服务的平均 EBS 文件系统利用率超过 80% 时发出警报。

意图:检测高 EBS 存储利用率。

PromQL 标准:avg({__name__="EBSFilesystemUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="your-cluster-name",ServiceName="your-service-name"}) > 80

推荐阈值:80(嵌入在查询中)

阈值理由:80% 在饱和之前留出余量。

评估间隔:60

待处理周期:300

恢复周期:300

MemoryReservation

标签:ClusterName

警报描述:当 ECS 集群的平均内存预留率超过 80% 时发出警报。

意图:检测接近内存容量的集群。

PromQL 标准:avg({__name__="MemoryReservation", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="your-cluster-name"}) > 80

推荐阈值:80(嵌入在查询中)

阈值理由:80% 预留表示新任务的余量有限。

评估间隔:60

待处理周期:300

恢复周期:300

MemoryUtilization

标签:ClusterName、ServiceName

警报描述:当 ECS 服务的平均内存利用率超过 80% 时发出警报。

意图:检测高内存利用率。

PromQL 标准:avg({__name__="MemoryUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="your-cluster-name",ServiceName="your-service-name"}) > 80

推荐阈值:80(嵌入在查询中)

阈值理由:80% 在饱和之前留出余量。

评估间隔:60

待处理周期:300

恢复周期:300

HTTPCode_Target_5XX_Count

标签:ClusterName、ServiceName

警报描述:当 HTTP 5XX 错误计数超过 ECS 服务的阈值时发出警报。

意图:检测高服务器端错误计数。

PromQL 标准:sum({__name__="HTTPCode_Target_5XX_Count", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="your-cluster-name",ServiceName="your-service-name"}) > THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:根据应用程序的正常错误率基准进行设置。

评估间隔:60

待处理周期:300

恢复周期:300

TargetResponseTime

标签:ClusterName、ServiceName

警报描述:当平均目标响应时间超过 ECS 服务的阈值时发出警报。

意图:检测高目标响应时间。

PromQL 标准:avg({__name__="TargetResponseTime", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="your-cluster-name",ServiceName="your-service-name"}) > THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:基于应用程序可接受的延迟要求进行设置。

评估间隔:60

待处理周期:300

恢复周期:300

EphemeralStorageUtilized

标签:ClusterName、ServiceName

警报描述:当平均临时存储用量超过 Fargate 任务的阈值时发出警报。

意图:检测 Fargate 任务的高临时存储用量。

PromQL 标准:avg({__name__="EphemeralStorageUtilized", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name",ServiceName="your-service-name"}) > THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:根据任务的临时存储分配进行设置。

评估间隔:60

待处理周期:300

恢复周期:300

RunningTaskCount

标签:ClusterName、ServiceName

警报描述:当 ECS 服务的运行任务计数降至零时发出警报。

意图:检测何时没有任务正在运行。

PromQL 标准:avg({__name__="RunningTaskCount", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name",ServiceName="your-service-name"}) <= 0

推荐阈值:0(嵌入在查询中)

阈值理由:零个运行任务表示服务中断。

评估间隔:60

待处理周期:300

恢复周期:300

instance_filesystem_utilization

标签:InstanceId、ContainerInstanceId、ClusterName

警报描述:当容器实例的平均文件系统利用率超过 90% 时发出警报。

意图:检测高文件系统利用率。

PromQL 标准:avg({__name__="instance_filesystem_utilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", InstanceId="your-instance-id",ContainerInstanceId="your-container-instance-id",ClusterName="your-cluster-name"}) > 90

推荐阈值:90(嵌入在查询中)

阈值理由:90% 文件系统利用率为操作空间留下最少空间。

评估间隔:60

待处理周期:300

恢复周期:300

TaskCpuUtilization(集群级别)

标签:ClusterName

警报描述:当集群级别的平均任务 CPU 利用率超过 80% 时发出警报。

意图:检测高 CPU 利用率。

PromQL 标准:avg({__name__="TaskCpuUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name"}) > 80

推荐阈值:80(嵌入在查询中)

阈值理由:80% 在饱和之前留出余量。

评估间隔:60

待处理周期:300

恢复周期:300

TaskCpuUtilization(服务级别)

标签:ClusterName、ServiceName

警报描述:当服务级别的平均任务 CPU 利用率超过 80% 时发出警报。

意图:检测高 CPU 利用率。

PromQL 标准:avg({__name__="TaskCpuUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name",ServiceName="your-service-name"}) > 80

推荐阈值:80(嵌入在查询中)

阈值理由:80% 在饱和之前留出余量。

评估间隔:60

待处理周期:300

恢复周期:300

TaskMemoryUtilization(集群级别)

标签:ClusterName

警报描述:当集群级别的平均任务内存利用率超过 80% 时发出警报。

意图:检测高内存利用率。

PromQL 标准:avg({__name__="TaskMemoryUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name"}) > 80

推荐阈值:80(嵌入在查询中)

阈值理由:80% 在饱和之前留出余量。

评估间隔:60

待处理周期:300

恢复周期:300

TaskMemoryUtilization(服务级别)

标签:ClusterName、ServiceName

警报描述:当服务级别的平均任务内存利用率超过 80% 时发出警报。

意图:检测高内存利用率。

PromQL 标准:avg({__name__="TaskMemoryUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name",ServiceName="your-service-name"}) > 80

推荐阈值:80(嵌入在查询中)

阈值理由:80% 在饱和之前留出余量。

评估间隔:60

待处理周期:300

恢复周期:300

ContainerCpuUtilization(集群级别)

标签:ClusterName

警报描述:当集群级别的平均容器 CPU 利用率超过 80% 时发出警报。

意图:检测高 CPU 利用率。

PromQL 标准:avg({__name__="ContainerCpuUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name"}) > 80

推荐阈值:80(嵌入在查询中)

阈值理由:80% 在饱和之前留出余量。

评估间隔:60

待处理周期:300

恢复周期:300

ContainerCpuUtilization(容器级别)

标签:ContainerName、ClusterName、ServiceName

警报描述:当容器级别的平均容器 CPU 利用率超过 80% 时发出警报。

意图:检测高 CPU 利用率。

PromQL 标准:avg({__name__="ContainerCpuUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ContainerName="your-container-name",ClusterName="your-cluster-name",ServiceName="your-service-name"}) > 80

推荐阈值:80(嵌入在查询中)

阈值理由:80% 在饱和之前留出余量。

评估间隔:60

待处理周期:300

恢复周期:300

ContainerMemoryUtilization(集群级别)

标签:ClusterName

警报描述:当集群级别的平均容器内存利用率超过 80% 时发出警报。

意图:检测高内存利用率。

PromQL 标准:avg({__name__="ContainerMemoryUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name"}) > 80

推荐阈值:80(嵌入在查询中)

阈值理由:80% 在饱和之前留出余量。

评估间隔:60

待处理周期:300

恢复周期:300

ContainerMemoryUtilization(容器级别)

标签:ContainerName、ClusterName、ServiceName

警报描述:当容器级别的平均容器内存利用率超过 80% 时发出警报。

意图:检测高内存利用率。

PromQL 标准:avg({__name__="ContainerMemoryUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ContainerName="your-container-name",ClusterName="your-cluster-name",ServiceName="your-service-name"}) > 80

推荐阈值:80(嵌入在查询中)

阈值理由:80% 在饱和之前留出余量。

评估间隔:60

待处理周期:300

恢复周期:300

TaskEBSfilesystemUtilization

标签:ClusterName、ServiceName

警报描述:当任务的平均 EBS 文件系统利用率超过 80% 时发出警报。

意图:检测高 EBS 文件系统利用率。

PromQL 标准:avg({__name__="TaskEBSfilesystemUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name",ServiceName="your-service-name"}) > 80

推荐阈值:80(嵌入在查询中)

阈值理由:80% 在饱和之前留出余量。

评估间隔:60

待处理周期:300

恢复周期:300

TaskEphemeralStorageUtilization(集群级别)

标签:ClusterName

警报描述:当集群级别的平均临时存储利用率超过 80% 时发出警报。

意图:检测高临时存储利用率。

PromQL 标准:avg({__name__="TaskEphemeralStorageUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name"}) > 80

推荐阈值:80(嵌入在查询中)

阈值理由:80% 在饱和之前留出余量。

评估间隔:60

待处理周期:300

恢复周期:300

TaskEphemeralStorageUtilization(服务级别)

标签:ClusterName、ServiceName

警报描述:当服务级别的平均临时存储利用率超过 80% 时发出警报。

意图:检测高临时存储利用率。

PromQL 标准:avg({__name__="TaskEphemeralStorageUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name",ServiceName="your-service-name"}) > 80

推荐阈值:80(嵌入在查询中)

阈值理由:80% 在饱和之前留出余量。

评估间隔:60

待处理周期:300

恢复周期:300

PercentIOLimit

标签:FileSystemId

警报描述:当 EFS 文件系统达到其 I/O 限制的 100% 时发出警报。

意图:检测文件系统何时达到 I/O 限制。

PromQL 标准:avg({__name__="PercentIOLimit", "@instrumentation.@name"="cloudwatch.aws/efs", FileSystemId="your-filesystem-id"}) >= 100

推荐阈值:100(嵌入在查询中)

阈值理由:100% 时,文件系统成为瓶颈。

评估间隔:60

待处理周期:900

恢复周期:900

BurstCreditBalance

标签:FileSystemId

警报描述:当 EFS 文件系统的突增积分余额降至零时发出警报。

意图:检测导致吞吐量减慢的耗尽的突增积分。

PromQL 标准:avg({__name__="BurstCreditBalance", "@instrumentation.@name"="cloudwatch.aws/efs", FileSystemId="your-filesystem-id"}) <= 0

推荐阈值:0(嵌入在查询中)

阈值理由:零积分导致吞吐量降低。

评估间隔:60

待处理周期:900

恢复周期:900

node_cpu_utilization

标签:ClusterName

警报描述:当 EKS Worker 节点上的最大 CPU 利用率超过 80% 时发出警报。

意图:检测 Worker 节点上的高 CPU。

PromQL 标准:max({__name__="node_cpu_utilization", "@instrumentation.@name"="cloudwatch.aws/eks-containerinsights", ClusterName="your-cluster-name"}) > 80

推荐阈值:80(嵌入在查询中)

阈值理由:80% 在饱和之前留出余量。

评估间隔:60

待处理周期:300

恢复周期:300

node_filesystem_utilization

标签:ClusterName

警报描述:当最大文件系统利用率超过 EKS Worker 节点的阈值时发出警报。

意图:检测 Worker 节点上的高文件系统使用率。

PromQL 标准:max({__name__="node_filesystem_utilization", "@instrumentation.@name"="cloudwatch.aws/eks-containerinsights", ClusterName="your-cluster-name"}) > THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值说明:根据节点的存储容量和使用模式进行设置。

评估间隔:60

待处理周期:300

恢复周期:300

node_memory_utilization

标签:ClusterName

警报描述:当 EKS Worker 节点上的最大内存利用率超过 80% 时发出警报。

意图:检测 Worker 节点上的高内存。

PromQL 标准:max({__name__="node_memory_utilization", "@instrumentation.@name"="cloudwatch.aws/eks-containerinsights", ClusterName="your-cluster-name"}) > 80

推荐阈值:80(嵌入在查询中)

阈值理由:80% 在饱和之前留出余量。

评估间隔:60

待处理周期:300

恢复周期:300

pod_cpu_utilization_over_pod_limit

标签:ClusterName、Namespace、Service

警报描述:当容器组(pod)CPU 利用率超过其限制的 80% 时发出警报。

意图:检测接近 CPU 限制的容器组(pod)。

PromQL 标准:max({__name__="pod_cpu_utilization_over_pod_limit", "@instrumentation.@name"="cloudwatch.aws/eks-containerinsights", ClusterName="your-cluster-name",Namespace="your-namespace",Service="your-service"}) > 80

推荐阈值:80(嵌入在查询中)

阈值理由:80% 在节流发生之前留出余量。

评估间隔:60

待处理周期:300

恢复周期:300

pod_memory_utilization_over_pod_limit

标签:ClusterName、Namespace、Service

警报描述:当容器组(pod)内存利用率超过其限制的 80% 时发出警报。

意图:检测接近内存限制的容器组(pod)。

PromQL 标准:max({__name__="pod_memory_utilization_over_pod_limit", "@instrumentation.@name"="cloudwatch.aws/eks-containerinsights", ClusterName="your-cluster-name",Namespace="your-namespace",Service="your-service"}) > 80

推荐阈值:80(嵌入在查询中)

阈值理由:80% 在 OOMKill 发生之前留出余量。

评估间隔:60

待处理周期:300

恢复周期:300

CPUUtilization

标签:CacheClusterId、CacheNodeId

警报描述:当平均 CPU 利用率超过 ElastiCache 节点的阈值时发出警报。

意图:检测实例的高 CPU。

PromQL 标准:avg({__name__="CPUUtilization", "@instrumentation.@name"="cloudwatch.aws/elasticache", CacheClusterId="your-cache-cluster-id",CacheNodeId="your-cache-node-id"}) > THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:根据节点类型和工作负载特征进行设置。

评估间隔:60

待处理周期:300

恢复周期:300

CurrConnections

标签:CacheClusterId、CacheNodeId

警报描述:当连接计数超过 ElastiCache 节点的阈值时发出警报。

意图:检测高连接计数。

PromQL 标准:avg({__name__="CurrConnections", "@instrumentation.@name"="cloudwatch.aws/elasticache", CacheClusterId="your-cache-cluster-id",CacheNodeId="your-cache-node-id"}) > THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:根据预期连接池大小和应用程序需求进行设置。

评估间隔:60

待处理周期:600

恢复周期:600

DatabaseMemoryUsagePercentage

标签:CacheClusterId

警报描述:当数据库内存使用量超过 ElastiCache 集群的阈值时发出警报。

意图:检测高内存使用率以防止写入失败。

PromQL 标准:avg({__name__="DatabaseMemoryUsagePercentage", "@instrumentation.@name"="cloudwatch.aws/elasticache", CacheClusterId="your-cache-cluster-id"}) > THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:根据驱逐策略和数据重要性进行设置。

评估间隔:60

待处理周期:300

恢复周期:300

EngineCPUUtilization

标签:CacheClusterId

警报描述:当 ElastiCache 集群的 Redis 引擎 CPU 利用率超过 90% 时发出警报。

意图:检测高 Redis 引擎 CPU 利用率。

PromQL 标准:avg({__name__="EngineCPUUtilization", "@instrumentation.@name"="cloudwatch.aws/elasticache", CacheClusterId="your-cache-cluster-id"}) > 90

推荐阈值:90(嵌入在查询中)

阈值理由:Redis 是单线程的;超过 90% 表示已饱和。

评估间隔:60

待处理周期:300

恢复周期:300

ReplicationLag

标签:CacheClusterId

警报描述:当复制延迟超过 ElastiCache 集群的阈值时发出警报。

意图:检测影响数据一致性的复制延迟。

PromQL 标准:avg({__name__="ReplicationLag", "@instrumentation.@name"="cloudwatch.aws/elasticache", CacheClusterId="your-cache-cluster-id"}) > THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:根据应用程序对过时读取的容忍度进行设置。

评估间隔:60

待处理周期:900

恢复周期:900

GPUConnectivityCheckFailed

标签:InstanceId、EGPUId

警报描述:当 Elastic Graphics 加速器与实例失去连接时发出警报。

意图:检测与 Elastic Graphics 加速器的连接问题。

PromQL 标准:max({__name__="GPUConnectivityCheckFailed", "@instrumentation.@name"="cloudwatch.aws/elasticgpus", InstanceId="your-instance-id",EGPUId="your-egpu-id"}) > 0

推荐阈值:0(嵌入在查询中)

阈值理由:任何连接失败都需要调查。

评估间隔:300

待处理周期:900

恢复周期:900

GPUHealthCheckFailed

标签:InstanceId、EGPUId

警报描述:当 Elastic Graphics 加速器运行状况检查失败时发出警报。

意图:检测运行状况不佳的 Elastic Graphics 加速器。

PromQL 标准:max({__name__="GPUHealthCheckFailed", "@instrumentation.@name"="cloudwatch.aws/elasticgpus", InstanceId="your-instance-id",EGPUId="your-egpu-id"}) > 0

推荐阈值:0(嵌入在查询中)

阈值理由:运行状况检查失败表示存在加速器问题。

评估间隔:300

待处理周期:900

恢复周期:900

TargetErrorThrottledCount

警报描述:当计划目标调用受到限制时发出警报。

意图:检测导致计划延迟的目标节流。

PromQL 标准:sum({__name__="TargetErrorThrottledCount", "@instrumentation.@name"="cloudwatch.aws/scheduler"}) > 0

推荐阈值:0(嵌入在查询中)

阈值理由:任何节流都表明存在目标容量问题。

评估间隔:60

待处理周期:900

恢复周期:900

InvocationThrottleCount

警报描述:当调度器调用受到限制时发出警报。

意图:检测调度器调用节流。

PromQL 标准:sum({__name__="InvocationThrottleCount", "@instrumentation.@name"="cloudwatch.aws/scheduler"}) > 0

推荐阈值:0(嵌入在查询中)

阈值理由:节流延迟计划的执行。

评估间隔:60

待处理周期:900

恢复周期:900

InvocationDroppedCount

警报描述:当计划的调用被丢弃时发出警报。

意图:检测丢弃的调用。

PromQL 标准:sum({__name__="InvocationDroppedCount", "@instrumentation.@name"="cloudwatch.aws/scheduler"}) > 0

推荐阈值:0(嵌入在查询中)

阈值理由:丢弃的调用表示计划的事件丢失。

评估间隔:60

待处理周期:60

恢复周期:60

InvocationsFailedToBeSentToDeadLetterCount

警报描述:当失败的调用无法发送到死信队列时发出警报。

意图:检测 DLQ 交付失败。

PromQL 标准:sum({__name__="InvocationsFailedToBeSentToDeadLetterCount", "@instrumentation.@name"="cloudwatch.aws/scheduler"}) > 0

推荐阈值:0(嵌入在查询中)

阈值理由:失败的 DLQ 交付意味着缺失错误信息。

评估间隔:60

待处理周期:900

恢复周期:900

GetRecords.IteratorAgeMilliseconds

标签:StreamName

警报描述:当使用器迭代器期限超过 Kinesis 流的阈值时发出警报。

意图:检测落后于保留期的数据,可能导致数据丢失。

PromQL 标准:max({__name__="GetRecords.IteratorAgeMilliseconds", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="your-stream-name"}) > THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:根据流保留期百分比进行设置。

评估间隔:60

待处理周期:900

恢复周期:900

GetRecords.Success

标签:StreamName

警报描述:当 GetRecords 成功率低于 Kinesis 流的阈值时发出警报。

意图:检测使用器检索失败。

PromQL 标准:avg({__name__="GetRecords.Success", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="your-stream-name"}) < THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:根据预期成功率进行设置。

评估间隔:60

待处理周期:300

恢复周期:300

PutRecord.Success

标签:StreamName

警报描述:当 PutRecord 成功率低于 Kinesis 流的阈值时发出警报。

意图:检测产生器摄取失败。

PromQL 标准:avg({__name__="PutRecord.Success", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="your-stream-name"}) < THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:根据预期成功率进行设置。

评估间隔:60

待处理周期:300

恢复周期:300

PutRecords.FailedRecords

标签:StreamName

警报描述:当批量放置操作为 Kinesis 流产生失败记录时发出警报。

意图:检测批量放置失败。

PromQL 标准:sum({__name__="PutRecords.FailedRecords", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="your-stream-name"}) > THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:根据可接受的失败计数进行设置。

评估间隔:60

待处理周期:300

恢复周期:300

ReadProvisionedThroughputExceeded

标签:StreamName

警报描述:当使用器读取超过 Kinesis 流的预置吞吐量时发出警报。

意图:检测使用器读取节流。

PromQL 标准:avg({__name__="ReadProvisionedThroughputExceeded", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="your-stream-name"}) > THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:任何持续节流都表明容量需求。

评估间隔:60

待处理周期:300

恢复周期:300

SubscribeToShardEvent.MillisBehindLatest

标签:StreamName、ConsumerName

警报描述:当增强型扇出使用器落后于最新记录时发出警报。

意图:检测增强型扇出使用器处理延迟。

PromQL 标准:avg({__name__="SubscribeToShardEvent.MillisBehindLatest", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="your-stream-name",ConsumerName="your-consumer-name"}) > THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:根据可接受的处理延迟进行设置。

评估间隔:60

待处理周期:300

恢复周期:300

WriteProvisionedThroughputExceeded

标签:StreamName

警报描述:当产生器写入超过 Kinesis 流的预置吞吐量时发出警报。

意图:检测产生器写入节流。

PromQL 标准:avg({__name__="WriteProvisionedThroughputExceeded", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="your-stream-name"}) > THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:持续节流表明容量需求。

评估间隔:60

待处理周期:300

恢复周期:300

ClaimedAccountConcurrency

警报描述:当申领的账户并发数超过阈值时发出警报。

意图:检测接近并发配额的账户。

PromQL 标准:max({__name__="ClaimedAccountConcurrency", "@instrumentation.@name"="cloudwatch.aws/lambda"}) > THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:设置为区域并发限制百分比。

评估间隔:60

待处理周期:600

恢复周期:600

错误

标签:FunctionName

警报描述:当函数错误计数超过 Lambda 函数的阈值时发出警报。

意图:检测高函数错误计数。

PromQL 标准:sum({__name__="Errors", "@instrumentation.@name"="cloudwatch.aws/lambda", FunctionName="your-function-name"}) > THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:根据可接受的错误量进行设置。

评估间隔:60

待处理周期:180

恢复周期:300

节流

标签:FunctionName

警报描述:当 Lambda 函数的函数调用受到限制时发出警报。

意图:检测函数调用节流。

PromQL 标准:sum({__name__="Throttles", "@instrumentation.@name"="cloudwatch.aws/lambda", FunctionName="your-function-name"}) > THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:节流表明已达到并发限制。

评估间隔:60

待处理周期:300

恢复周期:300

Duration

标签:FunctionName

警报描述:当 p90 函数持续时间超过 Lambda 函数的阈值时发出警报。

意图:检测长时间运行的函数调用。

PromQL 标准:histogram_quantile(0.9, {__name__="Duration", "@instrumentation.@name"="cloudwatch.aws/lambda", FunctionName="your-function-name"}) > THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:相对于函数超时进行设置。

评估间隔:60

待处理周期:900

恢复周期:900

ConcurrentExecutions

标签:FunctionName

警报描述:当并发执行超过 Lambda 函数的阈值时发出警报。

意图:检测接近并发限制的函数。

PromQL 标准:max({__name__="ConcurrentExecutions", "@instrumentation.@name"="cloudwatch.aws/lambda", FunctionName="your-function-name"}) > THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:设置为预留并发百分比。

评估间隔:60

待处理周期:600

恢复周期:600

memory_utilization

标签:function_name

警报描述:当 Lambda 函数的平均内存利用率超过 90% 时发出警报。

意图:检测接近配置的内存限制的函数。

PromQL 标准:avg({__name__="memory_utilization", "@instrumentation.@name"="cloudwatch.aws/lambda-insights", function_name="your-function-name"}) > 90

推荐阈值:90(嵌入在查询中)

阈值理由:超过 90% 可能会导致内存不足故障。

评估间隔:60

待处理周期:600

恢复周期:600

ErrorPortAllocation

标签:NatGatewayId

警报描述:当 NAT 网关无法为新连接分配端口时发出警报。

意图:检测阻止新连接的端口分配失败。

PromQL 标准:sum({__name__="ErrorPortAllocation", "@instrumentation.@name"="cloudwatch.aws/natgateway", NatGatewayId="your-nat-gateway-id"}) > 0

推荐阈值:0(嵌入在查询中)

阈值理由:任何分配失败都会影响连接。

评估间隔:60

待处理周期:900

恢复周期:900

PacketsDropCount

标签:NatGatewayId

警报描述:当 NAT 网关丢弃的数据包超过阈值时发出警报。

意图:检测表明容量或连接问题的数据包丢弃。

PromQL 标准:sum({__name__="PacketsDropCount", "@instrumentation.@name"="cloudwatch.aws/natgateway", NatGatewayId="your-nat-gateway-id"}) > THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:根据可接受的下降率进行设置。

评估间隔:60

待处理周期:300

恢复周期:300

PacketsDropped

标签:VpcId、VpcEndpointId、EndpointType、SubnetId、ServiceName

警报描述:当 VPC 端点丢弃的数据包超过阈值时发出警报。

意图:检测运行状况不佳的端点或端点服务。

PromQL 标准:sum({__name__="PacketsDropped", "@instrumentation.@name"="cloudwatch.aws/privatelinkendpoints", VpcId="your-vpc-id",VpcEndpointId="your-vpc-endpoint-id",EndpointType="your-endpoint-type",SubnetId="your-subnet-id",ServiceName="your-service-name"}) > THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:根据可接受的下降率进行设置。

评估间隔:60

待处理周期:300

恢复周期:300

RstPacketsSent

标签:ServiceId、LoadBalancerArn、Az

警报描述:当 RST 数据包速率超过端点服务的阈值时发出警报。

意图:检测端点服务运行状况不佳的目标。

PromQL 标准:sum({__name__="RstPacketsSent", "@instrumentation.@name"="cloudwatch.aws/privatelinkservices", ServiceId="SVC",LoadBalancerArn="LB",Az="AZ"}) > THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:根据可接受的 RST 数据包速率进行设置。

评估间隔:60

待处理周期:300

恢复周期:300

CPUUtilization

标签:DBInstanceIdentifier

警报描述:当 RDS 实例的平均 CPU 利用率超过 90% 时发出警报。

意图:检测防止性能下降的高 CPU。

PromQL 标准:avg({__name__="CPUUtilization", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > 90

推荐阈值:90(嵌入在查询中)

阈值说明:90% 表示接近饱和。

评估间隔:60

待处理周期:300

恢复周期:300

DatabaseConnections

标签:DBInstanceIdentifier

警报描述:当数据库连接超过 RDS 实例的阈值时发出警报。

意图:防止在最大限制下连接被拒绝。

PromQL 标准:avg({__name__="DatabaseConnections", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:设置为 max_connections 参数百分比。

评估间隔:60

待处理周期:300

恢复周期:300

EBSByteBalance%

标签:DBInstanceIdentifier

警报描述:当 RDS 实例的 EBS 字节余额低于 10% 时发出警报。

意图:检测导致瓶颈的低吞吐量积分。

PromQL 标准:avg({__name__="EBSByteBalance%", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) < 10

推荐阈值:10(嵌入在查询中)

阈值理由:低于 10% 可能会导致吞吐量下降。

评估间隔:60

待处理周期:180

恢复周期:180

EBSIOBalance%

标签:DBInstanceIdentifier

警报描述:当 RDS 实例的 EBS IO 余额低于 10% 时发出警报。

意图:检测导致瓶颈的低 IOPS 积分。

PromQL 标准:avg({__name__="EBSIOBalance%", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) < 10

推荐阈值:10(嵌入在查询中)

阈值理由:低于 10% 可能会导致 IOPS 下降。

评估间隔:60

待处理周期:180

恢复周期:180

FreeableMemory

标签:DBInstanceIdentifier

警报描述:当 RDS 实例的可用内存低于阈值时发出警报。

意图:防止导致连接被拒绝的内存不足情形。

PromQL 标准:avg({__name__="FreeableMemory", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) < THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值说明:根据实例类内存进行设置。

评估间隔:60

待处理周期:900

恢复周期:900

FreeLocalStorage

标签:DBInstanceIdentifier

警报描述:当可用本地存储空间低于 Aurora 实例的阈值时发出警报。

意图:防止 Aurora 本地存储耗尽。

PromQL 标准:avg({__name__="FreeLocalStorage", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) < THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:根据操作所需的最低值进行设置。

评估间隔:60

待处理周期:300

恢复周期:300

FreeStorageSpace

标签:DBInstanceIdentifier

警报描述:当可用存储空间低于 RDS 实例的阈值时发出警报。

意图:防止存储空间已满导致的停机。

PromQL 标准:min({__name__="FreeStorageSpace", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) < THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:根据存储增长率和预置大小进行设置。

评估间隔:60

待处理周期:300

恢复周期:300

MaximumUsedTransactionIDs

标签:DBInstanceIdentifier

警报描述:当 RDS 实例的最大已用事务 ID 超过 10 亿时发出警报。

意图:防止 PostgreSQL 事务 ID 重叠。

PromQL 标准:avg({__name__="MaximumUsedTransactionIDs", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > 1000000000

推荐阈值:1000000000(嵌入查询中)

阈值理由:10 亿表示接近重叠危险。

评估间隔:60

待处理周期:60

恢复周期:60

ReadLatency

标签:DBInstanceIdentifier

警报描述:当 p90 读取延迟超过 RDS 实例的阈值时发出警报。

意图:检测高读取延迟,表明存在磁盘问题。

PromQL 标准:histogram_quantile(0.9, {__name__="ReadLatency", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:根据可接受的应用程序延迟进行设置。

评估间隔:60

待处理周期:300

恢复周期:300

ReplicaLag

标签:DBInstanceIdentifier

警报描述:当 RDS 只读副本的复制延迟超过 60 秒时发出警报。

意图:检测可能会导致数据丢失的复制延迟。

PromQL 标准:max({__name__="ReplicaLag", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > 60

推荐阈值:60(嵌入在查询中)

阈值理由:对于大多数工作负载,60 秒都表示显著延迟。

评估间隔:60

待处理周期:600

恢复周期:600

WriteLatency

标签:DBInstanceIdentifier

警报描述:当 p90 写入延迟超过 RDS 实例的阈值时发出警报。

意图:检测高写入延迟,表明存在磁盘问题。

PromQL 标准:histogram_quantile(0.9, {__name__="WriteLatency", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:根据可接受的应用程序延迟进行设置。

评估间隔:60

待处理周期:300

恢复周期:300

DBLoad

标签:DBInstanceIdentifier

警报描述:当平均数据库负载超过 RDS 实例的阈值时发出警报。

意图:检测高数据库负载下降性能。

PromQL 标准:avg({__name__="DBLoad", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:设置为 vCPU 计数的倍数。

评估间隔:60

待处理周期:900

恢复周期:900

AuroraVolumeBytesLeftTotal

标签:DBClusterIdentifier

警报描述:当 Aurora 集群剩余存储字节数低于阈值时发出警报。

意图:防止 Aurora 集群存储耗尽。

PromQL 标准:avg({__name__="AuroraVolumeBytesLeftTotal", "@instrumentation.@name"="cloudwatch.aws/rds", DBClusterIdentifier="CLUSTER"}) < THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:根据增长率进行设置。

评估间隔:60

待处理周期:300

恢复周期:300

AuroraBinlogReplicaLag

标签:DBClusterIdentifier

警报描述:当 Aurora 二进制日志副本延迟指示错误状态时发出警报。

意图:检测写入器实例复制错误。

PromQL 标准:avg({__name__="AuroraBinlogReplicaLag", "@instrumentation.@name"="cloudwatch.aws/rds", DBClusterIdentifier="CLUSTER"}) <= -1

推荐阈值:-1(嵌入在查询中)

阈值理由:-1 表示错误状态。

评估间隔:60

待处理周期:120

恢复周期:120

BlockedTransactions

标签:DBInstanceIdentifier

警报描述:当被阻止事务计数超过 RDS 实例的阈值时发出警报。

意图:检测导致性能下降的事务阻止。

PromQL 标准:avg({__name__="BlockedTransactions", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:根据可接受的被阻止事务计数进行设置。

评估间隔:60

待处理周期:300

恢复周期:300

BufferCacheHitRatio

标签:DBInstanceIdentifier

警报描述:当 RDS 实例的缓冲区缓存命中率低于 80% 时发出警报。

意图:检测导致性能下降的缓存效率低下。

PromQL 标准:avg({__name__="BufferCacheHitRatio", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) < 80

推荐阈值:80(嵌入在查询中)

阈值理由:低于 80% 表示磁盘 I/O 过多。

评估间隔:60

待处理周期:600

恢复周期:600

EngineUptime

标签:DBClusterIdentifier

警报描述:当引擎正常运行时间降至零时发出警报,其表示 Aurora 写入器重启。

意图:检测 Aurora 写入器实例停机或崩溃。

PromQL 标准:avg({__name__="EngineUptime", "@instrumentation.@name"="cloudwatch.aws/rds", DBClusterIdentifier="CLUSTER"}) <= 0

推荐阈值:0(嵌入在查询中)

阈值理由:零正常运行时间表示实例重启。

评估间隔:60

待处理周期:120

恢复周期:120

RollbackSegmentHistoryListLength

标签:DBInstanceIdentifier

警报描述:当 Aurora 实例的回滚分段历史记录列表长度超过 100 万时发出警报。

意图:检测导致 CPU 降级的高回滚历史记录。

PromQL 标准:avg({__name__="RollbackSegmentHistoryListLength", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > 1000000

推荐阈值:1000000(嵌入在查询中)

阈值理由:高于 1M 导致性能问题。

评估间隔:60

待处理周期:300

恢复周期:300

StorageNetworkThroughput

标签:DBClusterIdentifier

警报描述:当存储网络吞吐量超过 Aurora 集群的阈值时发出警报。

意图:检测可能导致网络数据包丢弃的高吞吐量。

PromQL 标准:avg({__name__="StorageNetworkThroughput", "@instrumentation.@name"="cloudwatch.aws/rds", DBClusterIdentifier="CLUSTER"}) > THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:根据实例网络容量进行设置。

评估间隔:60

待处理周期:300

恢复周期:300

HealthCheckStatus

标签:HealthCheckId

警报描述:当 Route 53 运行状况检查报告端点运行状况不佳时发出警报。

意图:通过 Route 53 运行状况检查程序检测运行状况不佳的端点。

PromQL 标准:avg({__name__="HealthCheckStatus", "@instrumentation.@name"="cloudwatch.aws/route53", HealthCheckId="HC"}) < 1

推荐阈值:1(嵌入在查询中)

阈值理由:低于 1 表示端点未通过运行状况检查。

评估间隔:60

待处理周期:180

恢复周期:180

4xxErrors

标签:BucketName、FilterId

警报描述:当 S3 存储桶的 4xx 错误率超过 5% 时发出警报。

意图:检测异常的客户端错误率。

PromQL 标准:avg({__name__="4xxErrors", "@instrumentation.@name"="cloudwatch.aws/s3", BucketName="BUCKET",FilterId="FILTER"}) > 0.05

推荐阈值:0.05(嵌入在查询中)

阈值理由:超过 5% 表示存在设置或访问问题。

评估间隔:60

待处理周期:900

恢复周期:900

5xxErrors

标签:BucketName、FilterId

警报描述:当 S3 存储桶的 5xx 错误率超过 5% 时发出警报。

意图:检测影响应用程序的服务器端错误。

PromQL 标准:avg({__name__="5xxErrors", "@instrumentation.@name"="cloudwatch.aws/s3", BucketName="BUCKET",FilterId="FILTER"}) > 0.05

推荐阈值:0.05(嵌入在查询中)

阈值理由:超过 5% 表示存在 S3 服务问题。

评估间隔:60

待处理周期:900

恢复周期:900

OperationsFailedReplication

标签:SourceBucket、DestinationBucket、RuleId

警报描述:当存储桶的 S3 复制操作失败时发出警报。

意图:检测可能导致数据不一致的复制失败。

PromQL 标准:max({__name__="OperationsFailedReplication", "@instrumentation.@name"="cloudwatch.aws/s3", SourceBucket="SRC",DestinationBucket="DST",RuleId="RULE"}) > 0

推荐阈值:0(嵌入在查询中)

阈值理由:任何失败的复制都需要进行调查。

评估间隔:60

待处理周期:300

恢复周期:300

4xxErrors

标签:AccessPointName、DataSourceARN

警报描述:当 S3 对象 Lambda 接入点的 4xx 错误率超过 5% 时发出警报。

意图:检测对象 Lambda 的异常客户端错误率。

PromQL 标准:avg({__name__="4xxErrors", "@instrumentation.@name"="cloudwatch.aws/s3objectlambda", AccessPointName="AP",DataSourceARN="ARN"}) > 0.05

推荐阈值:0.05(嵌入在查询中)

阈值理由:超过 5% 表示存在设置问题。

评估间隔:60

待处理周期:900

恢复周期:900

5xxErrors

标签:AccessPointName、DataSourceARN

警报描述:当 S3 对象 Lambda 接入点的 5xx 错误率超过 5% 时发出警报。

意图:检测对象 Lambda 中的服务器端错误。

PromQL 标准:avg({__name__="5xxErrors", "@instrumentation.@name"="cloudwatch.aws/s3objectlambda", AccessPointName="AP",DataSourceARN="ARN"}) > 0.05

推荐阈值:0.05(嵌入在查询中)

阈值理由:超过 5% 表示存在 Lambda 或 S3 问题。

评估间隔:60

待处理周期:900

恢复周期:900

LambdaResponse4xx

标签:AccessPointName、DataSourceARN

警报描述:当 S3 对象 Lambda 接入点的 Lambda 函数 4xx 响应率超过 5% 时发出警报。

意图:检测 Lambda 函数客户端错误。

PromQL 标准:avg({__name__="LambdaResponse4xx", "@instrumentation.@name"="cloudwatch.aws/s3objectlambda", AccessPointName="AP",DataSourceARN="ARN"}) > 0.05

推荐阈值:0.05(嵌入在查询中)

阈值理由:超过 5% 表示存在 Lambda 函数问题。

评估间隔:60

待处理周期:900

恢复周期:900

NumberOfMessagesPublished

标签:TopicName

警报描述:当 SNS 主题的已发布消息数量低于阈值时发出警报。

意图:检测发布量显著下降。

PromQL 标准:sum({__name__="NumberOfMessagesPublished", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) < THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:根据最低预期流量进行设置。

评估间隔:60

待处理周期:300

恢复周期:300

NumberOfNotificationsDelivered

标签:TopicName

警报描述:当 SNS 主题的已传递通知数量低于阈值时发出警报。

意图:检测通知传送量下降。

PromQL 标准:sum({__name__="NumberOfNotificationsDelivered", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) < THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:根据最低预期交付进行设置。

评估间隔:60

待处理周期:300

恢复周期:300

NumberOfNotificationsFailed

标签:TopicName

警报描述:当失败的通知传送计数超过 SNS 主题的阈值时发出警报。

意图:检测传送失败。

PromQL 标准:sum({__name__="NumberOfNotificationsFailed", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) > THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:根据可接受的失败率进行设置。

评估间隔:60

待处理周期:300

恢复周期:300

NumberOfNotificationsFilteredOut-InvalidAttributes

标签:TopicName

警报描述:当通知因消息属性无效而被筛选掉时发出警报。

意图:检测无效的消息属性。

PromQL 标准:sum({__name__="NumberOfNotificationsFilteredOut-InvalidAttributes", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) > 0

推荐阈值:0(嵌入在查询中)

阈值理由:任何无效的筛选条件都表示配置错误。

评估间隔:60

待处理周期:300

恢复周期:300

NumberOfNotificationsFilteredOut-InvalidMessageBody

标签:TopicName

警报描述:当通知因消息正文无效而被筛选掉时发出警报。

意图:检测无效的消息正文。

PromQL 标准:sum({__name__="NumberOfNotificationsFilteredOut-InvalidMessageBody", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) > 0

推荐阈值:0(嵌入在查询中)

阈值理由:任何无效的筛选条件都表示配置错误。

评估间隔:60

待处理周期:300

恢复周期:300

NumberOfNotificationsRedrivenToDlq

标签:TopicName

警报描述:当 SNS 主题的通知被发送到死信队列时发出警报。

意图:检测发送到死信队列的消息。

PromQL 标准:sum({__name__="NumberOfNotificationsRedrivenToDlq", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) > 0

推荐阈值:0(嵌入在查询中)

阈值理由:任何 DLQ 消息都表示存在交付问题。

评估间隔:60

待处理周期:300

恢复周期:300

NumberOfNotificationsFailedToRedriveToDlq

标签:TopicName

警报描述:当 SNS 主题的通知未能发送到死信队列时发出警报。

意图:检测 DLQ 交付失败。

PromQL 标准:sum({__name__="NumberOfNotificationsFailedToRedriveToDlq", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) > 0

推荐阈值:0(嵌入在查询中)

阈值理由:失败的 DLQ 意味着缺失错误跟踪。

评估间隔:60

待处理周期:300

恢复周期:300

SMSMonthToDateSpentUSD

标签:TopicName

警报描述:当短信支出接近 SNS 主题的账户配额时发出警报。

意图:检测接近配额的短信支出。

PromQL 标准:max({__name__="SMSMonthToDateSpentUSD", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) > THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:根据账户短信配额进行设置。

评估间隔:60

待处理周期:300

恢复周期:300

SMSSuccessRate

标签:TopicName

警报描述:当 SNS 主题的短信传输成功率低于阈值时发出警报。

意图:检测失败的短信传输。

PromQL 标准:avg({__name__="SMSSuccessRate", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) < THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:根据可接受的传输速率进行设置。

评估间隔:60

待处理周期:300

恢复周期:300

ApproximateAgeOfOldestMessage

标签:QueueName

警报描述:当最早消息期限超过 SQS 队列的阈值时发出警报。

意图:检测处理速度不够快的消息。

PromQL 标准:max({__name__="ApproximateAgeOfOldestMessage", "@instrumentation.@name"="cloudwatch.aws/sqs", QueueName="QUEUE"}) > THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:根据可接受的消息处理时间进行设置。

评估间隔:60

待处理周期:900

恢复周期:900

ApproximateNumberOfMessagesNotVisible

标签:QueueName

警报描述:当动态消息数量超过 SQS 队列的阈值时发出警报。

意图:检测表明使用器问题的高动态消息。

PromQL 标准:avg({__name__="ApproximateNumberOfMessagesNotVisible", "@instrumentation.@name"="cloudwatch.aws/sqs", QueueName="QUEUE"}) > THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:根据预期的处理量进行设置。

评估间隔:60

待处理周期:900

恢复周期:900

ApproximateNumberOfMessagesVisible

标签:QueueName

警报描述:当可见消息数量超过 SQS 队列的阈值时发出警报。

意图:检测表明使用器速度慢的消息积压。

PromQL 标准:avg({__name__="ApproximateNumberOfMessagesVisible", "@instrumentation.@name"="cloudwatch.aws/sqs", QueueName="QUEUE"}) > THRESHOLD

推荐阈值:THRESHOLD(嵌入在查询中)

阈值理由:根据预期的队列深度进行设置。

评估间隔:60

待处理周期:900

恢复周期:900

NumberOfMessagesSent

标签:QueueName

警报描述:当没有消息发送到 SQS 队列时发出警报。

意图:检测停止发送消息的产生器。

PromQL 标准:sum({__name__="NumberOfMessagesSent", "@instrumentation.@name"="cloudwatch.aws/sqs", QueueName="QUEUE"}) <= 0

推荐阈值:0(嵌入在查询中)

阈值理由:零条消息表示产生器失败。

评估间隔:60

待处理周期:900

恢复周期:900

TunnelState(VPN 级别)

标签:VpnId

警报描述:当至少一个 VPN 隧道处于 DOWN 状态时发出警报。

意图:检测处于 DOWN 状态的至少一条隧道。

PromQL 标准:min({__name__="TunnelState", "@instrumentation.@name"="cloudwatch.aws/vpn", VpnId="VPN"}) < 1

推荐阈值:1(嵌入在查询中)

阈值理由:低于 1 意味着隧道关闭。

评估间隔:300

待处理周期:900

恢复周期:900

TunnelState(隧道级别)

标签:TunnelIpAddress

警报描述:当特定 VPN 隧道处于 DOWN 状态时发出警报。

意图:检测处于 DOWN 状态的特定隧道。

PromQL 标准:min({__name__="TunnelState", "@instrumentation.@name"="cloudwatch.aws/vpn", TunnelIpAddress="IP"}) < 1

推荐阈值:1(嵌入在查询中)

阈值理由:低于 1 意味着隧道关闭。

评估间隔:300

待处理周期:900

恢复周期:900