推荐的 PromQL 警报
将这些 PromQL 警报用作经典推荐警报的等效警报。它们使用 PromQL 即时查询来监控相同指标,这些查询会根据通过 CloudWatch OTLP 端点摄取的指标进行评估。
PromQL 警报使用 EvaluationCriteria 和 PromQLCriteria。与经典指标警报不同,阈值直接嵌入到 PromQL 查询表达式中。
-
待处理周期:警报转换为 ALARM 状态之前时间序列必须持续违规的持续时间(以秒为单位)。
-
恢复周期:警报恢复到 OK 状态之前所有时间序列必须停止违规的持续时间(以秒为单位)。
-
评估间隔:CloudWatch 运行 PromQL 查询的频率(以秒为单位)。
注意
这些警报需要通过 CloudWatch OTLP 端点发布的指标。有关更多信息,请参阅 PromQL 警报。
您可以使用 AWS CloudFormation 部署这些警报。请对 AWS::CloudWatch::Alarm 资源使用 EvaluationCriteria 和 PromQLCriteria 属性。
主题
API Gateway
REST API
- 4XXError
-
标签:ApiName、Stage
警报描述:当 REST API 阶段的平均 4XX 错误率超过 5% 时发出警报。
意图:检测高客户端错误率,表明存在请求问题。
PromQL 标准:
avg({__name__="4XXError", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiName="your-api-name",Stage="your-stage"}) > 0.05推荐阈值:0.05(嵌入在查询中)
阈值理由:检测超过 5% 的客户端错误率,这表示严重的请求失败。
评估间隔:60
待处理周期:300
恢复周期:300
- 5XXError
-
标签:ApiName、Stage
警报描述:当 REST API 阶段的平均 5XX 错误率超过 5% 时发出警报。
意图:检测高服务器错误率,表明存在后端故障。
PromQL 标准:
avg({__name__="5XXError", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiName="your-api-name",Stage="your-stage"}) > 0.05推荐阈值:0.05(嵌入在查询中)
阈值理由:检测超过 5% 的服务器错误率,需要立即进行调查。
评估间隔:60
待处理周期:180
恢复周期:300
- 延迟
-
标签:ApiName、Stage
警报描述:当 REST API 阶段的 p90 延迟超过 2500 毫秒时发出警报。
意图:检测影响用户体验的高 p90 延迟。
PromQL 标准:
histogram_quantile(0.9, {__name__="Latency", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiName="your-api-name",Stage="your-stage"}) > 2500推荐阈值:2500(嵌入在查询中)
阈值理由:p90 延迟超过 2500 毫秒表示大多数请求的响应时间下降。
评估间隔:60
待处理周期:300
恢复周期:300
- :计数。
-
标签:ApiName、Stage
警报描述:当 REST API 阶段的总请求数低于预期基准时发出警报。
意图:检测低流量,可能表示存在路由或可用性问题。
PromQL 标准:
sum({__name__="Count", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiName="your-api-name",Stage="your-stage"}) <THRESHOLD推荐阈值:
THRESHOLD(嵌入在查询中)阈值理由:根据预期流量基准进行设置,以检测意外下降。
评估间隔:60
待处理周期:600
恢复周期:300
HTTP API
- 4xx
-
标签:ApiId、Stage
警报描述:当 HTTP API 阶段的平均 4xx 错误率超过 5% 时发出警报。
意图:检测 HTTP API 端点的高客户端错误率。
PromQL 标准:
avg({__name__="4xx", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="your-api-id",Stage="your-stage"}) > 0.05推荐阈值:0.05(嵌入在查询中)
阈值理由:检测超过 5% 的客户端错误率。
评估间隔:60
待处理周期:300
恢复周期:300
- 5xx
-
标签:ApiId、Stage
警报描述:当 HTTP API 阶段的平均 5xx 错误率超过 5% 时发出警报。
意图:检测 HTTP API 端点的高服务器错误率。
PromQL 标准:
avg({__name__="5xx", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="your-api-id",Stage="your-stage"}) > 0.05推荐阈值:0.05(嵌入在查询中)
阈值理由:检测超过 5% 的服务器错误率,需要进行调查。
评估间隔:60
待处理周期:180
恢复周期:300
- 延迟
-
标签:ApiId、Stage
警报描述:当 HTTP API 阶段的 p90 延迟超过 2500 毫秒时发出警报。
意图:检测 HTTP API 端点的高 p90 延迟。
PromQL 标准:
histogram_quantile(0.9, {__name__="Latency", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="your-api-id",Stage="your-stage"}) > 2500推荐阈值:2500(嵌入在查询中)
阈值理由:p90 延迟超过 2500 毫秒表示响应时间下降。
评估间隔:60
待处理周期:300
恢复周期:300
- IntegrationLatency
-
标签:ApiId、Stage
警报描述:当 HTTP API 阶段的 p90 集成延迟超过 2000 毫秒时发出警报。
意图:检测高后端集成延迟,影响响应时间。
PromQL 标准:
histogram_quantile(0.9, {__name__="IntegrationLatency", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="your-api-id",Stage="your-stage"}) > 2000推荐阈值:2000(嵌入在查询中)
阈值理由:p90 集成延迟超过 2000 毫秒表示后端缓慢。
评估间隔:60
待处理周期:300
恢复周期:300
- :计数。
-
标签:ApiId、Stage
警报描述:当 HTTP API 阶段的总请求数低于预期基准时发出警报。
意图:检测低流量,可能表示存在路由或可用性问题。
PromQL 标准:
sum({__name__="Count", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="your-api-id",Stage="your-stage"}) <THRESHOLD推荐阈值:
THRESHOLD(嵌入在查询中)阈值理由:根据预期流量基准进行设置,以检测意外下降。
评估间隔:60
待处理周期:600
恢复周期:300
WebSocket API
- ClientError
-
标签:ApiId、Stage
警报描述:当 WebSocket API 阶段的平均客户端错误率超过 5% 时发出警报。
意图:检测 WebSocket API 连接的高客户端错误率。
PromQL 标准:
avg({__name__="ClientError", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="your-api-id",Stage="your-stage"}) > 0.05推荐阈值:0.05(嵌入在查询中)
阈值理由:检测 WebSocket 连接超过 5% 的客户端错误率。
评估间隔:60
待处理周期:300
恢复周期:300
- ExecutionError
-
标签:ApiId、Stage
警报描述:当 WebSocket API 阶段的平均执行错误率超过 5% 时发出警报。
意图:检测 WebSocket API 的高服务器端执行错误率。
PromQL 标准:
avg({__name__="ExecutionError", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="your-api-id",Stage="your-stage"}) > 0.05推荐阈值:0.05(嵌入在查询中)
阈值理由:检测超过 5% 的执行错误率,需要进行调查。
评估间隔:60
待处理周期:180
恢复周期:300
- IntegrationLatency
-
标签:ApiId、Stage
警报描述:当 WebSocket API 阶段的 p90 集成延迟超过 2000 毫秒时发出警报。
意图:检测 WebSocket API 路由的高后端集成延迟。
PromQL 标准:
histogram_quantile(0.9, {__name__="IntegrationLatency", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="your-api-id",Stage="your-stage"}) > 2000推荐阈值:2000(嵌入在查询中)
阈值理由:p90 集成延迟超过 2000 毫秒表示后端缓慢。
评估间隔:60
待处理周期:300
恢复周期:300
- MessageCount
-
标签:ApiId、Stage
警报描述:当 WebSocket API 阶段的总消息数低于预期基准时发出警报。
意图:检测低消息量,可能表示存在连接或路由问题。
PromQL 标准:
sum({__name__="MessageCount", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="your-api-id",Stage="your-stage"}) <THRESHOLD推荐阈值:
THRESHOLD(嵌入在查询中)阈值理由:根据预期消息量进行设置,以检测意外下降。
评估间隔:60
待处理周期:600
恢复周期:300
Auto Scaling
- GroupInServiceCapacity
-
标签:AutoScalingGroupName
警报描述:当自动扩缩组的平均服务中容量低于预期最低值时发出警报。
意图:检测由于启动失败或实例终止而导致的低可用性。
PromQL 标准:
avg({__name__="GroupInServiceCapacity", "@instrumentation.@name"="cloudwatch.aws/autoscaling", AutoScalingGroupName="your-auto-scaling-group-name"}) <THRESHOLD推荐阈值:
THRESHOLD(嵌入在查询中)阈值理由:根据所需的最低容量进行设置,以检测启动失败或实例不足情形。
评估间隔:60
待处理周期:600
恢复周期:600
Certificate Manager
- DaysToExpiry
-
标签:CertificateArn
警报描述:当证书到期的最短天数降至 44 天或更短时发出警报。
意图:主动发出证书到期警报,以便有时间进行续订。
PromQL 标准:
min({__name__="DaysToExpiry", "@instrumentation.@name"="cloudwatch.aws/certificatemanager", CertificateArn="your-certificate-arn"}) <= 44推荐阈值:44(嵌入在查询中)
阈值理由:在证书过期之前提供足够的准备时间来完成续订过程。
评估间隔:86400
待处理周期:86400
恢复周期:86400
CloudFront
- 5xxErrorRate
-
标签:DistributionId
警报描述:当平均 5xx 错误率超过 CloudFront 分配的阈值时发出警报。
意图:检测影响内容交付的高源或 CloudFront 错误率。
PromQL 标准:
avg({__name__="5xxErrorRate", "@instrumentation.@name"="cloudwatch.aws/cloudfront", DistributionId="your-distribution-id"}) >THRESHOLD推荐阈值:
THRESHOLD(嵌入在查询中)阈值理由:根据可接受的内容分发错误率进行设置。
评估间隔:60
待处理周期:300
恢复周期:300
- OriginLatency
-
标签:DistributionId
警报描述:当 p90 源延迟超过 CloudFront 分配的阈值时发出警报。
意图:检测影响内容交付性能的高源响应延迟。
PromQL 标准:
histogram_quantile(0.9, {__name__="OriginLatency", "@instrumentation.@name"="cloudwatch.aws/cloudfront", DistributionId="your-distribution-id"}) >THRESHOLD推荐阈值:
THRESHOLD(嵌入在查询中)阈值理由:根据预期源响应时间和缓存策略进行设置。
评估间隔:60
待处理周期:300
恢复周期:300
- FunctionValidationErrors
-
标签:DistributionId、FunctionName
警报描述:当发生任何 CloudFront 函数验证错误时发出警报。
意图:检测阻止函数执行的 CloudFront 函数验证失败。
PromQL 标准:
sum({__name__="FunctionValidationErrors", "@instrumentation.@name"="cloudwatch.aws/cloudfront", DistributionId="your-distribution-id",FunctionName="your-function-name"}) > 0推荐阈值:0(嵌入在查询中)
阈值理由:任何验证错误都表明存在需要注意的函数配置问题。
评估间隔:60
待处理周期:120
恢复周期:120
- FunctionExecutionErrors
-
标签:DistributionId、FunctionName
警报描述:当发生任何 CloudFront 函数执行错误时发出警报。
意图:检测 CloudFront 函数中影响请求处理的运行时故障。
PromQL 标准:
sum({__name__="FunctionExecutionErrors", "@instrumentation.@name"="cloudwatch.aws/cloudfront", DistributionId="your-distribution-id",FunctionName="your-function-name"}) > 0推荐阈值:0(嵌入在查询中)
阈值理由:任何执行错误都表明函数代码存在运行时问题。
评估间隔:60
待处理周期:300
恢复周期:300
- FunctionThrottles
-
标签:DistributionId、FunctionName
警报描述:当发生任何 CloudFront 函数节流时发出警报。
意图:检测可能会降低请求处理的 CloudFront 函数节流。
PromQL 标准:
sum({__name__="FunctionThrottles", "@instrumentation.@name"="cloudwatch.aws/cloudfront", DistributionId="your-distribution-id",FunctionName="your-function-name"}) > 0推荐阈值:0(嵌入在查询中)
阈值理由:任何节流都表明函数达到了计算限制。
评估间隔:60
待处理周期:300
恢复周期:300
Cognito
- SignUpThrottles
-
标签:UserPool、UserPoolClient
警报描述:当注册节流事件超过用户池的阈值时发出警报。
意图:检测阻止新用户注册的注册节流。
PromQL 标准:
sum({__name__="SignUpThrottles", "@instrumentation.@name"="cloudwatch.aws/cognito", UserPool="your-user-pool",UserPoolClient="your-user-pool-client"}) >THRESHOLD推荐阈值:
THRESHOLD(嵌入在查询中)阈值理由:根据注册操作可接受的节流率进行设置。
评估间隔:60
待处理周期:300
恢复周期:300
- SignInThrottles
-
标签:UserPool、UserPoolClient
警报描述:当登录节流事件超过用户池的阈值时发出警报。
意图:检测阻止用户身份验证的登录节流。
PromQL 标准:
sum({__name__="SignInThrottles", "@instrumentation.@name"="cloudwatch.aws/cognito", UserPool="your-user-pool",UserPoolClient="your-user-pool-client"}) >THRESHOLD推荐阈值:
THRESHOLD(嵌入在查询中)阈值理由:根据登录操作可接受的节流率进行设置。
评估间隔:60
待处理周期:300
恢复周期:300
- TokenRefreshTrott
-
标签:UserPool、UserPoolClient
警报描述:当令牌刷新节流事件超过用户池的阈值时发出警报。
意图:检测可能会导致会话中断的令牌刷新节流。
PromQL 标准:
sum({__name__="TokenRefreshThrottles", "@instrumentation.@name"="cloudwatch.aws/cognito", UserPool="your-user-pool",UserPoolClient="your-user-pool-client"}) >THRESHOLD推荐阈值:
THRESHOLD(嵌入在查询中)阈值理由:根据令牌刷新操作可接受的节流率进行设置。
评估间隔:60
待处理周期:300
恢复周期:300
- FederationThrottles
-
标签:UserPool、UserPoolClient、IdentityProvider
警报描述:当联合身份验证节流事件超过用户池身份提供者的阈值时发出警报。
意图:检测可能会阻止联合登录的联合节流。
PromQL 标准:
sum({__name__="FederationThrottles", "@instrumentation.@name"="cloudwatch.aws/cognito", UserPool="your-user-pool",UserPoolClient="your-user-pool-client",IdentityProvider="your-identity-provider"}) >THRESHOLD推荐阈值:
THRESHOLD(嵌入在查询中)阈值理由:根据联合身份验证操作可接受的节流率进行设置。
评估间隔:60
待处理周期:300
恢复周期:300
DynamoDB
- AccountProvisionedReadCapacityUtilization
-
标签:无
警报描述:当账户级别的预置读取容量利用率超过 80% 时发出警报。
意图:检测预置的读取容量何时接近账户限制。
PromQL 标准:
max({__name__="AccountProvisionedReadCapacityUtilization", "@instrumentation.@name"="cloudwatch.aws/dynamodb"}) > 80推荐阈值:80(嵌入在查询中)
阈值理由:利用率为 80% 时,在达到账户限制之前,您的余量有限。
评估间隔:300
待处理周期:600
恢复周期:600
- AccountProvisionedWriteCapacityUtilization
-
标签:无
警报描述:当账户级别的预置写入容量利用率超过 80% 时发出警报。
意图:检测预置的写入容量何时接近账户限制。
PromQL 标准:
max({__name__="AccountProvisionedWriteCapacityUtilization", "@instrumentation.@name"="cloudwatch.aws/dynamodb"}) > 80推荐阈值:80(嵌入在查询中)
阈值理由:利用率为 80% 时,在达到账户限制之前,您的余量有限。
评估间隔:300
待处理周期:600
恢复周期:600
- AgeOfOldestUnreplicatedRecord
-
标签:TableName、DelegatedOperation
警报描述:当最早的未复制记录的期限超过阈值时发出警报。
意图:检测可能导致全局表中的数据过时的复制延迟。
PromQL 标准:
max({__name__="AgeOfOldestUnreplicatedRecord", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name",DelegatedOperation="your-operation"}) >THRESHOLD推荐阈值:
THRESHOLD(嵌入在查询中)阈值理由:根据复制新鲜度要求进行设置。
评估间隔:300
待处理周期:900
恢复周期:900
- FailedToReplicateRecordCount
-
标签:TableName、DelegatedOperation
警报描述:当全局表中任何记录复制失败时发出警报。
意图:检测导致跨区域数据不一致的复制失败。
PromQL 标准:
sum({__name__="FailedToReplicateRecordCount", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name",DelegatedOperation="your-operation"}) > 0推荐阈值:0(嵌入在查询中)
阈值理由:任何失败的复制都表明存在数据一致性问题,需要立即关注。
评估间隔:60
待处理周期:60
恢复周期:60
- ReadThrottleEvents
-
标签:TableName
警报描述:当读取节流事件超过表的阈值时发出警报。
意图:检测表示预置容量不足的读取节流。
PromQL 标准:
sum({__name__="ReadThrottleEvents", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name"}) >THRESHOLD推荐阈值:
THRESHOLD(嵌入在查询中)阈值理由:根据读取操作可接受的节流计数进行设置。
评估间隔:60
待处理周期:300
恢复周期:300
- ReadThrottleEvents (GSI)
-
标签:TableName、GlobalSecondaryIndexName
警报描述:当读取节流事件超过全局二级索引的阈值时发出警报。
意图:检测 GSI 上表示索引容量不足的读取节流。
PromQL 标准:
sum({__name__="ReadThrottleEvents", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name",GlobalSecondaryIndexName="your-index-name"}) >THRESHOLD推荐阈值:
THRESHOLD(嵌入在查询中)阈值理由:根据 GSI 读取操作可接受的节流计数进行设置。
评估间隔:60
待处理周期:300
恢复周期:300
- ReplicationLatency
-
标签:TableName、ReceivingRegion
警报描述:当平均复制延迟超过全局表的阈值时发出警报。
意图:检测可能导致副本区域读取过时的高复制延迟。
PromQL 标准:
avg({__name__="ReplicationLatency", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name",ReceivingRegion="your-receiving-region"}) >THRESHOLD推荐阈值:
THRESHOLD(嵌入在查询中)阈值理由:根据副本区域的数据新鲜度要求进行设置。
评估间隔:60
待处理周期:900
恢复周期:900
- SuccessfulRequestLatency
-
标签:TableName、Operation
警报描述:当平均成功请求延迟超过表操作的阈值时发出警报。
意图:检测影响应用程序性能的 DynamoDB 操作高延迟。
PromQL 标准:
avg({__name__="SuccessfulRequestLatency", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name",Operation="your-operation"}) >THRESHOLD推荐阈值:
THRESHOLD(嵌入在查询中)阈值理由:根据特定 DynamoDB 操作的延迟 SLA 进行设置。
评估间隔:60
待处理周期:600
恢复周期:600
- SystemErrors
-
标签:TableName
警报描述:当系统错误超过表的阈值时发出警报。
意图:检测影响表可用性的 DynamoDB 服务端错误。
PromQL 标准:
sum({__name__="SystemErrors", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name"}) >THRESHOLD推荐阈值:
THRESHOLD(嵌入在查询中)阈值理由:根据表可接受的系统错误计数进行设置。
评估间隔:60
待处理周期:900
恢复周期:900
- ThrottledPutRecordCount
-
标签:TableName、DelegatedOperation
警报描述:当受限的放置记录计数超过表的阈值时发出警报。
意图:检测可能导致流式操作数据丢失的受限 put。
PromQL 标准:
max({__name__="ThrottledPutRecordCount", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name",DelegatedOperation="your-operation"}) >THRESHOLD推荐阈值:
THRESHOLD(嵌入在查询中)阈值理由:根据流式放置操作可接受的节流计数进行设置。
评估间隔:60
待处理周期:600
恢复周期:600
- UserErrors
-
标签:无
警报描述:当用户错误超过整个账户的阈值时发出警报。
意图:检测高客户端错误率,例如验证或条件检查失败。
PromQL 标准:
sum({__name__="UserErrors", "@instrumentation.@name"="cloudwatch.aws/dynamodb"}) >THRESHOLD推荐阈值:
THRESHOLD(嵌入在查询中)阈值理由:根据客户端请求失败可接受的错误率进行设置。
评估间隔:60
待处理周期:600
恢复周期:600
- WriteThrottleEvents
-
标签:TableName
警报描述:当写入节流事件超过表的阈值时发出警报。
意图:检测表示预置容量不足的写入节流。
PromQL 标准:
sum({__name__="WriteThrottleEvents", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name"}) >THRESHOLD推荐阈值:
THRESHOLD(嵌入在查询中)阈值理由:根据写入操作可接受的节流计数进行设置。
评估间隔:60
待处理周期:300
恢复周期:300
- WriteThrottleEvents (GSI)
-
标签:TableName、GlobalSecondaryIndexName
警报描述:当写入节流事件超过全局二级索引的阈值时发出警报。
意图:检测 GSI 上表示索引容量不足的写入节流。
PromQL 标准:
sum({__name__="WriteThrottleEvents", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="your-table-name",GlobalSecondaryIndexName="your-index-name"}) >THRESHOLD推荐阈值:
THRESHOLD(嵌入在查询中)阈值理由:根据 GSI 写入操作可接受的节流计数进行设置。
评估间隔:60
待处理周期:300
恢复周期:300
EBS
- VolumeStalledIOCheck
-
标签:VolumeId、InstanceId
警报描述:当 EBS 卷报告停滞的 I/O 检查失败时发出警报。
意图:检测 EBS 卷上停滞的 I/O,表示卷受损。
PromQL 标准:
max({__name__="VolumeStalledIOCheck", "@instrumentation.@name"="cloudwatch.aws/ebs", VolumeId="your-volume-id",InstanceId="your-instance-id"}) >= 1推荐阈值:1(嵌入在查询中)
阈值理由:1 或更大值表示卷已停滞 I/O,需要立即进行调查。
评估间隔:60
待处理周期:600
恢复周期:600
Amazon Elastic Compute Cloud
- CPUUtilization
-
标签:InstanceId
警报描述:当 EC2 实例的平均 CPU 利用率超过 80% 时发出警报。
意图:检测高 CPU 利用率。
PromQL 标准:
avg({__name__="CPUUtilization", "@instrumentation.@name"="cloudwatch.aws/ec2", InstanceId="your-instance-id"}) > 80推荐阈值:80(嵌入在查询中)
阈值理由:80% 阈值在饱和之前留出余量。
评估间隔:300
待处理周期:900
恢复周期:900
- StatusCheckFailed
-
标签:InstanceId
警报描述:当 EC2 实例的实例或系统运行状况检查失败时发出警报。
意图:检测实例或系统运行状况问题。
PromQL 标准:
max({__name__="StatusCheckFailed", "@instrumentation.@name"="cloudwatch.aws/ec2", InstanceId="your-instance-id"}) >= 1推荐阈值:1(嵌入在查询中)
阈值理由:任何状态检查失败都需要调查。
评估间隔:300
待处理周期:600
恢复周期:600
- StatusCheckFailed_AttachedEBS
-
标签:InstanceId
警报描述:当附加的 EBS 卷对 EC2 实例无法访问时发出警报。
意图:检测无法访问的 EBS 卷。
PromQL 标准:
max({__name__="StatusCheckFailed_AttachedEBS", "@instrumentation.@name"="cloudwatch.aws/ec2", InstanceId="your-instance-id"}) >= 1推荐阈值:1(嵌入在查询中)
阈值理由:无法访问的卷导致 I/O 故障。
评估间隔:60
待处理周期:600
恢复周期:600
Amazon ECS
- CPUReservation
-
标签:ClusterName
警报描述:当 ECS 集群的平均 CPU 预留率超过 80% 时发出警报。
意图:检测接近 CPU 容量的集群。
PromQL 标准:
avg({__name__="CPUReservation", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="your-cluster-name"}) > 80推荐阈值:80(嵌入在查询中)
阈值理由:80% 预留表示新任务的余量有限。
评估间隔:60
待处理周期:300
恢复周期:300
- CPUUtilization
-
标签:ClusterName、ServiceName
警报描述:当 ECS 服务的平均 CPU 利用率超过 80% 时发出警报。
意图:检测 ECS 服务的高 CPU 利用率。
PromQL 标准:
avg({__name__="CPUUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="your-cluster-name",ServiceName="your-service-name"}) > 80推荐阈值:80(嵌入在查询中)
阈值理由:80% 在饱和之前留出余量。
评估间隔:60
待处理周期:300
恢复周期:300
- EBSFilesystemUtilization
-
标签:ClusterName、ServiceName
警报描述:当 ECS 服务的平均 EBS 文件系统利用率超过 80% 时发出警报。
意图:检测高 EBS 存储利用率。
PromQL 标准:
avg({__name__="EBSFilesystemUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="your-cluster-name",ServiceName="your-service-name"}) > 80推荐阈值:80(嵌入在查询中)
阈值理由:80% 在饱和之前留出余量。
评估间隔:60
待处理周期:300
恢复周期:300
- MemoryReservation
-
标签:ClusterName
警报描述:当 ECS 集群的平均内存预留率超过 80% 时发出警报。
意图:检测接近内存容量的集群。
PromQL 标准:
avg({__name__="MemoryReservation", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="your-cluster-name"}) > 80推荐阈值:80(嵌入在查询中)
阈值理由:80% 预留表示新任务的余量有限。
评估间隔:60
待处理周期:300
恢复周期:300
- MemoryUtilization
-
标签:ClusterName、ServiceName
警报描述:当 ECS 服务的平均内存利用率超过 80% 时发出警报。
意图:检测高内存利用率。
PromQL 标准:
avg({__name__="MemoryUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="your-cluster-name",ServiceName="your-service-name"}) > 80推荐阈值:80(嵌入在查询中)
阈值理由:80% 在饱和之前留出余量。
评估间隔:60
待处理周期:300
恢复周期:300
- HTTPCode_Target_5XX_Count
-
标签:ClusterName、ServiceName
警报描述:当 HTTP 5XX 错误计数超过 ECS 服务的阈值时发出警报。
意图:检测高服务器端错误计数。
PromQL 标准:
sum({__name__="HTTPCode_Target_5XX_Count", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="your-cluster-name",ServiceName="your-service-name"}) >THRESHOLD推荐阈值:
THRESHOLD(嵌入在查询中)阈值理由:根据应用程序的正常错误率基准进行设置。
评估间隔:60
待处理周期:300
恢复周期:300
- TargetResponseTime
-
标签:ClusterName、ServiceName
警报描述:当平均目标响应时间超过 ECS 服务的阈值时发出警报。
意图:检测高目标响应时间。
PromQL 标准:
avg({__name__="TargetResponseTime", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="your-cluster-name",ServiceName="your-service-name"}) >THRESHOLD推荐阈值:
THRESHOLD(嵌入在查询中)阈值理由:基于应用程序可接受的延迟要求进行设置。
评估间隔:60
待处理周期:300
恢复周期:300
Amazon ECS Container Insights
- EphemeralStorageUtilized
-
标签:ClusterName、ServiceName
警报描述:当平均临时存储用量超过 Fargate 任务的阈值时发出警报。
意图:检测 Fargate 任务的高临时存储用量。
PromQL 标准:
avg({__name__="EphemeralStorageUtilized", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name",ServiceName="your-service-name"}) >THRESHOLD推荐阈值:
THRESHOLD(嵌入在查询中)阈值理由:根据任务的临时存储分配进行设置。
评估间隔:60
待处理周期:300
恢复周期:300
- RunningTaskCount
-
标签:ClusterName、ServiceName
警报描述:当 ECS 服务的运行任务计数降至零时发出警报。
意图:检测何时没有任务正在运行。
PromQL 标准:
avg({__name__="RunningTaskCount", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name",ServiceName="your-service-name"}) <= 0推荐阈值:0(嵌入在查询中)
阈值理由:零个运行任务表示服务中断。
评估间隔:60
待处理周期:300
恢复周期:300
- instance_filesystem_utilization
-
标签:InstanceId、ContainerInstanceId、ClusterName
警报描述:当容器实例的平均文件系统利用率超过 90% 时发出警报。
意图:检测高文件系统利用率。
PromQL 标准:
avg({__name__="instance_filesystem_utilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", InstanceId="your-instance-id",ContainerInstanceId="your-container-instance-id",ClusterName="your-cluster-name"}) > 90推荐阈值:90(嵌入在查询中)
阈值理由:90% 文件系统利用率为操作空间留下最少空间。
评估间隔:60
待处理周期:300
恢复周期:300
Amazon ECS Container Insights 增强型可观测性
- TaskCpuUtilization(集群级别)
-
标签:ClusterName
警报描述:当集群级别的平均任务 CPU 利用率超过 80% 时发出警报。
意图:检测高 CPU 利用率。
PromQL 标准:
avg({__name__="TaskCpuUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name"}) > 80推荐阈值:80(嵌入在查询中)
阈值理由:80% 在饱和之前留出余量。
评估间隔:60
待处理周期:300
恢复周期:300
- TaskCpuUtilization(服务级别)
-
标签:ClusterName、ServiceName
警报描述:当服务级别的平均任务 CPU 利用率超过 80% 时发出警报。
意图:检测高 CPU 利用率。
PromQL 标准:
avg({__name__="TaskCpuUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name",ServiceName="your-service-name"}) > 80推荐阈值:80(嵌入在查询中)
阈值理由:80% 在饱和之前留出余量。
评估间隔:60
待处理周期:300
恢复周期:300
- TaskMemoryUtilization(集群级别)
-
标签:ClusterName
警报描述:当集群级别的平均任务内存利用率超过 80% 时发出警报。
意图:检测高内存利用率。
PromQL 标准:
avg({__name__="TaskMemoryUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name"}) > 80推荐阈值:80(嵌入在查询中)
阈值理由:80% 在饱和之前留出余量。
评估间隔:60
待处理周期:300
恢复周期:300
- TaskMemoryUtilization(服务级别)
-
标签:ClusterName、ServiceName
警报描述:当服务级别的平均任务内存利用率超过 80% 时发出警报。
意图:检测高内存利用率。
PromQL 标准:
avg({__name__="TaskMemoryUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name",ServiceName="your-service-name"}) > 80推荐阈值:80(嵌入在查询中)
阈值理由:80% 在饱和之前留出余量。
评估间隔:60
待处理周期:300
恢复周期:300
- ContainerCpuUtilization(集群级别)
-
标签:ClusterName
警报描述:当集群级别的平均容器 CPU 利用率超过 80% 时发出警报。
意图:检测高 CPU 利用率。
PromQL 标准:
avg({__name__="ContainerCpuUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name"}) > 80推荐阈值:80(嵌入在查询中)
阈值理由:80% 在饱和之前留出余量。
评估间隔:60
待处理周期:300
恢复周期:300
- ContainerCpuUtilization(容器级别)
-
标签:ContainerName、ClusterName、ServiceName
警报描述:当容器级别的平均容器 CPU 利用率超过 80% 时发出警报。
意图:检测高 CPU 利用率。
PromQL 标准:
avg({__name__="ContainerCpuUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ContainerName="your-container-name",ClusterName="your-cluster-name",ServiceName="your-service-name"}) > 80推荐阈值:80(嵌入在查询中)
阈值理由:80% 在饱和之前留出余量。
评估间隔:60
待处理周期:300
恢复周期:300
- ContainerMemoryUtilization(集群级别)
-
标签:ClusterName
警报描述:当集群级别的平均容器内存利用率超过 80% 时发出警报。
意图:检测高内存利用率。
PromQL 标准:
avg({__name__="ContainerMemoryUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name"}) > 80推荐阈值:80(嵌入在查询中)
阈值理由:80% 在饱和之前留出余量。
评估间隔:60
待处理周期:300
恢复周期:300
- ContainerMemoryUtilization(容器级别)
-
标签:ContainerName、ClusterName、ServiceName
警报描述:当容器级别的平均容器内存利用率超过 80% 时发出警报。
意图:检测高内存利用率。
PromQL 标准:
avg({__name__="ContainerMemoryUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ContainerName="your-container-name",ClusterName="your-cluster-name",ServiceName="your-service-name"}) > 80推荐阈值:80(嵌入在查询中)
阈值理由:80% 在饱和之前留出余量。
评估间隔:60
待处理周期:300
恢复周期:300
- TaskEBSfilesystemUtilization
-
标签:ClusterName、ServiceName
警报描述:当任务的平均 EBS 文件系统利用率超过 80% 时发出警报。
意图:检测高 EBS 文件系统利用率。
PromQL 标准:
avg({__name__="TaskEBSfilesystemUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name",ServiceName="your-service-name"}) > 80推荐阈值:80(嵌入在查询中)
阈值理由:80% 在饱和之前留出余量。
评估间隔:60
待处理周期:300
恢复周期:300
- TaskEphemeralStorageUtilization(集群级别)
-
标签:ClusterName
警报描述:当集群级别的平均临时存储利用率超过 80% 时发出警报。
意图:检测高临时存储利用率。
PromQL 标准:
avg({__name__="TaskEphemeralStorageUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name"}) > 80推荐阈值:80(嵌入在查询中)
阈值理由:80% 在饱和之前留出余量。
评估间隔:60
待处理周期:300
恢复周期:300
- TaskEphemeralStorageUtilization(服务级别)
-
标签:ClusterName、ServiceName
警报描述:当服务级别的平均临时存储利用率超过 80% 时发出警报。
意图:检测高临时存储利用率。
PromQL 标准:
avg({__name__="TaskEphemeralStorageUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="your-cluster-name",ServiceName="your-service-name"}) > 80推荐阈值:80(嵌入在查询中)
阈值理由:80% 在饱和之前留出余量。
评估间隔:60
待处理周期:300
恢复周期:300
Amazon EFS
- PercentIOLimit
-
标签:FileSystemId
警报描述:当 EFS 文件系统达到其 I/O 限制的 100% 时发出警报。
意图:检测文件系统何时达到 I/O 限制。
PromQL 标准:
avg({__name__="PercentIOLimit", "@instrumentation.@name"="cloudwatch.aws/efs", FileSystemId="your-filesystem-id"}) >= 100推荐阈值:100(嵌入在查询中)
阈值理由:100% 时,文件系统成为瓶颈。
评估间隔:60
待处理周期:900
恢复周期:900
- BurstCreditBalance
-
标签:FileSystemId
警报描述:当 EFS 文件系统的突增积分余额降至零时发出警报。
意图:检测导致吞吐量减慢的耗尽的突增积分。
PromQL 标准:
avg({__name__="BurstCreditBalance", "@instrumentation.@name"="cloudwatch.aws/efs", FileSystemId="your-filesystem-id"}) <= 0推荐阈值:0(嵌入在查询中)
阈值理由:零积分导致吞吐量降低。
评估间隔:60
待处理周期:900
恢复周期:900
Amazon EKS Container Insights
- node_cpu_utilization
-
标签:ClusterName
警报描述:当 EKS Worker 节点上的最大 CPU 利用率超过 80% 时发出警报。
意图:检测 Worker 节点上的高 CPU。
PromQL 标准:
max({__name__="node_cpu_utilization", "@instrumentation.@name"="cloudwatch.aws/eks-containerinsights", ClusterName="your-cluster-name"}) > 80推荐阈值:80(嵌入在查询中)
阈值理由:80% 在饱和之前留出余量。
评估间隔:60
待处理周期:300
恢复周期:300
- node_filesystem_utilization
-
标签:ClusterName
警报描述:当最大文件系统利用率超过 EKS Worker 节点的阈值时发出警报。
意图:检测 Worker 节点上的高文件系统使用率。
PromQL 标准:
max({__name__="node_filesystem_utilization", "@instrumentation.@name"="cloudwatch.aws/eks-containerinsights", ClusterName="your-cluster-name"}) >THRESHOLD推荐阈值:
THRESHOLD(嵌入在查询中)阈值说明:根据节点的存储容量和使用模式进行设置。
评估间隔:60
待处理周期:300
恢复周期:300
- node_memory_utilization
-
标签:ClusterName
警报描述:当 EKS Worker 节点上的最大内存利用率超过 80% 时发出警报。
意图:检测 Worker 节点上的高内存。
PromQL 标准:
max({__name__="node_memory_utilization", "@instrumentation.@name"="cloudwatch.aws/eks-containerinsights", ClusterName="your-cluster-name"}) > 80推荐阈值:80(嵌入在查询中)
阈值理由:80% 在饱和之前留出余量。
评估间隔:60
待处理周期:300
恢复周期:300
- pod_cpu_utilization_over_pod_limit
-
标签:ClusterName、Namespace、Service
警报描述:当容器组(pod)CPU 利用率超过其限制的 80% 时发出警报。
意图:检测接近 CPU 限制的容器组(pod)。
PromQL 标准:
max({__name__="pod_cpu_utilization_over_pod_limit", "@instrumentation.@name"="cloudwatch.aws/eks-containerinsights", ClusterName="your-cluster-name",Namespace="your-namespace",Service="your-service"}) > 80推荐阈值:80(嵌入在查询中)
阈值理由:80% 在节流发生之前留出余量。
评估间隔:60
待处理周期:300
恢复周期:300
- pod_memory_utilization_over_pod_limit
-
标签:ClusterName、Namespace、Service
警报描述:当容器组(pod)内存利用率超过其限制的 80% 时发出警报。
意图:检测接近内存限制的容器组(pod)。
PromQL 标准:
max({__name__="pod_memory_utilization_over_pod_limit", "@instrumentation.@name"="cloudwatch.aws/eks-containerinsights", ClusterName="your-cluster-name",Namespace="your-namespace",Service="your-service"}) > 80推荐阈值:80(嵌入在查询中)
阈值理由:80% 在 OOMKill 发生之前留出余量。
评估间隔:60
待处理周期:300
恢复周期:300
Amazon ElastiCache
- CPUUtilization
-
标签:CacheClusterId、CacheNodeId
警报描述:当平均 CPU 利用率超过 ElastiCache 节点的阈值时发出警报。
意图:检测实例的高 CPU。
PromQL 标准:
avg({__name__="CPUUtilization", "@instrumentation.@name"="cloudwatch.aws/elasticache", CacheClusterId="your-cache-cluster-id",CacheNodeId="your-cache-node-id"}) >THRESHOLD推荐阈值:
THRESHOLD(嵌入在查询中)阈值理由:根据节点类型和工作负载特征进行设置。
评估间隔:60
待处理周期:300
恢复周期:300
- CurrConnections
-
标签:CacheClusterId、CacheNodeId
警报描述:当连接计数超过 ElastiCache 节点的阈值时发出警报。
意图:检测高连接计数。
PromQL 标准:
avg({__name__="CurrConnections", "@instrumentation.@name"="cloudwatch.aws/elasticache", CacheClusterId="your-cache-cluster-id",CacheNodeId="your-cache-node-id"}) >THRESHOLD推荐阈值:
THRESHOLD(嵌入在查询中)阈值理由:根据预期连接池大小和应用程序需求进行设置。
评估间隔:60
待处理周期:600
恢复周期:600
- DatabaseMemoryUsagePercentage
-
标签:CacheClusterId
警报描述:当数据库内存使用量超过 ElastiCache 集群的阈值时发出警报。
意图:检测高内存使用率以防止写入失败。
PromQL 标准:
avg({__name__="DatabaseMemoryUsagePercentage", "@instrumentation.@name"="cloudwatch.aws/elasticache", CacheClusterId="your-cache-cluster-id"}) >THRESHOLD推荐阈值:
THRESHOLD(嵌入在查询中)阈值理由:根据驱逐策略和数据重要性进行设置。
评估间隔:60
待处理周期:300
恢复周期:300
- EngineCPUUtilization
-
标签:CacheClusterId
警报描述:当 ElastiCache 集群的 Redis 引擎 CPU 利用率超过 90% 时发出警报。
意图:检测高 Redis 引擎 CPU 利用率。
PromQL 标准:
avg({__name__="EngineCPUUtilization", "@instrumentation.@name"="cloudwatch.aws/elasticache", CacheClusterId="your-cache-cluster-id"}) > 90推荐阈值:90(嵌入在查询中)
阈值理由:Redis 是单线程的;超过 90% 表示已饱和。
评估间隔:60
待处理周期:300
恢复周期:300
- ReplicationLag
-
标签:CacheClusterId
警报描述:当复制延迟超过 ElastiCache 集群的阈值时发出警报。
意图:检测影响数据一致性的复制延迟。
PromQL 标准:
avg({__name__="ReplicationLag", "@instrumentation.@name"="cloudwatch.aws/elasticache", CacheClusterId="your-cache-cluster-id"}) >THRESHOLD推荐阈值:
THRESHOLD(嵌入在查询中)阈值理由:根据应用程序对过时读取的容忍度进行设置。
评估间隔:60
待处理周期:900
恢复周期:900
Elastic GPUs
- GPUConnectivityCheckFailed
-
标签:InstanceId、EGPUId
警报描述:当 Elastic Graphics 加速器与实例失去连接时发出警报。
意图:检测与 Elastic Graphics 加速器的连接问题。
PromQL 标准:
max({__name__="GPUConnectivityCheckFailed", "@instrumentation.@name"="cloudwatch.aws/elasticgpus", InstanceId="your-instance-id",EGPUId="your-egpu-id"}) > 0推荐阈值:0(嵌入在查询中)
阈值理由:任何连接失败都需要调查。
评估间隔:300
待处理周期:900
恢复周期:900
- GPUHealthCheckFailed
-
标签:InstanceId、EGPUId
警报描述:当 Elastic Graphics 加速器运行状况检查失败时发出警报。
意图:检测运行状况不佳的 Elastic Graphics 加速器。
PromQL 标准:
max({__name__="GPUHealthCheckFailed", "@instrumentation.@name"="cloudwatch.aws/elasticgpus", InstanceId="your-instance-id",EGPUId="your-egpu-id"}) > 0推荐阈值:0(嵌入在查询中)
阈值理由:运行状况检查失败表示存在加速器问题。
评估间隔:300
待处理周期:900
恢复周期:900
Amazon EventBridge 调度器
- TargetErrorThrottledCount
-
警报描述:当计划目标调用受到限制时发出警报。
意图:检测导致计划延迟的目标节流。
PromQL 标准:
sum({__name__="TargetErrorThrottledCount", "@instrumentation.@name"="cloudwatch.aws/scheduler"}) > 0推荐阈值:0(嵌入在查询中)
阈值理由:任何节流都表明存在目标容量问题。
评估间隔:60
待处理周期:900
恢复周期:900
- InvocationThrottleCount
-
警报描述:当调度器调用受到限制时发出警报。
意图:检测调度器调用节流。
PromQL 标准:
sum({__name__="InvocationThrottleCount", "@instrumentation.@name"="cloudwatch.aws/scheduler"}) > 0推荐阈值:0(嵌入在查询中)
阈值理由:节流延迟计划的执行。
评估间隔:60
待处理周期:900
恢复周期:900
- InvocationDroppedCount
-
警报描述:当计划的调用被丢弃时发出警报。
意图:检测丢弃的调用。
PromQL 标准:
sum({__name__="InvocationDroppedCount", "@instrumentation.@name"="cloudwatch.aws/scheduler"}) > 0推荐阈值:0(嵌入在查询中)
阈值理由:丢弃的调用表示计划的事件丢失。
评估间隔:60
待处理周期:60
恢复周期:60
- InvocationsFailedToBeSentToDeadLetterCount
-
警报描述:当失败的调用无法发送到死信队列时发出警报。
意图:检测 DLQ 交付失败。
PromQL 标准:
sum({__name__="InvocationsFailedToBeSentToDeadLetterCount", "@instrumentation.@name"="cloudwatch.aws/scheduler"}) > 0推荐阈值:0(嵌入在查询中)
阈值理由:失败的 DLQ 交付意味着缺失错误信息。
评估间隔:60
待处理周期:900
恢复周期:900
Amazon Kinesis Data Streams
- GetRecords.IteratorAgeMilliseconds
-
标签:StreamName
警报描述:当使用器迭代器期限超过 Kinesis 流的阈值时发出警报。
意图:检测落后于保留期的数据,可能导致数据丢失。
PromQL 标准:
max({__name__="GetRecords.IteratorAgeMilliseconds", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="your-stream-name"}) >THRESHOLD推荐阈值:
THRESHOLD(嵌入在查询中)阈值理由:根据流保留期百分比进行设置。
评估间隔:60
待处理周期:900
恢复周期:900
- GetRecords.Success
-
标签:StreamName
警报描述:当 GetRecords 成功率低于 Kinesis 流的阈值时发出警报。
意图:检测使用器检索失败。
PromQL 标准:
avg({__name__="GetRecords.Success", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="your-stream-name"}) <THRESHOLD推荐阈值:
THRESHOLD(嵌入在查询中)阈值理由:根据预期成功率进行设置。
评估间隔:60
待处理周期:300
恢复周期:300
- PutRecord.Success
-
标签:StreamName
警报描述:当 PutRecord 成功率低于 Kinesis 流的阈值时发出警报。
意图:检测产生器摄取失败。
PromQL 标准:
avg({__name__="PutRecord.Success", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="your-stream-name"}) <THRESHOLD推荐阈值:
THRESHOLD(嵌入在查询中)阈值理由:根据预期成功率进行设置。
评估间隔:60
待处理周期:300
恢复周期:300
- PutRecords.FailedRecords
-
标签:StreamName
警报描述:当批量放置操作为 Kinesis 流产生失败记录时发出警报。
意图:检测批量放置失败。
PromQL 标准:
sum({__name__="PutRecords.FailedRecords", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="your-stream-name"}) >THRESHOLD推荐阈值:
THRESHOLD(嵌入在查询中)阈值理由:根据可接受的失败计数进行设置。
评估间隔:60
待处理周期:300
恢复周期:300
- ReadProvisionedThroughputExceeded
-
标签:StreamName
警报描述:当使用器读取超过 Kinesis 流的预置吞吐量时发出警报。
意图:检测使用器读取节流。
PromQL 标准:
avg({__name__="ReadProvisionedThroughputExceeded", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="your-stream-name"}) >THRESHOLD推荐阈值:
THRESHOLD(嵌入在查询中)阈值理由:任何持续节流都表明容量需求。
评估间隔:60
待处理周期:300
恢复周期:300
- SubscribeToShardEvent.MillisBehindLatest
-
标签:StreamName、ConsumerName
警报描述:当增强型扇出使用器落后于最新记录时发出警报。
意图:检测增强型扇出使用器处理延迟。
PromQL 标准:
avg({__name__="SubscribeToShardEvent.MillisBehindLatest", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="your-stream-name",ConsumerName="your-consumer-name"}) >THRESHOLD推荐阈值:
THRESHOLD(嵌入在查询中)阈值理由:根据可接受的处理延迟进行设置。
评估间隔:60
待处理周期:300
恢复周期:300
- WriteProvisionedThroughputExceeded
-
标签:StreamName
警报描述:当产生器写入超过 Kinesis 流的预置吞吐量时发出警报。
意图:检测产生器写入节流。
PromQL 标准:
avg({__name__="WriteProvisionedThroughputExceeded", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="your-stream-name"}) >THRESHOLD推荐阈值:
THRESHOLD(嵌入在查询中)阈值理由:持续节流表明容量需求。
评估间隔:60
待处理周期:300
恢复周期:300
AWS Lambda
- ClaimedAccountConcurrency
-
警报描述:当申领的账户并发数超过阈值时发出警报。
意图:检测接近并发配额的账户。
PromQL 标准:
max({__name__="ClaimedAccountConcurrency", "@instrumentation.@name"="cloudwatch.aws/lambda"}) >THRESHOLD推荐阈值:
THRESHOLD(嵌入在查询中)阈值理由:设置为区域并发限制百分比。
评估间隔:60
待处理周期:600
恢复周期:600
- 错误
-
标签:FunctionName
警报描述:当函数错误计数超过 Lambda 函数的阈值时发出警报。
意图:检测高函数错误计数。
PromQL 标准:
sum({__name__="Errors", "@instrumentation.@name"="cloudwatch.aws/lambda", FunctionName="your-function-name"}) >THRESHOLD推荐阈值:
THRESHOLD(嵌入在查询中)阈值理由:根据可接受的错误量进行设置。
评估间隔:60
待处理周期:180
恢复周期:300
- 节流
-
标签:FunctionName
警报描述:当 Lambda 函数的函数调用受到限制时发出警报。
意图:检测函数调用节流。
PromQL 标准:
sum({__name__="Throttles", "@instrumentation.@name"="cloudwatch.aws/lambda", FunctionName="your-function-name"}) >THRESHOLD推荐阈值:
THRESHOLD(嵌入在查询中)阈值理由:节流表明已达到并发限制。
评估间隔:60
待处理周期:300
恢复周期:300
- Duration
-
标签:FunctionName
警报描述:当 p90 函数持续时间超过 Lambda 函数的阈值时发出警报。
意图:检测长时间运行的函数调用。
PromQL 标准:
histogram_quantile(0.9, {__name__="Duration", "@instrumentation.@name"="cloudwatch.aws/lambda", FunctionName="your-function-name"}) >THRESHOLD推荐阈值:
THRESHOLD(嵌入在查询中)阈值理由:相对于函数超时进行设置。
评估间隔:60
待处理周期:900
恢复周期:900
- ConcurrentExecutions
-
标签:FunctionName
警报描述:当并发执行超过 Lambda 函数的阈值时发出警报。
意图:检测接近并发限制的函数。
PromQL 标准:
max({__name__="ConcurrentExecutions", "@instrumentation.@name"="cloudwatch.aws/lambda", FunctionName="your-function-name"}) >THRESHOLD推荐阈值:
THRESHOLD(嵌入在查询中)阈值理由:设置为预留并发百分比。
评估间隔:60
待处理周期:600
恢复周期:600
AWS Lambda Insights
- memory_utilization
-
标签:function_name
警报描述:当 Lambda 函数的平均内存利用率超过 90% 时发出警报。
意图:检测接近配置的内存限制的函数。
PromQL 标准:
avg({__name__="memory_utilization", "@instrumentation.@name"="cloudwatch.aws/lambda-insights", function_name="your-function-name"}) > 90推荐阈值:90(嵌入在查询中)
阈值理由:超过 90% 可能会导致内存不足故障。
评估间隔:60
待处理周期:600
恢复周期:600
NAT 网关
- ErrorPortAllocation
-
标签:NatGatewayId
警报描述:当 NAT 网关无法为新连接分配端口时发出警报。
意图:检测阻止新连接的端口分配失败。
PromQL 标准:
sum({__name__="ErrorPortAllocation", "@instrumentation.@name"="cloudwatch.aws/natgateway", NatGatewayId="your-nat-gateway-id"}) > 0推荐阈值:0(嵌入在查询中)
阈值理由:任何分配失败都会影响连接。
评估间隔:60
待处理周期:900
恢复周期:900
- PacketsDropCount
-
标签:NatGatewayId
警报描述:当 NAT 网关丢弃的数据包超过阈值时发出警报。
意图:检测表明容量或连接问题的数据包丢弃。
PromQL 标准:
sum({__name__="PacketsDropCount", "@instrumentation.@name"="cloudwatch.aws/natgateway", NatGatewayId="your-nat-gateway-id"}) >THRESHOLD推荐阈值:
THRESHOLD(嵌入在查询中)阈值理由:根据可接受的下降率进行设置。
评估间隔:60
待处理周期:300
恢复周期:300
AWS PrivateLink 端点
- PacketsDropped
-
标签:VpcId、VpcEndpointId、EndpointType、SubnetId、ServiceName
警报描述:当 VPC 端点丢弃的数据包超过阈值时发出警报。
意图:检测运行状况不佳的端点或端点服务。
PromQL 标准:
sum({__name__="PacketsDropped", "@instrumentation.@name"="cloudwatch.aws/privatelinkendpoints", VpcId="your-vpc-id",VpcEndpointId="your-vpc-endpoint-id",EndpointType="your-endpoint-type",SubnetId="your-subnet-id",ServiceName="your-service-name"}) >THRESHOLD推荐阈值:
THRESHOLD(嵌入在查询中)阈值理由:根据可接受的下降率进行设置。
评估间隔:60
待处理周期:300
恢复周期:300
AWS PrivateLink 服务
- RstPacketsSent
-
标签:ServiceId、LoadBalancerArn、Az
警报描述:当 RST 数据包速率超过端点服务的阈值时发出警报。
意图:检测端点服务运行状况不佳的目标。
PromQL 标准:
sum({__name__="RstPacketsSent", "@instrumentation.@name"="cloudwatch.aws/privatelinkservices", ServiceId="SVC",LoadBalancerArn="LB",Az="AZ"}) >THRESHOLD推荐阈值:
THRESHOLD(嵌入在查询中)阈值理由:根据可接受的 RST 数据包速率进行设置。
评估间隔:60
待处理周期:300
恢复周期:300
RDS
- CPUUtilization
-
标签:DBInstanceIdentifier
警报描述:当 RDS 实例的平均 CPU 利用率超过 90% 时发出警报。
意图:检测防止性能下降的高 CPU。
PromQL 标准:
avg({__name__="CPUUtilization", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > 90推荐阈值:90(嵌入在查询中)
阈值说明:90% 表示接近饱和。
评估间隔:60
待处理周期:300
恢复周期:300
- DatabaseConnections
-
标签:DBInstanceIdentifier
警报描述:当数据库连接超过 RDS 实例的阈值时发出警报。
意图:防止在最大限制下连接被拒绝。
PromQL 标准:
avg({__name__="DatabaseConnections", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) >THRESHOLD推荐阈值:
THRESHOLD(嵌入在查询中)阈值理由:设置为 max_connections 参数百分比。
评估间隔:60
待处理周期:300
恢复周期:300
- EBSByteBalance%
-
标签:DBInstanceIdentifier
警报描述:当 RDS 实例的 EBS 字节余额低于 10% 时发出警报。
意图:检测导致瓶颈的低吞吐量积分。
PromQL 标准:
avg({__name__="EBSByteBalance%", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) < 10推荐阈值:10(嵌入在查询中)
阈值理由:低于 10% 可能会导致吞吐量下降。
评估间隔:60
待处理周期:180
恢复周期:180
- EBSIOBalance%
-
标签:DBInstanceIdentifier
警报描述:当 RDS 实例的 EBS IO 余额低于 10% 时发出警报。
意图:检测导致瓶颈的低 IOPS 积分。
PromQL 标准:
avg({__name__="EBSIOBalance%", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) < 10推荐阈值:10(嵌入在查询中)
阈值理由:低于 10% 可能会导致 IOPS 下降。
评估间隔:60
待处理周期:180
恢复周期:180
- FreeableMemory
-
标签:DBInstanceIdentifier
警报描述:当 RDS 实例的可用内存低于阈值时发出警报。
意图:防止导致连接被拒绝的内存不足情形。
PromQL 标准:
avg({__name__="FreeableMemory", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) <THRESHOLD推荐阈值:
THRESHOLD(嵌入在查询中)阈值说明:根据实例类内存进行设置。
评估间隔:60
待处理周期:900
恢复周期:900
- FreeLocalStorage
-
标签:DBInstanceIdentifier
警报描述:当可用本地存储空间低于 Aurora 实例的阈值时发出警报。
意图:防止 Aurora 本地存储耗尽。
PromQL 标准:
avg({__name__="FreeLocalStorage", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) <THRESHOLD推荐阈值:
THRESHOLD(嵌入在查询中)阈值理由:根据操作所需的最低值进行设置。
评估间隔:60
待处理周期:300
恢复周期:300
- FreeStorageSpace
-
标签:DBInstanceIdentifier
警报描述:当可用存储空间低于 RDS 实例的阈值时发出警报。
意图:防止存储空间已满导致的停机。
PromQL 标准:
min({__name__="FreeStorageSpace", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) <THRESHOLD推荐阈值:
THRESHOLD(嵌入在查询中)阈值理由:根据存储增长率和预置大小进行设置。
评估间隔:60
待处理周期:300
恢复周期:300
- MaximumUsedTransactionIDs
-
标签:DBInstanceIdentifier
警报描述:当 RDS 实例的最大已用事务 ID 超过 10 亿时发出警报。
意图:防止 PostgreSQL 事务 ID 重叠。
PromQL 标准:
avg({__name__="MaximumUsedTransactionIDs", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > 1000000000推荐阈值:1000000000(嵌入查询中)
阈值理由:10 亿表示接近重叠危险。
评估间隔:60
待处理周期:60
恢复周期:60
- ReadLatency
-
标签:DBInstanceIdentifier
警报描述:当 p90 读取延迟超过 RDS 实例的阈值时发出警报。
意图:检测高读取延迟,表明存在磁盘问题。
PromQL 标准:
histogram_quantile(0.9, {__name__="ReadLatency", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) >THRESHOLD推荐阈值:
THRESHOLD(嵌入在查询中)阈值理由:根据可接受的应用程序延迟进行设置。
评估间隔:60
待处理周期:300
恢复周期:300
- ReplicaLag
-
标签:DBInstanceIdentifier
警报描述:当 RDS 只读副本的复制延迟超过 60 秒时发出警报。
意图:检测可能会导致数据丢失的复制延迟。
PromQL 标准:
max({__name__="ReplicaLag", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > 60推荐阈值:60(嵌入在查询中)
阈值理由:对于大多数工作负载,60 秒都表示显著延迟。
评估间隔:60
待处理周期:600
恢复周期:600
- WriteLatency
-
标签:DBInstanceIdentifier
警报描述:当 p90 写入延迟超过 RDS 实例的阈值时发出警报。
意图:检测高写入延迟,表明存在磁盘问题。
PromQL 标准:
histogram_quantile(0.9, {__name__="WriteLatency", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) >THRESHOLD推荐阈值:
THRESHOLD(嵌入在查询中)阈值理由:根据可接受的应用程序延迟进行设置。
评估间隔:60
待处理周期:300
恢复周期:300
- DBLoad
-
标签:DBInstanceIdentifier
警报描述:当平均数据库负载超过 RDS 实例的阈值时发出警报。
意图:检测高数据库负载下降性能。
PromQL 标准:
avg({__name__="DBLoad", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) >THRESHOLD推荐阈值:
THRESHOLD(嵌入在查询中)阈值理由:设置为 vCPU 计数的倍数。
评估间隔:60
待处理周期:900
恢复周期:900
- AuroraVolumeBytesLeftTotal
-
标签:DBClusterIdentifier
警报描述:当 Aurora 集群剩余存储字节数低于阈值时发出警报。
意图:防止 Aurora 集群存储耗尽。
PromQL 标准:
avg({__name__="AuroraVolumeBytesLeftTotal", "@instrumentation.@name"="cloudwatch.aws/rds", DBClusterIdentifier="CLUSTER"}) <THRESHOLD推荐阈值:
THRESHOLD(嵌入在查询中)阈值理由:根据增长率进行设置。
评估间隔:60
待处理周期:300
恢复周期:300
- AuroraBinlogReplicaLag
-
标签:DBClusterIdentifier
警报描述:当 Aurora 二进制日志副本延迟指示错误状态时发出警报。
意图:检测写入器实例复制错误。
PromQL 标准:
avg({__name__="AuroraBinlogReplicaLag", "@instrumentation.@name"="cloudwatch.aws/rds", DBClusterIdentifier="CLUSTER"}) <= -1推荐阈值:-1(嵌入在查询中)
阈值理由:-1 表示错误状态。
评估间隔:60
待处理周期:120
恢复周期:120
- BlockedTransactions
-
标签:DBInstanceIdentifier
警报描述:当被阻止事务计数超过 RDS 实例的阈值时发出警报。
意图:检测导致性能下降的事务阻止。
PromQL 标准:
avg({__name__="BlockedTransactions", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) >THRESHOLD推荐阈值:
THRESHOLD(嵌入在查询中)阈值理由:根据可接受的被阻止事务计数进行设置。
评估间隔:60
待处理周期:300
恢复周期:300
- BufferCacheHitRatio
-
标签:DBInstanceIdentifier
警报描述:当 RDS 实例的缓冲区缓存命中率低于 80% 时发出警报。
意图:检测导致性能下降的缓存效率低下。
PromQL 标准:
avg({__name__="BufferCacheHitRatio", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) < 80推荐阈值:80(嵌入在查询中)
阈值理由:低于 80% 表示磁盘 I/O 过多。
评估间隔:60
待处理周期:600
恢复周期:600
- EngineUptime
-
标签:DBClusterIdentifier
警报描述:当引擎正常运行时间降至零时发出警报,其表示 Aurora 写入器重启。
意图:检测 Aurora 写入器实例停机或崩溃。
PromQL 标准:
avg({__name__="EngineUptime", "@instrumentation.@name"="cloudwatch.aws/rds", DBClusterIdentifier="CLUSTER"}) <= 0推荐阈值:0(嵌入在查询中)
阈值理由:零正常运行时间表示实例重启。
评估间隔:60
待处理周期:120
恢复周期:120
- RollbackSegmentHistoryListLength
-
标签:DBInstanceIdentifier
警报描述:当 Aurora 实例的回滚分段历史记录列表长度超过 100 万时发出警报。
意图:检测导致 CPU 降级的高回滚历史记录。
PromQL 标准:
avg({__name__="RollbackSegmentHistoryListLength", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > 1000000推荐阈值:1000000(嵌入在查询中)
阈值理由:高于 1M 导致性能问题。
评估间隔:60
待处理周期:300
恢复周期:300
- StorageNetworkThroughput
-
标签:DBClusterIdentifier
警报描述:当存储网络吞吐量超过 Aurora 集群的阈值时发出警报。
意图:检测可能导致网络数据包丢弃的高吞吐量。
PromQL 标准:
avg({__name__="StorageNetworkThroughput", "@instrumentation.@name"="cloudwatch.aws/rds", DBClusterIdentifier="CLUSTER"}) >THRESHOLD推荐阈值:
THRESHOLD(嵌入在查询中)阈值理由:根据实例网络容量进行设置。
评估间隔:60
待处理周期:300
恢复周期:300
Route 53
- HealthCheckStatus
-
标签:HealthCheckId
警报描述:当 Route 53 运行状况检查报告端点运行状况不佳时发出警报。
意图:通过 Route 53 运行状况检查程序检测运行状况不佳的端点。
PromQL 标准:
avg({__name__="HealthCheckStatus", "@instrumentation.@name"="cloudwatch.aws/route53", HealthCheckId="HC"}) < 1推荐阈值:1(嵌入在查询中)
阈值理由:低于 1 表示端点未通过运行状况检查。
评估间隔:60
待处理周期:180
恢复周期:180
S3
- 4xxErrors
-
标签:BucketName、FilterId
警报描述:当 S3 存储桶的 4xx 错误率超过 5% 时发出警报。
意图:检测异常的客户端错误率。
PromQL 标准:
avg({__name__="4xxErrors", "@instrumentation.@name"="cloudwatch.aws/s3", BucketName="BUCKET",FilterId="FILTER"}) > 0.05推荐阈值:0.05(嵌入在查询中)
阈值理由:超过 5% 表示存在设置或访问问题。
评估间隔:60
待处理周期:900
恢复周期:900
- 5xxErrors
-
标签:BucketName、FilterId
警报描述:当 S3 存储桶的 5xx 错误率超过 5% 时发出警报。
意图:检测影响应用程序的服务器端错误。
PromQL 标准:
avg({__name__="5xxErrors", "@instrumentation.@name"="cloudwatch.aws/s3", BucketName="BUCKET",FilterId="FILTER"}) > 0.05推荐阈值:0.05(嵌入在查询中)
阈值理由:超过 5% 表示存在 S3 服务问题。
评估间隔:60
待处理周期:900
恢复周期:900
- OperationsFailedReplication
-
标签:SourceBucket、DestinationBucket、RuleId
警报描述:当存储桶的 S3 复制操作失败时发出警报。
意图:检测可能导致数据不一致的复制失败。
PromQL 标准:
max({__name__="OperationsFailedReplication", "@instrumentation.@name"="cloudwatch.aws/s3", SourceBucket="SRC",DestinationBucket="DST",RuleId="RULE"}) > 0推荐阈值:0(嵌入在查询中)
阈值理由:任何失败的复制都需要进行调查。
评估间隔:60
待处理周期:300
恢复周期:300
S3 对象 Lambda
- 4xxErrors
-
标签:AccessPointName、DataSourceARN
警报描述:当 S3 对象 Lambda 接入点的 4xx 错误率超过 5% 时发出警报。
意图:检测对象 Lambda 的异常客户端错误率。
PromQL 标准:
avg({__name__="4xxErrors", "@instrumentation.@name"="cloudwatch.aws/s3objectlambda", AccessPointName="AP",DataSourceARN="ARN"}) > 0.05推荐阈值:0.05(嵌入在查询中)
阈值理由:超过 5% 表示存在设置问题。
评估间隔:60
待处理周期:900
恢复周期:900
- 5xxErrors
-
标签:AccessPointName、DataSourceARN
警报描述:当 S3 对象 Lambda 接入点的 5xx 错误率超过 5% 时发出警报。
意图:检测对象 Lambda 中的服务器端错误。
PromQL 标准:
avg({__name__="5xxErrors", "@instrumentation.@name"="cloudwatch.aws/s3objectlambda", AccessPointName="AP",DataSourceARN="ARN"}) > 0.05推荐阈值:0.05(嵌入在查询中)
阈值理由:超过 5% 表示存在 Lambda 或 S3 问题。
评估间隔:60
待处理周期:900
恢复周期:900
- LambdaResponse4xx
-
标签:AccessPointName、DataSourceARN
警报描述:当 S3 对象 Lambda 接入点的 Lambda 函数 4xx 响应率超过 5% 时发出警报。
意图:检测 Lambda 函数客户端错误。
PromQL 标准:
avg({__name__="LambdaResponse4xx", "@instrumentation.@name"="cloudwatch.aws/s3objectlambda", AccessPointName="AP",DataSourceARN="ARN"}) > 0.05推荐阈值:0.05(嵌入在查询中)
阈值理由:超过 5% 表示存在 Lambda 函数问题。
评估间隔:60
待处理周期:900
恢复周期:900
SNS
- NumberOfMessagesPublished
-
标签:TopicName
警报描述:当 SNS 主题的已发布消息数量低于阈值时发出警报。
意图:检测发布量显著下降。
PromQL 标准:
sum({__name__="NumberOfMessagesPublished", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) <THRESHOLD推荐阈值:
THRESHOLD(嵌入在查询中)阈值理由:根据最低预期流量进行设置。
评估间隔:60
待处理周期:300
恢复周期:300
- NumberOfNotificationsDelivered
-
标签:TopicName
警报描述:当 SNS 主题的已传递通知数量低于阈值时发出警报。
意图:检测通知传送量下降。
PromQL 标准:
sum({__name__="NumberOfNotificationsDelivered", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) <THRESHOLD推荐阈值:
THRESHOLD(嵌入在查询中)阈值理由:根据最低预期交付进行设置。
评估间隔:60
待处理周期:300
恢复周期:300
- NumberOfNotificationsFailed
-
标签:TopicName
警报描述:当失败的通知传送计数超过 SNS 主题的阈值时发出警报。
意图:检测传送失败。
PromQL 标准:
sum({__name__="NumberOfNotificationsFailed", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) >THRESHOLD推荐阈值:
THRESHOLD(嵌入在查询中)阈值理由:根据可接受的失败率进行设置。
评估间隔:60
待处理周期:300
恢复周期:300
- NumberOfNotificationsFilteredOut-InvalidAttributes
-
标签:TopicName
警报描述:当通知因消息属性无效而被筛选掉时发出警报。
意图:检测无效的消息属性。
PromQL 标准:
sum({__name__="NumberOfNotificationsFilteredOut-InvalidAttributes", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) > 0推荐阈值:0(嵌入在查询中)
阈值理由:任何无效的筛选条件都表示配置错误。
评估间隔:60
待处理周期:300
恢复周期:300
- NumberOfNotificationsFilteredOut-InvalidMessageBody
-
标签:TopicName
警报描述:当通知因消息正文无效而被筛选掉时发出警报。
意图:检测无效的消息正文。
PromQL 标准:
sum({__name__="NumberOfNotificationsFilteredOut-InvalidMessageBody", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) > 0推荐阈值:0(嵌入在查询中)
阈值理由:任何无效的筛选条件都表示配置错误。
评估间隔:60
待处理周期:300
恢复周期:300
- NumberOfNotificationsRedrivenToDlq
-
标签:TopicName
警报描述:当 SNS 主题的通知被发送到死信队列时发出警报。
意图:检测发送到死信队列的消息。
PromQL 标准:
sum({__name__="NumberOfNotificationsRedrivenToDlq", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) > 0推荐阈值:0(嵌入在查询中)
阈值理由:任何 DLQ 消息都表示存在交付问题。
评估间隔:60
待处理周期:300
恢复周期:300
- NumberOfNotificationsFailedToRedriveToDlq
-
标签:TopicName
警报描述:当 SNS 主题的通知未能发送到死信队列时发出警报。
意图:检测 DLQ 交付失败。
PromQL 标准:
sum({__name__="NumberOfNotificationsFailedToRedriveToDlq", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) > 0推荐阈值:0(嵌入在查询中)
阈值理由:失败的 DLQ 意味着缺失错误跟踪。
评估间隔:60
待处理周期:300
恢复周期:300
- SMSMonthToDateSpentUSD
-
标签:TopicName
警报描述:当短信支出接近 SNS 主题的账户配额时发出警报。
意图:检测接近配额的短信支出。
PromQL 标准:
max({__name__="SMSMonthToDateSpentUSD", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) >THRESHOLD推荐阈值:
THRESHOLD(嵌入在查询中)阈值理由:根据账户短信配额进行设置。
评估间隔:60
待处理周期:300
恢复周期:300
- SMSSuccessRate
-
标签:TopicName
警报描述:当 SNS 主题的短信传输成功率低于阈值时发出警报。
意图:检测失败的短信传输。
PromQL 标准:
avg({__name__="SMSSuccessRate", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) <THRESHOLD推荐阈值:
THRESHOLD(嵌入在查询中)阈值理由:根据可接受的传输速率进行设置。
评估间隔:60
待处理周期:300
恢复周期:300
SQS
- ApproximateAgeOfOldestMessage
-
标签:QueueName
警报描述:当最早消息期限超过 SQS 队列的阈值时发出警报。
意图:检测处理速度不够快的消息。
PromQL 标准:
max({__name__="ApproximateAgeOfOldestMessage", "@instrumentation.@name"="cloudwatch.aws/sqs", QueueName="QUEUE"}) >THRESHOLD推荐阈值:
THRESHOLD(嵌入在查询中)阈值理由:根据可接受的消息处理时间进行设置。
评估间隔:60
待处理周期:900
恢复周期:900
- ApproximateNumberOfMessagesNotVisible
-
标签:QueueName
警报描述:当动态消息数量超过 SQS 队列的阈值时发出警报。
意图:检测表明使用器问题的高动态消息。
PromQL 标准:
avg({__name__="ApproximateNumberOfMessagesNotVisible", "@instrumentation.@name"="cloudwatch.aws/sqs", QueueName="QUEUE"}) >THRESHOLD推荐阈值:
THRESHOLD(嵌入在查询中)阈值理由:根据预期的处理量进行设置。
评估间隔:60
待处理周期:900
恢复周期:900
- ApproximateNumberOfMessagesVisible
-
标签:QueueName
警报描述:当可见消息数量超过 SQS 队列的阈值时发出警报。
意图:检测表明使用器速度慢的消息积压。
PromQL 标准:
avg({__name__="ApproximateNumberOfMessagesVisible", "@instrumentation.@name"="cloudwatch.aws/sqs", QueueName="QUEUE"}) >THRESHOLD推荐阈值:
THRESHOLD(嵌入在查询中)阈值理由:根据预期的队列深度进行设置。
评估间隔:60
待处理周期:900
恢复周期:900
- NumberOfMessagesSent
-
标签:QueueName
警报描述:当没有消息发送到 SQS 队列时发出警报。
意图:检测停止发送消息的产生器。
PromQL 标准:
sum({__name__="NumberOfMessagesSent", "@instrumentation.@name"="cloudwatch.aws/sqs", QueueName="QUEUE"}) <= 0推荐阈值:0(嵌入在查询中)
阈值理由:零条消息表示产生器失败。
评估间隔:60
待处理周期:900
恢复周期:900
VPN
- TunnelState(VPN 级别)
-
标签:VpnId
警报描述:当至少一个 VPN 隧道处于 DOWN 状态时发出警报。
意图:检测处于 DOWN 状态的至少一条隧道。
PromQL 标准:
min({__name__="TunnelState", "@instrumentation.@name"="cloudwatch.aws/vpn", VpnId="VPN"}) < 1推荐阈值:1(嵌入在查询中)
阈值理由:低于 1 意味着隧道关闭。
评估间隔:300
待处理周期:900
恢复周期:900
- TunnelState(隧道级别)
-
标签:TunnelIpAddress
警报描述:当特定 VPN 隧道处于 DOWN 状态时发出警报。
意图:检测处于 DOWN 状态的特定隧道。
PromQL 标准:
min({__name__="TunnelState", "@instrumentation.@name"="cloudwatch.aws/vpn", TunnelIpAddress="IP"}) < 1推荐阈值:1(嵌入在查询中)
阈值理由:低于 1 意味着隧道关闭。
评估间隔:300
待处理周期:900
恢复周期:900