View a markdown version of this page

Detecção - Recuperação de desastres de cargas de trabalho em AWS: Recuperação na nuvem

As traduções são geradas por tradução automática. Em caso de conflito entre o conteúdo da tradução e da versão original em inglês, a versão em inglês prevalecerá.

Detecção

É importante saber o mais rápido possível que suas cargas de trabalho não estão fornecendo os resultados comerciais que deveriam oferecer. Dessa forma, você pode declarar rapidamente um desastre e se recuperar de um incidente. Para objetivos agressivos de recuperação, esse tempo de resposta, juntamente com as informações apropriadas, é fundamental para atingir os objetivos de recuperação. Se seu objetivo de tempo de recuperação for de uma hora, você precisará detectar o incidente, notificar a equipe apropriada, engajar seus processos de escalonamento, avaliar as informações (se houver) sobre o tempo esperado de recuperação (sem executar o plano de DR), declarar um desastre e se recuperar em uma hora.

nota

Se as partes interessadas decidirem não invocar a DR, mesmo que o RTO esteja em risco, reavalie os planos e objetivos da DR. A decisão de não invocar os planos de DR pode ser porque os planos são inadequados ou há falta de confiança na execução.

É fundamental considerar a detecção, notificação, escalonamento, descoberta e declaração de incidentes em seu planejamento e objetivos para fornecer objetivos realistas e alcançáveis que forneçam valor comercial.

A AWS publica nossa maioria das up-to-the-minute informações sobre disponibilidade de serviços no Service Health Dashboard. Verifique a qualquer momento para obter informações de status atuais ou assine um feed RSS para ser notificado sobre interrupções em cada serviço individual. Se você estiver enfrentando um problema operacional em tempo real com um de nossos serviços que não é exibido no Service Health Dashboard, você pode criar uma Solicitação de Suporte.

AWS Health DashboardFornece informações sobre AWS Health eventos que podem afetar sua conta. As informações são apresentadas de duas formas: um painel que mostra eventos recentes e futuros organizados por categoria, e um log de eventos completo que mostra todos os eventos dos últimos 90 dias.

Para os requisitos de RTO mais rigorosos, você pode implementar o failover automatizado com base em verificações de integridade. Crie verificações de integridade que sejam representativas da experiência do usuário e baseadas em indicadores-chave de desempenho. As verificações profundas de saúde exercem as principais funcionalidades de sua carga de trabalho e vão além das verificações superficiais de batimentos cardíacos. Use verificações de saúde detalhadas com base em vários sinais. Tenha cuidado com essa abordagem para não acionar alarmes falsos, pois falhar quando não é necessário pode, por si só, introduzir riscos de disponibilidade.