View a markdown version of this page

Operações de produção - AWS DevOps Agente

As traduções são geradas por tradução automática. Em caso de conflito entre o conteúdo da tradução e da versão original em inglês, a versão em inglês prevalecerá.

Operações de produção

As operações de produção são o conjunto de recursos que ajudam você a detectar, responder e evitar incidentes quando o código estiver sendo executado na produção. AWS DevOps O agente trabalha junto com sua equipe de operações em todo o ciclo de vida do incidente, desde a detecção até a investigação, recuperação e prevenção.

Como funcionam as operações de produção

AWS DevOps O agente monitora seu ambiente de produção integrando-se às suas plataformas de observabilidade — Amazon CloudWatch, Datadog, Dynatrace, Grafana, New Relic e Splunk — junto com sistemas de emissão de bilhetes, como e, e ferramentas de comunicação, como o Slack. ServiceNow PagerDuty Quando um alerta é acionado ou um ticket de suporte chega, o agente começa a investigar imediatamente.

O agente usa a topologia do seu aplicativo — um mapa gerado automaticamente de seus recursos e seus relacionamentos — para correlacionar sinais entre serviços durante uma investigação. Ele rastreia métricas, registros, rastreamentos, alterações de código e histórico de implantação por meio do gráfico de dependências para identificar a causa raiz, avaliar o raio de explosão e determinar quais serviços posteriores podem ser afetados.

Entre incidentes, o agente analisa padrões em seu histórico de investigação para identificar melhorias sistêmicas. Ele gera recomendações direcionadas sobre observabilidade, infraestrutura, governança e otimização de código que abordam as causas-raiz em vez dos sintomas.

Para obter mais informações sobre como o agente descobre sua infraestrutura, consulteO que é uma topologia de DevOps agente?. Para obter detalhes sobre como conectar suas ferramentas de monitoramento, consulteConectando fontes de telemetria.

Introdução às operações de produção

Para começar a usar os recursos de operações de produção:

  1. Crie um Espaço do Agente — Um Espaço do Agente é o contêiner lógico que define o que o AWS DevOps Agente pode acessar e investigar. Configure sua AWS conta principal e configure o acesso do operador para sua equipe. Consulte Criação de um espaço de agente.

  2. Conecte suas fontes de telemetria — Conecte suas plataformas de monitoramento para que o agente possa acessar métricas, registros e rastreamentos durante as investigações. AWS DevOps O Agent oferece suporte a integrações integradas com Amazon CloudWatch, Datadog, Dynatrace, Grafana, New Relic e Splunk, além de integrações de webhook e servidor MCP para outras ferramentas. Consulte Conectando fontes de telemetria.

  3. Conecte ferramentas de emissão de tíquetes e comunicação (opcional) — Connect ou Slack para permitir uma investigação automatizada ServiceNow PagerDuty, acionada a partir de incidentes e atualizações de status em tempo real para sua equipe. Consulte Conectando-se à emissão de bilhetes e ao bate-papo.

  4. Aguarde a descoberta da topologia — Depois de conectar suas contas, o agente descobre automaticamente seus recursos e cria uma topologia de aplicativo. Isso normalmente é concluído em minutos e fornece o contexto que o agente usa para correlacionar sinais durante as investigações.

  5. Inicie sua primeira investigação — As investigações podem começar automaticamente a partir de fontes de alerta conectadas, por meio de webhooks ou manualmente na guia Resposta a incidentes no aplicativo web do DevOps Agente. Tente iniciar uma investigação manual descrevendo um problema ou escolhendo um ponto de partida pré-configurado, como “Último alarme” ou “Aumento da taxa de erros”. Consulte Resposta autônoma a incidentes.

Depois que sua primeira investigação for concluída, você poderá fornecer feedback sobre a análise da causa raiz, revisar o cronograma da investigação e explorar recomendações proativas na página de melhorias.

Capacidades de operações de produção

As operações de produção incluem três recursos principais:

  • Resposta autônoma a incidentes — O agente investiga automaticamente os problemas no momento em que eles ocorrem, analisando métricas, registros, rastreamentos, alterações de código e histórico de implantação para determinar a causa raiz e propor a mitigação. Consulte Resposta autônoma a incidentes.

  • Prevenção proativa de incidentes — O agente analisa padrões em seu histórico de incidentes para gerar recomendações que evitem futuros incidentes e reduzam o tempo médio de detecção. Consulte Prevenção proativa de incidentes.

  • On-demand DevOps tarefas — Uma interface conversacional para consultar sua infraestrutura, analisar a integridade do sistema e orientar investigações usando linguagem natural. Consulte DevOps Tarefas sob demanda.

Como as operações de produção retroalimentam a prontidão para o lançamento

As operações de produção e o gerenciamento de lançamentos formam um ciclo de feedback contínuo. Os insights dos incidentes de produção informam a validação da pré-produção, tornando seu processo de lançamento mais inteligente ao longo do tempo.

Os padrões de incidentes moldam as análises de lançamento — Quando o agente identifica causas-raiz recorrentes por meio da prevenção proativa de incidentes, como falta de tratamento de erros, lógica de repetição inadequada ou políticas de IAM com excesso de permissão, esses padrões informam o que as análises de código de prontidão para lançamento buscam. A crescente compreensão do agente sobre o que causa falhas de produção em seu ambiente torna as futuras revisões de código mais relevantes para seu perfil de risco real.

As recomendações de prevenção impulsionam mudanças no código — a prevenção proativa de incidentes gera especificações prontas para o agente que descrevem melhorias no código e na configuração com caminhos de arquivo e planos de implementação específicos. Essas especificações podem ser entregues a um agente de codificação durante o fluxo de trabalho de gerenciamento de versões, fechando o ciclo do problema de produção até a correção validada.

O conhecimento de topologia melhora a análise de dependências — A topologia do aplicativo criada durante as operações de produção — incluindo relacionamentos de serviço, caminhos de solicitação e limites de implantação — alimenta diretamente a análise de dependência entre repositórios realizada durante as análises de prontidão para o lançamento. O agente usa o mesmo entendimento de como seus serviços interagem para avaliar o raio de explosão durante a resposta a incidentes e durante a revisão do código.

O feedback da investigação refina as habilidades aprendidas — O feedback que você fornece sobre as investigações e a precisão das recomendações atualizam as habilidades aprendidas pelo agente. À medida que essas habilidades melhoram, tanto as investigações de incidentes quanto as análises de lançamentos se beneficiam de um conhecimento mais preciso sobre seu ambiente, padrões operacionais e técnicas de investigação eficazes.