View a markdown version of this page

Operazioni di produzione - AWS DevOps Agente

Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.

Operazioni di produzione

Le operazioni di produzione sono l'insieme di funzionalità che consentono di rilevare, rispondere e prevenire gli incidenti una volta che il codice è in esecuzione in produzione. AWS DevOps L'agente collabora con il team operativo per l'intero ciclo di vita degli incidenti, dal rilevamento alle indagini, al ripristino e alla prevenzione.

Come funzionano le operazioni di produzione

AWS DevOps Agent monitora il tuo ambiente di produzione integrandosi con le tue piattaforme di osservabilità (Amazon CloudWatch, Datadog, Dynatrace, Grafana, New Relic e Splunk) insieme a sistemi di ticketing come and e strumenti di comunicazione come Slack. ServiceNow PagerDuty Quando viene emesso un avviso o arriva un ticket di assistenza, l'agente inizia immediatamente a indagare.

L'agente utilizza la topologia dell'applicazione, una mappa generata automaticamente delle risorse e delle loro relazioni, per correlare i segnali tra i servizi durante un'indagine. Traccia metriche, log, tracce, modifiche al codice e cronologia di implementazione attraverso il grafico delle dipendenze per identificare la causa principale, valutare il raggio di esplosione e determinare quali servizi downstream potrebbero essere interessati.

Tra un incidente e l'altro, l'agente analizza i modelli della cronologia delle indagini per identificare miglioramenti sistemici. Genera raccomandazioni mirate in materia di osservabilità, infrastruttura, governance e ottimizzazione del codice che affrontano le cause profonde anziché i sintomi.

Per ulteriori informazioni su come l'agente scopre la tua infrastruttura, consulta. Cos'è una topologia ad DevOps agenti? Per i dettagli sulla connessione degli strumenti di monitoraggio, consultaConnessione delle fonti di telemetria.

Guida introduttiva alle operazioni di produzione

Per iniziare a utilizzare le funzionalità operative di produzione:

  1. Crea uno spazio per agenti: uno spazio per agenti è il contenitore logico che definisce a cosa l' AWS DevOps agente può accedere e a cosa può indagare. Configura il tuo AWS account principale e configura l'accesso come operatore per il tuo team. Per informazioni, consulta Creazione di uno spazio per agenti.

  2. Connetti le tue fonti di telemetria: collega le tue piattaforme di monitoraggio in modo che l'agente possa accedere a metriche, log e tracce durante le indagini. AWS DevOps Agent supporta integrazioni integrate con Amazon CloudWatch, Datadog, Dynatrace, Grafana, New Relic e Splunk, oltre a integrazioni di server webhook e MCP per altri strumenti. Per informazioni, consulta Connessione delle fonti di telemetria.

  3. Collega strumenti di ticketing e comunicazione (opzionale): Connect ServiceNow o Slack per consentire al tuo team di avviare indagini automatizzate a seguito di incidenti e ricevere aggiornamenti sullo stato in tempo reale. PagerDuty Per informazioni, consulta Connessione alla biglietteria e alla chat.

  4. Attendi il rilevamento della topologia: dopo aver collegato gli account, l'agente scopre automaticamente le tue risorse e crea una topologia applicativa. Questa operazione si completa in genere in pochi minuti e fornisce il contesto utilizzato dall'agente per correlare i segnali durante le indagini.

  5. Inizia la tua prima indagine: le indagini possono iniziare automaticamente da fonti di allarme connesse, tramite webhook o manualmente dalla scheda Incident Response dell'app web Agent. DevOps Prova ad avviare un'indagine manuale descrivendo un problema o scegliendo un punto di partenza preconfigurato come «Ultimo allarme» o «Picco di tasso di errore». Per informazioni, consulta Risposta autonoma agli incidenti.

Una volta completata la prima indagine, puoi fornire un feedback sull'analisi della causa principale, rivedere la tempistica delle indagini ed esplorare i consigli proattivi nella pagina Miglioramenti.

Capacità operative di produzione

Le operazioni di produzione includono tre funzionalità principali:

  • Risposta autonoma agli incidenti: l'agente analizza automaticamente i problemi nel momento in cui si verificano, analizzando metriche, log, tracce, modifiche al codice e cronologia di implementazione per determinare la causa principale e proporre soluzioni. Per informazioni, consulta Risposta autonoma agli incidenti.

  • Prevenzione proattiva degli incidenti: l'agente analizza i modelli nella cronologia degli incidenti per generare raccomandazioni che prevengano incidenti futuri e riducano il tempo medio di rilevamento. Per informazioni, consulta Prevenzione proattiva degli incidenti.

  • On-demand DevOps attività: un'interfaccia conversazionale per interrogare l'infrastruttura, analizzare lo stato del sistema e guidare le indagini utilizzando il linguaggio naturale. Per informazioni, consulta DevOps Attività su richiesta.

In che modo le operazioni di produzione influiscono sulla preparazione al rilascio

Le operazioni di produzione e la gestione dei rilasci formano un ciclo di feedback continuo. Le informazioni sugli incidenti di produzione consentono di convalidare la fase di pre-produzione, rendendo il processo di rilascio più intelligente nel tempo.

I modelli di incidente determinano le revisioni dei rilasci: quando l'agente identifica le cause principali ricorrenti attraverso la prevenzione proattiva degli incidenti, ad esempio la mancata gestione degli errori, una logica di ripetizione dei tentativi inadeguata o politiche IAM che prevedono autorizzazioni eccessive, questi modelli determinano gli obiettivi delle revisioni del codice di preparazione al rilascio. La crescente comprensione da parte dell'agente delle cause degli errori di produzione nell'ambiente rende le future revisioni del codice più pertinenti al profilo di rischio effettivo.

Le raccomandazioni sulla prevenzione determinano le modifiche al codice: la prevenzione proattiva degli incidenti genera specifiche pronte per l'uso con gli agenti che descrivono i miglioramenti del codice e della configurazione con percorsi di file e piani di implementazione specifici. Queste specifiche possono essere trasmesse a un agente di codifica durante il flusso di lavoro di gestione dei rilasci, eliminando così il passaggio dal problema di produzione alla correzione convalidata.

La conoscenza della topologia migliora l'analisi delle dipendenze: la topologia dell'applicazione creata durante le operazioni di produzione, comprese le relazioni di servizio, i percorsi di richiesta e i limiti di implementazione, contribuisce direttamente all'analisi delle dipendenze tra repository eseguita durante le revisioni della disponibilità del rilascio. L'agente utilizza la stessa comprensione del modo in cui i servizi interagiscono per valutare il raggio di esplosione sia durante la risposta agli incidenti che durante la revisione del codice.

Il feedback sulle indagini affina le competenze acquisite: il feedback fornito sulle indagini e l'accuratezza dei consigli aggiornano le competenze acquisite dall'agente. Man mano che queste competenze migliorano, sia le indagini sugli incidenti che le revisioni dei rilasci traggono vantaggio da una conoscenza più accurata dell'ambiente, dei modelli operativi e delle tecniche di indagine efficaci.