Las traducciones son generadas a través de traducción automática. En caso de conflicto entre la traducción y la version original de inglés, prevalecerá la version en inglés.
Operaciones de producción
Las operaciones de producción son el conjunto de capacidades que le ayudan a detectar, responder y prevenir incidentes una vez que el código se ejecuta en producción. AWS DevOps Agent trabaja junto a su equipo de operaciones durante todo el ciclo de vida de los incidentes, desde la detección hasta la investigación, la recuperación y la prevención.
Cómo funcionan las operaciones de producción
AWS DevOps Agent supervisa su entorno de producción integrándolo con sus plataformas de observabilidad (Amazon CloudWatch, Datadog, Dynatrace, Grafana, New Relic y Splunk), junto con sistemas de venta de entradas como y y herramientas de comunicación como Slack. ServiceNow PagerDuty Cuando se activa una alerta o llega una solicitud de asistencia, el agente comienza a investigar de inmediato.
El agente utiliza la topología de la aplicación (un mapa generado automáticamente de sus recursos y sus relaciones) para correlacionar las señales entre los servicios durante una investigación. Realiza un seguimiento de las métricas, los registros, los cambios de código y el historial de implementación a través del gráfico de dependencias para identificar la causa raíz, evaluar el radio de impacto y determinar qué servicios descendentes pueden estar afectados.
Entre los incidentes, el agente analiza los patrones del historial de investigación para identificar las mejoras sistémicas. Genera recomendaciones específicas sobre la observabilidad, la infraestructura, la gobernanza y la optimización del código que abordan las causas fundamentales y no los síntomas.
Para obtener más información sobre cómo el agente descubre su infraestructura, consulte¿Qué es una topología de DevOps agentes?. Para obtener más información sobre la conexión de las herramientas de supervisión, consulteConexión de fuentes de telemetría.
Cómo empezar con las operaciones de producción
Para empezar a utilizar las capacidades de operaciones de producción:
Cree un espacio de agentes: un espacio de agentes es el contenedor lógico que define lo que el AWS DevOps agente puede acceder e investigar. Configura tu AWS cuenta principal y configura el acceso de los operadores para tu equipo. Consulte Creación de un espacio de agentes.
Conecte sus fuentes de telemetría: conecte sus plataformas de monitoreo para que el agente pueda acceder a las métricas, los registros y los rastreos durante las investigaciones. AWS DevOps Agent admite integraciones integradas con Amazon CloudWatch, Datadog, Dynatrace, Grafana, New Relic y Splunk, además de integraciones de servidores webhook y MCP para otras herramientas. Consulte Conexión de fuentes de telemetría.
Conecta las herramientas de venta de entradas y comunicación (opcional): Connect ServiceNow o Slack para activar investigaciones automatizadas a partir de incidentes y enviar actualizaciones de estado en tiempo real a tu equipo. PagerDuty Consulte Conexión a la venta de entradas y al chat.
Espera a que se descubra la topología: tras conectar tus cuentas, el agente descubre automáticamente tus recursos y crea una topología de aplicaciones. Por lo general, esto se completa en cuestión de minutos y proporciona el contexto que el agente utiliza para correlacionar las señales durante las investigaciones.
Inicie su primera investigación: las investigaciones pueden iniciarse automáticamente desde las fuentes de alerta conectadas, mediante webhooks o manualmente desde la pestaña Respuesta a incidentes de la aplicación web DevOps Agent. Prueba a iniciar una investigación manual describiendo un problema o eligiendo un punto de partida preconfigurado, como «última alarma» o «aumento de la tasa de errores». Consulte Respuesta autónoma a incidentes.
Una vez finalizada la primera investigación, puedes dar tu opinión sobre el análisis de la causa raíz, revisar el calendario de la investigación y analizar las recomendaciones proactivas en la página de mejoras.
Capacidades de operaciones de producción
Las operaciones de producción incluyen tres capacidades principales:
Respuesta autónoma a los incidentes: el agente investiga automáticamente los problemas en el momento en que se producen y analiza las métricas, los registros, los rastreos, los cambios de código y el historial de implementación para determinar la causa raíz y proponer su mitigación. Consulte Respuesta autónoma a incidentes.
Prevención proactiva de incidentes: el agente analiza los patrones de su historial de incidentes para generar recomendaciones que eviten futuros incidentes y reduzcan el tiempo medio de detección. Consulte Prevención proactiva de incidentes.
On-demand DevOps tareas: una interfaz conversacional para consultar la infraestructura, analizar el estado del sistema y guiar las investigaciones mediante un lenguaje natural. Consulte DevOps Tareas bajo demanda.
Cómo influyen las operaciones de producción en la preparación para el lanzamiento
Las operaciones de producción y la gestión de los lanzamientos forman un circuito de retroalimentación continua. La información obtenida de los incidentes de producción sirve de base para la validación previa a la producción, lo que hace que el proceso de lanzamiento sea más inteligente con el tiempo.
Los patrones de incidentes moldean las revisiones de las versiones: cuando el agente identifica las causas fundamentales recurrentes mediante una prevención proactiva de incidentes, como la gestión de errores, una lógica de reintentos inadecuada o políticas de IAM excesivas, estos patrones determinan lo que buscan las revisiones del código de preparación de las versiones. La creciente comprensión del agente sobre las causas de los fallos de producción en su entorno hace que las futuras revisiones del código sean más relevantes para su perfil de riesgo real.
Las recomendaciones de prevención impulsan los cambios en el código: la prevención proactiva de incidentes genera especificaciones listas para los agentes que describen las mejoras en el código y la configuración con rutas de archivo y planes de implementación específicos. Estas especificaciones se pueden entregar a un agente de codificación durante el flujo de trabajo de gestión de versiones, lo que cierra el círculo entre el problema de producción y la solución validada.
El conocimiento de la topología mejora el análisis de dependencias: la topología de la aplicación creada durante las operaciones de producción (incluidas las relaciones de servicio, las rutas de solicitud y los límites de despliegue) se incorpora directamente al análisis de dependencias entre repositorios que se realiza durante las revisiones de preparación para el lanzamiento. El agente utiliza los mismos conocimientos sobre cómo interactúan sus servicios para evaluar el radio de impacto, tanto durante la respuesta a los incidentes como durante la revisión del código.
Los comentarios sobre las investigaciones perfeccionan las habilidades aprendidas: los comentarios que usted proporciona sobre las investigaciones y la precisión de las recomendaciones actualizan las habilidades aprendidas por el agente. A medida que estas habilidades mejoran, tanto la investigación de incidentes como la revisión de las versiones se benefician de un conocimiento más preciso sobre el entorno, los patrones operativos y las técnicas de investigación eficaces.