Las traducciones son generadas a través de traducción automática. En caso de conflicto entre la traducción y la version original de inglés, prevalecerá la version en inglés.
entrega de datos a cubos de uso general de Amazon S3
Con Amazon MSK Data Delivery, puede entregar los datos de Apache Kafka en el formato de origen a los buckets de uso general de Amazon S3 para su procesamiento posterior, con una fiabilidad integral para las cargas de trabajo de misión crítica. Utilícela para incluir los datos de Kafka en Amazon S3 para casos de uso como el archivado de registros, la retención de conformidad, la reproducción de Kafka y los modelos de formación. AI/ML Este enfoque elimina la necesidad de crear canalizaciones de conectores autogestionadas que se vuelven costosas y complejas desde el punto de vista operativo a medida que aumentan las cargas de trabajo.
Temas
Integraciones
Los corredores de Amazon MSK Express: la fuente de datos.
Amazon S3: destino de objetos de uso general.
Amazon CloudWatch: métricas y registros operativos.
AWS CloudTrail— Registro de auditoría de API.
AWS KMS— cifrado en reposo opcional gestionado por el cliente.
Casos de uso comunes
Archive los datos relacionados con Kafka en S3 para almacenarlos, reproducirlos o procesarlos por lotes posteriores.
Distribuya un solo tema en varios destinos sin aumentar la carga de los intermediarios.
Para ver la especificación de la APICreateChannel, consulteDescribeChannel, UpdateChannelDeleteChannel, y ListChannels en la referencia de API de Amazon MSK.
Flujo de datos
El siguiente diagrama muestra cómo fluyen los registros desde un tema de un agente de Amazon MSK Express a través de un canal de entrega de datos hasta su destino, y los registros no procesables se envían a una cola de correo sin procesar.
Ventajas
No hay infraestructura que administrar: no hay conectores ni clústeres de procesamiento. Usted configura un canal y el servicio se encarga de la entrega, el escalado y la tolerancia a fallos.
Sin impacto en los intermediarios: un canal lee el tema sin consumir el rendimiento del intermediario ni afectar a las cargas de trabajo de productores y consumidores.
Se adapta a sus datos: admite un rendimiento de entrega de datos de hasta 10 GBps sin necesidad de escalamiento manual.
Actualización de los datos en cuestión de minutos: los datos entregados están disponibles para consultarlos o procesarlos en un plazo de 5 a 15 minutos desde que se generaron para tratar el tema.
Built-in Gestión de errores: los registros que no se pueden procesar se envían a una cola de correo muerto con un contexto de error, por lo que la entrega continúa sin interrupciones.
Funcionamiento
Para enviar datos a un bucket S3 de uso general, debes crear un canal. Crea un canal en un clúster aprovisionado de Amazon MSK que utiliza agentes Express. El canal lee los registros de un tema de Kafka y los envía al destino configurado.
En el caso de los buckets de uso general de Amazon S3, el canal escribe los registros (JSON o String) como objetos en un bucket de S3 de uso general, mediante una plantilla de claves de salida configurable. ByteArray
Los registros que no se pueden procesar se envían a un bucket S3 de cola de correo muerto (DLQ) obligatorio.
nota
Un canal no rellena los datos producidos anteriormente, solo los datos producidos después de la activación.
Requisitos y configuraciones compatibles
Un clúster aprovisionado de Amazon MSK con agentes Express. No se admiten los agentes estándar ni Amazon MSK Serverless.
Al menos un tema de Kafka.
Un bucket de Amazon S3 para la cola de mensajes muertos (DLQ). Esto es obligatorio.
Una función de servicio de IAM que el canal asume para entregar los datos.
La actualización de los datos se configuró entre 5 y 15 minutos.
Datos del tema en formato JSON o String. ByteArray
Un bucket de Amazon S3 de uso general para la entrega.