View a markdown version of this page

pengiriman data ke bucket tujuan umum Amazon S3 - Amazon Managed Streaming untuk Apache Kafka

Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.

pengiriman data ke bucket tujuan umum Amazon S3

Dengan Amazon MSK Data Delivery, Anda dapat mengirimkan data Apache Kafka dalam format sumber ke bucket tujuan umum Amazon S3 untuk pemrosesan hilir, dengan keandalan ujung ke ujung untuk beban kerja kritis misi. Gunakan untuk mendaratkan data Kafka di Amazon S3 untuk kasus penggunaan seperti arsip log, retensi kepatuhan, pemutaran ulang Kafka, dan model pelatihan. AI/ML Pendekatan ini menghilangkan kebutuhan untuk membangun saluran konektor yang dikelola sendiri yang menjadi mahal dan kompleks secara operasional seiring dengan skala beban kerja.

Integrasi

  • Broker Amazon MSK Express — sumber data.

  • Amazon S3 — tujuan objek tujuan umum.

  • Amazon CloudWatch — metrik dan log operasional.

  • AWS CloudTrail— Pencatatan audit API.

  • AWS KMS— enkripsi opsional yang dikelola pelanggan saat istirahat.

Kasus penggunaan umum

  • Arsipkan data topik Kafka ke S3 untuk penyimpanan, pemutaran ulang, atau pemrosesan batch hilir.

  • Sempurnakan satu topik ke beberapa tujuan tanpa menambahkan beban broker.

Untuk spesifikasi API, lihat,CreateChannel,DescribeChannel, UpdateChannelDeleteChannel, dan ListChannels di Refer ensi API Amazon MSK.

Aliran data

Diagram berikut menunjukkan bagaimana catatan mengalir dari topik broker Amazon MSK Express melalui saluran Pengiriman Data ke tujuan Anda, dengan catatan yang tidak dapat diproses dialihkan ke antrian huruf mati.

Aliran data dari topik broker Amazon MSK Express melalui saluran Pengiriman Data ke bucket Amazon S3 tujuan umum, dengan catatan yang tidak dapat diproses dialihkan ke antrian huruf mati.

Manfaat

  • Tidak ada infrastruktur untuk dikelola — Tidak ada konektor atau cluster komputasi. Anda mengonfigurasi Saluran dan layanan menangani pengiriman, penskalaan, dan toleransi kesalahan.

  • Tidak ada dampak broker — Saluran membaca dari topik tanpa menghabiskan throughput broker atau memengaruhi beban kerja produsen dan konsumen.

  • Menskalakan dengan data Anda — Mendukung throughput pengiriman data hingga 10 GBps tanpa perlu penskalaan manual.

  • Kesegaran data dalam hitungan menit — Data yang dikirimkan tersedia untuk kueri atau pemrosesan dalam waktu 5 hingga 15 menit setelah diproduksi ke topik.

  • Built-in penanganan kesalahan — Catatan yang tidak dapat diproses dialihkan ke antrian huruf mati dengan konteks kesalahan, sehingga pengiriman terus berlanjut tanpa gangguan.

Cara kerjanya

Untuk mengirimkan data ke bucket S3 tujuan umum, Anda membuat Channel. Anda membuat Channel di cluster Amazon MSK Provisioned yang menggunakan broker Express. Saluran membaca catatan dari topik Kafka dan mengirimkannya ke tujuan yang dikonfigurasi.

Untuk bucket tujuan umum Amazon S3, Channel menulis catatan (JSON, ByteArray, atau String) sebagai objek ke bucket S3 tujuan umum, menggunakan templat kunci keluaran yang dapat dikonfigurasi.

Rekaman yang tidak dapat diproses dialihkan ke bucket S3 antrean huruf mati (DLQ) yang diperlukan.

catatan

Saluran tidak mengisi ulang data yang dihasilkan sebelumnya — hanya data yang dihasilkan setelah pengaktifan dikirimkan.

Persyaratan dan konfigurasi yang didukung

  • Cluster Amazon MSK Provisioned dengan broker Express. Pialang standar dan Amazon MSK Serverless tidak didukung.

  • Setidaknya satu topik Kafka.

  • Bucket Amazon S3 untuk antrean huruf mati (DLQ). Ini diperlukan.

  • Peran layanan IAM yang diasumsikan oleh Channel untuk mengirimkan data.

  • Kesegaran data dikonfigurasi antara 5 dan 15 menit.

  • Data topik dalam format JSON, ByteArray, atau String.

  • Bucket Amazon S3 serba guna untuk pengiriman.