View a markdown version of this page

Datenlieferung an Amazon S3-Allzweck-Buckets - Amazon Managed Streaming für Apache Kafka

Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.

Datenlieferung an Amazon S3-Allzweck-Buckets

Mit Amazon MSK Data Delivery können Sie Apache Kafka-Daten im Quellformat für die nachgelagerte Verarbeitung in Amazon S3-Buckets für allgemeine Zwecke bereitstellen — mit durchgängiger Zuverlässigkeit für unternehmenskritische Workloads. Verwenden Sie es, um Kafka-Daten in Amazon S3 für Anwendungsfälle wie Protokollarchivierung, Aufbewahrung von Vorschriften, Kafka-Wiedergabe und Trainingsmodelle zu speichern. AI/ML Durch diesen Ansatz entfällt die Notwendigkeit, selbstverwaltete Connector-Pipelines zu erstellen, die mit zunehmender Auslastung kostspielig und betrieblich komplex werden.

Integrationen

  • Amazon MSK Express Brokers — die Datenquelle.

  • Amazon S3 — Allzweck-Objektziel.

  • Amazon CloudWatch — Metriken und Betriebsprotokolle.

  • AWS CloudTrail— API-Audit-Protokollierung.

  • AWS KMS— optionale, vom Kunden verwaltete Verschlüsselung im Ruhezustand.

Häufige Anwendungsfälle

  • Archivieren Sie Kafka-Themendaten zur Speicherung, Wiedergabe oder nachgelagerten Stapelverarbeitung auf S3.

  • Verteilen Sie ein einzelnes Thema auf mehrere Ziele, ohne die Maklerlast zu erhöhen.

Die API-Spezifikation finden Sie unter CreateChannelDescribeChannel, UpdateChannelDeleteChannel, und ListChannels in der Amazon MSK API-Referenz.

Datenfluss

Das folgende Diagramm zeigt, wie Datensätze von einem Amazon MSK Express-Broker-Thema über einen Datenlieferkanal zu Ihrem Ziel übertragen werden, wobei nicht verarbeitbare Datensätze in eine Warteschlange weitergeleitet werden, in der keine Nachricht mehr eingegangen ist.

Daten fließen von einem Amazon MSK Express-Broker-Thema über einen Datenlieferkanal zu einem Amazon S3-Bucket für allgemeine Zwecke, wobei nicht verarbeitbare Datensätze an eine Warteschlange weitergeleitet werden, in der sie nicht mehr bearbeitet werden können.

Vorteile

  • Keine zu verwaltende Infrastruktur — Keine Konnektoren oder Rechencluster. Sie konfigurieren einen Channel und der Service kümmert sich um Bereitstellung, Skalierung und Fehlertoleranz.

  • Keine Auswirkung auf Makler — Ein Channel liest aus dem Thema, ohne den Brokerdurchsatz zu verbrauchen oder die Workloads von Produzenten und Verbrauchern zu beeinträchtigen.

  • Skaliert mit Ihren Daten — Unterstützt einen Datendurchsatz von bis zu 10 Gbit/s, ohne dass eine manuelle Skalierung erforderlich ist.

  • Aktualität der Daten innerhalb von Minuten — Die bereitgestellten Daten können innerhalb von 5 bis 15 Minuten nach ihrer Erstellung zum Thema abgefragt oder verarbeitet werden.

  • Built-in Fehlerbehandlung — Nicht verarbeitbare Datensätze werden an eine Warteschlange mit unleserem Text mit Fehlerkontext weitergeleitet, sodass die Übertragung ohne Unterbrechung fortgesetzt wird.

Funktionsweise

Um Daten an einen allgemeinen S3-Bucket zu liefern, erstellen Sie einen Channel. Sie erstellen einen Channel auf einem von Amazon MSK bereitgestellten Cluster, der Express-Broker verwendet. Der Channel liest Datensätze aus einem Kafka-Thema und übermittelt sie an das konfigurierte Ziel.

Bei Amazon S3-Buckets für allgemeine Zwecke schreibt der Channel Datensätze (JSON oder String) als Objekte in einen allgemeinen S3-Bucket ByteArray, wobei eine konfigurierbare Ausgabeschlüsselvorlage verwendet wird.

Datensätze, die nicht verarbeitet werden können, werden an einen erforderlichen S3-Bucket mit Dead-Letter Queue (DLQ) weitergeleitet.

Anmerkung

Ein Channel füllt zuvor erzeugte Daten nicht auf, sondern nur Daten, die nach der Aktivierung generiert wurden.

Anforderungen und unterstützte Konfigurationen

  • Ein von Amazon MSK bereitgestellter Cluster mit Express-Brokern. Standard-Broker und Amazon MSK Serverless werden nicht unterstützt.

  • Mindestens ein Kafka-Thema.

  • Ein Amazon S3-Bucket für die Dead-Letter Queue (DLQ). Dies ist erforderlich.

  • Eine IAM-Servicerolle, die der Channel für die Bereitstellung von Daten übernimmt.

  • Die Aktualität der Daten wurde zwischen 5 und 15 Minuten konfiguriert.

  • Themendaten im JSON ByteArray - oder String-Format.

  • Ein Allzweck-Amazon S3-Bucket für die Lieferung.