View a markdown version of this page

SageMaker HyperPod Referenz zu Cluster-Ereignissen - Amazon SageMaker KI

Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.

SageMaker HyperPod Referenz zu Cluster-Ereignissen

Diese Seite bietet eine vollständige Übersicht über alle strukturierten Ereignisse, die von Amazon-Clustern ausgelöst werden. SageMaker HyperPod Ereignisse bieten Einblick in die Abläufe auf Cluster-, Instanzgruppen- und Instanzebene, einschließlich Bereitstellung, Skalierung, Patches und orchestratorspezifischer Lebenszyklusänderungen.

Cluster-Ereignisse sind für Cluster verfügbar, bei denen der Wert auf gesetzt ist. HyperPod NodeProvisioningMode Continuous Auf Ereignisse kann über die ListClusterEvents DescribeClusterEvent AND-APIs, die Registerkarte „Ereignisse“ der SageMaker KI-Konsole und Amazon zugegriffen EventBridge werden.

Cluster-Ereignisaufzeichnung

Jedes Clusterereignis wird als strukturierter Datensatz dargestellt, der Identifikation, Zeitpunkt, Umfang, Schweregrad und betriebsspezifische Metadaten enthält. Das folgende Beispiel zeigt einen vollständigen Ereignisdatensatz, wie er über die DescribeClusterEvent API und Amazon bereitgestellt wird: EventBridge

{ "version": "0", "id": "0bd4a141-0a02-9d8a-f977-3924c3fb259c", "detail-type": "SageMaker HyperPod Cluster Event", "source": "aws.sagemaker", "account": "111122223333", "time": "2026-06-01T17:20:25Z", "region": "us-west-2", "resources": [ "arn:aws:sagemaker:us-west-2:111122223333:cluster/sample-cluster" ], "detail": { "EventDetails": { "EventId": "83ea0bb5-be77-45e8-a458-0a87f778a205", "ClusterArn": "arn:aws:sagemaker:us-west-2:111122223333:cluster/sample-cluster", "ClusterName": "sample-cluster", "InstanceGroupName": "p5Inst", "InstanceId": "i-0391f86fa0fe0d465", "ResourceType": "Instance", "EventTime": 1748794825350, "EventLevel": "Error", "Description": "Instance creation in Cluster sample-cluster and InstanceGroup p5Inst failed", "EventDetails": { "EventMetadata": { "Instance": { "FailureMessage": "We currently do not have sufficient capacity to launch new ml.p5.48xlarge instances. Please try again.", "NodeLogicalId": "df268d19-f035-4f28-9b80-b956b92ae21e" } } } } } }

Felder für Ereignisdatensätze

Das detail.EventDetails-Objekt enthält die folgenden Felder:

Feld Typ Erforderlich Description
EventId Zeichenfolge (UUID) Ja Eindeutiger Bezeichner für das Ereignis.
ClusterArn Zeichenfolge Ja ARN des HyperPod Clusters.
ClusterName Zeichenfolge Ja Name des HyperPod Clusters.
EventTime Zeitstempel Ja Wann das Ereignis eingetreten ist (Epochen-Millisekunden).
ResourceType Zeichenfolge Ja Umfang des Ereignisses:Cluster, oder. InstanceGroup Instance
EventLevel Zeichenfolge Ja Einstufung des Schweregrads: InfoWarn,, oderError.
Description Zeichenfolge Nein Human-readable Zusammenfassung der Veranstaltung.
InstanceGroupName Zeichenfolge Nein Name der Instanzgruppe (vorhanden, wenn InstanceGroup oder ResourceType istInstance).
InstanceId Zeichenfolge Nein EC2-Instanz-ID (vorhanden, wenn „ResourceTypeist“Instance).
EventDetails Objekt Nein Zusätzliche Metadaten, die für den Ressourcentyp und den Vorgang spezifisch sind.

Stufen der Ereignisse

Level Bedeutung
Info Der Vorgang wurde erfolgreich abgeschlossen oder läuft normal.
Warn Der Vorgang wurde aufgrund eines unkritischen Problems oder eines Zustands abgeschlossen, der möglicherweise in Zukunft behandelt werden muss.
Error Der Vorgang ist fehlgeschlagen oder erfordert sofortige Aufmerksamkeit.

Ressourcentypen

ResourceType Scope Beispielereignisse
Cluster Whole-cluster Operationen Cluster creation/update wurde gestartet, Clusterbetrieb ist fehlgeschlagen
InstanceGroup Operationen der Instanzgruppe Skalierung started/completed, geplantes Patchen, FSx-Lebenszyklus
Instance Betrieb einzelner Instanzen EC2-Bereitstellung, Ausführung von Lifecycle-Skripten, ENI-Management, Kündigung

EventDetails Metadaten

Cluster-Ereignisse enthalten ein EventMetadata Objekt innerhalb des EventDetails Felds, das einen operationsspezifischen Kontext bietet, der über das hinausgeht, was die Ereignisbeschreibung vermittelt. Der Inhalt von EventMetadata variiert je nach Ressourcentyp und Ereignistyp. Das vollständige Schema und die unterstützten Felder finden Sie EventMetadata in der Amazon SageMaker AI API-Referenz.

EventBridge Envelope-Felder

Bei der Lieferung durch Amazon EventBridge wird der Veranstaltungsdatensatz in den EventBridge Standardumschlag verpackt:

Feld Description
version EventBridge Schemaversion (immer"0").
id Eindeutige EventBridge Ereignis-ID.
detail-type SageMaker HyperPod Cluster Event
source aws.sagemaker
account AWS Konto-ID, der der Cluster gehört.
time ISO 8601-Zeitstempel des Ereignisses.
region AWS Region, in der sich der Cluster befindet.
resources Array, das den Cluster-ARN enthält.
detail Enthält das oben beschriebene EventDetails Objekt.

Häufige Ereignisse (EKS und Slurm)

Die folgenden Ereignisse werden für alle HyperPod Cluster unabhängig vom Orchestrator ausgegeben. In der Spalte Beschreibung wird der Wert des Description Felds im Ereignisdatensatz so angezeigt, wie er in der API-Antwort und auf der Registerkarte „Ereignisse“ der Konsole angezeigt wird.

Cluster-Lebenszyklus

Veranstaltung Description
Der Clusterbetrieb wurde gestartet Der Cluster <cluster-name><operation>wurde erfolgreich gestartet
Der Start des Clustervorgangs ist fehlgeschlagen Cluster konnte nicht gestartet werden <cluster-name><operation>
Cluster-Vorgang abgeschlossen Der Cluster <cluster-name><operation>wurde erfolgreich abgeschlossen
Der Clustervorgang ist fehlgeschlagen Cluster <cluster-name><operation>ist fehlgeschlagen

Lebenszyklus der Instanzgruppe

Veranstaltung Description
Der Betrieb der Instanzgruppe wurde gestartet InstanceGroup <instance-group-name><operation>wurde erfolgreich im Cluster gestartet <cluster-name>
Der Start des Instanzgruppen-Vorgangs ist fehlgeschlagen Fehler beim Starten InstanceGroup <instance-group-name><operation>im Cluster <cluster-name>
Der Vorgang der Instanzgruppe wurde abgeschlossen Die Instanzgruppe <instance-group-name><operation>im Cluster <cluster-name>wurde erfolgreich abgeschlossen
Der Vorgang der Instanzgruppe ist fehlgeschlagen Instanzgruppe <instance-group-name><operation>im Cluster <cluster-name>ist fehlgeschlagen

Netzwerkkonfiguration der Instanzgruppe

Veranstaltung Description
Netzwerkkonfiguration gefunden Subnetz <subnet-id>in AZ <availability-zone>mit SecurityGroupIds <security-group-ids>für IG <instance-group-name>im Cluster gefunden <cluster-name>
Die Netzwerkkonfiguration ist fehlgeschlagen Die Netzwerkkonfigurationsdetails der Instanzgruppe für IG <instance-group-name>im Cluster konnten nicht verarbeitet werden <cluster-name>
Es wurde eine benutzerdefinierte AMI-Überschreibung gefunden Es wurde eine benutzerdefinierte AMI-Override <ami-id>für IG <instance-group-name>im Cluster gefunden <cluster-name>
Die benutzerdefinierte AMI-Überschreibung ist fehlgeschlagen Fehler beim Verarbeiten der benutzerdefinierten AMI-Override-Details für IG <instance-group-name>im Cluster <cluster-name>
Verwendete Plattform-Netzwerkkonfiguration Verwendung der von der HyperPod Plattform bereitgestellten Netzwerkkonfiguration für IG <instance-group-name>im Cluster <cluster-name>
Die Netzwerkkonfiguration wurde ermittelt Die Netzwerkkonfiguration der Instanzgruppe für IG <instance-group-name>im Cluster wurde erfolgreich ermittelt <cluster-name>

Erstellung einer Instanz

Veranstaltung Description
Der Instanzbetrieb wurde gestartet Die Instanz <operation>wurde erfolgreich in Cluster <cluster-name>und IG gestartet <instance-group-name>
Der Start des Instanzvorgangs ist fehlgeschlagen Die Instanz konnte <operation>in Cluster <cluster-name>und IG nicht gestartet werden <instance-group-name>
Kapazitätsreservierung gefunden Es wurde <reservation-id>eine CapacityReservation ID für Cluster <cluster-name>und IG gefunden<instance-group-name>, wobei die reservierte Kapazität verwendet wurde
Die Kapazitätsreservierung wurde nicht gefunden Für Cluster <cluster-name>und IG CapacityReservation wurde nichts gefunden<instance-group-name>, da der On-Demand-Pool verwendet wird
Die Einrichtung der Instanznutzlast ist fehlgeschlagen Fehler bei der Verarbeitung CapacityReservationDetails für Cluster <cluster-name>und IG <instance-group-name>
Kunden-ENI wurde erstellt Kunden-ENI wurde erfolgreich erstellt, z. B. in Cluster <cluster-name>und IG <instance-group-name>
Die Erstellung der Kunden-ENI ist fehlgeschlagen Die Kunden-ENI konnte beispielsweise in Cluster <cluster-name>und IG nicht erstellt werden <instance-group-name>
EC2-Instanz wurde bereitgestellt <cluster-name>Die EC2-Instanz <instance-id>wurde erfolgreich in Cluster und IG bereitgestellt <instance-group-name>
Die Erstellung der EC2-Instanz ist fehlgeschlagen <cluster-name>Die EC2-Instanz konnte nicht in Cluster und IG bereitgestellt werden <instance-group-name>
Status des Lebenszyklus-Skripts aktualisiert <instance-id>Die Ausführung des Instance-Lifecycle-Skripts für die EC2-Instance hat <status>
Statusaktualisierung des Lifecycle-Skripts Fehler beim Aktualisieren des Ausführungsstatus des Instanzlebenszyklus-Skripts für EC2InstanceId <instance-id>
Die Instanzerstellung ist mit Lebenszyklusprotokollen fehlgeschlagen Die Ausführung des Instance-Lebenszyklus-Skripts für die EC2-Instance <instance-id>ist fehlgeschlagen. Die Lifecycle-Skriptprotokolle finden Sie unter Protokollgruppe...
Nicht verwendetes ENI-Cleanup war erfolgreich <cluster-name>Ungenutzte Kunden-ENIs für die EC2-Instance <instance-id>in Cluster und IG wurden erfolgreich gelöscht <instance-group-name>
Die unbenutzte ENI-Bereinigung ist fehlgeschlagen <cluster-name>Ungenutzte Kunden-ENIs für die EC2-Instance <instance-id>in Cluster und IG konnten nicht gelöscht werden <instance-group-name>

Löschen der Instanz

Veranstaltung Description
Die EC2-Instance wird gerade beendet <cluster-name>Die EC2-Instance <instance-id>wird derzeit in Cluster und IG beendet <instance-group-name>
Die Beendigung der EC2-Instanz ist fehlgeschlagen <cluster-name>Die EC2-Instance <instance-id>in Cluster und IG konnte nicht beendet werden <instance-group-name>
Kunden-ENI wurde gelöscht Die Kunden-ENI wurde erfolgreich für die EC2-Instance <instance-id>in Cluster <cluster-name>und IG gelöscht <instance-group-name>
Das Löschen der Kunden-ENI ist fehlgeschlagen Die Kunden-ENI für die EC2-Instance <instance-id>in Cluster <cluster-name>und IG konnte nicht gelöscht werden <instance-group-name>

Instance-Neustart

Veranstaltung Description
Der Neustart der EC2-Instanz ist im Gange <cluster-name>Der Neustart der EC2-Instance <instance-id>wird derzeit auf Cluster und IG ausgeführt <instance-group-name>
Die Anforderung zum Neustart der EC2-Instanz ist fehlgeschlagen <cluster-name>Fehler beim Senden der Neustartanforderung für die EC2-Instance <instance-id>in Cluster und IG <instance-group-name>

Instanzbetrieb (generisch)

Veranstaltung Description
Instanzvorgang abgeschlossen Die Instanz <operation><instance-id>in Cluster <cluster-name>und IG <instance-group-name>wurde erfolgreich abgeschlossen
Der Instanzvorgang ist fehlgeschlagen Die Instanz <operation><instance-id>in Cluster <cluster-name>und IG ist <instance-group-name>ausgefallen

Ersatz der Instanz

Veranstaltung Description
Der Austausch der Instanz wurde gestartet <instance-id>Die Instanz wird im Rahmen des Instanzaustauschs in Cluster <cluster-name>und IG gestartet <instance-group-name>
Der Start des Instanzaustauschs ist fehlgeschlagen Die Instanz <instance-id>konnte im Rahmen des Instanzaustauschs in Cluster <cluster-name>und IG nicht gestartet werden <instance-group-name>
Der Austausch der Instanz ist abgeschlossen Die Instanz wurde im <instance-id><operation>Rahmen des Instanzaustauschs in Cluster <cluster-name>und IG erfolgreich abgeschlossen <instance-group-name>
Der Austausch der Instanz ist fehlgeschlagen Die Instanz <instance-id><operation>ist im Rahmen des Instanzaustauschs in Cluster <cluster-name>und IG ausgefallen <instance-group-name>

Lebenszyklus des FSx-Dateisystems

Veranstaltung Description
Die FSx-Erstellung hat begonnen <instance-group-name>Die FSx-Erstellung für IG im Cluster wurde gestartet <cluster-name>
Die FSx-Erstellung ist fehlgeschlagen <instance-group-name>Fehler beim Erstellen von FSx für IG im Cluster <cluster-name>
Die FSx-Erstellung ist abgeschlossen <instance-group-name>Die FSx-Erstellung für IG im Cluster wurde erfolgreich abgeschlossen <cluster-name>
Das Löschen von FSx wurde gestartet <instance-group-name>Das Löschen von FSx für IG im Cluster wurde gestartet <cluster-name>
Das Löschen von FSx ist fehlgeschlagen <instance-group-name>Fehler beim Löschen von FSx für IG im Cluster <cluster-name>
Das Löschen von FSx ist abgeschlossen <instance-group-name>Das Löschen von FSx für IG im Cluster wurde erfolgreich abgeschlossen <cluster-name>
Das FSx-Update wurde gestartet <instance-group-name>Das FSx-Update für IG im Cluster wurde gestartet <cluster-name>
Das FSx-Update ist fehlgeschlagen <instance-group-name>FSx für IG im Cluster konnte nicht aktualisiert werden <cluster-name>
Das FSx-Update ist abgeschlossen <instance-group-name>Das FSx-Update für IG im Cluster wurde erfolgreich abgeschlossen <cluster-name>

Patchen (allgemeine Schritte)

Diese Patch-Ereignisse werden während des Betriebs sowohl für EKS- als auch für Slurm-Cluster ausgegeben. UpdateClusterSoftware

Veranstaltung Description
Patches für Instanzgruppen sind geplant InstanceGroup <instance-group-name>im Cluster <cluster-name>wurde UpdateClusterSoftware bis zum letzten Zeitpunkt geplant.
Der Zeitplan für das Patchen der Instanzgruppe ist fehlgeschlagen <cluster-name>Der Zeitplan UpdateClusterSoftware für IG <instance-group-name>im Cluster konnte nicht erstellt werden.
Das Patchen für Instanzgruppen wurde gestartet UpdateClusterSoftware wurde <instance-group-name><cluster-name>mithilfe einer <strategy>Strategie für IG im Cluster initiiert.
Der Start des Instanzgruppen-Patches ist fehlgeschlagen <cluster-name>Die UpdateClusterSoftware Initiierung von IG <instance-group-name>im Cluster ist fehlgeschlagen.
Der nächste Patch-Batch wurde ausgewählt <cluster-name>Der nächste Aktualisierungsstapel wurde für IG <instance-group-name>im Cluster ausgewählt.
Die Auswahl des nächsten Patch-Batches ist fehlgeschlagen <cluster-name>Der nächste Update-Batch für IG <instance-group-name>im Cluster konnte nicht ausgewählt werden.
Fehlgeschlagene Instanzen wurden in die Warteschlange zum Austausch gestellt Fehlgeschlagene Instanzen in IG <instance-group-name>im Cluster <cluster-name>standen in der Warteschlange für den Knotenaustausch.
Fehlgeschlagener Instanzwechsel, Warteschlange ist fehlgeschlagen <cluster-name>Fehler beim Einstellen von Instanzen für den Node-Ersatz in IG <instance-group-name>im Cluster.
Das Patchen der Instanzgruppe ist abgeschlossen UpdateClusterSoftware <cluster-name>erfolgreich für IG <instance-group-name>im Cluster abgeschlossen.
Der Abschluss des Patches für die Instanzgruppe ist fehlgeschlagen <cluster-name>Der Abschluss UpdateClusterSoftware für IG <instance-group-name>im Cluster ist fehlgeschlagen.
Der Austausch des Root-Volumes wurde gestartet Der Austausch des Root-Volumes für Instance <instance-id>in IG wurde gestartet<instance-group-name>.
Der Austausch des Root-Volumes ist fehlgeschlagen Der Austausch des Root-Volumes für die Instance <instance-id>in IG konnte nicht gestartet <instance-group-name>werden.
Das Patchen der Instanz war erfolgreich Die Instanz <instance-id>in IG <instance-group-name>wurde erfolgreich aktualisiert.

EKS-specific Ereignisse

Die folgenden Ereignisse werden nur für HyperPod Cluster ausgegeben, die mit Amazon EKS orchestriert wurden.

Greifen Sie auf die Zugangsverwaltung

Veranstaltung Description
Der Vorgang zur Eingabe des SLR-Zugriffs war erfolgreich SLR-Zugriffseintrag für Cluster <operation>erfolgreich <cluster-name>
Der SLR-Zugriffseingabevorgang ist fehlgeschlagen Die SLR-Zugriffseingabe für Cluster ist <operation>fehlgeschlagen <cluster-name>
Der Vorgang mit den EKS-Zugriffseinträgen war erfolgreich Die EKS-Zugriffseinträge <operation>für Cluster waren erfolgreich <cluster-name>
Der Vorgang mit den EKS-Zugriffseinträgen ist fehlgeschlagen EKS-Zugriffseinträge <operation>für Cluster sind fehlgeschlagen <cluster-name>

Aktualisierungen der Kubernetes-Konfiguration

Veranstaltung Description
Das Kubernetes-Konfigurationsupdate war erfolgreich <instance-id><cluster-name>Die Kubernetes-Konfiguration wurde erfolgreich aktualisiert, zum Beispiel in Cluster und IG <instance-group-name>
Das Update der Kubernetes-Konfiguration ist fehlgeschlagen <instance-id><cluster-name>Die Kubernetes-Konfiguration konnte beispielsweise in Cluster und IG nicht aktualisiert werden <instance-group-name>

Autoscaling von Karpenter

Veranstaltung Description
Der Autoscaling-Vorgang war erfolgreich AutoScaling <operation><status>erfolgreich im Cluster <cluster-name>
Der Autoscaling-Vorgang ist fehlgeschlagen Fehler beim Einspielen <operation> AutoScaling im Cluster <cluster-name>
Die Installation von Karpenter CRD war erfolgreich CustomResourceDefinition Die Installation im EKS-Cluster wurde erfolgreich abgeschlossen <cluster-name>
Die Installation von Karpenter CRD ist fehlgeschlagen CustomResourceDefinition Die Installation für EKS-Cluster ist fehlgeschlagen <cluster-name>
Die Aktualisierung der Karpenter SLR-Zugriffsrichtlinie war erfolgreich <operation><cluster-name>Zugriffsrichtlinien mit AmazonSageMakerHyperPodServiceRole Zugriffseintrag im EKS-Cluster erfolgreich
Die Aktualisierung der Karpenter SLR-Zugriffsrichtlinien ist fehlgeschlagen Fehler beim Zugriff <operation>auf Richtlinien mit AmazonSageMakerHyperPodServiceRole Zugriffseintrag im EKS-Cluster <cluster-name>

Patchen — EKS-Instanzebene

Veranstaltung Description
Die Vorbereitung des Instanz-Patches war erfolgreich Die Instanz <instance-id>in der IG <instance-group-name>wurde abgesperrt und die Pods wurden geräumt.
Das Patchen der Instanz wurde übersprungen (PDB-Verstoß) UpdateClusterSoftware für Instance <instance-id>in IG wurde aufgrund einer Einschränkung <instance-group-name>übersprungen. PodDisruptionBudget
Die Vorbereitung des Instanz-Patches ist fehlgeschlagen Fehler beim Vorbereiten <instance-id>der Instanz in IG <instance-group-name>für UpdateClusterSoftware.
Die Instanz wurde in den planbaren Zustand zurückversetzt Die Instanz <instance-id>in IG <instance-group-name>wurde in den planbaren Zustand zurückversetzt.
Die Wiederherstellung der Instanz in den planbaren Zustand ist fehlgeschlagen Fehler beim Wiederherstellen der Instanz <instance-id>in IG in den <instance-group-name>planbaren Zustand.

Patchen — EKS-Rollback

Veranstaltung Description
Die Backzeit hat begonnen Die Backphase für IG <instance-group-name>in Cluster hat begonnen<cluster-name>. Überwacht Alarme [<alarm-names>] für <duration>Sekunden.
Backzeit abgeschlossen Die Backphase für IG <instance-group-name>in Cluster ist abgeschlossen<cluster-name>. Während der <duration>Backperiode von 2 Sekunden wurden keine Alarme ausgelöst.
Es wurde ein Alarm für die Backzeit ausgelöst Die Backzeit für IG <instance-group-name>im Cluster ist fehlgeschlagen<cluster-name>. Alarme [<alarm-names>] haben den ALARM-Status erreicht. Automatisches Rollback wird initiiert.
Die Bewertung der Bremszeit ist fehlgeschlagen Fehler bei der Auswertung der Alarme während der Backphase für IG <instance-group-name>im Cluster<cluster-name>.
Das Rollback für das Patchen der Instanzgruppe wurde eingeleitet UpdateClusterSoftware <cluster-name>ist für IG <instance-group-name>im Cluster fehlgeschlagen. Rollback wird initiiert.
Das Rollback für das Patchen der Instanzgruppe ist fehlgeschlagen <instance-group-name><cluster-name>Das Rollback für IG im Cluster ist fehlgeschlagen. Einige Instanzen befinden sich möglicherweise im FailedMaintenance Status.
Das Rollback für das Patchen der Instanzen wurde eingeleitet Die Instanz <instance-id>in IG <instance-group-name>konnte nicht aktualisiert werden. Das Rollback wurde eingeleitet.
Das Rollback für das Patchen der Instanz war erfolgreich Die Instance <instance-id>in IG <instance-group-name>wurde erfolgreich auf das vorherige AMI zurückgesetzt.
Das Rollback beim Patchen der Instanz ist fehlgeschlagen UpdateClusterSoftware <instance-id><instance-group-name>Das Rollback ist zum Beispiel in IG fehlgeschlagen.

Slurm-specific Ereignisse

Die folgenden Ereignisse werden nur für HyperPod Cluster ausgegeben, die mit Slurm orchestriert wurden.

Veranstaltung Description
Es wurden Bereitstellungsparameter gefunden provisioning_parameters.json wurde im S3-Pfad für die Controller-Gruppe gefunden LifeCycleScript <instance-group-name>
Die Bereitstellungsparameter wurden nicht gefunden Im S3-Pfad für die Controller-Gruppe wurde keine provisioning_parameters.json gefunden LifeCycleScript <instance-group-name>
Slurm-Munge-Schlüssel wurde erstellt Der Munge-Schlüssel wurde erfolgreich erstellt und gespeichert
Die Slurm-Drift-Validierung wurde bestanden Die Überprüfung der Slurm-Konfiguration für die Drift wurde bestanden
Slurm-Drift erkannt Es wurde eine Abweichung bei der Slurm-Konfiguration festgestellt: <drift-details>
Das Rollback des Slurm-Clusters ist abgeschlossen Die Clustererstellung ist fehlgeschlagen: Controller und Anmeldeknoten waren nicht innerhalb der erwarteten Zeit bereit
Die Neukonfiguration von Slurm war erfolgreich Slurm wurde erfolgreich neu konfiguriert. Die Slurm-Konfiguration wurde aktualisiert, sodass sie dem gewünschten Status entspricht

EventBridge Integration

HyperPod sendet Cluster-Ereignisse EventBridge mithilfe von drei Detailtypen an Amazon:

Typ der Details Description
SageMaker HyperPod Cluster Event Betriebsereignisse für Bereitstellungs-, Skalierungs-, Patching- und Orchestrator-spezifische Vorgänge. Beinhaltet die Filterung nach Schweregrad. EventLevel
SageMaker HyperPod Cluster State Change Cluster-level Statusübergänge (z. B. Erstellen bis InService). Beinhaltet die vollständige Clusterkonfiguration.
SageMaker HyperPod Cluster Node Health Event Ereignisse zur Gesundheitsüberwachung durch den HyperPod Health Monitoring Agent (HMA). Beinhaltet den Gesundheitsstatus, den Grund, die Reparaturmaßnahme und eine Empfehlung.

Beispiele für Ereignismuster

Alle HyperPod Cluster-Ereignisse:

{ "source": ["aws.sagemaker"], "detail-type": ["SageMaker HyperPod Cluster Event"] }

Nur Fehlerereignisse (für Warnmeldungen):

{ "source": ["aws.sagemaker"], "detail-type": ["SageMaker HyperPod Cluster Event"], "detail": { "EventDetails": { "EventLevel": ["Error"] } } }

Ereignisse für einen bestimmten Cluster:

{ "source": ["aws.sagemaker"], "detail-type": ["SageMaker HyperPod Cluster Event"], "resources": ["arn:aws:sagemaker:us-west-2:111122223333:cluster/my-cluster-id"] }

Ereignisse zum Zustand des Knotens:

{ "source": ["aws.sagemaker"], "detail-type": ["SageMaker HyperPod Cluster Node Health Event"] }

API-Referenz

Weitere Informationen finden Sie auch unter