Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.
SageMaker HyperPod Referenz zu Cluster-Ereignissen
Diese Seite bietet eine vollständige Übersicht über alle strukturierten Ereignisse, die von Amazon-Clustern ausgelöst werden. SageMaker HyperPod Ereignisse bieten Einblick in die Abläufe auf Cluster-, Instanzgruppen- und Instanzebene, einschließlich Bereitstellung, Skalierung, Patches und orchestratorspezifischer Lebenszyklusänderungen.
Cluster-Ereignisse sind für Cluster verfügbar, bei denen der Wert auf gesetzt ist. HyperPod NodeProvisioningMode Continuous Auf Ereignisse kann über die ListClusterEvents DescribeClusterEvent AND-APIs, die Registerkarte „Ereignisse“ der SageMaker KI-Konsole und Amazon zugegriffen EventBridge werden.
Cluster-Ereignisaufzeichnung
Jedes Clusterereignis wird als strukturierter Datensatz dargestellt, der Identifikation, Zeitpunkt, Umfang, Schweregrad und betriebsspezifische Metadaten enthält. Das folgende Beispiel zeigt einen vollständigen Ereignisdatensatz, wie er über die DescribeClusterEvent API und Amazon bereitgestellt wird: EventBridge
{ "version": "0", "id": "0bd4a141-0a02-9d8a-f977-3924c3fb259c", "detail-type": "SageMaker HyperPod Cluster Event", "source": "aws.sagemaker", "account": "111122223333", "time": "2026-06-01T17:20:25Z", "region": "us-west-2", "resources": [ "arn:aws:sagemaker:us-west-2:111122223333:cluster/sample-cluster" ], "detail": { "EventDetails": { "EventId": "83ea0bb5-be77-45e8-a458-0a87f778a205", "ClusterArn": "arn:aws:sagemaker:us-west-2:111122223333:cluster/sample-cluster", "ClusterName": "sample-cluster", "InstanceGroupName": "p5Inst", "InstanceId": "i-0391f86fa0fe0d465", "ResourceType": "Instance", "EventTime": 1748794825350, "EventLevel": "Error", "Description": "Instance creation in Cluster sample-cluster and InstanceGroup p5Inst failed", "EventDetails": { "EventMetadata": { "Instance": { "FailureMessage": "We currently do not have sufficient capacity to launch new ml.p5.48xlarge instances. Please try again.", "NodeLogicalId": "df268d19-f035-4f28-9b80-b956b92ae21e" } } } } } }
Felder für Ereignisdatensätze
Das detail.EventDetails-Objekt enthält die folgenden Felder:
| Feld | Typ | Erforderlich | Description |
|---|---|---|---|
EventId |
Zeichenfolge (UUID) | Ja | Eindeutiger Bezeichner für das Ereignis. |
ClusterArn |
Zeichenfolge | Ja | ARN des HyperPod Clusters. |
ClusterName |
Zeichenfolge | Ja | Name des HyperPod Clusters. |
EventTime |
Zeitstempel | Ja | Wann das Ereignis eingetreten ist (Epochen-Millisekunden). |
ResourceType |
Zeichenfolge | Ja | Umfang des Ereignisses:Cluster, oder. InstanceGroup Instance |
EventLevel |
Zeichenfolge | Ja | Einstufung des Schweregrads: InfoWarn,, oderError. |
Description |
Zeichenfolge | Nein | Human-readable Zusammenfassung der Veranstaltung. |
InstanceGroupName |
Zeichenfolge | Nein | Name der Instanzgruppe (vorhanden, wenn InstanceGroup oder ResourceType istInstance). |
InstanceId |
Zeichenfolge | Nein | EC2-Instanz-ID (vorhanden, wenn „ResourceTypeist“Instance). |
EventDetails |
Objekt | Nein | Zusätzliche Metadaten, die für den Ressourcentyp und den Vorgang spezifisch sind. |
Stufen der Ereignisse
| Level | Bedeutung |
|---|---|
Info |
Der Vorgang wurde erfolgreich abgeschlossen oder läuft normal. |
Warn |
Der Vorgang wurde aufgrund eines unkritischen Problems oder eines Zustands abgeschlossen, der möglicherweise in Zukunft behandelt werden muss. |
Error |
Der Vorgang ist fehlgeschlagen oder erfordert sofortige Aufmerksamkeit. |
Ressourcentypen
| ResourceType | Scope | Beispielereignisse |
|---|---|---|
Cluster |
Whole-cluster Operationen | Cluster creation/update wurde gestartet, Clusterbetrieb ist fehlgeschlagen |
InstanceGroup |
Operationen der Instanzgruppe | Skalierung started/completed, geplantes Patchen, FSx-Lebenszyklus |
Instance |
Betrieb einzelner Instanzen | EC2-Bereitstellung, Ausführung von Lifecycle-Skripten, ENI-Management, Kündigung |
EventDetails Metadaten
Cluster-Ereignisse enthalten ein EventMetadata Objekt innerhalb des EventDetails Felds, das einen operationsspezifischen Kontext bietet, der über das hinausgeht, was die Ereignisbeschreibung vermittelt. Der Inhalt von EventMetadata variiert je nach Ressourcentyp und Ereignistyp. Das vollständige Schema und die unterstützten Felder finden Sie EventMetadata in der Amazon SageMaker AI API-Referenz.
EventBridge Envelope-Felder
Bei der Lieferung durch Amazon EventBridge wird der Veranstaltungsdatensatz in den EventBridge Standardumschlag verpackt:
| Feld | Description |
|---|---|
version |
EventBridge Schemaversion (immer"0"). |
id |
Eindeutige EventBridge Ereignis-ID. |
detail-type |
SageMaker HyperPod Cluster Event |
source |
aws.sagemaker |
account |
AWS Konto-ID, der der Cluster gehört. |
time |
ISO 8601-Zeitstempel des Ereignisses. |
region |
AWS Region, in der sich der Cluster befindet. |
resources |
Array, das den Cluster-ARN enthält. |
detail |
Enthält das oben beschriebene EventDetails Objekt. |
Häufige Ereignisse (EKS und Slurm)
Die folgenden Ereignisse werden für alle HyperPod Cluster unabhängig vom Orchestrator ausgegeben. In der Spalte Beschreibung wird der Wert des Description Felds im Ereignisdatensatz so angezeigt, wie er in der API-Antwort und auf der Registerkarte „Ereignisse“ der Konsole angezeigt wird.
Cluster-Lebenszyklus
| Veranstaltung | Description |
|---|---|
| Der Clusterbetrieb wurde gestartet | Der Cluster <cluster-name><operation>wurde erfolgreich gestartet |
| Der Start des Clustervorgangs ist fehlgeschlagen | Cluster konnte nicht gestartet werden <cluster-name><operation> |
| Cluster-Vorgang abgeschlossen | Der Cluster <cluster-name><operation>wurde erfolgreich abgeschlossen |
| Der Clustervorgang ist fehlgeschlagen | Cluster <cluster-name><operation>ist fehlgeschlagen |
Lebenszyklus der Instanzgruppe
| Veranstaltung | Description |
|---|---|
| Der Betrieb der Instanzgruppe wurde gestartet | InstanceGroup <instance-group-name><operation>wurde erfolgreich im Cluster gestartet <cluster-name> |
| Der Start des Instanzgruppen-Vorgangs ist fehlgeschlagen | Fehler beim Starten InstanceGroup <instance-group-name><operation>im Cluster <cluster-name> |
| Der Vorgang der Instanzgruppe wurde abgeschlossen | Die Instanzgruppe <instance-group-name><operation>im Cluster <cluster-name>wurde erfolgreich abgeschlossen |
| Der Vorgang der Instanzgruppe ist fehlgeschlagen | Instanzgruppe <instance-group-name><operation>im Cluster <cluster-name>ist fehlgeschlagen |
Netzwerkkonfiguration der Instanzgruppe
| Veranstaltung | Description |
|---|---|
| Netzwerkkonfiguration gefunden | Subnetz <subnet-id>in AZ <availability-zone>mit SecurityGroupIds <security-group-ids>für IG <instance-group-name>im Cluster gefunden <cluster-name> |
| Die Netzwerkkonfiguration ist fehlgeschlagen | Die Netzwerkkonfigurationsdetails der Instanzgruppe für IG <instance-group-name>im Cluster konnten nicht verarbeitet werden <cluster-name> |
| Es wurde eine benutzerdefinierte AMI-Überschreibung gefunden | Es wurde eine benutzerdefinierte AMI-Override <ami-id>für IG <instance-group-name>im Cluster gefunden <cluster-name> |
| Die benutzerdefinierte AMI-Überschreibung ist fehlgeschlagen | Fehler beim Verarbeiten der benutzerdefinierten AMI-Override-Details für IG <instance-group-name>im Cluster <cluster-name> |
| Verwendete Plattform-Netzwerkkonfiguration | Verwendung der von der HyperPod Plattform bereitgestellten Netzwerkkonfiguration für IG <instance-group-name>im Cluster <cluster-name> |
| Die Netzwerkkonfiguration wurde ermittelt | Die Netzwerkkonfiguration der Instanzgruppe für IG <instance-group-name>im Cluster wurde erfolgreich ermittelt <cluster-name> |
Erstellung einer Instanz
| Veranstaltung | Description |
|---|---|
| Der Instanzbetrieb wurde gestartet | Die Instanz <operation>wurde erfolgreich in Cluster <cluster-name>und IG gestartet <instance-group-name> |
| Der Start des Instanzvorgangs ist fehlgeschlagen | Die Instanz konnte <operation>in Cluster <cluster-name>und IG nicht gestartet werden <instance-group-name> |
| Kapazitätsreservierung gefunden | Es wurde <reservation-id>eine CapacityReservation ID für Cluster <cluster-name>und IG gefunden<instance-group-name>, wobei die reservierte Kapazität verwendet wurde |
| Die Kapazitätsreservierung wurde nicht gefunden | Für Cluster <cluster-name>und IG CapacityReservation wurde nichts gefunden<instance-group-name>, da der On-Demand-Pool verwendet wird |
| Die Einrichtung der Instanznutzlast ist fehlgeschlagen | Fehler bei der Verarbeitung CapacityReservationDetails für Cluster <cluster-name>und IG <instance-group-name> |
| Kunden-ENI wurde erstellt | Kunden-ENI wurde erfolgreich erstellt, z. B. in Cluster <cluster-name>und IG <instance-group-name> |
| Die Erstellung der Kunden-ENI ist fehlgeschlagen | Die Kunden-ENI konnte beispielsweise in Cluster <cluster-name>und IG nicht erstellt werden <instance-group-name> |
| EC2-Instanz wurde bereitgestellt | <cluster-name>Die EC2-Instanz <instance-id>wurde erfolgreich in Cluster und IG bereitgestellt <instance-group-name> |
| Die Erstellung der EC2-Instanz ist fehlgeschlagen | <cluster-name>Die EC2-Instanz konnte nicht in Cluster und IG bereitgestellt werden <instance-group-name> |
| Status des Lebenszyklus-Skripts aktualisiert | <instance-id>Die Ausführung des Instance-Lifecycle-Skripts für die EC2-Instance hat <status> |
| Statusaktualisierung des Lifecycle-Skripts | Fehler beim Aktualisieren des Ausführungsstatus des Instanzlebenszyklus-Skripts für EC2InstanceId <instance-id> |
| Die Instanzerstellung ist mit Lebenszyklusprotokollen fehlgeschlagen | Die Ausführung des Instance-Lebenszyklus-Skripts für die EC2-Instance <instance-id>ist fehlgeschlagen. Die Lifecycle-Skriptprotokolle finden Sie unter Protokollgruppe... |
| Nicht verwendetes ENI-Cleanup war erfolgreich | <cluster-name>Ungenutzte Kunden-ENIs für die EC2-Instance <instance-id>in Cluster und IG wurden erfolgreich gelöscht <instance-group-name> |
| Die unbenutzte ENI-Bereinigung ist fehlgeschlagen | <cluster-name>Ungenutzte Kunden-ENIs für die EC2-Instance <instance-id>in Cluster und IG konnten nicht gelöscht werden <instance-group-name> |
Löschen der Instanz
| Veranstaltung | Description |
|---|---|
| Die EC2-Instance wird gerade beendet | <cluster-name>Die EC2-Instance <instance-id>wird derzeit in Cluster und IG beendet <instance-group-name> |
| Die Beendigung der EC2-Instanz ist fehlgeschlagen | <cluster-name>Die EC2-Instance <instance-id>in Cluster und IG konnte nicht beendet werden <instance-group-name> |
| Kunden-ENI wurde gelöscht | Die Kunden-ENI wurde erfolgreich für die EC2-Instance <instance-id>in Cluster <cluster-name>und IG gelöscht <instance-group-name> |
| Das Löschen der Kunden-ENI ist fehlgeschlagen | Die Kunden-ENI für die EC2-Instance <instance-id>in Cluster <cluster-name>und IG konnte nicht gelöscht werden <instance-group-name> |
Instance-Neustart
| Veranstaltung | Description |
|---|---|
| Der Neustart der EC2-Instanz ist im Gange | <cluster-name>Der Neustart der EC2-Instance <instance-id>wird derzeit auf Cluster und IG ausgeführt <instance-group-name> |
| Die Anforderung zum Neustart der EC2-Instanz ist fehlgeschlagen | <cluster-name>Fehler beim Senden der Neustartanforderung für die EC2-Instance <instance-id>in Cluster und IG <instance-group-name> |
Instanzbetrieb (generisch)
| Veranstaltung | Description |
|---|---|
| Instanzvorgang abgeschlossen | Die Instanz <operation><instance-id>in Cluster <cluster-name>und IG <instance-group-name>wurde erfolgreich abgeschlossen |
| Der Instanzvorgang ist fehlgeschlagen | Die Instanz <operation><instance-id>in Cluster <cluster-name>und IG ist <instance-group-name>ausgefallen |
Ersatz der Instanz
| Veranstaltung | Description |
|---|---|
| Der Austausch der Instanz wurde gestartet | <instance-id>Die Instanz wird im Rahmen des Instanzaustauschs in Cluster <cluster-name>und IG gestartet <instance-group-name> |
| Der Start des Instanzaustauschs ist fehlgeschlagen | Die Instanz <instance-id>konnte im Rahmen des Instanzaustauschs in Cluster <cluster-name>und IG nicht gestartet werden <instance-group-name> |
| Der Austausch der Instanz ist abgeschlossen | Die Instanz wurde im <instance-id><operation>Rahmen des Instanzaustauschs in Cluster <cluster-name>und IG erfolgreich abgeschlossen <instance-group-name> |
| Der Austausch der Instanz ist fehlgeschlagen | Die Instanz <instance-id><operation>ist im Rahmen des Instanzaustauschs in Cluster <cluster-name>und IG ausgefallen <instance-group-name> |
Lebenszyklus des FSx-Dateisystems
| Veranstaltung | Description |
|---|---|
| Die FSx-Erstellung hat begonnen | <instance-group-name>Die FSx-Erstellung für IG im Cluster wurde gestartet <cluster-name> |
| Die FSx-Erstellung ist fehlgeschlagen | <instance-group-name>Fehler beim Erstellen von FSx für IG im Cluster <cluster-name> |
| Die FSx-Erstellung ist abgeschlossen | <instance-group-name>Die FSx-Erstellung für IG im Cluster wurde erfolgreich abgeschlossen <cluster-name> |
| Das Löschen von FSx wurde gestartet | <instance-group-name>Das Löschen von FSx für IG im Cluster wurde gestartet <cluster-name> |
| Das Löschen von FSx ist fehlgeschlagen | <instance-group-name>Fehler beim Löschen von FSx für IG im Cluster <cluster-name> |
| Das Löschen von FSx ist abgeschlossen | <instance-group-name>Das Löschen von FSx für IG im Cluster wurde erfolgreich abgeschlossen <cluster-name> |
| Das FSx-Update wurde gestartet | <instance-group-name>Das FSx-Update für IG im Cluster wurde gestartet <cluster-name> |
| Das FSx-Update ist fehlgeschlagen | <instance-group-name>FSx für IG im Cluster konnte nicht aktualisiert werden <cluster-name> |
| Das FSx-Update ist abgeschlossen | <instance-group-name>Das FSx-Update für IG im Cluster wurde erfolgreich abgeschlossen <cluster-name> |
Patchen (allgemeine Schritte)
Diese Patch-Ereignisse werden während des Betriebs sowohl für EKS- als auch für Slurm-Cluster ausgegeben. UpdateClusterSoftware
| Veranstaltung | Description |
|---|---|
| Patches für Instanzgruppen sind geplant | InstanceGroup <instance-group-name>im Cluster <cluster-name>wurde UpdateClusterSoftware bis zum letzten Zeitpunkt geplant. |
| Der Zeitplan für das Patchen der Instanzgruppe ist fehlgeschlagen | <cluster-name>Der Zeitplan UpdateClusterSoftware für IG <instance-group-name>im Cluster konnte nicht erstellt werden. |
| Das Patchen für Instanzgruppen wurde gestartet | UpdateClusterSoftware wurde <instance-group-name><cluster-name>mithilfe einer <strategy>Strategie für IG im Cluster initiiert. |
| Der Start des Instanzgruppen-Patches ist fehlgeschlagen | <cluster-name>Die UpdateClusterSoftware Initiierung von IG <instance-group-name>im Cluster ist fehlgeschlagen. |
| Der nächste Patch-Batch wurde ausgewählt | <cluster-name>Der nächste Aktualisierungsstapel wurde für IG <instance-group-name>im Cluster ausgewählt. |
| Die Auswahl des nächsten Patch-Batches ist fehlgeschlagen | <cluster-name>Der nächste Update-Batch für IG <instance-group-name>im Cluster konnte nicht ausgewählt werden. |
| Fehlgeschlagene Instanzen wurden in die Warteschlange zum Austausch gestellt | Fehlgeschlagene Instanzen in IG <instance-group-name>im Cluster <cluster-name>standen in der Warteschlange für den Knotenaustausch. |
| Fehlgeschlagener Instanzwechsel, Warteschlange ist fehlgeschlagen | <cluster-name>Fehler beim Einstellen von Instanzen für den Node-Ersatz in IG <instance-group-name>im Cluster. |
| Das Patchen der Instanzgruppe ist abgeschlossen | UpdateClusterSoftware <cluster-name>erfolgreich für IG <instance-group-name>im Cluster abgeschlossen. |
| Der Abschluss des Patches für die Instanzgruppe ist fehlgeschlagen | <cluster-name>Der Abschluss UpdateClusterSoftware für IG <instance-group-name>im Cluster ist fehlgeschlagen. |
| Der Austausch des Root-Volumes wurde gestartet | Der Austausch des Root-Volumes für Instance <instance-id>in IG wurde gestartet<instance-group-name>. |
| Der Austausch des Root-Volumes ist fehlgeschlagen | Der Austausch des Root-Volumes für die Instance <instance-id>in IG konnte nicht gestartet <instance-group-name>werden. |
| Das Patchen der Instanz war erfolgreich | Die Instanz <instance-id>in IG <instance-group-name>wurde erfolgreich aktualisiert. |
EKS-specific Ereignisse
Die folgenden Ereignisse werden nur für HyperPod Cluster ausgegeben, die mit Amazon EKS orchestriert wurden.
Greifen Sie auf die Zugangsverwaltung
| Veranstaltung | Description |
|---|---|
| Der Vorgang zur Eingabe des SLR-Zugriffs war erfolgreich | SLR-Zugriffseintrag für Cluster <operation>erfolgreich <cluster-name> |
| Der SLR-Zugriffseingabevorgang ist fehlgeschlagen | Die SLR-Zugriffseingabe für Cluster ist <operation>fehlgeschlagen <cluster-name> |
| Der Vorgang mit den EKS-Zugriffseinträgen war erfolgreich | Die EKS-Zugriffseinträge <operation>für Cluster waren erfolgreich <cluster-name> |
| Der Vorgang mit den EKS-Zugriffseinträgen ist fehlgeschlagen | EKS-Zugriffseinträge <operation>für Cluster sind fehlgeschlagen <cluster-name> |
Aktualisierungen der Kubernetes-Konfiguration
| Veranstaltung | Description |
|---|---|
| Das Kubernetes-Konfigurationsupdate war erfolgreich | <instance-id><cluster-name>Die Kubernetes-Konfiguration wurde erfolgreich aktualisiert, zum Beispiel in Cluster und IG <instance-group-name> |
| Das Update der Kubernetes-Konfiguration ist fehlgeschlagen | <instance-id><cluster-name>Die Kubernetes-Konfiguration konnte beispielsweise in Cluster und IG nicht aktualisiert werden <instance-group-name> |
Autoscaling von Karpenter
| Veranstaltung | Description |
|---|---|
| Der Autoscaling-Vorgang war erfolgreich | AutoScaling <operation><status>erfolgreich im Cluster <cluster-name> |
| Der Autoscaling-Vorgang ist fehlgeschlagen | Fehler beim Einspielen <operation> AutoScaling im Cluster <cluster-name> |
| Die Installation von Karpenter CRD war erfolgreich | CustomResourceDefinition Die Installation im EKS-Cluster wurde erfolgreich abgeschlossen <cluster-name> |
| Die Installation von Karpenter CRD ist fehlgeschlagen | CustomResourceDefinition Die Installation für EKS-Cluster ist fehlgeschlagen <cluster-name> |
| Die Aktualisierung der Karpenter SLR-Zugriffsrichtlinie war erfolgreich | <operation><cluster-name>Zugriffsrichtlinien mit AmazonSageMakerHyperPodServiceRole Zugriffseintrag im EKS-Cluster erfolgreich |
| Die Aktualisierung der Karpenter SLR-Zugriffsrichtlinien ist fehlgeschlagen | Fehler beim Zugriff <operation>auf Richtlinien mit AmazonSageMakerHyperPodServiceRole Zugriffseintrag im EKS-Cluster <cluster-name> |
Patchen — EKS-Instanzebene
| Veranstaltung | Description |
|---|---|
| Die Vorbereitung des Instanz-Patches war erfolgreich | Die Instanz <instance-id>in der IG <instance-group-name>wurde abgesperrt und die Pods wurden geräumt. |
| Das Patchen der Instanz wurde übersprungen (PDB-Verstoß) | UpdateClusterSoftware für Instance <instance-id>in IG wurde aufgrund einer Einschränkung <instance-group-name>übersprungen. PodDisruptionBudget |
| Die Vorbereitung des Instanz-Patches ist fehlgeschlagen | Fehler beim Vorbereiten <instance-id>der Instanz in IG <instance-group-name>für UpdateClusterSoftware. |
| Die Instanz wurde in den planbaren Zustand zurückversetzt | Die Instanz <instance-id>in IG <instance-group-name>wurde in den planbaren Zustand zurückversetzt. |
| Die Wiederherstellung der Instanz in den planbaren Zustand ist fehlgeschlagen | Fehler beim Wiederherstellen der Instanz <instance-id>in IG in den <instance-group-name>planbaren Zustand. |
Patchen — EKS-Rollback
| Veranstaltung | Description |
|---|---|
| Die Backzeit hat begonnen | Die Backphase für IG <instance-group-name>in Cluster hat begonnen<cluster-name>. Überwacht Alarme [<alarm-names>] für <duration>Sekunden. |
| Backzeit abgeschlossen | Die Backphase für IG <instance-group-name>in Cluster ist abgeschlossen<cluster-name>. Während der <duration>Backperiode von 2 Sekunden wurden keine Alarme ausgelöst. |
| Es wurde ein Alarm für die Backzeit ausgelöst | Die Backzeit für IG <instance-group-name>im Cluster ist fehlgeschlagen<cluster-name>. Alarme [<alarm-names>] haben den ALARM-Status erreicht. Automatisches Rollback wird initiiert. |
| Die Bewertung der Bremszeit ist fehlgeschlagen | Fehler bei der Auswertung der Alarme während der Backphase für IG <instance-group-name>im Cluster<cluster-name>. |
| Das Rollback für das Patchen der Instanzgruppe wurde eingeleitet | UpdateClusterSoftware <cluster-name>ist für IG <instance-group-name>im Cluster fehlgeschlagen. Rollback wird initiiert. |
| Das Rollback für das Patchen der Instanzgruppe ist fehlgeschlagen | <instance-group-name><cluster-name>Das Rollback für IG im Cluster ist fehlgeschlagen. Einige Instanzen befinden sich möglicherweise im FailedMaintenance Status. |
| Das Rollback für das Patchen der Instanzen wurde eingeleitet | Die Instanz <instance-id>in IG <instance-group-name>konnte nicht aktualisiert werden. Das Rollback wurde eingeleitet. |
| Das Rollback für das Patchen der Instanz war erfolgreich | Die Instance <instance-id>in IG <instance-group-name>wurde erfolgreich auf das vorherige AMI zurückgesetzt. |
| Das Rollback beim Patchen der Instanz ist fehlgeschlagen | UpdateClusterSoftware <instance-id><instance-group-name>Das Rollback ist zum Beispiel in IG fehlgeschlagen. |
Slurm-specific Ereignisse
Die folgenden Ereignisse werden nur für HyperPod Cluster ausgegeben, die mit Slurm orchestriert wurden.
| Veranstaltung | Description |
|---|---|
| Es wurden Bereitstellungsparameter gefunden | provisioning_parameters.json wurde im S3-Pfad für die Controller-Gruppe gefunden LifeCycleScript <instance-group-name> |
| Die Bereitstellungsparameter wurden nicht gefunden | Im S3-Pfad für die Controller-Gruppe wurde keine provisioning_parameters.json gefunden LifeCycleScript <instance-group-name> |
| Slurm-Munge-Schlüssel wurde erstellt | Der Munge-Schlüssel wurde erfolgreich erstellt und gespeichert |
| Die Slurm-Drift-Validierung wurde bestanden | Die Überprüfung der Slurm-Konfiguration für die Drift wurde bestanden |
| Slurm-Drift erkannt | Es wurde eine Abweichung bei der Slurm-Konfiguration festgestellt: <drift-details> |
| Das Rollback des Slurm-Clusters ist abgeschlossen | Die Clustererstellung ist fehlgeschlagen: Controller und Anmeldeknoten waren nicht innerhalb der erwarteten Zeit bereit |
| Die Neukonfiguration von Slurm war erfolgreich | Slurm wurde erfolgreich neu konfiguriert. Die Slurm-Konfiguration wurde aktualisiert, sodass sie dem gewünschten Status entspricht |
EventBridge Integration
HyperPod sendet Cluster-Ereignisse EventBridge mithilfe von drei Detailtypen an Amazon:
| Typ der Details | Description |
|---|---|
SageMaker HyperPod Cluster Event |
Betriebsereignisse für Bereitstellungs-, Skalierungs-, Patching- und Orchestrator-spezifische Vorgänge. Beinhaltet die Filterung nach Schweregrad. EventLevel |
SageMaker HyperPod Cluster State Change |
Cluster-level Statusübergänge (z. B. Erstellen bis InService). Beinhaltet die vollständige Clusterkonfiguration. |
SageMaker HyperPod Cluster Node Health
Event |
Ereignisse zur Gesundheitsüberwachung durch den HyperPod Health Monitoring Agent (HMA). Beinhaltet den Gesundheitsstatus, den Grund, die Reparaturmaßnahme und eine Empfehlung. |
Beispiele für Ereignismuster
Alle HyperPod Cluster-Ereignisse:
{ "source": ["aws.sagemaker"], "detail-type": ["SageMaker HyperPod Cluster Event"] }
Nur Fehlerereignisse (für Warnmeldungen):
{ "source": ["aws.sagemaker"], "detail-type": ["SageMaker HyperPod Cluster Event"], "detail": { "EventDetails": { "EventLevel": ["Error"] } } }
Ereignisse für einen bestimmten Cluster:
{ "source": ["aws.sagemaker"], "detail-type": ["SageMaker HyperPod Cluster Event"], "resources": ["arn:aws:sagemaker:us-west-2:111122223333:cluster/my-cluster-id"] }
Ereignisse zum Zustand des Knotens:
{ "source": ["aws.sagemaker"], "detail-type": ["SageMaker HyperPod Cluster Node Health Event"] }
API-Referenz
-
ListClusterEvents— Listet Ereignisse mit Filterung, Sortierung und Seitennummerierung auf
-
DescribeClusterEvent— Holen Sie sich alle Informationen zu einem bestimmten Ereignis
-
ClusterEventSummary— Datentyp „Zusammenfassung der Ereignisse“
-
ClusterEventDetail— Datentyp „Ereignisdetails“
Weitere Informationen finden Sie auch unter
-
SageMaker HyperPod Slurm-Cluster-Ereignisse— Slurm-Cluster-Ereignisse mit CLI-Nutzung und gängigen Szenarien
-
SageMaker HyperPod EKS-Cluster-Ereignisse— EKS-Cluster-Ereignisse mit CLI-Nutzung und gängigen Szenarien