Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.
SageMaker HyperPod Slurm-Cluster-Ereignisse
Amazon SageMaker HyperPod sendet strukturierte Cluster-Ereignisse aus, die Einblick in betriebliche Änderungen auf Cluster-, Instance-Gruppen- und Instance-Ebene bieten. Sie können diese Ereignisse verwenden, um die Bereitstellungsaktivitäten zu überwachen, Skalierungsvorgänge zu verfolgen, Fehler zu erkennen und automatische Warnungspipelines aufzubauen.
Cluster-Ereignisse sind für HyperPod Slurm-Cluster mit der Einstellung auf verfügbar. NodeProvisioningMode Continuous Auf Ereignisse kann über die DescribeClusterEvent APIs ListClusterEvents und, die SageMaker KI-Konsole und Amazon zugegriffen EventBridge werden.
Das vollständige Ereignisschema, die Schweregrade, den vollständigen Ereigniskatalog und Einzelheiten EventBridge zur Integration finden Sie unterSageMaker HyperPod Referenz zu Cluster-Ereignissen.
Voraussetzungen
-
Ihr HyperPod Slurm-Cluster muss auf
NodeProvisioningModeeingestellt seinContinuous. Cluster, die den Legacy-Bereitstellungsmodus verwenden, senden keine strukturierten Ereignisse aus. -
Um die API verwenden zu können, benötigen
sagemaker:ListClusterEventsSie diesagemaker:DescribeClusterEvententsprechenden Berechtigungen in Ihrer IAM-Richtlinie.
Event types (Ereignistypen)
HyperPod gibt bei kontinuierlicher Bereitstellung zwei Kategorien von Ereignissen für Slurm-Cluster aus: allgemeine Ereignisse, die für alle Orchestratoren gelten, und Ereignisse. Slurm-specific
Häufige Ereignisse betreffen zentrale Infrastrukturoperationen wie Instanzbereitstellung und -beendigung, Skalierung von Instanzgruppen, Verwaltung von Kapazitätsreservierungen, Ausführung von Lifecycle-Skripten, ENI-Management, FSx-Dateisystemlebenszyklus und Patch-Workflows. Die vollständige Liste finden Sie Allgemeine Ereignisse (EKS und Slurm) in der Referenz zu Cluster-Ereignissen. HyperPod
Slurm-specific Die Ereignisse betreffen orchestratorspezifische Operationen wie die Validierung von Bereitstellungsparametern, die Erstellung von Mungeschlüsseln, die Erkennung von Slurm-Konfigurationsabweichungen, die Slurm-Rekonfiguration und das Cluster-Rollback. Diese Ereignisse bieten Einblick in Slurm-specific Lebenszyklusphasen, die bisher nur anhand von Protokollen beobachtet werden konnten. CloudWatch Die vollständige Liste finden Sie Slurm-specific Ereignisse in der Referenz zu HyperPod Cluster-Ereignissen.
Ereignisse in der Konsole anzeigen
-
Öffnen Sie die SageMaker AI-Konsole
. -
Wählen Sie im linken Navigationsbereich HyperPodCluster aus.
-
Wählen Sie Ihren Clusternamen.
-
Wählen Sie die Registerkarte Ereignisse .
Auf der Registerkarte Ereignisse wird eine paginierte Liste von Ereignissen mit Spalten für die Ereignisebene, die Ereignis-ID, den Ressourcennamen, den Ressourcentyp, die Beschreibung und die Uhrzeit des Ereignisses angezeigt. Sie können Ereignisse mithilfe des Suchfeldes nach Attributen filtern, nach Ereigniszeit sortieren und eine Ereignis-ID auswählen, um die vollständigen Veranstaltungsdetails einschließlich der Ereignismetadaten und des vollständigen Ereignisdatensatzes anzuzeigen.
Ereignisse auflisten mit dem AWS CLI
Verwenden Sie den list-cluster-events Befehl, um Ereignisse für Ihren Cluster abzurufen:
aws sagemaker list-cluster-events \ --cluster-name my-slurm-cluster \ --sort-by EventTime \ --sort-order Descending \ --max-results 20
Sie können die Ergebnisse mithilfe der folgenden Filter eingrenzen:
-
--resource-type— filtern nachClusterInstanceGroup, oderInstance. -
--instance-group-name— nach Ereignissen für eine bestimmte Instanzgruppe filtern. -
--node-id— nach Ereignissen für eine bestimmte EC2-Instance filtern. -
--event-time-afterund--event-time-before— nach einem bestimmten Zeitfenster filtern.
Um beispielsweise nur Ereignisse auf Instanzgruppenebene für eine bestimmte Instanzgruppe zu sehen:
aws sagemaker list-cluster-events \ --cluster-name my-slurm-cluster \ --resource-type InstanceGroup \ --instance-group-name gpu-workers
Beschreibung eines bestimmten Ereignisses
Verwenden Sie den describe-cluster-event Befehl mit einer Ereignis-ID aus der Listenausgabe, um vollständige Ereignisdetails abzurufenEventLevel, einschließlichDescription, undEventMetadata:
aws sagemaker describe-cluster-event \ --cluster-name my-slurm-cluster \ --event-id 83ea0bb5-be77-45e8-a458-0a87f778a205
Die Struktur des zurückgegebenen Ereignisdatensatzes und eine Beschreibung der einzelnen Felder finden Sie Aufzeichnung der Cluster-Ereignisse in der HyperPod Cluster-Ereignisreferenz.
Automatisieren von Antworten mit Amazon EventBridge
HyperPod Cluster-Ereignisse werden automatisch EventBridge unter dem Detailtyp an Amazon gesendetSageMaker HyperPod Cluster Event, sodass Sie Ereignisse an Ziele wie Lambda, Amazon SNS, Step Functions oder Amazon SQS weiterleiten können. Sie können nach dem EventLevel Feld filtern, um Benachrichtigungen nur für Error Ereignisse auszulösen, oder nach Cluster-ARN filtern, um Regeln auf einen bestimmten Cluster zu beschränken.
EventBridge Ereignismuster, Payload-Beispiele sowie die zugehörigen Typen SageMaker
HyperPod Cluster State Change und SageMaker HyperPod Cluster Node
Health Event Detailtypen finden Sie EventBridge Integration in der Referenz zu HyperPod Cluster-Ereignissen.