View a markdown version of this page

SageMaker HyperPod EKS-Cluster-Ereignisse - Amazon SageMaker KI

Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.

SageMaker HyperPod EKS-Cluster-Ereignisse

Amazon SageMaker HyperPod sendet strukturierte Cluster-Ereignisse aus, die Einblick in betriebliche Änderungen auf Cluster-, Instance-Gruppen- und Instance-Ebene bieten. Sie können diese Ereignisse verwenden, um die Bereitstellungsaktivitäten zu überwachen, Skalierungsvorgänge zu verfolgen, Fehler zu erkennen und automatische Warnungspipelines aufzubauen.

Clusterereignisse sind für HyperPod EKS-Cluster mit NodeProvisioningMode der Einstellung auf verfügbar. Continuous Auf Ereignisse kann über die DescribeClusterEvent APIs ListClusterEvents und, die SageMaker KI-Konsole und Amazon zugegriffen EventBridge werden.

Das vollständige Ereignisschema, die Schweregrade, den vollständigen Ereigniskatalog und Einzelheiten EventBridge zur Integration finden Sie unterSageMaker HyperPod Referenz zu Cluster-Ereignissen.

Voraussetzungen

  • Ihr HyperPod EKS-Cluster muss auf NodeProvisioningMode eingestellt seinContinuous. Cluster, die den Legacy-Bereitstellungsmodus verwenden, geben keine strukturierten Ereignisse aus.

  • Um die API verwenden zu können, benötigen sagemaker:ListClusterEvents Sie die sagemaker:DescribeClusterEvent entsprechenden Berechtigungen in Ihrer IAM-Richtlinie.

Event types (Ereignistypen)

HyperPod gibt bei kontinuierlicher Bereitstellung zwei Kategorien von Ereignissen für EKS-Cluster aus: allgemeine Ereignisse, die für alle Orchestratoren gelten, und Ereignisse. EKS-specific

Häufige Ereignisse betreffen zentrale Infrastrukturoperationen wie Instanzbereitstellung und -beendigung, Skalierung von Instanzgruppen, Verwaltung von Kapazitätsreservierungen, Ausführung von Lifecycle-Skripten, ENI-Management, FSx-Dateisystemlebenszyklus und Patch-Workflows. Die vollständige Liste finden Sie Allgemeine Ereignisse (EKS und Slurm) in der Referenz zu Cluster-Ereignissen. HyperPod

EKS-specific Die Ereignisse umfassen orchestratorspezifische Operationen wie die Verwaltung von EKS-Zugriffseinträgen, Kubernetes-Konfigurationsupdates (Labels und Taints), den Karpenter-Autoscaling-Lebenszyklus, die Pod-Entfernung und während des Patchens sowie cordon/uncordon die Überwachung von Backzeitalarmen mit automatischem Rollback. Diese Ereignisse bieten Einblick in Lebenszyklusphasen, die bisher nur anhand von Protokollen beobachtet werden konnten. EKS-specific CloudWatch Die vollständige Liste finden Sie EKS-specific Ereignisse in der Referenz zu HyperPod Cluster-Ereignissen.

Ereignisse in der Konsole anzeigen

  1. Öffnen Sie die SageMaker AI-Konsole.

  2. Wählen Sie im linken Navigationsbereich HyperPodCluster aus.

  3. Wählen Sie Ihren Clusternamen.

  4. Wählen Sie die Registerkarte Ereignisse .

Auf der Registerkarte Ereignisse wird eine paginierte Liste von Ereignissen mit Spalten für die Ereignisebene, die Ereignis-ID, den Ressourcennamen, den Ressourcentyp, die Beschreibung und die Uhrzeit des Ereignisses angezeigt. Sie können Ereignisse mithilfe des Suchfeldes nach Attributen filtern, nach Ereigniszeit sortieren und eine Ereignis-ID auswählen, um die vollständigen Veranstaltungsdetails einschließlich der Ereignismetadaten und des vollständigen Ereignisdatensatzes anzuzeigen.

Ereignisse auflisten mit dem AWS CLI

Verwenden Sie den list-cluster-events Befehl, um Ereignisse für Ihren Cluster abzurufen:

aws sagemaker list-cluster-events \ --cluster-name my-eks-cluster \ --sort-by EventTime \ --sort-order Descending \ --max-results 20

Sie können die Ergebnisse mithilfe der folgenden Filter eingrenzen:

  • --resource-type— filtern nach ClusterInstanceGroup, oderInstance.

  • --instance-group-name— nach Ereignissen für eine bestimmte Instanzgruppe filtern.

  • --node-id— nach Ereignissen für eine bestimmte EC2-Instance filtern.

  • --event-time-afterund --event-time-before — nach einem bestimmten Zeitfenster filtern.

Um beispielsweise nur Ereignisse auf Instanzgruppenebene für eine bestimmte Instanzgruppe zu sehen:

aws sagemaker list-cluster-events \ --cluster-name my-eks-cluster \ --resource-type InstanceGroup \ --instance-group-name gpu-workers

Beschreibung eines bestimmten Ereignisses

Verwenden Sie den describe-cluster-event Befehl mit einer Ereignis-ID aus der Listenausgabe, um vollständige Ereignisdetails abzurufen, einschließlich der EventLevelDescription, undEventMetadata:

aws sagemaker describe-cluster-event \ --cluster-name my-eks-cluster \ --event-id 83ea0bb5-be77-45e8-a458-0a87f778a205

Die Struktur des zurückgegebenen Ereignisdatensatzes und eine Beschreibung der einzelnen Felder finden Sie Aufzeichnung der Cluster-Ereignisse in der HyperPod Cluster-Ereignisreferenz.

Automatisieren von Antworten mit Amazon EventBridge

HyperPod Cluster-Ereignisse werden automatisch EventBridge unter dem Detailtyp an Amazon gesendetSageMaker HyperPod Cluster Event, sodass Sie Ereignisse an Ziele wie Lambda, Amazon SNS, Step Functions oder Amazon SQS weiterleiten können. Sie können nach dem EventLevel Feld filtern, um Benachrichtigungen nur für Error Ereignisse auszulösen, oder nach Cluster-ARN filtern, um Regeln auf einen bestimmten Cluster zu beschränken.

EventBridge Ereignismuster, Payload-Beispiele sowie die zugehörigen Typen SageMaker HyperPod Cluster State Change und SageMaker HyperPod Cluster Node Health Event Detailtypen finden Sie EventBridge Integration in der Referenz zu HyperPod Cluster-Ereignissen.