

Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.

# SageMaker HyperPod Slurm-Cluster-Ereignisse
<a name="sagemaker-hyperpod-cluster-events-slurm-page"></a>

Amazon SageMaker HyperPod sendet strukturierte Cluster-Ereignisse aus, die Einblick in betriebliche Änderungen auf Cluster-, Instance-Gruppen- und Instance-Ebene bieten. Sie können diese Ereignisse verwenden, um die Bereitstellungsaktivitäten zu überwachen, Skalierungsvorgänge zu verfolgen, Fehler zu erkennen und automatische Warnungspipelines aufzubauen.

Cluster-Ereignisse sind für HyperPod Slurm-Cluster mit der Einstellung auf verfügbar. `NodeProvisioningMode` `Continuous` Auf Ereignisse kann über die `DescribeClusterEvent` APIs `ListClusterEvents` und, die SageMaker KI-Konsole und Amazon zugegriffen EventBridge werden.

Das vollständige Ereignisschema, die Schweregrade, den vollständigen Ereigniskatalog und Einzelheiten EventBridge zur Integration finden Sie unter[SageMaker HyperPod Referenz zu Cluster-Ereignissen](sagemaker-hyperpod-cluster-events-reference.md).

## Voraussetzungen
<a name="sagemaker-hyperpod-cluster-events-slurm-prereqs"></a>
+ Ihr HyperPod Slurm-Cluster muss auf `NodeProvisioningMode` eingestellt sein`Continuous`. Cluster, die den Legacy-Bereitstellungsmodus verwenden, senden keine strukturierten Ereignisse aus.
+ Um die API verwenden zu können, benötigen `sagemaker:ListClusterEvents` Sie die `sagemaker:DescribeClusterEvent` entsprechenden Berechtigungen in Ihrer IAM-Richtlinie.

## Event types (Ereignistypen)
<a name="sagemaker-hyperpod-cluster-events-slurm-types"></a>

HyperPod gibt bei kontinuierlicher Bereitstellung zwei Kategorien von Ereignissen für Slurm-Cluster aus: allgemeine Ereignisse, die für alle Orchestratoren gelten, und Ereignisse. Slurm-specific

**Häufige Ereignisse betreffen** zentrale Infrastrukturoperationen wie Instanzbereitstellung und -beendigung, Skalierung von Instanzgruppen, Verwaltung von Kapazitätsreservierungen, Ausführung von Lifecycle-Skripten, ENI-Management, FSx-Dateisystemlebenszyklus und Patch-Workflows. Die vollständige Liste finden Sie [Allgemeine Ereignisse (EKS und Slurm)](sagemaker-hyperpod-cluster-events-reference.md#sagemaker-hyperpod-cluster-events-common) in der Referenz zu Cluster-Ereignissen. HyperPod 

Slurm-specific Die **Ereignisse betreffen** orchestratorspezifische Operationen wie die Validierung von Bereitstellungsparametern, die Erstellung von Mungeschlüsseln, die Erkennung von Slurm-Konfigurationsabweichungen, die Slurm-Rekonfiguration und das Cluster-Rollback. Diese Ereignisse bieten Einblick in Slurm-specific Lebenszyklusphasen, die bisher nur anhand von Protokollen beobachtet werden konnten. CloudWatch Die vollständige Liste finden Sie [Slurm-specific Ereignisse](sagemaker-hyperpod-cluster-events-reference.md#sagemaker-hyperpod-cluster-events-slurm) in der Referenz zu HyperPod Cluster-Ereignissen.

## Ereignisse in der Konsole anzeigen
<a name="sagemaker-hyperpod-cluster-events-slurm-console"></a>

1. Öffnen Sie die [SageMaker AI-Konsole](https://console.aws.amazon.com/sagemaker).

1. Wählen Sie im linken Navigationsbereich **HyperPodCluster** aus.

1. Wählen Sie Ihren Clusternamen.

1. Wählen Sie die Registerkarte **Ereignisse** .

Auf der Registerkarte **Ereignisse** wird eine paginierte Liste von Ereignissen mit Spalten für die Ereignisebene, die Ereignis-ID, den Ressourcennamen, den Ressourcentyp, die Beschreibung und die Uhrzeit des Ereignisses angezeigt. Sie können Ereignisse mithilfe des Suchfeldes nach Attributen filtern, nach Ereigniszeit sortieren und eine Ereignis-ID auswählen, um die vollständigen Veranstaltungsdetails einschließlich der Ereignismetadaten und des vollständigen Ereignisdatensatzes anzuzeigen.

## Ereignisse auflisten mit dem AWS CLI
<a name="sagemaker-hyperpod-cluster-events-slurm-cli"></a>

Verwenden Sie den `list-cluster-events` Befehl, um Ereignisse für Ihren Cluster abzurufen:

```
aws sagemaker list-cluster-events \
    --cluster-name my-slurm-cluster \
    --sort-by EventTime \
    --sort-order Descending \
    --max-results 20
```

Sie können die Ergebnisse mithilfe der folgenden Filter eingrenzen:
+ `--resource-type`— filtern nach `Cluster``InstanceGroup`, oder`Instance`.
+ `--instance-group-name`— nach Ereignissen für eine bestimmte Instanzgruppe filtern.
+ `--node-id`— nach Ereignissen für eine bestimmte EC2-Instance filtern.
+ `--event-time-after`und `--event-time-before` — nach einem bestimmten Zeitfenster filtern.

Um beispielsweise nur Ereignisse auf Instanzgruppenebene für eine bestimmte Instanzgruppe zu sehen:

```
aws sagemaker list-cluster-events \
    --cluster-name my-slurm-cluster \
    --resource-type InstanceGroup \
    --instance-group-name gpu-workers
```

## Beschreibung eines bestimmten Ereignisses
<a name="sagemaker-hyperpod-cluster-events-slurm-describe"></a>

Verwenden Sie den `describe-cluster-event` Befehl mit einer Ereignis-ID aus der Listenausgabe, um vollständige Ereignisdetails abzurufen`EventLevel`, einschließlich`Description`, und`EventMetadata`:

```
aws sagemaker describe-cluster-event \
    --cluster-name my-slurm-cluster \
    --event-id 83ea0bb5-be77-45e8-a458-0a87f778a205
```

Die Struktur des zurückgegebenen Ereignisdatensatzes und eine Beschreibung der einzelnen Felder finden Sie [Aufzeichnung der Cluster-Ereignisse](sagemaker-hyperpod-cluster-events-reference.md#sagemaker-hyperpod-cluster-events-record) in der HyperPod Cluster-Ereignisreferenz.

## Automatisieren von Antworten mit Amazon EventBridge
<a name="sagemaker-hyperpod-cluster-events-slurm-eventbridge"></a>

HyperPod Cluster-Ereignisse werden automatisch EventBridge unter dem Detailtyp an Amazon gesendet`SageMaker HyperPod Cluster Event`, sodass Sie Ereignisse an Ziele wie Lambda, Amazon SNS, Step Functions oder Amazon SQS weiterleiten können. Sie können nach dem `EventLevel` Feld filtern, um Benachrichtigungen nur für `Error` Ereignisse auszulösen, oder nach Cluster-ARN filtern, um Regeln auf einen bestimmten Cluster zu beschränken.

 EventBridge Ereignismuster, Payload-Beispiele sowie die zugehörigen Typen `SageMaker HyperPod Cluster State Change` und `SageMaker HyperPod Cluster Node Health Event` Detailtypen finden Sie [EventBridge Integration](sagemaker-hyperpod-cluster-events-reference.md#sagemaker-hyperpod-cluster-events-eventbridge) in der Referenz zu HyperPod Cluster-Ereignissen.

## Verwandte Themen
<a name="sagemaker-hyperpod-cluster-events-slurm-related"></a>
+ [SageMaker HyperPod Referenz zu Cluster-Ereignissen](sagemaker-hyperpod-cluster-events-reference.md)
+ [Ereignisse, die Amazon SageMaker AI an Amazon sendet EventBridge](https://docs.aws.amazon.com/sagemaker/latest/dg/automating-sagemaker-with-eventbridge.html)