

Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.

# SageMaker HyperPod Événements du cluster Slurm
<a name="sagemaker-hyperpod-cluster-events-slurm-page"></a>

Amazon SageMaker HyperPod émet des événements de cluster structurés qui fournissent une visibilité sur les changements opérationnels au niveau du cluster, du groupe d'instances et de l'instance. Vous pouvez utiliser ces événements pour surveiller les activités de provisionnement, suivre les opérations de dimensionnement, détecter les défaillances et créer des pipelines d'alertes automatisés.

Les événements de cluster sont disponibles pour les clusters HyperPod Slurm `NodeProvisioningMode` définis sur. `Continuous` Les événements sont accessibles via les `DescribeClusterEvent` API `ListClusterEvents` and, la console SageMaker AI et Amazon EventBridge.

Pour le schéma complet des événements, les niveaux de gravité, le catalogue complet des événements et les détails de EventBridge l'intégration, consultez[SageMaker HyperPod référence des événements du cluster](sagemaker-hyperpod-cluster-events-reference.md).

## Conditions préalables
<a name="sagemaker-hyperpod-cluster-events-slurm-prereqs"></a>
+ Votre cluster HyperPod Slurm doit être `NodeProvisioningMode` configuré sur. `Continuous` Les clusters utilisant l'ancien mode de provisionnement n'émettent pas d'événements structurés.
+ Pour utiliser l'API, vous devez disposer `sagemaker:ListClusterEvents` d'`sagemaker:DescribeClusterEvent`autorisations dans votre politique IAM.

## Types d’événements
<a name="sagemaker-hyperpod-cluster-events-slurm-types"></a>

HyperPod émet deux catégories d'événements pour les clusters Slurm lors du provisionnement continu : les événements courants qui s'appliquent à tous les orchestrateurs et les événements. Slurm-specific

**Les événements courants concernent les** opérations d'infrastructure de base telles que le provisionnement et la résiliation des instances, le dimensionnement des groupes d'instances, la gestion des réservations de capacité, l'exécution de scripts de cycle de vie, la gestion ENI, le cycle de vie du système de fichiers FSx et les flux de travail d'application de correctifs. Pour la liste complète, voir [Événements courants (EKS et Slurm)](sagemaker-hyperpod-cluster-events-reference.md#sagemaker-hyperpod-cluster-events-common) la référence des événements du HyperPod cluster.

**Slurm-specific les événements couvrent les** opérations spécifiques à l'orchestrateur, telles que la validation des paramètres de provisionnement, la création de clés munge, la détection des dérives de configuration de Slurm, la reconfiguration de Slurm et la restauration du cluster. Ces événements fournissent une visibilité sur les étapes Slurm-specific du cycle de vie qui n'étaient auparavant observables que par le biais de CloudWatch journaux. Pour la liste complète, voir [Slurm-specific événements](sagemaker-hyperpod-cluster-events-reference.md#sagemaker-hyperpod-cluster-events-slurm) la référence des événements du HyperPod cluster.

## Affichage des événements dans la console
<a name="sagemaker-hyperpod-cluster-events-slurm-console"></a>

1. Ouvrez la [console SageMaker AI](https://console.aws.amazon.com/sagemaker).

1. Dans le volet de navigation de gauche, sélectionnez **HyperPodclusters**.

1. Choisissez le nom de votre cluster.

1. Sélectionnez l’onglet **Événements**.

L'onglet **Événements** affiche une liste paginée d'événements avec des colonnes indiquant le niveau de l'événement, l'ID de l'événement, le nom de la ressource, le type de ressource, la description et l'heure de l'événement. Vous pouvez filtrer les événements par attribut à l'aide du champ de recherche, les trier par heure et choisir un ID d'événement pour voir tous les détails de l'événement, y compris les métadonnées de l'événement et l'enregistrement complet de l'événement.

## Répertorier les événements en utilisant le AWS INTERFACE DE LIGNE DE COMMANDE (CLI)
<a name="sagemaker-hyperpod-cluster-events-slurm-cli"></a>

Utilisez la `list-cluster-events` commande pour récupérer les événements de votre cluster :

```
aws sagemaker list-cluster-events \
    --cluster-name my-slurm-cluster \
    --sort-by EventTime \
    --sort-order Descending \
    --max-results 20
```

Vous pouvez affiner les résultats à l'aide des filtres suivants :
+ `--resource-type`— filtrer par `Cluster``InstanceGroup`, ou`Instance`.
+ `--instance-group-name`— filtre les événements relatifs à un groupe d'instances spécifique.
+ `--node-id`— filtre les événements relatifs à une instance EC2 spécifique.
+ `--event-time-after`et `--event-time-before` — filtrez sur une fenêtre temporelle spécifique.

Par exemple, pour afficher uniquement les événements au niveau du groupe d'instances pour un groupe d'instances spécifique :

```
aws sagemaker list-cluster-events \
    --cluster-name my-slurm-cluster \
    --resource-type InstanceGroup \
    --instance-group-name gpu-workers
```

## Décrire un événement spécifique
<a name="sagemaker-hyperpod-cluster-events-slurm-describe"></a>

Utilisez la `describe-cluster-event` commande avec un ID d'événement issu de la sortie de la liste pour récupérer les détails complets de l'événement`EventLevel`, notamment les`Description`, et `EventMetadata` :

```
aws sagemaker describe-cluster-event \
    --cluster-name my-slurm-cluster \
    --event-id 83ea0bb5-be77-45e8-a458-0a87f778a205
```

Pour la structure de l'enregistrement d'événement renvoyé et une description de chaque champ, voir [Enregistrement des événements du cluster](sagemaker-hyperpod-cluster-events-reference.md#sagemaker-hyperpod-cluster-events-record) la référence des événements du HyperPod cluster.

## Automatiser les réponses avec Amazon EventBridge
<a name="sagemaker-hyperpod-cluster-events-slurm-eventbridge"></a>

HyperPod les événements de cluster sont automatiquement envoyés à Amazon EventBridge sous le type de détail`SageMaker HyperPod Cluster Event`, ce qui vous permet d'acheminer les événements vers des cibles telles que Lambda, Amazon SNS, Step Functions ou Amazon SQS. Vous pouvez filtrer sur le `EventLevel` terrain pour déclencher des alertes uniquement en cas d'`Error`événements, ou filtrer par ARN de cluster pour étendre les règles à un cluster spécifique.

Pour les modèles d' EventBridge événements, les exemples de charge utile et les types de `SageMaker HyperPod Cluster Node Health Event` détail `SageMaker HyperPod Cluster State Change` et connexes, reportez-vous [EventBridge intégration](sagemaker-hyperpod-cluster-events-reference.md#sagemaker-hyperpod-cluster-events-eventbridge) à la référence des événements du HyperPod cluster.

## Rubriques en relation
<a name="sagemaker-hyperpod-cluster-events-slurm-related"></a>
+ [SageMaker HyperPod référence des événements du cluster](sagemaker-hyperpod-cluster-events-reference.md)
+ [Événements qu'Amazon SageMaker AI envoie à Amazon EventBridge](https://docs.aws.amazon.com/sagemaker/latest/dg/automating-sagemaker-with-eventbridge.html)