Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.
SageMaker HyperPod Événements du cluster Slurm
Amazon SageMaker HyperPod émet des événements de cluster structurés qui fournissent une visibilité sur les changements opérationnels au niveau du cluster, du groupe d'instances et de l'instance. Vous pouvez utiliser ces événements pour surveiller les activités de provisionnement, suivre les opérations de dimensionnement, détecter les défaillances et créer des pipelines d'alertes automatisés.
Les événements de cluster sont disponibles pour les clusters HyperPod Slurm NodeProvisioningMode définis sur. Continuous Les événements sont accessibles via les DescribeClusterEvent API ListClusterEvents and, la console SageMaker AI et Amazon EventBridge.
Pour le schéma complet des événements, les niveaux de gravité, le catalogue complet des événements et les détails de EventBridge l'intégration, consultezSageMaker HyperPod référence des événements du cluster.
Conditions préalables
-
Votre cluster HyperPod Slurm doit être
NodeProvisioningModeconfiguré sur.ContinuousLes clusters utilisant l'ancien mode de provisionnement n'émettent pas d'événements structurés. -
Pour utiliser l'API, vous devez disposer
sagemaker:ListClusterEventsd'sagemaker:DescribeClusterEventautorisations dans votre politique IAM.
Types d’événements
HyperPod émet deux catégories d'événements pour les clusters Slurm lors du provisionnement continu : les événements courants qui s'appliquent à tous les orchestrateurs et les événements. Slurm-specific
Les événements courants concernent les opérations d'infrastructure de base telles que le provisionnement et la résiliation des instances, le dimensionnement des groupes d'instances, la gestion des réservations de capacité, l'exécution de scripts de cycle de vie, la gestion ENI, le cycle de vie du système de fichiers FSx et les flux de travail d'application de correctifs. Pour la liste complète, voir Événements courants (EKS et Slurm) la référence des événements du HyperPod cluster.
Slurm-specific les événements couvrent les opérations spécifiques à l'orchestrateur, telles que la validation des paramètres de provisionnement, la création de clés munge, la détection des dérives de configuration de Slurm, la reconfiguration de Slurm et la restauration du cluster. Ces événements fournissent une visibilité sur les étapes Slurm-specific du cycle de vie qui n'étaient auparavant observables que par le biais de CloudWatch journaux. Pour la liste complète, voir Slurm-specific événements la référence des événements du HyperPod cluster.
Affichage des événements dans la console
-
Ouvrez la console SageMaker AI
. -
Dans le volet de navigation de gauche, sélectionnez HyperPodclusters.
-
Choisissez le nom de votre cluster.
-
Sélectionnez l’onglet Événements.
L'onglet Événements affiche une liste paginée d'événements avec des colonnes indiquant le niveau de l'événement, l'ID de l'événement, le nom de la ressource, le type de ressource, la description et l'heure de l'événement. Vous pouvez filtrer les événements par attribut à l'aide du champ de recherche, les trier par heure et choisir un ID d'événement pour voir tous les détails de l'événement, y compris les métadonnées de l'événement et l'enregistrement complet de l'événement.
Répertorier les événements en utilisant le AWS INTERFACE DE LIGNE DE COMMANDE (CLI)
Utilisez la list-cluster-events commande pour récupérer les événements de votre cluster :
aws sagemaker list-cluster-events \ --cluster-name my-slurm-cluster \ --sort-by EventTime \ --sort-order Descending \ --max-results 20
Vous pouvez affiner les résultats à l'aide des filtres suivants :
-
--resource-type— filtrer parClusterInstanceGroup, ouInstance. -
--instance-group-name— filtre les événements relatifs à un groupe d'instances spécifique. -
--node-id— filtre les événements relatifs à une instance EC2 spécifique. -
--event-time-afteret--event-time-before— filtrez sur une fenêtre temporelle spécifique.
Par exemple, pour afficher uniquement les événements au niveau du groupe d'instances pour un groupe d'instances spécifique :
aws sagemaker list-cluster-events \ --cluster-name my-slurm-cluster \ --resource-type InstanceGroup \ --instance-group-name gpu-workers
Décrire un événement spécifique
Utilisez la describe-cluster-event commande avec un ID d'événement issu de la sortie de la liste pour récupérer les détails complets de l'événementEventLevel, notamment lesDescription, et EventMetadata :
aws sagemaker describe-cluster-event \ --cluster-name my-slurm-cluster \ --event-id 83ea0bb5-be77-45e8-a458-0a87f778a205
Pour la structure de l'enregistrement d'événement renvoyé et une description de chaque champ, voir Enregistrement des événements du cluster la référence des événements du HyperPod cluster.
Automatiser les réponses avec Amazon EventBridge
HyperPod les événements de cluster sont automatiquement envoyés à Amazon EventBridge sous le type de détailSageMaker HyperPod Cluster Event, ce qui vous permet d'acheminer les événements vers des cibles telles que Lambda, Amazon SNS, Step Functions ou Amazon SQS. Vous pouvez filtrer sur le EventLevel terrain pour déclencher des alertes uniquement en cas d'Errorévénements, ou filtrer par ARN de cluster pour étendre les règles à un cluster spécifique.
Pour les modèles d' EventBridge événements, les exemples de charge utile et les types de SageMaker HyperPod Cluster Node
Health Event détail SageMaker
HyperPod Cluster State Change et connexes, reportez-vous EventBridge intégration à la référence des événements du HyperPod cluster.