View a markdown version of this page

SageMaker HyperPod référence des événements du cluster - Amazon SageMaker AI

Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.

SageMaker HyperPod référence des événements du cluster

Cette page fournit une référence complète de tous les événements structurés émis par les SageMaker HyperPod clusters Amazon. Les événements fournissent une visibilité sur les opérations au niveau du cluster, du groupe d'instances et de l'instance, notamment le provisionnement, le dimensionnement, l'application de correctifs et les modifications du cycle de vie spécifiques à l'orchestrateur.

Les événements de cluster sont disponibles pour les HyperPod clusters dont la valeur NodeProvisioningMode est définie surContinuous. Les événements sont accessibles via les DescribeClusterEvent API ListClusterEvents and, l'onglet Événements de la console SageMaker AI et Amazon EventBridge.

Enregistrement des événements du cluster

Chaque événement de cluster est représenté sous la forme d'un enregistrement structuré contenant des métadonnées d'identification, de calendrier, de portée, de gravité et spécifiques à l'opération. L'exemple suivant montre un enregistrement d'événement complet tel qu'il a été fourni via l'DescribeClusterEventAPI et Amazon EventBridge :

{ "version": "0", "id": "0bd4a141-0a02-9d8a-f977-3924c3fb259c", "detail-type": "SageMaker HyperPod Cluster Event", "source": "aws.sagemaker", "account": "111122223333", "time": "2026-06-01T17:20:25Z", "region": "us-west-2", "resources": [ "arn:aws:sagemaker:us-west-2:111122223333:cluster/sample-cluster" ], "detail": { "EventDetails": { "EventId": "83ea0bb5-be77-45e8-a458-0a87f778a205", "ClusterArn": "arn:aws:sagemaker:us-west-2:111122223333:cluster/sample-cluster", "ClusterName": "sample-cluster", "InstanceGroupName": "p5Inst", "InstanceId": "i-0391f86fa0fe0d465", "ResourceType": "Instance", "EventTime": 1748794825350, "EventLevel": "Error", "Description": "Instance creation in Cluster sample-cluster and InstanceGroup p5Inst failed", "EventDetails": { "EventMetadata": { "Instance": { "FailureMessage": "We currently do not have sufficient capacity to launch new ml.p5.48xlarge instances. Please try again.", "NodeLogicalId": "df268d19-f035-4f28-9b80-b956b92ae21e" } } } } } }

Champs d'enregistrement d'événements

L'objet detail.EventDetails comporte les champs suivants :

Champ Type Obligatoire Description
EventId Chaîne (UUID) Oui Identifiant unique de l'événement.
ClusterArn String Oui ARN du HyperPod cluster.
ClusterName String Oui Nom du HyperPod cluster.
EventTime Horodatage Oui Quand l'événement s'est produit (époque en millisecondes).
ResourceType String Oui Portée de l'événement : ClusterInstanceGroup, ouInstance.
EventLevel String Oui Classification de gravité : InfoWarn, ouError.
Description String Non Human-readable résumé de l'événement.
InstanceGroupName String Non Nom du groupe d'instances (présent quand ResourceType est InstanceGroup ouInstance).
InstanceId String Non ID d'instance EC2 (présent quand il l'ResourceTypeestInstance).
EventDetails Objet Non Métadonnées supplémentaires spécifiques au type de ressource et au fonctionnement.

Niveaux d'événements

Niveau Signification
Info L'opération s'est terminée avec succès ou progresse normalement.
Warn Opération terminée en raison d'un problème non critique ou d'une condition susceptible de nécessiter une attention future.
Error L'opération a échoué ou nécessite une attention immédiate.

Types de ressources

ResourceType Scope Exemples d’événements
Cluster Whole-cluster opérations Cluster creation/update démarré, échec de l'opération du cluster
InstanceGroup Opérations sur les groupes d'instances Dimensionnement started/completed, application de correctifs planifiée, cycle de vie de FSx
Instance Opérations sur des instances individuelles Provisionnement EC2, exécution de scripts de cycle de vie, gestion ENI, résiliation

EventDetails métadonnées

Les événements de cluster incluent un EventMetadata objet dans le EventDetails champ qui fournit un contexte spécifique à l'opération au-delà de ce que transmet la description de l'événement. Le contenu de EventMetadata varie en fonction du type de ressource et du type d'événement. Pour le schéma complet et les champs pris en charge, consultez EventMetadatale manuel Amazon SageMaker AI API Reference.

EventBridge champs d'enveloppe

Lorsqu'il est livré via Amazon EventBridge, l'enregistrement de l'événement est emballé dans l' EventBridge enveloppe standard :

Champ Description
version EventBridge version du schéma (toujours"0").
id ID EventBridge d'événement unique.
detail-type SageMaker HyperPod Cluster Event
source aws.sagemaker
account AWS ID de compte propriétaire du cluster.
time Horodatage ISO 8601 de l'événement.
region AWS Région dans laquelle réside le cluster.
resources Tableau contenant l'ARN du cluster.
detail Contient l'EventDetailsobjet décrit ci-dessus.

Événements courants (EKS et Slurm)

Les événements suivants sont émis pour tous les HyperPod clusters, quel que soit l'orchestrateur. La colonne Description indique la valeur du Description champ dans l'enregistrement d'événement tel qu'il apparaît dans la réponse de l'API et dans l'onglet Événements de la console.

Cycle de vie d'un cluster

Événement Description
L'opération du cluster a démarré Le cluster <cluster-name><operation>a démarré avec succès
Échec du démarrage de l'opération du cluster Impossible de démarrer le cluster <cluster-name><operation>
Opération du cluster terminée Cluster <cluster-name><operation>terminé avec succès
L'opération du cluster a échoué Le cluster <cluster-name><operation>a échoué

Cycle de vie des groupes d'instances

Événement Description
L'opération du groupe d'instances a démarré InstanceGroup <instance-group-name><operation>a démarré avec succès dans Cluster <cluster-name>
Échec du démarrage de l'opération du groupe d'instances Impossible de démarrer InstanceGroup <instance-group-name><operation>dans le cluster <cluster-name>
Opération de groupe d'instances terminée Le groupe d'instances <instance-group-name><operation>du cluster s'<cluster-name>est terminé avec succès
L'opération du groupe d'instances a échoué <instance-group-name><operation><cluster-name>Échec du groupe d'instances dans le cluster

Configuration réseau du groupe d'instances

Événement Description
Configuration réseau trouvée Sous-réseau trouvé <subnet-id>en AZ <availability-zone>avec SecurityGroupIds <security-group-ids>pour IG <instance-group-name>en cluster <cluster-name>
La configuration réseau a échoué Impossible de traiter les détails de configuration réseau du groupe d'instances pour IG <instance-group-name>dans le cluster <cluster-name>
Une dérogation d'AMI personnalisée a été détectée Un remplacement d'AMI personnalisé a été trouvé <ami-id>pour IG <instance-group-name>dans le cluster <cluster-name>
Le remplacement de l'AMI personnalisé a échoué Impossible de traiter les détails de remplacement de l'AMI personnalisé pour IG <instance-group-name>dans le cluster <cluster-name>
Configuration réseau de la plate-forme utilisée Utilisation de HyperPod la configuration réseau fournie par la plate-forme pour IG <instance-group-name>in Cluster <cluster-name>
Configuration réseau déterminée Configuration réseau du groupe d'instances déterminée avec succès pour IG <instance-group-name>in Cluster <cluster-name>

Création d'instance

Événement Description
L'opération de l'instance a démarré L'instance <operation>a démarré avec succès dans Cluster <cluster-name>et IG <instance-group-name>
Échec du démarrage de l'opération d'instance Impossible de démarrer l'instance <operation>dans le cluster <cluster-name>et l'IG <instance-group-name>
Réservation de capacité trouvée CapacityReservation ID trouvé <reservation-id>pour le cluster <cluster-name>et l'IG<instance-group-name>, en utilisant la capacité réservée
Réservation de capacité introuvable Aucun résultat n' CapacityReservation a été trouvé pour Cluster <cluster-name>et IG<instance-group-name>, en utilisant un pool à la demande
La configuration de la charge utile de l'instance a échoué Échec du traitement CapacityReservationDetails pour le cluster <cluster-name>et l'IG <instance-group-name>
Client créé par ENI Client ENI créé avec succès, par exemple dans Cluster <cluster-name>et IG <instance-group-name>
La création de l'ENI client a échoué Impossible de créer le client ENI, par exemple dans Cluster <cluster-name>et IG <instance-group-name>
Instance EC2 provisionnée <cluster-name>Instance EC2 <instance-id>correctement provisionnée dans Cluster et IG <instance-group-name>
La création de l'instance EC2 a échoué Impossible de provisionner l'instance EC2 dans le cluster <cluster-name>et l'IG <instance-group-name>
État du script Lifecycle mis à jour <instance-id>L'exécution du script du cycle de vie de l'instance pour l'instance EC2 a <status>
Échec de la mise à jour du statut du script Impossible de mettre à jour l'état d'exécution du script de cycle de vie de l'instance pour EC2InstanceId <instance-id>
Échec de la création de l'instance avec les journaux de cycle L'exécution du script du cycle de vie de l'instance pour l'instance EC2 <instance-id>a échoué. Pour consulter les journaux des scripts de cycle de vie, visitez le groupe de journaux...
Nettoyage ENI non utilisé réussi <cluster-name>Suppression réussie des ENI client inutilisés pour l'instance EC2 <instance-id>dans Cluster et IG <instance-group-name>
Le nettoyage ENI non utilisé a échoué <cluster-name>Impossible de supprimer les ENI client non utilisés pour l'instance EC2 <instance-id>dans le cluster et l'IG <instance-group-name>

Suppression d'instance

Événement Description
Fin de l'instance EC2 en cours La résiliation de l'instance EC2 <instance-id>est actuellement en cours dans Cluster <cluster-name>et IG <instance-group-name>
Échec de la fermeture de l'instance EC2 Impossible de mettre fin à l'instance EC2 <instance-id>dans le cluster <cluster-name>et l'IG <instance-group-name>
Le client ENI a été supprimé Le client ENI a été supprimé avec succès pour l'instance EC2 <instance-id>dans Cluster <cluster-name>et IG <instance-group-name>
La suppression de l'ENI client a échoué Impossible de supprimer l'ENI client pour l'instance EC2 <instance-id>dans le cluster <cluster-name>et l'IG <instance-group-name>

Redémarrage d’instance

Événement Description
Redémarrage de l'instance EC2 en cours Le redémarrage de l'instance EC2 <instance-id>est actuellement en cours sur Cluster <cluster-name>et IG <instance-group-name>
Echec de la demande de redémarrage de l'instance EC2 Impossible de soumettre la demande de redémarrage pour l'instance EC2 <instance-id>dans le cluster <cluster-name>et l'IG <instance-group-name>

Fonctionnement de l'instance (générique)

Événement Description
Opération d'instance terminée Instance <operation><instance-id>dans le cluster <cluster-name>et l'IG <instance-group-name>terminée avec succès
L'opération de l'instance a échoué L'instance <operation><instance-id>dans le cluster <cluster-name>et l'IG <instance-group-name>ont échoué

Remplacement d'instance

Événement Description
Le remplacement de l'instance a commencé <instance-id>L'instance démarre dans le cadre du remplacement de l'instance dans Cluster <cluster-name>et IG <instance-group-name>
Le démarrage du remplacement de l'instance a échoué L'instance <instance-id>n'a pas pu démarrer dans le cadre du remplacement de l'instance dans Cluster <cluster-name>et IG <instance-group-name>
Remplacement de l'instance terminé Instance <instance-id><operation>terminée avec succès dans le cadre du remplacement de l'instance dans Cluster <cluster-name>et IG <instance-group-name>
Le remplacement de l'instance a échoué L'instance <instance-id><operation>a échoué dans le cadre du remplacement de l'instance dans Cluster <cluster-name>et IG <instance-group-name>

Cycle de vie du système de fichiers FSx

Événement Description
La création de FSx a commencé <instance-group-name>Début de la création de FSx pour IG in Cluster <cluster-name>
La création de FSx a échoué <instance-group-name>Impossible de créer FSx pour IG dans le cluster <cluster-name>
Création de FSx terminée <instance-group-name>Création de FSx terminée avec succès pour IG in Cluster <cluster-name>
La suppression de FSx a commencé <instance-group-name>La suppression de FSx a commencé pour IG in Cluster <cluster-name>
La suppression de FSx a échoué <instance-group-name>Impossible de supprimer FSx pour IG dans le cluster <cluster-name>
Suppression de FSx terminée <instance-group-name>Suppression de FSx terminée avec succès pour IG in Cluster <cluster-name>
La mise à jour de FSx a commencé <instance-group-name>Mise à jour de FSx lancée pour IG in Cluster <cluster-name>
Échec de la mise à jour de FSx <instance-group-name>Impossible de mettre à jour FSx pour IG dans le cluster <cluster-name>
Mise à jour de FSx terminée <instance-group-name>La mise à jour de FSx s'est terminée avec succès pour IG in Cluster <cluster-name>

Application de correctifs (étapes courantes)

Ces événements de correction sont émis pour les clusters EKS et Slurm pendant les opérations. UpdateClusterSoftware

Événement Description
Application de correctifs aux groupes d'instances planifiée InstanceGroup <instance-group-name>in Cluster <cluster-name>a été programmé UpdateClusterSoftware au plus tard.
Le calendrier d'application des correctifs au groupe d'instances a échoué Impossible de planifier UpdateClusterSoftware IG <instance-group-name>dans le cluster<cluster-name>.
L'application de correctifs aux groupes d'instances a commencé UpdateClusterSoftware initié pour IG <instance-group-name>in Cluster en <cluster-name>utilisant <strategy>la stratégie.
Le démarrage de l'application des correctifs au groupe d'instances a échoué Impossible de démarrer UpdateClusterSoftware pour IG <instance-group-name>dans le cluster<cluster-name>.
Sélection du lot de correctifs suivant Prochain lot de mise à jour sélectionné pour IG <instance-group-name>in Cluster<cluster-name>.
Échec de la sélection du lot de correctifs suivant Impossible de sélectionner le lot de mise à jour suivant pour IG <instance-group-name>dans le cluster<cluster-name>.
Instances défaillantes mises en file d'attente pour remplacement Les instances défaillantes dans IG <instance-group-name>in Cluster ont été mises en <cluster-name>file d'attente pour le remplacement du nœud.
Échec de la mise en file d'attente de remplacement d'instance Impossible de mettre en file d'attente les instances pour le remplacement des nœuds dans IG <instance-group-name>in Cluster<cluster-name>.
L'application des correctifs au groupe d'instances est terminée UpdateClusterSoftware terminé avec succès pour IG <instance-group-name>in Cluster<cluster-name>.
La fin de l'application des correctifs au groupe d'instances a échoué Impossible de terminer UpdateClusterSoftware pour IG <instance-group-name>in Cluster<cluster-name>.
Le remplacement du volume racine a commencé Le remplacement du volume racine a commencé pour Instance <instance-id>dans IG<instance-group-name>.
Le remplacement du volume racine a échoué Impossible de démarrer le remplacement du volume racine pour l'instance <instance-id>dans IG<instance-group-name>.
L'application des correctifs à l'instance a réussi L'instance <instance-id>dans IG a <instance-group-name>été mise à jour avec succès.

EKS-specific événements

Les événements suivants sont émis uniquement pour les HyperPod clusters orchestrés avec Amazon EKS.

Gestion des entrées d'accès

Événement Description
Opération de saisie d'accès SLR réussie Entrée d'accès SLR <operation>réussie pour le cluster <cluster-name>
L'opération de saisie d'accès au SLR a échoué <operation>Échec de l'entrée d'accès SLR pour le cluster <cluster-name>
L'opération des entrées d'accès EKS a réussi Entrées d'accès EKS <operation>réussies pour le cluster <cluster-name>
L'opération des entrées d'accès EKS a échoué Les entrées d'accès EKS <operation>ont échoué pour le cluster <cluster-name>

Mises à jour de configuration de Kubernetes

Événement Description
Mise à jour de la configuration de Kubernetes réussie <cluster-name>Configuration Kubernetes mise à jour avec succès, par exemple <instance-id>dans Cluster et IG <instance-group-name>
La mise à jour de la configuration de Kubernetes a échoué <cluster-name>Impossible de mettre à jour la configuration de Kubernetes, par exemple <instance-id>dans Cluster et IG <instance-group-name>

Mise à l'échelle automatique de Karpenter

Événement Description
Opération de mise à l'échelle automatique réussie AutoScaling <operation><status>avec succès dans Cluster <cluster-name>
L'opération d'autoscaling a échoué Impossible de se <operation> AutoScaling connecter au cluster <cluster-name>
L'installation de Karpenter CRD a réussi CustomResourceDefinition installation terminée avec succès dans EKS Cluster <cluster-name>
L'installation de Karpenter CRD a échoué CustomResourceDefinition échec de l'installation pour EKS Cluster <cluster-name>
Mise à jour de la politique d'accès au reflex Karpenter réussie <operation>politiques d'accès avec entrée AmazonSageMakerHyperPodServiceRole d'accès <cluster-name>réussie dans le cluster EKS
Échec de la mise à jour de la politique d'accès au reflex Karpenter Impossible d'<operation>accéder aux politiques avec entrée AmazonSageMakerHyperPodServiceRole d'accès dans le cluster EKS <cluster-name>

Application de correctifs — au niveau de l'instance EKS

Événement Description
Préparation de l'application des correctifs à l'instance réussie Instance <instance-id>à IG <instance-group-name>bouclée et capsules expulsées.
Correctif d'instance ignoré (violation du PDB) UpdateClusterSoftware par exemple, <instance-id>dans IG, <instance-group-name>a été ignorée en raison d'une PodDisruptionBudget contrainte.
Échec de la préparation de l'application des correctifs à Impossible de préparer l'instance <instance-id>dans IG <instance-group-name>pour UpdateClusterSoftware.
Instance restaurée à l'état planifiable Instance <instance-id>dans IG <instance-group-name>restaurée à l'état planifiable.
Échec de la restauration de l'instance en mode planifiable Impossible de restaurer l'état <instance-id><instance-group-name>planifiable de l'instance dans IG.

Correctifs — EKS rollback

Événement Description
L'heure de cuisson a commencé La période de cuisson a commencé pour IG <instance-group-name>in Cluster<cluster-name>. Surveillance des alarmes [<alarm-names>] pendant <duration>quelques secondes.
Temps de cuisson terminé Période de cuisson terminée pour IG <instance-group-name>in Cluster<cluster-name>. Aucune alarme ne s'est déclenchée pendant la <duration>deuxième période de cuisson.
Alarme de temps de cuisson déclenchée La période de cuisson a échoué pour IG <instance-group-name>dans Cluster<cluster-name>. Les alarmes [<alarm-names>] sont passées à l'état ALARM. Lancement de la restauration automatique.
Echec de l'évaluation du temps de cuisson Impossible d'évaluer les alarmes pendant la période de cuisson pour IG <instance-group-name>dans le cluster<cluster-name>.
Annulation de l'application des correctifs aux groupes d'instances lancée UpdateClusterSoftware a échoué pour IG <instance-group-name>dans Cluster<cluster-name>. Lancer le rollback.
L'annulation de l'application des correctifs au groupe d'instances a échoué <cluster-name>Le rollback a échoué pour IG <instance-group-name>in Cluster. Certaines instances peuvent être en FailedMaintenance état.
Annulation de l'application des correctifs d'instance initiée L'instance <instance-id>dans IG <instance-group-name>n'a pas pu être mise à jour. Annulation initiée.
L'annulation de l'application des correctifs d'instance a réussi L'instance <instance-id>dans IG <instance-group-name>a été rétablie avec succès à l'AMI précédente.
L'annulation de l'application des correctifs à l'instance a échoué UpdateClusterSoftware <instance-group-name>le rollback a échoué par exemple <instance-id>dans IG.

Slurm-specific événements

Les événements suivants sont émis uniquement pour les HyperPod clusters orchestrés avec Slurm.

Événement Description
Paramètres de provisionnement trouvés Provisioning_parameters.json a été trouvé dans le chemin S3 pour le groupe de contrôleurs LifeCycleScript <instance-group-name>
Paramètres de provisionnement introuvables Aucun provisioning_parameters.json n'a été trouvé dans le chemin S3 pour le groupe de contrôleurs LifeCycleScript <instance-group-name>
Clé munge Slurm créée Clé munge créée et enregistrée avec succès
Validation de Slurm Drift réussie Validation de la dérive de configuration de Slurm réussie
Dérive du lisier détectée Dérive de configuration Slurm détectée : <drift-details>
Annulation du cluster Slurm terminée La création du cluster a échoué : le contrôleur et les nœuds de connexion ne sont pas devenus prêts dans le délai prévu
La reconfiguration de Slurm a réussi Slurm a été reconfiguré avec succès. Configuration de Slurm mise à jour pour correspondre à l'état souhaité

EventBridge intégration

HyperPod envoie des événements de cluster à Amazon EventBridge en utilisant trois types de détails :

Type de détail Description
SageMaker HyperPod Cluster Event Événements opérationnels pour le provisionnement, le dimensionnement, l'application de correctifs et les opérations spécifiques à l'orchestrateur. Inclut EventLevel le filtrage par gravité.
SageMaker HyperPod Cluster State Change Cluster-level transitions de statut (par exemple, Creating to InService). Inclut la configuration complète du cluster.
SageMaker HyperPod Cluster Node Health Event Événements de surveillance de l'état de HyperPod santé générés par le Health Monitoring Agent (HMA). Comprend l'état de santé, le motif, les mesures de réparation et les recommandations.

Exemples de modèles d'événements

Tous les événements HyperPod du cluster :

{ "source": ["aws.sagemaker"], "detail-type": ["SageMaker HyperPod Cluster Event"] }

Événements d'erreur uniquement (pour les alertes) :

{ "source": ["aws.sagemaker"], "detail-type": ["SageMaker HyperPod Cluster Event"], "detail": { "EventDetails": { "EventLevel": ["Error"] } } }

Événements pour un cluster spécifique :

{ "source": ["aws.sagemaker"], "detail-type": ["SageMaker HyperPod Cluster Event"], "resources": ["arn:aws:sagemaker:us-west-2:111122223333:cluster/my-cluster-id"] }

Événements liés à la santé des nœuds :

{ "source": ["aws.sagemaker"], "detail-type": ["SageMaker HyperPod Cluster Node Health Event"] }

Référence des API

Consultez aussi