Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.
SageMaker HyperPod référence des événements du cluster
Cette page fournit une référence complète de tous les événements structurés émis par les SageMaker HyperPod clusters Amazon. Les événements fournissent une visibilité sur les opérations au niveau du cluster, du groupe d'instances et de l'instance, notamment le provisionnement, le dimensionnement, l'application de correctifs et les modifications du cycle de vie spécifiques à l'orchestrateur.
Les événements de cluster sont disponibles pour les HyperPod clusters dont la valeur NodeProvisioningMode est définie surContinuous. Les événements sont accessibles via les DescribeClusterEvent API ListClusterEvents and, l'onglet Événements de la console SageMaker AI et Amazon EventBridge.
Enregistrement des événements du cluster
Chaque événement de cluster est représenté sous la forme d'un enregistrement structuré contenant des métadonnées d'identification, de calendrier, de portée, de gravité et spécifiques à l'opération. L'exemple suivant montre un enregistrement d'événement complet tel qu'il a été fourni via l'DescribeClusterEventAPI et Amazon EventBridge :
{ "version": "0", "id": "0bd4a141-0a02-9d8a-f977-3924c3fb259c", "detail-type": "SageMaker HyperPod Cluster Event", "source": "aws.sagemaker", "account": "111122223333", "time": "2026-06-01T17:20:25Z", "region": "us-west-2", "resources": [ "arn:aws:sagemaker:us-west-2:111122223333:cluster/sample-cluster" ], "detail": { "EventDetails": { "EventId": "83ea0bb5-be77-45e8-a458-0a87f778a205", "ClusterArn": "arn:aws:sagemaker:us-west-2:111122223333:cluster/sample-cluster", "ClusterName": "sample-cluster", "InstanceGroupName": "p5Inst", "InstanceId": "i-0391f86fa0fe0d465", "ResourceType": "Instance", "EventTime": 1748794825350, "EventLevel": "Error", "Description": "Instance creation in Cluster sample-cluster and InstanceGroup p5Inst failed", "EventDetails": { "EventMetadata": { "Instance": { "FailureMessage": "We currently do not have sufficient capacity to launch new ml.p5.48xlarge instances. Please try again.", "NodeLogicalId": "df268d19-f035-4f28-9b80-b956b92ae21e" } } } } } }
Champs d'enregistrement d'événements
L'objet detail.EventDetails comporte les champs suivants :
| Champ | Type | Obligatoire | Description |
|---|---|---|---|
EventId |
Chaîne (UUID) | Oui | Identifiant unique de l'événement. |
ClusterArn |
String | Oui | ARN du HyperPod cluster. |
ClusterName |
String | Oui | Nom du HyperPod cluster. |
EventTime |
Horodatage | Oui | Quand l'événement s'est produit (époque en millisecondes). |
ResourceType |
String | Oui | Portée de l'événement : ClusterInstanceGroup, ouInstance. |
EventLevel |
String | Oui | Classification de gravité : InfoWarn, ouError. |
Description |
String | Non | Human-readable résumé de l'événement. |
InstanceGroupName |
String | Non | Nom du groupe d'instances (présent quand ResourceType est InstanceGroup ouInstance). |
InstanceId |
String | Non | ID d'instance EC2 (présent quand il l'ResourceTypeestInstance). |
EventDetails |
Objet | Non | Métadonnées supplémentaires spécifiques au type de ressource et au fonctionnement. |
Niveaux d'événements
| Niveau | Signification |
|---|---|
Info |
L'opération s'est terminée avec succès ou progresse normalement. |
Warn |
Opération terminée en raison d'un problème non critique ou d'une condition susceptible de nécessiter une attention future. |
Error |
L'opération a échoué ou nécessite une attention immédiate. |
Types de ressources
| ResourceType | Scope | Exemples d’événements |
|---|---|---|
Cluster |
Whole-cluster opérations | Cluster creation/update démarré, échec de l'opération du cluster |
InstanceGroup |
Opérations sur les groupes d'instances | Dimensionnement started/completed, application de correctifs planifiée, cycle de vie de FSx |
Instance |
Opérations sur des instances individuelles | Provisionnement EC2, exécution de scripts de cycle de vie, gestion ENI, résiliation |
EventDetails métadonnées
Les événements de cluster incluent un EventMetadata objet dans le EventDetails champ qui fournit un contexte spécifique à l'opération au-delà de ce que transmet la description de l'événement. Le contenu de EventMetadata varie en fonction du type de ressource et du type d'événement. Pour le schéma complet et les champs pris en charge, consultez EventMetadatale manuel Amazon SageMaker AI API Reference.
EventBridge champs d'enveloppe
Lorsqu'il est livré via Amazon EventBridge, l'enregistrement de l'événement est emballé dans l' EventBridge enveloppe standard :
| Champ | Description |
|---|---|
version |
EventBridge version du schéma (toujours"0"). |
id |
ID EventBridge d'événement unique. |
detail-type |
SageMaker HyperPod Cluster Event |
source |
aws.sagemaker |
account |
AWS ID de compte propriétaire du cluster. |
time |
Horodatage ISO 8601 de l'événement. |
region |
AWS Région dans laquelle réside le cluster. |
resources |
Tableau contenant l'ARN du cluster. |
detail |
Contient l'EventDetailsobjet décrit ci-dessus. |
Événements courants (EKS et Slurm)
Les événements suivants sont émis pour tous les HyperPod clusters, quel que soit l'orchestrateur. La colonne Description indique la valeur du Description champ dans l'enregistrement d'événement tel qu'il apparaît dans la réponse de l'API et dans l'onglet Événements de la console.
Cycle de vie d'un cluster
| Événement | Description |
|---|---|
| L'opération du cluster a démarré | Le cluster <cluster-name><operation>a démarré avec succès |
| Échec du démarrage de l'opération du cluster | Impossible de démarrer le cluster <cluster-name><operation> |
| Opération du cluster terminée | Cluster <cluster-name><operation>terminé avec succès |
| L'opération du cluster a échoué | Le cluster <cluster-name><operation>a échoué |
Cycle de vie des groupes d'instances
| Événement | Description |
|---|---|
| L'opération du groupe d'instances a démarré | InstanceGroup <instance-group-name><operation>a démarré avec succès dans Cluster <cluster-name> |
| Échec du démarrage de l'opération du groupe d'instances | Impossible de démarrer InstanceGroup <instance-group-name><operation>dans le cluster <cluster-name> |
| Opération de groupe d'instances terminée | Le groupe d'instances <instance-group-name><operation>du cluster s'<cluster-name>est terminé avec succès |
| L'opération du groupe d'instances a échoué | <instance-group-name><operation><cluster-name>Échec du groupe d'instances dans le cluster |
Configuration réseau du groupe d'instances
| Événement | Description |
|---|---|
| Configuration réseau trouvée | Sous-réseau trouvé <subnet-id>en AZ <availability-zone>avec SecurityGroupIds <security-group-ids>pour IG <instance-group-name>en cluster <cluster-name> |
| La configuration réseau a échoué | Impossible de traiter les détails de configuration réseau du groupe d'instances pour IG <instance-group-name>dans le cluster <cluster-name> |
| Une dérogation d'AMI personnalisée a été détectée | Un remplacement d'AMI personnalisé a été trouvé <ami-id>pour IG <instance-group-name>dans le cluster <cluster-name> |
| Le remplacement de l'AMI personnalisé a échoué | Impossible de traiter les détails de remplacement de l'AMI personnalisé pour IG <instance-group-name>dans le cluster <cluster-name> |
| Configuration réseau de la plate-forme utilisée | Utilisation de HyperPod la configuration réseau fournie par la plate-forme pour IG <instance-group-name>in Cluster <cluster-name> |
| Configuration réseau déterminée | Configuration réseau du groupe d'instances déterminée avec succès pour IG <instance-group-name>in Cluster <cluster-name> |
Création d'instance
| Événement | Description |
|---|---|
| L'opération de l'instance a démarré | L'instance <operation>a démarré avec succès dans Cluster <cluster-name>et IG <instance-group-name> |
| Échec du démarrage de l'opération d'instance | Impossible de démarrer l'instance <operation>dans le cluster <cluster-name>et l'IG <instance-group-name> |
| Réservation de capacité trouvée | CapacityReservation ID trouvé <reservation-id>pour le cluster <cluster-name>et l'IG<instance-group-name>, en utilisant la capacité réservée |
| Réservation de capacité introuvable | Aucun résultat n' CapacityReservation a été trouvé pour Cluster <cluster-name>et IG<instance-group-name>, en utilisant un pool à la demande |
| La configuration de la charge utile de l'instance a échoué | Échec du traitement CapacityReservationDetails pour le cluster <cluster-name>et l'IG <instance-group-name> |
| Client créé par ENI | Client ENI créé avec succès, par exemple dans Cluster <cluster-name>et IG <instance-group-name> |
| La création de l'ENI client a échoué | Impossible de créer le client ENI, par exemple dans Cluster <cluster-name>et IG <instance-group-name> |
| Instance EC2 provisionnée | <cluster-name>Instance EC2 <instance-id>correctement provisionnée dans Cluster et IG <instance-group-name> |
| La création de l'instance EC2 a échoué | Impossible de provisionner l'instance EC2 dans le cluster <cluster-name>et l'IG <instance-group-name> |
| État du script Lifecycle mis à jour | <instance-id>L'exécution du script du cycle de vie de l'instance pour l'instance EC2 a <status> |
| Échec de la mise à jour du statut du script | Impossible de mettre à jour l'état d'exécution du script de cycle de vie de l'instance pour EC2InstanceId <instance-id> |
| Échec de la création de l'instance avec les journaux de cycle | L'exécution du script du cycle de vie de l'instance pour l'instance EC2 <instance-id>a échoué. Pour consulter les journaux des scripts de cycle de vie, visitez le groupe de journaux... |
| Nettoyage ENI non utilisé réussi | <cluster-name>Suppression réussie des ENI client inutilisés pour l'instance EC2 <instance-id>dans Cluster et IG <instance-group-name> |
| Le nettoyage ENI non utilisé a échoué | <cluster-name>Impossible de supprimer les ENI client non utilisés pour l'instance EC2 <instance-id>dans le cluster et l'IG <instance-group-name> |
Suppression d'instance
| Événement | Description |
|---|---|
| Fin de l'instance EC2 en cours | La résiliation de l'instance EC2 <instance-id>est actuellement en cours dans Cluster <cluster-name>et IG <instance-group-name> |
| Échec de la fermeture de l'instance EC2 | Impossible de mettre fin à l'instance EC2 <instance-id>dans le cluster <cluster-name>et l'IG <instance-group-name> |
| Le client ENI a été supprimé | Le client ENI a été supprimé avec succès pour l'instance EC2 <instance-id>dans Cluster <cluster-name>et IG <instance-group-name> |
| La suppression de l'ENI client a échoué | Impossible de supprimer l'ENI client pour l'instance EC2 <instance-id>dans le cluster <cluster-name>et l'IG <instance-group-name> |
Redémarrage d’instance
| Événement | Description |
|---|---|
| Redémarrage de l'instance EC2 en cours | Le redémarrage de l'instance EC2 <instance-id>est actuellement en cours sur Cluster <cluster-name>et IG <instance-group-name> |
| Echec de la demande de redémarrage de l'instance EC2 | Impossible de soumettre la demande de redémarrage pour l'instance EC2 <instance-id>dans le cluster <cluster-name>et l'IG <instance-group-name> |
Fonctionnement de l'instance (générique)
| Événement | Description |
|---|---|
| Opération d'instance terminée | Instance <operation><instance-id>dans le cluster <cluster-name>et l'IG <instance-group-name>terminée avec succès |
| L'opération de l'instance a échoué | L'instance <operation><instance-id>dans le cluster <cluster-name>et l'IG <instance-group-name>ont échoué |
Remplacement d'instance
| Événement | Description |
|---|---|
| Le remplacement de l'instance a commencé | <instance-id>L'instance démarre dans le cadre du remplacement de l'instance dans Cluster <cluster-name>et IG <instance-group-name> |
| Le démarrage du remplacement de l'instance a échoué | L'instance <instance-id>n'a pas pu démarrer dans le cadre du remplacement de l'instance dans Cluster <cluster-name>et IG <instance-group-name> |
| Remplacement de l'instance terminé | Instance <instance-id><operation>terminée avec succès dans le cadre du remplacement de l'instance dans Cluster <cluster-name>et IG <instance-group-name> |
| Le remplacement de l'instance a échoué | L'instance <instance-id><operation>a échoué dans le cadre du remplacement de l'instance dans Cluster <cluster-name>et IG <instance-group-name> |
Cycle de vie du système de fichiers FSx
| Événement | Description |
|---|---|
| La création de FSx a commencé | <instance-group-name>Début de la création de FSx pour IG in Cluster <cluster-name> |
| La création de FSx a échoué | <instance-group-name>Impossible de créer FSx pour IG dans le cluster <cluster-name> |
| Création de FSx terminée | <instance-group-name>Création de FSx terminée avec succès pour IG in Cluster <cluster-name> |
| La suppression de FSx a commencé | <instance-group-name>La suppression de FSx a commencé pour IG in Cluster <cluster-name> |
| La suppression de FSx a échoué | <instance-group-name>Impossible de supprimer FSx pour IG dans le cluster <cluster-name> |
| Suppression de FSx terminée | <instance-group-name>Suppression de FSx terminée avec succès pour IG in Cluster <cluster-name> |
| La mise à jour de FSx a commencé | <instance-group-name>Mise à jour de FSx lancée pour IG in Cluster <cluster-name> |
| Échec de la mise à jour de FSx | <instance-group-name>Impossible de mettre à jour FSx pour IG dans le cluster <cluster-name> |
| Mise à jour de FSx terminée | <instance-group-name>La mise à jour de FSx s'est terminée avec succès pour IG in Cluster <cluster-name> |
Application de correctifs (étapes courantes)
Ces événements de correction sont émis pour les clusters EKS et Slurm pendant les opérations. UpdateClusterSoftware
| Événement | Description |
|---|---|
| Application de correctifs aux groupes d'instances planifiée | InstanceGroup <instance-group-name>in Cluster <cluster-name>a été programmé UpdateClusterSoftware au plus tard. |
| Le calendrier d'application des correctifs au groupe d'instances a échoué | Impossible de planifier UpdateClusterSoftware IG <instance-group-name>dans le cluster<cluster-name>. |
| L'application de correctifs aux groupes d'instances a commencé | UpdateClusterSoftware initié pour IG <instance-group-name>in Cluster en <cluster-name>utilisant <strategy>la stratégie. |
| Le démarrage de l'application des correctifs au groupe d'instances a échoué | Impossible de démarrer UpdateClusterSoftware pour IG <instance-group-name>dans le cluster<cluster-name>. |
| Sélection du lot de correctifs suivant | Prochain lot de mise à jour sélectionné pour IG <instance-group-name>in Cluster<cluster-name>. |
| Échec de la sélection du lot de correctifs suivant | Impossible de sélectionner le lot de mise à jour suivant pour IG <instance-group-name>dans le cluster<cluster-name>. |
| Instances défaillantes mises en file d'attente pour remplacement | Les instances défaillantes dans IG <instance-group-name>in Cluster ont été mises en <cluster-name>file d'attente pour le remplacement du nœud. |
| Échec de la mise en file d'attente de remplacement d'instance | Impossible de mettre en file d'attente les instances pour le remplacement des nœuds dans IG <instance-group-name>in Cluster<cluster-name>. |
| L'application des correctifs au groupe d'instances est terminée | UpdateClusterSoftware terminé avec succès pour IG <instance-group-name>in Cluster<cluster-name>. |
| La fin de l'application des correctifs au groupe d'instances a échoué | Impossible de terminer UpdateClusterSoftware pour IG <instance-group-name>in Cluster<cluster-name>. |
| Le remplacement du volume racine a commencé | Le remplacement du volume racine a commencé pour Instance <instance-id>dans IG<instance-group-name>. |
| Le remplacement du volume racine a échoué | Impossible de démarrer le remplacement du volume racine pour l'instance <instance-id>dans IG<instance-group-name>. |
| L'application des correctifs à l'instance a réussi | L'instance <instance-id>dans IG a <instance-group-name>été mise à jour avec succès. |
EKS-specific événements
Les événements suivants sont émis uniquement pour les HyperPod clusters orchestrés avec Amazon EKS.
Gestion des entrées d'accès
| Événement | Description |
|---|---|
| Opération de saisie d'accès SLR réussie | Entrée d'accès SLR <operation>réussie pour le cluster <cluster-name> |
| L'opération de saisie d'accès au SLR a échoué | <operation>Échec de l'entrée d'accès SLR pour le cluster <cluster-name> |
| L'opération des entrées d'accès EKS a réussi | Entrées d'accès EKS <operation>réussies pour le cluster <cluster-name> |
| L'opération des entrées d'accès EKS a échoué | Les entrées d'accès EKS <operation>ont échoué pour le cluster <cluster-name> |
Mises à jour de configuration de Kubernetes
| Événement | Description |
|---|---|
| Mise à jour de la configuration de Kubernetes réussie | <cluster-name>Configuration Kubernetes mise à jour avec succès, par exemple <instance-id>dans Cluster et IG <instance-group-name> |
| La mise à jour de la configuration de Kubernetes a échoué | <cluster-name>Impossible de mettre à jour la configuration de Kubernetes, par exemple <instance-id>dans Cluster et IG <instance-group-name> |
Mise à l'échelle automatique de Karpenter
| Événement | Description |
|---|---|
| Opération de mise à l'échelle automatique réussie | AutoScaling <operation><status>avec succès dans Cluster <cluster-name> |
| L'opération d'autoscaling a échoué | Impossible de se <operation> AutoScaling connecter au cluster <cluster-name> |
| L'installation de Karpenter CRD a réussi | CustomResourceDefinition installation terminée avec succès dans EKS Cluster <cluster-name> |
| L'installation de Karpenter CRD a échoué | CustomResourceDefinition échec de l'installation pour EKS Cluster <cluster-name> |
| Mise à jour de la politique d'accès au reflex Karpenter réussie | <operation>politiques d'accès avec entrée AmazonSageMakerHyperPodServiceRole d'accès <cluster-name>réussie dans le cluster EKS |
| Échec de la mise à jour de la politique d'accès au reflex Karpenter | Impossible d'<operation>accéder aux politiques avec entrée AmazonSageMakerHyperPodServiceRole d'accès dans le cluster EKS <cluster-name> |
Application de correctifs — au niveau de l'instance EKS
| Événement | Description |
|---|---|
| Préparation de l'application des correctifs à l'instance réussie | Instance <instance-id>à IG <instance-group-name>bouclée et capsules expulsées. |
| Correctif d'instance ignoré (violation du PDB) | UpdateClusterSoftware par exemple, <instance-id>dans IG, <instance-group-name>a été ignorée en raison d'une PodDisruptionBudget contrainte. |
| Échec de la préparation de l'application des correctifs à | Impossible de préparer l'instance <instance-id>dans IG <instance-group-name>pour UpdateClusterSoftware. |
| Instance restaurée à l'état planifiable | Instance <instance-id>dans IG <instance-group-name>restaurée à l'état planifiable. |
| Échec de la restauration de l'instance en mode planifiable | Impossible de restaurer l'état <instance-id><instance-group-name>planifiable de l'instance dans IG. |
Correctifs — EKS rollback
| Événement | Description |
|---|---|
| L'heure de cuisson a commencé | La période de cuisson a commencé pour IG <instance-group-name>in Cluster<cluster-name>. Surveillance des alarmes [<alarm-names>] pendant <duration>quelques secondes. |
| Temps de cuisson terminé | Période de cuisson terminée pour IG <instance-group-name>in Cluster<cluster-name>. Aucune alarme ne s'est déclenchée pendant la <duration>deuxième période de cuisson. |
| Alarme de temps de cuisson déclenchée | La période de cuisson a échoué pour IG <instance-group-name>dans Cluster<cluster-name>. Les alarmes [<alarm-names>] sont passées à l'état ALARM. Lancement de la restauration automatique. |
| Echec de l'évaluation du temps de cuisson | Impossible d'évaluer les alarmes pendant la période de cuisson pour IG <instance-group-name>dans le cluster<cluster-name>. |
| Annulation de l'application des correctifs aux groupes d'instances lancée | UpdateClusterSoftware a échoué pour IG <instance-group-name>dans Cluster<cluster-name>. Lancer le rollback. |
| L'annulation de l'application des correctifs au groupe d'instances a échoué | <cluster-name>Le rollback a échoué pour IG <instance-group-name>in Cluster. Certaines instances peuvent être en FailedMaintenance état. |
| Annulation de l'application des correctifs d'instance initiée | L'instance <instance-id>dans IG <instance-group-name>n'a pas pu être mise à jour. Annulation initiée. |
| L'annulation de l'application des correctifs d'instance a réussi | L'instance <instance-id>dans IG <instance-group-name>a été rétablie avec succès à l'AMI précédente. |
| L'annulation de l'application des correctifs à l'instance a échoué | UpdateClusterSoftware <instance-group-name>le rollback a échoué par exemple <instance-id>dans IG. |
Slurm-specific événements
Les événements suivants sont émis uniquement pour les HyperPod clusters orchestrés avec Slurm.
| Événement | Description |
|---|---|
| Paramètres de provisionnement trouvés | Provisioning_parameters.json a été trouvé dans le chemin S3 pour le groupe de contrôleurs LifeCycleScript <instance-group-name> |
| Paramètres de provisionnement introuvables | Aucun provisioning_parameters.json n'a été trouvé dans le chemin S3 pour le groupe de contrôleurs LifeCycleScript <instance-group-name> |
| Clé munge Slurm créée | Clé munge créée et enregistrée avec succès |
| Validation de Slurm Drift réussie | Validation de la dérive de configuration de Slurm réussie |
| Dérive du lisier détectée | Dérive de configuration Slurm détectée : <drift-details> |
| Annulation du cluster Slurm terminée | La création du cluster a échoué : le contrôleur et les nœuds de connexion ne sont pas devenus prêts dans le délai prévu |
| La reconfiguration de Slurm a réussi | Slurm a été reconfiguré avec succès. Configuration de Slurm mise à jour pour correspondre à l'état souhaité |
EventBridge intégration
HyperPod envoie des événements de cluster à Amazon EventBridge en utilisant trois types de détails :
| Type de détail | Description |
|---|---|
SageMaker HyperPod Cluster Event |
Événements opérationnels pour le provisionnement, le dimensionnement, l'application de correctifs et les opérations spécifiques à l'orchestrateur. Inclut EventLevel le filtrage par gravité. |
SageMaker HyperPod Cluster State Change |
Cluster-level transitions de statut (par exemple, Creating to InService). Inclut la configuration complète du cluster. |
SageMaker HyperPod Cluster Node Health
Event |
Événements de surveillance de l'état de HyperPod santé générés par le Health Monitoring Agent (HMA). Comprend l'état de santé, le motif, les mesures de réparation et les recommandations. |
Exemples de modèles d'événements
Tous les événements HyperPod du cluster :
{ "source": ["aws.sagemaker"], "detail-type": ["SageMaker HyperPod Cluster Event"] }
Événements d'erreur uniquement (pour les alertes) :
{ "source": ["aws.sagemaker"], "detail-type": ["SageMaker HyperPod Cluster Event"], "detail": { "EventDetails": { "EventLevel": ["Error"] } } }
Événements pour un cluster spécifique :
{ "source": ["aws.sagemaker"], "detail-type": ["SageMaker HyperPod Cluster Event"], "resources": ["arn:aws:sagemaker:us-west-2:111122223333:cluster/my-cluster-id"] }
Événements liés à la santé des nœuds :
{ "source": ["aws.sagemaker"], "detail-type": ["SageMaker HyperPod Cluster Node Health Event"] }
Référence des API
-
ListClusterEvents— Répertoriez les événements avec filtrage, tri et pagination
-
DescribeClusterEvent— Obtenez tous les détails d'un événement spécifique
-
ClusterEventSummary— Type de données récapitulatif de l'événement
-
ClusterEventDetail— Type de données détaillées de l'événement
Consultez aussi
-
SageMaker HyperPod Événements du cluster Slurm— Événements du cluster Slurm avec utilisation de la CLI et scénarios courants
-
SageMaker HyperPod Événements du cluster EKS— Événements du cluster EKS avec utilisation de la CLI et scénarios courants