Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.
Système de surveillance de la santé
SageMaker HyperPod le système de surveillance de la santé comprend deux composants
-
Les agents de surveillance installés sur vos nœuds, notamment l'agent de surveillance de l'état (HMA) qui sert de moniteur de santé sur l'hôte et un ensemble de moniteurs de santé hors nœud.
-
Système de restauration de nœuds géré par SageMaker HyperPod. Le système de surveillance de l'état de santé surveillera en permanence l'état de santé du nœud via des agents de surveillance, puis prendra des mesures automatiquement lorsqu'un défaut est détecté à l'aide du système de restauration des nœuds.
Contrôles de santé effectués par l'agent de SageMaker HyperPod surveillance de la santé
L'agent SageMaker HyperPod de surveillance de la santé vérifie les points suivants.
GPU NVIDIA
-
Erreurs dans la sortie
nvidia-smi -
Diverses erreurs dans les journaux générés par la plateforme Amazon Elastic Cloud (EC2)
-
Validation du nombre de GPU : en cas de décalage entre le nombre attendu de GPU dans un type d'instance particulier (par exemple : 8 GPU dans le type d'instance ml.p5.48xlarge) et le nombre renvoyé par, HMA redémarre le nœud
nvidia-smi
AWS Trainium
-
Erreurs dans la sortie du moniteur AWS Neuron
-
Sorties générées par le détecteur de problèmes de nœuds Neuron (Pour plus d'informations sur le détecteur de problèmes de nœuds AWS Neuron, voir Détection et restauration des problèmes de nœuds pour les nœuds AWS Neuron au sein des clusters Amazon EKS.)
-
Diverses erreurs dans les journaux générés par la plateforme Amazon EC2
-
Validation du nombre de périphériques neuronaux : en cas de décalage entre le nombre réel de périphériques neuronaux dans un type d'instance particulier et le nombre renvoyé par
neuron-ls, HMA redémarre le nœud
Les vérifications ci-dessus sont passives, les vérifications de l'état des antécédents HyperPod s'exécutent en permanence sur vos nœuds. Outre ces contrôles, exécute HyperPod également des contrôles de santé approfondis (ou actifs) lors de la création et de la mise à jour des HyperPod clusters. En savoir plus sur les bilans de santé approfondis.
Détection de défauts
Lorsqu'il SageMaker HyperPod détecte un défaut, il met en œuvre une réponse en quatre parties :
-
Étiquettes de nœuds
-
État de santé :
sagemaker.amazonaws.com/node-health-status -
Type de défaut :
sagemaker.amazonaws.com/fault-typesétiquette pour une catégorisation de haut niveau -
Motif du défaut :
sagemaker.amazonaws.com/fault-reasonsétiquette contenant des informations détaillées sur le défaut
-
-
Teinte de nœud
-
sagemaker.amazonaws.com/node-health-status=Unschedulable:NoSchedule
-
-
Annotation des nœuds
-
Détails de la panne :
sagemaker.amazonaws.com/fault-details -
Enregistre jusqu'à 20 erreurs avec horodatage survenues sur le nœud
-
-
Conditions du nœud (État du nœud Kubernetes)
-
Reflète l'état de santé actuel des nœuds :
-
Type : Identique au type de défaut
-
État :
True -
Motif : Identique à la raison de la panne
-
LastTransitionTime: temps d'apparition du défaut
-
-
Journaux générés par l'agent de SageMaker HyperPod surveillance de l'état
L'agent SageMaker HyperPod de surveillance de l'état est une fonction de vérification de l'état prête à l'emploi qui s'exécute en continu sur tous les clusters. HyperPod L'agent de surveillance de l'état publie les événements de santé détectés sur les instances GPU ou Trn dans CloudWatch le groupe /aws/sagemaker/Clusters/ de journaux du cluster.
Les journaux de détection de l'agent de surveillance de l' HyperPod état sont créés sous forme de flux de journaux distincts nommés SagemakerHealthMonitoringAgent pour chaque nœud. Vous pouvez interroger les journaux de détection en utilisant CloudWatch Log Insights comme suit.
fields @timestamp, @message | filter @message like /HealthMonitoringAgentDetectionEvent/
Cela devrait retourner une sortie semblable à ce qui suit.
2024-08-21T11:35:35.532-07:00 {"level":"info","ts":"2024-08-21T18:35:35Z","msg":"NPD caught event: %v","details: ":{"severity":"warn","timestamp":"2024-08-22T20:59:29Z","reason":"XidHardwareFailure","message":"Node condition NvidiaErrorReboot is now: True, reason: XidHardwareFailure, message: \"NVRM: Xid (PCI:0000:b9:00): 71, pid=<unknown>, name=<unknown>, NVLink: fatal error detected on link 6(0x10000, 0x0, 0x0, 0x0, 0x0, 0x0, 0x0)\""},"HealthMonitoringAgentDetectionEvent":"HealthEvent"} 2024-08-21T11:35:35.532-07:00 {"level":"info","ts":"2024-08-21T18:35:35Z","msg":"NPD caught event: %v","details: ":{"severity":"warn","timestamp":"2024-08-22T20:59:29Z","reason":"XidHardwareFailure","message":"Node condition NvidiaErrorReboot is now: True, reason: XidHardwareFailure, message: \"NVRM: Xid (PCI:0000:b9:00): 71, pid=<unknown>, name=<unknown>, NVLink: fatal error detected on link 6(0x10000, 0x0, 0x0, 0x0, 0x0, 0x0, 0x0)\""},"HealthMonitoringAgentDetectionEvent":"HealthEvent"}