View a markdown version of this page

Fehlerbehebung - Amazon SageMaker KI

Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.

Fehlerbehebung

Die folgende Seite enthält bekannte Lösungen zur Fehlerbehebung bei Ihren HyperPod EKS-Clustern.

Registerkarte Dashboard

Die Installation des EKS-Add-ons ist fehlgeschlagen.

Damit die Installation des EKS-Add-ons erfolgreich ist, benötigen Sie eine Kubernets-Version >= 1.30. Informationen zum Update finden Sie unter Kubernetes-Version aktualisieren.

Damit die Installation des EKS-Add-ons erfolgreich ist, müssen sich alle Knoten im Status Bereit und alle Pods im Status Running befinden.

Um den Status Ihrer Knoten zu überprüfen, verwenden Sie den list-cluster-nodes AWS CLI Befehl oder navigieren Sie in der EKS-Konsole zu Ihrem EKS-Cluster und sehen Sie sich den Status Ihrer Knoten an. Beheben Sie das Problem für jeden Knoten oder wenden Sie sich an Ihren Administrator. Wenn der Knotenstatus Unbekannt ist, löschen Sie den Knoten. Sobald der Status aller Knoten Bereit ist, versuchen Sie erneut, das EKS-Add-on HyperPod von der Amazon SageMaker AI-Konsole aus zu installieren.

Um den Status Ihrer Pods zu überprüfen, verwenden Sie den Kubernetes-CLI-Befehl kubectl get pods -n cloudwatch-agent oder navigieren Sie in der EKS-Konsole zu Ihrem EKS-Cluster und zeigen Sie den Status Ihrer Pods mit dem Namespace cloudwatch-agent an. Beheben Sie das Problem mit den Pods oder wenden Sie sich an Ihren Administrator, um das Problem zu lösen. Sobald alle Pod-Status „Running“ lauten, versuchen Sie erneut, das EKS-Add-on von der Amazon AI-Konsole HyperPod aus zu installieren. SageMaker

Weitere Informationen zur Problembehandlung finden Sie unter Problembehandlung für das Amazon CloudWatch Observability EKS-Add-on.

Registerkarte „Aufgaben“

Wenn Ihnen die Fehlermeldung angezeigt wird, dass die benutzerdefinierte Ressourcendefinition (CRD) auf dem Cluster nicht konfiguriert ist, gewähren Sie Ihrer Domain-Ausführungsrolle Rechte EKSAdminViewPolicy und ClusterAccessRole Richtlinien.

Richtlinien

Im Folgenden werden Lösungen für Fehler im Zusammenhang mit Richtlinien aufgeführt, die die HyperPod APIs oder die Konsole verwenden.

  • Wenn sich die Richtlinie in CreateFailed oder im CreateRollbackFailed Status befindet, müssen Sie die fehlgeschlagene Richtlinie löschen und eine neue erstellen.

  • Wenn die Richtlinie im Status UpdateFailed ist, versuchen Sie die Aktualisierung mit derselben Richtlinien-ARN erneut.

  • Wenn die Richtlinie den UpdateRollbackFailed Status hat, müssen Sie die fehlgeschlagene Richtlinie löschen und anschließend eine neue erstellen.

  • Wenn die Richtlinie im Status DeleteFailed und ist, versuchen Sie erneut, sie mit derselben Richtlinien-ARN zu löschen.

    • Wenn Sie beim Versuch, die Compute-Priorisierung oder Cluster-Richtlinie mithilfe der HyperPod Konsole zu löschen, auf einen Fehler gestoßen sind, versuchen Sie, die cluster-scheduler-config mithilfe der API zu löschen. Um den Status der Ressource zu überprüfen, rufen Sie die Detailseite einer Rechenzuweisung auf.

Verwenden Sie die Describe-API, um weitere Informationen zu dem Fehler zu erhalten.

Löschen von Clustern

Im Folgenden sind bekannte Lösungen für Fehler im Zusammenhang mit dem Löschen von Clustern aufgeführt.

  • Wenn das Löschen eines Clusters aufgrund der angehängten Richtlinien zur SageMaker HyperPod Aufgabenverwaltung fehlschlägt, müssen Sie dies tunLöschen von Richtlinien.

  • Wenn das Löschen eines Clusters fehlschlägt, weil die folgenden Berechtigungen fehlen, müssen Sie die Mindestberechtigungen Ihres Clusteradministrators aktualisieren. Weitere Informationen finden Sie im IAM-Benutzer für den Clusteradministrator Abschnitt auf der Registerkarte Amazon EKS.

    • sagemaker:ListComputeQuotas

    • sagemaker:ListClusterSchedulerConfig

    • sagemaker:DeleteComputeQuota

    • sagemaker:DeleteClusterSchedulerConfig

Gemeinsame Nutzung nicht zugewiesener Ressourcen

Wenn die Kapazität Ihres nicht zugewiesenen Ressourcenpools geringer ist als erwartet:

  1. Überprüfen Sie, ob der Knoten bereit ist

    kubectl get nodes

    Stellen Sie sicher, dass alle Knoten in der Ready STATUS-Spalte den Status anzeigen.

  2. Überprüfen Sie den Status „Planbar“ des Knotens

    kubectl get nodes -o custom-columns=NAME:.metadata.name,UNSCHEDULABLE:.spec.unschedulable

    Prüfen Sie, ob Knoten angezeigt <none> werden false oder nichttrue.

  3. Nicht zugewiesene gemeinsame Nutzung ClusterQueues von Ressourcen auflisten:

    kubectl get clusterqueue | grep hyperpod-ns-idle-resource-sharing

    Dies zeigt, dass alle nicht zugewiesenen Ressourcen gemeinsam genutzt werden. ClusterQueues Wenn sie nicht angezeigt ClusterQueues werden, überprüfen Sie die FailureReason untergeordnete ClusterSchedulerConfig Richtlinie, um festzustellen, ob Fehlermeldungen vorhanden sind, um mit dem Debuggen fortzufahren.

  4. Überprüfen Sie das nicht zugewiesene Kontingent zur gemeinsamen Nutzung von Ressourcen:

    kubectl describe clusterqueue hyperpod-ns-idle-resource-sharing-<index>

    Sehen Sie sich den spec.resourceGroups[].flavors[].resources Abschnitt an, um zu sehen, welches Kontingent für jede Ressourcenvariante zugewiesen ist.

    Abhängig von der Anzahl der Ressourcenvarianten in Ihrem Cluster ClusterQueues können mehrere nicht zugewiesene Ressourcen gemeinsam genutzt werden.

  5. Überprüfen Sie den MIG-Konfigurationsstatus (GPU-Knoten):

    kubectl get nodes -o jsonpath='{range .items[*]}{.metadata.name}{"\t"}{.metadata.labels.nvidia\.com/mig\.config\.state}{"\n"}{end}'

    Überprüfen Sie, ob die MIG-enabled Knoten success den Status anzeigen.

Add-on Das Upgrade von v1.3.x auf v1.5.0 schlägt fehl

Symptom: Wenn Sie das Task-Governance-Add-on direkt von v1.3.x (Kueue v0.12) auf v1.5.0 (Kueue v0.18) mit dem folgenden Fehler aktualisieren, wechselt das Add-on in den Status mit dem folgenden Fehler: aws eks update-addon UPDATE_FAILED

CustomResourceDefinition.apiextensions.k8s.io "cohorts.kueue.x-k8s.io" is invalid: status.storedVersions[0]: Invalid value: "v1alpha1": missing from spec.versions; v1alpha1 was previously a storage version, and must remain in spec.versions until a storage migration ensures no data remains persisted in v1alpha1 and removes v1alpha1 from status.storedVersions

Lösung: Verwenden Sie die Upgrade-Option in der AI-Konsole. SageMaker HyperPod Die Konsole wickelt die CRD-Migration automatisch ab, indem sie vorhandene Ressourcen sichert, StoredVersions migriert, das Add-on aktualisiert und Ressourcen wiederherstellt. Informationen zur manuellen Durchführung der Migration über die Amazon EKS-Add-On-Schnittstelle finden Sie unter. Führen Sie ein Upgrade von v1.3.x auf v1.5 durch