Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.
Problembehebung bei Ray on HyperPod
Verwenden Sie diese Seite, um häufig auftretende Probleme mit Ray-Clustern, Dashboards, Jobs und Observability zu diagnostizieren. HyperPod Jeder Eintrag gibt das Symptom, die Ursache und die Lösung an.
Raycluster bleibt in Ausstehend hängen
Symptom
Die Head- oder Worker-Pods bleiben Pending und der Cluster erreicht sie nieRunning.
Ursache
Die angeforderte vCPU oder der angeforderte Arbeitsspeicher ist höher als die zuweisbare Kubernetes-Kapazität für den ausgewählten Instanztyp. Allocatable ist niedriger als das Instanz-Namensschild, da das Kube-System einen Teil jedes Knotens reserviert und DaemonSets verbraucht.
Auflösung
Senken Sie die vCPU- und Speicheranforderungen so, dass sie der zuweisbaren Kapazität entsprechen, oder wählen Sie einen größeren Instance-Typ. Prüfen Sie, ob die Anforderungen mit den gemeldeten Werten zugewiesen werden können, kubectl describe node
und legen Sie fest, dass die Anforderungen niedriger sind.my-node
ray.init () schlägt mit einem Versionsfehler fehl
Symptom
ray.init()schlägt fehl, oder der Cluster wird gestartet, aber die Clients können keine Verbindung herstellen.
Ursache
Die Ray-Version im Space oder Client-Image stimmt nicht mit der Version spec.rayVersion im Cluster-Manifest überein.
Auflösung
Stellen spec.rayVersion Sie die Ray-Version im Container-Image ein und verwenden Sie dieselbe Ray-Version im Space oder Client. Weitere Informationen finden Sie unter Installation KubeRay auf HyperPod Amazon EKS.
Der Dashboard-Link gibt einen Autorisierungsfehler zurück
Symptom
Der Ray Dashboard-Link wird geöffnet, gibt jedoch einen Autorisierungsfehler zurück.
Ursache
Im Rahmen der Strategie für privaten Zugriff ist das Dashboard auf die Identität beschränkt, die die Verbindung hergestellt hat. Eine andere Identität wird verweigert.
Auflösung
Öffnen Sie das Dashboard mit der Identität, die den Cluster erstellt hat, oder verwenden Sie die Strategie für den öffentlichen Zugriff, um allen Personen mit Verbindungsberechtigungen im Namespace Zugriff zu gewähren. Weitere Informationen finden Sie unter Zugriffsstrategien und bewährte Sicherheitsmethoden.
Die Arbeitslast von Ray wurde nie zugelassen
Symptom
Ein RayCluster oder RayJob bleibt unzugelassen und es werden keine Pods erstellt.
Ursache
Für den Namespace gibt es in HyperPod Task Governance keine Rechenzuweisung, sodass Task Governance die Arbeitslast ohne Kontingent verwaltet, gegen das sie zugelassen werden könnte.
Auflösung
Weisen Sie dem Namespace eine Rechenzuweisung zu, oder senden Sie die Zuweisung an einen Namespace, der eine hat. Weitere Informationen finden Sie unter Task-Governance für Ray einrichten.
Grafana-Dashboards sind leer
Symptom
Die Ray Grafana-Dashboards werden geladen, zeigen aber keine Daten für einen laufenden Cluster an.
Ursache
Ray-Metriken sind im HyperPod Observability-Add-on nicht aktiviert, sodass keine Ray-Metriken gelöscht werden.
Auflösung
Aktivieren Sie Ray-Metriken im Observability-Add-on und vergewissern Sie sich, dass die Add-On-Version Ray-Metrik-Scraping unterstützt. Weitere Informationen finden Sie unter Erfassung von Ray-Metriken einrichten.
Die Auftragsübermittlung erreicht den Endpunkt nicht
Symptom
ray job submitkann keine Verbindung herstellen oder gibt einen Autorisierungsfehler zurück.
Ursache
Der Endpunkt für die Auftragsübermittlung ist nicht erreichbar, oder das Sitzungstoken ist abgelaufen. Eine Dashboard- oder Endpunktsitzung ist bis zu sechs Stunden gültig.
Auflösung
Bestätigen Sie die Endpunktadresse und generieren Sie dann eine neue Verbindungs-URL, um das Token zu aktualisieren und es erneut zu versuchen. Weitere Informationen finden Sie unter Generieren einer Dashboard-Verbindungs-URL.