View a markdown version of this page

Ray auf Häufig gestellte Fragen HyperPod - Amazon SageMaker KI

Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.

Ray auf Häufig gestellte Fragen HyperPod

HyperPod Ändert Ray oder? KubeRay

HyperPod führt den Upstream-Open-Source-Ray KubeRay ohne Änderungen aus. Ihr Ray-Code, die Ray-APIs und die RayClusterRayJob,RayCronJob, und RayService benutzerdefinierten Ressourcen verhalten sich wie in Open Source. HyperPod fügt Funktionen rund um Ray hinzu, wie z. B. ein verwaltetes Studio-Erlebnis, sicheren Dashboard-Zugriff, Beobachtbarkeit und Stabilität.

Kann ich meine bestehende KubeRay Installation behalten?

Sie können den KubeRay Operator, den Sie bereits verwenden, behalten. HyperPod Funktionen werden parallel dazu installiert, und Manifeste, die Sie bereits anwenden, funktionieren weiterhin. Wenn Ihr Cluster noch keinen KubeRay Operator hat, installieren Sie ihn wie unter beschriebenInstallation KubeRay auf HyperPod Amazon EKS.

Brauche ich SageMaker Studio?

Amazon SageMaker Studio ist nur für das Managed-Erlebnis erforderlich, bei dem Datenwissenschaftler Ray-Cluster ohne Kubernetes-Kenntnisse erstellen und verwalten. Auf einer vorhandenen Ray-Plattform verwenden kubectl Sie Helm und die Toolkit-Bibliothek, und Studio ist für nichts erforderlich. Weitere Informationen finden Sie unter Erste Schritte.

Kann ich meine eigenen Prometheus und Grafana verwenden?

Du kannst deine eigenen Prometheus und Grafana behalten. Das HyperPod Observability-Add-on ist eine Option, die bereits konfiguriert geliefert wird. Sie können Ray-Metriken jedoch stattdessen mit Ihrem eigenen Stack entfernen. Weitere Informationen finden Sie unter Erfassung von Ray-Metriken einrichten.

Wie funktioniert die Quote bei einem langlebigen Ray-Cluster?

HyperPod Task Governance berücksichtigt die Kontingente RayCluster auf dieser Ebene, sodass ein langlebiger Cluster seine volle deklarierte Kapazität behält, solange er läuft. Passen Sie die Größe eines persistenten Clusters an die Kapazität an, die Sie reservieren möchten, und verwenden Sie RayJob ihn für Aufgaben, bei denen Kapazität pro Job abgerufen und freigegeben wird. Weitere Informationen finden Sie unter Warteschlange mit Aufgabensteuerung.

Was passiert mit meinem Ray-Job, wenn ein GPU-Knoten ausfällt?

HyperPod erkennt den Fehler anhand von Zustandsprüfungen und startet den Knoten neu oder ersetzt ihn und KubeRay plant die betroffenen Ray-Pods neu ein. Ihr Job wird ab dem letzten Checkpoint wieder aufgenommen. Schreiben Sie also Checkpoints, um laufende Arbeiten wiederherzustellen. Weitere Informationen finden Sie unter Automatische Node-Wiederherstellung mit Ray.

Welche Ray-Bibliotheken werden unterstützt?

HyperPod unterstützt die Open-Source-Ray-Bibliotheken, einschließlich Ray Core, Ray Train, Ray Data und Ray Serve, da Ray unverändert darauf ausgeführt wird. Passen spec.rayVersion Sie die Ray-Version in Ihrem Container-Image an. Informationen zu den Bibliotheks-APIs finden Sie in der Ray-Dokumentation auf der Ray-Website.

Kann ich eine Funktion ohne die anderen übernehmen?

Jede HyperPod Funktion wird unabhängig als Add-on oder Python-Paket installiert, sodass Sie eine übernehmen und beenden können. Ein Team mit eigener Ray-Plattform kann Observability oder authentifizierten Dashboard-Zugriff hinzufügen, ohne den Rest zu ändern. Die vollständige Liste und die Abhängigkeiten finden Sie unter. Erste Schritte