View a markdown version of this page

Erste Schritte - Amazon SageMaker KI

Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.

Erste Schritte

Ray On HyperPod läuft unverändert auf dem KubeRay Open-Source-Operator und seinen benutzerdefinierten Ressourcen. Für den Einstieg benötigen Sie nur einen von Amazon EKS orchestrierten HyperPod Cluster und den darauf installierten KubeRay Operator. HyperPod fügt dann Funktionen rund um Ray hinzu, die Sie auf eine von zwei Arten übernehmen.

Erste Schritte

Diese beiden Schritte sind alles, was Sie benötigen, um Ray auszuführen HyperPod.

  1. Erstellen Sie einen HyperPod Cluster, der von Amazon EKS orchestriert wird. Weitere Informationen finden Sie unter Erstellen eines SageMaker HyperPod Clusters mit Amazon EKS-Orchestrierung.

  2. Installieren Sie den KubeRay Operator auf dem Cluster. Es verwaltet jede benutzerdefinierte Ray-Ressource. Weitere Informationen finden Sie unter Installation KubeRay auf HyperPod Amazon EKS.

Ray verfügt über HyperPod

HyperPod fügt Funktionen rund um Ray hinzu, und es gibt zwei Möglichkeiten, sie zu übernehmen. Das Setup ist in beiden Fällen dasselbe, und auf beiden laufen derselbe Open-Source-Ray und dieselben KubeRay benutzerdefinierten Ressourcen. Der Unterschied besteht darin, wie Ihre Teams die Funktionen nutzen. Sie können mit einem beginnen und das andere später hinzufügen.

Purpose-built Erfahrung als Datenwissenschaftler. Amazon SageMaker Studio vereint diese Funktionen in einer Oberfläche. Sie erstellen und verwalten Ray-Cluster, entwickeln interaktiv in einem angeschlossenen Bereich, erreichen das Ray-Dashboard über einen Browserlink und öffnen Grafana-Dashboards, ohne Kubernetes-Manifeste zu schreiben. Richten Sie zuerst Amazon SageMaker Studio für Ray ein. Weitere Informationen finden Sie unter Studio für Ray einrichten. Sie können sich dann für jede Funktion einzeln entscheiden, z. B. das SageMaker AI Spaces-Add-on für interaktive Entwicklung und das HyperPod Observability-Add-on für Dashboards.

Integration von Funktionen in Ihre bestehende interne ML-Plattform. Wählen Sie diese Option, wenn Sie Ihre eigene interne ML-Plattform auf Amazon EKS betreiben und Ihre Tools und Workflows beibehalten möchten. Sie fügen Ihrem Amazon EKS-Cluster HyperPod Rechenleistung hinzu und übernehmen nur die Funktionen, die Ihnen fehlen. Amazon SageMaker Studio ist für nichts erforderlich. Jede Funktion ist ein separates Add-on oder ein Python-Paket, sodass Sie eines übernehmen und beenden können.

Jede Funktion ist auf beide Arten verfügbar. Das speziell entwickelte Erlebnis bietet eine Weboberfläche, und auf Ihrer eigenen Plattform nutzen Sie dieselben Funktionen. kubectl

Feature Purpose-built Erfahrung in Amazon Studio SageMaker Deine eigene Plattform
Verwaltung von Ray-Workloads Erstellen und verwalten Sie Ray-Cluster in der Amazon SageMaker Studio-Weboberfläche kubectlund Ihre eigenen RayCluster Manifeste
IDE und Notebooks Web-UI zur Erstellung von Ray-Entwicklungsumgebungen Fügen Sie ein Leerzeichen hinzu mit kubectl
Zugriff auf das Ray Dashboard und Einreichung von Jobs One-click authentifizierter Zugriff und Auftragsübermittlung per Fernzugriff über Studio Space-Notebooks und den Code-Editor kubectlBefehle zum Generieren von Ray Dashboard-Links
Beobachtbarkeit Grafana-Dashboards aus dem Observability-Add-On HyperPod Das gleiche Add-on oder dein eigener Prometheus
Gemeinsame Nutzung von Ressourcen und Warteschlangen für Jobs mit Task-Governance Warteschlange mit Aufgabensteuerung Sehen Sie sich die Metriken zur Ressourcenzuweisung bei der Erstellung von Ray-Workloads an und senden Sie sie von der Benutzeroberfläche aus an eine Warteschlange über kubectl
Resilientes Training (automatische Wiederherstellung der Knoten, Erkennung hängender Jobs, mehrstufiges Checkpointing) Wird auf der Infrastrukturebene unterstützt Auf der Infrastrukturebene unterstützt
Beschleunigte Inferenz (Ray Serve, verwalteter mehrstufiger KV-Cache, Autoscaling) Wird auf der Infrastrukturebene unterstützt Auf der Infrastrukturebene unterstützt