View a markdown version of this page

Amazon SageMaker HyperPod - Amazon SageMaker KI

Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.

Amazon SageMaker HyperPod

SageMaker HyperPod unterstützt Sie bei der Bereitstellung robuster Cluster für die Ausführung von Workloads für maschinelles Lernen (ML) und die Entwicklung hochmoderner Modelle wie Large Language Models (LLMs), Diffusionsmodelle und Foundation Models (FMs). Es beschleunigt die Entwicklung von FMs, da undifferenzierter Aufwand beim Aufbau und der Wartung großer Rechencluster entfällt, die von Tausenden von Beschleunigern wie AWS Trainium und NVIDIA A100 und H100 Graphical Processing Units (GPUs) angetrieben werden. Wenn Beschleuniger ausfallen, erkennen die Resilienzfunktionen von SageMaker HyperPod Monitor the Cluster Instances automatisch die fehlerhafte Hardware und ersetzen sie im laufenden Betrieb, sodass Sie sich auf die Ausführung von ML-Workloads konzentrieren können.

Überprüfen Sie zunächst eine der folgenden Orchestrator-Optionen Voraussetzungen für die Verwendung SageMaker HyperPodAWS Identity and Access Management für SageMaker HyperPod, richten Sie sie ein und wählen Sie sie aus, die von unterstützt werden. SageMaker HyperPod

Slurm-Unterstützung in SageMaker HyperPod

SageMaker HyperPod bietet Unterstützung für die Ausführung von Machine-Learning-Workloads auf belastbaren Clustern durch Integration mit Slurm, einem Open-Source-Workload-Manager. Die Slurm-Unterstützung in SageMaker HyperPod ermöglicht eine nahtlose Cluster-Orchestrierung über die Slurm-Cluster-Konfiguration, sodass Sie Head-, Login- und Worker-Knoten auf den SageMaker HyperPod Clustern einrichten können. Diese Integration erleichtert auch die Slurm-based Jobplanung für die Ausführung von ML-Workloads auf dem Cluster sowie den direkten Zugriff auf Clusterknoten für die Jobplanung. Mit HyperPod der Unterstützung der Lifecycle-Konfiguration können Sie die Computerumgebung der Cluster an Ihre spezifischen Anforderungen anpassen. Darüber hinaus können Sie durch die Nutzung der verteilten Trainingsbibliotheken von Amazon SageMaker AI die Leistung der Cluster in Bezug auf AWS Rechen- und Netzwerkressourcen optimieren. Weitere Informationen hierzu finden Sie unter Orchestrierung von SageMaker HyperPod Clustern mit Slurm.

Amazon EKS-Unterstützung in SageMaker HyperPod

SageMaker HyperPod lässt sich auch in Amazon EKS integrieren, um das groß angelegte Training von Basismodellen auf langlebigen und belastbaren Rechenclustern zu ermöglichen. Auf diese Weise können Cluster-Administratoren HyperPod Cluster bereitstellen und sie an eine EKS-Steuerebene anhängen, was ein dynamisches Kapazitätsmanagement, direkten Zugriff auf Cluster-Instances und Resilienzfunktionen ermöglicht. Für Datenwissenschaftler HyperPod ermöglicht die Amazon EKS-Unterstützung die Ausführung containerisierter Workloads für das Training von Basismodellen, Inferenzen auf dem EKS-Cluster und die Nutzung der Funktion zur automatischen Wiederaufnahme von Jobs für das Kubeflow-Training. PyTorch Die Architektur umfasst eine 1-zu-1-Zuordnung zwischen einem EKS-Cluster (Steuerungsebene) und einem HyperPod Cluster (Worker Nodes) innerhalb einer VPC und bietet so eine eng integrierte Lösung für die Ausführung umfangreicher ML-Workloads. Weitere Informationen hierzu finden Sie unter Orchestrierung von Clustern mit Amazon EKS SageMaker HyperPod.

UltraServers mit HyperPod

HyperPod mit UltraServers liefert KI-Rechenleistung durch die Integration von NVIDIA-Superchips in eine zusammenhängende, leistungsstarke Infrastruktur. Jede NVL72 UltraServer kombiniert 18 Instanzen mit 72 NVIDIA Blackwell-GPUs, die über NVLink miteinander verbunden sind, was im Vergleich zu Instances der vorherigen Generation eine schnellere Inferenz und eine schnellere Trainingsleistung ermöglicht. Diese Architektur ist besonders nützlich für Unternehmen, die mit Basismodellen mit Billionen Parametern arbeiten, da der einheitliche GPU-Speicher es ermöglicht, dass ganze Modelle in einer einzigen NVLink-Domäne verbleiben, wodurch knotenübergreifende Netzwerkengpässe vermieden werden. HyperPod verstärkt diesen Hardwarevorteil durch eine intelligente, topologieorientierte Planung, die die Workload-Platzierung optimiert, durch automatischen Instance-Austausch zur Minimierung von Unterbrechungen und durch flexible Bereitstellungsoptionen, die sowohl dedizierte als auch gemeinsam genutzte Ressourcenkonfigurationen unterstützen. Für Teams, die die Grenzen der Modellgröße und -leistung erweitern möchten, bietet diese Integration die erforderliche Rechenbasis, um die fortschrittlichsten KI-Modelle mit beispielloser Effizienz zu trainieren und einzusetzen.

SageMaker HyperPod optimiert automatisch die Platzierung von Instanzen in Ihrem. UltraServers HyperPod Priorisiert standardmäßig alle Instanzen in einer Instanz, UltraServer bevor eine andere verwendet wird. Wenn Sie beispielsweise 14 Instanzen möchten und 2 UltraServers in Ihrem Plan haben, verwendet SageMaker AI alle Instanzen der ersten Instanz. UltraServer Wenn Sie 20 Instanzen möchten, verwendet SageMaker AI alle 18 Instanzen in der ersten UltraServer und verwendet dann 2 weitere Instanzen aus der zweiten.

AWS-Regionen unterstützt von SageMaker HyperPod

SageMaker HyperPod ist im Folgenden verfügbar AWS-Regionen.

  • us-east-1

  • us-east-2

  • us-west-1

  • us-west-2

  • eu-central-1

  • eu-north-1

  • eu-west-1

  • eu-west-2

  • eu-south-2

  • ap-south-1

  • ap-south-2

  • ap-southeast-1

  • ap-southeast-2

  • ap-southeast-3

  • ap-southeast-4

  • ap-northeast-1

  • ap-northeast-2

  • sa-east-1