View a markdown version of this page

Prise en main - Amazon SageMaker AI

Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.

Prise en main

Ray on HyperPod s'exécute sur l' KubeRay opérateur open source et ses ressources personnalisées, sans modification. Pour commencer, vous n'avez besoin que d'un HyperPod cluster orchestré par Amazon EKS et de l' KubeRay opérateur installé sur celui-ci. HyperPod ajoute ensuite des fonctionnalités autour de Ray que vous pouvez adopter de deux manières.

Prise en main

Ces deux étapes sont tout ce dont vous avez besoin pour exécuter Ray HyperPod.

  1. Créez un HyperPod cluster orchestré par Amazon EKS. Pour de plus amples informations, veuillez consulter Création d'un SageMaker HyperPod cluster avec l'orchestration Amazon EKS.

  2. Installez l' KubeRay opérateur sur le cluster. Il gère chaque ressource personnalisée Ray. Pour de plus amples informations, veuillez consulter Installation KubeRay sur HyperPod Amazon EKS.

Ray apparaît sur HyperPod

HyperPod ajoute des fonctionnalités autour de Ray, et il existe deux manières de les adopter. La configuration est la même dans les deux cas, et les deux exécutent le même Ray open source et les mêmes ressources KubeRay personnalisées. Ce qui diffère, c'est la façon dont vos équipes utilisent les fonctionnalités. Vous pouvez commencer par l'une et ajouter l'autre plus tard.

Purpose-built expérience de data scientist. Amazon SageMaker Studio réunit ces fonctionnalités dans une seule interface. Vous créez et gérez des clusters Ray, vous développez de manière interactive dans un espace rattaché, vous accédez au Ray Dashboard via un lien de navigateur et vous ouvrez des tableaux de bord Grafana, sans écrire de manifestes Kubernetes. Configurez d'abord Amazon SageMaker Studio pour Ray. Pour de plus amples informations, veuillez consulter Configuration de Studio pour Ray. Vous pouvez ensuite activer chaque fonctionnalité individuellement, comme le module complémentaire SageMaker AI Spaces pour le développement interactif et le module complémentaire HyperPod Observability pour les tableaux de bord.

Intégrer des fonctionnalités à votre plateforme de machine learning interne existante. Choisissez cette option si vous gérez votre propre plateforme de machine learning interne sur Amazon EKS et que vous souhaitez conserver vos outils et vos flux de travail. Vous associez le HyperPod calcul à votre cluster Amazon EKS et vous n'adoptez que les fonctionnalités qui vous font défaut. Rien ne nécessite Amazon SageMaker Studio. Chaque fonctionnalité est un module complémentaire distinct ou un package Python, vous pouvez donc en adopter un et arrêter.

Toutes les fonctionnalités sont disponibles dans les deux sens. L'expérience spécialement conçue intègre chacune d'entre elles dans une interface Web, et vous pouvez utiliser les mêmes fonctionnalités sur votre propre plateforme. kubectl

Fonctionnalité Purpose-built expérience dans Amazon SageMaker Studio Votre propre plateforme
Gestion des charges de travail Ray Créez et gérez des clusters Ray dans l'interface Web d'Amazon SageMaker Studio kubectlet vos propres RayCluster manifestes
IDE et ordinateurs portables Interface utilisateur Web pour créer des environnements de développement Ray Attachez un espace avec kubectl
Accès au tableau de bord Ray et soumission des offres d'emploi One-click accès authentifié et soumission de tâches à distance depuis les blocs-notes Studio Space et l'éditeur de code kubectlcommandes pour générer des liens Ray Dashboard
Observabilité Tableaux de bord Grafana à partir du module complémentaire Observability HyperPod Le même module complémentaire, ou votre propre Prometheus
Partage des ressources et mise en file d'attente des tâches grâce à la gouvernance des tâches Afficher les mesures d'allocation des ressources lors de la création de la charge de travail Ray et les soumettre à une file d'attente depuis l'interface utilisateur via kubectl
Formation résiliente (restauration automatique des nœuds, détection des tâches bloquées, points de contrôle hiérarchisés) Pris en charge au niveau de l'infrastructure Pris en charge au niveau de l'infrastructure
Inférence accélérée (Ray Serve, cache KV hiérarchisé géré, mise à l'échelle automatique) Pris en charge au niveau de l'infrastructure Pris en charge au niveau de l'infrastructure