

Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.

# Inférence accélérée
<a name="sagemaker-hyperpod-ray-accelerated-inference"></a>

Ray Serve est la bibliothèque open source de service de modèles pour Ray. Vous déployez un modèle en tant qu'application Serve, et Ray Serve gère le routage des demandes, le traitement par lots et la mise à l'échelle des répliques. Sur HyperPod, Ray Serve s'exécute KubeRay via une `RayService` ressource, de sorte que votre code Serve et votre graphique de déploiement restent inchangés.

## Exigences
<a name="sagemaker-hyperpod-ray-accelerated-inference-requirements"></a>

Ray Serve activé ne HyperPod nécessite que l' KubeRay opérateur. KubeRay réconcilie la `RayService` ressource, crée le cluster Ray qui la sauvegarde et gère les applications Serve qui s'y trouvent. Pour de plus amples informations, veuillez consulter [Installation KubeRay sur HyperPod Amazon EKS](sagemaker-hyperpod-ray-install-kuberay.md).

Vous n'installez pas d'opérateur d'inférence distinct pour diffuser des modèles avec Ray Serve. Le chemin de JumpStart déploiement utilise également la `toolkit-for-ray-on-sagemaker-ai` bibliothèque avec laquelle vous effectuez l'installation`pip`.

## Actions possibles
<a name="sagemaker-hyperpod-ray-accelerated-inference-capabilities"></a>
+ Déployez un modèle à partir de votre propre code en tant que tel `RayService` et accédez-y via HTTP.
+ Déployez un JumpStart modèle dans un déploiement Ray Serve.
+ Réduisez le délai d'obtention du premier jeton pour les charges de travail à contexte long et à tours multiples grâce à un cache KV hiérarchisé géré et à un routage prenant en compte les préfixes.
+ Faites évoluer les répliques de serveurs au sein du cluster et augmentez la capacité du cluster grâce à la gestion de Karpenter.

Pour l'API Ray Serve et les concepts de déploiement, voir [ Ray Serve : Scalable and Programmable ](https://docs.ray.io/en/latest/serve/index.html) Serving dans la documentation Ray.

**Topics**
+ [Exigences](#sagemaker-hyperpod-ray-accelerated-inference-requirements)
+ [Actions possibles](#sagemaker-hyperpod-ray-accelerated-inference-capabilities)
+ [Déploiement d'un modèle avec Ray Serve](sagemaker-hyperpod-ray-deploy-model.md)
+ [Déploiement d'un JumpStart modèle avec Ray Serve](sagemaker-hyperpod-ray-deploy-jumpstart-model.md)
+ [Cache et routage KV hiérarchisés gérés](sagemaker-hyperpod-ray-kv-cache.md)
+ [Configuration du cache KV hiérarchisé](sagemaker-hyperpod-ray-kv-cache-setup.md)
+ [Capacité de service Autoscaling](sagemaker-hyperpod-ray-serving-autoscaling.md)