

Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.

# Inferenza accelerata
<a name="sagemaker-hyperpod-ray-accelerated-inference"></a>

Ray Serve è la libreria open source per la gestione dei modelli di Ray. Si distribuisce un modello come applicazione Serve e Ray Serve gestisce il routing delle richieste, il batching e il ridimensionamento delle repliche. Se HyperPod, Ray Serve viene eseguito KubeRay tramite una `RayService` risorsa, quindi il codice Serve e il grafico di distribuzione rimangono invariati.

## Requisiti
<a name="sagemaker-hyperpod-ray-accelerated-inference-requirements"></a>

Ray Serve on HyperPod richiede solo l'operatore. KubeRay KubeRay riconcilia la `RayService` risorsa, crea il cluster Ray che la supporta e gestisce le applicazioni Serve su di essa. Per ulteriori informazioni, consulta [Installazione KubeRay su HyperPod Amazon EKS](sagemaker-hyperpod-ray-install-kuberay.md).

Non è necessario installare un operatore di inferenza separato per servire i modelli con Ray Serve. Il percorso JumpStart di distribuzione utilizza inoltre la `toolkit-for-ray-on-sagemaker-ai` libreria con cui si installa. `pip`

## Cosa puoi fare
<a name="sagemaker-hyperpod-ray-accelerated-inference-capabilities"></a>
+ Implementa un modello a partire dal tuo codice `RayService` e raggiungilo tramite HTTP.
+ Implementa un JumpStart modello in una distribuzione Ray Serve.
+ Riduci i tempi di attivazione del primo token per carichi di lavoro a lungo contesto e multiturno con una cache KV gestita su più livelli e un routing basato sui prefissi.
+ Scalate le repliche servite all'interno del cluster e scalate la capacità del cluster con Karpenter gestito.

Per l'API Ray Serve e i concetti di implementazione, vedi [ Ray Serve: Scalable and Programmable Serving nella documentazione di Ray. ](https://docs.ray.io/en/latest/serve/index.html)

**Topics**
+ [Requisiti](#sagemaker-hyperpod-ray-accelerated-inference-requirements)
+ [Cosa puoi fare](#sagemaker-hyperpod-ray-accelerated-inference-capabilities)
+ [Implementazione di un modello con Ray Serve](sagemaker-hyperpod-ray-deploy-model.md)
+ [Implementazione di un JumpStart modello con Ray Serve](sagemaker-hyperpod-ray-deploy-jumpstart-model.md)
+ [Cache e routing KV gestiti su più livelli](sagemaker-hyperpod-ray-kv-cache.md)
+ [Configurazione della cache KV su più livelli](sagemaker-hyperpod-ray-kv-cache-setup.md)
+ [Scalabilità automatica della capacità di servizio](sagemaker-hyperpod-ray-serving-autoscaling.md)