View a markdown version of this page

Inferenza accelerata - Amazon SageMaker AI

Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.

Inferenza accelerata

Ray Serve è la libreria open source per la gestione dei modelli di Ray. Si distribuisce un modello come applicazione Serve e Ray Serve gestisce il routing delle richieste, il batching e il ridimensionamento delle repliche. Se HyperPod, Ray Serve viene eseguito KubeRay tramite una RayService risorsa, quindi il codice Serve e il grafico di distribuzione rimangono invariati.

Requisiti

Ray Serve on HyperPod richiede solo l'operatore. KubeRay KubeRay riconcilia la RayService risorsa, crea il cluster Ray che la supporta e gestisce le applicazioni Serve su di essa. Per ulteriori informazioni, consulta Installazione KubeRay su HyperPod Amazon EKS.

Non è necessario installare un operatore di inferenza separato per servire i modelli con Ray Serve. Il percorso JumpStart di distribuzione utilizza inoltre la toolkit-for-ray-on-sagemaker-ai libreria con cui si installa. pip

Cosa puoi fare

  • Implementa un modello a partire dal tuo codice RayService e raggiungilo tramite HTTP.

  • Implementa un JumpStart modello in una distribuzione Ray Serve.

  • Riduci i tempi di attivazione del primo token per carichi di lavoro a lungo contesto e multiturno con una cache KV gestita su più livelli e un routing basato sui prefissi.

  • Scalate le repliche servite all'interno del cluster e scalate la capacità del cluster con Karpenter gestito.

Per l'API Ray Serve e i concetti di implementazione, vedi Ray Serve: Scalable and Programmable Serving nella documentazione di Ray.