Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.
Inferenza accelerata
Ray Serve è la libreria open source per la gestione dei modelli di Ray. Si distribuisce un modello come applicazione Serve e Ray Serve gestisce il routing delle richieste, il batching e il ridimensionamento delle repliche. Se HyperPod, Ray Serve viene eseguito KubeRay tramite una RayService risorsa, quindi il codice Serve e il grafico di distribuzione rimangono invariati.
Requisiti
Ray Serve on HyperPod richiede solo l'operatore. KubeRay KubeRay riconcilia la RayService risorsa, crea il cluster Ray che la supporta e gestisce le applicazioni Serve su di essa. Per ulteriori informazioni, consulta Installazione KubeRay su HyperPod Amazon EKS.
Non è necessario installare un operatore di inferenza separato per servire i modelli con Ray Serve. Il percorso JumpStart di distribuzione utilizza inoltre la toolkit-for-ray-on-sagemaker-ai libreria con cui si installa. pip
Cosa puoi fare
-
Implementa un modello a partire dal tuo codice
RayServicee raggiungilo tramite HTTP. -
Implementa un JumpStart modello in una distribuzione Ray Serve.
-
Riduci i tempi di attivazione del primo token per carichi di lavoro a lungo contesto e multiturno con una cache KV gestita su più livelli e un routing basato sui prefissi.
-
Scalate le repliche servite all'interno del cluster e scalate la capacità del cluster con Karpenter gestito.
Per l'API Ray Serve e i concetti di implementazione, vedi Ray Serve: Scalable and Programmable Serving nella documentazione di Ray.