

Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.

# Beschleunigte Inferenz
<a name="sagemaker-hyperpod-ray-accelerated-inference"></a>

Ray Serve ist die Open-Source-Bibliothek für die Bereitstellung von Modellen für Ray. Sie stellen ein Modell als Serve-Anwendung bereit, und Ray Serve kümmert sich um das Routing von Anfragen, das Batching und die Skalierung von Replikaten. Wenn aktiviert HyperPod, läuft Ray Serve KubeRay über eine `RayService` Ressource weiter, sodass Ihr Serve-Code und Ihr Bereitstellungsdiagramm unverändert bleiben.

## Voraussetzungen
<a name="sagemaker-hyperpod-ray-accelerated-inference-requirements"></a>

Ray Serve on HyperPod benötigt nur den KubeRay Operator. KubeRay gleicht die `RayService` Ressource ab, erstellt den Ray-Cluster, der sie unterstützt, und verwaltet die darauf befindlichen Serve-Anwendungen. Weitere Informationen finden Sie unter [Installation KubeRay auf HyperPod Amazon EKS](sagemaker-hyperpod-ray-install-kuberay.md).

Sie installieren keinen separaten Inferenzoperator, um Modelle mit Ray Serve zu bedienen. Der JumpStart Bereitstellungspfad verwendet zusätzlich die `toolkit-for-ray-on-sagemaker-ai` Bibliothek, mit `pip` der Sie installieren.

## Was Sie tun können
<a name="sagemaker-hyperpod-ray-accelerated-inference-capabilities"></a>
+ Stellen Sie ein Modell aus Ihrem eigenen Code als bereit `RayService` und erreichen Sie es über HTTP.
+ Stellen Sie ein JumpStart Modell in einer Ray Server-Bereitstellung bereit.
+ Verkürzen Sie die Zeit bis zum ersten Token für Workloads mit langem Kontext und mehreren Turn-Vorgängen mit einem verwalteten mehrstufigen KV-Cache und präfix-fähigem Routing.
+ Skalieren Sie die Serverreplikate innerhalb des Clusters und skalieren Sie die Clusterkapazität mit Managed Karpenter.

Informationen zur Ray Serve-API und zu den Bereitstellungskonzepten finden Sie [ in der Ray-Dokumentation unter ](https://docs.ray.io/en/latest/serve/index.html) Ray Serve: Scalable and Programmable Serving.

**Topics**
+ [Voraussetzungen](#sagemaker-hyperpod-ray-accelerated-inference-requirements)
+ [Was Sie tun können](#sagemaker-hyperpod-ray-accelerated-inference-capabilities)
+ [Bereitstellung eines Modells mit Ray Serve](sagemaker-hyperpod-ray-deploy-model.md)
+ [Bereitstellung eines JumpStart Modells mit Ray Serve](sagemaker-hyperpod-ray-deploy-jumpstart-model.md)
+ [Verwalteter mehrstufiger KV-Cache und Routing](sagemaker-hyperpod-ray-kv-cache.md)
+ [Tiered KV-Cache einrichten](sagemaker-hyperpod-ray-kv-cache-setup.md)
+ [Automatische Skalierung der Serverkapazität](sagemaker-hyperpod-ray-serving-autoscaling.md)