View a markdown version of this page

Beschleunigte Inferenz - Amazon SageMaker KI

Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.

Beschleunigte Inferenz

Ray Serve ist die Open-Source-Bibliothek für die Bereitstellung von Modellen für Ray. Sie stellen ein Modell als Serve-Anwendung bereit, und Ray Serve kümmert sich um das Routing von Anfragen, das Batching und die Skalierung von Replikaten. Wenn aktiviert HyperPod, läuft Ray Serve KubeRay über eine RayService Ressource weiter, sodass Ihr Serve-Code und Ihr Bereitstellungsdiagramm unverändert bleiben.

Voraussetzungen

Ray Serve on HyperPod benötigt nur den KubeRay Operator. KubeRay gleicht die RayService Ressource ab, erstellt den Ray-Cluster, der sie unterstützt, und verwaltet die darauf befindlichen Serve-Anwendungen. Weitere Informationen finden Sie unter Installation KubeRay auf HyperPod Amazon EKS.

Sie installieren keinen separaten Inferenzoperator, um Modelle mit Ray Serve zu bedienen. Der JumpStart Bereitstellungspfad verwendet zusätzlich die toolkit-for-ray-on-sagemaker-ai Bibliothek, mit pip der Sie installieren.

Was Sie tun können

  • Stellen Sie ein Modell aus Ihrem eigenen Code als bereit RayService und erreichen Sie es über HTTP.

  • Stellen Sie ein JumpStart Modell in einer Ray Server-Bereitstellung bereit.

  • Verkürzen Sie die Zeit bis zum ersten Token für Workloads mit langem Kontext und mehreren Turn-Vorgängen mit einem verwalteten mehrstufigen KV-Cache und präfix-fähigem Routing.

  • Skalieren Sie die Serverreplikate innerhalb des Clusters und skalieren Sie die Clusterkapazität mit Managed Karpenter.

Informationen zur Ray Serve-API und zu den Bereitstellungskonzepten finden Sie in der Ray-Dokumentation unter Ray Serve: Scalable and Programmable Serving.