Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.
Déploiement d'un modèle avec Ray Serve
Vous déployez un modèle avec une RayService ressource. Le serveConfigV2 champ contient vos applications Serve et leurs déploiements, et KubeRay crée le cluster Ray qui les exécute. HyperPod ne se modifie pas KubeRay, donc une exécution RayService que vous avez déjà exécutée continue de fonctionner.
Un RayService manifeste
Le manifeste suivant exécute une application Serve avec un seul GPU-backed déploiement. import_pathRemplacez-les par le module et l'objet d'application dans votre répertoire de travail.
apiVersion: ray.io/v1 kind: RayService metadata: name: my-service namespace: my-namespace spec: serveConfigV2: | applications: - name: my-app import_path: my_module:app route_prefix: / deployments: - name: Model num_replicas: 2 ray_actor_options: num_gpus: 1 rayClusterConfig: rayVersion: "2.56.1" headGroupSpec: rayStartParams: dashboard-host: "0.0.0.0" template: spec: containers: - name: ray-head image: rayproject/ray:2.56.1 ports: - { containerPort: 8265, name: dashboard } - { containerPort: 8000, name: serve } workerGroupSpecs: - groupName: gpu-workers replicas: 1 rayStartParams: {} template: spec: nodeSelector: node.kubernetes.io/instance-type: ml.g5.xlarge containers: - name: ray-worker image: rayproject/ray:2.56.1-gpu resources: limits: { nvidia.com/gpu: "1" } requests: { cpu: "4", memory: "16Gi", nvidia.com/gpu: "1" }
Postulez et confirmez que le service est prêt :
kubectl apply -f my-service.yaml -n my-namespace kubectl get rayservice my-service -n my-namespace
Atteindre le point final
Ray Serve écoute à port 8000 sur le headpod. Depuis l'intérieur du cluster, envoyez des requêtes au service qui KubeRay crée pour leRayService. Pour des tests rapides, vous pouvez utiliser kubectl port-forward :
kubectl port-forward svc/ray-service-head-svc8000:8000 curl http://localhost:8000/
Pour l'API de déploiement de Serve et la gestion des demandes, consultez l'API Ray Serve