

Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.

# Déploiement d'un modèle avec Ray Serve
<a name="sagemaker-hyperpod-ray-deploy-model"></a>

Vous déployez un modèle avec une `RayService` ressource. Le `serveConfigV2` champ contient vos applications Serve et leurs déploiements, et KubeRay crée le cluster Ray qui les exécute. HyperPod ne se modifie pas KubeRay, donc une exécution `RayService` que vous avez déjà exécutée continue de fonctionner.

## Un RayService manifeste
<a name="sagemaker-hyperpod-ray-deploy-model-manifest"></a>

Le manifeste suivant exécute une application Serve avec un seul GPU-backed déploiement. `import_path`Remplacez-les par le module et l'objet d'application dans votre répertoire de travail.

```
apiVersion: ray.io/v1
kind: RayService
metadata:
  name: my-service
  namespace: my-namespace
spec:
  serveConfigV2: |
    applications:
      - name: my-app
        import_path: my_module:app
        route_prefix: /
        deployments:
          - name: Model
            num_replicas: 2
            ray_actor_options:
              num_gpus: 1
  rayClusterConfig:
    rayVersion: "2.56.1"
    headGroupSpec:
      rayStartParams:
        dashboard-host: "0.0.0.0"
      template:
        spec:
          containers:
            - name: ray-head
              image: rayproject/ray:2.56.1
              ports:
                - { containerPort: 8265, name: dashboard }
                - { containerPort: 8000, name: serve }
    workerGroupSpecs:
      - groupName: gpu-workers
        replicas: 1
        rayStartParams: {}
        template:
          spec:
            nodeSelector:
              node.kubernetes.io/instance-type: ml.g5.xlarge
            containers:
              - name: ray-worker
                image: rayproject/ray:2.56.1-gpu
                resources:
                  limits: { nvidia.com/gpu: "1" }
                  requests: { cpu: "4", memory: "16Gi", nvidia.com/gpu: "1" }
```

Postulez et confirmez que le service est prêt :

```
kubectl apply -f my-service.yaml -n my-namespace
kubectl get rayservice my-service -n my-namespace
```

## Atteindre le point final
<a name="sagemaker-hyperpod-ray-deploy-model-endpoint"></a>

Ray Serve écoute à port `8000` sur le headpod. Depuis l'intérieur du cluster, envoyez des requêtes au service qui KubeRay crée pour le`RayService`. Pour des tests rapides, vous pouvez utiliser `kubectl port-forward` :

```
kubectl port-forward svc/{{ray-service-head-svc}} 8000:8000
curl http://localhost:8000/
```

Pour l'API de déploiement de Serve et la gestion des demandes, consultez l'API [ Ray Serve ](https://docs.ray.io/en/latest/serve/api/index.html) dans la documentation Ray.