

Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.

# Risoluzione dei problemi relativi a Ray on HyperPod
<a name="sagemaker-hyperpod-ray-troubleshooting"></a>

Usa questa pagina per diagnosticare i problemi più comuni relativi ai cluster, alle dashboard, ai job e all'osservabilità di Ray on. HyperPod Ogni voce fornisce il sintomo, la causa e la risoluzione.

## Ray Cluster bloccato in Pending
<a name="sagemaker-hyperpod-ray-troubleshooting-pending"></a>

**Caratteristiche**  
Il caposquadra o il gruppo di lavoratori rimangono `Pending` e il cluster non arriva mai. `Running`

**Causa**  
La vCPU o la memoria richiesta è superiore alla capacità allocabile di Kubernetes sul tipo di istanza scelto. L'allocabile è inferiore alla targhetta dell'istanza perché kube-system riserva e consuma parte di ciascun nodo. DaemonSets 

**Risoluzione**  
Riduci le richieste di vCPU e memoria in modo che si adattino alla capacità allocabile o scegli un tipo di istanza più grande. Seleziona Allocable with `kubectl describe node {{my-node}}` e imposta le richieste al di sotto dei valori riportati.

## ray.init () non riesce con un errore di versione
<a name="sagemaker-hyperpod-ray-troubleshooting-version"></a>

**Caratteristiche**  
`ray.init()`fallisce o il cluster si avvia ma i client non possono connettersi.

**Causa**  
La versione di Ray nello spazio o nell'immagine del client non corrisponde `spec.rayVersion` nel manifesto del cluster.

**Risoluzione**  
Imposta `spec.rayVersion` la versione Ray nell'immagine del contenitore e usa la stessa versione Ray nello spazio o nel client. Per ulteriori informazioni, consulta [Installazione KubeRay su HyperPod Amazon EKS](sagemaker-hyperpod-ray-install-kuberay.md).

## Il link alla dashboard restituisce un errore di autorizzazione
<a name="sagemaker-hyperpod-ray-troubleshooting-dashboard-auth"></a>

**Caratteristiche**  
Il link Ray Dashboard si apre ma restituisce un errore di autorizzazione.

**Causa**  
Secondo la strategia di accesso privato, la dashboard è limitata all'identità che ha creato la connessione. Viene negata un'identità diversa.

**Risoluzione**  
Apri la dashboard con l'identità che ha creato il cluster o utilizza la strategia di accesso pubblico per concedere l'accesso a chiunque disponga dell'autorizzazione di connessione nel namespace. Per ulteriori informazioni, consulta [Strategie di accesso e best practice di sicurezza](sagemaker-hyperpod-ray-dashboard-access-strategies.md).

## Il carico di lavoro Ray non è mai stato ammesso
<a name="sagemaker-hyperpod-ray-troubleshooting-not-admitted"></a>

**Caratteristiche**  
A `RayCluster` o `RayJob` rimane non ammesso e non viene creato alcun pod.

**Causa**  
Il namespace non ha un'allocazione di calcolo in HyperPod Task Governance, quindi Task Governance mantiene il carico di lavoro senza alcuna quota per ammetterlo.

**Risoluzione**  
Assegna un'allocazione di calcolo al namespace o inviala a un namespace che ne abbia una. Per ulteriori informazioni, consulta [Impostazione della governance delle attività per Ray](sagemaker-hyperpod-ray-task-governance-setup.md).

## Le dashboard di Grafana sono vuote
<a name="sagemaker-hyperpod-ray-troubleshooting-grafana-empty"></a>

**Caratteristiche**  
Le dashboard di Ray Grafana vengono caricate ma non mostrano dati per un cluster in esecuzione.

**Causa**  
Le metriche Ray non sono attivate nel componente aggiuntivo HyperPod Observability, quindi nessuna metrica Ray viene sottoposta a scraping.

**Risoluzione**  
Attiva le metriche Ray nel componente aggiuntivo Observability e verifica che la versione del componente aggiuntivo supporti il Ray metric scraping. Per ulteriori informazioni, consulta [Impostazione della raccolta di metriche Ray](sagemaker-hyperpod-ray-observability-setup.md).

## L'invio del lavoro non riesce a raggiungere l'endpoint
<a name="sagemaker-hyperpod-ray-troubleshooting-job-endpoint"></a>

**Caratteristiche**  
`ray job submit`non riesce a connettersi o restituisce un errore di autorizzazione.

**Causa**  
L'endpoint di invio del lavoro non è raggiungibile o il token di sessione è scaduto. Una sessione di dashboard o endpoint è valida per un massimo di sei ore.

**Risoluzione**  
Conferma l'indirizzo dell'endpoint, quindi genera un nuovo URL di connessione per aggiornare il token e riprovare. Per ulteriori informazioni, consulta [Generazione di un URL di connessione al dashboard](sagemaker-hyperpod-ray-dashboard-connection-url.md).