View a markdown version of this page

Risoluzione dei problemi relativi a Ray on HyperPod - Amazon SageMaker AI

Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.

Risoluzione dei problemi relativi a Ray on HyperPod

Usa questa pagina per diagnosticare i problemi più comuni relativi ai cluster, alle dashboard, ai job e all'osservabilità di Ray on. HyperPod Ogni voce fornisce il sintomo, la causa e la risoluzione.

Ray Cluster bloccato in Pending

Caratteristiche

Il caposquadra o il gruppo di lavoratori rimangono Pending e il cluster non arriva mai. Running

Causa

La vCPU o la memoria richiesta è superiore alla capacità allocabile di Kubernetes sul tipo di istanza scelto. L'allocabile è inferiore alla targhetta dell'istanza perché kube-system riserva e consuma parte di ciascun nodo. DaemonSets

Risoluzione

Riduci le richieste di vCPU e memoria in modo che si adattino alla capacità allocabile o scegli un tipo di istanza più grande. Seleziona Allocable with kubectl describe node my-node e imposta le richieste al di sotto dei valori riportati.

ray.init () non riesce con un errore di versione

Caratteristiche

ray.init()fallisce o il cluster si avvia ma i client non possono connettersi.

Causa

La versione di Ray nello spazio o nell'immagine del client non corrisponde spec.rayVersion nel manifesto del cluster.

Risoluzione

Imposta spec.rayVersion la versione Ray nell'immagine del contenitore e usa la stessa versione Ray nello spazio o nel client. Per ulteriori informazioni, consulta Installazione KubeRay su HyperPod Amazon EKS.

Il link alla dashboard restituisce un errore di autorizzazione

Caratteristiche

Il link Ray Dashboard si apre ma restituisce un errore di autorizzazione.

Causa

Secondo la strategia di accesso privato, la dashboard è limitata all'identità che ha creato la connessione. Viene negata un'identità diversa.

Risoluzione

Apri la dashboard con l'identità che ha creato il cluster o utilizza la strategia di accesso pubblico per concedere l'accesso a chiunque disponga dell'autorizzazione di connessione nel namespace. Per ulteriori informazioni, consulta Strategie di accesso e best practice di sicurezza.

Il carico di lavoro Ray non è mai stato ammesso

Caratteristiche

A RayCluster o RayJob rimane non ammesso e non viene creato alcun pod.

Causa

Il namespace non ha un'allocazione di calcolo in HyperPod Task Governance, quindi Task Governance mantiene il carico di lavoro senza alcuna quota per ammetterlo.

Risoluzione

Assegna un'allocazione di calcolo al namespace o inviala a un namespace che ne abbia una. Per ulteriori informazioni, consulta Impostazione della governance delle attività per Ray.

Le dashboard di Grafana sono vuote

Caratteristiche

Le dashboard di Ray Grafana vengono caricate ma non mostrano dati per un cluster in esecuzione.

Causa

Le metriche Ray non sono attivate nel componente aggiuntivo HyperPod Observability, quindi nessuna metrica Ray viene sottoposta a scraping.

Risoluzione

Attiva le metriche Ray nel componente aggiuntivo Observability e verifica che la versione del componente aggiuntivo supporti il Ray metric scraping. Per ulteriori informazioni, consulta Impostazione della raccolta di metriche Ray.

L'invio del lavoro non riesce a raggiungere l'endpoint

Caratteristiche

ray job submitnon riesce a connettersi o restituisce un errore di autorizzazione.

Causa

L'endpoint di invio del lavoro non è raggiungibile o il token di sessione è scaduto. Una sessione di dashboard o endpoint è valida per un massimo di sei ore.

Risoluzione

Conferma l'indirizzo dell'endpoint, quindi genera un nuovo URL di connessione per aggiornare il token e riprovare. Per ulteriori informazioni, consulta Generazione di un URL di connessione al dashboard.