View a markdown version of this page

Riferimento alle metriche di Ray - Amazon SageMaker AI

Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.

Riferimento alle metriche di Ray

L'add-on SageMaker HyperPod Observability raccoglie le metriche esportate da Ray. Non aggiungiamo, rinominiamo o rimuoviamo le metriche Ray, quindi i nomi e le etichette delle metriche corrispondono a Ray open source.

Le sezioni seguenti elencano i gruppi di metriche coperti da ciascun dashboard fornito. Per i nomi, le definizioni e i tipi delle singole metriche, vedi le metriche del sistema Ray nella documentazione di Ray.

Metriche Ray Core

La dashboard Ray Core descrive lo stato di Ray a livello di sistema e l'hardware su cui viene eseguito il cluster, tra questi gruppi:

  • Attività, attori e gruppi di collocamento

  • Risorse del cluster e archivio di oggetti

  • Hardware e sistema operativo dei nodi

  • Per-component utilizzo

  • stato di Autoscaler

Metriche Ray Data

La dashboard di Ray Data copre la velocità effettiva dei set di dati, il ciclo di vita delle attività, l'iterazione e la pressione della memoria, tra questi gruppi:

  • Righe, byte e blocchi

  • Numero di attività e ciclo di vita

  • Altri contatori per operatori

  • Iterazione

  • Archiviazione di oggetti e budget di memoria

  • Utilizzo e budget dei cluster

Metriche Ray Train

La dashboard di Ray Train illustra lo stato della formazione, l'esecuzione e lo stato dei lavoratori, il checkpoint e l'hardware dei nodi, nei seguenti gruppi:

  • Stato di esecuzione e di lavoro

  • Checkpoint e creazione di report

  • Hardware e sistema operativo del nodo

Metriche Ray Serve

La dashboard di Ray Serve copre la frequenza delle richieste, la latenza, gli errori e lo stato delle repliche, in questi gruppi:

  • Richieste e latenza

  • Errori e code

  • Stato della replica e del controller

  • Hardware del nodo e stato del cluster

Etichette per l'interrogazione

Le metriche vengono inserite in Amazon Managed Service for Prometheus, quindi puoi interrogarle all'esterno di Grafana. Il raccoglitore aggiunge,, e. cluster_name cluster_id namespace Ray aggiungeray_io_cluster, che identifica il cluster Ray ed è l'etichetta su cui ruotano i dashboard.

Per ulteriori informazioni sulla visualizzazione di queste metriche, consulta. Dashboard Ray Grafana