

Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.

# Referenz zu Ray-Metriken
<a name="sagemaker-hyperpod-ray-observability-metrics-reference"></a>

Das SageMaker HyperPod Observability-Add-on sammelt die Metriken, die Ray exportiert. Wir fügen Ray-Metriken nicht hinzu, benennen sie nicht um oder entfernen sie nicht, daher entsprechen die Namen und Bezeichnungen der Metriken dem Open-Source-Programm Ray.

In den folgenden Abschnitten sind die Metrikgruppen aufgeführt, die jedes bereitgestellte Dashboard abdeckt. Die Namen, Definitionen und Typen der einzelnen Metriken finden Sie unter [ Ray-Systemmetriken ](https://docs.ray.io/en/latest/ray-observability/reference/system-metrics.html) in der Ray-Dokumentation.

## Ray Core-Metriken
<a name="sagemaker-hyperpod-ray-observability-metrics-reference-core"></a>

Das ** Ray ** Core-Dashboard deckt den Ray-Status auf Systemebene und die Hardware, auf der der Cluster läuft, in den folgenden Gruppen ab:
+ Aufgaben, Akteure und Vermittlungsgruppen
+ Cluster-Ressourcen und Objektspeicher
+ Knotenhardware und Betriebssystem
+ Per-component Nutzung
+ Autoscaler-Status

## Ray Data-Metriken
<a name="sagemaker-hyperpod-ray-observability-metrics-reference-data"></a>

Das ** Ray ** Data-Dashboard deckt den Datendurchsatz, den Aufgabenlebenszyklus, die Iteration und den Speicherbedarf in den folgenden Gruppen ab:
+ Zeilen, Bytes und Blöcke
+ Anzahl und Lebenszyklus der Aufgaben
+ Zähler für andere Operatoren
+ Iteration
+ Objektspeicher und Speicherbudget
+ Cluster-Auslastung und Budgets

## Ray Train-Metriken
<a name="sagemaker-hyperpod-ray-observability-metrics-reference-train"></a>

Das ** Ray ** Train-Dashboard deckt die folgenden Gruppen ab: Trainingslauf und Worker-Status, Checkpoints und Node-Hardware:
+ Run- und Worker-Status
+ Checkpoints und Berichterstattung
+ Node-Hardware und Betriebssystem

## Ray Server-Metriken
<a name="sagemaker-hyperpod-ray-observability-metrics-reference-serve"></a>

Das ** Ray ** Serve-Dashboard deckt Anforderungsrate, Latenz, Fehler und den Zustand der Replikate in den folgenden Gruppen ab:
+ Anfragen und Latenz
+ Fehler und Warteschlangen
+ Zustand von Replikat und Controller
+ Knotenhardware und Clusterstatus

## Beschriftungen für Abfragen
<a name="sagemaker-hyperpod-ray-observability-metrics-reference-query"></a>

Metriken landen in Amazon Managed Service für Prometheus, sodass Sie sie außerhalb von Grafana abfragen können. Der Collector fügt`cluster_name`, und `cluster_id` hinzu. `namespace` Ray fügt hinzu`ray_io_cluster`, was den Ray-Cluster identifiziert und die Bezeichnung ist, auf der die Dashboards gedreht werden.

Weitere Informationen zur Visualisierung dieser Metriken finden Sie unter. [Ray Grafana-Dashboards](sagemaker-hyperpod-ray-observability-dashboards.md)