Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.
Detaillierte Beobachtbarkeit von Amazon SageMaker AI für Inferenzendpunkte
Detailed Observability ist ein Metrikerlebnis der nächsten Generation für Amazon SageMaker AI-Inferenzendpunkte in Echtzeit. Es basiert auf OpenTelemetry (OTel) und sammelt detaillierte Betriebsmetriken aus GPU-, Knoten- und Inferenz-Framework-Ebenen und veröffentlicht sie auf Amazon CloudWatch mit umfangreichen Labels wie Endpunktname, Name der Inferenzkomponente, Instanz-ID, Verfügbarkeitszone und Instanztyp.
Die wichtigsten Funktionen
-
OpenTelemetry-native Sammlung. Metriken werden mithilfe eines OTel Collectors erfasst, der Prometheus-Endpunkte aus DCGM (GPU-Metriken), Node-Exportern (CPU, Speicher, Festplatte) und Inferenz-Framework-Containern (vLLM, SGLang) extrahiert.
-
Etiketten mit reichhaltigen Abmessungen. Jede Metrik wird mit Bezeichnungen wie
aws.sagemaker.endpoint.name,,aws.sagemaker.inference_component.name@resource.host.id@resource.cloud.availability_zone, und@resource.host.typezur präzisen Filterung und Aggregation veröffentlicht. -
Per-GPU Zuordnung. GPU-Metriken (DCGM) beinhalten die Zuordnung pro Inferenzkomponente, sodass Sie feststellen können, welches Modell GPU-Ressourcen auf Multi-Tenant-Instances verbraucht.
-
Metriken für das Inferenz-Framework. Systemeigene VLLM- und SGLang-Metriken — einschließlich Tokens pro Sekunde, Time to First Token (TTFT), Latenz zwischen Tokens, KV-Cache-Auslastung, Warteschlangentiefe und Batchgröße — sind ohne benutzerdefinierte Instrumentierung verfügbar.
-
Unterstützung für PromQL-Abfragen. Fragen Sie Metriken mithilfe der PromQL-Syntax in Amazon CloudWatch, CloudWatch Query Studio oder Amazon Managed Grafana ab.
-
Konfigurierbare Scrape-Frequenz. Steuern Sie mithilfe von
MetricPublishFrequencyInSeconds(gültige Werte: 10, 30, 60, 120, 180, 240, 300 Sekunden), wie oft Metriken erfasst werden. Standard ist 60 Sekunde. Metriken der Kontrollebene wie Lebenszyklus, Autoscaling und ICE-Diagnose sind ereignisgesteuert und werden von dieser Einstellung nicht beeinflusst.
Anmerkung
Detailed Observability veröffentlicht OpenTelemetry (oTEL) -Metriken CloudWatch über OTLP an Amazon. Dies sind keine Prometheus-Metriken. Die Metriken werden nativ in Amazon CloudWatch als oTEL-Metrikdaten gespeichert und können mithilfe der PromQL-Syntax abgefragt werden. PromQL wird nur als Abfragesprache unterstützt — es ist kein Prometheus-Server oder Prometheus-compatible -Backend beteiligt.
Was ist enthalten?
| Kategorie | Kennzahlen | Scope | Frequency (Frequenz) |
|---|---|---|---|
| Inferenzrahmen () vLLM/SGLang | TTFT, ITL, KV-Cache, Warteschlangentiefe, Batchgröße, TPS, gleichzeitige Anfragen | Per-IC für Endpunkte von Inferenzkomponenten, pro Endpunkt für KMU instance/per | Konfigurierbar |
| GPU-Zustand (DCGM) | GPU-Auslastung, Auslastung von Speicherkopien, GPU-Temperatur | Per-instance, pro GPU | Konfigurierbar |
| Knotenintegrität | CPU, Speicher, Festplatte, Dateisystem | Per-instance | Konfigurierbar |
| Platzierung der Inferenzkomponenten und hohe Verfügbarkeit | Anzahl der IC-Kopien, Kopien pro AZ, AZ-Schräglage, IC pro Instanz, Instanzen pro AZ | Per-endpoint | Regelmäßig |
| Lebenszyklus | Download-Zeit des Modells, GPU-Ladezeit, Container-Start, Kaltstart | Per-IC, pro Endpunkt | Event-driven |
| Auto Scaling | Skalierung von Ereignissen, E2E-Latenz, Neuausrichtung | Per-endpoint | Event-driven |
| ICE-Diagnose | ICE-Anzahl, fehlgeschlagener Typ, fehlgeschlagene AZ | Per-endpoint | Event-driven |
Die vollständige Liste finden Sie unter OpenTelemetry Referenz zu Metriken.
Architektur und Datenfluss
Jede Endpunktinstanz stellt Metriken aus mehreren Quellen zur Verfügung. Der OTel Collector scannt diese Quellen, reichert die Daten mit Kontext-Labels an und exportiert sie in Ihr CloudWatch Amazon-Konto.
-
Model-Container, DCGM-Exporter und Node-Exporter stellen Prometheus-compatible Metriken für die Instance bereit (jeweils Inferenz-Framework-Metriken, GPU-Metriken und Metriken). CPU/memory/disk
-
oTEL Collector scannt diese Endpunkte und reichert jede Metrik mit Bezeichnungen wie Endpunktname, Name der Inferenzkomponente, Instanz-ID und Verfügbarkeitszone an.
-
Angereicherte Metriken werden über OTLP zu Amazon CloudWatch in Ihrem Konto exportiert.
-
Metriken können über PromQL in Amazon unter abgefragt werden. CloudWatch
https://monitoring.region.amazonaws.com
Preisgestaltung
Detaillierte Messdaten zur Beobachtbarkeit sind ohne zusätzliche Kosten enthalten. Informationen zu den Kosten für die CloudWatch Datenaufnahme durch Amazon im Zusammenhang mit der oTEL-Anreicherung finden Sie unter Amazon-Preise. CloudWatch