Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.
Osservabilità dettagliata di Amazon SageMaker AI per gli endpoint di inferenza
L'osservabilità dettagliata è un'esperienza metrica di nuova generazione per gli endpoint di inferenza in tempo reale di Amazon SageMaker AI. Basato su OpenTelemetry (OtEL), raccoglie metriche operative granulari dai livelli di GPU, nodo e framework di inferenza e le pubblica su Amazon CloudWatch con etichette complete tra cui nome dell'endpoint, nome del componente di inferenza, ID dell'istanza, zona di disponibilità e tipo di istanza.
Funzionalità chiave
-
OpenTelemetry-native collezione. Le metriche vengono raccolte utilizzando un OTel Collector che estrae gli endpoint Prometheus da DCGM (metriche GPU), dagli esportatori di nodi (CPU, memoria, disco) e dai contenitori del framework di inferenza (VLLm, Sglang).
-
Etichette dimensionali ricche. Ogni metrica viene pubblicata con etichette come
aws.sagemaker.endpoint.name,,aws.sagemaker.inference_component.name@resource.host.id@resource.cloud.availability_zone, e@resource.host.typeper un filtraggio e un'aggregazione precisi. -
Per-GPU attribuzione. Le metriche GPU (DCGM) includono l'attribuzione per componente di inferenza, che consente di identificare quale modello sta consumando risorse GPU su istanze multi-tenant.
-
Metriche del framework di inferenza. Le metriche native di VLLm e SGlang, tra cui token al secondo, TTFT (time to first token), latenza tra token, utilizzo della cache KV, profondità della coda e dimensione del batch, sono disponibili senza strumentazione personalizzata.
-
Supporto per le query PromQL. Esegui query sui parametri utilizzando la sintassi PromQL in Amazon CloudWatch, CloudWatch Query Studio o Amazon Managed Grafana.
-
Frequenza di scraping configurabile. Controlla la frequenza con cui vengono raccolte le metriche utilizzando
MetricPublishFrequencyInSeconds(valori validi: 10, 30, 60, 120, 180, 240, 300 secondi). Il valore predefinito è 60 secondi. Le metriche del piano di controllo come il ciclo di vita, la scalabilità automatica e la diagnostica ICE sono basate sugli eventi e non sono influenzate da questa impostazione.
Nota
Detailed Observability pubblica i OpenTelemetry parametri (Otel) su Amazon CloudWatch tramite OTLP. Queste non sono metriche di Prometheus. Le metriche sono archiviate nativamente in Amazon CloudWatch come dati metrici OTel e possono essere interrogate utilizzando la sintassi PromQL. PromQL è supportato solo come linguaggio di interrogazione: non è coinvolto alcun server o backend Prometheus. Prometheus-compatible
Cosa è incluso
| Categoria | Metriche | Scope | Frequenza |
|---|---|---|---|
| Quadro di inferenza () vLLM/SGLang | TTFT, ITL, cache KV, profondità della coda, dimensione del batch, TPS, richieste concorrenti | Per-IC per gli endpoint dei componenti di inferenza, per endpoint per le PMI instance/per | Configurabile |
| integrità della GPU (DCGM) | Utilizzo della GPU, utilizzo della copia della memoria, temperatura della GPU | Per-instance, per GPU | Configurabile |
| Integrità del nodo | CPU, memoria, disco, file system | Per-instance | Configurabile |
| Posizionamento dei componenti di inferenza e alta disponibilità | Numero di copie IC, copie per AZ, inclinazione AZ, IC per istanza, istanze per AZ | Per-endpoint | Periodic (Periodico) |
| Ciclo di vita | Tempo di download del modello, tempo di caricamento della GPU, avvio del contenitore, avvio a freddo | Per-IC, per endpoint | Event-driven |
| Dimensionamento automatico | Eventi di scalabilità, latenza E2E, ribilanciamento | Per-endpoint | Event-driven |
| Diagnostica ICE | Conteggio ICE, tipo fallito, AZ non riuscito | Per-endpoint | Event-driven |
Per l'elenco completo, consulta OpenTelemetry riferimento alle metriche.
Architettura e flusso di dati
Ogni istanza di endpoint espone metriche provenienti da più fonti. L'OTel Collector raccoglie queste fonti, arricchisce i dati con etichette contestuali e li esporta nel tuo account Amazon. CloudWatch
-
Il contenitore del modello, l'esportatore DCGM e l'esportatore di nodi espongono le Prometheus-compatible metriche sull'istanza (rispettivamente metriche del framework di inferenza, metriche GPU e metriche). CPU/memory/disk
-
OTel Collector analizza questi endpoint e arricchisce ogni metrica con etichette come il nome dell'endpoint, il nome del componente di inferenza, l'ID dell'istanza e la zona di disponibilità.
-
Le metriche arricchite vengono esportate tramite OTLP su CloudWatch Amazon nel tuo account.
-
Le metriche sono interrogabili tramite ProMQL in Amazon all'indirizzo. CloudWatch
https://monitoring.region.amazonaws.com
Prezzi
Le metriche dettagliate di osservabilità sono incluse senza costi aggiuntivi. Per informazioni sui costi di acquisizione CloudWatch dei dati di Amazon relativi all'arricchimento di Otel, consulta la pagina dei prezzi di Amazon. CloudWatch