View a markdown version of this page

Osservabilità dettagliata di Amazon SageMaker AI per gli endpoint di inferenza - Amazon SageMaker AI

Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.

Osservabilità dettagliata di Amazon SageMaker AI per gli endpoint di inferenza

L'osservabilità dettagliata è un'esperienza metrica di nuova generazione per gli endpoint di inferenza in tempo reale di Amazon SageMaker AI. Basato su OpenTelemetry (OtEL), raccoglie metriche operative granulari dai livelli di GPU, nodo e framework di inferenza e le pubblica su Amazon CloudWatch con etichette complete tra cui nome dell'endpoint, nome del componente di inferenza, ID dell'istanza, zona di disponibilità e tipo di istanza.

Funzionalità chiave

  • OpenTelemetry-native collezione. Le metriche vengono raccolte utilizzando un OTel Collector che estrae gli endpoint Prometheus da DCGM (metriche GPU), dagli esportatori di nodi (CPU, memoria, disco) e dai contenitori del framework di inferenza (VLLm, Sglang).

  • Etichette dimensionali ricche. Ogni metrica viene pubblicata con etichette comeaws.sagemaker.endpoint.name,, aws.sagemaker.inference_component.name @resource.host.id@resource.cloud.availability_zone, e @resource.host.type per un filtraggio e un'aggregazione precisi.

  • Per-GPU attribuzione. Le metriche GPU (DCGM) includono l'attribuzione per componente di inferenza, che consente di identificare quale modello sta consumando risorse GPU su istanze multi-tenant.

  • Metriche del framework di inferenza. Le metriche native di VLLm e SGlang, tra cui token al secondo, TTFT (time to first token), latenza tra token, utilizzo della cache KV, profondità della coda e dimensione del batch, sono disponibili senza strumentazione personalizzata.

  • Supporto per le query PromQL. Esegui query sui parametri utilizzando la sintassi PromQL in Amazon CloudWatch, CloudWatch Query Studio o Amazon Managed Grafana.

  • Frequenza di scraping configurabile. Controlla la frequenza con cui vengono raccolte le metriche utilizzando MetricPublishFrequencyInSeconds (valori validi: 10, 30, 60, 120, 180, 240, 300 secondi). Il valore predefinito è 60 secondi. Le metriche del piano di controllo come il ciclo di vita, la scalabilità automatica e la diagnostica ICE sono basate sugli eventi e non sono influenzate da questa impostazione.

Nota

Detailed Observability pubblica i OpenTelemetry parametri (Otel) su Amazon CloudWatch tramite OTLP. Queste non sono metriche di Prometheus. Le metriche sono archiviate nativamente in Amazon CloudWatch come dati metrici OTel e possono essere interrogate utilizzando la sintassi PromQL. PromQL è supportato solo come linguaggio di interrogazione: non è coinvolto alcun server o backend Prometheus. Prometheus-compatible

Cosa è incluso

Categorie metriche dettagliate di osservabilità
Categoria Metriche Scope Frequenza
Quadro di inferenza () vLLM/SGLang TTFT, ITL, cache KV, profondità della coda, dimensione del batch, TPS, richieste concorrenti Per-IC per gli endpoint dei componenti di inferenza, per endpoint per le PMI instance/per Configurabile
integrità della GPU (DCGM) Utilizzo della GPU, utilizzo della copia della memoria, temperatura della GPU Per-instance, per GPU Configurabile
Integrità del nodo CPU, memoria, disco, file system Per-instance Configurabile
Posizionamento dei componenti di inferenza e alta disponibilità Numero di copie IC, copie per AZ, inclinazione AZ, IC per istanza, istanze per AZ Per-endpoint Periodic (Periodico)
Ciclo di vita Tempo di download del modello, tempo di caricamento della GPU, avvio del contenitore, avvio a freddo Per-IC, per endpoint Event-driven
Dimensionamento automatico Eventi di scalabilità, latenza E2E, ribilanciamento Per-endpoint Event-driven
Diagnostica ICE Conteggio ICE, tipo fallito, AZ non riuscito Per-endpoint Event-driven

Per l'elenco completo, consulta OpenTelemetry riferimento alle metriche.

Architettura e flusso di dati

Diagramma di architettura che mostra la pipeline di raccolta delle metriche per un'osservabilità dettagliata.

Ogni istanza di endpoint espone metriche provenienti da più fonti. L'OTel Collector raccoglie queste fonti, arricchisce i dati con etichette contestuali e li esporta nel tuo account Amazon. CloudWatch

  1. Il contenitore del modello, l'esportatore DCGM e l'esportatore di nodi espongono le Prometheus-compatible metriche sull'istanza (rispettivamente metriche del framework di inferenza, metriche GPU e metriche). CPU/memory/disk

  2. OTel Collector analizza questi endpoint e arricchisce ogni metrica con etichette come il nome dell'endpoint, il nome del componente di inferenza, l'ID dell'istanza e la zona di disponibilità.

  3. Le metriche arricchite vengono esportate tramite OTLP su CloudWatch Amazon nel tuo account.

  4. Le metriche sono interrogabili tramite ProMQL in Amazon all'indirizzo. CloudWatch https://monitoring.region.amazonaws.com

Prezzi

Le metriche dettagliate di osservabilità sono incluse senza costi aggiuntivi. Per informazioni sui costi di acquisizione CloudWatch dei dati di Amazon relativi all'arricchimento di Otel, consulta la pagina dei prezzi di Amazon. CloudWatch