

Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.

# Osservabilità dettagliata di Amazon SageMaker AI per gli endpoint di inferenza
<a name="monitoring-cloudwatch-detailed-observability"></a>

L'osservabilità dettagliata è un'esperienza metrica di nuova generazione per gli endpoint di inferenza in tempo reale di Amazon SageMaker AI. Basato su OpenTelemetry (OtEL), raccoglie metriche operative granulari dai livelli di GPU, nodo e framework di inferenza e le pubblica su Amazon CloudWatch con etichette complete tra cui nome dell'endpoint, nome del componente di inferenza, ID dell'istanza, zona di disponibilità e tipo di istanza.

## Funzionalità chiave
<a name="detailed-observability-capabilities"></a>
+ **OpenTelemetry-native collezione**. Le metriche vengono raccolte utilizzando un OTel Collector che estrae gli endpoint Prometheus da DCGM (metriche GPU), dagli esportatori di nodi (CPU, memoria, disco) e dai contenitori del framework di inferenza (VLLm, Sglang).
+ **Etichette dimensionali ricche.** Ogni metrica viene pubblicata con etichette come`aws.sagemaker.endpoint.name`,, `aws.sagemaker.inference_component.name` `@resource.host.id``@resource.cloud.availability_zone`, e `@resource.host.type` per un filtraggio e un'aggregazione precisi.
+ **Per-GPU attribuzione.** Le metriche GPU (DCGM) includono l'attribuzione per componente di inferenza, che consente di identificare quale modello sta consumando risorse GPU su istanze multi-tenant.
+ **Metriche** del framework di inferenza. Le metriche native di VLLm e SGlang, tra cui token al secondo, TTFT (time to first token), latenza tra token, utilizzo della cache KV, profondità della coda e dimensione del batch, sono disponibili senza strumentazione personalizzata.
+ **Supporto** per le query PromQL. Esegui query sui parametri utilizzando la sintassi PromQL in Amazon CloudWatch, CloudWatch Query Studio o Amazon Managed Grafana.
+ **Frequenza di scraping configurabile.** Controlla la frequenza con cui vengono raccolte le metriche utilizzando `MetricPublishFrequencyInSeconds` (valori validi: 10, 30, 60, 120, 180, 240, 300 secondi). Il valore predefinito è 60 secondi. Le metriche del piano di controllo come il ciclo di vita, la scalabilità automatica e la diagnostica ICE sono basate sugli eventi e non sono influenzate da questa impostazione.

**Nota**  
Detailed Observability pubblica i OpenTelemetry parametri (Otel) su Amazon CloudWatch tramite OTLP. Queste *non sono metriche* di Prometheus. Le metriche sono archiviate nativamente in Amazon CloudWatch come dati metrici OTel e possono essere interrogate utilizzando la sintassi PromQL. PromQL è supportato solo come linguaggio di interrogazione: non è coinvolto alcun server o backend Prometheus. Prometheus-compatible

## Cosa è incluso
<a name="detailed-observability-whats-included"></a>


**Categorie metriche dettagliate di osservabilità**  

| Categoria | Metriche | Scope | Frequenza | 
| --- | --- | --- | --- | 
| Quadro di inferenza () vLLM/SGLang | TTFT, ITL, cache KV, profondità della coda, dimensione del batch, TPS, richieste concorrenti | Per-IC per gli endpoint dei componenti di inferenza, per endpoint per le PMI instance/per | Configurabile | 
| integrità della GPU (DCGM) | Utilizzo della GPU, utilizzo della copia della memoria, temperatura della GPU | Per-instance, per GPU | Configurabile | 
| Integrità del nodo | CPU, memoria, disco, file system | Per-instance | Configurabile | 
| Posizionamento dei componenti di inferenza e alta disponibilità | Numero di copie IC, copie per AZ, inclinazione AZ, IC per istanza, istanze per AZ | Per-endpoint | Periodic (Periodico) | 
| Ciclo di vita | Tempo di download del modello, tempo di caricamento della GPU, avvio del contenitore, avvio a freddo | Per-IC, per endpoint | Event-driven | 
| Dimensionamento automatico | Eventi di scalabilità, latenza E2E, ribilanciamento | Per-endpoint | Event-driven | 
| Diagnostica ICE | Conteggio ICE, tipo fallito, AZ non riuscito | Per-endpoint | Event-driven | 

Per l'elenco completo, consulta [OpenTelemetry riferimento alle metriche](inference-monitoring.md).

## Architettura e flusso di dati
<a name="detailed-observability-architecture"></a>

![Diagramma di architettura che mostra la pipeline di raccolta delle metriche per un'osservabilità dettagliata.](http://docs.aws.amazon.com/it_it/sagemaker/latest/dg/images/SageMaker Observability/Observability_Architecture.png)


Ogni istanza di endpoint espone metriche provenienti da più fonti. L'OTel Collector raccoglie queste fonti, arricchisce i dati con etichette contestuali e li esporta nel tuo account Amazon. CloudWatch 

1. **Il contenitore del modello**, l'esportatore **DCGM e l'esportatore** di **nodi** espongono le Prometheus-compatible metriche sull'istanza (rispettivamente metriche del framework di inferenza, metriche GPU e metriche). CPU/memory/disk 

1. **OTel Collector** analizza questi endpoint e arricchisce ogni metrica con etichette come il nome dell'endpoint, il nome del componente di inferenza, l'ID dell'istanza e la zona di disponibilità.

1. Le metriche arricchite vengono esportate tramite OTLP su CloudWatch Amazon nel tuo account.

1. Le metriche sono interrogabili tramite ProMQL in Amazon all'indirizzo. CloudWatch `https://monitoring.{{region}}.amazonaws.com`

## Prezzi
<a name="detailed-observability-pricing"></a>

Le metriche dettagliate di osservabilità sono incluse senza costi aggiuntivi. [Per informazioni sui costi di acquisizione CloudWatch dei dati di Amazon relativi all'arricchimento di Otel, consulta la pagina dei prezzi di Amazon. CloudWatch ](https://aws.amazon.com/cloudwatch/pricing/)