

Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.

# Observabilité détaillée d'Amazon SageMaker AI pour les points de terminaison d'inférence
<a name="monitoring-cloudwatch-detailed-observability"></a>

L'observabilité détaillée est une expérience métrique de nouvelle génération pour les points de terminaison d'inférence en temps réel d'Amazon SageMaker AI. Construit sur OpenTelemetry (OTel), il collecte des métriques opérationnelles détaillées à partir des couches du GPU, des nœuds et du framework d'inférence et les publie sur Amazon CloudWatch avec des étiquettes détaillées, notamment le nom du point de terminaison, le nom du composant d'inférence, l'ID d'instance, la zone de disponibilité et le type d'instance.

## Capacités clés
<a name="detailed-observability-capabilities"></a>
+ **OpenTelemetry-native collection**. Les métriques sont collectées à l'aide d'un collecteur OTel qui extrait les points de terminaison Prometheus du DCGM (métriques du GPU), des exportateurs de nœuds (CPU, mémoire, disque) et des conteneurs du framework d'inférence (vLLM, SGlang).
+ **Étiquettes dimensionnelles riches**. Chaque métrique est publiée avec des étiquettes telles que`aws.sagemaker.endpoint.name`,`aws.sagemaker.inference_component.name`, `@resource.host.id``@resource.cloud.availability_zone`, et `@resource.host.type` pour un filtrage et une agrégation précis.
+ **Per-GPU attribution**. Les métriques GPU (DCGM) incluent l'attribution par composant d'inférence, ce qui vous permet d'identifier le modèle consommant des ressources GPU sur des instances multi-locataires.
+ **Métriques du cadre d'inférence**. Les métriques natives vLLM et SGlang, notamment le nombre de jetons par seconde, le délai jusqu'au premier jeton (TTFT), la latence entre les jetons, l'utilisation du cache KV, la profondeur de la file d'attente et la taille des lots, sont disponibles sans instrumentation personnalisée.
+ Support des **requêtes ProMQL**. Interrogez les métriques à l'aide de la syntaxe ProMQL dans Amazon CloudWatch, CloudWatch Query Studio ou Amazon Managed Grafana.
+ **Fréquence de raclage configurable**. Contrôlez la fréquence à laquelle les métriques sont collectées à l'aide de `MetricPublishFrequencyInSeconds` (valeurs valides : 10, 30, 60, 120, 180, 240, 300 secondes). Par défaut, il est de 60 secondes. Les indicateurs du plan de contrôle tels que le cycle de vie, le dimensionnement automatique et les diagnostics ICE sont pilotés par les événements et ne sont pas affectés par ce paramètre.

**Note**  
L'observabilité détaillée publie des métriques OpenTelemetry (OTel) sur Amazon CloudWatch via OTLP. Ce *ne sont pas des indicateurs* de Prometheus. Les métriques sont stockées nativement dans Amazon CloudWatch sous forme de données métriques OTel et peuvent être interrogées à l'aide de la syntaxe ProMQL. ProMQL est uniquement pris en charge en tant que langage de requête : aucun serveur ou backend Prometheus n'est impliqué. Prometheus-compatible

## Ce qui est inclus
<a name="detailed-observability-whats-included"></a>


**Catégories de métriques d'observabilité détaillées**  

| Catégorie | Métriques | Scope | Frequency (Fréquence) | 
| --- | --- | --- | --- | 
| Cadre d'inférence () vLLM/SGLang | TTFT, ITL, cache KV, profondeur de file d'attente, taille du lot, TPS, demandes simultanées | Per-IC pour les points de terminaison des composants d'inférence, par point de terminaison pour les instance/per PME | Configurable | 
| État du GPU (DCGM) | Utilisation du processeur graphique, utilisation des copies de mémoire, température du processeur graphique | Per-instance, par GPU | Configurable | 
| État du nœud | CPU, mémoire, disque, système de fichiers | Per-instance | Configurable | 
| Placement des composants d'inférence et haute disponibilité | Nombre de copies d'IC, copies par AZ, asymétrie AZ, IC par instance, instances par AZ | Per-endpoint | Périodique | 
| Cycle de vie | Temps de téléchargement du modèle, temps de chargement du GPU, démarrage du conteneur, démarrage à froid | Per-IC, par point de terminaison | Event-driven | 
| Autoscaling | Événements de dimensionnement, latence E2E, rééquilibrage | Per-endpoint | Event-driven | 
| Diagnostic ICE | Nombre d'ICE, type défaillant, échec AZ | Per-endpoint | Event-driven | 

Pour en obtenir la liste complète, consultez [OpenTelemetry référence des métriques](inference-monitoring.md).

## Architecture et flux de données
<a name="detailed-observability-architecture"></a>

![Schéma d'architecture montrant le pipeline de collecte de métriques pour une observabilité détaillée.](http://docs.aws.amazon.com/fr_fr/sagemaker/latest/dg/images/SageMaker Observability/Observability_Architecture.png)


Chaque instance de point de terminaison expose des métriques provenant de plusieurs sources. L'OTel Collector extrait ces sources, enrichit les données avec des étiquettes contextuelles et les exporte vers votre compte Amazon CloudWatch .

1. **Le conteneur de modèles**, l'**exportateur DCGM** et l'**exportateur de nœuds** exposent les Prometheus-compatible métriques sur l'instance (métriques du framework d'inférence, métriques GPU et CPU/memory/disk métriques respectivement).

1. **OTel Collector** supprime ces points de terminaison et enrichit chaque métrique avec des étiquettes telles que le nom du point de terminaison, le nom du composant d'inférence, l'ID de l'instance et la zone de disponibilité.

1. Les métriques enrichies sont exportées via OTLP vers Amazon CloudWatch dans votre compte.

1. Les métriques peuvent être consultées via ProMQL sur Amazon à l'adresse. CloudWatch `https://monitoring.{{region}}.amazonaws.com`

## Tarification
<a name="detailed-observability-pricing"></a>

Des mesures d'observabilité détaillées sont incluses sans frais supplémentaires. Pour plus d'informations sur les coûts d'ingestion de CloudWatch données d'Amazon liés à l'enrichissement en OTel, consultez [Amazon CloudWatch Pricing](https://aws.amazon.com/cloudwatch/pricing/).