View a markdown version of this page

Observabilité détaillée d'Amazon SageMaker AI pour les points de terminaison d'inférence - Amazon SageMaker AI

Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.

Observabilité détaillée d'Amazon SageMaker AI pour les points de terminaison d'inférence

L'observabilité détaillée est une expérience métrique de nouvelle génération pour les points de terminaison d'inférence en temps réel d'Amazon SageMaker AI. Construit sur OpenTelemetry (OTel), il collecte des métriques opérationnelles détaillées à partir des couches du GPU, des nœuds et du framework d'inférence et les publie sur Amazon CloudWatch avec des étiquettes détaillées, notamment le nom du point de terminaison, le nom du composant d'inférence, l'ID d'instance, la zone de disponibilité et le type d'instance.

Capacités clés

  • OpenTelemetry-native collection. Les métriques sont collectées à l'aide d'un collecteur OTel qui extrait les points de terminaison Prometheus du DCGM (métriques du GPU), des exportateurs de nœuds (CPU, mémoire, disque) et des conteneurs du framework d'inférence (vLLM, SGlang).

  • Étiquettes dimensionnelles riches. Chaque métrique est publiée avec des étiquettes telles queaws.sagemaker.endpoint.name,aws.sagemaker.inference_component.name, @resource.host.id@resource.cloud.availability_zone, et @resource.host.type pour un filtrage et une agrégation précis.

  • Per-GPU attribution. Les métriques GPU (DCGM) incluent l'attribution par composant d'inférence, ce qui vous permet d'identifier le modèle consommant des ressources GPU sur des instances multi-locataires.

  • Métriques du cadre d'inférence. Les métriques natives vLLM et SGlang, notamment le nombre de jetons par seconde, le délai jusqu'au premier jeton (TTFT), la latence entre les jetons, l'utilisation du cache KV, la profondeur de la file d'attente et la taille des lots, sont disponibles sans instrumentation personnalisée.

  • Support des requêtes ProMQL. Interrogez les métriques à l'aide de la syntaxe ProMQL dans Amazon CloudWatch, CloudWatch Query Studio ou Amazon Managed Grafana.

  • Fréquence de raclage configurable. Contrôlez la fréquence à laquelle les métriques sont collectées à l'aide de MetricPublishFrequencyInSeconds (valeurs valides : 10, 30, 60, 120, 180, 240, 300 secondes). Par défaut, il est de 60 secondes. Les indicateurs du plan de contrôle tels que le cycle de vie, le dimensionnement automatique et les diagnostics ICE sont pilotés par les événements et ne sont pas affectés par ce paramètre.

Note

L'observabilité détaillée publie des métriques OpenTelemetry (OTel) sur Amazon CloudWatch via OTLP. Ce ne sont pas des indicateurs de Prometheus. Les métriques sont stockées nativement dans Amazon CloudWatch sous forme de données métriques OTel et peuvent être interrogées à l'aide de la syntaxe ProMQL. ProMQL est uniquement pris en charge en tant que langage de requête : aucun serveur ou backend Prometheus n'est impliqué. Prometheus-compatible

Ce qui est inclus

Catégories de métriques d'observabilité détaillées
Catégorie Métriques Scope Frequency (Fréquence)
Cadre d'inférence () vLLM/SGLang TTFT, ITL, cache KV, profondeur de file d'attente, taille du lot, TPS, demandes simultanées Per-IC pour les points de terminaison des composants d'inférence, par point de terminaison pour les instance/per PME Configurable
État du GPU (DCGM) Utilisation du processeur graphique, utilisation des copies de mémoire, température du processeur graphique Per-instance, par GPU Configurable
État du nœud CPU, mémoire, disque, système de fichiers Per-instance Configurable
Placement des composants d'inférence et haute disponibilité Nombre de copies d'IC, copies par AZ, asymétrie AZ, IC par instance, instances par AZ Per-endpoint Périodique
Cycle de vie Temps de téléchargement du modèle, temps de chargement du GPU, démarrage du conteneur, démarrage à froid Per-IC, par point de terminaison Event-driven
Autoscaling Événements de dimensionnement, latence E2E, rééquilibrage Per-endpoint Event-driven
Diagnostic ICE Nombre d'ICE, type défaillant, échec AZ Per-endpoint Event-driven

Pour en obtenir la liste complète, consultez OpenTelemetry référence des métriques.

Architecture et flux de données

Schéma d'architecture montrant le pipeline de collecte de métriques pour une observabilité détaillée.

Chaque instance de point de terminaison expose des métriques provenant de plusieurs sources. L'OTel Collector extrait ces sources, enrichit les données avec des étiquettes contextuelles et les exporte vers votre compte Amazon CloudWatch .

  1. Le conteneur de modèles, l'exportateur DCGM et l'exportateur de nœuds exposent les Prometheus-compatible métriques sur l'instance (métriques du framework d'inférence, métriques GPU et CPU/memory/disk métriques respectivement).

  2. OTel Collector supprime ces points de terminaison et enrichit chaque métrique avec des étiquettes telles que le nom du point de terminaison, le nom du composant d'inférence, l'ID de l'instance et la zone de disponibilité.

  3. Les métriques enrichies sont exportées via OTLP vers Amazon CloudWatch dans votre compte.

  4. Les métriques peuvent être consultées via ProMQL sur Amazon à l'adresse. CloudWatch https://monitoring.region.amazonaws.com

Tarification

Des mesures d'observabilité détaillées sont incluses sans frais supplémentaires. Pour plus d'informations sur les coûts d'ingestion de CloudWatch données d'Amazon liés à l'enrichissement en OTel, consultez Amazon CloudWatch Pricing.