View a markdown version of this page

OpenTelemetry référence des métriques - Amazon SageMaker AI

Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.

OpenTelemetry référence des métriques

Cette section fournit une liste complète (non exhaustive) des OpenTelemetry métriques émises par Amazon SageMaker AI concernant l'observabilité détaillée et disponibles dans SageMaker AI Insights.

OpenTelemetry étiquettes métriques

OpenTelemetry les métriques incluent des étiquettes (attributs) qui identifient la ressource associée à chaque point de données. Utilisez ces étiquettes pour filtrer et regrouper les métriques dans les requêtes.

OpenTelemetry étiquette Description
aws.sagemaker.endpoint.name Nom du point de terminaison
aws.sagemaker.variant.name Nom de la variante de production
aws.sagemaker.inference_component.name Nom du composant d'inférence
@resource.host.id ID d’instance EC2
aws.sagemaker.container.id ID du conteneur
@resource.cloud.availability_zone Zone de disponibilité
@resource.host.type Type d’instance

Account-level métriques agrégées

Ces statistiques se situent au niveau du compte.

# Métrique Description
1 TotalEndpoints Nombre total de points de terminaison actifs dans le compte
2 TotalICs Nombre total de composants d'inférence déployés sur tous les terminaux
3 TotalInvocations Nombre total de demandes d'inférence sur tous les points de terminaison

Métriques du GPU (DCGM)

Ces mesures sont collectées à partir de l'exportateur Data Center GPU Manager (DCGM) et sont disponibles sur tous les points de terminaison du GPU, quel que soit le cadre d'inférence.

Peut être agrégé au niveau du composant d'inférence, de l'instance ou du point de terminaison.

# Métrique Métrique (s) source Description
4 Utilisation du GPU (%) DCGM_FI_DEV_GPU_UTIL Pourcentage de temps pendant lequel le GPU exécutait activement des charges de travail
5 Utilisation de la mémoire du GPU (%) DCGM_FI_DEV_MEM_COPY_UTIL Pourcentage de temps pendant lequel le contrôleur de mémoire déplaçait activement des données vers ou depuis la mémoire du GPU

Métriques du nœud (instance)

Ces mesures sont collectées à partir de l'exportateur de nœuds et fournissent une visibilité au niveau de l'instance sur l'utilisation du processeur, de la mémoire et du disque.

Peut être agrégé au niveau de l'instance ou du point de terminaison.

# Métrique Métrique (s) source Description
6 Utilisation du processeur (%) node_cpu_seconds_total Un compteur cumulé mesurant le nombre total de secondes CPU passées dans chaque mode d'exécution (inactif, utilisateur, système, iowait) depuis le démarrage. Déterminez le pourcentage d'utilisation à partir du taux en mode veille.
7 Utilisation de la mémoire (%) node_memory_MemAvailable_bytes, node_memory_MemTotal_bytes Pourcentage de mémoire physique utilisée. Dérivé de la mémoire totale moins la mémoire disponible.
8 Utilisation du disque (%) node_filesystem_avail_bytes, node_filesystem_size_bytes Pourcentage d'espace du système de fichiers utilisé. Dérivé de la taille totale moins l'espace disponible.

Métriques du cadre d'inférence (vLLm/SGlang)

Les métriques du framework d'inférence sont émises nativement par le moteur de service exécuté dans le conteneur de votre modèle. SageMaker L'IA collecte automatiquement ces métriques à partir des frameworks pris en charge (vLLM et SGlang) lorsque l'observabilité détaillée est activée. Ces mesures fournissent une visibilité sur le débit des jetons, la latence, la pression du cache en KV et la mise en file d'attente des demandes au niveau des composants d'inférence.

Ces métriques peuvent être attribuées au niveau du point de terminaison, du composant d'inférence ou de l'instance.

# Métrique Métrique (s) source Description
9 Jetons d'entrée par seconde vllm:prompt_tokens_total Nombre total de jetons d'invite traités par seconde
10 Jetons de sortie par seconde vllm:generation_tokens_total Nombre total de jetons générés par seconde
11 TPS total Dérivé de #9 + #10 Jetons d'entrée et de sortie combinés par seconde
12 % d'utilisation du TPS Dérivé de #11 Débit de jetons actuel en pourcentage du pic observé
13 TTFT vllm:time_to_first_token_seconds Temps écoulé entre l'arrivée de la demande et le premier jeton généré (histogramme)
14 Inter-Token Latence vllm:inter_token_latency_seconds Temps moyen entre deux jetons générés consécutivement (histogramme)
15 Utilisation du cache KV vllm:gpu_cache_usage_perc Pourcentage de KV-cache mémoire GPU actuellement utilisée
16 Profondeur de file d'attente vllm:num_requests_waiting Nombre de demandes en attente de traitement
17 Taille de lot vllm:num_requests_running Nombre de demandes en cours (en cours)
18 Latence du modèle vllm:e2e_request_latency_seconds End-to-end latence de la demande entre l'arrivée et le jeton final (histogramme)
Note

Les métriques préfixées par vllm: ont des sglang: équivalents pour les points de terminaison SGlang.

Operations-driven métriques

Ces métriques sont pilotées par des événements et émises par vos opérations Create, Update ou Scale vers un point de terminaison ou un composant d'inférence. Ils ne sont pas concernés parMetricPublishFrequencyInSeconds.

Ces métriques peuvent être attribuées au niveau du point final et du composant d'inférence.

# Métrique Métrique (s) source Description
19 Événement de dimensionnement e2e_duration Indique qu'une action d'auto-scaling ou de dimensionnement manuel s'est produite sur votre terminal. Filtrez par étiquette aws.sagemaker.scaling.direction (ScaleOutouScaleIn) pour identifier la direction.
20 Latence de mise à l'échelle E2E e2e_duration End-to-end mise à l'échelle de la durée entre le déclenchement et la fin (secondes). Filtrez par étiquette aws.sagemaker.operation.type (par exemple,UpdateWCEndpoint).
21 Compte ICE ice_count Nombre d'événements d'erreur de capacité insuffisante par AZ et par type d'instance
22 Type d'événement de rééquilibrage rebalancing_blocked Type d'événement de rééquilibrage et son état actuel
23 Durée du rééquilibrage rebalancing_duration Durée du rééquilibrage du début à la fin (secondes)
24 Copies IC déplacées ic_copy_moved Nombre de copies des composants d'inférence déplacées lors du rééquilibrage
25 Instances publiées instances_released Nombre d'instances EC2 libérées par consolidation lors du rééquilibrage
26 Durée de téléchargement du modèle model_download_time Temps de téléchargement des artefacts du modèle depuis S3 vers l'instance (secondes)
27 Durée de charge du GPU gpu_load_time Temps de chargement des poids du modèle dans la mémoire du GPU (secondes)
28 Durée de démarrage du conteneur container_start_time Temps écoulé entre le début du conteneur et le passage du contrôle de santé (secondes)

Mesures de placement de flotte dérivées

Outre les mesures répertoriées ci-dessus, le tableau de bord SageMaker AI Insights calcule des mesures dérivées à partir des données de placement du plan de contrôle. Il s'agit de vues agrégées visibles sur le tableau de bord et ne sont pas des noms de métriques interrogeables individuellement dans Amazon CloudWatch Query Studio.

Les mesures de placement de flotte dérivées incluent :

  • Nombre d'instances par zone de disponibilité

  • Nombre de copies du circuit intégré par zone de disponibilité

  • AZ-Skew (pourcentage de déséquilibre de distribution au sein de votre flotte)

  • Copies IC par instance

Ces valeurs sont visibles dans l'onglet Fiabilité du tableau de bord SageMaker AI Insights.