Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.
OpenTelemetry référence des métriques
Cette section fournit une liste complète (non exhaustive) des OpenTelemetry métriques émises par Amazon SageMaker AI concernant l'observabilité détaillée et disponibles dans SageMaker AI Insights.
OpenTelemetry étiquettes métriques
OpenTelemetry les métriques incluent des étiquettes (attributs) qui identifient la ressource associée à chaque point de données. Utilisez ces étiquettes pour filtrer et regrouper les métriques dans les requêtes.
| OpenTelemetry étiquette | Description |
|---|---|
aws.sagemaker.endpoint.name |
Nom du point de terminaison |
aws.sagemaker.variant.name |
Nom de la variante de production |
aws.sagemaker.inference_component.name |
Nom du composant d'inférence |
@resource.host.id |
ID d’instance EC2 |
aws.sagemaker.container.id |
ID du conteneur |
@resource.cloud.availability_zone |
Zone de disponibilité |
@resource.host.type |
Type d’instance |
Account-level métriques agrégées
Ces statistiques se situent au niveau du compte.
| # | Métrique | Description |
|---|---|---|
| 1 | TotalEndpoints |
Nombre total de points de terminaison actifs dans le compte |
| 2 | TotalICs |
Nombre total de composants d'inférence déployés sur tous les terminaux |
| 3 | TotalInvocations |
Nombre total de demandes d'inférence sur tous les points de terminaison |
Métriques du GPU (DCGM)
Ces mesures sont collectées à partir de l'exportateur Data Center GPU Manager (DCGM) et sont disponibles sur tous les points de terminaison du GPU, quel que soit le cadre d'inférence.
Peut être agrégé au niveau du composant d'inférence, de l'instance ou du point de terminaison.
| # | Métrique | Métrique (s) source | Description |
|---|---|---|---|
| 4 | Utilisation du GPU (%) | DCGM_FI_DEV_GPU_UTIL |
Pourcentage de temps pendant lequel le GPU exécutait activement des charges de travail |
| 5 | Utilisation de la mémoire du GPU (%) | DCGM_FI_DEV_MEM_COPY_UTIL |
Pourcentage de temps pendant lequel le contrôleur de mémoire déplaçait activement des données vers ou depuis la mémoire du GPU |
Métriques du nœud (instance)
Ces mesures sont collectées à partir de l'exportateur de nœuds et fournissent une visibilité au niveau de l'instance sur l'utilisation du processeur, de la mémoire et du disque.
Peut être agrégé au niveau de l'instance ou du point de terminaison.
| # | Métrique | Métrique (s) source | Description |
|---|---|---|---|
| 6 | Utilisation du processeur (%) | node_cpu_seconds_total |
Un compteur cumulé mesurant le nombre total de secondes CPU passées dans chaque mode d'exécution (inactif, utilisateur, système, iowait) depuis le démarrage. Déterminez le pourcentage d'utilisation à partir du taux en mode veille. |
| 7 | Utilisation de la mémoire (%) | node_memory_MemAvailable_bytes,
node_memory_MemTotal_bytes |
Pourcentage de mémoire physique utilisée. Dérivé de la mémoire totale moins la mémoire disponible. |
| 8 | Utilisation du disque (%) | node_filesystem_avail_bytes,
node_filesystem_size_bytes |
Pourcentage d'espace du système de fichiers utilisé. Dérivé de la taille totale moins l'espace disponible. |
Métriques du cadre d'inférence (vLLm/SGlang)
Les métriques du framework d'inférence sont émises nativement par le moteur de service exécuté dans le conteneur de votre modèle. SageMaker L'IA collecte automatiquement ces métriques à partir des frameworks pris en charge (vLLM et SGlang) lorsque l'observabilité détaillée est activée. Ces mesures fournissent une visibilité sur le débit des jetons, la latence, la pression du cache en KV et la mise en file d'attente des demandes au niveau des composants d'inférence.
Ces métriques peuvent être attribuées au niveau du point de terminaison, du composant d'inférence ou de l'instance.
| # | Métrique | Métrique (s) source | Description |
|---|---|---|---|
| 9 | Jetons d'entrée par seconde | vllm:prompt_tokens_total |
Nombre total de jetons d'invite traités par seconde |
| 10 | Jetons de sortie par seconde | vllm:generation_tokens_total |
Nombre total de jetons générés par seconde |
| 11 | TPS total | Dérivé de #9 + #10 | Jetons d'entrée et de sortie combinés par seconde |
| 12 | % d'utilisation du TPS | Dérivé de #11 | Débit de jetons actuel en pourcentage du pic observé |
| 13 | TTFT | vllm:time_to_first_token_seconds |
Temps écoulé entre l'arrivée de la demande et le premier jeton généré (histogramme) |
| 14 | Inter-Token Latence | vllm:inter_token_latency_seconds |
Temps moyen entre deux jetons générés consécutivement (histogramme) |
| 15 | Utilisation du cache KV | vllm:gpu_cache_usage_perc |
Pourcentage de KV-cache mémoire GPU actuellement utilisée |
| 16 | Profondeur de file d'attente | vllm:num_requests_waiting |
Nombre de demandes en attente de traitement |
| 17 | Taille de lot | vllm:num_requests_running |
Nombre de demandes en cours (en cours) |
| 18 | Latence du modèle | vllm:e2e_request_latency_seconds |
End-to-end latence de la demande entre l'arrivée et le jeton final (histogramme) |
Note
Les métriques préfixées par vllm: ont des sglang: équivalents pour les points de terminaison SGlang.
Operations-driven métriques
Ces métriques sont pilotées par des événements et émises par vos opérations Create, Update ou Scale vers un point de terminaison ou un composant d'inférence. Ils ne sont pas concernés parMetricPublishFrequencyInSeconds.
Ces métriques peuvent être attribuées au niveau du point final et du composant d'inférence.
| # | Métrique | Métrique (s) source | Description |
|---|---|---|---|
| 19 | Événement de dimensionnement | e2e_duration |
Indique qu'une action d'auto-scaling ou de dimensionnement manuel s'est produite sur votre terminal. Filtrez par étiquette aws.sagemaker.scaling.direction (ScaleOutouScaleIn) pour identifier la direction. |
| 20 | Latence de mise à l'échelle E2E | e2e_duration |
End-to-end mise à l'échelle de la durée entre le déclenchement et la fin (secondes). Filtrez par étiquette aws.sagemaker.operation.type (par exemple,UpdateWCEndpoint). |
| 21 | Compte ICE | ice_count |
Nombre d'événements d'erreur de capacité insuffisante par AZ et par type d'instance |
| 22 | Type d'événement de rééquilibrage | rebalancing_blocked |
Type d'événement de rééquilibrage et son état actuel |
| 23 | Durée du rééquilibrage | rebalancing_duration |
Durée du rééquilibrage du début à la fin (secondes) |
| 24 | Copies IC déplacées | ic_copy_moved |
Nombre de copies des composants d'inférence déplacées lors du rééquilibrage |
| 25 | Instances publiées | instances_released |
Nombre d'instances EC2 libérées par consolidation lors du rééquilibrage |
| 26 | Durée de téléchargement du modèle | model_download_time |
Temps de téléchargement des artefacts du modèle depuis S3 vers l'instance (secondes) |
| 27 | Durée de charge du GPU | gpu_load_time |
Temps de chargement des poids du modèle dans la mémoire du GPU (secondes) |
| 28 | Durée de démarrage du conteneur | container_start_time |
Temps écoulé entre le début du conteneur et le passage du contrôle de santé (secondes) |
Mesures de placement de flotte dérivées
Outre les mesures répertoriées ci-dessus, le tableau de bord SageMaker AI Insights calcule des mesures dérivées à partir des données de placement du plan de contrôle. Il s'agit de vues agrégées visibles sur le tableau de bord et ne sont pas des noms de métriques interrogeables individuellement dans Amazon CloudWatch Query Studio.
Les mesures de placement de flotte dérivées incluent :
-
Nombre d'instances par zone de disponibilité
-
Nombre de copies du circuit intégré par zone de disponibilité
-
AZ-Skew (pourcentage de déséquilibre de distribution au sein de votre flotte)
-
Copies IC par instance
Ces valeurs sont visibles dans l'onglet Fiabilité du tableau de bord SageMaker AI Insights.