View a markdown version of this page

OpenTelemetry referencia de métricas - Amazon SageMaker AI

Las traducciones son generadas a través de traducción automática. En caso de conflicto entre la traducción y la version original de inglés, prevalecerá la version en inglés.

OpenTelemetry referencia de métricas

Esta sección proporciona una lista completa (no exhaustiva) de OpenTelemetry las métricas emitidas por Amazon SageMaker AI, de observabilidad detallada y disponibles en SageMaker AI Insights.

OpenTelemetry etiquetas métricas

OpenTelemetry las métricas incluyen etiquetas (atributos) que identifican el recurso asociado a cada punto de datos. Usa estas etiquetas para filtrar y agrupar las métricas de las consultas.

OpenTelemetry etiqueta Description (Descripción)
aws.sagemaker.endpoint.name Endpoint name (Nombre del punto de conexión)
aws.sagemaker.variant.name Nombre de la variante de producción
aws.sagemaker.inference_component.name Nombre del componente de inferencia
@resource.host.id ID de instancia de EC2
aws.sagemaker.container.id ID del contenedor
@resource.cloud.availability_zone Zona de disponibilidad
@resource.host.type Tipo de instancia

Account-level métricas agregadas

Estas métricas se encuentran a nivel de cuenta.

# Métrica Description (Descripción)
1 TotalEndpoints Número total de puntos de conexión activos en la cuenta
2 TotalICs Número total de componentes de inferencia implementados en todos los puntos finales
3 TotalInvocations Número total de solicitudes de inferencia en todos los puntos finales

Métricas de GPU (DCGM)

Estas métricas se recopilan del exportador de Data Center GPU Manager (DCGM) y están disponibles en todos los terminales de la GPU, independientemente del marco de inferencia.

Se pueden agregar a nivel de componente de inferencia, instancia o punto final.

# Métrica Métrica (s) de origen Description (Descripción)
4 Utilización de la GPU (%) DCGM_FI_DEV_GPU_UTIL Porcentaje de tiempo que la GPU estuvo ejecutando cargas de trabajo de forma activa
5 Utilización de la memoria de la GPU (%) DCGM_FI_DEV_MEM_COPY_UTIL Porcentaje de tiempo que la controladora de memoria estuvo moviendo datos de forma activa hacia o desde la memoria de la GPU

Métricas de nodo (instancia)

Estas métricas se recopilan del exportador de nodos y proporcionan visibilidad a nivel de instancia del uso de la CPU, la memoria y el disco.

Se pueden agregar a nivel de instancia o punto final.

# Métrica Métrica (s) de origen Description (Descripción)
6 Utilización de la CPU (%) node_cpu_seconds_total Un contador acumulativo que mide el total de segundos de CPU gastados en cada modo de ejecución (inactivo, usuario, sistema, iowait) desde el arranque. Deduzca el porcentaje de utilización a partir de la velocidad del modo inactivo.
7 Utilización de memoria (%) node_memory_MemAvailable_bytes, node_memory_MemTotal_bytes Porcentaje de memoria física en uso. Derivado de la memoria total menos la memoria disponible.
8 Utilización del disco (%) node_filesystem_avail_bytes, node_filesystem_size_bytes Porcentaje de espacio del sistema de archivos en uso. Derivado del tamaño total menos el espacio disponible.

Métricas del marco de inferencia (vLLm/sGLang)

Las métricas del marco de inferencia las emite de forma nativa el motor de servicio que se ejecuta dentro del contenedor del modelo. SageMaker La IA recopila automáticamente estas métricas de los marcos compatibles (vLLM y sGLang) cuando se habilita la observabilidad detallada. Estas métricas proporcionan visibilidad del rendimiento de los tokens, la latencia, la presión de la caché en KV y las colas de solicitudes a nivel del componente de inferencia.

Estas métricas se pueden atribuir a nivel de punto final, componente de inferencia o instancia.

# Métrica Métrica (s) de origen Description (Descripción)
9 Tokens de entrada por segundo vllm:prompt_tokens_total Número total de fichas rápidas procesadas por segundo
10 Tokens de salida por segundo vllm:generation_tokens_total Número total de fichas generadas por segundo
11 TPS total Derivado de #9 + #10 Tokens de entrada y salida combinados por segundo
12 % de utilización del TPS Derivado de #11 Rendimiento actual del token expresado como porcentaje del pico observado
13 TTFT vllm:time_to_first_token_seconds Tiempo transcurrido desde la llegada de la solicitud hasta el primer token generado (histograma)
14 Inter-Token Latencia vllm:inter_token_latency_seconds Tiempo medio entre los tokens generados de forma consecutiva (histograma)
15 Utilización de caché KV vllm:gpu_cache_usage_perc Porcentaje de KV-cache memoria de la GPU actualmente en uso
16 Profundidad de cola vllm:num_requests_waiting Número de solicitudes que esperan en la cola para ser procesadas
17 BatchSize vllm:num_requests_running Número de solicitudes en curso (en curso)
18 Latencia del modelo vllm:e2e_request_latency_seconds End-to-end solicitar latencia desde la llegada hasta el token final (histograma)
nota

Las métricas con el prefijo vllm: tienen sglang: contrapartes equivalentes para los puntos finales de SGLang.

Operations-driven métricas

Estas métricas se basan en eventos y las emiten sus operaciones de creación, actualización o escalado a un punto final o componente de inferencia. No se ven afectados por. MetricPublishFrequencyInSeconds

Estas métricas se pueden atribuir a nivel de punto final y componente de inferencia.

# Métrica Métrica (s) de origen Description (Descripción)
19 Evento de escalado e2e_duration Indica que se ha producido una acción de autoescalado o de escalado manual en su punto final. Filtre por etiqueta aws.sagemaker.scaling.direction (ScaleOutoScaleIn) para identificar la dirección.
20 Latencia de escalado E2E e2e_duration End-to-end escalando la duración desde que se activa hasta que se completa (segundos). Filtrar por etiqueta aws.sagemaker.operation.type (por ejemplo,UpdateWCEndpoint).
21 Recuento de hielo ice_count Número de eventos de error de capacidad insuficiente por zona de disponibilidad por tipo de instancia
22 Tipo de evento de reequilibrio rebalancing_blocked Tipo de evento de reequilibrio y su estado actual
23 Duración del reequilibrio rebalancing_duration Duración del reequilibrio desde el principio hasta la finalización (segundos)
24 Se movieron las copias de IC ic_copy_moved Número de copias de componentes de inferencia movidas durante el reequilibrio
25 Instancias publicadas instances_released Número de instancias EC2 liberadas por la consolidación durante el reequilibrio
26 Duración de la descarga del modelo model_download_time Tiempo de descarga de los artefactos del modelo desde S3 a la instancia (segundos)
27 Duración de carga de la GPU gpu_load_time Tiempo de carga de los pesos de los modelos en la memoria de la GPU (segundos)
28 Duración de inicio del contenedor container_start_time Tiempo desde que el contenedor comienza a pasar el control de estado (segundos)

Métricas derivadas de la ubicación de la flota

Además de las métricas enumeradas anteriormente, el panel de SageMaker AI Insights calcula las métricas derivadas de los datos de ubicación del plano de control. Se trata de vistas agregadas visibles en el panel de control y no son nombres de métricas que se puedan consultar de forma individual en Amazon CloudWatch Query Studio.

Las métricas derivadas de la ubicación de la flota incluyen:

  • Recuento de instancias por zona de disponibilidad

  • Recuento de copias de IC por zona de disponibilidad

  • Desviación entre zonas y zonas (porcentaje de desequilibrio de distribución en toda la flota)

  • Copias IC por instancia

Estos valores están visibles en la pestaña Fiabilidad del panel de control de SageMaker AI Insights.