Las traducciones son generadas a través de traducción automática. En caso de conflicto entre la traducción y la version original de inglés, prevalecerá la version en inglés.
OpenTelemetry referencia de métricas
Esta sección proporciona una lista completa (no exhaustiva) de OpenTelemetry las métricas emitidas por Amazon SageMaker AI, de observabilidad detallada y disponibles en SageMaker AI Insights.
OpenTelemetry etiquetas métricas
OpenTelemetry las métricas incluyen etiquetas (atributos) que identifican el recurso asociado a cada punto de datos. Usa estas etiquetas para filtrar y agrupar las métricas de las consultas.
| OpenTelemetry etiqueta | Description (Descripción) |
|---|---|
aws.sagemaker.endpoint.name |
Endpoint name (Nombre del punto de conexión) |
aws.sagemaker.variant.name |
Nombre de la variante de producción |
aws.sagemaker.inference_component.name |
Nombre del componente de inferencia |
@resource.host.id |
ID de instancia de EC2 |
aws.sagemaker.container.id |
ID del contenedor |
@resource.cloud.availability_zone |
Zona de disponibilidad |
@resource.host.type |
Tipo de instancia |
Account-level métricas agregadas
Estas métricas se encuentran a nivel de cuenta.
| # | Métrica | Description (Descripción) |
|---|---|---|
| 1 | TotalEndpoints |
Número total de puntos de conexión activos en la cuenta |
| 2 | TotalICs |
Número total de componentes de inferencia implementados en todos los puntos finales |
| 3 | TotalInvocations |
Número total de solicitudes de inferencia en todos los puntos finales |
Métricas de GPU (DCGM)
Estas métricas se recopilan del exportador de Data Center GPU Manager (DCGM) y están disponibles en todos los terminales de la GPU, independientemente del marco de inferencia.
Se pueden agregar a nivel de componente de inferencia, instancia o punto final.
| # | Métrica | Métrica (s) de origen | Description (Descripción) |
|---|---|---|---|
| 4 | Utilización de la GPU (%) | DCGM_FI_DEV_GPU_UTIL |
Porcentaje de tiempo que la GPU estuvo ejecutando cargas de trabajo de forma activa |
| 5 | Utilización de la memoria de la GPU (%) | DCGM_FI_DEV_MEM_COPY_UTIL |
Porcentaje de tiempo que la controladora de memoria estuvo moviendo datos de forma activa hacia o desde la memoria de la GPU |
Métricas de nodo (instancia)
Estas métricas se recopilan del exportador de nodos y proporcionan visibilidad a nivel de instancia del uso de la CPU, la memoria y el disco.
Se pueden agregar a nivel de instancia o punto final.
| # | Métrica | Métrica (s) de origen | Description (Descripción) |
|---|---|---|---|
| 6 | Utilización de la CPU (%) | node_cpu_seconds_total |
Un contador acumulativo que mide el total de segundos de CPU gastados en cada modo de ejecución (inactivo, usuario, sistema, iowait) desde el arranque. Deduzca el porcentaje de utilización a partir de la velocidad del modo inactivo. |
| 7 | Utilización de memoria (%) | node_memory_MemAvailable_bytes,
node_memory_MemTotal_bytes |
Porcentaje de memoria física en uso. Derivado de la memoria total menos la memoria disponible. |
| 8 | Utilización del disco (%) | node_filesystem_avail_bytes,
node_filesystem_size_bytes |
Porcentaje de espacio del sistema de archivos en uso. Derivado del tamaño total menos el espacio disponible. |
Métricas del marco de inferencia (vLLm/sGLang)
Las métricas del marco de inferencia las emite de forma nativa el motor de servicio que se ejecuta dentro del contenedor del modelo. SageMaker La IA recopila automáticamente estas métricas de los marcos compatibles (vLLM y sGLang) cuando se habilita la observabilidad detallada. Estas métricas proporcionan visibilidad del rendimiento de los tokens, la latencia, la presión de la caché en KV y las colas de solicitudes a nivel del componente de inferencia.
Estas métricas se pueden atribuir a nivel de punto final, componente de inferencia o instancia.
| # | Métrica | Métrica (s) de origen | Description (Descripción) |
|---|---|---|---|
| 9 | Tokens de entrada por segundo | vllm:prompt_tokens_total |
Número total de fichas rápidas procesadas por segundo |
| 10 | Tokens de salida por segundo | vllm:generation_tokens_total |
Número total de fichas generadas por segundo |
| 11 | TPS total | Derivado de #9 + #10 | Tokens de entrada y salida combinados por segundo |
| 12 | % de utilización del TPS | Derivado de #11 | Rendimiento actual del token expresado como porcentaje del pico observado |
| 13 | TTFT | vllm:time_to_first_token_seconds |
Tiempo transcurrido desde la llegada de la solicitud hasta el primer token generado (histograma) |
| 14 | Inter-Token Latencia | vllm:inter_token_latency_seconds |
Tiempo medio entre los tokens generados de forma consecutiva (histograma) |
| 15 | Utilización de caché KV | vllm:gpu_cache_usage_perc |
Porcentaje de KV-cache memoria de la GPU actualmente en uso |
| 16 | Profundidad de cola | vllm:num_requests_waiting |
Número de solicitudes que esperan en la cola para ser procesadas |
| 17 | BatchSize | vllm:num_requests_running |
Número de solicitudes en curso (en curso) |
| 18 | Latencia del modelo | vllm:e2e_request_latency_seconds |
End-to-end solicitar latencia desde la llegada hasta el token final (histograma) |
nota
Las métricas con el prefijo vllm: tienen sglang: contrapartes equivalentes para los puntos finales de SGLang.
Operations-driven métricas
Estas métricas se basan en eventos y las emiten sus operaciones de creación, actualización o escalado a un punto final o componente de inferencia. No se ven afectados por. MetricPublishFrequencyInSeconds
Estas métricas se pueden atribuir a nivel de punto final y componente de inferencia.
| # | Métrica | Métrica (s) de origen | Description (Descripción) |
|---|---|---|---|
| 19 | Evento de escalado | e2e_duration |
Indica que se ha producido una acción de autoescalado o de escalado manual en su punto final. Filtre por etiqueta aws.sagemaker.scaling.direction (ScaleOutoScaleIn) para identificar la dirección. |
| 20 | Latencia de escalado E2E | e2e_duration |
End-to-end escalando la duración desde que se activa hasta que se completa (segundos). Filtrar por etiqueta aws.sagemaker.operation.type (por ejemplo,UpdateWCEndpoint). |
| 21 | Recuento de hielo | ice_count |
Número de eventos de error de capacidad insuficiente por zona de disponibilidad por tipo de instancia |
| 22 | Tipo de evento de reequilibrio | rebalancing_blocked |
Tipo de evento de reequilibrio y su estado actual |
| 23 | Duración del reequilibrio | rebalancing_duration |
Duración del reequilibrio desde el principio hasta la finalización (segundos) |
| 24 | Se movieron las copias de IC | ic_copy_moved |
Número de copias de componentes de inferencia movidas durante el reequilibrio |
| 25 | Instancias publicadas | instances_released |
Número de instancias EC2 liberadas por la consolidación durante el reequilibrio |
| 26 | Duración de la descarga del modelo | model_download_time |
Tiempo de descarga de los artefactos del modelo desde S3 a la instancia (segundos) |
| 27 | Duración de carga de la GPU | gpu_load_time |
Tiempo de carga de los pesos de los modelos en la memoria de la GPU (segundos) |
| 28 | Duración de inicio del contenedor | container_start_time |
Tiempo desde que el contenedor comienza a pasar el control de estado (segundos) |
Métricas derivadas de la ubicación de la flota
Además de las métricas enumeradas anteriormente, el panel de SageMaker AI Insights calcula las métricas derivadas de los datos de ubicación del plano de control. Se trata de vistas agregadas visibles en el panel de control y no son nombres de métricas que se puedan consultar de forma individual en Amazon CloudWatch Query Studio.
Las métricas derivadas de la ubicación de la flota incluyen:
-
Recuento de instancias por zona de disponibilidad
-
Recuento de copias de IC por zona de disponibilidad
-
Desviación entre zonas y zonas (porcentaje de desequilibrio de distribución en toda la flota)
-
Copias IC por instancia
Estos valores están visibles en la pestaña Fiabilidad del panel de control de SageMaker AI Insights.