Las traducciones son generadas a través de traducción automática. En caso de conflicto entre la traducción y la version original de inglés, prevalecerá la version en inglés.
Observabilidad detallada de Amazon SageMaker AI para puntos finales de inferencia
La observabilidad detallada es una experiencia de métricas de próxima generación para los puntos finales de inferencia en tiempo real de Amazon SageMaker AI. Basado en OpenTelemetry (Otel), recopila métricas operativas detalladas de las capas de GPU, nodos y marcos de inferencia y las publica en Amazon CloudWatch con etiquetas detalladas que incluyen el nombre del punto de conexión, el nombre del componente de inferencia, el ID de la instancia, la zona de disponibilidad y el tipo de instancia.
Capacidades clave
-
OpenTelemetry-native colección. Las métricas se recopilan mediante un recopilador de Otel que extrae los puntos finales de Prometheus de la DCGM (métricas de GPU), los exportadores de nodos (CPU, memoria, disco) y los contenedores de marcos de inferencia (vLLM, SGLang).
-
Etiquetas dimensionales sofisticadas. Cada métrica se publica con etiquetas como
aws.sagemaker.endpoint.name,,aws.sagemaker.inference_component.name@resource.host.id@resource.cloud.availability_zone, y@resource.host.typepara un filtrado y una agregación precisos. -
Per-GPU atribución. Las métricas de la GPU (DCGM) incluyen la atribución por componente de inferencia, lo que permite identificar qué modelo consume recursos de la GPU en instancias de varios inquilinos.
-
Métricas del marco de inferencia. Las métricas nativas de vLLM y sGLang, que incluyen los tokens por segundo, el tiempo transcurrido hasta el primer token (TTFT), la latencia entre los tokens, la utilización de la caché en KV, la profundidad de las colas y el tamaño del lote, están disponibles sin instrumentación personalizada.
-
Soporte de consultas de ProMQL. Consulta métricas con la sintaxis de ProMQL en Amazon CloudWatch, CloudWatch Query Studio o Amazon Managed Grafana.
-
Frecuencia de raspado configurable. Controle la frecuencia con la que se recopilan las métricas mediante
MetricPublishFrequencyInSeconds(valores válidos: 10, 30, 60, 120, 180, 240, 300 segundos). El valor predeterminado es de 60 segundos. Las métricas del plano de control, como el ciclo de vida, el escalado automático y el diagnóstico del ICE, se basan en eventos y no se ven afectadas por esta configuración.
nota
Detailed Observability publica las métricas OpenTelemetry (Otel) en Amazon a CloudWatch través de OTLP. Estas no son métricas de Prometheus. Las métricas se almacenan de forma nativa en Amazon CloudWatch como datos de métricas de Otel y se pueden consultar mediante la sintaxis ProMQL. ProMQL solo se admite como lenguaje de consulta; no se utiliza ningún servidor o backend de Prometheus. Prometheus-compatible
Qué incluye
| Categoría | Métricas | Alcance | Frecuencia |
|---|---|---|---|
| Marco de inferencia () vLLM/SGLang | TTFT, ITL, caché KV, profundidad de cola, tamaño de lote, TPS, solicitudes simultáneas | Per-IC para los puntos finales de los componentes de inferencia, por punto final para SME instance/per | Configurable |
| Estado de la GPU (DCGM) | Utilización de la GPU, utilización de copias de memoria, temperatura de la GPU | Per-instance, por GPU | Configurable |
| Estado de los nodos | CPU, memoria, disco, sistema de archivos | Per-instance | Configurable |
| Ubicación de los componentes de inferencia y alta disponibilidad | Recuento de copias de IC, copias por AZ, asimétricas de AZ, IC por instancia, instancias por AZ | Per-endpoint | Periódico |
| Ciclo de vida | Tiempo de descarga del modelo, tiempo de carga de la GPU, inicio del contenedor, arranque en frío | Per-IC, por punto final | Event-driven |
| Escalado automático | Eventos de escalado, latencia E2E, reequilibrio | Per-endpoint | Event-driven |
| Diagnóstico ICE | Recuento de ICE, tipo fallido, AZ fallido | Per-endpoint | Event-driven |
Para ver una lista completa, consulte OpenTelemetry referencia de métricas.
Arquitectura y flujo de datos
Cada instancia de punto final expone métricas de varias fuentes. El recopilador de Otel extrae estas fuentes, enriquece los datos con etiquetas de contexto y los exporta a su cuenta de Amazon CloudWatch .
-
El contenedor de modelos, el exportador de DCGM y el exportador de nodos muestran Prometheus-compatible las métricas de la instancia (métricas del marco de inferencia, métricas de GPU y métricas, respectivamente). CPU/memory/disk
-
Otel Collector elimina estos puntos finales y enriquece cada métrica con etiquetas como el nombre del punto final, el nombre del componente de inferencia, el identificador de instancia y la zona de disponibilidad.
-
Las métricas enriquecidas se exportan mediante OTLP a Amazon CloudWatch en tu cuenta.
-
Las métricas se pueden consultar a través de ProMQL en Amazon at. CloudWatch
https://monitoring.region.amazonaws.com
Precios
Las métricas de observabilidad detalladas se incluyen sin coste adicional. Para obtener información sobre los costes de ingesta de CloudWatch datos de Amazon relacionados con el enriquecimiento de Otel, consulta los precios de Amazon CloudWatch