View a markdown version of this page

¿En qué se encuentran los entornos de servicio AWS Batch - AWS Batch

Las traducciones son generadas a través de traducción automática. En caso de conflicto entre la traducción y la version original de inglés, prevalecerá la version en inglés.

¿En qué se encuentran los entornos de servicio AWS Batch

Un entorno de servicio es un AWS Batch recurso que contiene los parámetros de configuración necesarios para integrarse AWS Batch con la SageMaker IA. Los entornos de servicio permiten AWS Batch enviar y gestionar los trabajos de SageMaker formación, a la vez que proporcionan capacidades AWS Batch de gestión de prioridades, programación y listas de espera.

Los entornos de servicio abordan los desafíos comunes a los que se enfrentan los equipos de ciencia de datos a la hora de administrar las cargas de trabajo de machine learning. Las organizaciones suelen limitar la cantidad de instancias disponibles para los modelos de formación a fin de evitar gastos excesivos accidentales, cumplir con las restricciones presupuestarias, ahorrar costos con las instancias reservadas o utilizar tipos de instancias específicos para las cargas de trabajo. Sin embargo, con las instancias asignadas, los científicos de datos desean ejecutar más cargas de trabajo simultáneas de las que es posible, lo que requiere una coordinación manual para decidir qué cargas de trabajo se ejecutan y cuándo.

Este desafío de coordinación afecta a organizaciones de todos los tamaños: desde equipos con solo unos pocos científicos de datos hasta operaciones a gran escala. Así como las organizaciones crecen, también lo hace la complejidad, lo cual significa que se necesitará más tiempo para administrar la coordinación de la carga de trabajo y la participación frecuente del administrador de la infraestructura. Se pierde el tiempo con estos esfuerzos manuales y se reduce la eficiencia de las instancias, lo que genera costos reales para los clientes.

En los entornos de servicio, los científicos de datos y los ingenieros de aprendizaje automático pueden enviar los trabajos de SageMaker formación con prioridades a colas configurables, lo que garantiza que las cargas de trabajo se ejecuten automáticamente sin intervención tan pronto como los recursos estén disponibles. Esta integración aprovecha las amplias capacidades de programación y creación AWS Batch de listas de espera, lo que permite a los clientes personalizar sus políticas de programación y creación de listas de espera para que coincidan con los objetivos de su organización.

Cómo funcionan los entornos de servicio con otros AWS Batch componentes

Los entornos de servicio se integran con otros AWS Batch componentes para permitir la espera de trabajos de SageMaker capacitación:

  • Colas de trabajos: los entornos de servicio se asocian a las colas de trabajos para permitir que la cola procese los trabajos de servicio para el trabajo de capacitación SageMaker

  • Trabajos de servicio: cuando envía un trabajo de servicio a una cola asociada a un entorno de servicio, AWS Batch utiliza la configuración del entorno para enviar el trabajo de formación correspondiente SageMaker

  • Políticas de programación: los entornos de servicio funcionan con políticas AWS Batch de programación para priorizar y administrar el orden de ejecución de los trabajos de SageMaker capacitación

Esta integración le permite aprovechar las capacidades avanzadas AWS Batch de programación y creación de listas de espera y, al mismo tiempo, mantener la plena funcionalidad y flexibilidad de los trabajos de SageMaker formación.

Prácticas recomendadas para los entornos de servicios

Los entornos de servicio brindan capacidades para administrar los trabajos SageMaker de capacitación a escala. Con estas prácticas recomendadas podrá optimizar los costos, el rendimiento y la eficiencia operativa, mientras que se evitan los problemas de configuración habituales que pueden afectar a los flujos de trabajo de machine learning.

Al planificar la capacidad del entorno de servicio, tenga en cuenta las cuotas y los límites específicos que se aplican a la cola de trabajos de SageMaker formación. Cada entorno de servicio tiene un límite máximo de capacidad expresado en número de instancias, que controla directamente el número de trabajos de SageMaker formación que se pueden ejecutar simultáneamente. Comprender estos límites ayuda a evitar la contención de recursos y garantiza tiempos de ejecución de los trabajos predecibles.

El rendimiento óptimo del entorno de servicio depende de la comprensión de las características únicas de la programación de los trabajos de SageMaker capacitación. A diferencia de los trabajos tradicionales en contenedores, los trabajos de servicio pasan de un SCHEDULED estado a otro mientras la SageMaker IA adquiere y aprovisiona las instancias de capacitación necesarias. Esto significa que las horas de inicio de los trabajos pueden variar considerablemente según la disponibilidad de las instancias y de la capacidad regional.

importante

Los entornos de servicio tienen cuotas específicas que pueden afectar a su capacidad de escalar las cargas de trabajo de SageMaker formación. Se pueden crear hasta 50 entornos de servicio por cuenta, y cada cola de trabajos solo admite un entorno de servicio asociado. Además, la carga útil de la solicitud de servicio para trabajos individuales tiene un límite de 10 KiB y la API SubmitServiceJob tiene un límite de 5 transacciones por segundo por cuenta. La comprensión de estos límites durante la planificación de la capacidad evitará las restricciones de escalamiento inesperadas.

La supervisión eficaz de los entornos de servicio requiere prestar atención tanto a las métricas de los servicios como a AWS Batch las de la SageMaker IA. Las transiciones del estado de trabajo ofrecen información valiosa sobre el rendimiento del sistema, sobre todo el tiempo empleado en el estado SCHEDULED, el cual indica los patrones de disponibilidad de la capacidad. Los entornos de servicio mantienen sus propios estados de ciclo de vida, similares a los de los entornos de computación, que pasan por los estados CREATING, VALID, INVALID y DELETING, que deben supervisarse para verificar su estado operativo. A fin de optimizar las configuraciones de los entornos de servicios a lo largo del tiempo, las organizaciones con prácticas de monitoreo consolidadas suelen realizar un seguimiento de la profundidad de las colas, las tasas de finalización de los trabajos y los patrones de utilización de las instancias.