View a markdown version of this page

Traitement des fonctionnalités avec Spark ML et Scikit-learn - Amazon SageMaker AI

Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.

Traitement des fonctionnalités avec Spark ML et Scikit-learn

Avant d'entraîner un modèle à l'aide d'algorithmes intégrés ou personnalisés d'Amazon SageMaker AI, vous pouvez utiliser les préprocesseurs Spark et Scikit-learn pour transformer vos données et concevoir des fonctionnalités.

Traitement de fonctionnalité avec Spark ML

Vous pouvez exécuter des tâches Spark ML avec AWS Glue, un service ETL (extraction, transformation, chargement) sans serveur, depuis votre bloc-notes SageMaker AI. Vous pouvez également vous connecter à des clusters EMR existants pour exécuter des tâches Spark ML avec Amazon EMR. Pour ce faire, vous avez besoin d'un rôle Gestion des identités et des accès AWS (IAM) qui autorise à passer des appels depuis votre bloc-notes SageMaker AI vers AWS Glue.

Note

Pour savoir quelles versions de Python et de Spark sont prises AWS Glue en charge, consultez les notes de version de AWS Glue.

Après avoir conçu les fonctionnalités, vous devez empaqueter et sérialiser les tâches Spark ML avec MLeap dans des conteneurs MLeap que vous pouvez ajouter à un pipeline d'inférence. Vous n'avez pas besoin d'utiliser des clusters Spark gérés de façon externe. Avec cette approche, vous pouvez passer aisément de quelques lignes à plusieurs téraoctets de données. Les mêmes outils de transformation fonctionnent pour l'entraînement et l'inférence. Vous n'avez donc pas besoin de dupliquer la logique de prétraitement ni d'ingénierie de fonctionnalité, ni de développer une solution unique pour conserver ces modèles. Avec les pipelines d'inférence, vous n'avez pas besoin de gérer d'infrastructure extérieure et vous pouvez effectuer des prédictions directement à partir des entrées de données.

Lorsque vous exécutez une tâche Spark ML AWS Glue, un pipeline Spark ML est sérialisé au format MLeap. Vous pouvez ensuite utiliser la tâche avec le conteneur de service de modèles SparkML dans un pipeline d'inférence SageMaker IA. MLeap est un format de sérialisation et un moteur d'exécution pour des pipelines d'apprentissage automatique. Il prend en charge Spark et permet de former TensorFlow des pipelines et de les exporter vers un pipeline sérialisé appelé MLeap Bundle. Scikit-learn Vous pouvez désérialiser les bundles dans Spark pour une évaluation en mode de traitement par lots ou dans l'exécution MLeap afin d'alimenter les services d'API en temps réel.

Pour un exemple qui montre comment intégrer un processus avec Spark ML, consultez le bloc-notes d'exemple de formation d'un modèle de machine learning à l'aide d'Apache Spark dans Amazon EMR et de déployer dans SageMaker AI.

Traitement des fonctionnalités avec Scikit-Learn

Vous pouvez exécuter et regrouper des tâches scikit-learn dans des conteneurs directement dans Amazon AI. SageMaker Pour un exemple de code Python permettant de créer un modèle de fonctionnalité Scikit-learn qui s'entraîne à partir de l'ensemble de données sur les fleurs d'iris de Fisher et prédit l'espèce d'iris sur la base de mesures morphologiques, voir Entraînement et prédiction d'IRIS avec Sagemaker. Scikit-learn