Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.
Utilisation AWS Catalogue de données Glue avec Spark sur Amazon EMR
À l'aide de la version 5.8.0 ou ultérieure d'Amazon EMR, vous pouvez configurer Spark pour utiliser le catalogue de données AWS Glue comme métastore Apache Hive. Nous recommandons cette configuration lorsque vous avez besoin d'une métastore Hive persistante ou d'une métastore Hive partagée par différents clusters, services, applications ou comptes. AWS
À l'aide de la version 6.5.0 ou ultérieure d'Amazon EMR, vous pouvez configurer Spark pour utiliser le catalogue de données AWS Glue avec Apache Iceberg.
À l'aide de la version 7.5.0 ou ultérieure d'Amazon EMR, vous pouvez configurer Spark pour utiliser le catalogue de données AWS Glue comme catalogue Iceberg REST.
AWS Glue est un service d'extraction, de transformation et de chargement (ETL) entièrement géré qui permet de classer vos données de manière simple et rentable, de les nettoyer, de les enrichir et de les déplacer de manière fiable entre différents magasins de données. Le catalogue de données AWS Glue fournit un référentiel de métadonnées unifié pour une variété de sources de données et de formats de données, s'intégrant à Amazon EMR ainsi qu'à Amazon RDS, Amazon Redshift, Redshift Spectrum, Athena et à toute application compatible avec le métastore Apache Hive. AWS Les robots Glue peuvent déduire automatiquement un schéma à partir des données sources dans Amazon S3 et stocker les métadonnées associées dans le catalogue de données. Pour plus d'informations sur le catalogue de données, voir Remplir le catalogue de données AWS Glue dans le Guide du développeur AWS Glue.
Des frais distincts s'appliquent pour AWS Glue. Il existe un tarif mensuel pour le stockage et l'accès aux métadonnées dans le catalogue de données, un tarif horaire facturé par minute pour les tâches AWS Glue ETL et l'exécution du robot d'exploration, et un tarif horaire facturé par minute pour chaque point de terminaison de développement provisionné. Le catalogue de données vous permet de stocker jusqu'à un million d'objets sans aucuns frais. Au-delà d'un million d'objets, des frais de 1 USD vous seront facturés tous les 100 000 objets. Dans le catalogue de données, sont considérés comme des objets une table, une partition ou une base de données. Pour de plus amples informations, consultez Tarification Glue
Important
Si vous avez créé des tableaux à l'aide d'Amazon Athena ou d'Amazon Redshift Spectrum avant le 14 août 2017, les bases de données et les tables sont stockées dans un Athena-managed catalogue distinct du catalogue de données AWS Glue. Pour intégrer Amazon EMR à ces tables, vous devez passer au catalogue de données AWS Glue. Pour plus d'informations, consultez la section Mise à niveau vers le catalogue de données AWS Glue dans le guide de l'utilisateur d'Amazon Athena.
Spécifier AWS Glue Data Catalog en tant que métastore Apache Hive
Vous pouvez spécifier le catalogue de données AWS Glue comme métastore à l'aide de l'API Console de gestion AWS AWS CLI, ou Amazon EMR. Lorsque vous utilisez la CLI ou l'API, vous utilisez la classification de configuration de Spark pour spécifier le catalogue de données. En outre, avec Amazon EMR 5.16.0 et versions ultérieures, vous pouvez utiliser la classification de configuration pour spécifier un catalogue de données dans un autre. Compte AWS Lorsque vous utilisez la console, vous pouvez spécifier le catalogue de données à l'aide des Options avancées ou des Options rapides.
Note
L'option permettant d'utiliser AWS Glue Data Catalog est également disponible avec Zeppelin car Zeppelin est installé avec des composants Spark.
Spécifier AWS Glue Data Catalog en tant que catalogue Apache Iceberg
Vous pouvez spécifier le catalogue de données AWS Glue comme implémentation du catalogue Apache Iceberg, ou comme point de terminaison du catalogue Apache Iceberg REST, à l' Console de gestion AWS aide de l'API Amazon EMR AWS CLI, ou lors de la configuration d'exécution de la session Spark. Lorsque vous utilisez la CLI ou l'API, vous utilisez la classification de configuration de Spark pour spécifier le catalogue de données. Pour plus de détails, voir Spécifier le catalogue de données AWS Glue en tant que catalogue Apache Iceberg.
Autorisations IAM
Le profil d'instance EC2 d'un cluster doit disposer d'autorisations IAM pour les actions AWS Glue. En outre, si vous activez le chiffrement pour les objets du catalogue de données AWS Glue, le rôle doit également être autorisé à chiffrer, déchiffrer et générer les éléments AWS KMS key utilisés pour le chiffrement.
Autorisations pour AWS Actions de colle
Aucune action n'est requise si vous utilisez le profil d'instance EC2 par défaut pour Amazon EMR. La politique AmazonElasticMapReduceforEC2Role gérée qui est associée à EMR_EC2_DefaultRole autorise toutes les actions AWS Glue nécessaires. Toutefois, si vous spécifiez un profil d'instance EC2 personnalisé et des autorisations, vous devez configurer les actions AWS Glue appropriées. Utilisez la stratégie gérée AmazonElasticMapReduceforEC2Role comme point de départ. Pour plus d'informations, consultez Rôle de service pour les instances EC2 de cluster (profil d'instance EC2) dans le Guide de gestion Amazon EMR.
Autorisations pour le chiffrement et le déchiffrement AWS Catalogue de données Glue
Votre profil d'instance a besoin d'autorisations pour chiffrer et déchiffrer les données au moyen de votre clé. Vous n'avez pas besoin de configurer ces autorisations si les deux déclarations suivantes s'appliquent :
-
Vous activez le chiffrement des objets du catalogue de données AWS Glue à l'aide de clés gérées pour AWS Glue.
-
Vous utilisez un cluster identique à celui du catalogue Compte AWS de données AWS Glue.
Sinon, vous devez ajouter l'instruction suivante à la politique d'autorisations attachée à votre profil d'instance EC2.
Pour plus d'informations sur le chiffrement du catalogue de données AWS Glue, consultez la section Chiffrement de votre catalogue de données dans le guide du développeur AWS Glue.
Resource-based autorisations
Si vous utilisez AWS Glue conjointement avec Hive, Spark ou Presto dans Amazon EMR, AWS Glue prend en charge des politiques basées sur les ressources pour contrôler l'accès aux ressources du catalogue de données. Ces ressources comprennent les bases de données, les tables, les connexions et les fonctions définies par l'utilisateur. Pour plus d'informations, consultez Politiques de ressources AWS Glue dans le Guide du développeur AWS Glue.
Lorsque vous utilisez des politiques basées sur les ressources pour limiter l'accès à AWS Glue depuis Amazon EMR, le principal que vous spécifiez dans la politique d'autorisations doit être le rôle ARN associé au profil d'instance EC2 spécifié lors de la création d'un cluster. Par exemple, pour une politique basée sur les ressources attachée à un catalogue, vous pouvez spécifier le rôle ARN pour le rôle de service par défaut pour les instances EC2 du cluster, EMR_EC2_DefaultRole en utilisant le Principal format illustré dans l'exemple suivant :
arn:aws:iam::acct-id:role/EMR_EC2_DefaultRole
Il acct-id peut être différent de l'identifiant de compte AWS Glue. Cela permet d'accéder aux clusters EMR à partir de comptes différents. Vous pouvez spécifier plusieurs principaux, chacun provenant d'un compte différent.
Considérations relatives à l'utilisation AWS Catalogue de données Glue
Tenez compte des éléments suivants lorsque vous utilisez AWS Glue Data Catalog en tant que métastore Apache Hive avec Spark :
-
Le manque de base de données par défaut sans URI d'emplacement entraîne des échecs lorsque vous créez une table. Pour contourner ce problème, utilisez la clause
LOCATIONpour spécifier un emplacement de bucket, tel ques3://, lorsque vous utilisezamzn-s3-demo-bucket1CREATE TABLE. Vous pouvez aussi créer des tables dans une autre base de données que celle par défaut. Il n'est pas possible de renommer des tables depuis AWS Glue.
Lorsque vous créez une table Hive sans spécifier de
LOCATION, les données de la table sont stockées à l'emplacement spécifié par la propriétéhive.metastore.warehouse.dir. Par défaut, il s'agit d'un emplacement dans HDFS. Si un autre cluster doit accéder à la table, il échoue, sauf s'il dispose d'autorisations adéquates sur le cluster qui a créé la table. En outre, le stockage dans HDFS étant transitoire, si le cluster est résilié, les données de la table sont perdues et la table doit être recréée. Nous vous recommandons de spécifier unLOCATIONdans Amazon S3 lorsque vous créez une table Hive à l'aide de AWS Glue. Vous pouvez également utiliser la classification de configurationhive-sitepour spécifier un emplacement dans Amazon S3 pourhive.metastore.warehouse.dir, qui s'applique à toutes les tables Hive. Si une table est créée dans un emplacement HDFS et que le cluster qui l'a créée est toujours en cours d'exécution, vous pouvez mettre à jour l'emplacement de la table vers Amazon S3 depuis AWS Glue. Pour plus d'informations, consultez la section Utilisation de tableaux sur la console AWS Glue dans le Guide du développeur AWS Glue.Les valeurs de partition contenant des guillemets et des apostrophes ne sont pas prises en charge, par exemple
PARTITION (owner="Doe's")..Les statistiques sur les colonnes
sont prises en charge à partir de la version emr-5.31.0. L'utilisation de l'autorisation Hive
n'est pas prise en charge. Comme alternative, pensez à utiliser AWS Glue Resource-Based Policies. Pour plus d'informations, consultez la section Resource-Based Politiques d'utilisation relatives à l'accès d'Amazon EMR au catalogue de données AWS Glue.
Tenez compte des points suivants lorsque vous utilisez AWS Glue Data Catalog en tant que catalogue REST Apache Iceberg avec Spark :
-
Si vous utilisez le catalogue de sessions Spark avec Iceberg, décrit dansDifférences de configuration entre Iceberg SparkCatalog et SparkSessionCatalog, vous devez configurer le catalogue de données AWS Glue en tant que métastore Apache Hive, en plus de configurer le catalogue de données AWS Glue en tant que catalogue REST Apache Iceberg.
-
Le point de terminaison IRC AWS Glue Data Catalog ne prend en charge que le schéma d'authentification Amazon Sigv4. OAuth n'est pas pris en charge. Pour les utilisateurs d'OAuth, veuillez utiliser IAM Identity Center pour configurer l'accès. Voir Connecter Lake Formation à IAM Identity Center.
-
Le catalogue REST de AWS Glue Iceberg ne prend pas en charge toutes les opérations en open source.
-
Voici les considérations relatives à Amazon EMR avec Lake Formation.