Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.
AWSSupport-DiagnoseEMRLogsWithAthena
Description
Le AWSSupport-DiagnoseEMRLogsWithAthena runbook permet de diagnostiquer les journaux Amazon EMR à l'aide d'Amazon Athena en intégration avec AWS Glue Data Catalog. Amazon Athena est utilisé pour interroger les fichiers journaux Amazon EMR pour les conteneurs, les journaux de nœuds, ou les deux, avec des paramètres facultatifs pour des plages de dates spécifiques ou des recherches basées sur des mots clés.
Le runbook peut récupérer automatiquement l'emplacement du journal Amazon EMR pour un cluster existant, ou vous pouvez spécifier l'emplacement du journal Amazon S3. Pour analyser les journaux, le runbook :
-
Crée une AWS Glue base de données et exécute des requêtes DDL (Amazon Athena Data Definition Language) sur l'emplacement des journaux Amazon EMR Amazon S3 afin de créer des tables pour les journaux de cluster et une liste des problèmes connus.
-
Exécute des requêtes DML (Data Manipulation Language) pour rechercher des modèles de problèmes connus dans les journaux Amazon EMR. Les requêtes renvoient une liste des problèmes détectés, leur nombre d'occurrences et le nombre de mots clés correspondants par chemin de fichier Amazon S3.
-
Les résultats sont chargés dans un compartiment Amazon S3 que vous spécifiez sous le préfixe
saw_diagnose_EMR_known_issues. -
Le runbook renvoie les résultats des requêtes Amazon Athena, en mettant en évidence les résultats, les recommandations et les références aux articles Amazon Knowledge Center (KC) provenant d'un sous-ensemble prédéfini.
-
En cas d'achèvement ou d'échec, la AWS Glue base de données et les fichiers contenant des problèmes connus chargés dans le compartiment Amazon S3 sont supprimés.
Fonctionnement
AWSSupport-DiagnoseEMRLogsWithAthenaEffectuez une analyse des journaux Amazon EMR à l'aide d'Amazon Athena pour détecter les erreurs et mettre en évidence les résultats, les recommandations et les articles pertinents du centre de connaissances.
Le runbook exécute les étapes suivantes :
-
Obtenez l'emplacement du journal du cluster Amazon EMR à l'aide de l'ID du cluster ou saisissez l'emplacement Amazon S3 pour récupérer l'emplacement et la taille du journal.
-
Fournissez une estimation des coûts d'Athena en fonction de la taille de l'emplacement des rondins.
-
Obtenez l'approbation pour poursuivre en demandant l'approbation des responsables IAM désignés avant d'exécuter les requêtes Athena et de passer aux étapes suivantes.
-
Téléchargez les problèmes connus dans le compartiment Amazon S3 spécifié, créez une AWS Glue base de données et des tables.
-
Exécutez des requêtes Athena sur les données des journaux Amazon EMR. Les requêtes peuvent effectuer une recherche par plage de dates, par mots clés, selon les deux critères, ou être exécutées sans filtres en fonction des entrées fournies.
-
Analysez les résultats pour mettre en évidence les conclusions, les recommandations et les articles pertinents de KC.
-
Liens de sortie pour les résultats des requêtes DML Amazon Athena.
-
Nettoyez l'environnement en supprimant la base de données créée, les tables et les problèmes connus téléchargés.
Type de document
Automatisation
Propriétaire
Amazon
Plateformes
/
Le AutomationAssumeRole paramètre nécessite les actions suivantes pour utiliser correctement le runbook :
-
athéna : GetQueryExecution
-
athéna : StartQueryExecution
-
athéna : GetPreparedStatement
-
athéna : CreatePreparedStatement
-
colle : GetDatabase
-
colle : CreateDatabase
-
colle : DeleteDatabase
-
colle : CreateTable
-
colle : GetTable
-
colle : DeleteTable
-
Elasticmapreduce : DescribeCluster
-
s3 : ListBucket
-
s3 : GetBucketVersioning
-
s3 : ListBucketVersions
-
s3 : GetBucketPublicAccessBlock
-
s3 : GetBucketPolicyStatus
-
s3 : GetObject
-
s3 : GetBucketLocation
-
tarification : GetProducts
-
tarification : GetAttributeValues
-
tarification : DescribeServices
-
tarification : ListPriceLists
Important
Pour limiter l'accès aux seules ressources nécessaires à cette automatisation, associez la politique suivante au rôle IAM qui approuve le service SSM. Remplacez la partition, la région et le compte par les valeurs appropriées pour la partition, la région et le numéro de compte où le run book est exécuté.
Instructions
Pour configurer l'automatisation, procédez comme suit :
-
Naviguez AWSSupport-DiagnoseEMRLogsWithAthena
dans la AWS Systems Manager rubrique Documents. -
Sélectionnez Execute automation (Exécuter l'automatisation).
-
Pour les paramètres d'entrée, entrez les informations suivantes :
-
AutomationAssumeRole (Facultatif) :
Le nom de ressource Amazon (ARN) du rôle Gestion des identités et des accès AWS (IAM) qui permet à Systems Manager Automation d'effectuer les actions en votre nom. Si aucun rôle n'est spécifié, Systems Manager Automation utilise les autorisations de l'utilisateur qui démarre ce runbook.
-
ClusterID (obligatoire) :
L'ID du cluster Amazon EMR.
-
S3LogLocation (Facultatif) :
Emplacement du journal Amazon EMR d'Amazon S3. Entrez l' Path-style URL de l'emplacement Amazon S3, par exemple :
s3://amzn-s3-demo-bucket/myfolder/j-1K48XXXXXXHCB/. Fournissez ce paramètre si le cluster Amazon EMR a été interrompu pendant plus de30jours. -
S3BucketName (Obligatoire) :
Le nom du compartiment Amazon S3 pour télécharger la liste des problèmes connus et le résultat des requêtes Amazon Athena. Le blocage de l'accès public doit être activé sur le bucket et se trouver dans la même AWS région et sur le même compte que le cluster Amazon EMR.
-
Approbateurs (obligatoire) :
La liste des mandants AWS authentifiés qui peuvent soit approuver soit rejeter l'action. Vous pouvez spécifier des principaux à l'aide de l'un des formats suivants : nom d'utilisateur, ARN utilisateur, ARN du rôle IAM ou ARN du rôle d'assume le rôle IAM. Le nombre maximum d'approbateurs est de 10.
-
FetchNodeLogsOnly (Facultatif) :
Si ce paramètre est défini sur
true, l'automatisation diagnostique les journaux des conteneurs de l'application Amazon EMR. La valeur par défaut estfalse. -
FetchContainersLogsOnly(Facultatif) :
Si ce paramètre est défini sur
true, l'automatisation diagnostique les journaux des conteneurs Amazon EMR. La valeur par défaut estfalse. -
EndSearchDate (Facultatif) :
Date de fin des recherches dans les journaux. S'il est fourni, l'automatisation recherchera exclusivement les journaux générés jusqu'à la date spécifiée dans le format YYYY-MM-DD (par exemple :
2024-12-30). -
DaysToCheck (Facultatif) :
Lorsqu'il
EndSearchDateest fourni, ce paramètre est requis pour déterminer le nombre de jours nécessaires pour rechercher rétrospectivement les journaux à partir des informations spécifiées.EndSearchDateLa valeur maximale est de30jours. La valeur par défaut est1. -
SearchKeywords (Facultatif) :
La liste des mots clés à rechercher dans les journaux, séparés par des virgules. Les mots clés ne peuvent pas contenir de guillemets simples ou doubles.
-
-
Sélectionnez Exécuter.
-
L'automatisation démarre.
-
Le document exécute les étapes suivantes :
-
obtenir LogLocation :
Récupère l'emplacement du journal Amazon S3 en interrogeant l'ID de cluster Amazon EMR spécifié. Si l'automatisation n'est pas en mesure d'interroger l'emplacement du journal à partir de l'ID de cluster Amazon EMR, le runbook utilise le paramètre
S3LogLocationd'entrée. -
succursale OnValidLog :
Vérifie l'emplacement des journaux Amazon EMR. Si l'emplacement est valide, procédez à l'estimation des coûts potentiels d'Amazon Athena lors de l'exécution de requêtes sur les journaux Amazon EMR.
-
estimation AthenaCosts :
Détermine la taille des journaux Amazon EMR et fournit une estimation des coûts liés à l'exécution de scans Athena sur le jeu de données de journaux. Pour les régions non commerciales (non AWS partitionnées), cette étape fournit simplement la taille du journal sans estimer les coûts. Les coûts peuvent être calculés à l'aide de la documentation tarifaire Athena dans la région spécifiée.
-
Automatisation des approbations :
Attend l'approbation des responsables IAM désignés pour passer aux prochaines étapes de l'automatisation. La notification d'approbation contient le coût estimé de l'analyse Amazon Athena dans les journaux Amazon EMR, ainsi que des informations sur les ressources mises en service par l'automatisation.
-
télécharger KnownIssuesExecuteAthenaQueries :
Télécharge les problèmes connus prédéfinis dans le compartiment Amazon S3 spécifié dans le
S3BucketNameparamètre. Crée une AWS Glue base de données et des tables. Exécute les requêtes Amazon Athena dans la AWS Glue base de données en fonction des paramètres d'entrée. -
obtenir QueryExecutionStatus :
Attend que l'état d'exécution de la requête Amazon Athena soit en
SUCCEEDEDcours. La requête DML Amazon Athena recherche les erreurs et les exceptions dans les journaux du cluster Amazon EMR. -
analyser AthenaResults :
Analyse les résultats d'Amazon Athena pour fournir des résultats, des recommandations et des articles du centre de connaissances (KC) provenant d'un ensemble prédéfini de mappages.
-
obtenir AnalyzeResultsQuery1ExecutionStatus :
Attend que l'
SUCCEEDEDétat d'exécution de la requête soit en cours. La requête DML Amazon Athena analyse les résultats de la requête DML précédente. Cette requête d'analyse renverra les exceptions correspondantes avec les résolutions et les articles KC -
obtenir AnalyzeResultsQuery2ExecutionStatus :
Attend que l'
SUCCEEDEDétat d'exécution de la requête soit en cours. La requête DML Amazon Athena analyse les résultats de la requête DML précédente. Cette requête d'analyse renverra la liste des chemins exceptions/errors détectés dans chaque chemin de journal Amazon S3. -
imprimer AthenaQueriesMessage :
Imprime les liens vers les résultats des requêtes DML Amazon Athena.
-
Ressources de nettoyage :
Clean-ups ressources en supprimant la AWS Glue base de données créée et en supprimant les fichiers de problèmes connus qui ont été créés dans le compartiment de journaux Amazon EMR.
-
-
Une fois terminé, consultez la section Sorties pour obtenir les résultats détaillés de l'exécution :
La sortie fournit trois liens pour les résultats de la requête Athena :
-
Liste de toutes les erreurs et exceptions fréquentes détectées dans les journaux du cluster Amazon EMR, ainsi que les emplacements des journaux correspondants (préfixe Amazon S3).
-
Résumé des exceptions connues uniques identifiées dans les journaux Amazon EMR, ainsi que des résolutions recommandées et des articles KC pour vous aider à résoudre les problèmes.
-
Informations détaillées sur les endroits où des erreurs et des exceptions spécifiques apparaissent dans les chemins de journalisation d'Amazon S3, afin de permettre un diagnostic plus approfondi.
-
Références
Systems Manager Automation
AWS documentation de service
-
Reportez-vous à la section Résolution des problèmes liés aux clusters Amazon EMR pour plus d'informations