Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.
Distribution
Utilisez l'Distributionanalyseur pour calculer la distribution de fréquence des valeurs d'une colonne. L'analyseur produit différentes sorties en fonction du type de données de colonne :
-
Colonnes numériques — Génère un histogramme groupé. L'histogramme divise la plage de valeurs de la colonne en intervalles de largeur égale (cases) et compte le nombre de valeurs dans chaque case.
-
Colonnes de type chaîne, date et autres colonnes non numériques : génère une distribution de valeurs qui compte la fréquence de chaque valeur distincte, triée par ordre décroissant de fréquence. L'analyseur renvoie uniquement les 20 valeurs les plus fréquentes.
Note
Vous ne pouvez utiliser l'Distributionanalyseur que dans le Analyzers bloc de votre ensemble de règles DQDL. Il ne peut pas être utilisé en règle générale.
Syntaxe
Distribution<COL_NAME>Distribution<COL_NAME>with bins =<BIN_COUNT>Distribution<COL_NAME>with bins =<BIN_COUNT>, rebin =<true|false>
-
COL_NAME : nom de la colonne à analyser ou
AllColumnsà calculer les distributions pour toutes les colonnes du jeu de données.Types de colonnes pris en charge : n’importe quel type de colonne
-
bacs (facultatif) : nombre de bacs (intervalles) à utiliser pour les histogrammes de colonnes numériques. La valeur par défaut est 20. La valeur maximale est de 20. Ce paramètre n'a aucun effet sur les colonnes non numériques.
-
rebin (facultatif) — Contrôle le comportement de rebinage automatique. Lorsque le débordement dépasse le seuil lors d'essais consécutifs, l'analyseur se réactive automatiquement. La valeur par défaut est
true. Réglez pourfalsegarder les bords du bac gelés indéfiniment, quelle que soit la fréquence de débordement. Pour de plus amples informations, veuillez consulter Rebinage automatique.
Exemple — Distribution de base pour une seule colonne
L'exemple suivant calcule une distribution de fréquence pour la Salary colonne à l'aide des 20 cases par défaut :
Analyzers = [ Distribution "Salary" ]
Exemple — Nombre de bacs personnalisé
L'exemple suivant calcule un histogramme pour la Age colonne à l'aide de 10 groupes :
Analyzers = [ Distribution "Age" with bins = 10 ]
Exemple — Distribution pour toutes les colonnes
L'exemple suivant calcule les distributions pour toutes les colonnes de l'ensemble de données. Les colonnes numériques produisent des histogrammes avec 20 cases, et les colonnes non numériques produisent des distributions de valeurs :
Analyzers = [ Distribution AllColumns ]
Exemple — Combinaison avec des règles et d'autres analyseurs
L'exemple suivant montre un ensemble de règles qui combine des règles, des analyseurs standard et l'Distributionanalyseur :
Rules = [ RowCount > 100, Completeness "Salary" > 0.9 ] Analyzers = [ Mean "Salary", StandardDeviation "Salary", Distribution "Salary" with bins = 15, Distribution "Department" ]
Format de sortie
Lorsque vous exécutez l'Distributionanalyseur, il produit une statistique nommée. Distribution Les statistiques scalaires (telles que Mean ouSum) renvoient une valeur numérique unique. La Distribution statistique, en revanche, renvoie un résultat structuré :
-
BinEdges— Tableau définissant les limites des classes (pour les colonnes numériques) ou des valeurs distinctes (pour les colonnes non numériques). -
Count— Un tableau de fréquences pour chaque case ou valeur.
Vous pouvez récupérer les résultats de distribution à l'aide de l'ListDataQualityStatisticsAPI ou de l'GetDataQualityResultAPI. Pour plus d'informations sur les API de qualité des données, consultez la section API de qualité des données dans la référence des API AWS Glue.
Comportement null
L'analyseur exclut du calcul des classes les lignes contenant des valeurs NULL dans la colonne cible.
Pour plus d'informations sur les bords de bacs gelés, les observations de débordement et le reregroupement automatique, consultez. Analyseur de distribution