

Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.

# Distribution
<a name="dqdl-rule-types-Distribution"></a>

Utilisez l'`Distribution`analyseur pour calculer la distribution de fréquence des valeurs d'une colonne. L'analyseur produit différentes sorties en fonction du type de données de colonne :
+ **Colonnes numériques ** — Génère un histogramme groupé. L'histogramme divise la plage de valeurs de la colonne en intervalles de largeur égale (cases) et compte le nombre de valeurs dans chaque case.
+ **Colonnes de type chaîne, date et autres colonnes non numériques ** : génère une distribution de valeurs qui compte la fréquence de chaque valeur distincte, triée par ordre décroissant de fréquence. L'analyseur renvoie uniquement les 20 valeurs les plus fréquentes.

**Note**  
Vous ne pouvez utiliser l'`Distribution`analyseur que dans le `Analyzers` bloc de votre ensemble de règles DQDL. Il ne peut pas être utilisé en règle générale.

**Syntaxe**

```
Distribution {{<COL_NAME>}}
Distribution {{<COL_NAME>}} with bins = {{<BIN_COUNT>}}
Distribution {{<COL_NAME>}} with bins = {{<BIN_COUNT>}}, rebin = {{<true|false>}}
```
+ **COL\_NAME ** : nom de la colonne à analyser ou `AllColumns` à calculer les distributions pour toutes les colonnes du jeu de données.

  **Types de colonnes pris en charge** : n’importe quel type de colonne
+ **bacs ** (facultatif) : nombre de bacs (intervalles) à utiliser pour les histogrammes de colonnes numériques. La valeur par défaut est 20. La valeur maximale est de 20. Ce paramètre n'a aucun effet sur les colonnes non numériques.
+ **rebin ** (facultatif) — Contrôle le comportement de rebinage automatique. Lorsque le débordement dépasse le seuil lors d'essais consécutifs, l'analyseur se réactive automatiquement. La valeur par défaut est `true`. Réglez pour `false` garder les bords du bac gelés indéfiniment, quelle que soit la fréquence de débordement. Pour de plus amples informations, veuillez consulter [Rebinage automatique](dqdl.md#dqdl-analyzers-distribution-rebinning).

**Exemple — Distribution de base pour une seule colonne **

L'exemple suivant calcule une distribution de fréquence pour la `Salary` colonne à l'aide des 20 cases par défaut :

```
Analyzers = [
    Distribution "Salary"
]
```

**Exemple — Nombre de bacs personnalisé **

L'exemple suivant calcule un histogramme pour la `Age` colonne à l'aide de 10 groupes :

```
Analyzers = [
    Distribution "Age" with bins = 10
]
```

**Exemple — Distribution pour toutes les colonnes **

L'exemple suivant calcule les distributions pour toutes les colonnes de l'ensemble de données. Les colonnes numériques produisent des histogrammes avec 20 cases, et les colonnes non numériques produisent des distributions de valeurs :

```
Analyzers = [
    Distribution AllColumns
]
```

**Exemple — Combinaison avec des règles et d'autres analyseurs **

L'exemple suivant montre un ensemble de règles qui combine des règles, des analyseurs standard et l'`Distribution`analyseur :

```
Rules = [
    RowCount > 100,
    Completeness "Salary" > 0.9
]
Analyzers = [
    Mean "Salary",
    StandardDeviation "Salary",
    Distribution "Salary" with bins = 15,
    Distribution "Department"
]
```

**Format de sortie**

Lorsque vous exécutez l'`Distribution`analyseur, il produit une statistique nommée. `Distribution` Les statistiques scalaires (telles que `Mean` ou`Sum`) renvoient une valeur numérique unique. La `Distribution` statistique, en revanche, renvoie un résultat structuré :
+ `BinEdges`— Tableau définissant les limites des classes (pour les colonnes numériques) ou des valeurs distinctes (pour les colonnes non numériques).
+ `Count`— Un tableau de fréquences pour chaque case ou valeur.

Vous pouvez récupérer les résultats de distribution à l'aide de l'`ListDataQualityStatistics`API ou de l'`GetDataQualityResult`API. Pour plus d'informations sur les API de qualité des données, consultez la section API de qualité des [ données ](https://docs.aws.amazon.com/glue/latest/dg/aws-glue-api-data-quality.html) dans la référence des API *AWS Glue*.

**Comportement null**

L'analyseur exclut du calcul des classes les lignes contenant des valeurs NULL dans la colonne cible.

Pour plus d'informations sur les bords de bacs gelés, les observations de débordement et le reregroupement automatique, consultez. [Analyseur de distribution](dqdl.md#dqdl-analyzers-distribution)