

Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.

# Distribuzione
<a name="dqdl-rule-types-Distribution"></a>

Usa l'`Distribution`analizzatore per calcolare la distribuzione di frequenza dei valori in una colonna. L'analizzatore produce diversi output a seconda del tipo di dati della colonna:
+ **Colonne numeriche**: genera un istogramma raggruppato. L'istogramma divide l'intervallo di valori della colonna in intervalli di uguale larghezza (bin) e conta il numero di valori in ogni raccoglitore.
+ **Stringa, data e altre colonne non numeriche**: genera una distribuzione dei valori che conta la frequenza di ogni valore distinto, ordinata in ordine decrescente per frequenza. L'analizzatore restituisce solo i primi 20 valori più frequenti.

**Nota**  
È possibile utilizzare l'`Distribution`Analyzer solo nel `Analyzers` blocco del set di regole DQDL. Non può essere usato come regola.

**Sintassi**

```
Distribution {{<COL_NAME>}}
Distribution {{<COL_NAME>}} with bins = {{<BIN_COUNT>}}
Distribution {{<COL_NAME>}} with bins = {{<BIN_COUNT>}}, rebin = {{<true|false>}}
```
+ **COL\_NAME ** — Il nome della colonna da analizzare o per calcolare le distribuzioni `AllColumns` per tutte le colonne del set di dati.

  **Tipi di colonna supportati**: qualsiasi tipo di colonna
+ **bins ** (opzionale) — Il numero di bin (intervalli) da utilizzare per gli istogrammi numerici delle colonne. Il valore predefinito è 20. Il valore massimo è 20. Questo parametro non ha effetto sulle colonne non numeriche.
+ **rebin ** (opzionale) — Controlla il comportamento di rebinning automatico. Quando l'overflow supera la soglia per esecuzioni consecutive, l'analizzatore si riavvia automaticamente. Il valore predefinito è `true`. Impostato per mantenere i bordi del contenitore congelati `false` a tempo indeterminato indipendentemente dalla frequenza di overflow. Per ulteriori informazioni, consulta [Riavvio automatico](dqdl.md#dqdl-analyzers-distribution-rebinning).

**Esempio: distribuzione di base per una singola colonna **

L'esempio seguente calcola una distribuzione di frequenza per la `Salary` colonna utilizzando i 20 bin predefiniti:

```
Analyzers = [
    Distribution "Salary"
]
```

**Esempio: numero di raccoglitori personalizzato **

L'esempio seguente calcola un istogramma per la `Age` colonna utilizzando 10 contenitori:

```
Analyzers = [
    Distribution "Age" with bins = 10
]
```

**Esempio: distribuzione per tutte le colonne **

L'esempio seguente calcola le distribuzioni per tutte le colonne del set di dati. Le colonne numeriche producono istogrammi con 20 contenitori e le colonne non numeriche producono distribuzioni di valori:

```
Analyzers = [
    Distribution AllColumns
]
```

**Esempio: combinazione con regole e altri analizzatori **

L'esempio seguente mostra un set di regole che combina regole, analizzatori standard e l'analizzatore: `Distribution`

```
Rules = [
    RowCount > 100,
    Completeness "Salary" > 0.9
]
Analyzers = [
    Mean "Salary",
    StandardDeviation "Salary",
    Distribution "Salary" with bins = 15,
    Distribution "Department"
]
```

**Formato di output**

Quando si esegue l'`Distribution`Analyzer, viene prodotta una statistica denominata. `Distribution` Le statistiche scalari (come `Mean` o`Sum`) restituiscono un singolo valore numerico. La `Distribution` statistica, al contrario, restituisce un risultato strutturato:
+ `BinEdges`— Una matrice che definisce i limiti del contenitore (per le colonne numeriche) o i valori distinti (per le colonne non numeriche).
+ `Count`— Una serie di frequenze per ogni contenitore o valore.

È possibile recuperare i risultati della distribuzione utilizzando l'`ListDataQualityStatistics`API o l'`GetDataQualityResult`API. Per ulteriori informazioni sulle API Data Quality, consulta le API [ Data Quality ](https://docs.aws.amazon.com/glue/latest/dg/aws-glue-api-data-quality.html) nel *AWS Glue API Reference. *

**Comportamento nullo**

L'analizzatore esclude le righe con valori NULL nella colonna di destinazione dal calcolo del bin.

Per ulteriori informazioni sui bordi dei bin bloccati, sulle osservazioni di overflow e sul rebinning automatico, vedere. [Analizzatore di distribuzione](dqdl.md#dqdl-analyzers-distribution)