

Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.

# Distribution
<a name="dqdl-rule-types-Distribution"></a>

Verwenden Sie den `Distribution` Analyzer, um die Häufigkeitsverteilung von Werten in einer Spalte zu berechnen. Der Analyzer erzeugt je nach Spaltendatentyp unterschiedliche Ausgaben:
+ **Numerische Spalten ** — Generiert ein Histogramm mit Unterteilungen. Das Histogramm unterteilt den Wertebereich der Spalte in Intervalle gleicher Breite (Abschnitte) und zählt die Anzahl der Werte in jedem Abschnitt.
+ **Zeichenfolge, Datum und andere nicht numerische Spalten ** — Generiert eine Wertverteilung, die die Häufigkeit jedes einzelnen Werts zählt, sortiert in absteigender Reihenfolge nach Häufigkeit. Der Analysator gibt nur die 20 häufigsten Werte zurück.

**Anmerkung**  
Sie können den `Distribution` Analyzer nur im `Analyzers` Block Ihres DQDL-Regelsatzes verwenden. Er kann in der Regel nicht verwendet werden.

**Syntax**

```
Distribution {{<COL_NAME>}}
Distribution {{<COL_NAME>}} with bins = {{<BIN_COUNT>}}
Distribution {{<COL_NAME>}} with bins = {{<BIN_COUNT>}}, rebin = {{<true|false>}}
```
+ **COL\_NAME ** — Der Name der Spalte, die analysiert oder `AllColumns` die Verteilungen für alle Spalten im Datensatz berechnet werden sollen.

  **Unterstützte Spaltentypen**: Jeder Spaltentyp
+ **Bins ** (optional) — Die Anzahl der Abschnitte (Intervalle), die für numerische Spaltenhistogramme verwendet werden sollen. Der Standardwert ist 20. Der Höchstwert ist 20. Dieser Parameter hat keine Auswirkung auf nicht numerische Spalten.
+ **rebin ** (optional) — Steuert das automatische Rebining-Verhalten. Wenn der Überlauf bei aufeinanderfolgenden Durchläufen den Schwellenwert überschreitet, führt der Analyzer automatisch ein Rebining durch. Der Standardwert ist `true`. Stellen Sie diese Option auf ein`false`, um die Behälterränder unabhängig von der Häufigkeit des Überlaufens auf unbestimmte Zeit einzufrieren. Weitere Informationen finden Sie unter [Automatisches Rebinning](dqdl.md#dqdl-analyzers-distribution-rebinning).

**Beispiel — Grundverteilung für eine einzelne Spalte **

Im folgenden Beispiel wird eine Häufigkeitsverteilung für die `Salary` Spalte anhand der standardmäßigen 20 Abschnitte berechnet:

```
Analyzers = [
    Distribution "Salary"
]
```

**Beispiel — Benutzerdefinierte Bin-Anzahl **

Im folgenden Beispiel wird ein Histogramm für die `Age` Spalte anhand von 10 Abschnitten berechnet:

```
Analyzers = [
    Distribution "Age" with bins = 10
]
```

**Beispiel — Verteilung für alle Spalten **

Im folgenden Beispiel werden Verteilungen für alle Spalten im Datensatz berechnet. Numerische Spalten erzeugen Histogramme mit 20 Abschnitten, und nichtnumerische Spalten erzeugen Wertverteilungen:

```
Analyzers = [
    Distribution AllColumns
]
```

**Beispiel — Kombination mit Regeln und anderen Analysatoren **

Das folgende Beispiel zeigt einen Regelsatz, der Regeln, Standardanalysatoren und den Analyzer kombiniert: `Distribution`

```
Rules = [
    RowCount > 100,
    Completeness "Salary" > 0.9
]
Analyzers = [
    Mean "Salary",
    StandardDeviation "Salary",
    Distribution "Salary" with bins = 15,
    Distribution "Department"
]
```

**Ausgabeformat**

Wenn Sie den `Distribution` Analyzer ausführen, generiert er eine Statistik mit dem Namen. `Distribution` Skalare Statistiken (wie `Mean` oder`Sum`) geben einen einzelnen numerischen Wert zurück. Die `Distribution` Statistik gibt dagegen ein strukturiertes Ergebnis zurück:
+ `BinEdges`— Ein Array, das die Abteilungsgrenzen (für numerische Spalten) oder unterschiedliche Werte (für nicht numerische Spalten) definiert.
+ `Count`— Eine Reihe von Frequenzen für jeden Abschnitt oder Wert.

Sie können Verteilungsergebnisse mithilfe der `ListDataQualityStatistics` API oder der `GetDataQualityResult` API abrufen. Weitere Informationen zu den Data Quality APIs finden Sie unter [ Data Quality APIs ](https://docs.aws.amazon.com/glue/latest/dg/aws-glue-api-data-quality.html) in der *AWS Glue-API-Referenz*.

**Nullverhalten**

Der Analyzer schließt Zeilen mit NULL-Werten in der Zielspalte von der Bin-Berechnung aus.

Weitere Informationen zu eingefrorenen Partienkanten, Überlaufbeobachtungen und automatischem erneuten Einteilen finden Sie unter. [Verteilungsanalysator](dqdl.md#dqdl-analyzers-distribution)