View a markdown version of this page

Distribution - AWS Glue

Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.

Distribution

Verwenden Sie den Distribution Analyzer, um die Häufigkeitsverteilung von Werten in einer Spalte zu berechnen. Der Analyzer erzeugt je nach Spaltendatentyp unterschiedliche Ausgaben:

  • Numerische Spalten — Generiert ein Histogramm mit Unterteilungen. Das Histogramm unterteilt den Wertebereich der Spalte in Intervalle gleicher Breite (Abschnitte) und zählt die Anzahl der Werte in jedem Abschnitt.

  • Zeichenfolge, Datum und andere nicht numerische Spalten — Generiert eine Wertverteilung, die die Häufigkeit jedes einzelnen Werts zählt, sortiert in absteigender Reihenfolge nach Häufigkeit. Der Analysator gibt nur die 20 häufigsten Werte zurück.

Anmerkung

Sie können den Distribution Analyzer nur im Analyzers Block Ihres DQDL-Regelsatzes verwenden. Er kann in der Regel nicht verwendet werden.

Syntax

Distribution <COL_NAME> Distribution <COL_NAME> with bins = <BIN_COUNT> Distribution <COL_NAME> with bins = <BIN_COUNT>, rebin = <true|false>
  • COL_NAME — Der Name der Spalte, die analysiert oder AllColumns die Verteilungen für alle Spalten im Datensatz berechnet werden sollen.

    Unterstützte Spaltentypen: Jeder Spaltentyp

  • Bins (optional) — Die Anzahl der Abschnitte (Intervalle), die für numerische Spaltenhistogramme verwendet werden sollen. Der Standardwert ist 20. Der Höchstwert ist 20. Dieser Parameter hat keine Auswirkung auf nicht numerische Spalten.

  • rebin (optional) — Steuert das automatische Rebining-Verhalten. Wenn der Überlauf bei aufeinanderfolgenden Durchläufen den Schwellenwert überschreitet, führt der Analyzer automatisch ein Rebining durch. Der Standardwert ist true. Stellen Sie diese Option auf einfalse, um die Behälterränder unabhängig von der Häufigkeit des Überlaufens auf unbestimmte Zeit einzufrieren. Weitere Informationen finden Sie unter Automatisches Rebinning.

Beispiel — Grundverteilung für eine einzelne Spalte

Im folgenden Beispiel wird eine Häufigkeitsverteilung für die Salary Spalte anhand der standardmäßigen 20 Abschnitte berechnet:

Analyzers = [ Distribution "Salary" ]

Beispiel — Benutzerdefinierte Bin-Anzahl

Im folgenden Beispiel wird ein Histogramm für die Age Spalte anhand von 10 Abschnitten berechnet:

Analyzers = [ Distribution "Age" with bins = 10 ]

Beispiel — Verteilung für alle Spalten

Im folgenden Beispiel werden Verteilungen für alle Spalten im Datensatz berechnet. Numerische Spalten erzeugen Histogramme mit 20 Abschnitten, und nichtnumerische Spalten erzeugen Wertverteilungen:

Analyzers = [ Distribution AllColumns ]

Beispiel — Kombination mit Regeln und anderen Analysatoren

Das folgende Beispiel zeigt einen Regelsatz, der Regeln, Standardanalysatoren und den Analyzer kombiniert: Distribution

Rules = [ RowCount > 100, Completeness "Salary" > 0.9 ] Analyzers = [ Mean "Salary", StandardDeviation "Salary", Distribution "Salary" with bins = 15, Distribution "Department" ]

Ausgabeformat

Wenn Sie den Distribution Analyzer ausführen, generiert er eine Statistik mit dem Namen. Distribution Skalare Statistiken (wie Mean oderSum) geben einen einzelnen numerischen Wert zurück. Die Distribution Statistik gibt dagegen ein strukturiertes Ergebnis zurück:

  • BinEdges— Ein Array, das die Abteilungsgrenzen (für numerische Spalten) oder unterschiedliche Werte (für nicht numerische Spalten) definiert.

  • Count— Eine Reihe von Frequenzen für jeden Abschnitt oder Wert.

Sie können Verteilungsergebnisse mithilfe der ListDataQualityStatistics API oder der GetDataQualityResult API abrufen. Weitere Informationen zu den Data Quality APIs finden Sie unter Data Quality APIs in der AWS Glue-API-Referenz.

Nullverhalten

Der Analyzer schließt Zeilen mit NULL-Werten in der Zielspalte von der Bin-Berechnung aus.

Weitere Informationen zu eingefrorenen Partienkanten, Überlaufbeobachtungen und automatischem erneuten Einteilen finden Sie unter. Verteilungsanalysator