View a markdown version of this page

Abfragen Ihres Data Lake - Amazon Redshift

Amazon Redshift unterstützt die Verwendung von Python-UDFs nach dem 30. Juni 2026 nicht mehr. Wir werden damit beginnen, es schrittweise durchzusetzen. Weitere Informationen zum Ende der Lebensdauer von Python und zu den Migrationsoptionen finden Sie im Blogbeitrag, der am 30. Juni 2025 veröffentlicht wurde.

Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.

Abfragen Ihres Data Lake

Sie können Amazon Redshift verwenden, um Daten in Amazon S3 abzufragen, ohne die Daten in Amazon Redshift-Tabellen laden zu müssen. Amazon Redshift bietet SQL-Funktionen für die schnelle Online-Analyseverarbeitung (OLAP) von sehr großen Datensätzen, die sowohl in Amazon-Redshift-Clustern als auch Amazon-S3-Data-Lakes gespeichert sind. Sie können Daten in vielen Formaten abfragen, darunter Iceberg, Parquet, ORC, RCFile,, TextFile SequenceFile RegexSerde, OpenCSV und AVRO. Um die Struktur der Dateien in Amazon S3 zu definieren, erstellen Sie externe Schemata und Tabellen. Dann verwenden Sie einen externen Datenkatalog wie AWS Glue oder Ihren eigenen Apache Hive-Metastore. Änderungen an einem der Datenkatalogtypen sind sofort für jeden Ihrer Amazon-Redshift-Cluster verfügbar.

Nachdem Ihre Daten in einem AWS Glue Datenkatalog registriert und aktiviert wurden AWS Lake Formation, können Sie mit der Abfrage Ihres Data Lake beginnen.

Sie können die externen Tabellen in einer oder mehreren Spalten partitionieren, um die Abfrageleistung durch Partitionseliminierung zu optimieren. Sie können die externen Tabellen mit Amazon-Redshift-Tabellen abfragen und verknüpfen. Sie können von mehreren Amazon Redshift-Clustern aus auf externe Tabellen zugreifen und die Amazon S3-Daten von jedem Cluster in derselben AWS Region abfragen. Wenn Sie Amazon-S3-Datendateien aktualisieren, stehen diese Daten sofort zur Abfrage von allen Ihren Amazon-Redshift-Clustern aus zur Verfügung.

Mithilfe der integrierten Data Lake-Abfrage-Engine für RG und Redshift Serverless

Amazon Redshift RG-Cluster und Amazon Redshift Serverless enthalten eine integrierte Data Lake-Abfrage-Engine, die auf den eigenen Rechenressourcen des Clusters ausgeführt wird und ein einheitliches Erlebnis sowohl für Data Lake- als auch für Data Warehouse-Anwendungsfälle bietet.

Die integrierte Data Lake-Abfrage-Engine macht die Verwendung von Redshift Spectrum überflüssig und macht die damit verbundenen Redshift Spectrum-Gebühren überflüssig. Die integrierte Data Lake-Abfrage-Engine unterstützt auch das Abfragen von Daten in Amazon S3-Buckets, die sich in einer anderen Region befinden. AWS Cross-region Für Abfragen fallen zusätzliche Datenübertragungsgebühren an. Für die Aktivierung der integrierten Data Lake-Abfrage-Engine ist keine zusätzliche Konfiguration erforderlich, da sie standardmäßig aktiviert ist.

Anmerkung

In einigen Fällen können Sie auf RG eine langsamere Leistung im Vergleich zu RA3-Clustern beobachten, auf denen Redshift Spectrum ausgeführt wird, das unabhängig mithilfe dedizierter Rechenressourcen skaliert wird. Wenn Sie eine langsamere Abfrageleistung feststellen, sollten Sie erwägen, weitere Knoten hinzuzufügen oder ein Upgrade auf größere RG-Instance-Größen durchzuführen.

Verwenden von Redshift Spectrum für DC2 und RA3

Auf von DC2 und RA3 bereitgestellten Clustern befindet sich Redshift Spectrum auf dedizierten Amazon Redshift-Servern, die von Ihrem Cluster unabhängig sind. Redshift Spectrum verschiebt viele datenverarbeitungsintensive Aufgaben, wie etwa die Prädikatfilterung und -aggregierung, auf die Redshift-Spectrum-Ebene. Redshift Spectrum lässt sich auch intelligent skalieren, um die Vorteile der massiv parallelen Verarbeitung zu nutzen.

Weitere Informationen zu Redshift Spectrum, einschließlich zur Arbeit mit Redshift Spectrum und Data Lakes, finden Sie unter Erste Schritte mit Amazon Redshift Spectrum im Datenbankentwicklerhandbuch zu Amazon Redshift.