Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.
Jobs
L'API Jobs descrive i tipi di dati e l'API relativi alla creazione, all'aggiornamento, all'eliminazione o alla visualizzazione di lavori in. AWS Glue
Tipi di dati
Struttura del processo
Specifica una definizione del processo.
Campi
-
Name— UTF-8 stringa, lunga non meno di 1 o più di 255 byte, corrispondente a. Single-line string patternIl nome assegnato alla definizione del processo.
-
JobMode— UTF-8 stringa (valori validi:SCRIPT=""|VISUAL=""|NOTEBOOK="").Una modalità che descrive come è stato creato un processo. I valori validi sono:
-
SCRIPT- Il lavoro è stato creato utilizzando l'editor di script di AWS Glue Studio. -
VISUAL- Il lavoro è stato creato utilizzando l'editor visivo di AWS Glue Studio. -
NOTEBOOK: il processo è stato creato utilizzando un notebook con sessioni interattive.
Quando il campo
JobModeè mancante o null, viene assegnatoSCRIPTcome valore predefinito. -
-
JobRunQueuingEnabled: booleano.Specifica se l'accodamento dell'esecuzione dei processi è abilitato per le esecuzioni di questo processo.
Il valore true indica che l'accodamento dei job run è abilitato e consente alle esecuzioni dei job di attendere in coda quando le risorse non sono disponibili anziché fallire immediatamente. Ciò include scenari come il raggiungimento dei limiti di esecuzione simultanea dei job, l'insufficienza delle risorse di calcolo (DPU) o i vincoli temporanei relativi alle risorse.
Nota
Per i VPC-based lavori con esaurimento dell'IP: l'accodamento si attiverà solo se viene rilevata una carenza di IP al momento dell'avvio del lavoro. Se l'esaurimento dell'IP si verifica dopo l'avvio del driver (durante il provisioning dell'esecutore), il processo avrà esito negativo anziché essere messo in coda.
Se il campo è falso o non viene compilato, l'esecuzione del job avrà esito negativo immediatamente quando le risorse non sono disponibili.
Se questo campo non corrisponde al set di valori impostato nell'esecuzione del processo, verrà utilizzato il valore presente nel campo di esecuzione del processo.
-
Description: stringa di descrizione, non superiore a 2048 byte di lunghezza, corrispondente a URI address multi-line string pattern.Descrizione del processo.
-
LogUri— UTF-8 stringa.Questo campo è riservato per uso futuro.
-
Role— UTF-8 corda.Il nome o ARN (Amazon Resource Name) del ruolo IAM associato a questo processo.
-
CreatedOn: timestamp.La data e l'ora in cui è stata creata la specifica della definizione del processo.
-
LastModifiedOn: timestamp.L'ultimo point-in-time in cui è stata modificata la definizione del processo.
-
ExecutionProperty: un oggetto ExecutionProperty.ExecutionPropertyche specifica il numero massimo di esecuzioni simultanee consentite per il processo. -
Command: un oggetto JobCommand.Il
JobCommandche esegue questo lavoro. -
DefaultArguments: una matrice della mappa di coppie chiave-valore.Ogni chiave è una UTF-8 stringa.
Ogni valore è una UTF-8 stringa.
Gli argomenti predefiniti per ciascuna esecuzione del processo, specificati come coppie nome-valore.
Qui è possibile specificare gli argomenti utilizzati dal proprio script di esecuzione del lavoro, nonché gli argomenti utilizzati dal proprio script di esecuzione AWS Glue del lavoro.
Gli argomenti del processo potrebbero essere registrati. Non passare segreti in testo chiaro come argomenti. Recupera i segreti da una AWS Glue connessione AWS Secrets Manager o da un altro meccanismo di gestione dei segreti se intendi mantenerli all'interno del Job.
Per informazioni su come specificare e utilizzare gli argomenti del proprio processo, fai riferimento a Chiamare le API AWS Glue in Python nella guida per gli sviluppatori.
Per informazioni sugli argomenti che puoi fornire a questo campo durante la configurazione dei processi Spark, consulta la pagina Special Parameters Used by AWS Glue nella Guida per gli sviluppatori.
Per informazioni sugli argomenti che puoi fornire a questo campo durante la configurazione dei processi Ray, consulta la pagina Using job parameters in Ray jobs nella Guida per gli sviluppatori.
-
NonOverridableArguments: una matrice della mappa di coppie chiave-valore.Ogni chiave è una UTF-8 stringa.
Ogni valore è una UTF-8 stringa.
Gli argomenti per questo processo che non vengono sovrascritti quando si forniscono argomenti di processo in un'esecuzione di processo, specificati come coppie nome-valore.
-
Connections: un oggetto ConnectionsList.Le connessioni utilizzate per questo processo.
-
MaxRetries: numero (intero).Il numero massimo di volte in cui riprovare questo processo dopo un JobRun errore.
-
AllocatedCapacity: numero (intero).in quanto obsoleto. Usare invece
MaxCapacity.Il numero di unità di elaborazione AWS Glue dati (DPU) assegnate alle esecuzioni di questo processo. È possibile allocare un minimo di 2 DPU; l'impostazione di default è 10. Una DPU è una misura relativa della potenza di elaborazione composta da 4 vCPU di capacità di elaborazione e 16 GB di memoria. Per ulteriori informazioni, consultare la pagina dei prezzi di AWS Glue
. -
Timeout: numero (intero), almeno 1.Timeout del processo in minuti. Indica il tempo massimo durante cui l'esecuzione di un processo può utilizzare le risorse prima di essere terminata e passare allo stato
TIMEOUT.I processi devono avere valori di timeout inferiori a 7 giorni o 10080 minuti. In caso contrario, i processi genereranno un'eccezione.
Quando il valore viene lasciato vuoto, il timeout è predefinito a 2.880 minuti per Glue versione 4.0 e precedenti o 480 minuti per Glue versione 5.0 e successive.
Tutti i AWS Glue lavori esistenti con un valore di timeout superiore a 7 giorni verranno impostati come impostazione predefinita su 7 giorni. Ad esempio, se un processo in batch ha impostato un timeout di 20 giorni, sarà interrotto al settimo giorno.
Per i processi di streaming, se è stata impostata una finestra di manutenzione, il processo sarà riavviato durante tale finestra dopo 7 giorni.
-
MaxCapacity: numero (doppio).Per i lavori di Glue versione 1.0 o precedente, utilizzando il tipo di worker standard, il numero di unità di elaborazione AWS Glue dati (DPU) che possono essere allocate durante l'esecuzione di questo lavoro. Una DPU è una misura relativa della potenza di elaborazione composta da 4 vCPU di capacità di elaborazione e 16 GB di memoria. Per ulteriori informazioni, consultare la pagina dei prezzi di AWS Glue
. Per i processi Glue versione 2.0 e successive, non è possibile specificare il valore
Maximum capacity. Si deve invece specificare unWorker typee unNumber of workers.Non impostare
MaxCapacityse usiWorkerTypeeNumberOfWorkers.Il valore che è possibile allocare per
MaxCapacityvaria a seconda che si esegua un processo shell di Python, un processo ETL di Apache Spark o un processo ETL di streaming di Apache Spark:-
Quando si specifica un processo shell di Python (
JobCommand.Name="pythonshell"), è possibile allocare 0,0625 o 1 DPU. Il valore di default è 0,0625 DPU. -
Quando si specifica un processo ETL Apache Spark (
JobCommand.Name="glueetl”) o un processo ETL di streaming Apache Spark (JobCommand.Name="gluestreaming”), è possibile allocare da 2 a 100 DPU. Il valore di default è 10 DPU. Questo tipo di processo non può avere un'allocazione DPU frazionata.
-
-
WorkerType— UTF-8 stringa (valori validi:Standard=""|G.025X=""|G.1X=""| |G.2X=""|G.4X=""|G.8X=""|G.12X=""|G.16X=""|R.1X=""| |R.2X=""R.4X=""R.8X=""|Z.2X="").Il tipo di worker predefinito allocato quando viene eseguito un processo.
AWS Glue fornisce diversi tipi di lavoratori per soddisfare diversi requisiti di carico di lavoro:
Tipi di G Worker (General-purpose computerworker):
-
G.025X: 0,25 DPU (2 vCPU, 4 GB di memoria, disco da 84 GB)
-
G.1X: 1 DPU (4 vCPU, 16 GB di memoria, disco da 94 GB)
-
G.2X: 2 DPU (8 vCPU, 32 GB di memoria, disco da 138 GB)
-
G.4X: 4 DPU (16 vCPU, 64 GB di memoria, disco da 256 GB)
-
G.8X: 8 DPU (32 vCPU, 128 GB di memoria, disco da 512 GB)
-
G.12X: 12 DPU (48 vCPU, 192 GB di memoria, 768 GB di disco)
-
G.16X: 16 DPU (64 vCPU, 256 GB di memoria, disco da 1024 GB)
Tipi di lavoratori R (Memory-optimized lavoratori):
-
R.1X: 1 DPU (4 vCPU, 32 GB di memoria, disco da 94 GB)
-
R.2X: 2 DPU (8 vCPU, 64 GB di memoria, disco da 128 GB)
-
R.4X: 4 DPU (16 vCPU, 128 GB di memoria, disco da 256 GB)
-
R.8X: 8 DPU (32 vCPU, 256 GB di memoria, disco da 512 GB)
-
-
NumberOfWorkers: numero (intero).Il numero di worker di un
workerTypespecifico allocati quando viene eseguito un processo. -
SecurityConfiguration— UTF-8 stringa, lunga non meno di 1 o più di 255 byte, corrispondente a. Single-line string patternNome della struttura
SecurityConfigurationda usare con questo processo. -
NotificationProperty: un oggetto NotificationProperty.Specifica le proprietà di configurazione di una notifica di processo.
-
Running: booleano.Questo campo è riservato per uso futuro.
-
GlueVersion— UTF-8 stringa, di lunghezza non inferiore a 1 o più di 255 byte, corrispondente a. Custom string pattern #48Nei job Spark,
GlueVersiondetermina le versioni di Apache Spark e Python disponibili in un job. AWS Glue La versione Python indica la versione supportata per i processi di tipo Spark.I processi Ray devono impostare il valore di
GlueVersionsu4.0o superiore. Tuttavia, le versioni di Ray, Python e le librerie aggiuntive disponibili nel processo Ray sono determinate dal parametroRuntimedel comando del processo.Per ulteriori informazioni sulle AWS Glue versioni disponibili e sulle versioni corrispondenti di Spark e Python, consulta la versione Glue nella guida per sviluppatori.
I lavori creati senza specificare una versione di Glue predefinita è Glue 5.1.
-
CodeGenConfigurationNodes: una matrice della mappa di coppie chiave-valore.Ogni chiave è una UTF-8 stringa, corrispondente a. Custom string pattern #60
Ogni valore è un oggetto CodeGenConfigurationNode.
La rappresentazione di un grafico aciclico diretto su cui si basano sia il componente visivo che la generazione di codice di Glue Studio.
-
ExecutionClass— UTF-8 stringa, lunga non più di 16 byte (valori validi:FLEX=""|STANDARD="").Indica se il processo viene eseguito con una classe di esecuzione standard o flessibile. La classe di esecuzione standard è ideale per carichi di lavoro sensibili al tempo che richiedono un avvio rapido dei processi e risorse dedicate.
La classe di esecuzione flessibile è appropriata per i processi non sensibili al tempo i cui tempi di inizio e completamento possono variare.
Solo i lavori con AWS Glue versione 3.0 e successive e il tipo di comando
glueetlpotranno essere impostati suExecutionClass.FLEXLa classe di esecuzione flessibile è disponibile per i processi Spark. -
SourceControlDetails: un oggetto SourceControlDetails.I dettagli per una configurazione di controllo di origine per un processo, che consente la sincronizzazione degli artefatti del processo da o verso un repository remoto.
-
MaintenanceWindow— UTF-8 stringa, corrispondente aCustom string pattern #34.Questo campo specifica un giorno della settimana e un'ora per una finestra di manutenzione per i lavori di streaming. AWS Glue esegue periodicamente attività di manutenzione. Durante queste finestre di manutenzione, AWS Glue sarà necessario riavviare i processi di streaming.
AWS Glue riavvierà il lavoro entro 3 ore dalla finestra di manutenzione specificata. Ad esempio, se la finestra di manutenzione viene impostata per lunedì alle 10:00 GMT, i processi verranno riavviati tra le 10:00 GMT e le 13:00 GMT.
-
ProfileName— UTF-8 stringa, lunga non meno di 1 o più di 255 byte, corrispondente a. Single-line string patternIl nome di un profilo di AWS Glue utilizzo associato al job.
ExecutionProperty struttura
Una proprietà di esecuzione di un processo.
Campi
-
MaxConcurrentRuns: numero (intero).Il numero massimo di esecuzioni simultanee consentite per il processo. Il valore di default è 1. Viene restituito un errore al raggiungimento della soglia. Il valore massimo che è possibile specificare è controllato da un limite di servizio.
NotificationProperty struttura
Specifica le proprietà di configurazione di una notifica.
Campi
-
NotifyDelayAfter: numero (intero), almeno 1.Dopo l'inizio dell'esecuzione di un processo, la quantità di minuti da attendere prima di inviare una notifica di ritardo dell'esecuzione di un processo.
JobCommand struttura
Specifica il codice eseguito quando viene eseguito un processo.
Campi
-
Name— UTF-8 corda.Il nome del comando del processo. Per un processo ETL Apache Spark, deve essere
glueetl. Per un processo shell Python, deve esserepythonshell. Per un processo ETL di streaming Apache Spark, deve esseregluestreaming. Per un processo Ray, questo deve essereglueray. -
ScriptLocation— UTF-8 stringa, lunga non più di 400000 byte.Specifica il percorso di Amazon Simple Storage Service (Amazon S3) per uno script che esegue un processo.
-
PythonVersion— UTF-8 stringa, corrispondente a. Custom string pattern #49La versione Python utilizzata per eseguire un processo shell Python. I valori consentiti sono 2 o 3.
-
Runtime— UTF-8 stringa, lunga non più di 64 byte, corrispondente a. Custom string pattern #33Nei processi Ray, Runtime viene utilizzato per specificare le versioni di Ray, Python e librerie aggiuntive disponibili nell'ambiente. Questo campo non viene utilizzato in altri tipi di processo. Per i valori dell'ambiente di runtime supportati, consulta la sezione Ambienti di runtime Ray supportati nella Guida per gli AWS Glue sviluppatori.
ConnectionsList struttura
Specifica le connessioni utilizzate da un processo.
Campi
-
Connections— Una serie di UTF-8 stringhe, non più di 1000 stringhe.Un elenco di connessioni utilizzate dal processo.
JobUpdate struttura
Specifica le informazioni utilizzate per aggiornare una definizione del processo esistente. La precedente definizione di processo viene completamente sovrascritta da questa informazione.
Campi
-
JobMode— UTF-8 stringa (valori validi:SCRIPT=""|VISUAL=""|NOTEBOOK="").Una modalità che descrive come è stato creato un processo. I valori validi sono:
-
SCRIPT- Il lavoro è stato creato utilizzando l'editor di script di AWS Glue Studio. -
VISUAL- Il lavoro è stato creato utilizzando l'editor visivo di AWS Glue Studio. -
NOTEBOOK: il processo è stato creato utilizzando un notebook con sessioni interattive.
Quando il campo
JobModeè mancante o null, viene assegnatoSCRIPTcome valore predefinito. -
-
JobRunQueuingEnabled: booleano.Specifica se l'accodamento dell'esecuzione dei processi è abilitato per le esecuzioni di questo processo.
Il valore true indica che l'accodamento dei job run è abilitato e consente alle esecuzioni dei job di attendere in coda quando le risorse non sono disponibili anziché fallire immediatamente. Ciò include scenari come il raggiungimento dei limiti di esecuzione simultanea dei job, l'insufficienza delle risorse di calcolo (DPU) o i vincoli temporanei relativi alle risorse.
Nota
Per i VPC-based lavori con esaurimento dell'IP: l'accodamento si attiverà solo se viene rilevata una carenza di IP al momento dell'avvio del lavoro. Se l'esaurimento dell'IP si verifica dopo l'avvio del driver (durante il provisioning dell'esecutore), il processo avrà esito negativo anziché essere messo in coda.
Se il campo è falso o non viene compilato, l'esecuzione del job avrà esito negativo immediatamente quando le risorse non sono disponibili.
Se questo campo non corrisponde al set di valori impostato nell'esecuzione del processo, verrà utilizzato il valore presente nel campo di esecuzione del processo.
-
Description: stringa di descrizione, non superiore a 2048 byte di lunghezza, corrispondente a URI address multi-line string pattern.Descrizione del processo da definire.
-
LogUri— UTF-8 stringa.Questo campo è riservato per uso futuro.
-
Role— UTF-8 corda.Il nome o ARN (Amazon Resource Name) del ruolo IAM associato a questo processo (richiesto).
-
ExecutionProperty: un oggetto ExecutionProperty.ExecutionPropertyche specifica il numero massimo di esecuzioni simultanee consentite per il processo. -
Command: un oggetto JobCommand.JobCommandche esegue il processo (richiesto). -
DefaultArguments: una matrice della mappa di coppie chiave-valore.Ogni chiave è una UTF-8 stringa.
Ogni valore è una UTF-8 stringa.
Gli argomenti predefiniti per ciascuna esecuzione del processo, specificati come coppie nome-valore.
Qui è possibile specificare gli argomenti utilizzati dal proprio script di esecuzione del lavoro, nonché gli argomenti utilizzati dal proprio script di esecuzione AWS Glue del lavoro.
Gli argomenti del processo potrebbero essere registrati. Non passare segreti in testo chiaro come argomenti. Recupera i segreti da una AWS Glue connessione AWS Secrets Manager o da un altro meccanismo di gestione dei segreti se intendi mantenerli all'interno del Job.
Per informazioni su come specificare e utilizzare gli argomenti del proprio processo, fai riferimento a Chiamare le API AWS Glue in Python nella guida per gli sviluppatori.
Per informazioni sugli argomenti che puoi fornire a questo campo durante la configurazione dei processi Spark, consulta la pagina Special Parameters Used by AWS Glue nella Guida per gli sviluppatori.
Per informazioni sugli argomenti che puoi fornire a questo campo durante la configurazione dei processi Ray, consulta la pagina Using job parameters in Ray jobs nella Guida per gli sviluppatori.
-
NonOverridableArguments: una matrice della mappa di coppie chiave-valore.Ogni chiave è una UTF-8 stringa.
Ogni valore è una UTF-8 stringa.
Gli argomenti per questo processo che non vengono sovrascritti quando si forniscono argomenti di processo in un'esecuzione di processo, specificati come coppie nome-valore.
-
Connections: un oggetto ConnectionsList.Le connessioni utilizzate per questo processo.
-
MaxRetries: numero (intero).Il numero massimo di tentativi per riprovare il processo se ha esito negativo.
-
AllocatedCapacity: numero (intero).in quanto obsoleto. Usare invece
MaxCapacity.Il numero di unità di elaborazione AWS Glue dati (DPU) da allocare a questo processo. È possibile allocare un minimo di 2 DPU; l'impostazione di default è 10. Una DPU è una misura relativa della potenza di elaborazione composta da 4 vCPU di capacità di elaborazione e 16 GB di memoria. Per ulteriori informazioni, consultare la pagina dei prezzi di AWS Glue
. -
Timeout: numero (intero), almeno 1.Timeout del processo in minuti. Indica il tempo massimo durante cui l'esecuzione di un processo può utilizzare le risorse prima di essere terminata e passare allo stato
TIMEOUT.I processi devono avere valori di timeout inferiori a 7 giorni o 10080 minuti. In caso contrario, i processi genereranno un'eccezione.
Quando il valore viene lasciato vuoto, il timeout è predefinito a 2.880 minuti per Glue versione 4.0 e precedenti o 480 minuti per Glue versione 5.0 e successive.
Tutti i AWS Glue lavori esistenti con un valore di timeout superiore a 7 giorni verranno impostati come impostazione predefinita su 7 giorni. Ad esempio, se un processo in batch ha impostato un timeout di 20 giorni, sarà interrotto al settimo giorno.
Per i processi di streaming, se è stata impostata una finestra di manutenzione, il processo sarà riavviato durante tale finestra dopo 7 giorni.
-
MaxCapacity: numero (doppio).Per i lavori di Glue versione 1.0 o precedente, utilizzando il tipo di worker standard, il numero di unità di elaborazione AWS Glue dati (DPU) che possono essere allocate durante l'esecuzione di questo lavoro. Una DPU è una misura relativa della potenza di elaborazione composta da 4 vCPU di capacità di elaborazione e 16 GB di memoria. Per ulteriori informazioni, consultare la pagina dei prezzi di AWS Glue
. Per i processi Glue versione 2.0 e successive, non è possibile specificare il valore
Maximum capacity. Si deve invece specificare unWorker typee unNumber of workers.Non impostare
MaxCapacityse usiWorkerTypeeNumberOfWorkers.Il valore che è possibile allocare per
MaxCapacityvaria a seconda che si esegua un processo shell di Python, un processo ETL di Apache Spark o un processo ETL di streaming di Apache Spark:-
Quando si specifica un processo shell di Python (
JobCommand.Name="pythonshell"), è possibile allocare 0,0625 o 1 DPU. Il valore di default è 0,0625 DPU. -
Quando si specifica un processo ETL Apache Spark (
JobCommand.Name="glueetl”) o un processo ETL di streaming Apache Spark (JobCommand.Name="gluestreaming”), è possibile allocare da 2 a 100 DPU. Il valore di default è 10 DPU. Questo tipo di processo non può avere un'allocazione DPU frazionata.
-
-
WorkerType— UTF-8 stringa (valori validi:Standard=""|G.025X=""|G.1X=""| |G.2X=""|G.4X=""|G.8X=""|G.12X=""|G.16X=""|R.1X=""| |R.2X=""R.4X=""R.8X=""|Z.2X="").Il tipo di worker predefinito allocato quando viene eseguito un processo. Accetta il valore di G.025X G.1X, G.2X, G.4X, G.8X, G.12X, G.16X, R.1X R.2X R.4X, o R.8X per i job Spark. Accetta il valore Z.2X per i lavori Ray. Per ulteriori informazioni, consultare Definire le proprietà di processo per i processi Spark
-
NumberOfWorkers: numero (intero).Il numero di worker di un
workerTypespecifico allocati quando viene eseguito un processo. -
SecurityConfiguration— UTF-8 stringa, lunga non meno di 1 o più di 255 byte, corrispondente a. Single-line string patternNome della struttura
SecurityConfigurationda usare con questo processo. -
NotificationProperty: un oggetto NotificationProperty.Specifica le proprietà di configurazione di una notifica di un processo.
-
GlueVersion— UTF-8 stringa, di lunghezza non inferiore a 1 o più di 255 byte, corrispondente a. Custom string pattern #48Nei job Spark,
GlueVersiondetermina le versioni di Apache Spark e Python disponibili in un job. AWS Glue La versione Python indica la versione supportata per i processi di tipo Spark.I processi Ray devono impostare il valore di
GlueVersionsu4.0o superiore. Tuttavia, le versioni di Ray, Python e le librerie aggiuntive disponibili nel processo Ray sono determinate dal parametroRuntimedel comando del processo.Per ulteriori informazioni sulle AWS Glue versioni disponibili e sulle versioni corrispondenti di Spark e Python, consulta la versione Glue nella guida per sviluppatori.
Se non viene fornita nella richiesta di aggiornamento, la versione Glue mantiene il valore della definizione del lavoro esistente.
-
CodeGenConfigurationNodes: una matrice della mappa di coppie chiave-valore.Ogni chiave è una UTF-8 stringa, corrispondente a. Custom string pattern #60
Ogni valore è un oggetto CodeGenConfigurationNode.
La rappresentazione di un grafico aciclico diretto su cui si basano sia il componente visivo che la generazione di codice di Glue Studio.
-
ExecutionClass— UTF-8 stringa, lunga non più di 16 byte (valori validi:FLEX=""|STANDARD="").Indica se il processo viene eseguito con una classe di esecuzione standard o flessibile. La classe di esecuzione standard è ideale per carichi di lavoro sensibili al tempo che richiedono un avvio rapido dei processi e risorse dedicate.
La classe di esecuzione flessibile è appropriata per i processi non sensibili al tempo i cui tempi di inizio e completamento possono variare.
Solo i lavori con AWS Glue versione 3.0 e successive e il tipo di comando
glueetlpotranno essere impostati suExecutionClass.FLEXLa classe di esecuzione flessibile è disponibile per i processi Spark. -
SourceControlDetails: un oggetto SourceControlDetails.I dettagli per una configurazione di controllo di origine per un processo, che consente la sincronizzazione degli artefatti del processo da o verso un repository remoto.
-
MaintenanceWindow— UTF-8 stringa, corrispondente aCustom string pattern #34.Questo campo specifica un giorno della settimana e un'ora per una finestra di manutenzione per i lavori di streaming. AWS Glue esegue periodicamente attività di manutenzione. Durante queste finestre di manutenzione, AWS Glue sarà necessario riavviare i processi di streaming.
AWS Glue riavvierà il lavoro entro 3 ore dalla finestra di manutenzione specificata. Ad esempio, se la finestra di manutenzione viene impostata per lunedì alle 10:00 GMT, i processi verranno riavviati tra le 10:00 GMT e le 13:00 GMT.
-
ProfileName— UTF-8 stringa, lunga non meno di 1 o più di 255 byte, corrispondente a. Single-line string patternIl nome di un profilo di AWS Glue utilizzo associato al job.
SourceControlDetails struttura
I dettagli per una configurazione di controllo di origine per un processo, che consente la sincronizzazione degli artefatti del processo da o verso un repository remoto.
Campi
-
Provider— UTF-8 stringa (valori validi:GITHUB|AWS_CODE_COMMIT).Il provider per il repository remoto.
-
Repository— UTF-8 stringa, lunga non meno di 1 o più di 512 byte.Il nome del repository remoto che contiene gli artefatti del processo.
-
Owner— UTF-8 stringa, lunga non meno di 1 o più di 512 byte.Il proprietario del repository remoto che contiene gli artefatti del processo.
-
Branch— UTF-8 stringa, lunga non meno di 1 o più di 512 byte.Un ramo opzionale nel repository remoto.
-
Folder— UTF-8 stringa, lunga non meno di 1 o più di 512 byte.Una cartella opzionale nel repository remoto.
-
LastCommitId— UTF-8 stringa, lunga non meno di 1 o più di 512 byte.L'ultimo ID di commit per un commit nel repository remoto.
-
LastSyncTimestamp— UTF-8 stringa, lunga non meno di 1 o più di 512 byte.La data e l'ora in cui è stata eseguita l'ultima sincronizzazione di processo.
-
AuthStrategy— UTF-8 stringa (valori validi:PERSONAL_ACCESS_TOKEN|AWS_SECRETS_MANAGER).Il tipo di autenticazione, che può essere un token di autenticazione memorizzato in AWS Secrets Manager o un token di accesso personale.
-
AuthToken— UTF-8 stringa, lunga non meno di 1 o più di 512 byte.Il valore di un token di autorizzazione.
Operazioni
CreateJob azione (Python: create_job)
Crea una nuova definizione del processo.
Richiesta
-
Name— Obbligatorio: UTF-8 stringa, lunga non meno di 1 o più di 255 byte, corrispondente a. Single-line string patternIl nome assegnato alla definizione del processo. Deve essere univoco all'interno dell'account .
-
JobMode— UTF-8 stringa (valori validi:SCRIPT=""|VISUAL=""|NOTEBOOK="").Una modalità che descrive come è stato creato un processo. I valori validi sono:
-
SCRIPT- Il lavoro è stato creato utilizzando l'editor di script di AWS Glue Studio. -
VISUAL- Il lavoro è stato creato utilizzando l'editor visivo di AWS Glue Studio. -
NOTEBOOK: il processo è stato creato utilizzando un notebook con sessioni interattive.
Quando il campo
JobModeè mancante o null, viene assegnatoSCRIPTcome valore predefinito. -
-
JobRunQueuingEnabled: booleano.Specifica se l'accodamento dell'esecuzione dei processi è abilitato per le esecuzioni di questo processo.
Il valore true indica che l'accodamento dei job run è abilitato e consente alle esecuzioni dei job di attendere in coda quando le risorse non sono disponibili anziché fallire immediatamente. Ciò include scenari come il raggiungimento dei limiti di esecuzione simultanea dei job, l'insufficienza delle risorse di calcolo (DPU) o i vincoli temporanei relativi alle risorse.
Nota
Per i VPC-based lavori con esaurimento dell'IP: l'accodamento si attiverà solo se viene rilevata una carenza di IP al momento dell'avvio del lavoro. Se l'esaurimento dell'IP si verifica dopo l'avvio del driver (durante il provisioning dell'esecutore), il processo avrà esito negativo anziché essere messo in coda.
Se il campo è falso o non viene compilato, l'esecuzione del job avrà esito negativo immediatamente quando le risorse non sono disponibili.
Se questo campo non corrisponde al set di valori impostato nell'esecuzione del processo, verrà utilizzato il valore presente nel campo di esecuzione del processo.
-
Description: stringa di descrizione, non superiore a 2048 byte di lunghezza, corrispondente a URI address multi-line string pattern.Descrizione del processo da definire.
-
LogUri— UTF-8 stringa.Questo campo è riservato per uso futuro.
-
Role— Obbligatorio: UTF-8 stringa.Il nome o ARN (Amazon Resource Name) del ruolo IAM associato a questo processo.
-
ExecutionProperty: un oggetto ExecutionProperty.ExecutionPropertyche specifica il numero massimo di esecuzioni simultanee consentite per il processo. -
Command- obbligatorio: un oggetto JobCommand.Il
JobCommandche esegue questo lavoro. -
DefaultArguments: una matrice della mappa di coppie chiave-valore.Ogni chiave è una UTF-8 stringa.
Ogni valore è una UTF-8 stringa.
Gli argomenti predefiniti per ciascuna esecuzione del processo, specificati come coppie nome-valore.
Qui è possibile specificare gli argomenti utilizzati dal proprio script di esecuzione del lavoro, nonché gli argomenti utilizzati dal proprio script di esecuzione AWS Glue del lavoro.
Gli argomenti del processo potrebbero essere registrati. Non passare segreti in testo chiaro come argomenti. Recupera i segreti da una AWS Glue connessione AWS Secrets Manager o da un altro meccanismo di gestione dei segreti se intendi mantenerli all'interno del Job.
Per informazioni su come specificare e utilizzare gli argomenti del proprio processo, fai riferimento a Chiamare le API AWS Glue in Python nella guida per gli sviluppatori.
Per informazioni sugli argomenti che puoi fornire a questo campo durante la configurazione dei processi Spark, consulta la pagina Special Parameters Used by AWS Glue nella Guida per gli sviluppatori.
Per informazioni sugli argomenti che puoi fornire a questo campo durante la configurazione dei processi Ray, consulta la pagina Using job parameters in Ray jobs nella Guida per gli sviluppatori.
-
NonOverridableArguments: una matrice della mappa di coppie chiave-valore.Ogni chiave è una UTF-8 stringa.
Ogni valore è una UTF-8 stringa.
Gli argomenti per questo processo che non vengono sovrascritti quando si forniscono argomenti di processo in un'esecuzione di processo, specificati come coppie nome-valore.
-
Connections: un oggetto ConnectionsList.Le connessioni utilizzate per questo processo.
-
MaxRetries: numero (intero).Il numero massimo di tentativi per riprovare il processo se ha esito negativo.
-
AllocatedCapacity: numero (intero).Questo parametro è obsoleto. Usare invece
MaxCapacity.Il numero di unità di elaborazione AWS Glue dati (DPU) da allocare a questo Job. È possibile allocare un minimo di 2 DPU; l'impostazione di default è 10. Una DPU è una misura relativa della potenza di elaborazione composta da 4 vCPU di capacità di elaborazione e 16 GB di memoria. Per ulteriori informazioni, consultare la pagina dei prezzi di AWS Glue
. -
Timeout: numero (intero), almeno 1.Timeout del processo in minuti. Indica il tempo massimo durante cui l'esecuzione di un processo può utilizzare le risorse prima di essere terminata e passare allo stato
TIMEOUT.I processi devono avere valori di timeout inferiori a 7 giorni o 10080 minuti. In caso contrario, i processi genereranno un'eccezione.
Quando il valore viene lasciato vuoto, il timeout è predefinito a 2.880 minuti per Glue versione 4.0 e precedenti o 480 minuti per Glue versione 5.0 e successive.
Tutti i AWS Glue lavori esistenti con un valore di timeout superiore a 7 giorni verranno impostati come impostazione predefinita su 7 giorni. Ad esempio, se un processo in batch ha impostato un timeout di 20 giorni, sarà interrotto al settimo giorno.
Per i processi di streaming, se è stata impostata una finestra di manutenzione, il processo sarà riavviato durante tale finestra dopo 7 giorni.
-
MaxCapacity: numero (doppio).Per i lavori di Glue versione 1.0 o precedente, utilizzando il tipo di worker standard, il numero di unità di elaborazione AWS Glue dati (DPU) che possono essere allocate durante l'esecuzione di questo lavoro. Una DPU è una misura relativa della potenza di elaborazione composta da 4 vCPU di capacità di elaborazione e 16 GB di memoria. Per ulteriori informazioni, consultare la pagina dei prezzi di AWS Glue
. Per i processi Glue versione 2.0 e successive, non è possibile specificare il valore
Maximum capacity. Si deve invece specificare unWorker typee unNumber of workers.Non impostare
MaxCapacityse usiWorkerTypeeNumberOfWorkers.Il valore che è possibile allocare per
MaxCapacityvaria a seconda che si esegua un processo shell di Python, un processo ETL di Apache Spark o un processo ETL di streaming di Apache Spark:-
Quando si specifica un processo shell di Python (
JobCommand.Name="pythonshell"), è possibile allocare 0,0625 o 1 DPU. Il valore di default è 0,0625 DPU. -
Quando si specifica un processo ETL Apache Spark (
JobCommand.Name="glueetl”) o un processo ETL di streaming Apache Spark (JobCommand.Name="gluestreaming”), è possibile allocare da 2 a 100 DPU. Il valore di default è 10 DPU. Questo tipo di processo non può avere un'allocazione DPU frazionata.
-
-
SecurityConfiguration— UTF-8 stringa, lunga non meno di 1 o più di 255 byte, corrispondente a. Single-line string patternNome della struttura
SecurityConfigurationda usare con questo processo. -
Tags: una matrice di mappe con coppie chiave-valore, non superiore alle 50 coppie.Ogni chiave è una UTF-8 stringa di lunghezza non inferiore a 1 o superiore a 128 byte.
Ogni valore è una UTF-8 stringa, lunga non più di 256 byte.
I tag da usare con questo processo. Puoi usare i tag per limitare l'accesso al processo. Per ulteriori informazioni sui tag in AWS Glue, consulta AWS Tags in AWS Glue nella guida per sviluppatori.
-
NotificationProperty: un oggetto NotificationProperty.Specifica le proprietà di configurazione di una notifica di processo.
-
GlueVersion— UTF-8 stringa, lunga non meno di 1 o più di 255 byte, corrispondente a. Custom string pattern #48Nei job Spark,
GlueVersiondetermina le versioni di Apache Spark e Python disponibili in un job. AWS Glue La versione Python indica la versione supportata per i processi di tipo Spark.I processi Ray devono impostare il valore di
GlueVersionsu4.0o superiore. Tuttavia, le versioni di Ray, Python e le librerie aggiuntive disponibili nel processo Ray sono determinate dal parametroRuntimedel comando del processo.Per ulteriori informazioni sulle AWS Glue versioni disponibili e sulle versioni corrispondenti di Spark e Python, consulta la versione Glue nella guida per sviluppatori.
I lavori creati senza specificare una versione di Glue predefinita è Glue 5.1.
-
NumberOfWorkers: numero (intero).Il numero di worker di un
workerTypespecifico allocati quando viene eseguito un processo. -
WorkerType— UTF-8 stringa (valori validi:Standard=""|G.025X=""|G.1X=""|G.2X=""|G.4X=""|G.8X=""|G.12X=""|G.16X=""| |R.1X=""|R.2X=""|R.4X=""R.8X=""|Z.2X="").Il tipo di worker predefinito allocato quando viene eseguito un processo. Accetta il valore di G.025X G.1X, G.2X, G.4X, G.8X, G.12X, G.16X, R.1X R.2X R.4X, o R.8X per i job Spark. Accetta il valore Z.2X per i lavori Ray.
-
Per il tipo di worker
G.025X, ciascun worker si mappa a 0,25 DPU (2 vCPU, 4 GB di memoria) con disco da 84 GB e fornisce 1 esecutore per worker. Consigliamo questo tipo di worker per i processi di streaming a basso volume. Questo tipo di worker è disponibile solo per i lavori di streaming AWS Glue versione 3.0 o successiva. -
Per il tipo di worker
G.1X, ciascun worker si mappa a 1 DPU (4 vCPU, 16 GB di memoria) con disco da 94 GB e fornisce 1 esecutore per worker. Questi tipi di worker sono raccomandati per carichi di lavoro come trasformazioni di dati, join e query, in quanto offrono un modo scalabile ed economico per eseguire la maggior parte dei processi. -
Per il tipo di worker
G.2X, ciascun worker si mappa a 2 DPU (8 vCPU, 32 GB di memoria) con disco da 138 GB e fornisce 1 esecutore per worker. Questi tipi di worker sono raccomandati per carichi di lavoro come trasformazioni di dati, join e query, in quanto offrono un modo scalabile ed economico per eseguire la maggior parte dei processi. -
Per il tipo di worker
G.4X, ciascun worker si mappa a 4 DPU (16 vCPU, 64 GB di memoria) con disco da 256 GB e fornisce 1 esecutore per worker. Questi tipi di worker sono raccomandati per i processi i cui carichi di lavoro contengono trasformazioni, aggregazioni, join e query con i requisiti più elevati. Questo tipo di lavoratore è disponibile solo per i lavori Spark ETL AWS Glue versione 3.0 o successiva AWS nelle seguenti regioni: Stati Uniti orientali (Ohio), Stati Uniti orientali (Virginia settentrionale), Stati Uniti occidentali (California settentrionale), Stati Uniti occidentali (Oregon), Asia Pacifico (Mumbai), Asia Pacifico (Seoul), Asia Pacifico (Singapore), Asia Pacifico (Sydney), Asia Pacifico (Tokyo), Canada (Centrale), Europa (Francoforte), Europa (Irlanda), Europa (Londra), Europa (Spagna), Europa (Stoccolma) e -
Per il tipo di worker
G.8X, ciascun worker si mappa a 8 DPU (32 vCPU, 128 GB di memoria) con disco da 512 GB e fornisce 1 esecutore per worker. Questi tipi di worker sono raccomandati per i processi i cui carichi di lavoro contengono trasformazioni, aggregazioni, join e query con i requisiti più elevati. Questo tipo di worker è disponibile solo per i job Spark ETL AWS Glue versione 3.0 o successiva, nelle stesse AWS regioni supportate per il tipo diG.4Xlavoratore. -
Per il tipo di
G.12Xworker, ogni worker esegue il mapping a 12 DPU (48 vCPU, 192 GB di memoria) con disco da 768 GB e fornisce 1 esecutore per lavoratore. Consigliamo questo tipo di lavoratore per lavori con carichi di lavoro molto elevati. Questo tipo di worker è disponibile solo per i job Spark ETL AWS Glue versione 4.0 o successiva. -
Per il tipo di
G.16Xworker, ogni worker esegue il mapping a 16 DPU (64 vCPU, 256 GB di memoria) con disco da 1024 GB e fornisce 1 executor per lavoratore. Consigliamo questo tipo di lavoratore per lavori con carichi di lavoro molto elevati. Questo tipo di worker è disponibile solo per i job Spark ETL AWS Glue versione 4.0 o successiva. -
Per il tipo di
R.1Xworker, ogni worker esegue il mapping a 1 DPU (4 vCPU, 32 GB di memoria) con disco da 94 GB e fornisce 1 executor per lavoratore. Consigliamo questo tipo di worker per carichi di lavoro che richiedono molta memoria. Questo tipo di worker è disponibile solo per i job AWS Glue Spark ETL versione 4.0 o successiva. -
Per il tipo di
R.2Xworker, ogni worker esegue il mapping su 2 DPU (8 vCPU, 64 GB di memoria) con disco da 128 GB e fornisce 1 esecutore per lavoratore. Consigliamo questo tipo di worker per carichi di lavoro che richiedono molta memoria. Questo tipo di worker è disponibile solo per i job AWS Glue Spark ETL versione 4.0 o successiva. -
Per il tipo di
R.4Xworker, ogni worker esegue il mapping a 4 DPU (16 vCPU, 128 GB di memoria) con disco da 256 GB e fornisce 1 executor per lavoratore. Consigliamo questo tipo di worker per carichi di lavoro che richiedono molta memoria. Questo tipo di worker è disponibile solo per i job AWS Glue Spark ETL versione 4.0 o successiva. -
Per il tipo di
R.8Xworker, ogni worker esegue il mapping a 8 DPU (32 vCPU, 256 GB di memoria) con disco da 512 GB e fornisce 1 executor per lavoratore. Consigliamo questo tipo di worker per carichi di lavoro che richiedono molta memoria. Questo tipo di worker è disponibile solo per i job AWS Glue Spark ETL versione 4.0 o successiva. -
Per il tipo di
Z.2Xworker, ogni worker esegue il mapping su 2 M-DPU (8 vCPU, 64 GB di memoria) con disco da 128 GB e fornisce fino a 8 Ray worker in base all'autoscaler.
-
-
CodeGenConfigurationNodes: una matrice della mappa di coppie chiave-valore.Ogni chiave è una stringa, corrispondente a. UTF-8 Custom string pattern #60
Ogni valore è un oggetto CodeGenConfigurationNode.
La rappresentazione di un grafico aciclico diretto su cui si basano sia il componente visivo che la generazione di codice di Glue Studio.
-
ExecutionClass— UTF-8 stringa, lunga non più di 16 byte (valori validi:FLEX=""|STANDARD="").Indica se il processo viene eseguito con una classe di esecuzione standard o flessibile. La classe di esecuzione standard è ideale per carichi di lavoro sensibili al tempo che richiedono un avvio rapido dei processi e risorse dedicate.
La classe di esecuzione flessibile è appropriata per i processi non sensibili al tempo i cui tempi di inizio e completamento possono variare.
Solo i lavori con AWS Glue versione 3.0 e successive e il tipo di comando
glueetlpotranno essere impostati suExecutionClass.FLEXLa classe di esecuzione flessibile è disponibile per i processi Spark. -
SourceControlDetails: un oggetto SourceControlDetails.I dettagli per una configurazione di controllo di origine per un processo, che consente la sincronizzazione degli artefatti del processo da o verso un repository remoto.
-
MaintenanceWindow— UTF-8 stringa, corrispondente aCustom string pattern #34.Questo campo specifica un giorno della settimana e un'ora per una finestra di manutenzione per i lavori di streaming. AWS Glue esegue periodicamente attività di manutenzione. Durante queste finestre di manutenzione, AWS Glue sarà necessario riavviare i processi di streaming.
AWS Glue riavvierà il lavoro entro 3 ore dalla finestra di manutenzione specificata. Ad esempio, se la finestra di manutenzione viene impostata per lunedì alle 10:00 GMT, i processi verranno riavviati tra le 10:00 GMT e le 13:00 GMT.
-
ProfileName— UTF-8 stringa, lunga non meno di 1 o più di 255 byte, corrispondente a. Single-line string patternIl nome di un profilo di AWS Glue utilizzo associato al job.
Risposta
-
Name— UTF-8 stringa, lunga non meno di 1 o più di 255 byte, corrispondente a. Single-line string patternIl nome univoco assegnato alla definizione del processo.
Errori
InvalidInputExceptionIdempotentParameterMismatchExceptionAlreadyExistsExceptionInternalServiceExceptionOperationTimeoutExceptionResourceNumberLimitExceededExceptionConcurrentModificationException
UpdateJob azione (Python: update_job)
Aggiorna la definizione di un processo esistente. La precedente definizione di processo viene completamente sovrascritta da questa informazione.
Richiesta
-
JobName— Obbligatorio: UTF-8 stringa, lunga non meno di 1 o più di 255 byte, corrispondente a. Single-line string patternNome della definizione del processo da aggiornare.
-
JobUpdate- obbligatorio: un oggetto JobUpdate.Specifica i valori con cui aggiornare la definizione del processo. La configurazione non specificata viene rimossa o ripristinata ai valori predefiniti.
-
ProfileName— UTF-8 stringa, di lunghezza non inferiore a 1 o più di 255 byte, corrispondente a. Single-line string patternIl nome di un profilo di AWS Glue utilizzo associato al job.
Risposta
-
JobName— UTF-8 stringa, lunga non meno di 1 o più di 255 byte, corrispondente a. Single-line string patternRestituisce il nome della definizione aggiornata del processo.
Errori
InvalidInputExceptionEntityNotFoundExceptionInternalServiceExceptionOperationTimeoutExceptionConcurrentModificationException
GetJob azione (Python: get_job)
Recupera la definizione di un processo esistente.
Richiesta
-
JobName— Obbligatorio: UTF-8 stringa, lunga non meno di 1 o più di 255 byte, corrispondente a. Single-line string patternNome della definizione del processo da recuperare.
Risposta
-
Job: un oggetto Processo.La definizione del processo richiesta.
Errori
InvalidInputExceptionEntityNotFoundExceptionInternalServiceExceptionOperationTimeoutException
GetJobs azione (Python: get_jobs)
Recupera tutte le attuali definizioni del processo.
Richiesta
-
NextToken— stringa UTF-8 .Un token di continuazione, se si tratta di una chiamata di continuazione.
-
MaxResults: numero (intero), non inferiore a 1 o superiore a 1.000.La dimensione massima della risposta.
Risposta
-
Jobs: una matrice di oggetti Processo.Un elenco di definizioni del processo.
-
NextToken— UTF-8 corda.Un token di continuazione, se non sono ancora state restituite tutte le definizioni del processo.
Errori
InvalidInputExceptionEntityNotFoundExceptionInternalServiceExceptionOperationTimeoutException
DeleteJob azione (Python: delete_job)
Elimina una specifica definizione del processo. Se la definizione del processo non viene trovata, non viene generata alcuna eccezione.
Richiesta
-
JobName— Obbligatorio: UTF-8 stringa, lunga non meno di 1 o più di 255 byte, corrispondente a. Single-line string patternNome della definizione del processo da eliminare.
Risposta
-
JobName— UTF-8 stringa, di lunghezza non inferiore a 1 o più di 255 byte, corrispondente a. Single-line string patternIl nome della definizione del processo eliminata.
Errori
InvalidInputExceptionInternalServiceExceptionOperationTimeoutException
ListJobs azione (Python: list_jobs)
Recupera i nomi di tutte le risorse lavorative in questo AWS account o le risorse con il tag specificato. Questa operazione consente di vedere quali risorse sono disponibili nel proprio account e i relativi nomi.
L'operazione accetta il campo facoltativo Tags che si può utilizzare come filtro per la risposta in modo che le risorse con tag possano essere recuperate come gruppo. Se si sceglie di utilizzare il filtro dei tag, potranno essere recuperate solo le risorse con tag.
Richiesta
-
NextToken— UTF-8 stringa.Token di continuazione, se si tratta di una richiesta di continuazione.
-
MaxResults: numero (intero), non inferiore a 1 o superiore a 1.000.La dimensione massima di un elenco da restituire.
-
Tags: una matrice di mappe con coppie chiave-valore, non superiore alle 50 coppie.Ogni chiave è una UTF-8 stringa di lunghezza non inferiore a 1 o superiore a 128 byte.
Ogni valore è una UTF-8 stringa, lunga non più di 256 byte.
Specifica che vengono restituite solo le risorse con tag.
Risposta
-
JobNames— Una matrice di UTF-8 stringhe.I nomi di tutti i processi nell'account oppure i processi con i tag specificati.
-
NextToken— UTF-8 corda.Token di continuazione, se l'elenco restituito non contiene l'ultimo parametro disponibile.
Errori
InvalidInputExceptionEntityNotFoundExceptionInternalServiceExceptionOperationTimeoutException
BatchGetJobs azione (Python: batch_get_jobs)
Restituisce un elenco di metadati di risorse per un determinato elenco di nomi di processi. Dopo aver chiamato l'operazione ListJobs, puoi chiamare questa operazione per accedere ai dati a cui sono state concesse le autorizzazioni. Questa operazione supporta tutte le autorizzazioni IAM, tra cui le condizioni di autorizzazione che utilizzano i tag.
Richiesta
-
JobNames— Obbligatorio: un array di stringhe. UTF-8L'elenco dei nomi di processo, che potrebbero essere i nomi restituiti dall'operazione
ListJobs.
Risposta
-
Jobs: una matrice di oggetti Processo.Un elenco di definizioni del processo.
-
JobsNotFound— Un array di UTF-8 stringhe.Un elenco di nomi di processi non trovati.
Errori
InternalServiceExceptionOperationTimeoutExceptionInvalidInputException