Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.
Guida alla compatibilità di formato dei dati
Nota
Amazon SageMaker Clarify non è più aperto a nuovi clienti. I clienti esistenti possono continuare a utilizzare il servizio normalmente. AWS continua a investire in miglioramenti della sicurezza e della disponibilità di Clarify, ma non prevediamo di introdurre nuove funzionalità. Per ulteriori informazioni, consulta Chiarire la modifica della disponibilità.
Questa guida descrive i tipi di formato di dati compatibili con i processi di elaborazione SageMaker Clarify. I tipi di formato di dati supportati includono le estensioni dei file, la struttura dei dati e i requisiti o le restrizioni specifici per i set di dati tabulari, di immagini e di serie temporali. La guida mostra anche come verificare se il set di dati è conforme a questi requisiti.
Ad alto livello, il processo di elaborazione SageMaker Clarify segue il modello input-process-output per calcolare le metriche di bias e le attribuzioni delle funzionalità. Per i dettagli, consulta gli esempi seguenti.
L'input per il processo di elaborazione Clarify è costituito da quanto segue: SageMaker
-
Il set di dati da analizzare.
-
La configurazione dell'analisi Per ulteriori informazioni su come configurare un’analisi, consulta File di configurazione dell’analisi.
Durante la fase di elaborazione, SageMaker Clarify calcola le metriche di distorsione e le attribuzioni delle funzionalità. Il processo di elaborazione SageMaker Clarify completa i seguenti passaggi nel backend:
-
Il processo di elaborazione SageMaker Clarify analizza la configurazione di analisi e carica il set di dati.
-
Per calcolare i parametri di bias e le attribuzioni delle funzionalità post-addestramento, il processo richiede previsioni basate sul modello. Il processo di elaborazione SageMaker Clarify serializza i dati e li invia come richiesta al modello che viene distribuito su un SageMaker endpoint di inferenza AI in tempo reale. Successivamente, il processo di elaborazione SageMaker Clarify estrae le previsioni dalla risposta.
-
Il processo di elaborazione SageMaker Clarify esegue l'analisi della distorsione e della spiegabilità, quindi produce i risultati.
Per ulteriori informazioni, consulta Come funzionano SageMaker Clarify Processing Jobs.
Il parametro utilizzato per specificare il formato dei dati dipende da dove i dati vengono utilizzati nel flusso di elaborazione, come mostrato in seguito:
-
Per un set di dati di input, utilizza il parametro
dataset_typeper specificare il formato o il tipo MIME. -
Per una richiesta a un endpoint, utilizza il parametro
content_typeper specificare il formato. -
Per una risposta a un endpoint, utilizza il parametro
accept_typeper specificare il formato.
Il set di dati di input, la richiesta e la risposta da e verso l'endpoint non richiedono lo stesso formato. Ad esempio, è possibile utilizzare un set di dati Parquet con un payload di richiesta CSV e un payload di risposta JSON Lines, date le condizioni descritte in seguito.
-
L'analisi è configurata correttamente.
-
Il modello supporta i formati di richiesta e risposta.
Nota
Se accept_type vengono forniti content_type o meno, il contenitore SageMaker Clarify deduce i valori e. content_type accept_type