Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.
Perfezionamento dei dati durante la formazione con Amazon SageMaker smart sifting
SageMaker smart sifting è una funzionalità di SageMaker formazione che aiuta a migliorare l'efficienza dei set di dati di formazione e a ridurre tempi e costi totali di formazione.
I moderni modelli di deep learning, come i modelli linguistici di grandi dimensioni (LLM) o i modelli Vision Transformer, richiedono spesso enormi set di dati per raggiungere una precisione accettabile. Ad esempio, gli LLM richiedono spesso trilioni di token o petabyte di dati per la convergenza. Le dimensioni crescenti dei set di dati di addestramento, insieme alle dimensioni di modelli all’avanguardia, possono aumentare i tempi di calcolo e i costi di addestramento dei modelli.
Invariabilmente, i campioni in un set di dati non contribuiscono in modo uguale al processo di apprendimento durante l’addestramento dei modelli. Una parte significativa delle risorse di calcolo fornite durante l’addestramento potrebbe essere impiegata per l’elaborazione di campioni semplici che non contribuiscono in modo sostanziale alla precisione complessiva di un modello. Idealmente, i set di dati di addestramento dovrebbero includere solo campioni che migliorano effettivamente la convergenza di un modello. Il filtraggio dei dati meno utili può ridurre i tempi di addestramento e i costi di calcolo. Tuttavia, identificare i dati meno utili può essere difficile e rischioso. È difficile a livello pratico identificare quali campioni siano meno informativi prima dell’addestramento e la precisione di un modello può risentirne se vengono esclusi i campioni sbagliati o un numero eccessivo di campioni.
Il setacciamento intelligente dei dati con Amazon SageMaker AI può aiutare a ridurre tempi e costi di formazione migliorando l'efficienza dei dati. L'algoritmo di setacciamento SageMaker intelligente valuta il valore della perdita di ogni dato durante la fase di caricamento dei dati di un processo di formazione ed esclude i campioni che sono meno informativi per il modello. Utilizzando dati perfezionati per l’addestramento, si riducono i tempi e i costi totali dell’addestramento dei modelli, eliminando inutili passaggi avanti e indietro su dati non migliorativi. Pertanto, l’impatto sulla precisione del modello è minimo o nullo.
SageMaker smart sifting è disponibile tramite SageMaker Training Deep Learning Containers (DLC) e supporta i carichi di lavoro tramite. PyTorch PyTorch DataLoader Sono necessarie solo poche righe di modifica del codice per implementare lo SageMaker smart sifting e non è necessario modificare i flussi di lavoro di formazione o elaborazione dati esistenti.