Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.
So funktioniert SageMaker Smart Sifting
Das Ziel von SageMaker Smart Sifting besteht darin, deine Trainingsdaten während des Trainingsprozesses zu sichten und das Modell nur mit aussagekräftigeren Stichproben zu versorgen. Während eines typischen Trainings mit PyTorch werden die Daten iterativ stapelweise an die Trainingsschleife und von der an Beschleunigungsgeräte (wie GPUs oder Trainium-Chips) gesendet. PyTorch DataLoader
Das folgende Diagramm zeigt einen Überblick über den Aufbau des SageMaker Smart-Sifting-Algorithmus.
Kurz gesagt, SageMaker Smart Sifting funktioniert während des Trainings, während die Daten geladen werden. Der SageMaker Smart-Sifting-Algorithmus führt eine Verlustberechnung für die Chargen durch und sortiert Daten, die sich nicht verbessern, vor dem Vorwärts- und Rückwärtsdurchlauf jeder Iteration heraus. Der verfeinerte Datenstapel wird dann für den Vorwärts- und Rückwärtsdurchlauf verwendet.
Anmerkung
Beim intelligenten Sichten von SageMaker KI-Daten werden zusätzliche Vorwärtsdurchgänge verwendet, um deine Trainingsdaten zu analysieren und zu filtern. Im Gegenzug gibt es weniger Rückwärtsdurchläufe, da Daten mit geringerer Aussagekraft aus Ihrem Trainingsjob ausgeschlossen werden. Aus diesem Grund führt Smart Sifting bei Modellen mit langen oder aufwändigen Rückwärtsdurchläufen zu den größten Effizienzsteigerungen. Dauert der Vorwärtsdurchlauf Ihres Modells jedoch länger als der Rückwärtsdurchlauf, kann der Mehraufwand die Gesamttrainingszeit erhöhen. Um zu messen, wie viel Zeit für jeden Durchlauf aufgewendet wird, können Sie einen Pilot-Trainingsjob ausführen und Protokolle sammeln, in denen die Dauer der Prozesse aufgezeichnet wird. Erwägen Sie auch, den SageMaker Profiler zu verwenden, der Profiling-Tools und UI-Anwendungen bereitstellt. Weitere Informationen hierzu finden Sie unter SageMaker Amazon-Profiler.
SageMaker Smart Sifting eignet sich für PyTorch-based Trainingsaufgaben mit klassischer verteilter Datenparallelität, bei der Modellreplikate auf jedem GPU-Worker erstellt und ausgeführt werden. AllReduce Es funktioniert mit PyTorch DDP und der SageMaker KI-Bibliothek für verteilte parallele Daten.