Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.
Modifica della disponibilità del debugger
Nota
Amazon SageMaker Debugger non è più aperto a nuovi clienti. I clienti esistenti possono continuare a utilizzare il servizio normalmente. AWS continua a investire in miglioramenti della sicurezza e della disponibilità di Debugger, ma non prevediamo di introdurre nuove funzionalità.
Sostituzione di Amazon Debugger SageMaker
Segui questa guida per passare a servizi alternativi.
Panoramica di
Amazon SageMaker Debugger ha fornito l'osservabilità della formazione, il debug dei modelli e la profilazione del sistema come funzionalità integrate. SageMaker Queste funzionalità sono ora meglio servite da una combinazione di Amazon SageMaker AI MLFlow, TensorBoard on e Amazon CloudWatch per la formazione sull'osservabilità SageMaker, il debug dei modelli e il monitoraggio delle prestazioni del sistema. Questi strumenti offrono funzionalità flessibili che si adattano al tuo flusso di lavoro di formazione specifico, sia che tu stia perfezionando i modelli di base, addestrando architetture personalizzate o eseguendo carichi di lavoro distribuiti.
Mappatura delle capacità
| Capacità di debugger | Sostituita da | Cosa fornisce |
|---|---|---|
| Registrazione delle metriche di allenamento | MLFlow/ TensorBoard | Registra, visualizza e confronta le metriche tra le sessioni di formazione |
| Monitoraggio di modelli e parametri | MLflow | Tieni traccia degli iperparametri, delle versioni dei modelli e degli artefatti con una riproducibilità completa |
| Analisi del gradiente, dell'attivazione e del peso | TensorBoard | Plugin di istogramma e distribuzione per l'ispezione degli interni del modello durante le fasi di formazione |
| Profilazione delle risorse di sistema (CPU, GPU, memoria, disco) | Amazon CloudWatch | Real-time metriche di utilizzo con dashboard configurabili |
| Diagnostica automatizzata della formazione | Amazon CloudWatch Alarms + MLFlow | Monitora tutte le metriche registrate, come la convergenza delle perdite, le norme sui gradienti, l'utilizzo delle risorse e gli avvisi in caso di superamento delle soglie. Il confronto delle esecuzioni di MLFlow identifica le regressioni tra gli esperimenti |
Passaggio 1: rimozione della configurazione del debugger
Rimuovi DebuggerHookConfig dal tuo stimatore
Se lo script di formazione o lo SageMaker stimatore include rules delle configurazioni DebuggerHookConfig Debugger-specific TensorBoardOutputConfig, rimuovile. Ciò disabilita l'acquisizione automatica dei tensori e la valutazione delle regole.
Nota
Se stai usando la Estimator classe SageMaker Python SDK v2, considera anche la transizione alle più recenti API di formazione SageMaker Python SDK o alle chiamate dirette a Boto3, poiché gli estimatori sono un costrutto legacy. CreateTrainingJob
Elimina l'output del debugger in Amazon S3
Il debugger ha archiviato i dati dei tensori e l'output di profilazione in S3 in percorsi come:
s3://<bucket>/<training-job-name>/debug-output/ s3://<bucket>/<training-job-name>/profiler-output/
Elimina questi prefissi se non hai più bisogno dei dati storici. I registri dei processi di formazione e gli artefatti del modello in S3 rimangono inalterati.
Elimina le regole Debugger personalizzate (se utilizzate)
Se hai definito contenitori di regole personalizzati:
-
Elimina le immagini Amazon ECR utilizzate per la valutazione personalizzata delle regole Debugger
-
Rimuovi gli script di definizione delle regole o le configurazioni JSON che non sono più necessari
Elimina i gruppi di CloudWatch log (opzionale)
Il debugger ha creato i gruppi di log in /aws/sagemaker/TrainingJobs per la valutazione delle regole. Eliminali se non sono più necessari per ridurre i costi di archiviazione dei log.
Rivedi le politiche IAM
Rimuovi le politiche IAM che concedevano l'accesso specificamente per l'utilizzo del Debugger:
-
s3:GetObject/ha comes3:PutObjectambito i percorsi di output del Debugger -
logs:PutLogEventsper gruppi di log Debugger-specific -
Autorizzazioni per l'esecuzione del contenitore di regole Debugger
Conserva tutte le politiche ancora necessarie per i tuoi lavori di formazione, MLFlow o. CloudWatch
Fase 2: Configurazione delle sostituzioni
Integra MLFlow per il monitoraggio degli esperimenti
Amazon SageMaker AI offre una funzionalità MLFlow senza server che si ridimensiona dinamicamente per supportare le attività di sviluppo di modelli AI senza costi aggiuntivi. Consulta il blog di lancio. https://aws.amazon.com/blogs/aws/accelerate-ai-development-using-amazon-sagemaker-ai-with-serverless-mlflow/
Usa MLFlow per:
-
Registra iperparametri, metriche di addestramento e artefatti del modello
-
Confronta le esecuzioni fianco a fianco per identificare regressioni o miglioramenti
-
Tieni traccia delle versioni dei modelli e della loro evoluzione dall'esperimento alla produzione
Inizia: esperimenti di machine learning che utilizzano Amazon SageMaker AI con MLFlow: includono la configurazione, la creazione di un server di tracciamento e l'integrazione con il codice di formazione.
Da utilizzare per l' TensorBoard introspezione dei modelli
TensorBoard in Amazon, l' SageMaker intelligenza artificiale offre una visibilità approfondita degli elementi interni del modello durante l'addestramento:
-
Visualizza le distribuzioni dei gradienti e gli istogrammi del peso nei vari passaggi
-
Monitora i modelli di attivazione e il comportamento dei livelli
-
Tieni traccia delle metriche scalari, delle immagini e delle visualizzazioni personalizzate
Quando usare vs. TensorBoard MLFlow: MLFlow tiene traccia delle metriche scalari e supporta la visualizzazione di base per il confronto delle esecuzioni. TensorBoard eccelle nell'introspezione multidimensionale dei modelli: istogrammi a gradiente, distribuzioni del peso, grafici computazionali e proiezioni di incorporamento. Usali entrambi insieme: MLFlow per la gestione degli esperimenti, per sessioni di debug approfondite. TensorBoard
Inizia: TensorBoard in Amazon AI SageMaker
Usa Amazon CloudWatch per il monitoraggio del sistema e gli avvisi
Amazon CloudWatch acquisisce i parametri di utilizzo delle risorse per i tuoi lavori di formazione e supporta allarmi configurabili:
-
Monitora l'utilizzo di CPU, GPU, memoria e disco in tempo reale
-
Imposta allarmi su qualsiasi metrica di addestramento per rilevare anomalie, ad esempio picchi di perdite, problemi nelle risorse o comportamenti imprevisti delle metriche
-
Crea dashboard combinando metriche di sistema e metriche di formazione per una visibilità unificata
Inizia subito: Amazon CloudWatch Metrics per il monitoraggio e l'analisi dei lavori di formazione
Cosa succede ai tuoi dati esistenti
-
Registri di formazione in S3: i risultati del lavoro di formazione, gli artefatti del modello e i registri rimangono accessibili. Sono indipendenti da Debugger.
-
Dati sui tensori del debugger: le raccolte di tensori storiche archiviate da Debugger rimangono in S3 nei percorsi sopra elencati finché non le elimini. La libreria
smdebugclientpuò ancora leggere questi dati come riferimento. -
CloudWatch metriche: le metriche di formazione cronologiche già CloudWatch disponibili vengono conservate in base alle impostazioni di conservazione dei log del tuo account.