

Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.

# Änderung der Debugger-Verfügbarkeit
<a name="debugger-availability-change"></a>

**Anmerkung**  
Amazon SageMaker Debugger steht neuen Kunden nicht mehr offen. Bestehende Kunden können den Service weiterhin wie gewohnt nutzen. AWS investiert weiterhin in Sicherheits- und Verfügbarkeitsverbesserungen für Debugger, aber wir planen nicht, neue Funktionen einzuführen.

## Amazon SageMaker Debugger ersetzen
<a name="debugger-replacing"></a>

Folgen Sie dieser Anleitung, um zu alternativen Diensten überzugehen.

## -Übersicht
<a name="debugger-migration-overview"></a>

Amazon SageMaker Debugger bot als integrierte Funktion die Beobachtbarkeit von Schulungen, das Debuggen von Modellen und die Erstellung von Systemprofilen. SageMaker Diese Funktionen werden jetzt besser durch eine Kombination aus Amazon SageMaker AI MLFlow, TensorBoard on und Amazon CloudWatch für das Training der Beobachtbarkeit SageMaker, das Modelldebugging und die Überwachung der Systemleistung unterstützt. Diese Tools bieten flexible Funktionen, die sich an Ihren spezifischen Trainingsablauf anpassen, unabhängig davon, ob Sie Basismodelle optimieren, benutzerdefinierte Architekturen trainieren oder verteilte Workloads ausführen.

## Zuordnung der Fähigkeiten
<a name="debugger-capability-mapping"></a>


| Debugger-Fähigkeit | Ersetzt durch | Was es bietet | 
| --- | --- | --- | 
| Protokollierung von Trainingsmetriken | MLflow/ TensorBoard | Protokollieren, visualisieren und vergleichen Sie Kennzahlen für alle Trainingsläufe | 
| Modell- und Parameterverfolgung | MLflow | Verfolgen Sie Hyperparameter, Modellversionen und Artefakte mit voller Reproduzierbarkeit | 
| Gradienten-, Aktivierungs- und Gewichtsanalyse | TensorBoard | Histogramm- und Verteilungs-Plugins zur Überprüfung der Modellinterna in allen Trainingsschritten | 
| Profilerstellung von Systemressourcen (CPU, GPU, Speicher, Festplatte) | Amazon CloudWatch | Real-time Nutzungsmetriken mit konfigurierbaren Dashboards | 
| Automatisierte Trainingsdiagnostik | Amazon CloudWatch Alarms \+ MLFlow | Überwachen Sie alle protokollierten Kennzahlen wie Verlustkonvergenz, Gradientennormen und Ressourcenauslastung und warnen Sie bei Grenzwertüberschreitungen. Der MLFlow-Vergleich identifiziert Regressionen zwischen Experimenten | 

## Schritt 1: Debugger-Konfiguration entfernen
<a name="debugger-step1-remove"></a>

### DebuggerHookConfig Aus Ihrem Schätzer entfernen
<a name="debugger-remove-hook-config"></a>

Wenn Ihr Trainingsskript oder SageMaker Kalkulator Konfigurationen enthält oder `rules` Konfigurationen enthält `DebuggerHookConfig` Debugger-specific `TensorBoardOutputConfig`, entfernen Sie diese. Dadurch werden die automatische Tensorerfassung und Regelauswertung deaktiviert.

**Anmerkung**  
Wenn Sie die SageMaker Python SDK `Estimator` v2-Klasse verwenden, sollten Sie auch den Übergang zu den neueren [ SageMaker Python SDK-Training-APIs ](https://docs.aws.amazon.com/sagemaker/latest/dg/train-model.html) oder direkten `CreateTrainingJob` Boto3-Aufrufen in Betracht ziehen, da Estimators ein veraltetes Konstrukt sind.

### Löschen Sie die Debugger-Ausgabe in Amazon S3
<a name="debugger-delete-s3-output"></a>

Der Debugger speicherte Tensordaten und die Profilerstellungsausgabe in S3 unter Pfaden wie:

```
s3://<bucket>/<training-job-name>/debug-output/
s3://<bucket>/<training-job-name>/profiler-output/
```

Löschen Sie diese Präfixe, wenn Sie die historischen Daten nicht mehr benötigen. Ihre Trainingsauftragsprotokolle und Modellartefakte in S3 bleiben davon unberührt.

### Löschen Sie benutzerdefinierte Debugger-Regeln (falls verwendet)
<a name="debugger-delete-custom-rules"></a>

Wenn Sie benutzerdefinierte Regelcontainer definiert haben:
+ Löschen Sie Amazon ECR-Images, die für die Bewertung benutzerdefinierter Debugger-Regeln verwendet wurden
+ Entfernen Sie Regeldefinitionsskripts oder JSON-Konfigurationen, die nicht mehr benötigt werden

### Löschen Sie CloudWatch Protokollgruppen (optional)
<a name="debugger-delete-cloudwatch-logs"></a>

Der Debugger hat unter Protokollgruppen `/aws/sagemaker/TrainingJobs` für die Regelauswertung erstellt. Löschen Sie diese, wenn sie nicht mehr benötigt werden, um die Kosten für die Protokollspeicherung zu senken.

### Überprüfen Sie die IAM-Richtlinien
<a name="debugger-review-iam"></a>

Entfernen Sie die IAM-Richtlinien, die den Zugriff speziell für die Verwendung des Debuggers gewährt haben:
+ `s3:GetObject`/beschränkt sich auf `s3:PutObject` Debugger-Ausgabepfade
+ `logs:PutLogEvents`für Protokollgruppen Debugger-specific 
+ Berechtigungen für die Ausführung von Debugger-Regelcontainern

Behalten Sie alle Richtlinien bei, die Sie für Ihre Trainingsjobs, MLflow oder noch benötigen. CloudWatch

## Schritt 2: Ersatzprodukte konfigurieren
<a name="debugger-step2-configure"></a>

### Integrieren Sie MLflow für die Nachverfolgung von Experimenten
<a name="debugger-integrate-mlflow"></a>

Amazon SageMaker AI bietet eine serverlose MLFlow-Funktion, die dynamisch skaliert wird, um KI-Modellentwicklungsaufgaben ohne zusätzliche Kosten zu unterstützen. Sehen Sie sich den [ Launch-Blog an. ](https://aws.amazon.com/blogs/aws/accelerate-ai-development-using-amazon-sagemaker-ai-with-serverless-mlflow/)

Verwenden Sie MLflow, um:
+ Protokollieren Sie Hyperparameter, Trainingsmetriken und Modellartefakte
+ Vergleichen Sie Läufe nebeneinander, um Regressionen oder Verbesserungen zu identifizieren
+ Verfolgen Sie die Modellversionen und den Verlauf vom Experiment bis zur Produktion

**Erste Schritte: Experimente mit ** [ maschinellem Lernen unter Verwendung von Amazon SageMaker AI mit MLflow ](https://docs.aws.amazon.com/sagemaker/latest/dg/mlflow-track-experiments.html) — behandelt die Einrichtung, die Erstellung eines Tracking-Servers und die Integration in Ihren Trainingscode.

### TensorBoard Zur Modell-Introspektion verwenden
<a name="debugger-use-tensorboard"></a>

TensorBoard in Amazon bietet SageMaker KI während des Trainings einen umfassenden Einblick in die internen Abläufe der Modelle:
+ Visualisieren Sie Gradientenverteilungen und gewichten Sie Histogramme stufenweise
+ Überwachen Sie Aktivierungsmuster und Ebenenverhalten
+ Verfolgen Sie skalare Metriken, Bilder und benutzerdefinierte Visualisierungen

**Wann sollte man vs. verwenden TensorBoard MLflow: ** MLflow verfolgt skalare Metriken und unterstützt grundlegende Visualisierungen für den Vergleich von Rechenläufen. TensorBoard zeichnet sich durch multidimensionale Modell-Introspektion aus — Gradientenhistogramme, Gewichtsverteilungen, Rechendiagramme und eingebettete Projektionen. Verwenden Sie beides zusammen: MLflow für das Experimentmanagement, für tiefgreifende Debugging-Sitzungen. TensorBoard 

**Erste Schritte: ** [ TensorBoard in Amazon AI SageMaker ](https://docs.aws.amazon.com/sagemaker/latest/dg/tensorboard-on-sagemaker.html)

### Verwenden Sie Amazon CloudWatch für Systemüberwachung und Benachrichtigungen
<a name="debugger-use-cloudwatch"></a>

Amazon CloudWatch erfasst Kennzahlen zur Ressourcenauslastung für Ihre Schulungsjobs und unterstützt konfigurierbare Alarme:
+ Überwachen Sie die CPU-, GPU-, Speicher- und Festplattenauslastung in Echtzeit
+ Stellen Sie Alarme für jede Trainingsmetrik ein, um Anomalien zu erkennen — Verlustplateaus, Ressourcenengpässe oder unerwartetes Verhalten der Messwerte
+ Erstellen Sie Dashboards, die Systemkennzahlen und Trainingsmetriken kombinieren, um einen einheitlichen Überblick zu erhalten

**Erste Schritte: ** [ Amazon CloudWatch Metrics zur Überwachung und Analyse von Schulungsjobs ](https://docs.aws.amazon.com/sagemaker/latest/dg/training-metrics.html)

## Was passiert mit Ihren vorhandenen Daten
<a name="debugger-existing-data"></a>
+ **Trainingsprotokolle in S3: ** Ihre Trainingsauftragsausgaben, Modellartefakte und Protokolle bleiben zugänglich. Diese sind unabhängig vom Debugger.
+ **Debugger-Tensordaten: ** Historische Tensorsammlungen, die vom Debugger gespeichert wurden, verbleiben in S3 unter den oben aufgeführten Pfaden, bis Sie sie löschen. Die [`smdebug` Client-Bibliothek ](https://github.com/awslabs/sagemaker-debugger) kann diese Daten weiterhin als Referenz lesen.
+ **CloudWatch Kennzahlen: ** Historische Trainingsmetriken, die bereits vorliegen, CloudWatch werden gemäß den Einstellungen für die Aufbewahrung von [ Protokollen in Ihrem Konto gespeichert](https://docs.aws.amazon.com/AmazonCloudWatch/latest/logs/Working-with-log-groups-and-streams.html#SettingLogRetention).