Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.
Änderung der Verfügbarkeit von Amazon SageMaker Model Monitor
Anmerkung
Amazon SageMaker Model Monitor steht neuen Kunden nicht mehr offen. Bestehende Kunden können den Service weiterhin wie gewohnt nutzen. AWS investiert weiterhin in Sicherheits- und Verfügbarkeitsverbesserungen für Model Monitor, wir planen jedoch nicht, neue Funktionen einzuführen.
Open-source SageMaker KI-Überwachungslösungen + Amazon QuickSight + Amazon CloudWatch
Die Kombination aus den SageMaker Open-Source-KI-Überwachungslösungen von Amazon, den QuickSight Amazon-Governance-Dashboards und Amazon CloudWatch dient als Ersatz für Amazon SageMaker Model Monitor.
Die SageMaker Open-Source-KI-Überwachungslösungen von Amazon (veröffentlicht in der aws-samples GitHub Organisation
Durch die Inferenzüberwachung mit Amazon wird Ihren QuickSight Produktions-Inferenz-Pipelines eine Steuerungsebene hinzugefügt, die eine vorausschauende Überwachung in Echtzeit ermöglicht. Es verfolgt kontinuierlich Prognosen und Kennzahlen zur Datenqualität, verarbeitet verzögertes Ground-Truth-Verfahren und visualisiert Abweichungen und Modellleistungstrends in Dashboards für Führungskräfte. Diese Lösung kombiniert SageMaker KI, MLflow Apps und Eviently AI für statistische Driftanalysen mit einem Athena Iceberg Data Lake, EventBridge-triggered Lambda für geplante Analysen, SNS-Warnmeldungen und Dashboards. QuickSight
Amazon CloudWatch bietet Überwachung auf System- und Inferenzebene mit erweiterten Metriken für SageMaker Endpunkte, darunter Aufruflatenz, Modellfehler, Auslastung und benutzerdefinierte Metriken mit Alarmen zur Erkennung von Anomalien. CPU/GPU
Amazon SageMaker Model Monitor durch Open-Source-Lösungen zu ersetzen und QuickSight CloudWatch
In diesem Abschnitt erfahren Sie, wie Sie Ihre bestehende Amazon SageMaker Model Monitor-Bereitstellung mithilfe der SageMaker Open-Source-KI-Überwachungslösungen von Amazon (AI MLflow Apps + Eviently SageMaker AI), QuickSight Amazon-Governance-Dashboards und Amazon ersetzen. CloudWatch Diese Lösung unterstützt gleichwertige und erweiterte Funktionen für die Überwachung der Datenqualität, die Überwachung der Modellqualität, die Erkennung von Verzerrungen, die Erkennung von Abweichungen bei der Merkmalsattribution und die Überwachung der Systemleistung für Modelle, die auf Amazon AI bereitgestellt werden. SageMaker
Model Monitor wird entfernt
Beenden Sie Model Monitor für neue Überwachungspläne
Wenn Ihr Workflow das Erstellen von Überwachungszeitplänen mithilfe der ModelExplainabilityMonitor KlassenDefaultModelMonitor, ModelQualityMonitorModelBiasMonitor, oder aus dem SageMaker Python-SDK oder der CreateMonitoringSchedule API umfasst, wechseln Sie zu den Alternativen, die im Abschnitt Konfiguration von Ersatzteilen unten beschrieben werden.
Löschen Sie vorhandene Überwachungszeitpläne
Bei Überwachungsplänen werden Processing-Job-Instances (Beispiel:ml.m5.xlarge) nach einem wiederkehrenden Zeitplan gestartet. Wenn Sie sie löschen, können Sie die laufenden Rechenkosten senken.
Verwenden des SageMaker Python-SDK:
import sagemaker from sagemaker.model_monitor import DefaultModelMonitor session = sagemaker.Session() # List all monitoring schedules schedules = session.sagemaker_client.list_monitoring_schedules() # Delete each schedule for schedule in schedules['MonitoringScheduleSummaries']: schedule_name = schedule['MonitoringScheduleName'] print(f"Deleting monitoring schedule: {schedule_name}") session.sagemaker_client.delete_monitoring_schedule( MonitoringScheduleName=schedule_name )
Mit dem AWS CLI:
# List all monitoring schedules aws sagemaker list-monitoring-schedules # Delete a specific monitoring schedule aws sagemaker delete-monitoring-schedule \ --monitoring-schedule-name "my-data-quality-monitor"
Anmerkung
Durch das Löschen eines Überwachungsplans wird auch der Zeitplan beendet, sofern er nicht bereits gestoppt wurde. Dadurch wird der Verlauf der Auftragsausführung des Überwachungsplans nicht gelöscht.
Konfiguration von Ersatzteilen
Auswahl einer Überwachungslösung
Das https://github.com/aws-samples/sample-aiops-on-amazon-sagemakerai/tree/main/monitoring
| Lösung | Typ der Inferenz | Bereitstellung | Schwerpunkt der Überwachung | Am besten geeignet für |
|---|---|---|---|---|
| Pipeline zur prädiktiven ML-Batch-Überwachung | Batch-Transformation | 2 Notizbücher (Experiment und SageMaker Pipeline) | Daten- und Modellqualitätsabweichung | Periodische Chargenvorhersagen |
| Prädiktive ML-Endpunktüberwachung | Real-time Endpunkt (Datenerfassung) | Notebook + CDK Lambda | Daten + Qualitätsabweichung des Modells | Real-time Endpunkte, die mit CDK skaliert wurden |
| Real-Time Inferenzüberwachung mit Eviently AI + SNS | Real-time Endpunkt (Datenerfassung) | Workshop-Notizbuch (Empfehlung) | Qualitätsabweichung bei Daten und Modellen | Einfache E-Mail-Benachrichtigungen auf einem vorhandenen Endpunkt |
| Real-Time Inferenzüberwachung mit Dashboards QuickSight | Real-time Endpunkt | Notizbücher und Skripte (Athena Iceberg Lake) | Drift + Leistung + verzögerter Ground Truth | Dashboards zur Produktionssteuerung (siehe Meta-Monitoring unten) |
| LLM-Inferenzüberwachung | Real-time Endpunkt (Datenerfassung) | CDK (Schrittfunktionen + Lambda) | Generative KI-Bewertungen (Sicherheit, Relevanz, Sprachkompetenz usw.) | LLM Sicherheits- und Qualitätsüberwachung |
| SageMaker Beobachtbarkeit von Ressourcen mit Grafana | Real-time Endpunkt | Einzelnes Notizbuch (Amazon Managed Grafana) | GPU/CPU/memory + Kosten | Multi-model Kosten- und Kapazitätsoptimierung |
| LLM Qualitätsbeobachtbarkeit mit Grafana | Real-time Endpunkt | Notizbuch (Managed Grafana +) CloudWatch | Sicherheit, Relevanz, Ton, Verbundqualität | Regressionserkennung der LLM-Ausgabequalität |
Erste Schritte mit den Monitoring-Lösungen
Die empfohlenen Ausgangspunkte für den Ersatz der Daten- und Modellqualitätsüberwachung von Model Monitor sind die Predictive ML Batch Monitoring Pipeline (für batch/Batch Transform-Workloads) und die Predictive ML Endpoint Monitoring-Lösung (für Echtzeit-Endpunkte). Beide verwenden standardmäßig den UCI Bank Marketing-Datensatz, sodass Sie sie durchgängig ausführen können, bevor Sie sie an Ihr eigenes Modell anpassen.
Predictive ML Batch Monitoring Pipeline (zwei Notebooks, nacheinander ausgeführt):
-
Experimentation (
predictive_ml_experimentation_data_model_monitoring_evidently.ipynb): trainiert ein XGBoost-Modell mit MLflow-Tracking, führt die Batch-Transform-Inferenz aus, führt dannDataDriftPresetEviently aus und protokolliert alle Metriken und Berichte inDataSummaryPresetIhrer MLflow-App.ClassificationPresetHTML/JSON -
Pipeline-Automatisierung (
batch_monitoring_pipeline.ipynb): operationalisiert den Workflow in eine SageMaker Pipeline mit einemTransformStepund EvientlyProcessingSteps, einem SNS-Thema für Warnmeldungen und einem Zeitplan. EventBridge Stellen Sie in Abschnitt 2,baseline_s3_uri,production_s3_urimlflow_app_name,mlflow_experiment_name(match Notebook 1) undschedule_expression(z.notification_emailB.) ein.rate(1 day)Bestätigen Sie das SNS-E-Mail-Abonnement vor der ersten Ausführung. Schwellenwerte für Abweichungen sind gültigscripts/monitoring_processor.py(Standardeinstellung: Warnung, wenn mehr als 30% der Funktionen abweichen).
Predictive ML Endpoint Monitoring (Notizbuch, dann optionales CDK für Skalierung): Öffnen Sieml_experimentation_with_data_model_monitoring_evidently_realtime.ipynb, legen Sie es mlflow_app_name in Abschnitt 2 fest und führen Sie die Abschnitte 1—8 aus. Dadurch wird das Modell trainiert, ein Echtzeit-Endpunkt mit Datenerfassung bereitgestellt, und es wird offensichtlich mit der Ausgangsbasis und ClassificationPreset der Realität DataDriftPreset verglichen.
Stellen Sie zur Skalierung die beiden Docker-based Lambda-Funktionen (Datendrift und Modellqualität) mit CDK bereit. Voncdk/, ausführennpm install, exportieren Sie die in Abschnitt 9 gedruckten Variablen (ENDPOINT_NAME,,,BUCKET,PREFIX,BASELINE_KEY,CAPTURE_PREFIX,GROUND_TRUTH_KEY, optionalSNS_TOPIC_ARN) MLFLOW_TRACKING_URI MLFLOW_EXPERIMENTFEATURE_COLUMNS, und führen Sie dann aus bash scripts/deploy.sh (wird cdk bootstrap automatisch ausgeführt).
Aktivieren Sie EventBridge S3-Benachrichtigungen im Bucket und fügen Sie S3-Trigger hinzu: Datendrift s3:ObjectCreated:* nach ${PREFIX}/data-capture/ unten, Modellqualität nach unten${PREFIX}/data/ground_truth/.
aws s3api put-bucket-notification-configuration \ --bucket <your-sagemaker-bucket> \ --notification-configuration '{"EventBridgeConfiguration": {}}'
Das Lambda-Modell alarmiert per SNS, wenn eine Metrik ihren Schwellenwert unterschreitet (Standardwerte: F1 0,70, Genauigkeit 0,80, ROC AUC 0,75; Überschreibung mit,,). THRESHOLD_F1 THRESHOLD_ACCURACY THRESHOLD_ROC_AUC
Das Lambda-Modell alarmiert per SNS, wenn eine Metrik ihren Schwellenwert unterschreitet (Standardwerte: F1 0,70, Genauigkeit 0,80, ROC AUC 0,75; Überschreibung mit,,). THRESHOLD_F1 THRESHOLD_ACCURACY THRESHOLD_ROC_AUC
Als einfache Alternative auf einem vorhandenen Endpunkt bietet die Lösung Real-Time Inference Monitoring with Eviently AI + SNS einen einzelnen FrameworkProcessor Verarbeitungsschritt (EvidentlyMonitoring) sowie einen EventBridge Scheduler und ein SNS-Thema, ohne Data Lake oder Dashboard. Es handelt sich um einen Verweis auf Abschnitt 8 von Notizbuch 06 im Amazon-Workshop „Von der Idee zur Produktion“. drifted_columns_share DriftThreshold 0.05 CriticalFeatures
Ersetzt die Überwachung der Datenqualität
Die Datenqualitätsüberwachung von Model Monitor erkennt statistische Abweichungen bei den Eingabemerkmalen, indem Live-Inferenzdaten mit einer Basislinie aus Trainingsdaten verglichen werden. Es berechnet Statistiken (Mittelwert, Standardabweichung, Minimum, Maximum, eindeutige Anzahl) und überprüft Einschränkungen (Datentyp, Vollständigkeit, Wertebereiche) mithilfe einer Deequ-based Engine, die bei geplanten Verarbeitungsjobs läuft.
Option 1: Open-source Lösungen mit Eviently AI
Die Überwachungslösungen verwenden KI von Eviently, DataDriftPreset um Merkmalsdrift zu erkennen und berechnen PSI- (Population Stability Index) und KS-Statistiken für jedes Merkmal. Die Trainingsbasisdaten werden als Referenzdatensatz und aktuelle Inferenzdaten als aktueller Datensatz gelesen. Die Batch- und Endpunktlösungen werden außerdem ausgeführtDataSummaryPreset, um Datenqualitätsprobleme (fehlende Werte, Ausreißer, Integritätsprüfungen) aufzudecken, was den Einschränkungsprüfungen von Model Monitor sehr ähnlich ist. Drift-Scores werden mit konfigurierbaren Schwellenwerten verglichen, zusammen mit den Trainingsmetriken in einer SageMaker KI-MLflow-App protokolliert und als interaktive HTML-Berichte angezeigt.
Dieser Ersatz ist hochgradig skalierbar und vollständig anpassbar:
-
Skalierbar: Compute skaliert im Leerlauf auf Null. EventBridge-triggered Lambda führt Drift-Analysen nach einem Zeitplan durch, und die Athena Iceberg-Tabellenpartitionierung hält die Scankosten niedrig, wenn das Datenvolumen wächst. High-volume Bereitstellungen werden linear ohne reservierte Kapazität skaliert.
-
Individuell anpassbar: Sie steuern die Drift-Voreinstellungen, Schwellenwerte pro Funktion, Lookback-Fenster und den Zeitplan über eine zentrale Zentrale.
config.yamlSie können domänenspezifische Drifttests hinzufügen, die über den PSI hinausgehen (z. B. Geschäftskennzahlen wie Änderungen der Genehmigungsrate). -
Einheitliche Abstammung: Drift-Metriken werden zusammen mit Trainingsmetriken in derselben SageMaker KI-MLflow-App gespeichert, sodass eine vollständige Modellherkunft und eine Drift-Trendanalyse möglich sind.
Detaillierte Einrichtungsschritte finden Sie in den SageMaker Open-Source-AI-Überwachungslösungen
Option 2: CloudWatch Benutzerdefinierte Amazon-Metriken + Erkennung von Anomalien
Für eine einfache Überwachung der Datenqualität ohne die gesamte Überwachungspipeline können Sie benutzerdefinierte Messwerte veröffentlichen CloudWatch und Alarme zur Erkennung von Anomalien verwenden. Eine ausführliche Anleitung finden Sie unter Verwenden der CloudWatch Anomalieerkennung.
Ersetzt die Qualitätsüberwachung des Modells
Die Modellqualitätsüberwachung von Model Monitor überwacht die Genauigkeit der Vorhersagen, indem Ground-Truth-Labels aus S3 mit Endpunktvorhersagen zusammengeführt und Metriken (Genauigkeit, Präzision, Rückruf, F1, AUC, RMSE, MAE) nach einem Zeitplan berechnet werden.
Option 1: Open-source Lösungen mit Eviently AI
Die Überwachungslösungen verwenden künstliche Intelligenz von Eviently ClassificationPreset zur BerechnungROC-AUC, Präzisierung, Erinnerung, F1 und der Konfusionsmatrix, wann immer Ground Truth verfügbar ist. Zu den Lösungen gehört ein Muster, mit dem verzögerte Ground-Truth-Prognosen mit Vorhersagen anhand von Inferenz-ID abgeglichen werden. Dadurch wird die tatsächliche Latenz bei der Kennzeichnung berücksichtigt, die die Überwachung der Modellqualität erschwert.
Option 2: benutzerdefinierte Metriken CloudWatch
Veröffentlichen Sie Kennzahlen zur Modellqualität CloudWatch , sobald Ground Truth verfügbar ist.
Ersetzt die Überwachung von Verzerrungen
Die Überwachung der Verzerrungsabweichung von Model Monitor erkennt Veränderungen der Fairness-Metriken im Laufe der Zeit, indem Live-Prognosen mit einer Verzerrungs-Basislinie für geschützte Attribute verglichen werden.
Segment-sliced Metriken mit Eviently AI, die in MLflow protokolliert wurden und QuickSight
Verfolgen Sie Vorurteile, indem Sie Leistungs- und Ergebniskennzahlen pro Segment mit geschützten Attributen (z. B. von genderage_band, oderregion) berechnen und sie mit den Trainingsbasiswerten vergleichen. Das Gleiche, das offensichtlich für die Modellqualität ClassificationPreset verwendet wird, wird pro Segment berechnet, und die daraus resultierenden segmentspezifischen Kennzahlen (Auswahlrate, true/false positive Raten precision/recall) werden in der SageMaker KI MLflow App protokolliert und im Governance-Dashboard angezeigt. QuickSight
Definieren Sie Ihre eigenen Fairness-Schwellenwerte (z. B. die maximal zulässige Lücke bei der Auswahlrate oder die tatsächliche Positivrate zwischen Segmenten) und benachrichtigen Sie über Amazon SNS, wenn eine Lücke den Schwellenwert überschreitet. Verwenden Sie dabei dasselbe EventBridge + Lambda-Muster wie bei den Daten- und Modellqualitätsmonitoren. Da alles Open Source ist und in Ihrem Konto läuft, kontrollieren Sie, welche Attribute überwacht werden und welche Fairnessdefinitionen gelten.
Inferenz-Metaüberwachung mit Amazon QuickSight (Echtzeit- und prädiktive Überwachung)
Prädiktive Modelle können sich in der Produktion unbemerkt verschlechtern. Bei Betrugsfällen kommt es immer häufiger zu Fehlalarmen, Kreditsachbearbeiter sehen Anträge, die hätten gemeldet werden müssen, und Planer haben aufgrund der überschätzten Nachfrage am Ende einen Überschuss an Lagerbeständen. Meta-monitoring gibt den Teams kontinuierliches Feedback zur Leistung des Produktionsmodells und warnt sie, sobald die Modellqualität oder Datenabweichungen auftreten, sodass sie Modelle proaktiv aktualisieren können.
Diese Lösung kombiniert AWS verwaltete Services (Amazon SageMaker AI, Amazon Athena, AWS
Lambda, Amazon SQS, Amazon SNS, Amazon, Amazon QuickSight) mit Open-Source-ML-Tools (SageMaker AI MLflow Apps EventBridge, Eviently AI), um ein produktionsbereites Überwachungssystem zu schaffen. Im Repository für Überwachungslösungen handelt es sich um die Lösung Real-Time Inference Monitoring with QuickSight Dashboards. Die komplette Referenzimplementierung befindet sich unter sample-mlops-bestpractices
Voraussetzungen:
-
Eine SageMaker KI-Domain mit einem MLflow-Tracking-Server.
-
Eine SageMaker Ausführungsrolle mit Berechtigungen für S3, Athena, Lambda, SQS, SNS und EventBridge (das Repo enthält die genauen Inline-IAM-Richtlinien und/Helper).
create_or_update_sagemaker_rolecreate_lambda_role -
Ein S3-Bucket für die Datenspeicherung.
-
Python 3.12+ und der
uvPaketmanager (für den script/CLI Pfad); ein QuickSight Enterprise-Abonnement für das Governance-Dashboard.
Wählen Sie einen Setup-Pfad:
Option A (empfohlen für neue Benutzer): Wenn Sie keine SageMaker Domain haben, stellen Sie die CloudFormation Vorlage in bereitcloudformation/. Sie stellt die SageMaker Domain, das Benutzerprofil, den JupyterLab Speicherplatz, den MLFlow-Tracking-Server, den S3-Bucket und die unterstützende VPC bereit, klont das Repo automatisch und schreibt eine Datei, die beim ersten Start ausgefüllt wird. .env
Option B (bestehende Domains): Wenn Sie bereits eine SageMaker Domain mit einem MLflow-Tracking-Server haben, klonen Sie das Repo und füllen Sie es manuell aus. JupyterLab .env
Einrichtung
Richten Sie eine Schulung ein, um sich auf die Überwachung vorzubereiten. Sie können alles von den drei Notebooks in SageMaker Studio aus steuern oder die entsprechenden CLI-Befehle verwenden (jede Notebook-Zelle ist einem python main.py ... Befehl für zugeordnet CI/CD). Wenn Sie das Beispiel von Anfang bis Ende ausführen, müssen Sie es nicht bearbeitenconfig.yaml. Das Ausfüllen .env und Verwenden der Standardwerte funktioniert. Wenn Sie bereits ein Modell bereitgestellt haben, passen Sie die Trainingspipeline an Ihre eigenen Schritte an und stellen Sie sicher, dass der Inferenzendpunkt die Prognosedatensätze an Amazon SQS weiterleitet.