View a markdown version of this page

Änderung der Verfügbarkeit von Amazon SageMaker Model Monitor - Amazon SageMaker KI

Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.

Änderung der Verfügbarkeit von Amazon SageMaker Model Monitor

Anmerkung

Amazon SageMaker Model Monitor steht neuen Kunden nicht mehr offen. Bestehende Kunden können den Service weiterhin wie gewohnt nutzen. AWS investiert weiterhin in Sicherheits- und Verfügbarkeitsverbesserungen für Model Monitor, wir planen jedoch nicht, neue Funktionen einzuführen.

Open-source SageMaker KI-Überwachungslösungen + Amazon QuickSight + Amazon CloudWatch

Die Kombination aus den SageMaker Open-Source-KI-Überwachungslösungen von Amazon, den QuickSight Amazon-Governance-Dashboards und Amazon CloudWatch dient als Ersatz für Amazon SageMaker Model Monitor.

Die SageMaker Open-Source-KI-Überwachungslösungen von Amazon (veröffentlicht in der aws-samples GitHub Organisation) bieten eine hochgradig skalierbare und anpassbare Grundlage für eine umfassende Überwachung der Daten- und Modellqualität. Sie basieren auf AWS verwalteten Diensten (Amazon SageMaker AI, Amazon Athena, Amazon AWS Lambda, Amazon SQS EventBridge, Amazon SNS, Amazon QuickSight) in Kombination mit Open-Source-ML-Tools (SageMaker AI MLflow Apps und Eviently AI). Die Lösungen laufen vollständig in Ihrem Unternehmen AWS-Konto und lassen sich von Batch-Workloads mit geringem Volumen bis hin zu Echtzeit-Endpunkten mit hohem Durchsatz skalieren. Sie decken Batch-Inferenz, Echtzeit-Endpunkte, LLM-Evaluierung und die Beobachtbarkeit von GPU-Ressourcen ab. Sie passen sie an Ihre eigenen Datensätze, Modelle und Drift-Schwellenwerte an.

Durch die Inferenzüberwachung mit Amazon wird Ihren QuickSight Produktions-Inferenz-Pipelines eine Steuerungsebene hinzugefügt, die eine vorausschauende Überwachung in Echtzeit ermöglicht. Es verfolgt kontinuierlich Prognosen und Kennzahlen zur Datenqualität, verarbeitet verzögertes Ground-Truth-Verfahren und visualisiert Abweichungen und Modellleistungstrends in Dashboards für Führungskräfte. Diese Lösung kombiniert SageMaker KI, MLflow Apps und Eviently AI für statistische Driftanalysen mit einem Athena Iceberg Data Lake, EventBridge-triggered Lambda für geplante Analysen, SNS-Warnmeldungen und Dashboards. QuickSight

Amazon CloudWatch bietet Überwachung auf System- und Inferenzebene mit erweiterten Metriken für SageMaker Endpunkte, darunter Aufruflatenz, Modellfehler, Auslastung und benutzerdefinierte Metriken mit Alarmen zur Erkennung von Anomalien. CPU/GPU

Amazon SageMaker Model Monitor durch Open-Source-Lösungen zu ersetzen und QuickSight CloudWatch

In diesem Abschnitt erfahren Sie, wie Sie Ihre bestehende Amazon SageMaker Model Monitor-Bereitstellung mithilfe der SageMaker Open-Source-KI-Überwachungslösungen von Amazon (AI MLflow Apps + Eviently SageMaker AI), QuickSight Amazon-Governance-Dashboards und Amazon ersetzen. CloudWatch Diese Lösung unterstützt gleichwertige und erweiterte Funktionen für die Überwachung der Datenqualität, die Überwachung der Modellqualität, die Erkennung von Verzerrungen, die Erkennung von Abweichungen bei der Merkmalsattribution und die Überwachung der Systemleistung für Modelle, die auf Amazon AI bereitgestellt werden. SageMaker

Model Monitor wird entfernt

Beenden Sie Model Monitor für neue Überwachungspläne

Wenn Ihr Workflow das Erstellen von Überwachungszeitplänen mithilfe der ModelExplainabilityMonitor KlassenDefaultModelMonitor, ModelQualityMonitorModelBiasMonitor, oder aus dem SageMaker Python-SDK oder der CreateMonitoringSchedule API umfasst, wechseln Sie zu den Alternativen, die im Abschnitt Konfiguration von Ersatzteilen unten beschrieben werden.

Löschen Sie vorhandene Überwachungszeitpläne

Bei Überwachungsplänen werden Processing-Job-Instances (Beispiel:ml.m5.xlarge) nach einem wiederkehrenden Zeitplan gestartet. Wenn Sie sie löschen, können Sie die laufenden Rechenkosten senken.

Verwenden des SageMaker Python-SDK:

import sagemaker from sagemaker.model_monitor import DefaultModelMonitor session = sagemaker.Session() # List all monitoring schedules schedules = session.sagemaker_client.list_monitoring_schedules() # Delete each schedule for schedule in schedules['MonitoringScheduleSummaries']: schedule_name = schedule['MonitoringScheduleName'] print(f"Deleting monitoring schedule: {schedule_name}") session.sagemaker_client.delete_monitoring_schedule( MonitoringScheduleName=schedule_name )

Mit dem AWS CLI:

# List all monitoring schedules aws sagemaker list-monitoring-schedules # Delete a specific monitoring schedule aws sagemaker delete-monitoring-schedule \ --monitoring-schedule-name "my-data-quality-monitor"
Anmerkung

Durch das Löschen eines Überwachungsplans wird auch der Zeitplan beendet, sofern er nicht bereits gestoppt wurde. Dadurch wird der Verlauf der Auftragsausführung des Überwachungsplans nicht gelöscht.

Konfiguration von Ersatzteilen

Auswahl einer Überwachungslösung

Das https://github.com/aws-samples/sample-aiops-on-amazon-sagemakerai/tree/main/monitoring Open-Source-Repository für SageMaker KI-Überwachungslösungen von Amazon bietet sieben produktionsfertige Überwachungslösungen, die auf SageMaker AI MLflow Apps und Eviently AI basieren. Wählen Sie diejenige aus, die Ihrem Inferenzmuster und Ihren betrieblichen Anforderungen entspricht. Alle von ihnen sind Open Source, laufen in Ihrem System und sind so konzipiert AWS-Konto, dass sie an Ihre Datensätze, Modelle und Drift-Schwellenwerte angepasst werden können.

Lösung Typ der Inferenz Bereitstellung Schwerpunkt der Überwachung Am besten geeignet für
Pipeline zur prädiktiven ML-Batch-Überwachung Batch-Transformation 2 Notizbücher (Experiment und SageMaker Pipeline) Daten- und Modellqualitätsabweichung Periodische Chargenvorhersagen
Prädiktive ML-Endpunktüberwachung Real-time Endpunkt (Datenerfassung) Notebook + CDK Lambda Daten + Qualitätsabweichung des Modells Real-time Endpunkte, die mit CDK skaliert wurden
Real-Time Inferenzüberwachung mit Eviently AI + SNS Real-time Endpunkt (Datenerfassung) Workshop-Notizbuch (Empfehlung) Qualitätsabweichung bei Daten und Modellen Einfache E-Mail-Benachrichtigungen auf einem vorhandenen Endpunkt
Real-Time Inferenzüberwachung mit Dashboards QuickSight Real-time Endpunkt Notizbücher und Skripte (Athena Iceberg Lake) Drift + Leistung + verzögerter Ground Truth Dashboards zur Produktionssteuerung (siehe Meta-Monitoring unten)
LLM-Inferenzüberwachung Real-time Endpunkt (Datenerfassung) CDK (Schrittfunktionen + Lambda) Generative KI-Bewertungen (Sicherheit, Relevanz, Sprachkompetenz usw.) LLM Sicherheits- und Qualitätsüberwachung
SageMaker Beobachtbarkeit von Ressourcen mit Grafana Real-time Endpunkt Einzelnes Notizbuch (Amazon Managed Grafana) GPU/CPU/memory + Kosten Multi-model Kosten- und Kapazitätsoptimierung
LLM Qualitätsbeobachtbarkeit mit Grafana Real-time Endpunkt Notizbuch (Managed Grafana +) CloudWatch Sicherheit, Relevanz, Ton, Verbundqualität Regressionserkennung der LLM-Ausgabequalität

Erste Schritte mit den Monitoring-Lösungen

Die empfohlenen Ausgangspunkte für den Ersatz der Daten- und Modellqualitätsüberwachung von Model Monitor sind die Predictive ML Batch Monitoring Pipeline (für batch/Batch Transform-Workloads) und die Predictive ML Endpoint Monitoring-Lösung (für Echtzeit-Endpunkte). Beide verwenden standardmäßig den UCI Bank Marketing-Datensatz, sodass Sie sie durchgängig ausführen können, bevor Sie sie an Ihr eigenes Modell anpassen.

Predictive ML Batch Monitoring Pipeline (zwei Notebooks, nacheinander ausgeführt):

  1. Experimentation (predictive_ml_experimentation_data_model_monitoring_evidently.ipynb): trainiert ein XGBoost-Modell mit MLflow-Tracking, führt die Batch-Transform-Inferenz aus, führt dann DataDriftPreset Eviently aus und protokolliert alle Metriken und Berichte in DataSummaryPreset Ihrer MLflow-App. ClassificationPreset HTML/JSON

  2. Pipeline-Automatisierung (batch_monitoring_pipeline.ipynb): operationalisiert den Workflow in eine SageMaker Pipeline mit einem TransformStep und Eviently ProcessingStep s, einem SNS-Thema für Warnmeldungen und einem Zeitplan. EventBridge Stellen Sie in Abschnitt 2,baseline_s3_uri, production_s3_urimlflow_app_name, mlflow_experiment_name (match Notebook 1) und schedule_expression (z. notification_email B.) ein. rate(1 day) Bestätigen Sie das SNS-E-Mail-Abonnement vor der ersten Ausführung. Schwellenwerte für Abweichungen sind gültig scripts/monitoring_processor.py (Standardeinstellung: Warnung, wenn mehr als 30% der Funktionen abweichen).

Predictive ML Endpoint Monitoring (Notizbuch, dann optionales CDK für Skalierung): Öffnen Sieml_experimentation_with_data_model_monitoring_evidently_realtime.ipynb, legen Sie es mlflow_app_name in Abschnitt 2 fest und führen Sie die Abschnitte 1—8 aus. Dadurch wird das Modell trainiert, ein Echtzeit-Endpunkt mit Datenerfassung bereitgestellt, und es wird offensichtlich mit der Ausgangsbasis und ClassificationPreset der Realität DataDriftPreset verglichen.

Stellen Sie zur Skalierung die beiden Docker-based Lambda-Funktionen (Datendrift und Modellqualität) mit CDK bereit. Voncdk/, ausführennpm install, exportieren Sie die in Abschnitt 9 gedruckten Variablen (ENDPOINT_NAME,,,BUCKET,PREFIX,BASELINE_KEY,CAPTURE_PREFIX,GROUND_TRUTH_KEY, optionalSNS_TOPIC_ARN) MLFLOW_TRACKING_URI MLFLOW_EXPERIMENTFEATURE_COLUMNS, und führen Sie dann aus bash scripts/deploy.sh (wird cdk bootstrap automatisch ausgeführt).

Aktivieren Sie EventBridge S3-Benachrichtigungen im Bucket und fügen Sie S3-Trigger hinzu: Datendrift s3:ObjectCreated:* nach ${PREFIX}/data-capture/ unten, Modellqualität nach unten${PREFIX}/data/ground_truth/.

aws s3api put-bucket-notification-configuration \ --bucket <your-sagemaker-bucket> \ --notification-configuration '{"EventBridgeConfiguration": {}}'

Das Lambda-Modell alarmiert per SNS, wenn eine Metrik ihren Schwellenwert unterschreitet (Standardwerte: F1 0,70, Genauigkeit 0,80, ROC AUC 0,75; Überschreibung mit,,). THRESHOLD_F1 THRESHOLD_ACCURACY THRESHOLD_ROC_AUC

Das Lambda-Modell alarmiert per SNS, wenn eine Metrik ihren Schwellenwert unterschreitet (Standardwerte: F1 0,70, Genauigkeit 0,80, ROC AUC 0,75; Überschreibung mit,,). THRESHOLD_F1 THRESHOLD_ACCURACY THRESHOLD_ROC_AUC

Als einfache Alternative auf einem vorhandenen Endpunkt bietet die Lösung Real-Time Inference Monitoring with Eviently AI + SNS einen einzelnen FrameworkProcessor Verarbeitungsschritt (EvidentlyMonitoring) sowie einen EventBridge Scheduler und ein SNS-Thema, ohne Data Lake oder Dashboard. Es handelt sich um einen Verweis auf Abschnitt 8 von Notizbuch 06 im Amazon-Workshop „Von der Idee zur Produktion“. Bei Überschreitung (Standardeinstellung) oder bei konfigurierter Abweichung werden Warnmeldungen ausgelöst. drifted_columns_share DriftThreshold 0.05 CriticalFeatures

Ersetzt die Überwachung der Datenqualität

Die Datenqualitätsüberwachung von Model Monitor erkennt statistische Abweichungen bei den Eingabemerkmalen, indem Live-Inferenzdaten mit einer Basislinie aus Trainingsdaten verglichen werden. Es berechnet Statistiken (Mittelwert, Standardabweichung, Minimum, Maximum, eindeutige Anzahl) und überprüft Einschränkungen (Datentyp, Vollständigkeit, Wertebereiche) mithilfe einer Deequ-based Engine, die bei geplanten Verarbeitungsjobs läuft.

Option 1: Open-source Lösungen mit Eviently AI

Die Überwachungslösungen verwenden KI von Eviently, DataDriftPreset um Merkmalsdrift zu erkennen und berechnen PSI- (Population Stability Index) und KS-Statistiken für jedes Merkmal. Die Trainingsbasisdaten werden als Referenzdatensatz und aktuelle Inferenzdaten als aktueller Datensatz gelesen. Die Batch- und Endpunktlösungen werden außerdem ausgeführtDataSummaryPreset, um Datenqualitätsprobleme (fehlende Werte, Ausreißer, Integritätsprüfungen) aufzudecken, was den Einschränkungsprüfungen von Model Monitor sehr ähnlich ist. Drift-Scores werden mit konfigurierbaren Schwellenwerten verglichen, zusammen mit den Trainingsmetriken in einer SageMaker KI-MLflow-App protokolliert und als interaktive HTML-Berichte angezeigt.

Dieser Ersatz ist hochgradig skalierbar und vollständig anpassbar:

  • Skalierbar: Compute skaliert im Leerlauf auf Null. EventBridge-triggered Lambda führt Drift-Analysen nach einem Zeitplan durch, und die Athena Iceberg-Tabellenpartitionierung hält die Scankosten niedrig, wenn das Datenvolumen wächst. High-volume Bereitstellungen werden linear ohne reservierte Kapazität skaliert.

  • Individuell anpassbar: Sie steuern die Drift-Voreinstellungen, Schwellenwerte pro Funktion, Lookback-Fenster und den Zeitplan über eine zentrale Zentrale. config.yaml Sie können domänenspezifische Drifttests hinzufügen, die über den PSI hinausgehen (z. B. Geschäftskennzahlen wie Änderungen der Genehmigungsrate).

  • Einheitliche Abstammung: Drift-Metriken werden zusammen mit Trainingsmetriken in derselben SageMaker KI-MLflow-App gespeichert, sodass eine vollständige Modellherkunft und eine Drift-Trendanalyse möglich sind.

Detaillierte Einrichtungsschritte finden Sie in den SageMaker Open-Source-AI-Überwachungslösungen von Amazon. Die QuickSight-based Echtzeitlösung wird im Meta-Monitoring Abschnitt Inferenz weiter unten beschrieben.

Option 2: CloudWatch Benutzerdefinierte Amazon-Metriken + Erkennung von Anomalien

Für eine einfache Überwachung der Datenqualität ohne die gesamte Überwachungspipeline können Sie benutzerdefinierte Messwerte veröffentlichen CloudWatch und Alarme zur Erkennung von Anomalien verwenden. Eine ausführliche Anleitung finden Sie unter Verwenden der CloudWatch Anomalieerkennung.

Ersetzt die Qualitätsüberwachung des Modells

Die Modellqualitätsüberwachung von Model Monitor überwacht die Genauigkeit der Vorhersagen, indem Ground-Truth-Labels aus S3 mit Endpunktvorhersagen zusammengeführt und Metriken (Genauigkeit, Präzision, Rückruf, F1, AUC, RMSE, MAE) nach einem Zeitplan berechnet werden.

Option 1: Open-source Lösungen mit Eviently AI

Die Überwachungslösungen verwenden künstliche Intelligenz von Eviently ClassificationPreset zur BerechnungROC-AUC, Präzisierung, Erinnerung, F1 und der Konfusionsmatrix, wann immer Ground Truth verfügbar ist. Zu den Lösungen gehört ein Muster, mit dem verzögerte Ground-Truth-Prognosen mit Vorhersagen anhand von Inferenz-ID abgeglichen werden. Dadurch wird die tatsächliche Latenz bei der Kennzeichnung berücksichtigt, die die Überwachung der Modellqualität erschwert.

Option 2: benutzerdefinierte Metriken CloudWatch

Veröffentlichen Sie Kennzahlen zur Modellqualität CloudWatch , sobald Ground Truth verfügbar ist.

Ersetzt die Überwachung von Verzerrungen

Die Überwachung der Verzerrungsabweichung von Model Monitor erkennt Veränderungen der Fairness-Metriken im Laufe der Zeit, indem Live-Prognosen mit einer Verzerrungs-Basislinie für geschützte Attribute verglichen werden.

Segment-sliced Metriken mit Eviently AI, die in MLflow protokolliert wurden und QuickSight

Verfolgen Sie Vorurteile, indem Sie Leistungs- und Ergebniskennzahlen pro Segment mit geschützten Attributen (z. B. von genderage_band, oderregion) berechnen und sie mit den Trainingsbasiswerten vergleichen. Das Gleiche, das offensichtlich für die Modellqualität ClassificationPreset verwendet wird, wird pro Segment berechnet, und die daraus resultierenden segmentspezifischen Kennzahlen (Auswahlrate, true/false positive Raten precision/recall) werden in der SageMaker KI MLflow App protokolliert und im Governance-Dashboard angezeigt. QuickSight

Definieren Sie Ihre eigenen Fairness-Schwellenwerte (z. B. die maximal zulässige Lücke bei der Auswahlrate oder die tatsächliche Positivrate zwischen Segmenten) und benachrichtigen Sie über Amazon SNS, wenn eine Lücke den Schwellenwert überschreitet. Verwenden Sie dabei dasselbe EventBridge + Lambda-Muster wie bei den Daten- und Modellqualitätsmonitoren. Da alles Open Source ist und in Ihrem Konto läuft, kontrollieren Sie, welche Attribute überwacht werden und welche Fairnessdefinitionen gelten.

Inferenz-Metaüberwachung mit Amazon QuickSight (Echtzeit- und prädiktive Überwachung)

Prädiktive Modelle können sich in der Produktion unbemerkt verschlechtern. Bei Betrugsfällen kommt es immer häufiger zu Fehlalarmen, Kreditsachbearbeiter sehen Anträge, die hätten gemeldet werden müssen, und Planer haben aufgrund der überschätzten Nachfrage am Ende einen Überschuss an Lagerbeständen. Meta-monitoring gibt den Teams kontinuierliches Feedback zur Leistung des Produktionsmodells und warnt sie, sobald die Modellqualität oder Datenabweichungen auftreten, sodass sie Modelle proaktiv aktualisieren können.

Diese Lösung kombiniert AWS verwaltete Services (Amazon SageMaker AI, Amazon Athena, AWS Lambda, Amazon SQS, Amazon SNS, Amazon, Amazon QuickSight) mit Open-Source-ML-Tools (SageMaker AI MLflow Apps EventBridge, Eviently AI), um ein produktionsbereites Überwachungssystem zu schaffen. Im Repository für Überwachungslösungen handelt es sich um die Lösung Real-Time Inference Monitoring with QuickSight Dashboards. Die komplette Referenzimplementierung befindet sich unter sample-mlops-bestpractices und verwendet ein Modell zur Erkennung von Kreditkartenbetrug (XGBoost) als praktisches Beispiel. Sie implementiert eine 11-stufige Architektur, die eine Schulungspipeline, Inferenzüberwachung und ein Governance-Dashboard umfasst. Drei geführte Notizbücher steuern den Arbeitsablauf.

Voraussetzungen:

  • Eine SageMaker KI-Domain mit einem MLflow-Tracking-Server.

  • Eine SageMaker Ausführungsrolle mit Berechtigungen für S3, Athena, Lambda, SQS, SNS und EventBridge (das Repo enthält die genauen Inline-IAM-Richtlinien und/Helper). create_or_update_sagemaker_role create_lambda_role

  • Ein S3-Bucket für die Datenspeicherung.

  • Python 3.12+ und der uv Paketmanager (für den script/CLI Pfad); ein QuickSight Enterprise-Abonnement für das Governance-Dashboard.

Wählen Sie einen Setup-Pfad:

Option A (empfohlen für neue Benutzer): Wenn Sie keine SageMaker Domain haben, stellen Sie die CloudFormation Vorlage in bereitcloudformation/. Sie stellt die SageMaker Domain, das Benutzerprofil, den JupyterLab Speicherplatz, den MLFlow-Tracking-Server, den S3-Bucket und die unterstützende VPC bereit, klont das Repo automatisch und schreibt eine Datei, die beim ersten Start ausgefüllt wird. .env

Option B (bestehende Domains): Wenn Sie bereits eine SageMaker Domain mit einem MLflow-Tracking-Server haben, klonen Sie das Repo und füllen Sie es manuell aus. JupyterLab .env

Einrichtung

Richten Sie eine Schulung ein, um sich auf die Überwachung vorzubereiten. Sie können alles von den drei Notebooks in SageMaker Studio aus steuern oder die entsprechenden CLI-Befehle verwenden (jede Notebook-Zelle ist einem python main.py ... Befehl für zugeordnet CI/CD). Wenn Sie das Beispiel von Anfang bis Ende ausführen, müssen Sie es nicht bearbeitenconfig.yaml. Das Ausfüllen .env und Verwenden der Standardwerte funktioniert. Wenn Sie bereits ein Modell bereitgestellt haben, passen Sie die Trainingspipeline an Ihre eigenen Schritte an und stellen Sie sicher, dass der Inferenzendpunkt die Prognosedatensätze an Amazon SQS weiterleitet.