View a markdown version of this page

Optimierte generative KI-Inferenzempfehlungen - Amazon SageMaker KI

Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.

Optimierte generative KI-Inferenzempfehlungen

Amazon SageMaker AI unterstützt jetzt Inferenzempfehlungen, eine Funktion, die manuelle Optimierung und Benchmarking überflüssig macht, um eine optimale Inferenzleistung zu erzielen. Anstatt manuell Kombinationen von GPU-Instance-Typen, Servercontainern, Parallelitätsstrategien und Optimierungstechniken zu testen, geben Sie Ihr Modell und Ihre Workload-Anforderungen an, und die SageMaker KI gibt validierte, einsatzbereite Konfigurationen mit echten Leistungskennzahlen zurück.

Inferenzempfehlungen analysieren die Architektur Ihres Modells, schränken den Konfigurationsraum ein und wenden zielgerichtete Optimierungen an, wie z. B. spekulative Dekodierung für den Durchsatz und Kernel-Tuning für Latenz. Indem Sie mehrere Instance-Typen evaluieren, können Sie die Option mit dem besten Preis-Leistungs-Verhältnis für Ihre Arbeitslast auswählen. Jede Konfiguration wird anhand einer echten GPU-Infrastruktur verglichen, sodass Sie die Bereitstellung mit Zuversicht durchführen und Ihre Inferenzausgaben richtig einplanen können.

Funktionsweise

Der Einstieg in Inferenzempfehlungen ist einfach, egal ob über SageMaker AI Studio oder die KI-APIs. SageMaker Die folgenden Schritte beschreiben den Arbeitsablauf.

  1. Bereiten Sie Ihr Modell vor. Verweisen Sie auf Modellartefakte in Amazon S3 oder der SageMaker AI Model Registry. Inferenzempfehlungen unterstützen das HuggingFace Checkpoint-Format mit SafeTensor Gewichtungen, einschließlich Basismodellen und benutzerdefinierter oder fein abgestimmter Modelle.

  2. Definieren Sie Ihre Arbeitslast. Beschreiben Sie Ihre erwarteten Verkehrsmuster, einschließlich Eingabe- und Ausgabe-Token-Verteilungen und Parallelitätsstufen. Sie können Inline-Spezifikationen oder einen repräsentativen Datensatz aus Amazon S3 verwenden.

  3. Setze dein Ziel. Wählen Sie ein einziges Leistungsziel: Kostenoptimierung, Minimierung der Latenz oder Maximierung des Durchsatzes. Wählen Sie bis zu drei Instanztypen zum Vergleich aus.

  4. Überprüfen Sie die Ergebnisse. SageMaker KI gibt validierte Konfigurationen mit echten Leistungskennzahlen zurück: Time to First Token (TTFT), Latenz zwischen den Token, Latenz bei Anfragen bei P50/P90/P99, Durchsatz und Kosten pro Konfiguration. Jede Konfiguration ist einsatzbereit.

  5. Bereitstellen. Stellen Sie die gewählte Konfiguration mit einer einzigen Aktion von SageMaker SageMaker AI Studio oder programmgesteuert über die API auf einem KI-Inferenzendpunkt bereit.

Sie können auch bestehende Produktionsendpunkte mit einem Benchmark vergleichen, um die aktuelle Leistung zu überprüfen oder sie mit neuen Konfigurationen zu vergleichen.

Anwendungsfälle

Im Folgenden sind gängige Anwendungsfälle für Inferenzempfehlungen aufgeführt.

  • Pre-deployment Validierung. Optimieren Sie ein neues Modell und vergleichen Sie es, bevor Sie sich für eine Produktionsbereitstellung entscheiden. Überprüfen Sie die Leistung des Modells, bevor Sie in die Skalierung investieren.

  • Regressionstests nach Aktualisierungen. Überprüfen Sie die Leistung nach einem Container-Update, einem Framework-Upgrade oder einer Veröffentlichung der Serverbibliothek. Vergewissern Sie sich, dass Ihre Konfiguration immer noch optimal ist, bevor Sie zur Produktion übergehen.

  • Right-sizing wenn sich die Bedingungen ändern. Wenn sich die Verkehrsmuster ändern oder neue Instance-Typen verfügbar werden, führen Sie die Inferenzempfehlungen innerhalb von Stunden erneut aus, anstatt einen wochenlangen manuellen Prozess neu zu starten.

  • Vergleich der Modelle. Vergleichen Sie die Leistung und die Kosten verschiedener Modellvarianten verschiedener Instance-Typen, um vor der Produktionsbereitstellung eine fundierte Auswahl zu treffen.

  • Kostenoptimierung Vergleichen Sie bestehende Produktionsendpunkte, um zu erkennen, ob die Infrastruktur überlastet ist. Verwenden Sie die Ergebnisse, um die richtige Größe zu ermitteln und die Ausgaben für wiederkehrende Inferenzen zu reduzieren.

Preisgestaltung

Für Inferenzempfehlungen fallen keine zusätzlichen Servicegebühren an. Sie können bestehende ML-Reservierungen (flexible Schulungspläne) ohne zusätzliche Rechenkosten verwenden oder On-Demand-Rechenleistung verwenden, die automatisch bereitgestellt wird.

Unterstützte Regionen

Inferenzempfehlungen sind in den folgenden AWS Regionen verfügbar:

  • USA Ost (Nord-Virginia)

  • USA Ost (Ohio)

  • USA West (Oregon)

  • Asien-Pazifik (Singapur)

  • Asien-Pazifik (Tokio)

  • Europe (Frankfurt)

  • Europa (Irland)