Mit KI entwickeln

Bereitstellung von Bild- und Videogenerierung mit vLLM-Omni auf SageMaker AI

Ein technischer Leitfaden erläutert, wie die Modelle FLUX.2 und Wan2.1 auf Amazon SageMaker unter Verwendung eines gemeinsamen vLLM-Omni-Containers mit gemischten Inferenzmustern bereitgestellt werden.

Automatisch aus dem englischen Original übersetzt.

Amazon Web Services hat am 28. September 2026 ein technisches Tutorial veröffentlicht, das zeigt, wie Bilder generiert und in Videos animiert werden können, indem Amazon SageMaker AI genutzt wird. Der Leitfaden beschreibt die Bereitstellung zweier spezifischer generativer Modelle, FLUX.2-klein-4B und Wan2.1-VACE-1.3B, unter Verwendung des AWS vLLM-Omni Deep Learning Containers zur Handhabung sowohl von Echtzeit- als auch von asynchronen Workloads innerhalb einer einheitlichen Infrastruktur.

Was passiert ist

Die Veröffentlichung skizziert einen Workflow, der eine Texteingabeaufforderung (Prompt) in ein Standbild umwandelt und dieses Bild anschließend in einen kurzen Videoclip animiert. Dieser Prozess stützt sich auf zwei unterschiedliche Endpunkte, die aus derselben festgelegten Version des AWS vLLM-Omni Deep Learning Containers (DLC) bereitgestellt werden. Der erste Endpunkt übernimmt die Bildgenerierung unter Verwendung des Modells FLUX.2-klein-4B, während der zweite die Videogenerierung mit dem Modell Wan2.1-VACE-1.3B verwaltet. Durch die Nutzung eines einzigen Container-Images für beide Aufgaben reduziert die Architektur die Varianz im Serving-Stack und ermöglicht es jedem Modell, auf Instanztypen zu laufen, die für seine spezifischen Rechenanforderungen optimiert sind.

Das Tutorial unterscheidet zwischen den für jede Aufgabe erforderlichen Inferenzmustern. Die Bildgenerierung erfolgt über einen SageMaker AI-Echtzeitendpunkt, der das generierte PNG direkt an den Client zurückgibt. Im Gegensatz dazu nutzt die Videogenerierung einen SageMaker Asynchronous Inference-Endpunkt. Dieser Ansatz ist notwendig, da die Videoerstellung ein länger laufender Vorgang ist, der größere Nutzlasten umfasst. Der asynchrone Endpunkt schreibt die finale MP4-Datei in Amazon Simple Storage Service (Amazon S3), sodass der Client das Ergebnis abfragen kann, anstatt eine Verbindung offen zu halten.

Diese Veröffentlichung dient als zweiter Teil einer Serie, die spezialisierte AWS DLCs untersucht. Während der vorherige Beitrag sich auf die Echtzeit-Sprachverarbeitung mittels bidirektionalem Streaming konzentrierte, isoliert dieser Leitfaden die Bild- und Videogenerierung, um die Unterschiede bei den Payloads und Antwortmechanismen zu verdeutlichen. Die bereitgestellte Lösung umfasst sowohl einen Workflow über die Befehlszeilenschnittstelle als auch eine Streamlit-Anwendung, die es Entwicklern ermöglicht, die End-to-End-Pipeline von der Texteingabeaufforderung bis zum animierten Video zu testen.

Wie es funktioniert

Die Kerntechnologie, die diesen Workflow ermöglicht, ist der AWS vLLM-Omni DLC, der das vLLM-Framework über die Textgenerierung hinaus erweitert, um Audio, Bilder und Videos über OpenAI-kompatible APIs zu unterstützen. Der Container enthält Routing-Middleware, die den CustomAttributes-Header in eingehenden Anfragen liest und den Datenverkehr an die entsprechende vLLM-Omni-Route weiterleitet. Für das Bildmodell werden Anfragen an /v1/images/generations geleitet, während Videoanfragen an /v1/videos/sync gehen. Diese Abstraktion ermöglicht es Entwicklern, mit komplexen multimodalen Modellen unter Verwendung vertrauter API-Strukturen zu interagieren.

Der Datenfluss beginnt, wenn die Anwendung eine Texteingabeaufforderung an den FLUX.2-klein-Endpunkt sendet. Das Modell gibt ein base64-kodiertes PNG zurück, das die Anwendung dann auf die Zielvideomaße skaliert und in eine kompakte JPEG-Daten-URL umwandelt. Dieses Referenzbild wird in eine Multipart-Anfrage für das Wan VACE-Videomodell eingebettet. Da die Nutzlast die Grenze von 128.000 Bytes für inline asynchrone Bodies überschreitet, lädt die Anwendung die Anfrage zu Amazon S3 hoch und stellt dem SageMaker-Endpunkt den Speicherort bereit. Der Endpunkt verarbeitet den Job, schreibt die resultierende MP4-Datei in einen definierten S3-Ausgabespeicherort, und der Client ruft die Datei ab, sobald die Generierung abgeschlossen ist.

Wichtige Details

  • Die Lösung verwendet das festgelegte DLC-Image omni-sagemaker-cuda-v1.6 für beide Endpunkte.
  • Die Bildgenerierung läuft auf einem ml.g6.xlarge-Instanztyp über einen Echtzeitendpunkt.
  • Die Videogenerierung läuft auf einem ml.g6e.xlarge-Instanztyp über einen asynchronen Endpunkt.
  • Das Wan VACE-Modell nutzt Variational Autoencoder (VAE)-Tiling, um den Spitzenverbrauch des Arbeitsspeichers während des Decodings zu reduzieren.
  • Standardmäßige Videoeinstellungen erzeugen 17 Frames unter Verwendung von 30 Diffusionsschritten zur Qualitätserhaltung.
  • Erfolgreiche Antworten und Aufruffehler werden unter separaten Amazon S3-Präfixen gespeichert.

Warum das wichtig ist

Für Engineering-Teams, die generative Medienanwendungen entwickeln, bietet dieses Muster eine klare Blaupause für das Management von Workloads mit gemischter Latenz. Die Nutzung von Echtzeit-Inferenz für schnelle Aufgaben wie die Bildgenerierung stellt sofortiges Feedback sicher, während asynchrone Inferenz Timeouts und Ressourcenkonkurrenz bei langsamerer Video-Rendering verhindert. Diese Trennung ermöglicht es Systemen, effizienter zu skalieren, da jeder Endpunkt unabhängig basierend auf seinen spezifischen Latenz- und Durchsatzanforderungen tuned werden kann.

Darüber hinaus vereinfacht die Nutzung eines gemeinsamen Container-Images den operativen Overhead. Die Wartung einer einzelnen DLC-Version über mehrere Modelle hinweg reduziert die Komplexität des Dependency-Managements und des Security-Patchings. Entwickler können Modelle austauschen oder aktualisieren, indem sie die Umgebungsvariable SM_VLLM_MODEL ändern, ohne die zugrunde liegende Serving-Infrastruktur neu aufzubauen. Diese Modularität unterstützt schnelles Experimentieren mit verschiedenen Modellfamilien, während die Produktionsumgebung stabil bleibt.

Was Sie tun können

  • Klonen Sie das Repository sagemaker-genai-hosting-examples von GitHub, um auf den Beispielcode zuzugreifen.
  • Stellen Sie sicher, dass Ihr AWS-Konto über Quotas für ml.g6.xlarge- und ml.g6e.xlarge-Instanzen in Ihrer Zielregion verfügt.
  • Konfigurieren Sie eine SageMaker-Ausführungsrolle mit Berechtigungen für den Zugriff auf Amazon S3 und die Erstellung von Endpunkten.
  • Führen Sie das bereitgestellte Skript deploy.py aus, um die Echtzeit- und asynchronen Endpunkte bereitzustellen.
  • Verwenden Sie das Befehlszeilentool generate.py, um die Pipeline mit benutzerdefinierten Text- und Bewegungs-Prompts zu testen.
  • Starten Sie die enthaltene Streamlit-Anwendung, um den Workflow von Bild zu Video in einer Browseroberfläche zu visualisieren.

Tools aus dem Bytechap-Shop

$89

DocBento

Selbst gehostetes Dokumentenmanagement, das jeden Scan liest und mit Seitenzitaten antwortet.

Live-Demo

Weiterlesen

Alle Artikel