Despliegue de generación de imágenes y videos con vLLM-Omni en SageMaker AI
Una guía técnica detalla cómo desplegar los modelos FLUX.2 y Wan2.1 en Amazon SageMaker utilizando un contenedor compartido vLLM-Omni con patrones de inferencia mixtos.
Traducido automáticamente del original en inglés.
Amazon Web Services publicó un tutorial técnico el 28 de septiembre de 2026, demostrando cómo generar imágenes y animarlas en video utilizando Amazon SageMaker AI. La guía detalla el despliegue de dos modelos generativos específicos, FLUX.2-klein-4B y Wan2.1-VACE-1.3B, aprovechando el AWS vLLM-Omni Deep Learning Container para gestionar cargas de trabajo tanto en tiempo real como asíncronas dentro de una infraestructura unificada.
Qué ocurrió
La publicación describe un flujo de trabajo que transforma una indicación de texto (prompt) en una imagen estática y subsequently anima esa imagen en un breve clip de video. Este proceso se basa en dos endpoints distintos desplegados desde la misma versión fijada del AWS vLLM-Omni Deep Learning Container (DLC). El primer endpoint gestiona la generación de imágenes usando el modelo FLUX.2-klein-4B, mientras que el segundo administra la generación de video mediante el modelo Wan2.1-VACE-1.3B. Al utilizar una única imagen de contenedor para ambas tareas, la arquitectura reduce la variabilidad en la pila de servicio, permitiendo que cada modelo opere en tipos de instancia optimizados para sus demandas computacionales específicas.
El tutorial distingue entre los patrones de inferencia requeridos para cada tarea. La generación de imágenes se maneja a través de un endpoint en tiempo real de SageMaker AI, que devuelve el PNG generado directamente al cliente. En contraste, la generación de video utiliza un endpoint de Inferencia Asíncrona de SageMaker. Este enfoque es necesario porque la creación de video es una operación de mayor duración que involucra cargas útiles más grandes. El endpoint asíncrono escribe el archivo MP4 final en Amazon Simple Storage Service (Amazon S3), permitiendo al cliente consultar el resultado en lugar de mantener una conexión abierta.
Este lanzamiento constituye la segunda parte de una serie que explora DLCs especializados de AWS. Mientras que la entrega anterior se centró en el procesamiento de voz en tiempo real mediante streaming bidireccional, esta guía aísla la generación de imágenes y video para aclarar las diferencias en las cargas útiles y los mecanismos de respuesta. La solución proporcionada incluye tanto un flujo de trabajo de interfaz de línea de comandos como una aplicación Streamlit, lo que permite a los desarrolladores probar el pipeline de extremo a extremo desde la indicación de texto hasta el video animado.
Cómo funciona
La tecnología central que habilita este flujo de trabajo es el AWS vLLM-Omni DLC, que extiende el framework vLLM más allá de la generación de texto para soportar audio, imágenes y video a través de APIs compatibles con OpenAI. El contenedor incluye middleware de enrutamiento que lee el encabezado CustomAttributes en las solicitudes entrantes y dirige el tráfico a la ruta adecuada de vLLM-Omni. Para el modelo de imágenes, las solicitudes se enrutan a /v1/images/generations, mientras que las solicitudes de video van a /v1/videos/sync. Esta abstracción permite a los desarrolladores interactuar con modelos multimodales complejos utilizando estructuras de API familiares.
El flujo de datos comienza cuando la aplicación envía una indicación de texto al endpoint FLUX.2-klein. El modelo devuelve un PNG codificado en base64, que la aplicación redimensiona para coincidir con las dimensiones del video objetivo y convierte en una URL de datos JPEG compacta. Esta imagen de referencia se incrusta en una solicitud multipart para el modelo de video Wan VACE. Dado que la carga útil supera el límite de 128.000 bytes para cuerpos asíncronos en línea, la aplicación sube la solicitud a Amazon S3 y proporciona la ubicación al endpoint de SageMaker. El endpoint procesa el trabajo, escribe el MP4 resultante en una ubicación de salida designada en S3, y el cliente recupera el archivo una vez completada la generación.
Detalles clave
- La solución utiliza la imagen DLC fijada
omni-sagemaker-cuda-v1.6para ambos endpoints. - La generación de imágenes se ejecuta en un tipo de instancia
ml.g6.xlargemediante un endpoint en tiempo real. - La generación de video se ejecuta en un tipo de instancia
ml.g6e.xlargemediante un endpoint asíncrono. - El modelo Wan VACE utiliza teselado de autoencoder variacional (VAE) para reducir la memoria pico durante la decodificación.
- La configuración predeterminada de video produce 17 fotogramas utilizando 30 pasos de difusión para preservar la calidad.
- Las respuestas exitosas y los fallos de invocación se almacenan bajo prefijos separados de Amazon S3.
Por qué importa
Para equipos de ingeniería que construyen aplicaciones de medios generativos, este patrón ofrece un plano claro para gestionar cargas de trabajo con latencias mixtas. Utilizar inferencia en tiempo real para tareas rápidas como la generación de imágenes asegura retroalimentación inmediata, mientras que la inferencia asíncrona previene tiempos de espera agotados y contención de recursos para el renderizado de video más lento. Esta separación permite que los sistemas escalen de manera más eficiente, ya que cada endpoint puede ajustarse independientemente según sus requisitos específicos de latencia y rendimiento.
Además, el uso de una imagen de contenedor compartida simplifica la sobrecarga operativa. Mantener una única versión de DLC a través de múltiples modelos reduce la complejidad de la gestión de dependencias y el parcheo de seguridad. Los desarrolladores pueden intercambiar o actualizar modelos cambiando la variable de entorno SM_VLLM_MODEL sin reconstruir la infraestructura de servicio subyacente. Esta modularidad apoya la experimentación rápida con diferentes familias de modelos manteniendo el entorno de producción estable.
Qué puedes hacer
- Clona el repositorio
sagemaker-genai-hosting-examplesdesde GitHub para acceder al código de ejemplo. - Asegúrate de que tu cuenta de AWS tenga cuota para instancias
ml.g6.xlargeyml.g6e.xlargeen tu región objetivo. - Configura un rol de ejecución de SageMaker con permisos para acceder a Amazon S3 y crear endpoints.
- Ejecuta el script
deploy.pyproporcionado para aprovisionar los endpoints en tiempo real y asíncronos. - Usa la aplicación Streamlit incluida para probar el pipeline completo.

