Xây dựng với AI

Triển khai tạo ảnh và video với vLLM-Omni trên SageMaker AI

Hướng dẫn kỹ thuật chi tiết cách triển khai các mô hình FLUX.2 và Wan2.1 trên Amazon SageMaker bằng cách sử dụng container vLLM-Omni chung với các mẫu suy luận hỗn hợp.

Được dịch tự động từ bản gốc tiếng Anh.

Amazon Web Services đã phát hành một hướng dẫn kỹ thuật vào ngày 28 tháng 9 năm 2026, minh họa cách tạo ảnh và chuyển đổi chúng thành video bằng Amazon SageMaker AI. Hướng dẫn này trình bày chi tiết việc triển khai hai mô hình tạo sinh cụ thể là FLUX.2-klein-4B và Wan2.1-VACE-1.3B, sử dụng AWS vLLM-Omni Deep Learning Container để xử lý cả khối lượng công việc thời gian thực và bất đồng bộ trong một hạ tầng thống nhất.

Điều gì đã xảy ra

Bài viết phác thảo một quy trình làm việc biến lời nhắc văn bản (text prompt) thành một bức ảnh tĩnh, sau đó hoạt hóa bức ảnh đó thành một đoạn video ngắn. Quy trình này dựa vào hai endpoint riêng biệt được triển khai từ cùng một phiên bản cố định của AWS vLLM-Omni Deep Learning Container (DLC). Endpoint đầu tiên xử lý việc tạo ảnh bằng mô hình FLUX.2-klein-4B, trong khi endpoint thứ hai quản lý việc tạo video bằng mô hình Wan2.1-VACE-1.3B. Bằng cách sử dụng một hình ảnh container duy nhất cho cả hai tác vụ, kiến trúc này giảm thiểu sự khác biệt trong stack phục vụ (serving stack), đồng thời cho phép mỗi mô hình chạy trên các loại instance được tối ưu hóa cho nhu cầu tính toán cụ thể của chúng.

Hướng dẫn phân biệt rõ các mẫu suy luận cần thiết cho từng tác vụ. Việc tạo ảnh được xử lý qua endpoint thời gian thực của SageMaker AI, trả về trực tiếp file PNG đã tạo cho client. Ngược lại, việc tạo video sử dụng endpoint SageMaker Asynchronous Inference. Cách tiếp cận này là cần thiết vì quá trình tạo video là một thao tác chạy dài hơn và liên quan đến các payload lớn hơn. Endpoint bất đồng bộ sẽ ghi file MP4 cuối cùng vào Amazon Simple Storage Service (Amazon S3), cho phép client kiểm tra kết quả theo chu kỳ thay vì giữ kết nối mở.

Bản phát hành này là phần thứ hai trong loạt bài khám phá các DLC chuyên biệt của AWS. Trong khi phần trước tập trung vào xử lý giọng nói thời gian thực sử dụng streaming hai chiều, hướng dẫn này tách biệt việc tạo ảnh và video để làm rõ sự khác nhau về payload và cơ chế phản hồi. Giải pháp được cung cấp bao gồm cả quy trình làm việc giao diện dòng lệnh (CLI) và một ứng dụng Streamlit, giúp các nhà phát triển thử nghiệm toàn bộ pipeline từ lời nhắc văn bản đến video hoạt hóa.

Cách thức hoạt động

Công nghệ cốt lõi hỗ trợ quy trình làm việc này là AWS vLLM-Omni DLC, mở rộng framework vLLM vượt ra ngoài việc tạo văn bản để hỗ trợ âm thanh, hình ảnh và video thông qua các API tương thích với OpenAI. Container bao gồm middleware định tuyến đọc header CustomAttributes trong các yêu cầu gửi đến và chuyển tiếp lưu lượng truy cập đến route vLLM-Omni phù hợp. Đối với mô hình ảnh, các yêu cầu được định tuyến tới /v1/images/generations, trong khi các yêu cầu video đi tới /v1/videos/sync. Sự trừu tượng hóa này cho phép các nhà phát triển tương tác với các mô hình đa phương thức phức tạp bằng cách sử dụng cấu trúc API quen thuộc.

Luồng dữ liệu bắt đầu khi ứng dụng gửi một lời nhắc văn bản tới endpoint FLUX.2-klein. Mô hình trả về một file PNG được mã hóa base64, mà ứng dụng sau đó sẽ thay đổi kích thước để khớp với kích thước video mục tiêu và chuyển đổi thành một data URL JPEG gọn nhẹ. Hình ảnh tham chiếu này được nhúng vào một yêu cầu multipart cho mô hình video Wan VACE. Vì payload vượt quá giới hạn 128.000 byte đối với body bất đồng bộ inline, ứng dụng tải lên yêu cầu vào Amazon S3 và cung cấp vị trí cho endpoint SageMaker. Endpoint xử lý job, ghi file MP4 kết quả vào một vị trí đầu ra S3 chỉ định, và client sẽ lấy file này khi quá trình tạo hoàn tất.

Chi tiết chính

  • Giải pháp sử dụng hình ảnh DLC phiên bản cố định omni-sagemaker-cuda-v1.6 cho cả hai endpoint.
  • Việc tạo ảnh chạy trên loại instance ml.g6.xlarge thông qua endpoint thời gian thực.
  • Việc tạo video chạy trên loại instance ml.g6e.xlarge thông qua endpoint bất đồng bộ.
  • Mô hình Wan VACE sử dụng kỹ thuật tiling variational autoencoder (VAE) để giảm bộ nhớ đỉnh trong quá trình giải mã.
  • Các cài đặt video mặc định tạo ra 17 khung hình sử dụng 30 bước khuếch tán (diffusion steps) để bảo toàn chất lượng.
  • Các phản hồi thành công và lỗi gọi dịch vụ được lưu trữ dưới các prefix Amazon S3 riêng biệt.

Tại sao điều này quan trọng

Đối với các nhóm kỹ sư xây dựng ứng dụng truyền thông tạo sinh, mẫu thiết kế này cung cấp một bản thiết kế rõ ràng để quản lý các khối lượng công việc có độ trễ hỗn hợp. Sử dụng suy luận thời gian thực cho các tác vụ nhanh như tạo ảnh đảm bảo phản hồi tức thì, trong khi suy luận bất đồng bộ ngăn chặn tình trạng hết thời gian chờ (timeout) và tranh chấp tài nguyên cho việc render video chậm hơn. Sự tách biệt này cho phép hệ thống mở rộng quy mô hiệu quả hơn, vì mỗi endpoint có thể được tinh chỉnh độc lập dựa trên các yêu cầu cụ thể về độ trễ và thông lượng của nó.

Ngoài ra, việc sử dụng một hình ảnh container chung giúp đơn giản hóa chi phí vận hành. Duy trì một phiên bản DLC duy nhất trên nhiều mô hình làm giảm độ phức tạp của việc quản lý phụ thuộc và vá lỗi bảo mật. Các nhà phát triển có thể hoán đổi hoặc cập nhật mô hình bằng cách thay đổi biến môi trường SM_VLLM_MODEL mà không cần xây dựng lại hạ tầng phục vụ nền tảng. Tính mô-đun này hỗ trợ thử nghiệm nhanh chóng với các họ mô hình khác nhau trong khi vẫn giữ cho môi trường sản xuất ổn định.

Những gì bạn có thể làm

  • Nhân bản repository sagemaker-genai-hosting-examples từ GitHub để truy cập mã mẫu.
  • Đảm bảo tài khoản AWS của bạn có hạn mức (quota) cho các instance ml.g6.xlarge và ml.g6e.xlarge tại khu vực mục tiêu.
  • Cấu hình vai trò thực thi (execution role) SageMaker với quyền truy cập Amazon S3 và tạo endpoint.
  • Chạy script deploy.py được cung cấp để khởi tạo các endpoint thời gian thực và bất đồng bộ.
  • Sử dụng công cụ dòng lệnh generate.py để thử nghiệm pipeline với các lời nhắc văn bản và chuyển động tùy chỉnh.
  • Khởi chạy ứng dụng Streamlit đi kèm để trực quan hóa quy trình từ ảnh sang video trong giao diện trình duyệt.

Công cụ từ cửa hàng Bytechap

$89

DocBento

Hệ thống quản lý tài liệu tự host, có khả năng đọc mọi bản quét và trả lời kèm trích dẫn trang cụ thể.

Demo trực tiếp

Đọc tiếp

Xây dựng với AI

Việc tái tạo mô hình OLMo 3 7B trên TPU tiết lộ các lỗi ẩn trong trình tải dữ liệu

Một nghiên cứu tình huống của Google đã tái tạo thành công mô hình OLMo 3 của AI2 trên các bộ xử lý TPU, khớp với các chỉ số hiệu suất nhưng đồng thời phát hiện ra những lỗi phân mảnh dữ liệu nghiêm trọng khiến việc ghi nhớ dữ liệu bị nhầm lẫn là sự cải thiện.

Tất cả bài viết