vLLM-Omni を SageMaker AI で使用した画像および動画生成のデプロイ
Amazon SageMaker で FLUX.2 および Wan2.1 モデルを、混在推論パターンに対応した共有 vLLM-Omni コンテナを使用してデプロイする方法を解説する技術ガイドです。
英語の原文から自動翻訳されました。
Amazon Web Services は 2026 年 9 月 28 日に、Amazon SageMaker AI を使用して画像を生成し、それを動画にアニメーション化する方法を示す技術チュートリアルを公開しました。このガイドでは、AWS vLLM-Omni ディープラーニングコンテナを活用し、統一されたインフラストラクチャ内でリアルタイムワークロードと非同期ワークロードの両方を処理しながら、FLUX.2-klein-4B と Wan2.1-VACE-1.3B という 2 つの特定の生成モデルをデプロイする方法を詳しく説明しています。
何が起きたか
この出版物は、テキストプロンプトを静止画に変換し、続いてその画像を短い動画クリップにアニメーション化するワークフローを紹介しています。このプロセスは、固定バージョンの AWS vLLM-Omni ディープラーニングコンテナ (DLC) からデプロイされた 2 つの異なるエンドポイントに依存しています。最初のエンドポイントは FLUX.2-klein-4B モデルを使用して画像生成を処理し、2 番目のエンドポイントは Wan2.1-VACE-1.3B モデルを使用して動画生成を管理します。両方のタスクで単一のコンテナイメージを使用することで、サービングスタックの変動を減らしつつ、各モデルが特定の計算ニーズに最適化されたインスタンスタイプで動作できるようにしています。
チュートリアルでは、各タスクに必要な推論パターンの違いを区別しています。画像生成は、生成された PNG をクライアントに直接返す SageMaker AI リアルタイムエンドポイントを介して処理されます。対照的に、動画生成は SageMaker 非同期推論エンドポイントを使用します。動画作成はより長い実行時間がかかり、ペイロードも大きくなるため、このアプローチが必要になります。非同期エンドポイントは最終的な MP4 ファイルを Amazon Simple Storage Service (Amazon S3) に書き込み、クライアントは接続を開いたままにするのではなく、結果をポーリングできるようになります。
今回のリリースは、専門的な AWS DLC を探求するシリーズの第 2 部として位置づけられています。前回のパートでは双方向ストリーミングを使用したリアルタイム音声処理に焦点が当てられていましたが、今回のガイドでは画像および動画生成に特化し、ペイロードと応答メカニズムの違いを明確にしています。提供されるソリューションには、コマンドラインインターフェースワークフローと Streamlit アプリケーションの両方が含まれており、開発者はテキストプロンプトからアニメーション動画までのエンドツーエンドのパイプラインをテストできます。
仕組み
このワークフローを支える中核技術は AWS vLLM-Omni DLC です。これは vLLM フレームワークをテキスト生成を超えて拡張し、OpenAI 互換 API を通じてオーディオ、画像、動画をサポートします。コンテナにはルーティングミドルウェアが含まれており、受信リクエスト内の CustomAttributes ヘッダーを読み取り、トラフィックを適切な vLLM-Omni ルートへ転送します。画像モデルの場合、リクエストは /v1/images/generations にルーティングされ、動画リクエストは /v1/videos/sync に送信されます。この抽象化により、開発者は慣れ親しんだ API 構造を使って複雑なマルチモーダルモデルとやり取りできます。
データフローは、アプリケーションがテキストプロンプトを FLUX.2-klein エンドポイントに送信することから始まります。モデルは base64 でエンコードされた PNG を返し、アプリケーションはこれをターゲット動画サイズに合わせてリサイズし、コンパクトな JPEG データ URL に変換します。この参照画像は、Wan VACE 動画モデル向けのマルチパートリクエストに埋め込まれます。ペイロードがインライン非同期ボディの 128,000 バイト制限を超えるため、アプリケーションはリクエストを Amazon S3 にアップロードし、その場所を SageMaker エンドポイントに提供します。エンドポイントはジョブを処理し、結果の MP4 を指定された S3 出力場所に書き込み、クライアントは生成完了後にファイルを取得します。
主要な詳細
- このソリューションは、両方のエンドポイントで
omni-sagemaker-cuda-v1.6の固定 DLC イメージを使用します。 - 画像生成は、リアルタイムエンドポイントを介して
ml.g6.xlargeインスタンスタイプで実行されます。 - 動画生成は、非同期エンドポイントを介して
ml.g6e.xlargeインスタンスタイプで実行されます。 - Wan VACE モデルは、デコーディング中のピークメモリを削減するために変分オートエンコーダー (VAE) ティリングを使用します。
- デフォルトの動画設定では、品質保持のため 30 ステップの拡散過程を用いて 17 フレームを生成します。
- 成功した応答と呼び出し失敗は、それぞれ別の Amazon S3 プレフィックス下に保存されます。
なぜ重要なのか
生成メディアアプリケーションを構築するエンジニアリングチームにとって、このパターンは混合レイテンシーワークロードを管理するための明確な青写真を提供します。画像生成のような高速タスクにはリアルタイム推論を使用することで即時のフィードバックを保証し、遅い動画レンダリングには非同期推論を使用することでタイムアウトやリソース競合を防ぎます。この分離により、システムはより効率的にスケール可能になり、各エンドポイントを固有のレイテンシー要件とスループット要件に基づいて独立してチューニングできます。
さらに、共有コンテナイメージの使用により運用オーバーヘッドが簡素化されます。複数のモデル間で単一の DLC バージョンを維持することで、依存関係管理とセキュリティパッチ適用の複雑さが軽減されます。開発者は、基盤となるサービングインフラストラクチャを再ビルドせずに SM_VLLM_MODEL 環境変数を変更することで、モデルの交換や更新が可能です。このモジュール性により、本番環境の安定性を保ちながら、異なるモデルファミリーでの迅速な実験が可能になります。
やれること
- GitHub から
sagemaker-genai-hosting-examplesリポジトリをクローンしてサンプルコードにアクセスしてください。 - AWS アカウントが対象リージョンで
ml.g6.xlargeおよびml.g6e.xlargeインスタンスのクォータを持っていることを確認してください。 - Amazon S3 へのアクセス権限とエンドポイント作成権限を持つ SageMaker 実行ロールを設定してください。
- 提供されている
deploy.pyスクリプトを実行して、リソースのプロビジョニングを行ってください。

