AIで開発する

Condé Nast、マルチモーダルAIで動画検索時間を99%短縮

Condé Nastは、Amazon BedrockとTwelveLabs Marengoを用いたセマンティック検索により、14万本のクリップを対象とした動画発見時間を250分から2分未満に短縮しました。

英語の原文から自動翻訳されました。

Condé NastはAWS Generative AI Innovation Centerと提携し、動画発見プロセスを刷新しました。これにより、タスクあたりの平均検索時間が250分から2分未満へと大幅に短縮されました。このメディア大手は、14万本以上の動画からなるライブラリ全体にマルチモーダル・セマンティック検索システムを導入し、Amazon BedrockとAmazon OpenSearch Serviceを活用して意図に基づく検索を実現しました。

何が起きたか

Vogue、GQ、Vanity Fair、Wiredなどのブランドの編集チームは以前、タイトルや説明といった静的メタデータと手動でのスクラブ操作に頼って動画アセットを探していました。このアプローチは大きな業務負担を生み出しており、キーワード検索では特定できない視覚的または音声的な瞬間を探すためにスタッフが数時間費やす状況が続いていました。また、属人的な知識への依存は単一障害点(SPOF)を生み出し、主要な担当者が不在の際には膨大なアーカイブコンテンツが検索不能になるという問題もありました。

この構造的な非効率性を解消するため、Condé Nastはテキストラベルを超えて動画コンテンツを理解するソリューションをAWSと共同で構築しました。新しいシステムでは、「落ち着いた背景の初心者向けヨガコンテンツ」や「ファッションウィークの舞台裏の瞬間」といった自然言語クエリによる検索が可能になります。視覚要素、音声トラック、トランスクリプトを同時に分析することで、プラットフォームは正確なタイムスタンプ付きで関連クリップを表示し、ファイル全体を視聴する必要をなくします。

2026年5月のベンチマーキングワークショップでは、コンテンツ発見時間の99.2%削減という結果が得られました。同社は生産性の向上と広告主からの依頼への迅速な対応により、年間約80万ドルの運用コスト削減を見込んでいます。Condé Nastのグローバル・シニアディレクター(クリエイティブ最適化担当)であるBilly Keenly氏は、この協業が高度なワークフロー目標を採用するためのビジネスケースを明確にする助けになったと述べています。

仕組み

アーキテクチャは、計算負荷の高い取り込みパイプラインと低遅延のクエリ提供層を分離しており、それぞれ独立してスケーリングできます。動画がAmazon S3にアップロードされると、イベントが発生し、Amazon ECS上のAWS Fargateで実行される取り込みサービスがトリガーされます。このサービスはファイルを検証し、メタデータを抽出した後、動画をセグメントに分割します。各セグメントはAmazon Bedrock経由でTwelveLabs Marengo埋め込みモデルによって非同期に処理され、視覚、音声、トランスクリプトデータにわたる意味論的な情報を捉えたマルチモーダルベクトル埋め込みが生成されます。

これらの埋め込みは耐久性のためにAmazon S3に保存され、高速なk近傍(k-NN)類似性検索のためにAmazon OpenSearch Serviceにインデックス化されます。クエリ側では、ユーザーのリクエストがApplication Load Balancerを通じてフロントエンドサービスに渡され、自然言語がベクトル埋め込みに変換されます。その後、検索サービスはOpenSearchインデックスに対して類似性検索を実行し、Amazon DocumentDBからのメタデータで結果を強化してから、正確なクリップのタイムスタンプをユーザーに返します。

主要な詳細

  • ライブラリの規模: システムは14万本以上の動画をインデックス化し、検索対象としています。
  • パフォーマンス向上: 発見時間はタスクあたり250分から2分未満に短縮されました。
  • コアモデル: TwelveLabs Marengo埋め込みモデルが、視覚、音声、トランスクリプト信号の結合エンコーディングを担当しています。
  • インフラストラクチャ: モデルアクセス用にAmazon Bedrock、ベクトルインデックス用にAmazon OpenSearch Serviceを使用して構築されています。
  • 耐障害性: OpenSearchの同期レプリケーションとDocumentDBの主従レプリカを用いたマルチAZ展開です。
  • コスト影響: 2026年5月のベンチマークに基づき、年間約80万ドルの運用コスト削減が見込まれています。

なぜ重要なのか

検索システムを構築するエンジニアリングチームにとって、このケーススタディはリッチメディアに対するキーワードベースの検索の限界を浮き彫りにします。従来のメタデータは、ファイル名ではなく気分、アクション、コンテキストでコンテンツを記述するユーザーの微妙な意図を捉えきれません。マルチモーダル埋め込みは、テキスト、画像、音声信号が整列する統一された意味空間を作成することでこのギャップを埋め、より直感的かつ正確な発見を可能にします。

取り込みと提供を分離するというアーキテクチャ上の決定は、スケーラビリティにとって極めて重要です。数十万本の動画の埋め込み処理はリソースを大量に消費し、モノリシックに処理するとリアルタイムクエリをブロックする可能性があります。非同期呼び出しとイベント駆動型オーケストレーションを使用することで、Condé Nastはバックフィル操作やシステム更新が編集スタッフ向けのライブ検索体験の可用性やレイテンシに影響を与えないように確保しました。

実践できること

  • 動画や音声検索を含むプロジェクトで、TwelveLabs Marengoのようなマルチモーダル埋め込みモデルを検討してください。
  • 重いバッチ処理がユーザー向けレイテンシに影響しないよう、取り込みパイプラインと提供パイプラインを分離してください。
  • メインアプリケーションのスレッドをブロックすることなく大規模なバックログを処理するために、埋め込み生成に非同期呼び出しを使用してください。
  • より精密な結果を得るために、ベクトル類似性とメタデータフィルタリングを組み合わせたハイブリッド検索戦略を実装してください。
  • セマンティック検索抽象化層を設計する前に、ユーザー調査を行い自然言語クエリのパターンを理解してください。
  • コンピューティングリソースとデータリソースを複数のAvailability Zonesに分散させることで、最初から高可用性を考慮した設計を行ってください。

Bytechapストアのツール

続きを読む

すべての記事