Condé Nast réduit le temps de recherche vidéo de 99 % grâce à l'IA multimodale
Condé Nast a réduit le temps de découverte de vidéos de 250 minutes à moins de deux minutes en utilisant Amazon Bedrock et TwelveLabs Marengo pour une recherche sémantique sur 140 000 extraits.
Traduit automatiquement depuis l'original anglais.
Condé Nast s'est associé au AWS Generative AI Innovation Center pour refondre son processus de découverte de vidéos, réduisant le temps de recherche d'une moyenne de 250 minutes à moins de deux minutes par tâche. Le géant des médias a déployé un système de recherche sémantique multimodale sur sa bibliothèque de plus de 140 000 vidéos, en tirant parti d'Amazon Bedrock et d'Amazon OpenSearch Service pour permettre une récupération basée sur l'intention.
Ce qui s'est passé
Les équipes éditoriales de marques telles que Vogue, GQ, Vanity Fair et Wired dépendaient auparavant du défilement manuel et de métadonnées statiques comme les titres et les descriptions pour localiser les ressources vidéo. Cette approche créait une lourdeur opérationnelle significative, car le personnel passait des heures à chercher des moments visuels ou audio spécifiques que les recherches par mots-clés ne pouvaient pas identifier. La dépendance à la connaissance institutionnelle a également créé des points de défaillance uniques, rendant vastes quantités de contenu archivé introuvables lorsque le personnel clé était indisponible.
Pour remédier à cette inefficacité structurelle, Condé Nast a travaillé avec AWS pour construire une solution capable de comprendre le contenu vidéo au-delà des étiquettes textuelles. Le nouveau système permet aux éditeurs de rechercher en utilisant des requêtes en langage naturel telles que « contenu de yoga pour débutants avec fonds apaisants » ou « coulisses de la fashion week ». En analysant simultanément les éléments visuels, les pistes audio et les transcriptions, la plateforme fait apparaître des extraits pertinents avec des horodatages précis, éliminant ainsi la nécessité de regarder des fichiers entiers.
La mise en œuvre a entraîné une réduction de 99,2 % du temps de découverte de contenu lors d'un atelier d'évaluation en mai 2026. L'entreprise estime des économies opérationnelles annuelles d'environ 800 000 dollars grâce à une productivité accrue et à des délais de réponse plus rapides aux demandes des annonceurs. Billy Keenly, Global Senior Director of Creative Optimization chez Condé Nast, a noté que la collaboration a aidé à clarifier le cas commercial pour l'adoption de ces objectifs avancés de flux de travail.
Comment cela fonctionne
L'architecture sépare le pipeline d'ingestion gourmand en calcul de la couche de service de requêtes à faible latence, permettant à chacun de monter en charge indépendamment. Lorsqu'une vidéo est téléchargée sur Amazon S3, un événement déclenche un service d'ingestion fonctionnant sur Amazon ECS avec AWS Fargate. Ce service valide le fichier, extrait les métadonnées et divise la vidéo en segments. Chaque segment est traité de manière asynchrone via le modèle d'embedding TwelveLabs Marengo via Amazon Bedrock, qui génère des embeddings vectoriels multimodaux capturant la signification sémantique à travers les données visuelles, audio et de transcription.
Ces embeddings sont stockés dans Amazon S3 pour la durabilité et indexés dans Amazon OpenSearch Service pour une recherche rapide de similarité k-plus-proches (k-NN). Du côté des requêtes, les demandes des utilisateurs passent par un Application Load Balancer vers un service frontend, qui convertit le langage naturel en embeddings vectoriels. Le service de recherche effectue ensuite une recherche de similarité contre l'index OpenSearch et enrichit les résultats avec des métadonnées provenant d'Amazon DocumentDB avant de renvoyer les horodatages précis des extraits à l'utilisateur.
Détails clés
- Taille de la bibliothèque : Le système indexe et recherche plus de 140 000 vidéos.
- Gain de performance : Le temps de découverte est passé de 250 minutes à moins de 2 minutes par tâche.
- Modèle principal : Le modèle d'embedding TwelveLabs Marengo gère l'encodage conjoint des signaux visuels, audio et de transcription.
- Infrastructure : Construit sur Amazon Bedrock pour l'accès aux modèles et Amazon OpenSearch Service pour l'indexation vectorielle.
- Résilience : Déploiement multi-AZ avec réplication synchrone pour OpenSearch et répliques primaire-secondaire pour DocumentDB.
- Impact sur les coûts : Économies opérationnelles annuelles estimées à 800 000 dollars basées sur les benchmarks de mai 2026.
Pourquoi c'est important
Pour les équipes d'ingénierie construisant des systèmes de recherche, cette étude de cas met en lumière les limites de la récupération basée sur les mots-clés pour les médias riches. Les métadonnées traditionnelles échouent à capturer l'intention nuancée des utilisateurs qui décrivent le contenu par humeur, action ou contexte plutôt que par nom de fichier. Les embeddings multimodaux comblent ce fossé en créant un espace sémantique unifié où les signaux texte, image et audio s'alignent, permettant une découverte plus intuitive et précise.
La décision architecturale de découpler l'ingestion du service est critique pour la scalabilité. Le traitement des embeddings pour des centaines de milliers de vidéos est gourmand en ressources et peut bloquer les requêtes en temps réel si géré de manière monolithique. En utilisant l'invocation asynchrone et l'orchestration pilotée par événements, Condé Nast s'est assuré que les opérations de backfill et les mises à jour du système n'affectaient pas la disponibilité ou la latence de l'expérience de recherche en direct pour le personnel éditorial.
Ce que vous pouvez faire
- Évaluez les modèles d'embeddings multimodaux comme TwelveLabs Marengo pour les projets impliquant la recherche vidéo ou audio.
- Découplez vos pipelines d'ingestion et de service pour empêcher le traitement par lots lourd d'affecter la latence perçue par l'utilisateur.
- Utilisez l'invocation asynchrone pour la génération d'embeddings afin de gérer de grands arriérés sans bloquer les threads principaux de l'application.
- Implémentez des stratégies de recherche hybride combinant similarité vectorielle et filtrage de métadonnées pour des résultats plus précis.
- Menez des recherches utilisateur pour comprendre les schémas de requêtes en langage naturel avant de concevoir votre couche d'abstraction de recherche sémantique.
- Concevez pour la haute disponibilité dès le départ en répartissant les ressources de calcul et de données sur plusieurs Availability Zones.


