Construir con IA

Condé Nast reduce el tiempo de búsqueda de vídeo en un 99 % con IA multimodal

Condé Nast redujo el tiempo de descubrimiento de vídeos de 250 minutos a menos de dos minutos utilizando Amazon Bedrock y TwelveLabs Marengo para la búsqueda semántica en 140.000 clips.

Traducido automáticamente del original en inglés.

Condé Nast se asoció con el AWS Generative AI Innovation Center para renovar su proceso de descubrimiento de vídeos, reduciendo el tiempo de búsqueda de una media de 250 minutos a menos de dos minutos por tarea. El gigante mediático desplegó un sistema de búsqueda semántica multimodal en su biblioteca de más de 140.000 vídeos, aprovechando Amazon Bedrock y Amazon OpenSearch Service para habilitar la recuperación basada en la intención.

Qué ocurrió

Los equipos editoriales de marcas como Vogue, GQ, Vanity Fair y Wired dependían anteriormente del visionado manual y de metadatos estáticos como títulos y descripciones para localizar activos de vídeo. Este enfoque generaba una importante carga operativa, ya que el personal pasaba horas buscando momentos visuales o sonoros específicos que las búsquedas por palabras clave no podían identificar. La dependencia del conocimiento institucional también creaba puntos únicos de fallo, dejando vastas cantidades de contenido del archivo indescubribles cuando el personal clave no estaba disponible.

Para abordar esta ineficiencia estructural, Condé Nast trabajó con AWS para construir una solución que comprende el contenido de vídeo más allá de las etiquetas de texto. El nuevo sistema permite a los editores buscar mediante consultas en lenguaje natural como "contenido de yoga para principiantes con fondos relajantes" o "momentos entre bastidores de la semana de la moda". Al analizar simultáneamente elementos visuales, pistas de audio y transcripciones, la plataforma muestra clips relevantes con marcas de tiempo precisas, eliminando la necesidad de ver archivos completos.

La implementación resultó en una reducción del 99,2 % en el tiempo de descubrimiento de contenido durante un taller de evaluación comparativa en mayo de 2026. La empresa estima ahorros operativos anuales de aproximadamente $800.000 debido al aumento de la productividad y a tiempos de respuesta más rápidos ante solicitudes de anunciantes. Billy Keenly, Director Senior Global de Optimización Creativa en Condé Nast, señaló que la colaboración ayudó a clarificar el caso de negocio para adoptar estos objetivos avanzados de flujo de trabajo.

Cómo funciona

La arquitectura separa la tubería de ingesta intensiva en cómputo de la capa de servicio de consultas de baja latencia, permitiendo que cada una escale de forma independiente. Cuando se sube un vídeo a Amazon S3, un evento activa un servicio de ingesta que se ejecuta en Amazon ECS con AWS Fargate. Este servicio valida el archivo, extrae metadatos y divide el vídeo en segmentos. Cada segmento se procesa de forma asíncrona a través del modelo de incrustaciones TwelveLabs Marengo vía Amazon Bedrock, que genera incrustaciones vectoriales multimodales que capturan el significado semántico a través de datos visuales, de audio y de transcripción.

Estas incrustaciones se almacenan en Amazon S3 para durabilidad y se indexan en Amazon OpenSearch Service para una búsqueda rápida de similitud k-nearest neighbor (k-NN). En el lado de la consulta, las solicitudes de usuario pasan a través de un Application Load Balancer hacia un servicio frontend, que convierte el lenguaje natural en incrustaciones vectoriales. El servicio de búsqueda realiza entonces una búsqueda de similitud contra el índice de OpenSearch y enriquece los resultados con metadatos de Amazon DocumentDB antes de devolver marcas de tiempo precisas de los clips al usuario.

Detalles clave

  • Tamaño de la biblioteca: El sistema indexa y busca más de 140.000 vídeos.
  • Mejora de rendimiento: El tiempo de descubrimiento bajó de 250 minutos a menos de 2 minutos por tarea.
  • Modelo principal: El modelo de incrustaciones TwelveLabs Marengo maneja la codificación conjunta de señales visuales, de audio y de transcripción.
  • Infraestructura: Construido sobre Amazon Bedrock para el acceso a modelos y Amazon OpenSearch Service para la indexación vectorial.
  • Resiliencia: Despliegue multi-AZ con replicación síncrona para OpenSearch y réplicas primarias-secundarias para DocumentDB.
  • Impacto en costes: Ahorros operativos anuales estimados en $800.000 basados en las pruebas de referencia de mayo de 2026.

Por qué importa

Para los equipos de ingeniería que construyen sistemas de búsqueda, este estudio de caso destaca las limitaciones de la recuperación basada en palabras clave para medios ricos. Los metadatos tradicionales no logran capturar la intención matizada de los usuarios que describen contenido por estado de ánimo, acción o contexto en lugar de por nombre de archivo. Las incrustaciones multimodales cierran esta brecha creando un espacio semántico unificado donde las señales de texto, imagen y audio se alinean, permitiendo un descubrimiento más intuitivo y preciso.

La decisión arquitectónica de desacoplar la ingesta del servicio es crítica para la escalabilidad. Procesar incrustaciones para cientos de miles de vídeos consume muchos recursos y puede bloquear las consultas en tiempo real si se gestiona monolíticamente. Al utilizar invocación asíncrona y orquestación dirigida por eventos, Condé Nast aseguró que las operaciones de relleno histórico y las actualizaciones del sistema no impactaran la disponibilidad ni la latencia de la experiencia de búsqueda en vivo para el personal editorial.

Qué puedes hacer

  • Evalúa modelos de incrustación multimodal como TwelveLabs Marengo para proyectos que involucren búsqueda de vídeo o audio.
  • Desacopla tus tuberías de ingesta y servicio para evitar que el procesamiento pesado por lotes afecte la latencia orientada al usuario.
  • Utiliza la invocación asíncrona para la generación de incrustaciones para manejar grandes acumulaciones sin bloquear los hilos principales de la aplicación.
  • Implementa estrategias de búsqueda híbrida que combinen similitud vectorial con filtrado de metadatos para obtener resultados más precisos.
  • Realiza investigación de usuarios para entender los patrones de consulta en lenguaje natural antes de diseñar tu capa de abstracción de búsqueda semántica.
  • Diseña para alta disponibilidad desde el principio distribuyendo recursos de cómputo y datos entre múltiples Availability Zones.

Herramientas de la Tienda de Bytechap

$79

WorkBento

Suite de RR. HH. y gestión del entorno laboral impulsada por IA que puedes alojar tú mismo.

Demo en vivo

Seguir leyendo

Todos los artículos