Condé Nast reduziert die Video-Suchzeit um 99 % mit multimodaler KI
Condé Nast hat die Zeit für die Videosuche von 250 Minuten auf unter zwei Minuten verkürzt, indem Amazon Bedrock und TwelveLabs Marengo für die semantische Suche über 140.000 Clips hinweg eingesetzt wurden.
Automatisch aus dem englischen Original übersetzt.
Condé Nast hat mit dem AWS Generative AI Innovation Center zusammengearbeitet, um seinen Prozess zur Videoentdeckung grundlegend zu überarbeiten. Dabei wurde die Suchzeit pro Aufgabe von durchschnittlich 250 Minuten auf unter zwei Minuten reduziert. Der Medienriese setzte ein multimodales semantisches Suchsystem in seiner Bibliothek mit mehr als 140.000 Videos ein und nutzte dabei Amazon Bedrock und Amazon OpenSearch Service, um eine absichtsbasierte Abrufmethode (Intent-based Retrieval) zu ermöglichen.
Was passiert ist
Redaktionsteams bei Marken wie Vogue, GQ, Vanity Fair und Wired waren zuvor auf manuelles Durchsuchen und statische Metadaten wie Titel und Beschreibungen angewiesen, um Videoassets zu finden. Dieser Ansatz führte zu erheblichen operativen Reibungsverlusten, da das Personal Stunden damit verbrachte, spezifische visuelle oder akustische Momente zu suchen, die durch Keyword-Suchen nicht identifiziert werden konnten. Die Abhängigkeit vom institutionellen Wissen schuf zudem einzelne Ausfallpunkte, wodurch große Mengen an Archivinhalten unentdeckt blieben, wenn Schlüsselpersonal nicht verfügbar war.
Um diese strukturelle Ineffizienz anzugehen, arbeitete Condé Nast mit AWS zusammen, um eine Lösung zu entwickeln, die Videoinhalte über reine Textbeschriftungen hinaus versteht. Das neue System ermöglicht es Redakteuren, mit natürlichsprachigen Abfragen wie „Anfänger-Yoga-Inhalte mit beruhigenden Hintergründen“ oder „Behind-the-Scenes-Momente der Fashion Week“ zu suchen. Indem das System visuelle Elemente, Audiospuren und Transkripte gleichzeitig analysiert, liefert die Plattform relevante Clips mit präzisen Zeitstempeln, sodass das vollständige Ansehen der Dateien entfällt.
Die Implementierung führte während eines Benchmarking-Workshops im Mai 2026 zu einer Reduzierung der Entdeckungszeit für Inhalte um 99,2 Prozent. Das Unternehmen schätzt jährliche operative Einsparungen von etwa 800.000 US-Dollar aufgrund erhöhter Produktivität und schnellerer Reaktionszeiten auf Anfragen von Werbetreibenden. Billy Keenly, Global Senior Director of Creative Optimization bei Condé Nast, merkte an, dass die Zusammenarbeit half, den Geschäftsnutzen für die Annahme dieser fortgeschrittenen Workflow-Ziele zu verdeutlichen.
Wie es funktioniert
Die Architektur trennt die rechenintensive Aufnahmepipeline von der Ebene für die latenzarme Abfragebereitstellung, sodass beide unabhängig voneinander skalieren können. Wenn ein Video in Amazon S3 hochgeladen wird, löst ein Ereignis einen Aufnahmedienst aus, der auf Amazon ECS mit AWS Fargate läuft. Dieser Dienst validiert die Datei, extrahiert Metadaten und teilt das Video in Segmente auf. Jedes Segment wird asynchron durch das TwelveLabs Marengo Embedding-Modell via Amazon Bedrock verarbeitet, welches multimodale Vektor-Embeddings erzeugt, die die semantische Bedeutung über visuelle, auditive und Transkriptdaten hinweg erfassen.
Diese Embeddings werden zur Sicherung der Datenhaltbarkeit in Amazon S3 gespeichert und für schnelle k-nearest neighbor (k-NN)-Ähnlichkeitssuchen in Amazon OpenSearch Service indexiert. Auf der Abfrageseite leiten Nutzeranfragen über einen Application Load Balancer an einen Frontend-Dienst weiter, der natürliche Sprache in Vektor-Embeddings umwandelt. Der Suchdienst führt anschließend eine Ähnlichkeitssuche gegen den OpenSearch-Index durch und reichert die Ergebnisse mit Metadaten aus Amazon DocumentDB an, bevor er präzise Clip-Zeitstempel an den Nutzer zurückgibt.
Wichtige Details
- Bibliotheksumfang: Das System indexiert und durchsucht über 140.000 Videos.
- Leistungssteigerung: Die Entdeckungszeit sank von 250 Minuten auf unter 2 Minuten pro Aufgabe.
- Kernmodell: Das TwelveLabs Marengo Embedding-Modell übernimmt die gemeinsame Kodierung von visuellen, auditiven und Transkriptsignalen.
- Infrastruktur: Errichtet auf Amazon Bedrock für den Modellzugriff und Amazon OpenSearch Service für die Vektorindexierung.
- Resilienz: Multi-AZ-Bereitstellung mit synchroner Replikation für OpenSearch und Primary-Standby-Replikas für DocumentDB.
- Kostenwirkung: Geschätzte jährliche operative Einsparungen von 800.000 US-Dollar basierend auf Benchmarks vom Mai 2026.
Warum das wichtig ist
Für Engineering-Teams, die Suchsysteme entwickeln, hebt dieses Fallbeispiel die Grenzen der keyword-basierten Abrufmethode für Rich Media hervor. Traditionelle Metadaten können die nuancierte Absicht von Nutzern nicht erfassen, die Inhalte nach Stimmung, Aktion oder Kontext beschreiben, statt nach Dateinamen. Multimodale Embeddings schließen diese Lücke, indem sie einen einheitlichen semantischen Raum schaffen, in dem Text-, Bild- und Audiosignale übereinstimmen, was eine intuitivere und genauere Entdeckung ermöglicht.
Die architektonische Entscheidung, Aufnahme und Bereitstellung zu entkoppeln, ist für die Skalierbarkeit entscheidend. Die Verarbeitung von Embeddings für Hunderttausende von Videos ist ressourcenintensiv und kann Echtzeitabfragen blockieren, wenn sie monolithisch gehandhabt wird. Durch die Nutzung asynchroner Aufrufe und ereignisgesteuerter Orchestrierung stellte Condé Nast sicher, dass Nachfüllvorgänge (Backfill Operations) und Systemupdates die Verfügbarkeit oder Latenz des Live-Sucherlebnisses für das Redaktionsteam nicht beeinträchtigten.
Was Sie tun können
- Bewerten Sie multimodale Embedding-Modelle wie TwelveLabs Marengo für Projekte, die Video- oder Audiosuche beinhalten.
- Entkoppeln Sie Ihre Aufnahme- und Bereitstellungspipelines, um zu verhindern, dass schwere Batch-Verarbeitungen die benutzerseitige Latenz beeinflussen.
- Verwenden Sie asynchrone Aufrufe für die Generierung von Embeddings, um große Rückstände zu verarbeiten, ohne die Hauptanwendungs-Threads zu blockieren.
- Implementieren Sie hybride Suchstrategien, die Vektorähnlichkeit mit Metadatenfilterung kombinieren, um präzisere Ergebnisse zu erzielen.
- Führen Sie Nutzerforschung durch, um Muster natürlichsprachiger Abfragen zu verstehen, bevor Sie Ihre semantische Suchabstraktionsebene gestalten.
- Planen Sie Hochverfügbarkeit von Anfang an, indem Sie Rechen- und Datenressourcen über mehrere Availability Zones verteilen.


