Condé Nast giảm 99% thời gian tìm kiếm video nhờ AI đa phương thức
Condé Nast đã rút ngắn thời gian khám phá nội dung video từ 250 phút xuống dưới hai phút bằng cách sử dụng Amazon Bedrock và TwelveLabs Marengo cho việc tìm kiếm ngữ nghĩa trên 140.000 đoạn clip.
Được dịch tự động từ bản gốc tiếng Anh.
Condé Nast đã hợp tác với Trung tâm Đổi mới Sáng tạo về Generative AI của AWS để cải tổ quy trình khám phá nội dung video, giảm thời gian tìm kiếm trung bình từ 250 phút xuống còn chưa đầy hai phút mỗi tác vụ. Tập đoàn truyền thông này đã triển khai một hệ thống tìm kiếm ngữ nghĩa đa phương thức trên thư viện hơn 140.000 video, tận dụng Amazon Bedrock và Amazon OpenSearch Service để kích hoạt khả năng truy xuất dựa trên ý định (intent-based retrieval).
Điều gì đã xảy ra
Các đội ngũ biên tập tại những thương hiệu như Vogue, GQ, Vanity Fair và Wired trước đây phụ thuộc vào việc tua thủ công và các siêu dữ liệu tĩnh như tiêu đề và mô tả để xác định vị trí tài nguyên video. Cách tiếp cận này gây ra gánh nặng vận hành đáng kể, khi nhân viên phải dành hàng giờ để tìm kiếm những khoảnh khắc hình ảnh hoặc âm thanh cụ thể mà các tìm kiếm theo từ khóa không thể nhận diện được. Việc phụ thuộc vào kiến thức chuyên môn nội bộ cũng tạo ra các điểm lỗi đơn lẻ, khiến lượng lớn nội dung lưu trữ trở nên khó tìm thấy khi những nhân sự chủ chốt vắng mặt.
Để giải quyết tình trạng kém hiệu quả mang tính cấu trúc này, Condé Nast đã làm việc với AWS để xây dựng một giải pháp có khả năng hiểu nội dung video vượt ra ngoài các nhãn văn bản. Hệ thống mới cho phép các biên tập viên tìm kiếm bằng các truy vấn ngôn ngữ tự nhiên như "nội dung yoga cho người mới bắt đầu với nền yên tĩnh" hoặc "những khoảnh khắc hậu trường tuần lễ thời trang". Bằng cách phân tích đồng thời các yếu tố hình ảnh, đường dẫn âm thanh và bản ghi chép (transcript), nền tảng hiển thị các đoạn clip liên quan kèm theo mốc thời gian chính xác, loại bỏ nhu cầu xem toàn bộ tệp tin.
Việc triển khai đã dẫn đến mức giảm 99,2% thời gian khám phá nội dung trong một hội thảo đánh giá chuẩn vào tháng 5 năm 2026. Công ty ước tính tiết kiệm chi phí vận hành khoảng 800.000 USD mỗi năm nhờ tăng năng suất và phản hồi nhanh hơn đối với các yêu cầu từ nhà quảng cáo. Billy Keenly, Giám đốc Cấp cao Toàn cầu về Tối ưu hóa Sáng tạo tại Condé Nast, lưu ý rằng sự hợp tác này đã giúp làm rõ luận điểm kinh doanh cho việc áp dụng các mục tiêu quy trình làm việc tiên tiến.
Cách thức hoạt động
Kiến trúc tách biệt pipeline xử lý dữ liệu đầu vào (ingestion) nặng về tính toán khỏi tầng phục vụ truy vấn độ trễ thấp, cho phép mỗi phần mở rộng độc lập. Khi một video được tải lên Amazon S3, một sự kiện sẽ kích hoạt dịch vụ ingestion chạy trên Amazon ECS với AWS Fargate. Dịch vụ này xác minh tệp, trích xuất siêu dữ liệu và chia nhỏ video thành các phân đoạn. Mỗi phân đoạn được xử lý bất đồng bộ thông qua mô hình nhúng (embedding model) TwelveLabs Marengo qua Amazon Bedrock, tạo ra các vector nhúng đa phương thức nắm bắt ý nghĩa ngữ nghĩa xuyên suốt dữ liệu hình ảnh, âm thanh và bản ghi chép.
Các vector nhúng này được lưu trữ trong Amazon S3 để đảm bảo độ bền vững và được lập chỉ mục trong Amazon OpenSearch Service để thực hiện tìm kiếm tương đồng k-láng giềng gần nhất (k-NN) nhanh chóng. Về phía truy vấn, các yêu cầu của người dùng đi qua Application Load Balancer tới một dịch vụ frontend, nơi chuyển đổi ngôn ngữ tự nhiên thành các vector nhúng. Sau đó, dịch vụ tìm kiếm thực hiện tìm kiếm tương đồng trên chỉ mục OpenSearch và bổ sung kết quả bằng siêu dữ liệu từ Amazon DocumentDB trước khi trả về mốc thời gian chính xác của đoạn clip cho người dùng.
Chi tiết chính
- Quy mô thư viện: Hệ thống lập chỉ mục và tìm kiếm trên hơn 140.000 video.
- Mức tăng hiệu suất: Thời gian khám phá giảm từ 250 phút xuống dưới 2 phút mỗi tác vụ.
- Mô hình cốt lõi: Mô hình nhúng TwelveLabs Marengo xử lý mã hóa chung các tín hiệu hình ảnh, âm thanh và bản ghi chép.
- Cơ sở hạ tầng: Được xây dựng trên Amazon Bedrock để truy cập mô hình và Amazon OpenSearch Service để lập chỉ mục vector.
- Khả năng phục hồi: Triển khai đa vùng sẵn sàng (Multi-AZ) với sao chép đồng bộ cho OpenSearch và các bản sao dự phòng chính-phụ cho DocumentDB.
- Tác động chi phí: Ước tính tiết kiệm 800.000 USD chi phí vận hành hàng năm dựa trên các chuẩn đo lường tháng 5 năm 2026.
Tại sao điều này quan trọng
Đối với các đội ngũ kỹ thuật xây dựng hệ thống tìm kiếm, nghiên cứu điển hình này nhấn mạnh những hạn chế của việc truy xuất dựa trên từ khóa đối với phương tiện truyền thông phong phú. Siêu dữ liệu truyền thống không nắm bắt được ý định tinh tế của người dùng khi họ mô tả nội dung theo cảm xúc, hành động hoặc bối cảnh thay vì tên tệp. Các vector nhúng đa phương thức lấp đầy khoảng trống này bằng cách tạo ra một không gian ngữ nghĩa thống nhất, nơi các tín hiệu văn bản, hình ảnh và âm thanh được căn chỉnh, cho phép khám phá trực quan và chính xác hơn.
Quyết định kiến trúc tách rời quá trình ingestion khỏi quá trình phục vụ là rất quan trọng cho khả năng mở rộng. Việc xử lý các vector nhúng cho hàng trăm nghìn video đòi hỏi nhiều tài nguyên và có thể chặn các truy vấn thời gian thực nếu được xử lý theo kiểu khối đơn (monolithic). Bằng cách sử dụng lời gọi bất đồng bộ và điều phối dựa trên sự kiện, Condé Nast đã đảm bảo rằng các thao tác nạp dữ liệu bù (backfill) và cập nhật hệ thống không ảnh hưởng đến tính sẵn sàng hoặc độ trễ của trải nghiệm tìm kiếm trực tiếp dành cho nhân viên biên tập.
Bạn có thể làm gì
- Đánh giá các mô hình nhúng đa phương thức như TwelveLabs Marengo cho các dự án liên quan đến tìm kiếm video hoặc âm thanh.
- Tách rời các pipeline ingestion và serving để ngăn chặn việc xử lý lô nặng ảnh hưởng đến độ trễ hướng tới người dùng.
- Sử dụng lời gọi bất đồng bộ cho việc tạo vector nhúng để xử lý các backlog lớn mà không chặn các luồng ứng dụng chính.
- Triển khai các chiến lược tìm kiếm lai kết hợp độ tương đồng vector với bộ lọc siêu dữ liệu để có kết quả chính xác hơn.
- Tiến hành nghiên cứu người dùng để hiểu các mẫu truy vấn ngôn ngữ tự nhiên trước khi thiết kế lớp trừu tượng tìm kiếm ngữ nghĩa của bạn.
- Thiết kế cho tính sẵn sàng cao ngay từ đầu bằng cách phân bổ tài nguyên tính toán và dữ liệu trên nhiều Vùng sẵn sàng (Availability Zones).


