Xây dựng với AI

NVIDIA VSS 3.3 giảm chi phí AI thị giác nhờ lấy mẫu thích ứng và xây dựng dựa trên prompt

NVIDIA phát hành Blueprint VSS 3.3, giới thiệu tính năng Lấy mẫu Video Hiệu quả Thích ứng (Adaptive Efficient Video Sampling) để giảm mức sử dụng token và kỹ năng Build Vision Agent cho phép tạo ra các triển khai đa luồng công việc từ một prompt duy nhất.

Được dịch tự động từ bản gốc tiếng Anh.

NVIDIA đã phát hành phiên bản 3.3 của Metropolis Blueprint dành cho Tìm kiếm và Tóm tắt Video (VSS), nhằm mục đích hạ thấp rào cản tài chính và vận hành trong việc xây dựng các tác nhân AI thị giác cấp độ sản xuất. Bản cập nhật này giới thiệu hai cơ chế chính: một công cụ tổng hợp bằng ngôn ngữ tự nhiên giúp triển khai nhanh hơn và một kỹ thuật lấy mẫu thích ứng làm giảm đáng kể chi phí tính toán khi chạy hệ thống. Những thay đổi này nhắm đến các nhà phát triển cần tích hợp các mô hình ngôn ngữ-thị giác vào các quy trình phân tích video phức tạp, đa luồng mà không phải chịu những khoản chi phí cơ sở hạ tầng quá lớn.

Chuyện gì đã xảy ra

Bản cập nhật VSS 3.3 kết nối các mô hình ngôn ngữ-thị giác như NVIDIA Cosmos với các mô hình ngôn ngữ lớn như NVIDIA Nemotron, công nghệ sinh thành tăng cường truy xuất (retrieval-augmented generation) và các công cụ Model Context Protocol. Sự tích hợp này cho phép các hệ thống chuyển đổi video trực tiếp và ghi sẵn thành các truy vấn tìm kiếm bằng ngôn ngữ tự nhiên, các phiên hỏi đáp về nội dung hình ảnh, các cảnh báo đã được xác minh và các báo cáo tự động. Phiên bản phát hành này đặc biệt giải quyết chi phí cao liên quan đến cả việc phát triển lẫn vận hành các hệ thống ở quy mô lớn, cung cấp các công cụ mới để tối ưu hóa từng giai đoạn.

Về phía phát triển, kỹ năng Build Vision Agent mới, được nhận diện là vss-build-vision-ai, cho phép các nhà phát triển tạo ra các triển khai đa luồng công việc chỉ từ một prompt văn bản duy nhất. Thay vì cấu hình thủ công các microservice, kỹ năng này bắt đầu từ một trong bốn hồ sơ nhà phát triển đã được xác thực và chỉ thêm các dịch vụ cần thiết cho khả năng được yêu cầu. Nó hội tụ các thành phần cơ sở hạ tầng chung như Kafka, Redis và Elasticsearch vào các instance đơn lẻ để tránh trùng lặp. Trong một buổi demo liên quan đến dây chuyền đóng chai, kỹ năng này đã tạo ra một triển khai trực tiếp, có thể xem trước với chức năng tìm kiếm, xác minh cảnh báo và báo cáo ca làm việc trong vòng chưa đầy 30 phút trên máy chủ RTX PRO 6000 Blackwell trang bị hai GPU.

Về phía vận hành, bản cập nhật giới thiệu tính năng Lấy mẫu Video Hiệu quả Thích ứng (EVS). Tính năng này giảm tải xử lý cho các mô hình ngôn ngữ-thị giác bằng cách loại bỏ động các patch hình ảnh không thay đổi giữa các khung hình. Bằng cách gom nhóm công việc của mô hình xung quanh những khoảnh khắc hoạt động thực tế, hệ thống tránh lãng phí tài nguyên tính toán vào các nền tĩnh. Trong các bài kiểm tra sử dụng RTX PRO 6000 Blackwell chạy Cosmos 3 Super FP8, phương pháp này đã cắt giảm độ trễ bối cảnh hóa cảnh báo đi 17% và tăng số lượng luồng VLM thời gian thực đồng thời lên 46%.

Cách thức hoạt động

Kỹ năng Build Vision Agent hoạt động bằng cách coi các cấu hình hiện có làm nền tảng thay vì bắt đầu từ con số không. Nó chọn lựa khớp gần nhất từ bốn hồ sơ đã được xác thực: base cho chú thích dày đặc, alerts cho phát hiện thời gian thực, lvs cho tóm tắt video dài hoặc search cho nhúng đối tượng. Kỹ năng sau đó tính toán delta nhỏ nhất có thể, chỉ thêm hoặc xóa các khóa dịch vụ cụ thể và đảm bảo rằng các vai trò chung như bộ dò (detectors) hoặc bus tin nhắn được hợp nhất vào các instance đơn lẻ. Nếu hệ thống không thể tự động giải quyết một lựa chọn cấu hình, nó sẽ đặt ra một câu hỏi có cấu trúc duy nhất cho nhà phát triển thay vì đưa ra một quyết định tùy ý.

Adaptive EVS hoạt động bằng cách so sánh mỗi patch của khung hình video với khung hình trước đó bằng cách sử dụng độ tương tự cosine (cosine similarity). Các patch không thay đổi bị loại bỏ trước khi chúng đến được mô hình ngôn ngữ, trong khi các clip có tỷ lệ giữ lại cao được gom nhóm thành các sự kiện. Các clip có tỷ lệ giữ lại thấp bị loại bỏ hoặc flush, cho phép mô hình tập trung sự chú ý vào chuyển động liên quan. Việc cắt tỉa động này diễn ra bên trong microservice VLM thời gian thực, nghĩa là nó quyết định những token nào cần giữ lại cho mỗi patch và mỗi khung hình dựa trên hoạt động thực tế của cảnh quay thay vì một tốc độ cố định.

Chi tiết chính

  • Kỹ năng Build Vision Agent đã giảm thời gian triển khai cho một tác nhân dây chuyền đóng chai xuống dưới 30 phút trên máy chủ RTX PRO 6000 Blackwell trang bị hai GPU.
  • Adaptive EVS đã giảm 80% token đầu vào của VLM khi tóm tắt một video dài 60 phút, cắt giảm thời gian xử lý xuống còn một nửa.
  • Số lượng luồng VLM thời gian thực đồng thời tăng 46%, từ 13 lên 19 luồng trên cùng một cấu hình phần cứng.
  • Độ trễ bối cảnh hóa cảnh báo giảm 17%, từ 1.021 ms xuống còn 844 ms trong quá trình thử nghiệm.
  • Hệ thống tái sử dụng cơ sở hạ tầng chung như Kafka, Redis và Elasticsearch, ngăn chặn các triển khai trùng lặp giữa các luồng công việc khác nhau.
  • Adaptive EVS là tùy chọn và được cấu hình thông qua các biến môi trường như VIA_EVS_SESSION và VLM_VIDEO_PRUNING_RATE.

Tại sao điều này quan trọng

Đối với các kỹ sư phần mềm và trưởng nhóm kỹ thuật, thách thức chính với AI thị giác là sự phức tạp trong việc ghép nối các microservice rời rạc. Các thiết lập truyền thống đòi hỏi tích hợp thủ công các hệ thống thu thập dữ liệu, xử lý luồng, phát hiện sự kiện và truy xuất, thường dẫn đến cơ sở hạ tầng trùng lặp và chi phí bảo trì cao. Bằng cách tự động hóa việc tổng hợp này thông qua các prompt ngôn ngữ tự nhiên, VSS 3.3 cho phép các đội ngũ di chuyển từ khái niệm thử nghiệm (proof of concept) sang sản xuất nhanh hơn. Khả năng mở rộng một triển khai đang chạy với các delta nhỏ có nghĩa là việc thêm các khả năng mới, chẳng hạn như chuyển từ phát hiện đơn giản sang tóm tắt toàn diện, không đòi hỏi phải xây dựng lại toàn bộ stack.

Chi phí vận hành cũng quan trọng không kém, vì các khối lượng công việc AI thị giác có thể nhanh chóng trở nên đắt đỏ do mức sử dụng token nặng nề. Mỗi khung hình bổ sung được xử lý bởi một mô hình ngôn ngữ-thị giác đều làm tăng mức sử dụng GPU và độ trễ xếp hàng. Adaptive EVS giải quyết điều này bằng cách đảm bảo sức mạnh tính toán chỉ được chi tiêu cho các yếu tố hình ảnh thay đổi. Lợi ích hiệu suất này cho phép các tổ chức chạy nhiều luồng đồng thời hơn trên phần cứng hiện có, tác động trực tiếp đến tổng chi phí sở hữu (TCO). Đối với các ứng dụng như giám sát thành phố thông minh hoặc an toàn kho bãi, nơi hầu hết footage video là tĩnh, tối ưu hóa này làm cho việc phân tích liên tục trở nên khả thi về mặt tài chính.

Bạn có thể làm gì

  • Nhân bản repository Blueprint VSS từ GitHub để truy cập các kỹ năng và mã triển khai phiên bản 3.3.
  • Cài đặt các VSS Agent Skills vào thư mục skills tiêu chuẩn của agent lập trình của bạn, sử dụng symlink để giữ chúng luôn cập nhật.
  • Sử dụng kỹ năng vss-build-vision-ai để tạo kế hoạch triển khai bằng cách mô tả tác nhân mong muốn, bao gồm nguồn video và các luồng công việc.
  • Xem xét biểu đồ kiến trúc được tạo và tệp override.env để xác minh vị trí GPU, cổng và ranh giới bảo mật trước khi triển khai.
  • Kích hoạt Adaptive EVS cho các khối lượng công việc thời gian thực bằng cách đặt VIA_EVS_SESSION=true và điều chỉnh tỷ lệ cắt tỉa dựa trên nội dung video cụ thể của bạn.
  • Đánh giá benchmark độ chính xác, thông lượng và độ trễ trên footage đại diện để xác định ngưỡng tương tự tối ưu cho trường hợp sử dụng của bạn.

Công cụ từ cửa hàng Bytechap

$89

DocBento

Hệ thống quản lý tài liệu tự host, có khả năng đọc mọi bản quét và trả lời kèm trích dẫn trang cụ thể.

Demo trực tiếp

Đọc tiếp

Tất cả bài viết