NVIDIA VSS 3.3 senkt Kosten für visuelle KI durch adaptive Abtastung und promptbasierte Builds
NVIDIA veröffentlicht VSS Blueprint 3.3, das Adaptive Efficient Video Sampling zur Reduzierung der Token-Nutzung sowie die Build Vision Agent-Funktion einführt, die Multi-Workflow-Bereitstellungen aus einem einzigen Prompt zusammenstellt.
Automatisch aus dem englischen Original übersetzt.
NVIDIA hat Version 3.3 seines Metropolis Blueprints für Videosuche und -zusammenfassung (VSS) veröffentlicht. Ziel ist es, die finanziellen und betrieblichen Hürden beim Aufbau produktionsreifer visueller KI-Agenten zu senken. Das Update führt zwei wesentliche Mechanismen ein: ein Kompositionswerkzeug auf natürlicher Sprache für schnellere Bereitstellungen und eine adaptive Abtasttechnik, die die Rechenkosten zur Laufzeit erheblich reduziert. Diese Änderungen richten sich an Entwickler, die Vision-Sprachmodelle in komplexe, multimodale Videoanalyse-Pipelines integrieren müssen, ohne prohibitiv hohe Infrastrukturkosten zu verursachen.
Was passiert ist
Das VSS-3.3-Update verbindet Vision-Sprachmodelle wie NVIDIA Cosmos mit großen Sprachmodellen wie NVIDIA Nemotron, Retrieval-Augmented Generation (RAG) und Model Context Protocol (MCP)-Tools. Diese Integration ermöglicht es Systemen, Live- und Aufzeichnungsvideos in Suchanfragen auf natürlicher Sprache, visuelle Frage-Antwort-Sitzungen, verifizierte Warnmeldungen und automatisierte Berichte umzuwandeln. Die Veröffentlichung adressiert gezielt die hohen Kosten sowohl bei der Entwicklung dieser Systeme als auch beim Betrieb im großen Maßstab und bietet neue Tools zur Optimierung jeder Phase.
Auf der Entwicklungsseite ermöglicht die neue Build Vision Agent-Funktion, identifiziert als vss-build-vision-ai, Entwicklern das Erstellen von Multi-Workflow-Bereitstellungen aus einem einzelnen Text-Prompt. Anstatt Microservices manuell zu konfigurieren, startet die Funktion mit einem von vier validierten Entwicklerprofilen und fügt nur die für die angeforderte Fähigkeit erforderlichen Dienste hinzu. Gemeinsame Infrastrukturkomponenten wie Kafka, Redis und Elasticsearch werden auf einzelne Instanzen konvergiert, um Duplizierungen zu vermeiden. In einer Demonstration mit einer Abfülllinie erzeugte diese Funktion innerhalb von 30 Minuten auf einem Host mit zwei RTX PRO 6000 Blackwell GPUs eine live überprüfbare Bereitstellung mit Suche, Warnüberprüfung und Schichtberichten.
Auf der Laufzeitseite führt das Update Adaptive Efficient Video Sampling (EVS) ein. Diese Funktion reduziert die Verarbeitungslast für Vision-Sprachmodelle, indem sie dynamisch visuelle Patches entfernt, die zwischen den Frames unverändert bleiben. Durch das Batching von Modellberechnungen rund um Momente tatsächlicher Aktivität vermeidet das System die Verschwendung von Rechenressourcen für statische Hintergründe. In Tests mit einer RTX PRO 6000 Blackwell, die Cosmos 3 Super FP8 ausführte, reduzierte dieser Ansatz die Latenz bei der Kontextualisierung von Warnmeldungen um 17 % und erhöhte die Anzahl der gleichzeitigen Echtzeit-VLM-Streams um 46 %.
Wie es funktioniert
Die Build Vision Agent-Funktion arbeitet, indem sie bestehende Konfigurationen als Grundlage nutzt, statt bei Null anzufangen. Sie wählt den am nächsten liegenden Treffer aus vier validierten Profilen: base für dichte Bildunterschriften, alerts für Echtzeiterkennung, lvs für Langvideo-Zusammenfassungen oder search für Objekt-Einbettungen. Anschließend berechnet die Funktion die kleinste mögliche Delta-Menge, fügt nur spezifische Dienstschlüssel hinzu oder entfernt sie und stellt sicher, dass gemeinsame Rollen wie Detektoren oder Message-Buses in einzelnen Instanzen konsolidiert werden. Wenn das System eine Konfigurationsentscheidung nicht automatisch auflösen kann, stellt es dem Entwickler eine einzige strukturierte Frage, anstatt eine willkürliche Entscheidung zu treffen.
Adaptive EVS funktioniert, indem jeder Patch eines Videoframes mit dem vorherigen unter Verwendung der Kosinusähnlichkeit verglichen wird. Patches, die sich nicht geändert haben, werden verworfen, bevor sie das Sprachmodell erreichen, während Clips mit hohen Behaltensraten als Ereignisse gebatcht werden. Clips mit niedriger Behaltensrate werden verworfen oder geleert, sodass sich das Modell auf relevante Bewegungen konzentrieren kann. Dieses dynamische Pruning erfolgt innerhalb des Echtzeit-VLM-Microservices, was bedeutet, dass er basierend auf der tatsächlichen Szenenaktivität entscheidet, welche Tokens pro Patch und pro Frame beibehalten werden, und nicht nach einer festen Rate.
Wichtige Details
- Die Build Vision Agent-Funktion reduzierte die Bereitstellungszeit für einen Abfülllinien-Agenten auf weniger als 30 Minuten auf einem Host mit zwei RTX PRO 6000 Blackwell GPUs.
- Adaptive EVS reduzierte die VLM-Eingabe-Tokens um 80 % bei der Zusammenfassung eines 60-minütigen Videos und halbierte die Verarbeitungszeit.
- Die Anzahl der gleichzeitigen Echtzeit-VLM-Streams stieg um 46 %, von 13 auf 19 Streams bei derselben Hardwarekonfiguration.
- Die Latenz bei der Kontextualisierung von Warnmeldungen sank um 17 %, von 1.021 ms auf 844 ms während der Tests.
- Das System nutzt gemeinsame Infrastruktur wie Kafka, Redis und Elasticsearch erneut und verhindert so doppelte Bereitstellungen über verschiedene Workflows hinweg.
- Adaptive EVS ist optional und wird über Umgebungsvariablen wie
VIA_EVS_SESSIONundVLM_VIDEO_PRUNING_RATEkonfiguriert.
Warum das wichtig ist
Für Software-Ingenieure und technische Leiter war die Hauptherausforderung bei visueller KI die Komplexität der Zusammenführung unterschiedlicher Microservices. Traditionelle Setups erfordern die manuelle Integration von Aufnahme, Stream-Verarbeitung, Ereigniserkennung und Retrieval-Systemen, was oft zu duplizierter Infrastruktur und hohem Wartungsaufwand führt. Durch die Automatisierung dieser Komposition über Prompts in natürlicher Sprache ermöglicht VSS 3.3 Teams den schnelleren Übergang vom Proof of Concept zur Produktion. Die Möglichkeit, eine laufende Bereitstellung mit kleinen Deltas zu erweitern, bedeutet, dass das Hinzufügen neuer Fähigkeiten, wie der Wechsel von einfacher Erkennung zur vollständigen Zusammenfassung, keinen Neuaufbau des gesamten Stacks erfordert.
Laufzeitkosten sind ebenso kritisch, da Workloads für visuelle KI aufgrund hoher Token-Nutzung schnell teuer werden können. Jeder zusätzliche Frame, der von einem Vision-Sprachmodell verarbeitet wird, erhöht die GPU-Nutzung und die Queueing-Latenz. Adaptive EVS adressiert dies, indem sichergestellt wird, dass Rechenleistung nur für sich ändernde visuelle Elemente aufgewendet wird. Dieser Effizienzgewinn ermöglicht es Organisationen, mehr gleichzeitige Streams auf vorhandener Hardware auszuführen, was sich direkt auf die Gesamtbetriebskosten (TCO) auswirkt. Für Anwendungen wie Smart-City-Überwachung oder Lagersicherheit, bei denen das meiste Videomaterial statisch ist, macht diese Optimierung die kontinuierliche Analyse finanziell tragfähig.
Was Sie tun können
- Klonen Sie das VSS Blueprint Repository von GitHub, um auf die 3.3-Funktionen und den Bereitstellungscode zuzugreifen.
- Installieren Sie die VSS Agent Skills im Standard-Skills-Verzeichnis Ihres Coding-Agents und verwenden Sie Symlinks, um sie aktuell mit Updates zu halten.
- Nutzen Sie die
vss-build-vision-ai-Funktion, um einen Bereitstellungsplan zu generieren, indem Sie Ihren gewünschten Agenten beschreiben, einschließlich Videoquellen und Workflows. - Überprüfen Sie das generierte Architekturdiagramm und die Datei
override.env, um GPU-Platzierung, Ports und Sicherheitsgrenzen vor der Bereitstellung zu verifizieren. - Aktivieren Sie Adaptive EVS für Echtzeit-Workloads, indem Sie
VIA_EVS_SESSION=truesetzen und die Pruning-Rate basierend auf Ihrem spezifischen Videoinhalt anpassen. - Führen Sie Benchmarks für Genauigkeit, Durchsatz und Latenz auf repräsentativem Filmmaterial durch, um den optimalen Ähnlichkeitsschwellenwert für Ihren Anwendungsfall zu bestimmen.

