NVIDIA VSS 3.3、適応サンプリングとプロンプトベース構築で視覚AIコストを削減
NVIDIAはVSS Blueprint 3.3をリリースし、トークン使用量を削減する「Adaptive Efficient Video Sampling」と、単一のプロンプトからマルチワークフロー展開を構成する「Build Vision Agent」スキルを導入しました。
英語の原文から自動翻訳されました。
NVIDIAは、Video Search and Summarization(VSS)向けのMetropolis Blueprintバージョン3.3をリリースしました。これは、本番環境レベルの視覚AIエージェント構築における経済的および運用上の障壁を下げることを目的としています。今回のアップデートでは、2つの主要なメカニズムが導入されました。1つは迅速なデプロイメントを実現する自然言語による構成ツール、もう1つは実行時の計算コストを大幅に削減する適応サンプリング技術です。これらの変更は、膨大なインフラ費用をかけることなく、複雑なマルチストリーム動画分析パイプラインに視覚言語モデルを統合する必要のある開発者を対象としています。
何が起きたか
VSS 3.3アップデートは、NVIDIA Cosmosなどの視覚言語モデルを、NVIDIA Nemotronなどの大規模言語モデル、検索拡張生成(RAG)、Model Context Protocolツールと接続します。この統合により、システムはライブおよび録画された動画を、自然言語での検索クエリ、視覚的な質問応答セッション、検証済みアラート、自動レポートに変換できるようになります。今回のリリースは、こうしたシステムの開発および大規模運用に伴う高コストに特に対処しており、各フェーズを合理化するための新しいツールを提供しています。
開発側では、vss-build-vision-aiとして識別される新しい「Build Vision Agent」スキルにより、開発者は単一のテキストプロンプトからマルチワークフローのデプロイメントを構成できます。マイクロサービスを手動で設定する代わりに、このスキルは4つの検証済み開発者プロファイルのいずれかから開始し、要求された機能に必要なサービスのみを追加します。Kafka、Redis、Elasticsearchなどの共有インフラコンポーネントを単一インスタンスに収束させ、重複を回避します。ボトリングラインに関するデモでは、このスキルにより、2基のGPUを搭載したRTX PRO 6000 Blackwellホスト上で、検索、アラート検証、シフトレポート機能を備えたライブかつプレビュー可能なデプロイメントが30分未満で生成されました。
実行時側では、アップデートにより「Adaptive Efficient Video Sampling(EVS)」が導入されました。この機能は、フレーム間で変化していない視覚パッチを動的に間引くことで、視覚言語モデルへの処理負荷を軽減します。実際の活動がある瞬間に合わせてモデル処理をバッチ化することで、静的な背景に対して計算リソースを無駄遣いすることを防ぎます。Cosmos 3 Super FP8を実行しているRTX PRO 6000 Blackwellを用いたテストでは、このアプローチによりアラートの文脈化レイテンシが17%短縮され、同時実時間VLMストリームの数が46%増加しました。
仕組み
「Build Vision Agent」スキルは、既存の設定を基盤として扱い、ゼロから始めるのではなく動作します。4つの検証済みプロファイルの中から最も近いものを選択します。高密度キャプション用のbase、リアルタイム検出用のalerts、長尺動画要約用のlvs、またはオブジェクト埋め込み用のsearchです。その後、このスキルは最小限の差分を計算し、特定のサービスキーのみを追加または削除して、検出器やメッセージバスなどの共有ロールが単一インスタンスに統合されるようにします。システムが設定選択を自動的に解決できない場合、恣意的な決定を行う代わりに、開発者に構造化された単一の質問を投げかけます。
Adaptive EVSは、コサイン類似度を使用して動画フレームの各パッチを前のフレームと比較することで動作します。変化していないパッチは言語モデルに到達する前に破棄され、保持率の高いクリップはイベントとしてバッチ化されます。保持率が低いクリップは破棄またはフラッシュされ、モデルは関連する動きに注意を集中させることができます。この動的な間引きは、実時間VLMマイクロサービス内部で行われるため、固定レートではなく実際のシーン活動に基づいて、パッチごと・フレームごとにどのトークンを保持するかを決定します。
主要な詳細
- 「Build Vision Agent」スキルにより、ボトリングライン用エージェントのデプロイメント時間が、2基のGPUを搭載したRTX PRO 6000 Blackwellホスト上で30分未満に短縮されました。
- Adaptive EVSにより、60分の動画を要約する際のVLM入力トークンが80%削減され、処理時間は半分になりました。
- 同時実時間VLMストリームが46%増加し、同じハードウェア構成で13ストリームから19ストリームに上昇しました。
- アラートの文脈化レイテンシが17%低下し、テスト中に1,021 msから844 msに減少しました。
- システムはKafka、Redis、Elasticsearchなどの共有インフラを再利用し、異なるワークフロー間での重複デプロイメントを防ぎます。
- Adaptive EVSはオプションであり、
VIA_EVS_SESSIONやVLM_VIDEO_PRUNING_RATEなどの環境変数を通じて設定されます。
なぜ重要なのか
ソフトウェアエンジニアやテクニカルリードにとって、視覚AIの主な課題は、バラバラのマイクロサービスを組み合わせる複雑さにありました。従来のセットアップでは、取り込み、ストリーム処理、イベント検出、検索システムの手動統合が必要であり、これがしばしばインフラの重複や高い保守オーバーヘッドにつながります。VSS 3.3は、自然言語プロンプトを通じてこの構成を自動化することで、チームが概念実証から本番環境へより迅速に移行できるようにします。小さな差分で稼働中のデプロイメントを拡張できる能力により、単純な検出から完全な要約への切り替えなど、新しい機能を追加する際にスタック全体を再構築する必要がなくなります。
実行時コストも同様に重要です。視覚AIワークロードは、トークン使用量が多いため急速に高額になる可能性があるからです。視覚言語モデルによって処理されるフレームが増えるたびに、GPU使用量とキューイング遅延が増加します。Adaptive EVSは、計算力を変化している視覚要素にのみ費やすことでこれに対応します。この効率性の向上により、組織は既存のハードウェアでより多くの同時ストリームを実行でき、総所有コスト(TCO)に直接影響を与えます。スマートシティ監視や倉庫安全管理など、動画の大部分が静止画であるアプリケーションにおいては、この最適化により連続的な分析が経済的に実現可能になります。
実施できること
- GitHubからVSS Blueprintリポジトリをクローンし、3.3のスキルとデプロイメントコードにアクセスしてください。
- コーディングエージェントの標準スキルディレクトリにVSS Agent Skillsをインストールし、シンボリックリンクを使用して更新に対応させてください。
vss-build-vision-aiスキルを使用し、動画ソースやワークフローを含めた希望のエージェントを記述することで、デプロイメント計画を生成してください。- デプロイ前に、生成されたアーキテクチャ図と
override.envファイルを確認し、GPU配置、ポート、セキュリティ境界を検証してください。 VIA_EVS_SESSION=trueを設定し、具体的な動画コンテンツに基づいて間引きレートを調整することで、実時間ワークロード向けにAdaptive EVSを有効にしてください。- 代表的なフッテージで精度、スループット、レイテンシをベンチマークし、ユースケースに最適な類似性閾値を決定してください。
