英伟达发布VSS Blueprint 3.3:单条提示部署视频AI代理,VLM输入token降80%
英伟达视频搜索与摘要蓝图更新到3.3版,新增Build Vision Agent技能让编码代理用自然语言组合部署视频分析应用,同时引入自适应EVS按帧裁剪视觉token,在RTX PRO 6000 Blackwell上并发实时VLM流从13路增至19路。
AI解读:英伟达在技术博客中发布了VSS Blueprint 3.3,围绕“降低开发和运行视频AI代理的成本”做了两处改动:一是新增Build Vision Agent技能,让Claude Code、Codex等编码代理用一条自然语言提示完成应用组装与部署;二是引入自适应EVS,把未变化的视频区域从视觉token里裁掉,减少VLM的重复计算。
官方给出的数字是:一条提示、不到30分钟、几美元的编码代理用量,就能在两条RTSP摄像机上部署一条橙汁灌装线的溢出检测代理。
对开发者而言,最直接的改变在“搭环境”这一步。以前要把告警、搜索、摘要这些工作流串起来,得自己选微服务、配Kafka、Redis、Elasticsearch和模型端点;现在Build Vision Agent从四个已验证的开发者配置(base、alerts、lvs、search)里挑一个当基础,只计算最小增量,共用同一套消息总线和索引,不用复制基础设施。
运行侧的自适应EVS在RTX PRO 6000 Blackwell上跑Cosmos 3 Super FP8,把告警上下文化延迟从1021毫秒降到844毫秒,降17%;60分钟视频摘要的VLM输入token减少80%,耗时约减半;同卡并发实时VLM流从13路增加到19路,多46%。
这些数字有明确的前提。英伟达说明结果会随场景运动、分块长度和相似度阈值变化,建议先用代表性素材做基准测试再定生产默认值。自适应EVS主要适合“看多帧、答得短”的场景,比如密集描述、长视频摘要和告警验证;对“看少量帧、输出长文本”的任务收益较小。它运行在RT-VLM容器内,不对外部端点生效,而且是可选项,需要在override.env里手动开启。
目前没有公开的第三方复现或长期运行数据,官方也提示要在可信隔离网络里加认证、TLS、限流和外部控制。真正受影响的是已经在做视频分析落地、且被GPU成本和搭环境时间卡住的团队:他们的集成工作量和token支出有望下降,但省多少取决于自己的视频内容和阈值设置。普通读者不需要为此做什么。
英伟达在其技术博客发布NVIDIA Metropolis Video Search and Summarization(VSS)Blueprint 3.3,围绕降低成本做了两处更新:新增Build Vision Agent技能(vss-build-vision-ai),以及面向运行时的自适应高效视频采样(Adaptive EVS)。博客作者为Elizabeth Goodman。
VSS将NVIDIA Cosmos等视觉语言模型、NVIDIA Nemotron等大语言模型、检索增强生成(RAG)和Model Context Protocol(MCP)工具连接起来,把直播和录制视频转成自然语言搜索、视觉问答、经验证的告警和自动报告。VSS 3.3的自适应EVS按帧比较相邻画面,裁掉未变化的视觉token,并把VLM计算集中到事件发生的时刻。
官方给出的两个核心数字:在开发侧,一条提示在不到30分钟内完成并部署一条灌装线溢出代理,编码代理用量为“几美元”;在运行侧,60分钟视频摘要的VLM输入token减少80%,同一GPU上的并发流增加46%。
官方说明自适应EVS在NVIDIA RTX PRO 6000 Blackwell上运行Cosmos 3 Super FP8时,告警上下文化延迟从1021毫秒降至844毫秒(降17%),并发实时VLM流从13路增至19路。英伟达提示结果会随场景运动、分块长度和相似度阈值变化,建议在生产默认值前用代表性素材做基准测试。
自适应EVS运行在RT-VLM容器内,不作用于远程端点,且为可选项。官方称它最适合VLM读取多帧但输出较短的场景,如密集描述、长视频摘要和告警验证,对少帧长输出的任务收益较小。
英伟达建议在可信隔离网络部署,并配置认证、TLS、限流和外部控制。博客提到将于太平洋时间10月1日上午9点直播,用单条提示构建一个视觉AI代理。
Build Vision Agent:从一个已验证配置算最小增量
VSS 3.3把此前的单项技能重新组织为部署技能、操作技能、工具和基准测试,由vss-build-vision-ai负责组合其余部分。开发者描述想要的应用,该技能将其翻译成覆盖profiles、微服务、配置和运行时操作的部署计划。
它不是从零生成部署,而是从四个已验证的开发者配置中挑最接近的一个作为Foundation,只改动请求所需的部分。这四个配置分别是:base(对片段做密集描述与问答)、alerts(实时VLM告警,或RT-CV检测加行为分析与VLM告警验证)、lvs(长视频摘要)、search(对象与视频嵌入加代理式搜索)。
技能随后计算最小增量:只增删精确的服务键,只保留请求能力实际触达的服务,并把共享角色收敛到一个实例。两个能力都需要检测器就只用一个检测器;都需要Kafka和Elasticsearch就共用一条消息总线和一套Elasticsearch,各自写入自己的索引。规则无法决定时,技能会提一个结构化问题而不是猜测。
- 把应用目标映射到所需的VSS工作流与微服务
- 把告警、搜索、摘要等工作流合并到一份部署计划
- 复用共享基础设施,包括VIOS、Kafka、Redis、Elasticsearch、HAProxy入口和MCP服务
- 生成自包含构建:_builds/<name>/override.env、compose.yml,以及用docker compose config产出的扁平化resolved.yml,可独立部署
- 不修改仓库的deploy/docker/目录
- 在写入或部署前展示架构图供审阅,然后运行验证、部署和就绪检查
- 询问是否部署代理运行环境,默认是NemoClaw主机侧沙箱并预装VSS技能;选否则生成由VSS CLI驱动的无头栈
- 通过更小的增量扩展正在运行的部署,复用现有服务
灌装线示例:两条RTSP摄像机,约30分钟到可预览部署
博客给出的样例提示是:为一条橙汁灌装线构建VSS视觉代理,使用安装在灌装机和封盖机上的两个RTSP摄像机,检测瓶子溢出和果汁洒漏,用VLM验证每条告警,让告警片段可搜索,并为线长生成班次报告。
代理会组装这些能力:VIOS支持的RTSP摄像机与录制片段接入;按Foundation配置决定的实时检测、跟踪、描述或基于VLM的告警;针对溢出、洒漏和停线事件的行为分析或规则;确认告警并解释推理的VLM验证;对已验证片段和已索引视频的自然语言搜索;用于操作员交接和事件复盘的摘要与报告;以及共享的消息、存储、API和可观测性。
在一台双GPU的RTX PRO 6000 Blackwell主机上,该技能通过复用现有服务、只新增一个告警桥和实时VLM,把搜索与告警组合起来。FP8 Cosmos 3 Nano与检测器共用GPU,避免重复。博客称一个录制的告警构建在不到30分钟内达到可实时预览的部署。
自适应EVS:按余弦相似度裁剪,按活跃度分批
在已部署的灌装线代理中,摄像机全天产生视频,每一帧的大部分区域不变:灌装机、护栏、地面,只有移动的瓶子在变,而溢出很少发生。每个帧窗口仍会成为VLM的视觉上下文,模型大部分算力花在重读与上一帧完全相同的区域。
自适应EVS在管线中做两件事。动态裁剪:把每个patch与前一帧用余弦相似度比较,未变化的patch在进入语言模型前被丢弃。事件感知分批:token保留比例指示活跃度,约高于70%的片段作为事件分批处理,低于约30%的被丢弃或刷掉,其余正常处理。
此前的EVS已以固定裁剪率随vLLM和Cosmos NIM微服务发布;VSS 3.3中的自适应版本集成进实时VLM微服务,按patch和帧决定保留哪些token。
开启方式与适用边界
自适应EVS需要在override.env中启用,官方给出的配置项为:VIA_EVS_SESSION=true、VLM_VIDEO_PRUNING_RATE=0.5(范围 0.0 到 1.0,越高裁剪越多)、VLLM_EVS_SIMILARITY_THRESHOLD=0.2。
使用步骤包括:克隆VSS Blueprint仓库并检出包含 3.3 技能的分支;把VSS技能安装到编码代理的标准技能目录;描述想要的代理,包括视频源、工作流和部署约束;审阅架构图和 _builds/<name>/override.env,尤其是GPU放置、模型端点、端口、存储和安全边界;对RT-VLM工作负载启用自适应EVS、调整裁剪率并在代表性视频上基准测试准确率、吞吐和延迟;在可信隔离网络部署并配置认证、TLS、限流和外部控制。
- 官方称这些改动减少前期开发工作,也减少VLM处理视频所需的GPU工作
- 降低告警、搜索、摘要、报告和问答之间的重复基础设施
- 通过跳过无事发生的视频降低摘要和事件复盘延迟
- 通过复用运行中部署的增量方式让扩展更容易