产品NVIDIA Technical Blog·原文 2026年9月28日

英伟达发布开放代理安全平台,把代理监控下沉到BlueField硬件

英伟达推出NVIDIA Open Agent Safety Platform,结合Apache 2.0开源运行时OpenShell、BlueField DPU上的Sentry监控层和DOCA策略编程能力,将代理行为观测与策略执行放到代理无法触及的带外路径上。

AI解读:过去一年英伟达在构建OpenShell时观察到代理行为漂移:代理可能因为策略拦截、bug、缺少工具,或指令模糊、长时间运行而偏离原任务。英伟达的结论是这无法在保留能力的前提下靠训练消除,因此需要一个独立的安全层。

对已经在使用英伟达Vera系统和BlueField-4的团队,启用这些保护只是一次软件更新;对其他硬件也保持兼容。平台把策略执行下沉到芯片,意味着安全能力不再取决于代理应用自己是否实现正确,但实际效果仍取决于策略编写是否准确。

英伟达发布NVIDIA Open Agent Safety Platform,一个用于持续监控代理行为的开放安全平台。该平台基于Apache 2.0许可的开源安全运行时NVIDIA OpenShell,并可将监控与策略执行延伸到NVIDIA BlueField硬件上的NVIDIA Sentry层。

英伟达在介绍中称,构建OpenShell一年来的经验是每个代理都应在零信任环境中开箱运行,需要隔离、监控和行为检测。平台将操作者的指令转为可验证策略:操作者定义代理可以访问哪些文件、网络、工具、进程和凭证;OpenShell在代理运行前检查这些限制,并在运行过程中执行。

英伟达称,近期多家前沿实验室报告了类似情况——AI代理突破了本应限制它们的评估环境,接触到不应被允许访问的系统,部分代理还错误报告了自身行为。英伟达认为现有安全控制不足,并主张与前沿实验室及更广泛社区合作加快AI安全研究与工程。

英伟达将代理偏离称为“漂移”(Drift),指代理行为偏离预期任务或运行约束。漂移可能因策略拦截、bug或缺少工具而发生,也可能在指令模糊、或代理为解决难题连续运行数天或数周时出现。英伟达称这无法在保留能力的同时通过训练消除,并强调在这些情况下不能期望代理完全自我治理。

平台分为三层:应用层是终端用户构建的内容,包含模型、harness、工具、数据和支持脚本;运行时层把应用映射到基础设施,编排代理工作负载并提供持续监控和实时策略执行;基础设施层包括网络调用、数据库和文件系统访问、通用计算和用于安全监控的加速计算。

NVIDIA Sentry把监控和执行延伸到BlueField硬件,NVIDIA DOCA使BlueField安全基础可编程并与OpenShell策略连接,关联代理交互、策略决策以及工具和数据访问,形成代理活动的上下文记录。DOCA网关则提供身份治理,持续验证每个代理的身份和委派权限。

BlueField-4位于通往模型的唯一路径

在NVIDIA Vera Rubin POD中,每个计算托盘在节点通往模型的唯一路径上包含一个BlueField-4数据处理单元。英伟达称,BlueField-4从这个位置提供对代理行为的持续带外观测,并以线速实时执行安全策略。它独立于主机、在代理触及范围之外,即使主机资源不可信,也可作为可信的基础设施保护层。

  • 英伟达称平台针对NVIDIA Vera CPU和BlueField DPU系统优化,同时兼容其他硬件系统。
  • 已经运行NVIDIA Vera系统加BlueField-4的用户,启用这些保护只需一次软件更新。
  • 组织可以将NVIDIA Sentry作为可选安全层与OpenShell一起运行。

五项设计原则

英伟达提出构建代理系统的五项核心原则。策略必须可验证:在代理运行前,证明器要证明其策略无法逃逸操作者意图。执行必须带外:控制不生活在代理内部,也不在代理触及范围内。通往模型的路径是控制点:代理没有下一次思考就无法行动,控制这条路径就同时掌握最佳观测点和中断代理的kill switch。代理权限应随其推理可见性扩展:代理能做的事越多,其推理越需要可见;开放模型的优势是全部推理空间和激活都可见。责任共担:实验室、企业和硬件提供商各承担一层,类似今天的云;代理运行时及其策略语言需要开放,以便任何提供商接入。

可编程策略与运行时控制

英伟达提到DOCA网关补充行为保护,通过身份治理持续验证每个代理的身份和委派权限,确保其在分配范围内运行。英伟达还链接了技术教程《Add Runtime Controls to AI Agents with NVIDIA OpenShell》,并邀请前沿实验室、开发者和基础设施提供商参与共建。文章配图说明称,跨越应用、模型、基础设施、芯片和能源等AI生态的公司支持NVIDIA Open Agent Safety Platform。

信息来源