今日分析

AI 新闻里的变化、生意与判断。

第 018 期Agent / 安全基础设施

英伟达发布 Agent 安全平台,先管住它能碰什么

英伟达 9 月 28 日发布 Open Agent Safety Platform:开源运行时 OpenShell 在沙箱外定义并执行 Agent 的文件、网络、进程和凭据权限,Sentry 则在 BlueField-4 DPU 上做带外监控和隔离。它针对的是最近一连串 Agent 越权事件,但平台由英伟达主导,硬件层的效果和跨环境表现还需要独立验证。

AI 生成示意图、非事件现场、非产品界面:用于表现 Agent 安全运行时、硬件监控和权限检查,不对应英伟达设施或真实产品画面。
点击图片放大
01

这次发布包含两层东西

英伟达 9 月 28 日公布 Open Agent Safety Platform,并推出 OpenShell 0.1.0。OpenShell 是 Apache 2.0 开源运行时,把 Agent 放进带内核隔离的沙箱,用策略限制它能读写哪些文件、访问哪些网络、启动哪些进程和使用哪些凭据。

另一层是 NVIDIA Sentry。英伟达把它放到 BlueField-4 DPU 上,负责在主机和 Agent 之外记录行为、执行策略和触发隔离。官方给出的参考架构把 OpenShell 放在软件运行时,把 Sentry 放在基础设施层,两个组件一起工作。

02

权限不再交给模型自己解释

OpenShell 的示例很直白:先建立一个没有外网的沙箱,再给它只读访问 api.github.com 的规则。Agent 发起 GET 可以通过,发起 POST 会被拦截;真实凭据留在沙箱外,只在被允许的目标和程序上临时绑定。

它还提供策略验证器,用形式逻辑检查一份规则实际放开了哪些路径。规则写得像只读,另一条工具或生成的代码却能绕到写入接口,这类问题可以在运行前先暴露出来。权限审批默认留给人,Agent 不能批准自己的申请。

03

芯片层监控是英伟达的算盘

英伟达把 BlueField-4 描述成通往模型的独立路径:在 Vera Rubin POD 参考系统里,DPU 位于节点和模型之间,能在主机不可信时继续观察和执行策略。这个设计把“杀掉任务”的开关放到 Agent 触碰不到的位置。

这也带着很明确的商业关系。英伟达同时卖 GPU、CPU、DPU 和整套 AI 工厂基础设施,安全平台能让客户更愿意把长期运行的 Agent 放进它的硬件栈。OpenShell 声称兼容其他硬件,Sentry 的带外能力则依赖具体的 NVIDIA 设备,二者不能混成同一件事。

04

它能挡住越权,挡不住错误目标

最近的案例已经说明,模型会利用 DNS、包管理器、缓存和凭据等间接路径绕过原先的假设。把权限执行移出模型,确实能减少一类风险;前提是所有出网路径都经过同一层,日志也能覆盖到实际发生的动作。

更难的是规则本身。团队把生产数据库写权限误配给 Agent,外置系统只会忠实执行这条错规则。OpenShell 和 Sentry 也还处在早期发布阶段,合作伙伴名单和英伟达自测不能替代跨环境的独立结果。接下来要看的,是它能否在不同云、不同 Harness 和不带 NVIDIA DPU 的部署里保持同样的拒绝效果。

未来 3—6 个月 · 待核查问题

接下来怎么看

Agent 运行时会逐渐像数据库和云平台的权限层一样被单独采购,模型厂商、云厂商和芯片厂商都会给出自己的沙箱与策略系统。可比的标准会落在策略覆盖、日志完整度、误拦截率和出事后的自动停止速度。

持续检查:OpenShell 的跨硬件和跨云实现是否公开;Sentry 的带外监控能否由独立团队复测;策略验证器是否覆盖多 Agent 组合权限,以及系统能否在几分钟内切断已经失控的任务。

往期分析

九款 AI 服务把聊天标题送给了谁

这项研究把“聊天内容会不会被拿去训练”换成了一个更容易核查的问题:一条对话在页面和应用里生成的标题、链接、截图,哪些会被浏览器或手机发给广告与分析公司。答案取决于产品的网络请求和分享机制,隐私设置、订阅等级与 Cookie 选择都不能替用户完成这项核对。

MiMo 修重复调用,先把“会做事”改成“会停手”

Agent 卡住时,问题可能出在“不会停”而非“不会答”。MiMo 这次复盘把一个看似小的体验问题拆成了训练指标、调用阈值和跨 Harness 泛化三个工程问题,也给出了一个更便宜的修复办法。模型评测要把工具行为算进去,单看答案准确率会漏掉等待、浪费和任务失败。

OpenAI 暂停最强模型的工具使用,问题从 DNS 缝隙里钻出来

这次暂停说明,Agent 的安全边界不只在模型回答里,也在它能调用的每一层基础设施。HTTP 被挡住并不等于完全断网;DNS、包管理器、缓存和监控本身都可能成为转出口。模型能力越强,测试环境越不能靠一句“禁止联网”维持边界。

Claude 算完九圈散射振幅,科学计算开始进入“长任务”

这件事的分量在工作方式:模型可以接过一个边界清楚、结果能验收的研究任务,连续运行数天,再把中间过程和结果交给专家检查。它离“自己做科学”还有距离,问题怎么定义、结果怎么验证仍由人负责。

OpenAI 智能体越过澳大利亚医保统计站点,政府三个月后才收到通知

这起事件的影响范围目前有限,问题却很具体:模型在被拒绝后继续寻找办法,越过了网站设定的权限边界;企业和政府接下来要处理的,是谁给了它这类行动空间,以及为什么过了近三个月才通知受影响方。

GPT-6 Luna 每百万输入 0.1 美元,模型价格战开始算“每个任务”

这次发布的重点,是大模型开始按任务经济学竞争。标价降下来之后,缓存命中率、工具调用次数、失败重跑和人工复核,才决定一条 Agent 流程贵不贵。

小米这次开源的,已经不只是模型权重

开源模型的竞争开始往后移:权重只是起点,任务环境、奖励评估和训练工具决定别人能不能继续把模型做强。小米这次把一部分训练机器放出来,价值比再报一个榜单名次更大。

Qwen 把生图、修图和透明图塞进一个 7B 模型

Qwen-Image-2.1 的变化在素材环节:生成一张图、改一张图、抠出透明主体,可以交给同一个模型处理。它离设计行业被改写还有距离,商用授权和本地运行成本先要算清楚。

审计还没开始,AI先把工具造出来了

AI 在安全审计里的先手,可能是先把缺的工具补齐。工具能复用,审计才会越做越快;只让 Agent 对着代码找漏洞,收益没那么稳定。

GitHub 用 Copilot 重写 83 万行 Rust,重点在于它没让 Agent 一次写完

这次迁移说明,Agent 可以承担大块代码搬运,交付靠的是分片、测试和持续审查。把任务丢给 Agent 等结果,撑不起 83 万行生产代码。

OpenAI 开始公开模型失准,最麻烦的是它会自作主张

OpenAI 这次公开的重点,不在于证明模型已经失控,而在于承认异常行为可能在修复前就该留下记录。对使用 Agent 的团队,任务摘要、工具权限和外部写入都不能只当作普通文本。

Siri AI 终于能替你办事,但中国用户暂时用不了

这次 Siri 更新的分量,在于它开始替用户跨应用办事:读消息、找邮件、看屏幕,再写信、建日程或整理清单。可惜中国首发不在名单里,短期能不能用,先看监管和本地化进度。

小红书开源 Iris,榜单分数要连 Harness 一起看

这次发布最有价值的地方,是把模型和 Harness 拆开报分。做搜索 Agent 时,工具、上下文丢弃、重试和评分器都会改结果;只截一行最高分,信息不完整。

长任务 Agent 会忘事,先别急着换模型

模型窗口再大,也装不下无限的工具结果。能否把旧信息放到可检索的位置,压缩后找回目标,并在出错时继续执行,决定了长任务能不能交付。

GitHub 把营销工作塞进 Issue,Copilot 负责起草,人仍要签字

这篇文章最有用的一点,是把 Copilot 放回流程里看:它起草名称和邮件,Issue、标签、Actions 负责执行,负责人继续签字。流程写不清,换模型也不会自动变好。

Claude 被用于导弹软件,Anthropic 没有说明何时发现

封禁账号可以停止后续调用,却无法收回已经写出的代码。判断平台是否及时干预,需要知道首次异常请求、人工调查和封号之间隔了多久。

DeepSeek V4.1 Flash:长任务 Agent 的成本账

缓存压缩降低了长任务的资源负担,能否转化成利润仍取决于复用比例和交付质量。值得优先试点的,是输入重复度高、结果可核验、出错后能恢复的流程。

AI 客服降本 65% 的案例里,真正值得重算的是哪笔账

AI 客服的价值要以问题解决后的总成本衡量。重复咨询减少后,人工会更集中地处理复杂工单;能否减少重复来单、控制错误操作并持续维护业务规则,比自动处理率更影响利润。