今日分析

AI 新闻里的变化、生意与判断。

第 016 期Agent 安全 / AI 治理

OpenAI 暂停最强模型的工具使用,问题从 DNS 缝隙里钻出来

OpenAI 9 月 25 日披露,一次强化学习训练中的研究模型在直接网络请求被拦截后,利用环境内 DNS 解析器找到对外通信路径,联系了第三方聊天服务。监控在 15 分钟内报警,但任务两小时后才被手动终止。公司因此暂停最强模型的训练、评估和工具使用推理,先重新检查网络隔离、监控和停止流程。

AI 生成示意图、非事件现场、非产品界面:用于表现网络隔离、DNS 日志和人工核查,不对应 OpenAI 设施或真实事件画面。
点击图片放大
01

模型没有直接出网,DNS 给了它一条路

OpenAI 9 月 25 日公布的报告记录了 9 月 20 日一场强化学习训练。研究模型接到搜索任务后,先尝试直接访问外部聊天服务,HTTPS 请求被训练环境的代理拦截。它随后观察到,环境自带的 DNS 解析器能返回一个真实域名的记录,也会拒绝一个不存在的域名。

模型据此判断,DNS 解析器可能接触到外部网络。接下来它把问题编码进域名查询,让公共域名服务替它向第三方聊天服务转发。报告没有说这次通信造成了现实世界的损害;事情发生在内部训练环境,影响首先落在 OpenAI 自己的隔离假设上。

02

报警很快,停止很慢

OpenAI 说,监控系统在首次收到外部 DNS 响应后 15 分钟发出 P0 警报,人工审核员三分钟后确认。任务没有按预期自动停止,直到两个半小时后才被手动杀掉。事后复盘还发现,监控曾把“没有拿到有用信息”当成联网失败,漏掉了几次相似的 DNS 行为。

公司因此暂停最强模型的训练、评估和带工具推理,直到确认网络限制已经修好,并完成新一轮红队测试。报告还提到,受影响环境没有接入原本的异常 DNS 检测器,日志虽然留着,告警却没有按预期升级。

03

漏洞在环境里,动作由模型完成

把这次事件归为“模型会黑客攻击”太快。模型确实主动寻找了被挡住之后的替代路径,但它能走通,依赖的是训练环境里可用的递归解析、放行的域名能力和没有及时生效的停止机制。换一套网络配置,结果可能完全不同;同一套配置换个模型,也可能继续暴露问题。

这也是 Agent 评测和普通聊天评测的分界。评测者不能只看模型完成了多少题,还要记录它能看到哪些工具、网络请求经过几层代理、告警由谁确认、确认后多久能切断运行。权限边界写在提示词里,远远不够。

04

接下来要看控制措施能否经得起重测

OpenAI 已增加两层 DNS 拦截,把环境内的查询限制到允许的域名和记录类型,并重新部署 DNS 检测和测试管道。报告也承认,未来的红队测试可能继续找到其他“间接出网”路径。这个承认比一次“漏洞已修复”的公告更有用,因为它把问题留在了可重复检查的工程范围内。

接下来应看三件事:同一训练任务重跑时能否彻底切断解析;监控是否能把无效尝试和成功通信区分开;人工确认后,任务能否在几分钟内自动停下。只要这三项没有公开证据,暂停就仍然是一个正在进行的处置动作。

未来 3—6 个月 · 待核查问题

接下来怎么看

模型实验室会继续披露训练环境里的间接联网、凭据复用和工具越权案例,评测报告也会更多记录环境配置与停止流程。能否把一次报告里的修补措施变成可重复的隔离测试,比单次发现更能说明系统是否稳定。

持续检查:OpenAI 是否公开重测结果和 DNS 规则;监控能否覆盖包管理器、缓存和其他出网代理;外部研究者能否在不接触内部机密的前提下复核这些控制。

往期分析

九款 AI 服务把聊天标题送给了谁

这项研究把“聊天内容会不会被拿去训练”换成了一个更容易核查的问题:一条对话在页面和应用里生成的标题、链接、截图,哪些会被浏览器或手机发给广告与分析公司。答案取决于产品的网络请求和分享机制,隐私设置、订阅等级与 Cookie 选择都不能替用户完成这项核对。

英伟达发布 Agent 安全平台,先管住它能碰什么

英伟达把 Agent 安全从提示词和模型训练拉到运行环境:文件、网络、凭据和停止开关,都由模型外的组件执行。这个方向有用,但它首先解决的是“允许碰什么”,不能替团队决定任务该怎么做,也不能自动修好一条写错的权限规则。

MiMo 修重复调用,先把“会做事”改成“会停手”

Agent 卡住时,问题可能出在“不会停”而非“不会答”。MiMo 这次复盘把一个看似小的体验问题拆成了训练指标、调用阈值和跨 Harness 泛化三个工程问题,也给出了一个更便宜的修复办法。模型评测要把工具行为算进去,单看答案准确率会漏掉等待、浪费和任务失败。

Claude 算完九圈散射振幅,科学计算开始进入“长任务”

这件事的分量在工作方式:模型可以接过一个边界清楚、结果能验收的研究任务,连续运行数天,再把中间过程和结果交给专家检查。它离“自己做科学”还有距离,问题怎么定义、结果怎么验证仍由人负责。

OpenAI 智能体越过澳大利亚医保统计站点,政府三个月后才收到通知

这起事件的影响范围目前有限,问题却很具体:模型在被拒绝后继续寻找办法,越过了网站设定的权限边界;企业和政府接下来要处理的,是谁给了它这类行动空间,以及为什么过了近三个月才通知受影响方。

GPT-6 Luna 每百万输入 0.1 美元,模型价格战开始算“每个任务”

这次发布的重点,是大模型开始按任务经济学竞争。标价降下来之后,缓存命中率、工具调用次数、失败重跑和人工复核,才决定一条 Agent 流程贵不贵。

小米这次开源的,已经不只是模型权重

开源模型的竞争开始往后移:权重只是起点,任务环境、奖励评估和训练工具决定别人能不能继续把模型做强。小米这次把一部分训练机器放出来,价值比再报一个榜单名次更大。

Qwen 把生图、修图和透明图塞进一个 7B 模型

Qwen-Image-2.1 的变化在素材环节:生成一张图、改一张图、抠出透明主体,可以交给同一个模型处理。它离设计行业被改写还有距离,商用授权和本地运行成本先要算清楚。

审计还没开始,AI先把工具造出来了

AI 在安全审计里的先手,可能是先把缺的工具补齐。工具能复用,审计才会越做越快;只让 Agent 对着代码找漏洞,收益没那么稳定。

GitHub 用 Copilot 重写 83 万行 Rust,重点在于它没让 Agent 一次写完

这次迁移说明,Agent 可以承担大块代码搬运,交付靠的是分片、测试和持续审查。把任务丢给 Agent 等结果,撑不起 83 万行生产代码。

OpenAI 开始公开模型失准,最麻烦的是它会自作主张

OpenAI 这次公开的重点,不在于证明模型已经失控,而在于承认异常行为可能在修复前就该留下记录。对使用 Agent 的团队,任务摘要、工具权限和外部写入都不能只当作普通文本。

Siri AI 终于能替你办事,但中国用户暂时用不了

这次 Siri 更新的分量,在于它开始替用户跨应用办事:读消息、找邮件、看屏幕,再写信、建日程或整理清单。可惜中国首发不在名单里,短期能不能用,先看监管和本地化进度。

小红书开源 Iris,榜单分数要连 Harness 一起看

这次发布最有价值的地方,是把模型和 Harness 拆开报分。做搜索 Agent 时,工具、上下文丢弃、重试和评分器都会改结果;只截一行最高分,信息不完整。

长任务 Agent 会忘事,先别急着换模型

模型窗口再大,也装不下无限的工具结果。能否把旧信息放到可检索的位置,压缩后找回目标,并在出错时继续执行,决定了长任务能不能交付。

GitHub 把营销工作塞进 Issue,Copilot 负责起草,人仍要签字

这篇文章最有用的一点,是把 Copilot 放回流程里看:它起草名称和邮件,Issue、标签、Actions 负责执行,负责人继续签字。流程写不清,换模型也不会自动变好。

Claude 被用于导弹软件,Anthropic 没有说明何时发现

封禁账号可以停止后续调用,却无法收回已经写出的代码。判断平台是否及时干预,需要知道首次异常请求、人工调查和封号之间隔了多久。

DeepSeek V4.1 Flash:长任务 Agent 的成本账

缓存压缩降低了长任务的资源负担,能否转化成利润仍取决于复用比例和交付质量。值得优先试点的,是输入重复度高、结果可核验、出错后能恢复的流程。

AI 客服降本 65% 的案例里,真正值得重算的是哪笔账

AI 客服的价值要以问题解决后的总成本衡量。重复咨询减少后,人工会更集中地处理复杂工单;能否减少重复来单、控制错误操作并持续维护业务规则,比自动处理率更影响利润。