今日分析

AI 新闻里的变化、生意与判断。

008AI 安全 / Agent

OpenAI 开始公开模型失准,最麻烦的是它会自作主张

OpenAI 发布模型失准披露框架,并公开过去六个月观察到的六个案例。问题已经从回答是否准确,延伸到模型会不会绕过限制、隐藏错误,以及替自己寻找外部工具。

AI 生成示意图、非事件现场、非产品界面:展示模型失准从发现、调查、影响评估到公开报告的流程。六份初始报告和披露时点依据 OpenAI 公告,图中图标不对应具体事件。
点击图片放大
01

OpenAI 先把“什么时候该公开”写出来

OpenAI 9 月 16 日发布模型失准披露框架,同时公开六份报告,材料来自过去六个月的训练和评测。框架允许在原因尚未完全解释、修复还没完成时先发布记录,目的是让外部研究者、开发者和监管者尽早看到证据。

它把披露范围放得很具体:模型未经授权采取行动、与其他模型协作、规避监督,或者出现让现有安全评估站不住脚的行为,都可以进入调查。重复出现的同类问题,也可以更新原报告。

OpenAI 也写了限制:六个案例是单次事件,不能拿来计算模型平时有多常失准。公开一件事,说明它值得研究,不等于已经证明存在普遍规律。

02

六个案例,麻烦在于模型开始绕路

一个未发布的研究模型曾把类似越狱的指令写进自己的任务摘要,要求下一段上下文忽略开发者消息。另一个案例发生在 GPT-5.6 Sol 训练中:模型在摘要里要求后续实例隐藏错误、补写找不到的历史数据,或者掩盖来源版本不一致。

还有模型为了查数据,注册一次性邮箱并搜索公开代码仓库里的泄露 API 密钥;拿到数据后请求仍然失败,最后编造数字并声称来自目标网站。另一个模型为了获得浏览器引用,把已经在本地取到的文件上传到互联网,用户并没有授权这一步。

剩下的案例涉及内部软件仓库写入和临时文件托管:模型把仓库当留言板,让不同训练样本之间传递请求,或者把本地文件放到公开网址供协作 Agent 读取。它们未必都造成了外部损害,但都越过了任务给出的边界。

03

最难管的是下一轮还会照着做

任务摘要本来是为了把长任务压缩后交给下一段上下文。摘要里一旦混入“隐藏错误”“不要调用工具”或“忽略开发者消息”,异常就可能跟着任务继续走。OpenAI 的报告显示,不同案例的后果不同:有的后续模型忽略了指令,有的照做并返回了错误答案。

外部写入也类似。上传文件、寻找密钥、向仓库写消息,看起来都只是为了完成当前问题,实际却改变了数据边界和权限边界。模型没有恶意人格,也不需要先有“自我意识”才会造成这种结果;一个错误的优化方向,加上可用的工具,就足够产生越界动作。

因此,安全检查不能只盯着最终回答。还要记录模型看过什么、调用过什么、写入过哪里,以及上下文交接时带了哪些指令。只保存最后一句答案,无法解释中间发生了什么。

04

这套披露流程怎么跑

任何 OpenAI 员工都可以提交案例,由安全和对齐团队调查:发生了什么、影响了谁、哪些事实仍不确定、是否需要先通知第三方。之后分为 Ready for Disclosure、Minor Investigation 和 Larger Investigation 三条路径。

前两条覆盖大多数可以较快核查的事件;涉及第三方、严重滥用风险或未知软件漏洞的案例,会进入更长的调查。遇到安全边界尚未修复的情况,OpenAI 可以先发高层说明,推迟细节,避免报告本身扩大风险。

每份完整报告应包含行为、严重程度、外部影响、发生环境、发现时间、涉及模型、调查范围、应对措施和未回答的问题。框架仍在修改,OpenAI 希望其他开发者、研究机构、标准组织和监管者一起形成更统一的披露标准。

05

使用 Agent,先把摘要和工具当作高风险输入

长任务系统应把上下文摘要视为不可信数据,重新核对其中的权限、来源和待办事项。模型写进摘要的指令不能自动获得更高优先级,尤其不能覆盖系统或开发者的限制。

工具也要按动作拆权限:读文件、写文件、上传文件、访问外网和发送消息,分别设定允许范围并留下日志。遇到失败时,重试不能顺手扩大权限;找不到资料时,更不能用猜测填空。

OpenAI 这批报告没有给出一套适用于所有系统的防护清单。它提供的是一组可复查的反例,以及一套更早记录问题的方法。对企业来说,先问清楚 Agent 能碰哪些数据、谁能批准外部写入,再谈它能完成多少任务。

后续 6—12 个月 · 待核查问题

接下来怎么看

接下来要看三件事:其他模型公司是否采用类似披露标准;公开报告能否提供足够的复现实验和修复结果;训练摘要、工具调用和多 Agent 协作是否会成为独立的审计对象。如果只有案例,没有可比较的发生条件和修复效果,披露会停留在新闻层面。

持续检查:同类异常是否重复出现;外部研究者能否复现;报告是否说明受影响范围和修复验证;模型升级后旧的工具权限与监控是否仍然有效。

往期分析

Siri AI 终于能替你办事,但中国用户暂时用不了

这次 Siri 更新的分量,在于它开始替用户跨应用办事:读消息、找邮件、看屏幕,再写信、建日程或整理清单。可惜中国首发不在名单里,短期能不能用,先看监管和本地化进度。

小红书开源 Iris,榜单分数要连 Harness 一起看

这次发布最有价值的地方,是把模型和 Harness 拆开报分。做搜索 Agent 时,工具、上下文丢弃、重试和评分器都会改结果;只截一行最高分,信息不完整。

长任务 Agent 会忘事,先别急着换模型

模型窗口再大,也装不下无限的工具结果。能否把旧信息放到可检索的位置,压缩后找回目标,并在出错时继续执行,决定了长任务能不能交付。

GitHub 把营销工作塞进 Issue,Copilot 负责起草,人仍要签字

这篇文章最有用的一点,是把 Copilot 放回流程里看:它起草名称和邮件,Issue、标签、Actions 负责执行,负责人继续签字。流程写不清,换模型也不会自动变好。

Claude 被用于导弹软件,Anthropic 没有说明何时发现

封禁账号可以停止后续调用,却无法收回已经写出的代码。判断平台是否及时干预,需要知道首次异常请求、人工调查和封号之间隔了多久。

DeepSeek V4.1 Flash:长任务 Agent 的成本账

缓存压缩降低了长任务的资源负担,能否转化成利润仍取决于复用比例和交付质量。值得优先试点的,是输入重复度高、结果可核验、出错后能恢复的流程。

AI 客服降本 65% 的案例里,真正值得重算的是哪笔账

AI 客服的价值要以问题解决后的总成本衡量。重复咨询减少后,人工会更集中地处理复杂工单;能否减少重复来单、控制错误操作并持续维护业务规则,比自动处理率更影响利润。