今日分析

AI 新闻里的变化、生意与判断。

010AI 编程 / 安全审计

审计还没开始,AI先把工具造出来了

Trail of Bits 为 Miden zkVM 审计,先用 Claude 和 Codex 补齐开发工具,再把这些工具用于静态分析和形式化验证。结果发现 400 多处类型校验问题、1 个高危漏洞,以及测试没抓到的两个细微 bug。

AI 生成示意图、非事件现场、非产品界面:根据 Trail of Bits 公布的审计流程和结果绘制;数字来自原文,图标不对应具体软件界面。
点击图片放大
01

他们先花六个月造工具

Trail of Bits 9 月 18 日写了一篇 Miden zkVM 审计复盘。Miden 的核心库用了自定义汇编语言 MASM,几乎没有 IDE 支持、代码导航和检查器。团队没有直接把 Agent 丢进代码库里找问题,先问了一个很实际的问题:审计开始前,缺什么工具?

接下来的六个月,Claude 和 Codex 做了 LSP、VS Code 扩展、反编译器、静态分析器和 Lean 执行器模型。Agent 负责规划、写代码和互相检查,人负责确定要证明的性质、看结果是否说得通。

02

这次准备没有白做

审计时,静态分析找出 400 多处类型校验可以加强的位置,全部能从公开 API 触达。其中有一个高危问题:程序没有验证 prover 提供的余数,攻击者可能利用它伪造 Falcon 签名,抽走由这类密钥控制的资金。原文说的是可被利用的风险,没有披露真实资金已经被盗。

Lean 还产出了 95 个机器验证的正确性证明,并找到了两个现有单元测试没覆盖到的细小 bug。一个和 64 位右旋有关,另一个出在 256 位乘法的栈处理上。

03

AI 的价值在审计前就出现了

很多 AI 安全演示都在说 Agent 能一次读多少代码、报出多少漏洞。Trail of Bits 这篇文章换了个顺序:先让 Agent 把人想要的工具做出来,再让工具和人一起审计。LSP 解决阅读问题,反编译器把陌生汇编变成可分析的中间表示,静态分析和 Lean 负责反复检查。

这条路的经济账也变了。以前很难为一个结果不确定的半年工具项目拿预算;现在失败的试验主要消耗模型调用和工程时间。工具如果能留在团队里,下一次审计还能继续用。

04

这不等于审计可以交给 Agent

这是一家安全公司的单个项目,代码有明确范围,团队也有足够时间把工具做深。普通团队照抄六个月周期,未必划算。已有成熟编译器、类型系统和测试的项目,新增工具的收益会小很多;自定义语言、协议和数据格式,才更适合先让 Agent 补基础设施。

形式化证明也只证明写下来的性质。定理写错、模型漏掉边界,证明照样能通过。Trail of Bits 仍然需要人工审计定理和高危发现,说明 Agent 负责扩大检查面,人负责确认问题是否属于真实风险。

未来 6—12 个月 · 待核查问题

接下来怎么看

未来半年到一年,AI 在安全工程里更可能先成为“审计前的工具开发者”,再成为审计员。要看这套 LSP、静态分析和证明工具能否复用到下一批项目,以及团队是否公开误报率、修复时间和后续缺陷;只有一篇漂亮复盘,还不足以说明行业已经换了玩法。

持续检查:安全公司是否把 Agent 生成的工具带到多个项目;类型问题和高危漏洞的误报率是否披露;形式化证明覆盖的代码是否扩大;客户是否愿意为这段准备工作单独付费。

往期分析

GPT-6 Luna 每百万输入 0.1 美元,模型价格战开始算“每个任务”

这次发布的重点,是大模型开始按任务经济学竞争。标价降下来之后,缓存命中率、工具调用次数、失败重跑和人工复核,才决定一条 Agent 流程贵不贵。

小米这次开源的,已经不只是模型权重

开源模型的竞争开始往后移:权重只是起点,任务环境、奖励评估和训练工具决定别人能不能继续把模型做强。小米这次把一部分训练机器放出来,价值比再报一个榜单名次更大。

Qwen 把生图、修图和透明图塞进一个 7B 模型

Qwen-Image-2.1 的变化在素材环节:生成一张图、改一张图、抠出透明主体,可以交给同一个模型处理。它离设计行业被改写还有距离,商用授权和本地运行成本先要算清楚。

GitHub 用 Copilot 重写 83 万行 Rust,重点在于它没让 Agent 一次写完

这次迁移说明,Agent 可以承担大块代码搬运,交付靠的是分片、测试和持续审查。把任务丢给 Agent 等结果,撑不起 83 万行生产代码。

OpenAI 开始公开模型失准,最麻烦的是它会自作主张

OpenAI 这次公开的重点,不在于证明模型已经失控,而在于承认异常行为可能在修复前就该留下记录。对使用 Agent 的团队,任务摘要、工具权限和外部写入都不能只当作普通文本。

Siri AI 终于能替你办事,但中国用户暂时用不了

这次 Siri 更新的分量,在于它开始替用户跨应用办事:读消息、找邮件、看屏幕,再写信、建日程或整理清单。可惜中国首发不在名单里,短期能不能用,先看监管和本地化进度。

小红书开源 Iris,榜单分数要连 Harness 一起看

这次发布最有价值的地方,是把模型和 Harness 拆开报分。做搜索 Agent 时,工具、上下文丢弃、重试和评分器都会改结果;只截一行最高分,信息不完整。

长任务 Agent 会忘事,先别急着换模型

模型窗口再大,也装不下无限的工具结果。能否把旧信息放到可检索的位置,压缩后找回目标,并在出错时继续执行,决定了长任务能不能交付。

GitHub 把营销工作塞进 Issue,Copilot 负责起草,人仍要签字

这篇文章最有用的一点,是把 Copilot 放回流程里看:它起草名称和邮件,Issue、标签、Actions 负责执行,负责人继续签字。流程写不清,换模型也不会自动变好。

Claude 被用于导弹软件,Anthropic 没有说明何时发现

封禁账号可以停止后续调用,却无法收回已经写出的代码。判断平台是否及时干预,需要知道首次异常请求、人工调查和封号之间隔了多久。

DeepSeek V4.1 Flash:长任务 Agent 的成本账

缓存压缩降低了长任务的资源负担,能否转化成利润仍取决于复用比例和交付质量。值得优先试点的,是输入重复度高、结果可核验、出错后能恢复的流程。

AI 客服降本 65% 的案例里,真正值得重算的是哪笔账

AI 客服的价值要以问题解决后的总成本衡量。重复咨询减少后,人工会更集中地处理复杂工单;能否减少重复来单、控制错误操作并持续维护业务规则,比自动处理率更影响利润。