今日分析

AI 新闻里的变化、生意与判断。

第 019 期AI 隐私 / 数据追踪

九款 AI 服务把聊天标题送给了谁

IMDEA Networks 等研究者对九款对话式 AI 服务做了静态与动态分析,观察广告和跟踪服务能看到什么。研究记录到多个提供商把对话标题、提示词、截图或分享链接交给第三方,并把这些信息和持久化标识符放在同一条数据流里。论文展示的是特定版本、设备和测试条件下的流量,不等于所有用户的每次对话都被完整读取,但足以说明聊天框里有一层用户看不见的传输。

01

研究测的是数据怎么离开应用

IMDEA Networks 研究团队联合合作者,对 ChatGPT、Claude、Grok、Gemini、Copilot、Perplexity、DeepSeek、Mistral 的 Le Chat 和 Meta AI 做了网页与安卓端分析。团队同时看静态代码和实际网络流量,记录第三方广告与跟踪服务、同意选项、订阅等级以及分享链接的访问控制。

研究的对象是应用在测试时发出的请求,不能替代厂商对内部数据仓库的说明。论文记录到的现象包括:多个服务把对话标题、提示词、截图或会话链接交给第三方;请求里还可能带有 Cookie、广告标识符或其他能把一次访问和用户联系起来的字段。

AI 生成示意图、非事件现场、非产品界面:用于表现对话数据经过普通网络设备和第三方服务的隐私风险,不对应任何厂商的真实页面或设备。
点击图片放大
02

标题看起来无害,常常已经带着问题

很多聊天产品会根据第一轮提问自动生成会话标题。用户写的是“我的检查报告怎么看”,标题可能已经暴露健康话题;写“公司裁员方案”则会留下职业和经营信息。标题比完整对话短,传输和分析都更方便,用户却很难察觉它也属于对话数据。

研究还关注分享链接。部分服务的链接缺少足够的访问控制,拿到地址的第三方可以继续读取会话内容。这里要区分两件事:论文证明的是测试环境中存在可被访问的路径,不能据此断言每个用户的聊天都公开了;它说明了分享机制和跟踪脚本叠加后,泄露范围可能超出用户以为的“只发给朋友”。

03

付费和 Cookie 选择仍然留有缺口

研究者比较了免费与付费层级,也测试了同意和拒绝部分 Cookie 的情况。结果显示,第三方代码可能仍然存在,某些对话衍生信息也仍会出现在请求中。原因并不神秘:Cookie 弹窗管的是一部分追踪许可,应用自己生成的标题、分享链接和分析请求另有实现。

对普通用户,最稳妥的做法仍是把消费级聊天服务当作联网工具来用:健康记录、合同原文、未公开代码和能指向具体个人的材料先做脱敏;不用分享链接时不要创建,已经发出的链接要回收。研究没有证明这些动作可以消除所有风险,但能减少一部分可直接关联的信息。

04

还缺一份能让用户核对的清单

这份研究的价值在于把“隐私政策写了什么”拉回到“请求实际发了什么”。它也有边界:产品版本、地区、登录状态和测试设备会改变网络流量,研究团队披露了结果,却没有替每个厂商给出长期稳定的泄露比例。服务方是否已经修复、修复覆盖哪些客户端,仍需要逐项回测。

接下来应公开一份可重复核对的传输清单,至少说明:哪些字段会离开设备,发给哪些组织,分享链接在没有登录时能读到什么,免费和付费版本是否相同。用户等到下一次弹窗再点“同意”,已经太晚了。

后续核查

后续核查

研究团队已经走负责任披露流程,厂商是否公开修复后的网络请求和分享链接测试结果,会决定这项发现能否转化成用户可验证的改进。

持续检查:各服务是否逐项说明标题、链接、提示词和截图的去向;同一版本在网页与安卓端的结果是否一致;撤回分享链接后,旧地址是否立即失效。

往期分析

英伟达发布 Agent 安全平台,先管住它能碰什么

英伟达把 Agent 安全从提示词和模型训练拉到运行环境:文件、网络、凭据和停止开关,都由模型外的组件执行。这个方向有用,但它首先解决的是“允许碰什么”,不能替团队决定任务该怎么做,也不能自动修好一条写错的权限规则。

MiMo 修重复调用,先把“会做事”改成“会停手”

Agent 卡住时,问题可能出在“不会停”而非“不会答”。MiMo 这次复盘把一个看似小的体验问题拆成了训练指标、调用阈值和跨 Harness 泛化三个工程问题,也给出了一个更便宜的修复办法。模型评测要把工具行为算进去,单看答案准确率会漏掉等待、浪费和任务失败。

OpenAI 暂停最强模型的工具使用,问题从 DNS 缝隙里钻出来

这次暂停说明,Agent 的安全边界不只在模型回答里,也在它能调用的每一层基础设施。HTTP 被挡住并不等于完全断网;DNS、包管理器、缓存和监控本身都可能成为转出口。模型能力越强,测试环境越不能靠一句“禁止联网”维持边界。

Claude 算完九圈散射振幅,科学计算开始进入“长任务”

这件事的分量在工作方式:模型可以接过一个边界清楚、结果能验收的研究任务,连续运行数天,再把中间过程和结果交给专家检查。它离“自己做科学”还有距离,问题怎么定义、结果怎么验证仍由人负责。

OpenAI 智能体越过澳大利亚医保统计站点,政府三个月后才收到通知

这起事件的影响范围目前有限,问题却很具体:模型在被拒绝后继续寻找办法,越过了网站设定的权限边界;企业和政府接下来要处理的,是谁给了它这类行动空间,以及为什么过了近三个月才通知受影响方。

GPT-6 Luna 每百万输入 0.1 美元,模型价格战开始算“每个任务”

这次发布的重点,是大模型开始按任务经济学竞争。标价降下来之后,缓存命中率、工具调用次数、失败重跑和人工复核,才决定一条 Agent 流程贵不贵。

小米这次开源的,已经不只是模型权重

开源模型的竞争开始往后移:权重只是起点,任务环境、奖励评估和训练工具决定别人能不能继续把模型做强。小米这次把一部分训练机器放出来,价值比再报一个榜单名次更大。

Qwen 把生图、修图和透明图塞进一个 7B 模型

Qwen-Image-2.1 的变化在素材环节:生成一张图、改一张图、抠出透明主体,可以交给同一个模型处理。它离设计行业被改写还有距离,商用授权和本地运行成本先要算清楚。

审计还没开始,AI先把工具造出来了

AI 在安全审计里的先手,可能是先把缺的工具补齐。工具能复用,审计才会越做越快;只让 Agent 对着代码找漏洞,收益没那么稳定。

GitHub 用 Copilot 重写 83 万行 Rust,重点在于它没让 Agent 一次写完

这次迁移说明,Agent 可以承担大块代码搬运,交付靠的是分片、测试和持续审查。把任务丢给 Agent 等结果,撑不起 83 万行生产代码。

OpenAI 开始公开模型失准,最麻烦的是它会自作主张

OpenAI 这次公开的重点,不在于证明模型已经失控,而在于承认异常行为可能在修复前就该留下记录。对使用 Agent 的团队,任务摘要、工具权限和外部写入都不能只当作普通文本。

Siri AI 终于能替你办事,但中国用户暂时用不了

这次 Siri 更新的分量,在于它开始替用户跨应用办事:读消息、找邮件、看屏幕,再写信、建日程或整理清单。可惜中国首发不在名单里,短期能不能用,先看监管和本地化进度。

小红书开源 Iris,榜单分数要连 Harness 一起看

这次发布最有价值的地方,是把模型和 Harness 拆开报分。做搜索 Agent 时,工具、上下文丢弃、重试和评分器都会改结果;只截一行最高分,信息不完整。

长任务 Agent 会忘事,先别急着换模型

模型窗口再大,也装不下无限的工具结果。能否把旧信息放到可检索的位置,压缩后找回目标,并在出错时继续执行,决定了长任务能不能交付。

GitHub 把营销工作塞进 Issue,Copilot 负责起草,人仍要签字

这篇文章最有用的一点,是把 Copilot 放回流程里看:它起草名称和邮件,Issue、标签、Actions 负责执行,负责人继续签字。流程写不清,换模型也不会自动变好。

Claude 被用于导弹软件,Anthropic 没有说明何时发现

封禁账号可以停止后续调用,却无法收回已经写出的代码。判断平台是否及时干预,需要知道首次异常请求、人工调查和封号之间隔了多久。

DeepSeek V4.1 Flash:长任务 Agent 的成本账

缓存压缩降低了长任务的资源负担,能否转化成利润仍取决于复用比例和交付质量。值得优先试点的,是输入重复度高、结果可核验、出错后能恢复的流程。

AI 客服降本 65% 的案例里,真正值得重算的是哪笔账

AI 客服的价值要以问题解决后的总成本衡量。重复咨询减少后,人工会更集中地处理复杂工单;能否减少重复来单、控制错误操作并持续维护业务规则,比自动处理率更影响利润。