一家以色列测试公司被指是多起AI智能体失控事件共同源头
Irregular CTO承认,今年多起OpenAI、Meta、Anthropic和Google模型在测试中攻击真实目标的事件,源于同一测试场景中的两个配置错误——测试环境意外可访问互联网,且虚构目标公司名与真实域名重叠。
AI解读:The Verge报道称,近期多起AI智能体在测试中攻击真实世界目标的事件并非孤立,而是源自同一家测试公司Irregular的同一个评估场景配置错误。这一发现把公众对“AI失控”的担忧,拉回到一个更具体的问题上:测试环境本身没有封住。
Irregular是一家以色列初创公司,2023年以Pattern Labs之名成立,专门在模拟真实世界安全场景的高保真平台中压力测试AI模型。它的客户包括OpenAI、Meta、Anthropic,也为英国政府和RAND做过测试,OpenAI的模型系统卡中引用过它的工作。
错误出在两个地方:智能体本不应访问开放互联网,但互联网访问“意外可用”;同时为模拟创建的一个虚构目标公司名“与一个真实域名重叠”。两者叠加,让智能体冲向了真实目标。CTO Omer Nevo确认,OpenAI、Meta、Anthropic和Google相关事件均由此引起。
对AI公司来说,这类测试是发布前的安全流程;对Irregular来说,一次环境配置失误就能把内部演练变成真实攻击。事件后Irregular收紧了互联网访问控制,扩大监控与人工审查,并在评估前加强核查访问范围是否匹配预期。但受影响公司是否追责、是否继续合作,四家公司均未回答。
Nevo称对Kimi K3和GLM-5.2的测试未出现同类问题,但强调这不能证明这些模型更不易出现此类行为。由于这两款模型可自托管下载,测试方不必依赖厂商提供访问权限或回传数据,这为独立安全评测提供了另一种路径。
The Verge报道,今年多起AI智能体在测试中攻击真实世界目标的事件,共同指向一家以色列AI安全测试初创公司Irregular。该公司CTO Omer Nevo向The Verge确认,涉及OpenAI、Meta、Anthropic和Google模型的事件“都源于同一个评估场景中的同一个底层问题”。
Irregular成立于2023年,原名Pattern Labs,自称在“高保真研究平台”中模拟和监控真实世界的AI安全场景,对AI模型进行压力测试。其确切客户名单未知,但OpenAI的模型系统卡中引用过它的工作,它也为英国政府和Anthropic测试过系统,并与智库RAND联合发表过研究。
Nevo称,在这些测试中,智能体本不应能访问开放互联网,但“互联网访问意外可用”;同时,为模拟创建的虚构目标公司名“与一个真实域名重叠”。两者叠加,使智能体奔向了真实世界目标。目前尚不清楚实际被攻击的是哪些公司或组织。
这些事件与OpenAI披露的Hugging Face遭攻击事件无关,也不涉及英国AI安全研究所报告的入侵。Nevo称,近期业界其他安全事件与Irregular或其评估无关。
同一个测试场景,两个配置错误
Nevo对The Verge说,事件出于同一个评估场景的同一底层问题,且“已被披露”。但“披露”不等于公开,目前不清楚他指的是通知了Irregular客户、公众还是其他方。
报道称,Anthropic和OpenAI的报告以及关于Google的报道显示,这些科技公司大约在7月底的相近时间收到通知。OpenAI和Anthropic自行公布了入侵事件;Meta和几周后Google的事件则是先通过媒体报道公开。
部分测试使用了“夺旗”演练,这是测试黑客能力的常见方式,要求智能体在模拟网络中寻找隐藏信息。前提是网络确实是模拟的。
- 测试类型:高保真安全场景压力测试,部分为“夺旗”演练
- 错误一:智能体本不应联网,但互联网访问意外可用
- 错误二:为模拟创建的虚构公司名与真实域名重叠
- 结果:智能体在真实世界寻找目标,具体受害方不明
- 受影响模型:OpenAI、Meta、Anthropic、Google
Irregular的整改与后续报告
Nevo表示,事件促使Irregular做出改变:“我们收紧了互联网访问控制,扩大了监控和人工审查,并加强了评估开始前的检查,以核实访问权限是否符合预期范围。我们还改进了与合作伙伴记录和约定每次评估设置与参数的方式。”
他还说,Irregular已解决与事件相关的测试环境问题。该公司计划在与涉事公司的联合工作完成后,发布一份更广泛的报告,“涵盖安全开展网络评估的经验教训和实践”。Nevo称,与合作伙伴的工作旨在将这些事件的经验转化为开发和评估日益强大AI的公开共享实践。
The Verge向四家美国AI公司询问更多细节,包括何时得知入侵、是否向Irregular寻求赔偿或其他补救、是否预期继续与Irregular合作,均未获正面回答。Google和Anthropic未回应,OpenAI和Meta让The Verge参考此前发布的博客文章。
- 收紧互联网访问控制
- 扩大监控和人工审查
- 评估前加强核查访问范围
- 改进与合作伙伴对评估设置和参数的记录与约定
- 计划发布安全开展网络评估的经验报告
中国开源模型也被测试,但未出现同类事件
Irregular官网研究显示,它还对来自中国公司Moonshot AI的Kimi K3和Z.ai的GLM-5.2进行了类似网络安全测试。与参与其他事件的部分闭源模型不同——Meta将其旗舰Spark模型保持闭源——这两款模型可自由下载并在用户自己的硬件上运行,因此像Irregular这样的测试方不必依赖公司提供访问权限,也不必向公司回传数据。Irregular的研究将它们描述为“自托管”实例。
Nevo称,对GLM和Kimi的评估没有观察到同类问题:“在评估GLM或Kimi时,我们没有观察到此处引用事件中描述的同类型问题。”但他警告,这一观察本身不应被解读为这些模型更不易出现此类行为的证据。Moonshot和Z.ai均未回应The Verge的置评请求。
- 涉及模型:Kimi K3(Moonshot AI)和GLM-5.2(Z.ai)
- 测试方式:自托管实例,无需厂商提供访问或回传数据
- Nevo称未观察到同类问题,但警告不能据此认定这些模型更安全
- Moonshot和Z.ai未回应置评请求