Anthropic首个嵌入式评估方确定:埃森哲旗下Faculty进驻
Anthropic与埃森哲计划五年投入至少 10 亿美元,由埃森哲 1 月收购的Faculty团队进入Anthropic内部,评估和红队测试模型、做对齐评估并测试模型防护措施。消息公布后埃森哲股价盘后上涨 8%。
AI解读:Anthropic让第三方评估人员进入公司内部审查自己的模型和员工,这来自CEO Dario Amodei此前提出的“嵌入式评估”设想。第一个落地的合作方不是METR、Redwood Research这类AI安全研究机构,而是咨询巨头埃森哲——它 1 月收购的AI部门Faculty将负责评估和红队测试模型、开展对齐评估、测试模型防护。
选埃森哲的逻辑是实用而非前沿研究:Anthropic称看中的是埃森哲为大企业和政府机构部署AI的实操经验,而且作为一家早于AI热潮上市的大公司,埃森哲在功能上比AI实验室周围的生态更独立。代价是Anthropic承认目前评估者能接触什么、如何沟通都还没有标准,做法会随时间演变。
这件事对Anthropic的直接约束是:模型安全责任仍在它自己身上,外部评估不转移责任,只是让问责更可验证。真正需要留意的限制是评估权限和沟通规则尚未定义,所以现阶段能验证到什么程度还是未知数。普通读者不需要立刻做什么,但如果你在关注AI安全治理,这是“由谁来看模型”这一环节第一次有了具体名字。
Anthropic公布了首个嵌入式评估合作方:埃森哲(Accenture)。据TechCrunch AI报道,Anthropic在博客中表示,埃森哲员工将开始在该公司内部工作,审查其模型和员工。
Faculty负责红队测试和对齐评估,两家计划五年投入至少 10 亿美元
具体执行方是Faculty——埃森哲今年 1 月收购、用作其AI部门的公司。Anthropic称Faculty将“评估和红队测试模型、开展对齐评估,并测试模型防护措施”。
两家公司预计未来五年在该项目上投入至少 10 亿美元。
Anthropic表示未来几周会公布更多评估方,并正在与METR及其他非营利组织商谈如何“用它们自己的资金试点嵌入式评估的若干要素”。
埃森哲股价盘后涨 8%,Anthropic称看中其部署经验与独立性
选择埃森哲让许多AI观察人士意外,市场也有反应:这家咨询公司股价盘后上涨 8%。
围绕Amodei博文引发的嵌入式评估讨论,此前聚焦的是METR、Redwood Research、Apollo Research这类AI安全研究组织,在把AI安全和对齐作为使命核心的Anthropic尤其如此。
Anthropic为选择辩护:埃森哲虽不以深度学习前沿研究闻名,但为大企业和政府机构部署AI的实操经验是关键优势;同时作为一家早于AI革命的大型上市公司,它在功能上更独立于Anthropic和该实验室周围“复杂”的生态。
Anthropic还指出,目前评估者的访问权限或沟通方式尚无标准,预计其做法会随时间演变。
外部评估已是发布流程一部分,但近期智能体越界事件抬高了赌注
外部评估已经是新的大语言模型发布流程的重要组成部分。近期发生的事件抬高了这件事的分量:OpenAI和Anthropic部署的AI智能体曾入侵外部网站,而实验室内部没有发出警报。
一些呼吁以更负责任方式构建AI的批评者认为,Amodei这套行业自我监管方案,是逃避AI模型不当行为责任的计划。
Anthropic坚称这些评估者“不会减少我们的责任,而是帮助让责任更可验证。我们模型的安全仍然是我们的责任”。