模型TechCrunch AI·原文 2026年9月18日

Baseten旗下Base Labs联合Hugging Face、Goodfire推出开放权重模型安全标准

Baseten的研究部门Base Labs与Hugging Face、Goodfire AI合作,为开放权重模型建设安全评估与监控基础设施,应对通过“消融”技术移除模型安全防护的问题。

AI解读:开放权重模型的安全问题正变得越来越具体:Hugging Face上目前列出了超过 6000 个被“消融”的模型,即有人通过这种技术去掉了模型原有的安全防护。Baseten的研究部门Base Labs因此联合Hugging Face和Goodfire AI,想做一套训练和监控开放模型的安全基础设施标准。

这套标准的思路是把安全做进模型训练和部署的流程里,而不是事后补上。对开发和部署开放模型的人来说,这意味着未来可能有一套公开的方法来评估和监控模型行为,而不是各自摸索。不过三家公司没有披露具体技术方案,所以现在能确定的只是合作方向和参与方。

Goodfire擅长解释模型内部决策,Base Labs负责研究和发布方法,Hugging Face提供模型托管平台,分工上看有可能覆盖从训练到分发的环节。Baseten还在公开征集开发者参与框架建设,最终这套标准能否被广泛采用,取决于后续公开的方法和生态响应。

Baseten周三联合旗下研究部门Base Labs,与Hugging Face和Goodfire AI合作,为开放权重模型建设安全评估与监控基础设施。

这一合作宣布之际,开放权重模型的安全性正引发讨论:通过一种名为“消融”(abliteration)的技术移除模型安全防护,可以让开放权重模型变得危险。Hugging Face目前列出了超过 6000 个被消融的模型。

Base Labs是Baseten今年早些时候成立的研究团队,将开发和发布用于训练和监控开放模型的方法。Baseten将这一未来工作定位为开放模型的“标准”,透明且内置于模型的训练和部署方式中,而不是事后附加。

Baseten在X上表示:“我们相信开放性是AI安全的一种优势。开放性提供了更多模型行为的可见性,最重要的是,比闭源提供了更多将安全研究转化为可操作、透明控制的手段。”

三家公司尚未披露合作在技术上如何运作。Goodfire在回复Baseten帖子时将目标概括为:“安全必须内置于开放模型中,并由提供模型服务的人来提供。”

Baseten是一家AI推理提供商,今年 6 月完成 15 亿美元F轮融资,估值达到 130 亿美元。合作伙伴Goodfire AI同样资金充足,今年早些时候完成了由B Capital领投的 1.5 亿美元B轮融资,用于推进其模型可解释性平台。

Baseten公开征集开发者参与框架

Baseten正在向更广泛的开发者生态发出公开呼吁,希望其为该框架作出贡献。

Baseten表示:“我们正在共同构建一个对所有人安全且可访问的开放模型生态。”

信息来源

TechCrunch AI原始来源