Google DeepMind发布SynthID Bio,为AI生成蛋白质嵌入可验证水印
该水印直接写入生物代码,在湿实验中覆盖VEGF-A、SARS-CoV-2刺突蛋白RBD和PD-L1三个靶点,水印版本的命中率、结合亲和力与天然序列多样性均与未水印版本持平。
AI解读:Google DeepMind把SynthID水印从图像、文本搬到了合成生物学:新工具SynthID Bio在蛋白质序列和 3D结构中嵌入不可感知的签名,实验室测试中不改变蛋白质的生物学功能。
它想解决的是DNA合成筛查的缺口。AI能设计出与已知危险序列几乎不相似的全新蛋白质,合成厂商过去把陌生序列当成未发现的天然生物,现在不能这么假设,而人工审查会拖慢研究。水印可以作为一个自动验证信号,证明订单来自带内置安全措施的受信任模型。
对设计蛋白的研究者来说,这次改变的是“溯源”这件事:水印不依赖谁运行模型,而是写进模型权重和生物代码本身。限制也很明确——论文仍是概念验证,水印对蓄意篡改的鲁棒性还是待解问题,而且需要社区、合成厂商和政策方一起配合才能兑现生物安全收益。
Google DeepMind于 9 月 30 日发布SynthID Bio,一种针对合成生物学的蛋白质水印方法,用于标识AI生成的蛋白质序列和预测 3D结构。该公告称这是概念验证(proof of concept),目标是在保留蛋白质生物功能的前提下,为AI设计的生物分子提供可检测的来源信号。
SynthID Bio会依据数据类型调整做法:对序列,悄悄引导氨基酸的选择;对预测的 3D结构,调整原子坐标,从而留下可检测的信号。DeepMind称这些调整在实验中未损害蛋白质的生物学功能。
论文作者为Pushmeet Kohli、David Stutz、Ali Cowen-Rivers和Jeremy Ratcliff。该项目由Pushmeet Kohli发起,Alexander I. Cowen-Rivers和David Stutz领导研究与技术开发。
在三个靶点上做湿实验:水印版本与未水印版本指标持平
DeepMind用蛋白质结合体(binder)设计方法AlphaProteo,配合SynthID Bio版本的ProteinMPNN(一种常用的蛋白质序列生成方法)来验证该方法。
湿实验测试覆盖三个靶点蛋白:VEGF-A、SARS-CoV-2刺突蛋白RBD和PD-L1。公告称,水印设计的命中率(hit rate)、结合亲和力(以KD衡量,数值越低结合越强)以及天然序列多样性,都与未水印版本相当,并称这成功创造了首批既有水印又有生物功能的蛋白质结合体。
公告附有用水印VEGF-A蛋白结合体预测结构的可视化图,水印信号按每个氨基酸以颜色标示;另有三个靶点上水印与非水印设计结合亲和力的对比图。
- 验证方法:AlphaProteo + SynthID Bio版ProteinMPNN
- 测试靶点:VEGF-A、SARS-CoV-2刺突蛋白RBD、PD-L1
- 衡量指标:命中率、结合亲和力(KD)、序列多样性,公告称均与未水印版本持平
- 体外验证由Adaptyv Bio协助
对AlphaFold 3做微调,水印写进模型权重
针对蛋白质折叠,SynthID Bio微调AlphaFold 3扩散网络的一小部分,把水印能力直接构建进模型权重,因此无论谁运行该模型,预测出的 3D坐标都自带可检测签名。
DeepMind称,SynthID Bio在保持AlphaFold 3预测精度的同时,实现了接近完美的可检测性,维持了关键结构特征的分布,并且能抵御数字噪声或轻微的坐标改动。公告以 7PPA为例,展示了AF3预测结构、真实结构和加水印结构三张图。
- 做法:微调AlphaFold 3扩散网络的一小部分
- 声称:预测精度保持,可检测性接近完美,抗数字噪声和轻微坐标变化
- 图中示例:7PPA的AF3预测结构、真实结构、水印结构
直指DNA合成筛查与数据库标注
公告把生物安全比作“瑞士奶酪”模型:多层独立防护叠加,彼此覆盖盲区。模型层缓解措施和客户审查各是一层,都存在潜在缺口;SynthID Bio被定位为嵌入生物设计本身的一层切实验证。
这项能力对DNA合成筛查尤其关键。把数字蛋白质设计变成实体分子,需要向DNA合成厂商下单,厂商会对照已知威胁数据库筛查请求。历史上不熟悉的序列可能被安全地假定为未发现的天然生物,但由于AI能创造出与已知危害几乎不相似的全新序列,筛查方不能再这样假设。验证一个陌生订单是否为工程化威胁需要详尽的人工审查,可能拖慢重要研究。SynthID Bio可提供自动验证信号,证明订单出自带内置安全措施的受信任模型。
生物安全政策专家、Science Policy Consulting负责人Sarah Carter表示,SynthID Bio是追踪生物设计来源的重要一块拼图;通过把设计与模型开发者关联起来,这些水印让开发者能在安全上领先,也让合成提供商能更快筛查使用了相关模型的客户。
Twist Bioscience政策与生物安全副总裁James Diggans表示,对Twist而言,水印是生物安全工具箱中一个很有前景的新增项,有望加强筛查、把资源集中到需要更仔细审查的序列上,并随着AI设计的生物学不断推进,让生物安全更高效。Twist曾为该论文提供早期反馈。
公告还提到,SynthID Bio可能有助于维护Protein Data Bank、UniProt和GenBank等数据库的完整性。这些数据库许多允许公开提交,对科学进展至关重要,但错误标注的条目可能对生物安全决策产生过大负面影响,而AI生成生物数据的加入可能让这一问题更严重。在提交过程中,SynthID Bio可帮助确保合成条目被正确标注或标记以供进一步审查。
- DNA合成筛查是生物安全前线,但面对AI生成的全新序列,人工审查可能拖慢研究
- DeepMind称水印可作为自动验证信号,证明订单来自受信任模型
- 数据库方面:Protein Data Bank、UniProt、GenBank,公告称可用于标注或标记合成条目
开放代码与数据,并已把水印扩展到噬菌体基因组
公告称,SynthID Bio不是生物安全的银弹,但它是把经过检验的SynthID水印工具带到合成生物学的重要第一步,用于可靠识别和追踪AI生成的生物序列与结构。
接下来的关键挑战包括让水印对蓄意篡改更鲁棒。SynthID Bio也可与来源元数据方案(类似数字媒体领域的C2PA)或AI生成生物数据的中央存储库配合,更好地识别和追踪AI生成的蛋白质。
为匹配前沿AI能力增长,DeepMind也在研究如何把水印应用到更复杂的生物对象。在与斯坦福大学Hie实验室和Arc Institute的持续合作中,团队把SynthID Bio集成到先进基因组模型Evo 2中,给Evo 2设计的噬菌体基因组加水印。细菌培养的早期实验室测试确认这些加水印的噬菌体具有功能。DeepMind认为这项工作有潜力应对基因组设计相关的部分生物安全风险,并将在技术论文中分享更多细节。
DeepMind表示,要兑现这项工作的全部生物安全收益需要社区合作和进一步研究。作为负责任创新承诺的一部分,团队将发表方法论文,开源代码和体外数据,并向研究社区发布模型权重。希望就合作事宜联系者可发邮件至[email protected]并提供高层级提案,且不要披露任何机密或专有信息。
- 待解问题:水印对蓄意篡改的鲁棒性
- 可能搭配:来源元数据方案(类似C2PA)、AI生成生物数据中央存储库
- Evo 2噬菌体工作:与斯坦福Hie实验室和Arc Institute合作,早期细菌培养测试确认有功能
- 开放内容:方法论文、代码、体外数据、模型权重