研究Amazon Science·原文 2026年9月22日

Amazon Bio Discovery连发三篇论文:抗体设计从预测走向实验验证

MochiBind序列模型在四个抗原上排名精度超越结构基线近 10%,CA-MAP用 18 万参数对抗批次效应,智能体设计的纳米抗体在 116 个候选中有 46 个强结合。

AI解读:抗体药开发从靶点到先导候选通常要六到十二个月,成本高企。Amazon Bio Discovery的三篇论文分别攻克三个环节:谁结合得最紧、能不能成药、怎么从零设计出可实验验证的抗体。它们共同的特征是把评估条件从“熟悉靶点”推向“陌生靶点”,因为后者才接近真实药物发现场景。

第一篇提出的MochiBind不预测绝对亲和力数值,而是判断同一抗原的两个抗体谁结合更紧,再用TrueSkill聚合出排名。它不依赖结构输入,CPU上 13 秒能打分 20 万对抗体,比同类方法快 100 倍以上,在四个未见过的抗原上两两准确率平均高出最强结构基线近 10%。对做大规模筛选的团队来说,这意味着可以在湿实验之前先砍掉绝大多数不结合的候选。

第二篇CA-MAP解决的是批次效应:不同实验室测同一抗体得到不同数值,模型微调后会悄悄继承某家实验室的系统偏差。它把少量同批次样本的属性值放进输入,让模型自己校准,并用随机变换训练策略防止模型忽略这些例子。加 0 到 0.3 的模拟批次偏移后,普通微调相关性掉到 0.58,CA-MAP保持在 0.99。它只有约 18.2 万可训练参数,推理速度约是TxGemma的 200 倍,且因为属性用文本描述,未经训练的性质也能靠相关性质推测。

第三篇把预测和生成模型串成一条实际设计流水线:针对一种无实验结构、无公开抗体信息的儿童癌症靶点,热点推荐智能体从八个区域中选位,三个生成模型各产出 9.6 万个设计,经Pareto多目标筛选后挑出 10 万候选做酵母表面展示。116 个存活候选都不结合无关对照蛋白,最终 46 个被认定为强结合。这组数字本身还不构成药物,但展示了一条实验室反馈能回流训练模型的闭环。

Amazon Bio Discovery的科学家团队近期发表三篇论文,分别针对抗体计算设计的三个环节提出新方法:从序列直接对候选抗体排名的MochiBind、在推理时校正实验室批次效应的CA-MAP,以及用智能体引导从零设计纳米抗体并通过实验验证的完整流程。第三篇论文在ICML 2026 Workshop on Generative and Agentic AI for Biology上以Spotlight形式报告,并获得Best Paper Runner-Up Award。

传统抗体发现要六到十二个月,三个瓶颈彼此独立

单克隆抗体是生物制药开发的主力,已有超过 100 款获FDA批准的药物,生产、监管和临床开发路径成熟。但传统的抗体发现仍受成本上升和周期漫长困扰,从确定靶点到获得先导候选通常需要六到十二个月。

研发一个抗体药物取决于三个因素:靶点上最佳的绑定位点、哪些候选结合得最紧、以及其中哪些能通过生产和临床。针对每一项,该领域已有预测模型,但它们在有大量训练数据的熟悉靶点和检测中表现良好,在陌生靶点上要差得多。围绕分布内准确率构建的基准让这种差距难以衡量、也难以弥合。

Amazon Bio Discovery是亚马逊旗下面向科学家的AI应用,提供生物AI模型和一体化实验室服务来设计和测试新药候选。其团队的三篇论文分别处理这三个因素中的研究问题:两篇是经同行评议的预测论文,分别关于按结合强度对候选排名和灵活预测成药性;第三篇将预测带入端到端设计流程,用智能体导航结合位点选择,并交付了针对一个新癌症靶点的实验验证抗体命中。

  • 截至论文发表,已有超过 100 款FDA批准的单克隆抗体药物。
  • 传统路径从靶点到先导候选通常需六到十二个月。
  • 三个待解问题:最佳结合位点、最紧结合候选、能否通过生产和临床。
  • 现有预测模型在熟悉靶点上表现好,在陌生靶点上明显变差。

MochiBind:不猜绝对数值,只判断谁结合得更紧

在发表于iScience的论文《A systematic evaluation framework for universal antibody-antigen binding affinity prediction and candidate recommendation》中,团队提出新的评估框架,并训练了一个基于序列的结合亲和力预测器MochiBind。

大多数亲和力预测器评估的是预测绝对结合亲和力的能力,测试抗原出现在训练数据中,测试集中很少或没有非结合物。这些特点让评估比实际应用容易:绝对亲和力值跨检测不可比,对未见过的抗原性能会下降;而实际用例是在数千个候选中排名,其中大多数根本不结合靶点,挑出值得送进实验室的那些。团队调查了七项先前研究,没有一项满足训练可靠通用预测器所需的全部条件。

因此团队重新定义了任务:MochiBind不预测绝对数值,而是判断针对同一抗原的两个抗体哪个结合更紧。它先用预训练蛋白质语言模型ESM-2将抗体-抗原复合物的残基嵌入表示空间,再计算每个复合物残基嵌入的均值得到单一嵌入。一个专门训练的网路层将这些嵌入投影到低维空间,通过两个投影的差值预测相对结合强度。成对比较随后用TrueSkill聚合成候选池的全局排名,TrueSkill是最初为基于比赛结果给电子游戏玩家排名而开发的贝叶斯评分算法。任何阶段都不需要结构输入。

这种形式有两个实际优势:相对顺序跨检测比绝对值更一致,训练信号对测量噪声更不敏感;输出正是发现流程需要的排名列表。论文还提出了新的评估框架。他们使用AlphaBind数据集,覆盖四个抗原系统(靶向TIGIT、PD-1、HER2和SARS-CoV-1 RBD),每个约有 3 万个经实验表征的变体,抗原之间的成对序列相似度接近零。评估方案严格跨抗原:用两个抗原训练,第三个验证,第四个测试,轮换使每个抗原都充当一次留出系统。标准化了两个指标:成对准确率,以及top K的检索准确率和精确率,即模型K个推荐中有多少被实验确认是强结合物。

  • MochiBind在全部四个留出抗原上成对准确率都高于所有基于结构的基线,平均超越最接近的竞争者近 10%。
  • 在排序性能上,MochiBind在四个抗原上都取得最高检索准确率,在四个中的三个上取得最高检索精确率(最低假阳性率)。
  • 在CPU上约 13 秒内为 20 万对抗体打分,比竞争方法推理速度提升超过 100 倍,论文称这应能支持超大设计文库的筛选。

CA-MAP:18 万参数对抗批次效应,0.99 不掉分

与靶点结合紧密但在血液中结块、降解或引发免疫反应的蛋白质不能成为有效或安全的药物。从生物数据预测这类性质的大多数尝试都遇到同一个问题:批次效应,即不同实验室处理样本或进行实验的方式存在系统性差异,导致可预测的测量偏差,也就是批次偏移。在一个实验室数据上微调的模型会悄悄继承该实验室的偏移。

在发表于npj Systems Biology and Applications的论文《Context-aware multi-property antibody predictor: A novel framework integrating text and protein language models》中,团队在推理阶段解决批次效应。模型名为上下文感知多属性抗体预测器CA-MAP,它接收一个提示,其中包含数量可变的示例抗体及其测量属性,随后是一个查询抗体和要预测的属性名称。当示例与查询来自同一实验室时,它们的测量属性就捕获了批次偏移。模型的输入(即上下文)因此包含了无需重新训练即可校正批次效应所需的信息。

但让模型使用这些上下文并不简单。在单一来源数据上训练的模型可能学会忽略示例——毕竟其测量值系统性地偏斜——而仅依赖查询序列。团队的训练策略AB-context-aware防止这一点:对上下文属性和预期答案同时施加一个隐藏的随机变换,每个提示重新采样。在这种方案下,变换只能从上下文中恢复,因此模型必须使用上下文。

他们在微调的领域专用多模态大语言模型TxGemma上测量了预测疏水性的效果。没有批次效应时,标准微调和AB-context-aware训练表现相当,与真值的相关性为 0.99(根据Spearman等级相关系数,1 为完全相关)。在 0 到 0.3 范围内的模拟加性批次效应下,标准微调下降到 0.58 的相关性,而上下文感知模型保持在 0.99。

CA-MAP的多模态架构相对较小,结合文本和蛋白质。序列用ESM-2编码,属性名用句子嵌入编码,数值各有专用编码器和投影器,一个基于序列建模架构MAMBA的状态空间模型将它们组合起来。在覆盖六种成药属性的 876,898 条抗体重链合成数据集上训练后,CA-MAP在若干属性上达到大于 0.8 的Spearman相关性(记为 ρ),在联合测试的全部四个属性上优于微调的TxGemma基线。

该架构的训练和运行成本也低得多,约有 18.2 万个可训练参数,而TxGemma有 4000 万个,每个提示的推理速度约是后者的 200 倍。因为属性以文本指定,CA-MAP还可以查询其训练数据中没有的属性。在一组实验中,团队仅在数据集六种成药属性中的四种上训练CA-MAP,测试另外两种(正电荷异质性PosCh和免疫原性)。当只用两个目标属性作为上下文时,免疫原性预测达到 ρ = 0.25;在上下文中加入全部六种相关属性后,ρ = 0.73。PosCh在同样对比下从 ρ = 0.08 提高到 0.73。这些提升表明模型在利用成药属性之间的相关性,提示昂贵的检测或可部分用较便宜的检测来估计。

  • 标准微调在模拟批次效应下相关性从 0.99 掉到 0.58。
  • CA-MAP在同样条件下保持 0.99。
  • 约 18.2 万可训练参数,对比TxGemma的 4000 万。
  • 推理速度约是TxGemma的 200 倍。
  • 未见属性免疫原性 ρ 从 0.25 提升到 0.73,PosCh从 0.08 提升到 0.73。

从零设计纳米抗体:8 个热点、46 个强结合物

第三篇论文《Agent-guided de novo design of nanobody binders against a novel cancer target》将预测和生成抗体模型结合起来,在一个真实药物发现项目中从零设计治疗性纳米抗体。

设计项目的靶点抗原——业内称为“campaign”——的选择反映了真实临床需求:一种促纤维增生性小圆细胞肿瘤的细胞表面靶点,这是一种罕见且侵袭性的儿童癌症。合作方纽约纪念斯隆-凯特琳癌症中心的Nai-Kong V. Cheung博士实验室通过对患者肿瘤标本测序,寻找同时满足三个条件的蛋白质:位于肿瘤细胞表面、由特定遗传错误驱动、在健康组织中基本不存在。该靶点没有实验结构,也没有公开的抗体信息,因此没有模板可移植、没有先前的campaign可做亲和力成熟,设计模型也不可能在训练中遇到过这个抗原。

de novo设计campaign开始时的关键决策之一是靶向抗原表面的哪些特定区域,即表位或热点。团队设计了一个热点推荐智能体,编排七种生物信息学工具,执行确定溶剂可及表面积、二级结构、疏水性、针对用户指定阴性靶点的序列唯一性等任务;将表位与NIAID免疫表位数据库中的 50 万条记录进行匹配;以及按照蛋白质家族(Pfam)数据库中的类别注释结构域。模型将这些工具的输出综合成热点推荐,并为每个推荐给出明确的生物物理依据。

将推荐建立在确定性工具输出上,使搜索聚焦于有证据支持的区域,而非依赖模型对蛋白质生物学的参数化知识。在SAbDab基准的抗体-抗原复合物上评估,智能体在多样化留出集上约 80% 的情况下在前五个提议区域中至少恢复一个真实表位残基。对于设计campaign中的靶点抗原,它提出了八个热点区域。

随后团队使用三种不同设计原理的生成模型——RFantibody(在蛋白质骨架上扩散)、IgGM(联合序列-结构扩散)和mBER(通过结构预测模型反向传播)——生成靶向这些热点的抗体设计。每个模型产出 96,000 个设计,每个设计根据折叠置信度(抗体折叠成结合靶点所需形状的可能性)、复合物质量(抗体与靶点形成正确结合界面的可能性)、序列隐患(抗体序列引起开发或生产问题的可能性)以及MochiBind的序列亲和力估计等属性评分。候选选择智能体应用多目标Pareto过滤,确保保留在不同指标组合上表现突出的设计,并优先选出 100,000 个候选进行实验筛选。

每个候选被合成并展示在酵母细胞表面,筛选其是否粘附靶点,粘附最强的设计经过两轮分选和过滤。存活下来的 116 个候选没有一个结合无关对照蛋白,表明它们特异性结合预期靶点,而非普遍粘性。随后对全部 116 个候选逐一测量与靶点抗原的结合强度,46 个被确定为强结合物。

这 46 个结合物连同完整筛选中的结合与非结合标签,成为下一轮设计的训练数据:一个lab-in-the-loop工作流,每轮实验精炼提出下一轮设计的模型。论文称亚马逊在运行这一闭环上具有独特优势,拥有构建生物学基础机器学习所需的科学专业知识、设计和评分数十万候选的计算能力,以及通过Amazon Bio Discovery将这些方法——包括目前尚不可用的MochiBind和CA-MAP——交付给客户的路径。

论文将这一流程描述为集成计算与实验的de novo纳米抗体设计流水线。

  • 靶点:促纤维增生性小圆细胞肿瘤的细胞表面抗原,罕见侵袭性儿童癌症。
  • 合作方:纪念斯隆-凯特琳癌症中心Nai-Kong V. Cheung实验室。
  • 靶点无实验结构、无公开抗体信息。
  • 热点智能体编排七种生物信息学工具,匹配 50 万条免疫表位数据库记录。
  • 智能体在前五个提议中约 80% 情况下至少恢复一个真实表位残基。
  • 该靶点提出八个热点区域。
  • 三个生成模型各产出 96,000 个设计。
  • 多目标Pareto过滤后优先选出 100,000 个候选。
  • 酵母表面展示两轮分选后存活 116 个候选,均不结合无关对照蛋白。
  • 46 个被确定为强结合物。

信息来源

Amazon Science原始来源