研究LangChain Blog·原文 2026年9月17日本站收录 2026年9月18日

LangChain推出Deep Life Sci:面向临床与实验室科学家的开源智能体助手

LangChain发布基于Deep Agents harness的开源助手Deep Life Sci,可调用ClinicalTrials.gov超 60 万项注册研究、PubMed 2900万篇摘要和PubMed Central 1200万篇全文,并为每个子智能体配备LangSmith沙箱运行代码。

AI解读:LangChain发布Deep Life Sci,一个专为临床和实验室科学家打造的开源智能体助手,基于其Deep Agents harness构建。它要解决的问题很具体:医药研发成本每九年翻一倍,而通用AI助手缺乏生命科学领域知识和数据源接入。

它能接入ClinicalTrials.gov超过 60 万项注册研究、PubMed 2900万篇论文摘要和PubMed Central 1200万篇全文文章,并通过子智能体同时审阅数百份文档。每个智能体带有LangSmith沙箱,可以安全运行代码做数据分析。

对实验室科学家来说,典型用法是上传RNA-seq或蛋白质组学筛选结果表,智能体在沙箱里做富集分析、查找文献证据、区分已知基因和新基因,返回带支持文献的排序表。对临床开发和HEOR团队,则可以统一提取标准疗法的试验终点、样本量、人群特征和随访时长,生成对比表。

LangChain强调开源和可定制是核心卖点,因为生命科学领域的GxP验证需要完整文档和审计日志,解释系统为何这样决策,要求企业完全掌控系统。Deep Life Sci的所有运行记录会存在用户自己的LangSmith账户里,可回溯文献搜索、沙箱代码和子智能体阅读的文档。

限制也在于此:Deep Life Sci知道主要终点是什么,但不知道公司内部检测结果、监管机构曾质疑过哪些终点、哪些试验点实际入组了患者,这些需要企业自行集成。这决定了它对谁最有用——有能力把内部数据接入并做二次开发的企业团队,而不只是个人研究者。

LangChain发布Deep Life Sci,一个面向临床和实验室科学家的开源智能体助手。它基于LangChain的Deep Agents harness构建,定位是供企业采用和修改的模板。

根据LangChain博客,Deep Life Sci可以访问ClinicalTrials.gov上超过 60 万项注册研究的临床试验记录、PubMed的 2900 万篇论文摘要,以及PubMed Central的 1200 万篇全文文章。它通过将文档分配给子智能体,能一次审阅数百份文档。

每个智能体都带有LangSmith沙箱,允许它安全运行代码来执行任意数据分析。用户可以上传PDF、图片、表格数据文件、RIS等文献文件,以及SMILES、FASTA等序列文件,供智能体纳入工作。

LangChain在博客中称,Deep Life Sci是一个开源智能体助手,作为模板供公司采用并根据自身用例修改。LangChain认为,拥有自己智能的组织将占据优势。

LangChain指出的医药研发成本问题

LangChain在博客中引用了Eroom定律(Eroom倒过来读就是Moore),将其描述为摩尔定律的邪恶双胞胎。过去 70 年计算能力价格指数级下降,带来了个人电脑、互联网、手机和现在的AI革命;而制药研究走向相反方向,开发每种新药的成本每九年翻一倍。

LangChain认为,成本飙升来自药物开发的两个阶段:临床前研究和临床试验。确定有前景的药物靶点需要筛选数百万篇科学论文和大量生物数据集;候选分子进入人体临床试验后,还要完成数万页文书工作,以符合不断增加的FDA法规。

LangChain称,许多AI公司承诺其工具能帮助恢复研究生产力,但Claude和ChatGPT等通用AI助手缺乏必要的领域知识和与科学数据源的集成。更专业的生物技术AI产品往往收取高额加价。这两种情况下,智能体harness都是专有的,用户无法定制,并被锁定在昂贵的闭源模型中。

LangChain强调,这在生命科学领域尤其关键,因为GxP验证需要详尽的文档和审计日志,能够解释系统为何如此行为,要求公司对用于驱动临床决策的任何系统拥有完全控制。

Deep Life Sci的工作方式与示例流程

LangChain博客描述了几种典型工作流。实验室科学家完成RNA-seq或蛋白质组学筛选后上传结果表,智能体在沙箱中运行富集分析以识别差异表达基因,然后搜索文献寻找每个命中基因与表型相关的先前证据,将研究充分的基因与新颖基因分开,并返回带有支持论文的排序表。

对于临床开发或HEOR团队,可能需要找到某个适应症中标准疗法的每一项已发表试验,并一致地提取终点值、样本量N、人群特征和随访时长。智能体运行搜索、按标准筛选、将每项试验提取到共同schema中,并生成表格和森林图式比较。

在临床试验阶段,会产生数千页不同类型的文档,包括知情同意书、临床方案文件及修订、病例报告表等,所有这些都必须经过彻底审计、审查和多次编辑才能最终定稿。LangChain称,使用Deep Life Sci,用户可以上传参考方案文件、研究和收集额外统计信息,并快速整理必要的反馈和编辑,最终可能显著缩短临床文档处理时间。

LangChain还提到,当智能体被优化并集成到公司生态系统中时,Deep Life Sci的价值会进一步增加。Deep Life Sci知道主要终点是什么,但不知道公司特有的细节,例如内部检测结果、监管机构曾质疑过哪些终点,或者哪些试验点实际入组了患者而非只是承诺入组。

LangChain称,将这些上下文集成到harness中,就是实践中拥有自己智能的样子。因为Deep Life Sci的代码是开源的,组织可以按自己的意愿处理。定制可以包括添加与内部数据和文档的集成、利用不同的前沿和开源模型、执行防护栏和审批门等。

追踪与评估:LangSmith的角色

LangChain博客称,修改harness会让企业进入智能体开发生命周期(ADLC):构建、测试、部署、监控,然后将学到的内容反馈到下一个版本。追踪和评估帮助驱动这个开发循环。

关于追踪,每次Deep Life Sci运行都会端到端记录在用户自己的LangSmith账户中,包括智能体发出的文献搜索、在沙箱中运行的代码、每个子智能体阅读的文档,以及它如何从这些内容得出答案。LangChain称,这些轨迹可用于调试和改进智能体,并作为审计记录。

关于评估,评估告诉用户对智能体的更改是否帮助了其性能。Deep Life Sci附带一个默认评估集,可以随着添加集成和识别新用例而修改和扩充。在更换模型或重写提示词前后运行该评估集,就能看到新版本是否真的改进,还是悄悄退步了。

LangChain在博客结尾表示,智能体AI已经在编码和数学等领域引发革命。生物医学领域的成本效益和迭代速度直接转化为拯救的生命,不应被落下。结合Deep Life Sci等开源工具和LangSmith的ADLC能力的生物技术和制药公司,可以通过在整个药物开发周期中提供成本节约和更快迭代来逆转Eroom定律。

信息来源

LangChain Blog原始来源