LangChain博客:Abridge与Included Health如何用LangSmith把临床评审变成可复用评测
LangChain博客介绍了Abridge和Included Health两家医疗AI团队使用LangSmith的实践:将稀缺的临床专家判断转化为带标签数据集、校准后的评测器和自动化发布门禁,Abridge借此把发布周期从一两个月缩短到几天。
AI解读:这条新闻讲的不是某个新模型,而是医疗AI团队怎么解决一个很具体的瓶颈:系统好不好,最终得由临床医生来判断。但医生没时间一条条翻几千次对话,于是Abridge和Included Health把医生的判断“存起来”,变成可以反复使用的评测数据集和自动评测器。
对做医疗AI产品的团队来说,这意味着专家评审从一次性成本变成了基础设施。Abridge用它把发布周期从一到两个月压到几天,Included Health则在一次架构迁移中跑完已有的多轮模拟测试、确认性能没有下降,两周内完成迁移且没有明显回归。
效果数据方面,Included Health称Dot上线后聊天互动量提升75%,在已评分对话中临床医生对其护理建议的认同度高于团队95%的目标,临床审计显示Dot识别出超过99%的高风险情况。这些数字来自公司自己的说法,不是第三方评测。
限制同样明确。临床记录没有唯一正确答案,不同专科和医生会有合理差异;还要评估“正确地不作为”,比如紧急护栏该触发时触发、该安静时安静。此外,评测数据里的对话记录和医生标注可能含受保护健康信息,Abridge要求自托管、访问控制和可审计,并在用于学习前移除身份信息。
LangChain博客发布文章,介绍医疗AI团队使用LangSmith的典型场景。文章聚焦两家组织:做AI就医引导的Included Health,和把医患对话转成临床记录的Abridge。
文章的核心主张是,医疗AI的准确性由工程团队之外的人决定,而临床专家的时间通常是系统里最稀缺的资源。两家团队的做法是把专家输入转化为可长期使用的资产:带标签数据集、经过校准的评测器和自动化发布门禁。
Abridge团队在文中说:“信任是一滴一滴攒起来,一桶一桶失去的。”目标是让每一次专家判断在未来的测试、发布和迭代中反复使用。
为什么临床评审会成为瓶颈
文章说,临床医生能很快判断一份生成的记录是否把症状归给了正确的人,或患者是否被推荐了最合适的护理级别,但无法无限期地逐条审查成千上万次就诊。规模一大,专家验证就成了限制因素。
Included Health构建了Dot,一个由LangGraph和Deep Agents驱动的AI引导工具,用于理解模糊的成员需求、回答覆盖范围和账单问题、把人引导到合适的护理,并识别紧急情况。文章举例:一个关于某项扫描是否被覆盖的问题,可能在几轮对话后暴露出该成员实际需要联系初级保健医生。评测Dot既要查准确性,也要看它是否利用了成员的完整上下文来给出安全合适的下一步建议。
Abridge把医患对话转成临床记录。在患者同意下,医生录制就诊过程,Abridge把对话转成记录,进入纵向健康档案并支持计费。在这种场景下,归因至关重要:如果患者的观察被呈现为医生的结论,一个症状就可能变成可计费的诊断。幻觉带来另一种风险:一个从未开出的药物或剂量可能进入记录。可信的记录必须保留谁说了什么、捕捉临床上重要的内容,且不引入对话不支持的信息。
评审需要先定义清楚的三件事
文章提出,在把临床判断编码成自动评测之前,团队要先定义专家到底在评什么。有三个属性让这种判断难以规模化。
第一,真值很少是唯一的。临床记录没有唯一标准形式,什么该写进去因专科、就诊和医生而异,合理的专家之间也会有分歧。参考记录有用,但把单一参考当作唯一正确答案,会惩罚合理的差异,同时仍可能漏掉临床上重要的错误。
第二,正确地不作为很重要。医疗团队必须评估系统是否在行动上正确,也要评估它是否识别出什么时候不该行动。例如Included Health的评审者检查紧急护栏在合适时触发、在良性情况下保持不激活;Abridge测试其代理是否停留在边界内,并选择医生会预期的工具。
第三,评审者的专业水平是规格的一部分。Abridge会事先确定某项评测需要委员会认证的医生还是特定专科医生。文章写道,一个评判者的水平取决于校准它的那些判断。
把专家判断做成可复用的评测资产
Abridge从医生和用户反馈中的已知失败模式出发,按普遍性和严重程度排序,归类为准确性、合规、风格和完整性等类别,并为每一类建立单独的评判器,而不是产出一个笼统的质量分。
过去,医生写一份标注指南并标注就诊记录,然后有人手动调整评判器的提示词,直到它的分数与这些标注一致。Abridge现在把同样的指南和例子输入自动化的提示词优化框架来生成评判器。
因为单一参考无法涵盖所有有效记录,Abridge叠加了两种互补方法:无参考评判器直接对照源对话给记录打分,不需要参考,因此能跨就诊泛化,可以在开发期间运行,也能在生产中持续运行;基于参考的评判器把输出与精选示例比较,可以针对特定医学专科定制,捕捉更宽泛评判器漏掉的上下文和细微差别。
优化后的评判器仍要对照医生标注验证。LangSmith的Align Evaluator提供界面比较两者并调查分歧。Abridge还单独要求标注者解释自己的决定,即使输出是正确的;这些解释有助于解决不一致并确认标注经过仔细审查。
生产评审如何闭环并成为发布门禁
文章说,校准后的评判器应用的是团队已经捕捉到的判断,生产评审则提供下一轮判断,揭示系统在真实对话中的表现,并产生要修什么的证据。
Included Health把对话送入LangSmith的标注队列,临床评审者评估Dot是否把成员引导到正确的护理场所、紧急护栏行为是否合适、案例是否需要跟进。这些决定成为结构化标签,导出到Included Health的数据仓库,数据科学团队用它们构建运营看板,同时反馈到管理Dot如何引导成员的技能定义中。文章称每次评审只用一次,却被用三次。
在发布环节,Abridge的模型变更要经过逐步更真实的阶段:离线评测、对历史就诊记录回测、有限的A/B测试、全面发布和持续生产监控。A/B测试这一步比较特殊:部分合作方同意成为前10%到15%的客户,参与静默发布。这让Abridge观察到自动评判器无法提供的信号:医生是否编辑生成的记录、如何评分、分享什么定性反馈。文章称这一流程把Abridge的发布周期从一两个月缩短到几天。
Included Health把同样原则用于一次架构变更:把Dot的超级图迁移到Deep Agents,影响四个产品团队,大家都担心破坏性变更。团队运行已有的多轮模拟测试套件,确认性能保持,两周内完成迁移,没有明显回归。
生产可靠性与受保护健康信息
Included Health从三个维度衡量表现:采用率、引导质量和安全性——分别对应成员会不会用、是否把人引导到合适护理、是否识别出需要紧急关注的情况。文章称Dot上线后聊天互动量提升75%;在已评分对话中,临床医生对Dot护理建议的认同度高于团队95%的目标;临床审计显示Dot识别出超过99%的高风险情况。
文章还指出,让临床判断可复用的同一批资产——就诊轨迹、对话历史和医生标注——也可能包含受保护健康信息(PHI)。一旦团队开始存储和复用它们,安全和部署架构就成了评测设计的一部分。
Abridge把自托管、访问控制和可审计性作为评测基础设施的要求,并在用于学习前移除对话数据中的身份信息。LangSmith支持托管云、自带云和自托管部署;团队必须决定评测数据存在哪里、谁能访问、适用哪些审计和保留控制,以及含PHI的轨迹如何处理。