Included Health用LangGraph搭建联邦式医疗导航智能体Dot
Dot将对话路由、专科转诊和临床审核串在同一个图上,团队按子服务拆分开发,官方公布的数据是:聊天参与度提升 75%,高风险识别率超过 99%,临床一致率高于 95% 的内部目标。
AI解读:Included Health把原本硬编码的导航决策树换成了LangGraph上的联邦式多智能体架构,主图叫Dot supergraph。它要解决的具体问题是:会员问「动脉斑块扫描保不保」时,系统要能顺着追问发现对方有高胆固醇和心脏病家族史,而不是只回一个金额了事。
在「我胸口疼」这种开场下,决策树式的交互要问完七个澄清问题才意识到可能是急症,而Dot需要在第一轮就触发急诊路径。这是这条新闻里对普通用户最直接的价值:它省的不是点击次数,是可能被耽误的时间。
对使用Included Health的雇主和健康计划来说,Dot的临床建议会先进入LangSmith标注队列,由临床团队逐条审核是否推荐了正确的就医点,再导出到数据仓库做运营看板。这套人工回环同时是质量监督和调参依据,也就是说,系统的准确率有一个人工兜底的过程。
真正给工程团队省事的是两个设计:全局语音语调提示词由平台统一维护,不同产品团队的智能体切换时不会突然变冷淡;每个智能体能通过虚拟文件系统按需加载技能文件,覆盖问诊该问什么、哪些情况不适合虚拟问诊。超过 20 到 30 项雇主福利也在往技能化的方向编码。
已公布的结果里,聊天的参与度提升 75%,临床团队对被评分对话的认可度超过 95% 的内部目标,Dot识别出超过 99% 的高风险情况。这些数字来自Included Health和LangChain的描述,属于厂商自报口径,独立第三方的验证数据尚未公开。
Included Health与雇主和健康计划合作,为其员工和会员提供虚拟初级保健、行为健康、紧急护理和专科护理等医疗导航服务。其产品体验的核心是一个叫Dot的AI医疗向导。据LangChain博客的文章,Dot建立在一个使用Deep Agents和LangGraph的联邦式多智能体架构之上。
Included Health工程经理Kartik Darapuneni描述过旧方案的局限:健康系统过去用结构化导航树来路由这类需求,这能让复杂需求对软件变得可管理,但代价是把它们摊平成一串预定义的决策。「对会员来说,感觉很死板,体验就是不好。」他说。
当一段对话以「我胸口疼」开场时,这种局限的后果更严重:系统需要在第一轮就识别出潜在的紧急情况,而不是在问了七个澄清问题之后。
Included Health的生产架构围绕一张名为Dot supergraph的主LangGraph图展开。Dot作为主要的对话路由,处理覆盖范围问题、账单咨询等交易型互动,也负责导航到正确的护理点。一组子工作流处理特定领域的会员旅程,包括紧急护理接诊、预约排程、寻找专科医生、行为健康等。
不同产品团队各管一块图,Deep Agents负责语调和上下文传递
调度这一个环节,就要考虑会员有资格使用哪些服务、其覆盖范围细节、是主会员还是受抚养人,以及一系列临床上的细微差别。Included Health引入了Deep Agents,目的是让这些服务之间保持一致。
员工机器学习工程师Rohan Bhandari说:「原本你跳进另一个智能体,它突然变得很短促、很生硬,语音语调都不一样。」有了Deep Agents,团队可以创建一个全局的平台语音语调提示词,在所有智能体之间传递,不需要每个团队各自维护。
在从一个工作流路由到另一个工作流时,Deep Agents的文件系统和内置上下文管理允许传出智能体总结对话,并把摘要和完整对话历史的文件路径一起传给接收智能体。这套设置确保会员不用在不同团队拥有的不同智能体之间重复自己的情况。
以共享的覆盖范围问题技能为例:覆盖范围问题不一定在对话开头出现。会员可能正在寻找专科医生,中途想知道费用是多少。在Deep Agents之前,这需要把覆盖范围能力穿进每个子工作流的路由逻辑里。Rohan说,现在「我们把它拆成一个平台子智能体,所有Deep Agents都能继承。也就是说每个智能体都能回答覆盖范围问题。」
技能即能力注册表,按需加载而不是一次塞满
Included Health用Deep Agent技能为智能体提供临床能力和服务。每个技能描述一项服务是什么、什么时候合适、什么时候不合适,以及如何处理边缘情况。比如,受抚养人想要预约一项有资格限制的服务时该怎么办。
模型使用渐进式披露来引导对话。比如,会员说想去看医生,可能有三种或更多合适的帮助方式,比如虚拟紧急护理、虚拟初级保健、找线下医生。智能体通过一个虚拟文件系统管理技能注册表,一开始只拿到每个技能的简短描述,调用时,模型决定哪些技能相关,然后可以加载完整的技能文件。
Included Health除自有服务外也支持第三方雇主福利,他们正努力把这些也编码成技能,以覆盖每个雇主计划 20 到 30 项福利。
Rohan补充说:「我们有临床团队审核聊天记录,确认他们是否同意我们根据会员的问题把他送到了哪个护理点。」这个反馈回环让Included Health能随时间调整技能定义,并保持在临床路由一致性 95% 的目标之上。
人工转接是核心设计约束,不是边缘情况
Kartik说:「我们把LangGraph当作整个消息平台。」LangGraph的持久化执行允许智能体在对话中保持完整上下文,支持无限期暂停和上下文保留。当智能体遇到不确定的地方,它会暂停图,路由给人工会员护理顾问进行多轮交流,然后恢复,智能体保留人类所说的和所做的一切的完整上下文。
这种设计反映了医疗关系的长期性。会员可以在几天或几周后回到同一个对话线程追问,智能体能从上次中断的地方继续,包括任何人工辅助部分的完整上下文。Kartik说:「从人的角度看,他们是在帮智能体解除阻塞,而不是做所有的工作。」
该架构还为下一步演进留了空间:在人工处理对话的同时运行一条并行的智能体线程,让智能体做背景研究并实时向护理顾问提出建议。
临床审核和用户模拟评测支撑迁移
LangSmith标注队列是Included Health运行临床监督的核心。目前每一段对话都会进入队列接受临床团队审核。审核人员评估智能体的导航建议是否正确,紧急护栏是否在恰当的时机触发(或者正确地没有触发),并标记任何需要跟进的事项。这些标签从LangSmith导出到Included Health的数据仓库,数据科学团队在那里构建运营指标看板。
使用LangChain用户模拟包进行的多轮用户模拟评测,成了架构变更的安全网。从标准智能体迁移到Deep Agents影响了四个产品团队,他们都担心破坏性变更。
Rohan说:「我们能够跑完整个评测套件,看到性能在大多数情况下变好了,然后我们有信心把它分享给其他团队。」多亏这些评测,迁移在不到两周内完成,没有出现重大回退,也没有团队抵制。
官方公布的三组早期指标
Dot在 8 月面向客户发布,Rohan形容这是「团队过去几年见过的最顺利的发布」。早期指标在三个方面朝着正确方向发展。
参与度:会员与智能体的互动率大幅提高,带来聊天参与度提升 75%。
临床准确性:在临床医生评分的对话中,临床医生认可Dot的护理建议,远高于 95% 的目标。Included Health的临床团队通过LangSmith标注队列给对话打标签,判断Dot是否把会员指向了正确的护理点。
临床安全:经定期临床审计验证,Dot识别出超过 99% 的高风险情况。这一高检出率使团队能够尽快主动接触和支持脆弱会员。
- 来源说明:本文基于LangChain博客文章整理,文中数据、架构描述和引语均来自该文及其中包含的Included Health人员表述。
- 三组早期指标由厂商公布,未提供第三方独立验证数据。
- 关于Dot在真实世界临床结果中的效果,来源未提供对照研究或长期追踪数据。