产品AWS Machine Learning·原文 2026年9月22日

EXL在AWS上推出医疗理赔IDP方案,单案人工审核时间从超 100 分钟降至数小时

EXL将Xtrakto.AI文档处理与在Amazon SageMaker AI上微调的保险领域大模型组合成一条管道,处理数百页医疗记录,把理赔审核从数天压到小时级,并保留人工复核环节。

EXL在AWS上构建了一套AI医疗智能文档处理(IDP)方案,把理赔员单案超过 100 分钟的手动医疗记录审核流程自动化。该方案将Xtrakto.AI的文档处理能力与在Amazon SageMaker AI上微调的EXL Insurance LLM组合成一条管道,处理从数百页医疗记录中抽取、摘要和查询信息。

EXL是一家数据分析和AI解决方案提供商,服务财富 500 强企业超过 25 年,全球有 5 万多名专业人员。该解决方案托管在AWS上,训练和推理环境放在同一套安全控制下。

问题:数百页医疗记录人工审,每人理解还不一样

在保险理赔裁定和人寿核保中,医疗记录是每项决定的基础。理赔员和核保人员必须审阅这些常常长达数百页的记录,以评估有效性、确定赔付或做出核保决定。

难点不只是数量。医疗记录是非结构化的,充满专业临床术语,需要审核人把患者病情及其随时间演变的不同数据点连接起来。文档类型涵盖脊椎按摩护理记录、诊断测试、急诊就诊、手术报告、医生咨询、处方药报告、精神科评估、实验室结果、独立医学检查(IME)报告和同行评审等数十种。

这种审核要求深厚的医疗领域专业知识、持续专注和解释性判断。因此过程缓慢、手动且容易不一致。不同专业人员对同一医疗数据的解读方式不同,后果包括理赔结算延迟、评估准确性问题、赔付成本增加、客户体验不佳以及监管审查加强。

方案:Xtrakto.AI管文档,EXL Insurance LLM管领域推理

EXL把两个互补的AI应用组合成一条端到端管道,托管在AWS上。Xtrakto.AI负责文档摄入、拆分、分类、抽取、增强和后处理,是一个不依赖模板的IDP应用,使用计算机视觉、自然语言处理(NLP)和智能体AI工作流从多种文档类型中抽取结构化数据,不需要预先配置模板。

EXL Insurance LLM提供领域智能层:医疗摘要、自然语言查询、带可追溯性的深度推理和结构化输出生成。该模型在保险和医疗领域数据上微调,能理解临床术语、ICD(国际疾病分类)和CPT(现行程序术语)代码、诊断-治疗关系,以及理赔和核保工作流的特定需求。

两者合在一起构成一条自动化、可扩展的管道,把原始医疗文档转化为理赔员、核保人员和护理协调员可用的情报。

架构:11 步流程,模型开发和推理隔离

该方案完全运行在一个AWS区域内,上下游客户端应用通过安全API连接。架构遵循从摄入到输出交付的 11 步流程,另有一个独立的模型开发环境用于持续改进。

管道使用的AWS服务包括:Amazon API Gateway用于安全摄入和结果交付API(步骤 1 和 11);Amazon Cognito用于请求认证和授权(步骤 2);AWS Step Functions作为编排引擎协调子请求、路由和抽取工作流(步骤 3);Amazon Textract和AWS Lambda用于文档预处理,包括机器可读性检查、OCR、文件类型转换和文本嵌入生成(步骤 4);Amazon SageMaker AI用于基于训练好的领域模型进行机器学习模型推理和数据检索(步骤 5);Amazon DynamoDB和Amazon Relational Database Service(Amazon RDS)用于使用内部和外部参考数据库进行数据增强(步骤 6);Amazon SageMaker AI实时推理端点服务EXL Insurance LLM,用于验证、摘要、查询和智能体推理(步骤 7);Amazon Bedrock按需提供通用基础模型,补充领域特定的EXL Insurance LLM(步骤 7);AWS Lambda生成多种格式的输出(步骤 8);Amazon CloudWatch提供应用和模型监控仪表板(步骤 9);Amazon Simple Storage Service(Amazon S3)作为中央数据湖存储文档和处理输出(步骤 10);Amazon SageMaker AI在隔离的模型开发环境中用于模型训练、微调和实验(步骤 0)。

EXL把模型开发和生产推理放在同一套安全控制下。Amazon SageMaker AI为EXL Insurance LLM提供托管训练和推理环境,支持多GPU微调、与生产隔离的实验,以及随理赔量扩展的实时推理端点。Amazon Bedrock通过单一API按需访问通用基础模型,EXL可以为每项任务选择合适模型,无需管理额外基础设施。两项服务都在AWS Identity and Access Management(IAM)限定的访问控制内运行。

为什么微调而不是提示:9 年数据、13,500 条记录、LoRA

EXL称,通用模型如GPT-4或Claude具备广泛的语言理解能力,但缺乏保险理赔裁定所需的专业词汇、推理模式和工作流意识。保险理赔涉及多种不同的医疗记录标注标签类型、领域特定的摘要格式(经济性和非经济性损害赔偿)以及谈判指导生成。这些任务需要深度领域适应,仅靠提示无法在大规模下稳定实现。

训练数据来自EXL 9年保险理赔运营积累,包含超过 13,500 条记录,涵盖结构化数据库记录和非结构化医疗文档。数据准备管道包括:用Amazon Textract做OCR,从扫描的医疗PDF中提取文本,同时保留行和词级别的位臵上下文;垃圾页检测,用自动分类器识别并移除会降低训练质量的不相关或扫描质量差的页面;按HIPAA要求进行去标识化,在训练前移除受保护健康信息;多标签合并,把每页的多个标签引用分组为统一训练样本,防止模型在单页包含多个医学发现时输出不一致。

微调方面,EXL在Amazon SageMaker AI上使用参数高效微调(PEFT)和低秩适应(LoRA),不修改基础模型全部参数,降低计算成本。训练使用SageMaker AI训练实例上的多GPU配置和NVIDIA GPU,采用数据和模型并行优化吞吐量,使用NVIDIA NeMo框架构建和管理训练管道,并在与生产推理隔离的SageMaker AI环境中进行,使模型实验不影响线上工作负载。

七阶段管道:从文档拆分到结构化输出

管道把每份文档推进七个阶段。第 1 阶段文档拆分和分类:上游应用通过基于Amazon API Gateway的摄入API提交抽取请求,文档以多种渠道和格式到达,AWS Lambda函数用Apache Tika做初始文件解析和OCR后归一化,原始文档存入Amazon S3。经过Amazon Cognito认证后,编排引擎AWS Step Functions接管,根据输入创建子请求并路由到相应处理模块。Xtrakto.AI的分类引擎不依赖文档布局或预定义模板,使用少样本和迁移学习方法基于含义和上下文分类,能用有限训练样本分类新文档类型。捆绑文件(带多个附件的邮件)被拆分成单个子文档,分别路由到下游抽取模块。

第 2 阶段数据抽取,带置信分和可追溯性。文档经过机器可读性检查、Amazon Textract OCR、文件类型转换和文本嵌入生成。部署在Amazon SageMaker AI上的计算机视觉模型(CNN、RCNN)处理像素级图像数据,应对扫描医疗记录的常见质量问题:低分辨率、褶皱或污渍噪声、倾斜、手写和印刷内容混合。这些模型识别重复页、检测有界和无界表格、识别抽取区域、检测签名、解读条形码和二维码。约 25–30% 的文档包含手写内容,从结构化表单填写(低复杂度,约占手写量的 50–60%)到半结构化注释(约 15–20%)再到完全自由格式的医生笔记(约 15–20%),每种需要专门处理。抽取基于上下文而非模板:结构化和半结构化文档由计算机视觉模型识别区域并抽取键值对,内置领域本体结合语义相似度NLP模型把抽取的键映射到业务特定字段;高度非结构化内容(医生笔记、手术报告)通过基于LangGraph的智能体工作流编排抽取,分解为结构化推理步骤。每个抽取字段获得 0-100 的置信分,低于可配置阈值的字段通过EXL Xtrakto.AI验证界面转给人工验证员,反馈持续改进模型准确率。

第 3 阶段数据增强和集成:抽取的数据用存储在Amazon DynamoDB和Amazon RDS中的内部和外部参考数据库增强,对照ICD-10、CPT和HCPCS库验证抽取代码,归一化日期和术语,解决跨字段一致性问题,增强数据存回Amazon S3数据湖。

第 4 阶段智能摘要:EXL Insurance LLM从Amazon SageMaker AI上的推理端点接管,把数百页的复杂医疗记录浓缩成结构化摘要,用户可根据工作流选择短、中、长摘要。模型抽取、标注、总结并呈现最相关的临床信息,同时保留文档的原始上下文和叙述流。用户可以通过反馈机制评价和纠正摘要,这些纠正喂回SageMaker AI上的模型微调。

第 5 阶段自然语言查询:支持三种模式——跨理赔类型的常见问题预定义FAQ;把相关问题分组批量处理的捆绑问题;用日常语言提问的开放查询。模型理解每个查询背后的意图,给出基于底层文档数据的答案,可同时处理多个查询。

第 6 阶段带可追溯性的深度推理:每个问答响应和摘要都链接回确切的源数据或文档片段,审核人可以对照原始记录验证AI生成的见解。用户可以通过编辑生成的摘要或答案纠正不准确之处,并评价输出质量,这些纠正喂入持续模型改进。第 7 阶段结构化输出和可视化:通过AWS Lambda函数生成输出,经结果API(Amazon API Gateway)交付,下游应用可按需获取可导出PDF报告、按年份组织的带超链接诊断历史图表、JSON/XML/CSV/平面文件等多种导出格式,输出数据存入Amazon S3数据湖,CloudWatch提供端到端监控仪表板。

责任AI控制与真实案例

由于工作流处理受保护健康信息并产生AI生成的临床和理赔见解,责任AI控制被内置到部署中而非事后添加。生成输出在到达审核人前经过内容过滤和接地检查,使摘要和答案锚定于源记录并在政策范围内。源级可追溯性使每个输出可审计回原始文档,人工参与验证门控低置信度结果,符合HIPAA的去标识化程序在整个管道中保护患者数据。

EXL称,使用该管道后医疗记录审核时间从数天缩短到数小时,关键阶段的人工参与验证帮助维持质量同时减少周转时间。内部基准测试中,微调后的EXL Insurance LLM在标签、摘要、问答和推理等关键理赔工作流任务上表现强劲,评估使用BLEU、ROUGE、BERTScore、METEOR等自动指标,以及三名保险主题专家的盲审。

一个大型医疗支付方在临床病例管理中面临运营挑战,其护士和护理协调员同样每例花费超过 100 分钟手动检索数据、验证和准备临床摘要,信息分散在电子健康记录、护理管理系统、理赔系统和扫描医疗文档中。来源内容在此处截断,未提供该支付方采用后的具体结果。

信息来源