阿里达摩院DAMO RADAR登上Science:一个模型覆盖腹部18种结构146种病
阿里达摩院联合浙大一院等机构研发的通用腹部影像AI模型DAMO RADAR在Science刊发,覆盖18种解剖结构、146种疾病,内部3.9万例队列平均AUC 0.913,外部8家医院2.4万例AUC 0.895,模型、代码、框架全部开源。
AI解读:这项研究最核心的变化,是把医疗影像AI从“一个模型看一种病”改成“一个模型看整个腹部”。达摩院和浙大一院等医院做的DAMO RADAR覆盖18种解剖结构、146种病,论文发表在Science。此前医疗影像AI多困在专病模型里,做一个病种要两三年,而临床上病人往往同时带着多种病变来,一份CT里可能涉及多个器官。
它的训练方式也不再依赖医生逐张标注,而是用CT影像和对应诊断报告的对应关系做视觉-语言对比学习,并做成“器官级细粒度对齐”:先把整套CT拆成肝脏、胰腺、胆囊、肾脏等器官单元,再和报告里对应的描述精确对齐。团队说,这一设计灵感来自放射科医生按器官依次阅片的真实习惯。
从验证数据看,模型在内部近3.9万例真实世界连续队列中平均AUC为0.913,在8家外部医院超2.4万例CT上为0.895,在未纳入训练的2.7万例急诊数据上为0.904;在肝癌、胰腺癌、胃癌、肠癌四种癌症上以病理金标准考核,AUC为0.891至0.984。在14家医院26名放射科医生参与的人机对比中,RADAR准确率超过其中23名医生,稍弱于3名资深医生。
对一线的直接影响写在读片环节:医生在AI辅助下整体敏感度提升约10%,平均阅片时间减少30%以上,“初级医生+AI”的敏感性甚至超过资深医生独自阅片。浙大一院放射科主任肖文波说,写一份腹部CT报告,中高年资医生也要20分钟以上,一例CT有数百张图像,而RADAR能补上人类医生“穷其一生也见不到这么多病例”的盲区。
开源是这条新闻里对同行最实际的部分:模型、代码、技术框架全部开放,任何团队都可以复现、改进,或迁移到MRI、PET、超声等其他影像模态。不过论文展示的是诊断性能与辅助场景的结果,不等于临床落地后自动替代医生;团队和医生都强调最终仍有真人把关,而年轻医生若形成对AI的路径依赖,也可能截断影像逻辑思维的培养路径。
阿里达摩院联合浙大一院等全球多家医院研发的通用腹部影像AI模型DAMO RADAR,于2026年9月18日被学术期刊Science正式刊发,论文称其为全球首个专家级的通用影像AI模型,覆盖腹部18种解剖结构、146种疾病。
DAMO RADAR全称为Rapid Abdominal Diagnosis with AI and Radiology。达摩院高级算法专家张建鹏提到,此前专病模型一个病种至少啃两三年,而人类疾病成千上万种;同时真实病人不会只带一种病来,一份CT影像里可能同时存在多种器官、多种病变,因此团队转向用一个模型覆盖整个腹部。
研究选择腹部,是因为这是临床公认最难的影像场景。浙大一院放射科主任肖文波介绍,腹部涉及消化系统、泌尿系统、生殖系统,肝胆胰脾肠道挤在一起,肠道盘绕整个腹腔,器官几乎都是密度接近的软组织,年轻医生通常最害怕被分到腹部组。此前的AI辅助工具多针对肺结节等,腹部长期是禁区。
效果验证分多层。在内部近3.9万例真实世界连续队列中,RADAR平均AUC为0.913;在来自8家外部医院、超2.4万例、覆盖不同地区和扫描设备的CT上,AUC为0.895;在2.7万例未纳入训练的急诊数据上,AUC为0.904。
在肝癌、胰腺癌、胃癌、肠癌四种癌症上,团队以病理活检结果作为金标准考核,RADAR的AUC为0.891至0.984。人机对比中,来自14家医院的26名放射科医生与RADAR在同一批病例上独立诊断,RADAR准确率超过其中23名医生,只稍弱于3名资深医生。
团队同时测试了人机协同:医生在有AI帮助的情况下读片,整体敏感度提升约10%,平均阅片时间减少30%以上,“初级医生+AI”的敏感性甚至超过资深医生独自阅片。
器官级对齐:不标整张CT,而是拆成器官单元再对齐报告
过去的医疗影像AI多用监督学习,由医生逐张标注CT图像,标注成本巨大,且模型只能识别被标注过的病种。RADAR改用视觉-语言对比学习,直接从医院天然存在的CT影像与对应诊断报告的对应关系中学习,不需要医生额外逐片标注。
团队最初尝试把整张CT和整份报告对齐,结果模型只能学到粗糙的统计特征,建立不起“哪个器官对应哪段描述”的关联。一套腹部CT有几百张切片、多个器官,真正有问题的可能只是某个器官上一个很小的病灶,关键信号会被大量正常组织淹没。
RADAR的核心突破是“器官级细粒度对齐”:先从CT中定位肝脏、胰腺、胆囊、肾脏等各个器官,把整套CT拆解成器官单元,再把每个器官单元与报告中对应的描述精确对齐。论文称这一设计灵感来自放射科医生的真实工作方式——医生看腹部CT时也不会把整个腹部当整体扫一眼,而是依次看肝脏、胰腺、胆道、肾脏、肠道。
另一个创新是自适应对比建模。标准对比学习默认把不同病人的特征严格区分,但医疗场景里两个健康肝脏不应被割裂看待,同一种病的两个患者影像特征也应放在一起学习。RADAR根据这些医学知识动态调整样本之间的距离。论文展示的Scaling Law曲线显示,随着数据增长,模型性能持续上升,曲线没有饱和迹象。
一线反馈与开源:医生催着上线,也担心年轻医生形成路径依赖
肖文波说,第一次看到RADAR的验证数据“都不敢相信”,AI能在腹部这么多相似结构里一下检出146种病、AUC还有0.9上下,完全超乎医生们的想象。科室里很多医生催着赶紧部署,外面医院的医生也闻讯前来,希望AI帮助解决腹部CT这个头疼的问题。
她提到影像科的一句老话“同病异影、异病同影”:同一种疾病可以长成完全不同的样子,不同的病又可能看起来一模一样,一个医生可能要看几十万张片子才能把各种特征见过一遍。她认为RADAR最大的价值是补上人类医生的盲区,帮他们“少漏一个病灶”,在良恶性鉴别这种生死攸关场景里提供一个补充性参考。
隐忧不在准确率,而在医生培养。医生培养讲究影像逻辑思维,需要从理论到实践反复打磨;年轻医生用了AI,报告可能达到主任级水平,一旦形成路径依赖,反而把培养路径截断。肖文波的想法是让RADAR同时变成“一对一带教工具”:年轻医生按常规写完报告,再用AI做一次自我检测,哪个病灶漏了、哪个判断偏了,当场就知道。
达摩院资深算法专家张灵说,Science极少发医疗影像AI的文章,因为它长期被当作工程技术问题;RADAR首次证明了通用医疗影像AI是一条具有现实可行性的技术路线,改变了审稿人的想法,审稿人开始把它当作“科学问题”对待。
开源范围包括模型、代码和技术框架,任何团队都可以复现、改进,或迁移到自己的场景。RADAR的器官级对齐框架也适配其他影像模态,只要有相关数据,MRI、PET、超声都可以成为迁移目标。
论文链接:https://www.science.org/doi/10.1126/science.aec6129;开源地址:https://github.com/alibaba-damo-academy/damo-radar。