NVIDIA发布NV-Reason-CT:首个面向3D CT的开源思维链视觉语言模型
NVIDIA推出专为3D CT分析构建的视觉语言模型NV-Reason-CT,在CT-RATE基准上以原生3D生成式架构取得0.614宏F1和0.871宏AUROC,首次让单一开源模型同时具备CT分类与报告生成能力。模型以研究基础定位发布,非获批临床产品。
AI解读:NVIDIA这次把思维链推理从2D胸片搬到了3D CT。此前大多数医学视觉语言模型要么只能处理2D切片,要么把CT体积当成一叠互不相干的图片来处理,切片之间的空间关系就丢了。NV-Reason-CT用一个原生3D视觉编码器直接读取整个CT体积,再让语言模型按放射科医生的方式逐步分析,这是它区别于以往方案的核心。
对开发者来说,实际变化是拿到一个可后训练的开源基础模型。它支持胸部和腹部共59类异常的结构化报告生成、多轮追问,以及模仿医生逐步推理的思维链输出。NVIDIA同时放出Hugging Face检查点和含推理脚本、训练配置、后训练配方的GitHub仓库,研究机构可以基于自己的CT数据集微调。
需要明确的是,这不是可临床落地的诊断产品。NVIDIA在文中写明NV-Reason-CT是开放研究开发基础,不是自主诊断系统,也不是获批临床产品。它主要面向研究人员和开发专科CT应用的企业,距离真正进入放射科工作流还有监管和验证的门槛。
基准数据上,NV-Reason-CT在CT-RATE的18标签分类任务中宏F1为0.614、宏AUROC为0.871,高于VoxelFM的0.581/0.870、ClinFusion-8B的0.442以及MedGemma 1.5的0.303。NVIDIA称这是首次有单一开源模型在CT分类和报告生成上同时达到有竞争力的水平。这些数字来自厂商自报的评测表,第三方复现情况尚不明确。
NVIDIA发布NV-Reason-CT,一个专为3D CT分析构建的视觉语言模型(VLM)。据NVIDIA技术博客,该模型将思维链推理扩展到完整的体积CT,能生成结构化诊断报告、模仿放射科医生的内部思考过程,并支持针对胸部和腹部的多轮追问对话。
NV-Reason-CT基于NV-Reason-CXR开创的推理方法构建。NVIDIA称NV-Reason-CXR已在一项被RSNA 2026接收的多读者临床研究中得到验证,该研究确认了放射科医生的时间节省,同时保持诊断准确性。
NVIDIA明确说明NV-Reason-CT是开放的研究与开发基础,不是自主诊断系统,也不是获批的临床产品。它被定位为AI基础模型,供研究人员和开发者构建专科CT分析应用时进行后训练。
NVIDIA解释3D CT推理需要不同方案的原因:一次腹部CT检查可包含300至600张轴位切片,在三个空间维度上编码解剖上下文,标准2D编码器无法从独立切片中重建这种关系。模型架构将Qwen3.5-4B语言模型与3D ViT(Primus/Colipri)结合,全部权重在大规模CT队列数据上端到端重训练。
编码器基于Primus 3D ViT改造,训练前用Colipri权重初始化。CT体积重采样为192³体素、2毫米各向同性分辨率,使用不重叠的8x8x8 patch token,产生24x24x24即13824个视觉token上下文。所有视觉token连同其3D网格坐标一起传给语言模型,语言模型包含3D MRoPE以处理视觉token的三维空间关系。
NV-Reason-CT的四项核心能力与训练方法
据NVIDIA介绍,NV-Reason-CT的核心能力包括四项:结构化报告生成、模仿放射科医生的思维链、多步对话追问,以及完整3D ViT编码器。NVIDIA团队构建了一个CT本体,覆盖30种胸部异常和29种腹部异常,用于引导和评估模型,包括肺结节、气胸、肝脏病灶、肾囊肿等,其格式可直接映射到临床文档工作流。
思维链能力方面,模型生成逐步的内部思考——系统检查解剖区域、呈现相关发现、考虑鉴别诊断、表达不确定性,风格参照有经验的放射科医生审阅检查的过程。多轮对话能力允许临床医生和研究人员就特定发现追问、要求澄清鉴别诊断,或在任何阶段探查模型推理。
训练方法分两阶段。第一阶段为监督微调,训练数据混合了结构化报告、专家放射科医生的推理标注和通用VQA。放射科医生贡献了CT检查的详细思维链口述,记录其内部审阅过程。课程覆盖约55万个结构化问答示例,横跨胸腹部区域。训练数据包括CT-RATE、NIH CT数据集和CancerVerse,并辅以从大语言模型蒸馏的高质量合成推理数据,以专家放射科医生标注作为锚定示例。
第二阶段使用组相对策略优化(GRPO)精炼推理质量。奖励函数基于识别出的异常和诊断的准确性,并且是解剖感知的:模型在每个解剖区域内被强化准确性,而不是使用单一全局信号。NVIDIA称这种两阶段方法让模型能在CT表现多样性上泛化,而不需要为整个训练分布标注详尽的推理链。
CT-RATE基准表现与临床反馈
NVIDIA称NV-Reason-CT在3D CT理解的主要公开基准上取得领先结果。在CT-RATE的18标签分类任务中,使用固定统一阈值、直接Yes/No提示且无分类头或任务特定适配的条件下,NV-Reason-CT宏F1为0.614、宏AUROC为0.871。对比之下,VoxelFM为0.581/0.870,Pillar-0为0.544/0.861,ClinFusion-8B为0.442(未报告AUROC),CT-CLIP为0.398/0.733,Merlin为0.358/0.662,MedGemma 1.5为0.303(未报告AUROC)。
NVIDIA称这是首次有单一开源模型在CT分类和报告生成上同时达到有竞争力的水平。除基准表现外,NVIDIA表示该模型获得了美国国立卫生研究院(NIH)放射科医生的积极临床评价,他们验证了结构化报告的质量和思维链推理轨迹的临床合理性。
NIH高级临床医生Baris Turkbey在NVIDIA博客中表示:“NV-Reason-CT提供了那种系统性的、逐步的推理,反映了我们实际思考CT检查的方式。能够审阅模型的思考过程——而不仅仅是结论——才使得信任其发现并据此采取行动成为可能。”
在临床应用方面,NVIDIA称生成一份覆盖60多种异常的详细结构化报告即使对有经验的放射科医生也很耗时,NV-Reason-CT可在数秒内生成该输出,并附有临床医生可快速浏览、验证和修改的推理过程。NVIDIA还称传统医学AI模型输出标签或分数,而NV-Reason-CT输出推理过程,使结论可审计。
开源获取方式与生态定位
NV-Reason-CT被设计为更广泛医学AI社区可构建的基础。研究人员可使用模型检查点和后训练配方研究医学影像中的思维链推理、在机构特定CT数据集上微调,或将NV-Reason-CT集成到多模态研究流程中。检查点可从Hugging Face获取,GitHub仓库包含推理脚本、训练配置和后训练配方。
NVIDIA表示互补模型包括用于分割和合成数据生成的NV-Generate-CTMR和NV-Segment-CTMR。医学AI公司,包括放射科工作流供应商、PACS开发者和临床决策支持平台,可以针对特定临床应用适配NV-Reason-CT。NVIDIA在博客中点名Aidoc、HOPPR、Rad AI、Mosaic Clinical Technologies和Raidium等公司,称其所在的领域内,一个能力强、开放、可对话的3D CT模型能填补真实的能力缺口。
NV-Reason-CT属于NVIDIA Medical AI开放医学AI模型家族,与NV-Generate-CTMR、NV-Segment-CTMR和NV-Reason-CXR共同构成从合成数据生成、分割到透明对话式临床推理的端到端放射科AI流程组件。