大数跨境

Science(一区 ,IF=47.3)DAMO‑RADAR:面向腹部 CT 的专家级通用多模态诊断大模型

Science(一区 ,IF=47.3)DAMO‑RADAR:面向腹部 CT 的专家级通用多模态诊断大模型 瓴智医学AI
2026-10-04
8
导读:Science(一区 ,IF=47.3)DAMO‑RADAR:面向腹部 CT 的专家级通用多模态诊断大模型
本文题为《An expert‑level generalist AI for abdominal CT diagnosis》由 Tingbo Liang 等多位学者共同完成,作者单位包括浙江大学医学院附属第一医院、阿里巴巴达摩院以及国内多家合作医疗机构。腹部 CT 解剖结构复杂、病变类型繁多,现有影像 AI 多为单病种专用模型,高度依赖人工病灶标注,普通图文对齐模型易受大量正常组织背景干扰,通用诊断能力存在明显局限。针对上述问题,该研究构建 DAMO‑RADAR 腹部 CT 通用视觉语言大模型,提出器官级细粒度图文对齐学习策略,直接利用海量 CT 与放射报告配对数据开展训练,无需手工病灶标注,可识别 18 个解剖部位下共计 146 种影像学异常。研究依托内部、多中心外部以及急诊 CT 数据集完成多层验证,同时开展 26 名放射科医师对照阅片与人机协同实验,结果显示该模型独立诊断性能优秀,作为阅片辅助工具能够提升医师诊断灵敏度、缩短阅片耗时。该模型开源开放,为腹部 CT 通用放射 AI 的科研探索与临床转化提供新思路。

01 摘要

放射学对于现代临床诊断至关重要,能够检测和表征多种疾病的特征。该领域长期以来的愿景是实现一种通用人工智能(AI),能够为各种真实场景提供专家级诊断支持。增强腹部计算机断层扫描(CT)是最复杂的挑战之一,需要评估数十个器官和数百种疾病。尽管在特定领域取得了人工智能的里程碑,当前的人工智能解决方案在疾病覆盖和准确性方面仍然有限。它们主要依赖于带昂贵的手工注释的监督学习,限制了在开放式临床环境中的可扩展性和适用性。

02 研究背景

一、研究问题


1.腹部 CT 包含多器官、数百种病变,临床场景复杂;现有影像 AI 大多是单病种专用模型,“一病一模” 开发模式,开发成本高,很难覆盖全部临床病变。

2.传统模型高度依赖人工勾画病灶金标准标注,大规模高质量病灶标注人力成本高昂,限制通用放射 AI 发展。
3.普通医学图文对齐模型直接对整张 CT 与报告做粗粒度对齐,缺少器官解剖约束,容易被大量正常组织背景干扰,腹部 CT 任务效果差。
4.多数医学大模型仅做离线指标评测,缺少真实医师对照阅片研究,缺少对人机协同辅助效果的评估。
5.模型跨设备、跨中心、急诊非理想扫描条件下泛化能力需要验证。

二、相关工作


1.单病种专用 CTAI:针对肝脏、胰腺等单一疾病,依赖大量人工病灶标注,模型能力局限单一任务。

2.用医学视觉语言模型(CT‑CLIP 等):整张影像‑报告粗粒度对齐,缺少解剖先验,在解剖复杂腹部 CT 任务性能受限。
3.医学 3D 基础模型:侧重特征提取,缺少面向放射诊断的图文对齐,难以直接输出多病变诊断结果。
4.医学 AI 阅片人对照研究:多数研究仅看离线 AUC,较少开展多名放射医师对照、人机协同辅助的真实阅片评估。

03 模型设计


1.整体双分支架构:视觉分支(3D‑nnU‑Net 编码器 + 解剖分割解码器)、文本分支;实现器官级细粒度图文对齐。
图 1 DAMO‑RADAR 整体架构、器官级细粒度图文对齐流程图
2.器官级细粒度对齐核心机制:3D 编码器提取全 CT 体积特征;分割解码器预测 18 类腹部解剖器官 mask;利用器官 mask 作为空间参考,把每个解剖器官对应的局部影像特征,和放射报告内对应器官描述文本做细粒度图文对比学习,规避大量正常组织背景带来的干扰。
   
3.训练数据形式:直接使用原始 CT 影像 + 原始放射报告配对,不需要病灶手工标注;学习器官影像片段和报告文本描述之间的对应关系。
  
4.推理模式:模式一:模型独立输出 18 个解剖部位对应的 146 项影像异常诊断结果;模式二:作为辅助工具,输出提示给放射医师,实现人机协同阅片。

5.后处理微调:基于少量标注样本做微调,进一步提升多中心数据集诊断性能。

04 实验设置


一、数据集


  1. 内部训练 + 测试:近 3.9 万例连续真实世界腹部增强 CT;

  2. 多中心外部测试:8 家外部医疗机构合计 2.4 万例 CT,不同设备、扫描参数;

  3. 急诊泛化数据集:2.7 万例急诊腹部 CT(未参与训练,成像条件差);

  4. 医师阅片研究集:300 例 CT,26 名来自 14 家机构放射医师(含高年资主治、住院医师)。

二、对比基线


CT‑CLIP、fVLM 等医学视觉语言基线;临床放射科医师人工判读。

三、评测任务集合


  1. 离线指标:146 种病变诊断 AUC;内部、多中心外部、急诊数据集性能;微调前后性能对比;

  2. 医师头对头对照:RADAR 独立模型和 26 位放射医师诊断结果对比;

  3. 人机协同实验:放射医师在 RADAR 辅助提示下阅片,统计灵敏度、阅片耗时变化;

  4. 癌症专项评估:肝癌、胰腺癌、胃癌、肠癌四类恶性肿瘤诊断性能。

四、统计方法


bootstrap 获取 95% 置信区间;ROC‑AUC;统计阅片灵敏度、阅片时间,对比人机协同前后差异。

05 结果与分析


  1. 癌症专项

    肝癌、胰腺癌、胃癌、肠癌四类肿瘤 AUC 区间 0.891‑0.984。

  2. 和放射医师头对头对照

    RADAR 独立诊断综合表现优于 26 名放射医师中 23 位,仅 3 位高年资医师整体结果优于模型。

  3. 人机协同阅片结果

    使用 RADAR 作为阅片辅助提示,放射医师整体诊断灵敏度提升约 10%,阅片耗时下降 30.7%;低年资医师借助模型辅助可以缩小与高年资医师的诊断差距。

  4. 基线对比

    器官细粒度对齐方案显著优于整张图粗粒度图文对齐的 CT‑CLIP、fVLM 等基线模型。

06 结论

RADAR是一款基于可扩展视觉语言框架构建的通用人工智能模型,直接基于大规模临床报告训练,无需人工注释。它实现了广泛的诊断覆盖和高腹部CT解读的准确性,并在作为辅助阅读工具时提高了放射科医生的灵敏度。这项研究表明,大规模视觉语言学习可能为高效开发适用于复杂多样的放射学解读任务的通用人工智能系统提供切实可行的路径。

07 论文评价

✅方法创新亮点

  1. 器官级细粒度图文对齐:创新架构,引入解剖分割 mask 作为空间约束,解决腹部 CT 粗粒度图文对齐受大量正常组织背景干扰的痛点;不需要病灶手工标注,充分挖掘医院存量 CT‑报告资源。
  2. 证据链条完整:内部真实连续队列、多中心 8 家机构外部验证、急诊场景泛化、26 名放射医师头对头对照阅片、人机协同辅助效果评估,不局限单纯离线 AUC 指标。

  3. 同时评估模型独立诊断能力,以及人机协同辅助放射医生工作流,更贴合放射科真实临床使用场景。

  4. 完整开源模型权重与代码,降低通用腹部 CT 影像 AI 后续研究门槛;是通用放射 AI 重要的临床转化研究范例。

⚠方法不足

虽然急诊 CT 有不错泛化,对于极罕见病变样本不足;没有完成医疗器械审批,仅科研用途,不可替代放射医师诊断。训练数据来源于国内医疗机构,在人种、设备差异极大海外人群的泛化有待进一步验证。

08 参考资料

Article:

DOI:10.1126/science.aec6129

图文:陈宣辰

编辑:陈宣辰

审核:吴朝


Nature Communications(一区, IF=15.7)基于 DeepSeek 轻量化多模态大模型的胸片临床全自动阅片系统 Janus-Pro-CXR


Nature Communications(一区,IF=15.7)CBSI 扩散生成框架:基于无造影 MRI 无创识别胶质瘤血脑屏障状态


Lancet Digital Health(一区,IF=27.6)基于内镜图像的鼻咽癌 AI 检测系统全国多中心开发与验证


Cancer Cell(一区|IF=56.1)基于知识增强的视觉-语言病理基础模型预训练,用于癌症诊断

【声明】内容源于网络
0
0
瓴智医学AI
分享医学人工智能前沿知识,搭建跨学科研究、合作及应用转化平台。致力于医学人工智能技术、研发及科研,提供医学人工智能全方位服务。
内容 85
粉丝 0
瓴智医学AI 分享医学人工智能前沿知识,搭建跨学科研究、合作及应用转化平台。致力于医学人工智能技术、研发及科研,提供医学人工智能全方位服务。
总阅读2.5k
粉丝0
内容85