01 摘要
CT 影像数量持续增长,放射医师人力缺口巨大。现有医学视觉语言模型大多基于 2D 切片,通过逐切片聚合得到 3D 特征,不能完整处理三维容积信息;且大多只使用放射报告单一监督源,没有充分挖掘医院内现成结构化 EHR 诊断信息。本文构建 Merlin,基于 I3D 膨胀 ResNet152 作为 3D 图像编码器,Clinical‑Longformer 作为文本编码器,联合 EHR 表型标签、解剖拆分后的放射报告做多任务对比学习预训练。无需微调的原生能力包含零样本病灶检出、PheWAS 表型分类、图文跨模态检索;经过适配微调后支持 5 年慢性疾病风险预测、放射报告生成、3D 器官分割。内部测试集与来自 3 个外部机构共 44098 例腹部、胸部 CT 开展验证;对比 2D VLM、2D‑to‑3D、纯 3D 自监督等多条基线,Merlin 在绝大多数任务上表现最优,即便只训练腹部 CT,在胸部 CT 任务上依然优于专门训练胸部 CT 的基础模型。本研究给出数据缩放规律,证实医疗机构在单 GPU 条件即可训练 3D CT 多模态基座;开源数据集与全套代码,为三维 CT 医学基础模型提供基线。
02 研究背景
一、研究问题
-
CT 检查量逐年上涨,放射科医师人力不足;现有 AI 多为单任务专用模型,新任务需要大量人工标注,成本高昂。
-
多数医学视觉语言模型基于 2D 切片,采用切片均值聚合得到三维表征,无法完整捕获 CT 容积三维解剖空间信息。
-
现有 CT 多模态基座大多仅利用放射报告文本,忽略医院现成结构化 EHR 的 ICD 诊断编码这一弱监督信号。
-
完备评测体系缺失:很多研究缺少零样本任务、下游微调任务、多中心外部验证、消融实验与数据缩放规律的完整链条,仅依赖内部数据集测试。
-
3D 医学模型训练算力门槛高,多数医院硬件资源有限,缺少可在单 GPU 完成训练的可行落地方案。
二、相关工作
-
2D 医学 VLM(MedCLIP、BioMedCLIP):基于二维切片,依靠切片均值聚合得到三维特征,损失三维解剖信息。
-
2D‑to‑3D 升维模型:先 2D 提取特征,再用投影层聚合,无法原生处理完整三维 CT 容积。
-
纯 3D 自监督模型:如 Swin‑UNETR,仅做图像自监督学习,缺少图文对齐能力,不能完成零样本检索、提示推理任务。
-
现有 CT 基础模型:部分专门面向胸部 CT 的基座,但很少同时引入 EHR 结构化标签;普遍缺少大规模多中心外部验证、完整消融与数据缩放规律分析。
03 模型设计
- 数据预处理流程:腹部 CT 容积做重采样,HU 值截断归一化;放射报告按照解剖部位拆分为子片段;ICD 编码映射到 PheWAS 表型,构建多标签弱监督标签集。
图 1 Merlin 训练策略与全部评测任务总览图
图 2 零样本病灶检出原理、消融实验与外部数据集性能图
- 训练数据集:单中心回顾临床队列,15331 例腹部 CT,配套放射报告、ICD 编码;内部测试集 5137 例;外部 3 家中心合计 44098 例 CT(腹部 + 胸部),VerSe、TotalSegmentator 公开数据集用于骨折、器官分割评测。
04 实验设置
一、训练硬件与参数
单张 A6000‑48G GPU;FP16 混合精度,开启梯度检查点;AdamW 优化器;联合 InfoNCE、BCE 多损失函数;支持多任务同步、两阶段分阶段两套训练配置。
二、对比基线:2D VLM(OpenCLIP、BioMedCLIP、ResnetCLIP);2D‑to‑3D 升维 VLM;纯 3D 自监督模型 Swin‑UNETR、I3D ResNet;公开 CT 基座 MedImageInsight、Google‑CT‑FM、CT‑CLIP、M3FM。
三、验证任务集合
-
非适配零样本任务:30 项病灶零样本检出;692 个 PheWAS 表型分类;图像‑报告双向零样本跨模态检索;
-
微调适配任务:6 种慢性疾病 5 年发病风险预测;基于 RadLlama‑7B LoRA 微调生成放射报告;基于 nnUNet 框架添加解码器完成 20 类器官 3D 语义分割;
-
补充实验:架构消融实验、训练策略消融、数据缩放实验;跨解剖泛化实验(腹部预训练,评测胸部 CT);多中心外部数据集验证。
图 3 表型分类、5 年慢病预测、报告生成、器官分割实验结果汇总图
四、统计方法
bootstrap 重采样获取 95% 置信区间;分类任务指标 AUROC、AUPRC、F1;分割任务 Dice 系数;检索任务 Recall@1;采用单侧 p 值做显著性检验。
05 结果与分析
- 零样本任务性能
内部数据集零样本病灶检出平均 F1=0.741;外部数据集 F1=0.647,显著优于 2D OpenCLIP、BioMedCLIP 基线;报告解剖拆分对零样本分类增益最大。692 个表型分类 macro‑AUROC=0.812;零样本图文双向检索结果全面优于全部 2D 基线。
- 5 年慢性疾病预测
100% 下游标签条件平均 AUROC=0.757;仅使用 10% 稀缺标签样本 AUROC 仍可达 0.708,较 ImageNet 初始化纯视觉模型提升 4‑7 个百分点,在标签稀缺场景收益突出。
- 放射报告生成
对比基线 RadFM,RadGraph‑F1、BERTScore、ROUGE‑2、BLEU 全部量化指标更优,支持按解剖部位分段输出报告;存在一定假阴性漏检问题。
- 3D 器官语义分割
训练样本稀缺(10% 数据)条件,Merlin 预训练权重初始化 Dice 显著优于原生 nnUNet;100% 充足标签场景,专用 nnUNet 架构性能略占优势。
- 消融与数据缩放实验
I3D 初始化、EHR 联合放射报告多任务训练带来明显性能提升;报告拆分有益于零样本分类,但对检索任务无增益;模型性能随训练数据量增大持续提升,得到 CT 基座的数据缩放参考曲线。
- 跨解剖泛化结果
Merlin 仅用腹部 CT 完成预训练,在线性探针评测胸部 CT 任务时,性能优于专门基于胸部 CT 训练的 CT‑CLIP、M3FM 等基座,体现强大三维表征跨解剖迁移能力。
- 多中心外部验证
44098 例多中心 CT 验证集上,Merlin 稳定优于各类对比基线,对设备、人群、报告书写习惯带来的数据分布偏移鲁棒性良好。
06 结论
Merlin 是面向 CT 的 3D 视觉‑语言基础模型,联合结构化 EHR 表型标签与放射报告文本开展多源弱监督预训练,单张 A6000 GPU 即可完成完整训练。模型具备零样本病灶检出、表型分类、跨模态检索原生能力;经过微调适配可以实现慢病风险预测、放射报告生成、三维器官分割。经过大规模内外部 CT 数据集完整验证,综合性能优于 2D VLM、2D‑to‑3D 升维、纯 3D 自监督等对比基线;仅在腹部 CT 预训练就可以很好泛化到胸部 CT 任务。研究给出 CT 基础模型的数据缩放规律,开源模型、代码与数据集,为医疗机构自建三维医学影像基础模型提供可复用范式。本研究存在局限:报告生成模块存在假阴性漏检;预训练数据来自单家机构;尚未开展真实临床前瞻性试验;对极微小病灶识别能力有限。
07 论文评价
✅方法创新亮点
-
创新训练范式,同时利用结构化 EHR 诊断编码 + 非结构化放射报告两类医院存量数据做弱监督,无需大规模人工标注。
-
原生处理完整三维 CT 容积,区别主流 2D 切片聚合路线;划分零样本原生能力、下游微调适配两套使用路径,覆盖多样化临床任务。
-
证据链完整,包含内部测试、大样本多中心外部验证、多组消融实验、数据缩放规律、跨解剖泛化测试,与大量主流基线头对头对比。
-
证实 3D CT 基础模型可在单 GPU 完成训练,显著降低医院开展医学大模型研究的算力门槛;完整开源数据集与代码
⚠方法不足
预训练数据来源为单家学术机构,虽然做了多中心外部测试,但预训练数据多样性有限;放射报告生成存在假阴性漏检,生成模块有待进一步优化;未开展真实临床前瞻性试验,不能评估对放射医师工作流、患者诊断结局的实际影响;在分割任务训练样本充足条件下,nnUNet 专用架构性能略优于 Merlin 初始化;未拓展 MRI 等其他三维医学模态,没有探索更高分辨率输入。
08 参考资料
Article:
编辑:陈宣辰
审核:吴朝
JAMA Network Open (一区,IF=11.7)放射领域人工智能与机器学习医疗器械 FDA 审批现状:一项系统综述
npj Digital Medicine(IF=18.1)丨广东省人民医院眼科联合中山大学等多家单位开发PubChat,实现可溯源的多语言生物医学文献智能检索
npj digital medicine(一区|IF=18)用于肺腺癌谱系结节术前侵入性分级的多模态深度学习方法
Nature Medicine(一区 IF=52.5)对MASLD中脂肪性肝炎和纤维化相关影像及血清诊断生物标志物的前瞻性验证:LITMUS影像研究

