大数跨境

Nature Communications(一区 ,IF=18.9,)基于 DeepSeek 轻量化多模态大模型的胸片临床全自动阅片系统 Janus-Pro-CXR

Nature Communications(一区 ,IF=18.9,)基于 DeepSeek 轻量化多模态大模型的胸片临床全自动阅片系统 Janus-Pro-CXR 瓴智医学AI
2026-08-04
1
导读:Nature Communications(一区 ,IF=18.9,)基于 DeepSeek 轻量化多模态大模型的胸片临床全自动阅片系统 Janus-Pro-CXR
本文基于 DeepSeek 开源多模态基座 Janus-Pro 构建 1B 参数量轻量化胸片专用大模型 Janus-Pro-CXR,通过三段医学监督微调实现胸部 X 光病灶识别与标准化放射报告自动生成。研究结合大规模公共数据集与国内 27 中心本地胸片数据集完成回顾模型评测,并开展三中心前瞻性人机对照临床试验。结果显示该轻量化模型推理仅需 1–2 秒,硬件门槛低;前瞻性验证中 AI 辅助显著提升住院医师报告质量、病灶判读一致性,单例阅片耗时降低 18.3%,在病灶识别、报告生成指标上优于 ChatGPT4o 等通用大模型,适合基层、医疗资源短缺机构落地,开源框架为影像 AI 轻量化临床转化提供可行方案。

01 摘要

全球放射科医师缺口持续扩大,胸部 X 光作为基础筛查影像阅片负荷极高,现有胸片 AI 存在参数量大、硬件要求高、报告书写不规范、缺乏真实临床前瞻性验证等痛点。本文提出 Janus-Pro-CXR 轻量化多模态放射系统,以 1B 参数 DeepSeek Janus-Pro 为基底,依托 MIMIC-CXR、CheXpert Plus 及国内 27 家医院 CXR-27 数据集分阶段微调,集成视觉编码器、病灶专家分支与报告生成模块。回顾测试中,模型病灶识别 F1、RadGraph 实体抽取指标优于通用大模型与主流胸片专用 AI;纳入 3 家医院 296 名患者的前瞻性随机对照试验证实:AI 辅助组报告质量分 4.36±0.50、RADPEER 一致性分 4.30±0.57,均显著高于纯人工组;单例书写平均 120.6 秒,较常规 147.6 秒缩短 27 秒,效率提升 18.3%。模型支持正侧位双片、历史对比片多输入场景,推理仅需普通 RTX4060 笔记本,开源架构降低基层部署成本,可有效缓解放射人力短缺、规范报告书写、缩短阅片工时。

02 研究背景

一、研究问题

  1. 全球放射医师资源分配不均,低收入地区百万人口仅 1.9 名放射医师,胸片海量阅片造成漏诊、报告书写不规范问题突出。

  2. 现有胸片 AI 多为单任务病灶分类模型,无法生成完整标准化放射报告;通用多模态大模型术语口语化、胸部病灶识别精度不足,且参数量巨大、云端部署存在数据隐私风险。

  3. 多数影像大模型仅完成回顾数据集评测,缺少真实门诊前瞻性人机对照证据,无法证实对医师阅片质量、工作效率的实际改善效果。

  4. 轻量化医学多模态模型稀缺,现有专用模型对高端 GPU 依赖强,基层、基层诊所难以部署,缺少低成本本地运行方案。

二、研究难点


  1. 多阶段领域适配微调:需融合海外公开胸片数据与国内多中心本土化影像,消除设备、人种、报告书写风格差异。

  2. 多任务协同架构设计:同步完成病灶检出、影像实体关系抽取、标准化放射报告生成三大任务,平衡识别精度与文本规范性。

  3. 前瞻性临床试验设计:采用盲法专家多维度打分,设置报告质量、一致性、阅工时多重客观评价指标,控制医师经验混杂变量。

  4. 轻量化性能平衡:在 1B 参数前提下,实现媲美大尺寸模型的胸部影像识别与报告生成能力,降低推理硬件门槛。

三、相关工作


  1. 传统胸片 AI:仅实现结节、积液等单一病灶分类,无完整报告生成能力,临床辅助场景受限。

  2. 通用多模态 LLM(GPT4o 等):跨领域通用性强,但胸部影像专业识别精度不足,放射术语不标准,不支持本地离线部署。

  3. 现有胸片专用多模态模型:识别效果尚可,但参数量大、闭源、依赖高性能工作站,难以下沉基层医疗机构。

  4. 既往影像生成类研究:大多仅做回顾指标对比,未开展真实临床前瞻性试验,缺少人机协同的循证支撑。

03 模型设计


一、总体思路


以 1B 参数 Janus-Pro 多模态基座为基础,搭建 Janus-Pro-CXR 系统:SIGLIP 视觉编码器提取胸片特征,搭配胸部病灶专家分类分支增强病灶感知,时序文本模块生成标准化放射报告;分三阶段监督微调(海外公开集→国内多中心集)。研究分为回顾模型评测、三中心前瞻性人机对照两大模块,定量对比模型识别指标 + 放射医师盲法主观打分,同时验证正侧位、历史对照多图像输入兼容性。

图 1 Janus-Pro-CXR 系统整体技术架构图

二、数据集划分


  1. 微调数据集:MIMIC-CXR、CheXpert Plus 合计 384208 张;国内 27 中心 CXR-27 共 11156 张用于本土化微调。

  2. 回顾测试集:CXR-7 内部测试 1240 例、MIMIC 官方测试集 2365 例,用于病灶识别、报告量化指标评测。

  3. 前瞻性临床队列:3 家医院 296 名需胸片检查患者,1:1 分为 AI 辅助组、纯人工对照组。

  4. 补充多图像测试集:50 例正侧位配对影像、50 例带历史随访对比影像。

三、模型核心模块


  1. Siglip 视觉编码器:提取胸片全局与局部病灶视觉 token;

  2. ET 病灶专家分支:独立输出胸部异常病灶分类结果,为文本生成提供病灶先验;

  3. 条件文本生成模块:融合影像特征、病灶标签、患者病史,输出结构化规范放射报告;

  4. 轻量化推理优化:单张胸片推理 1–2 秒,8G 消费级显卡即可本地离线运行。

图 2 全文研究试验整体流程图(数据集划分、回顾 / 前瞻性研究分支)

04 实验设置


一、硬件与训练参数


训练服务器搭载 RTX3090,推理环境普通笔记本 RTX4060(8G);微调分三阶段,Adam 优化器,分步衰减学习率。

二、对照基线模型


通用多模态:ChatGPT 4o、原生 Janus-Pro;专用胸片模型:MAIRA-2、CheXagent 等主流 SOTA。

三、回顾定量评价指标


  1. 病灶识别:Micro/Macro F1(Top5/14 类胸部征象)、AUC;

  2. 文本指标:RadGraph 实体抽取 F1;

  3. 主观评测:5 名 8–15 年放射专家盲法打分(5 分 Likert 报告质量、RADPEER 一致性、成对偏好测试)。

四、前瞻性临床主要结局


报告质量均分、RADPEER 一致性评分、单例阅片总耗时;次要结局:肺炎等病灶检出阳性率、专家成对偏好占比。

五、统计方法


配对 t 检验、重复测量方差分析、Cohen’s Kappa、Kendall 一致性系数,双侧 P<0.05 为差异有统计学意义。

05 结果与分析


一、回顾数据集模型性能


Janus-Pro-CXR 在 MIMIC、国内 CXR 双测试集所有 F1、RadGraph 指标全面优于 ChatGPT4o、原生 Janus-Pro;专家盲测中 30.4% 单模型报告、54.3% AI 辅助医师报告被 3 名以上专家优先选择;合成报告与真实临床报告视觉、术语相似度极高,评估人员难以区分。

图 3 各模型病灶识别指标小提琴图、专家主观偏好对比柱状图

二、前瞻性临床试验核心结果


  1. 报告质量:AI 组 4.36±0.50 vs 对照组 4.12±0.80(P<0.001);

  2. RADPEER 一致性:AI 组 4.30±0.57 vs 对照组 4.14±0.84(P<0.001);

  3. 阅片效率:AI 平均 120.6s,人工 147.6s,缩短 27s,效率提升 18.3%;

  4. 亚组分析:复杂多病灶病例 AI 省时优势仍显著;AI 组肺炎诊断阳性率显著高于对照组


    图 4 前瞻性试验两组报告得分、阅工时雨云对比图

三、多图像输入拓展验证


同时输入正位 + 侧位胸片、历史对比片时,模型生成报告质量显著优于单正位图像,前瞻性补充队列同样验证 AI 辅助可同步提升报告质量与阅片速度

四、泛化与部署特性


仅 1B 参数,离线本地运行无需云端传输,规避患者影像隐私泄露;微调所需影像样本量少,不同地区医院仅少量本地数据即可完成适配,开源代码便于基层二次部署。

06 结论

本文提出 1B 轻量化多模态胸片专用系统 Janus-Pro-CXR,在公开与国内多中心数据集上病灶识别、标准化报告生成能力优于通用大模型及主流专用胸片 AI;三中心前瞻性临床试验证实,AI 辅助可显著提升低年资放射医师报告规范性、病灶判读一致性,大幅缩短单例阅片时长,减轻放射科工作负荷。模型消费级显卡即可离线推理、开源易部署,适配基层、医疗资源匮乏地区,支持正侧位、历史对比多模态输入,为胸部影像轻量化临床 AI 提供完整开源解决方案。但模型对水肿、胸膜增厚等细微征象识别精度不足,纵向随访历史片对比仅完成回顾测试,缺少长期前瞻性随访验证,当前仅能作为医师辅助工具,无法独立替代放射诊断。

07 论文评价

方法创新亮点

    1.基于 1B 极小参数量多模态基座打造胸片专用放射系统,兼顾识别精度与轻量化离线部署能力,解决基层硬件门槛痛点;
    2.采用海外公开 + 国内多中心分阶段微调策略,兼顾通用影像特征与本土临床报告书写习惯,泛化性更强;
    3.同时完成大规模回顾指标评测 + 真实门诊前瞻性人机对照,循证证据链条完整,区别于仅做离线数据集的同类研究;
    4.集成病灶专家分支 + 标准化报告生成双模块,同步解决病灶漏诊、文书不规范两大临床痛点;

    方法不足

    模型对胸膜增厚、轻微水肿等细微胸部征象识别效果有限,源于训练集轻度病灶样本不足;历史随访胸片动态对比功能仅做回顾验证,无长期前瞻性队列支撑;试验仅纳入国内单区域三家医院,人群、设备多样性有限;未与 MAIRA-2 等闭源顶尖胸片模型开展前瞻性真人对照;系统仅作辅助参考,无法独立出具最终诊断报告,人机双向实时交互问诊功能尚未开发完善。

    08 参考资料

    Article:

    DOI:10.1038/s41467-026-72680-6

    图文:陈宣辰

    编辑:陈宣辰

    审核:吴朝


    Nature Communications(一区,IF=18.9)CBSI 扩散生成框架:基于无造影 MRI 无创识别胶质瘤血脑屏障状态
    Radiology(一区,IF=11.1)深度伪造 X 光影像的风险研究:放射医师与多模态大模型识别 ChatGPT 生成合成胸片的诊断准确度
    Nature Medicine(一区 IF=50)基于大语言模型的临床医学文献系统综述
    Nature Communications(一区|IF=15.7)通过基于机器学习的增强采样工作流程,针对那些具有内在无序结构的AR-NTD进行建模.-

    【声明】内容源于网络
    0
    0
    瓴智医学AI
    分享医学人工智能前沿知识,搭建跨学科研究、合作及应用转化平台。致力于医学人工智能技术、研发及科研,提供医学人工智能全方位服务。
    内容 78
    粉丝 0
    瓴智医学AI 分享医学人工智能前沿知识,搭建跨学科研究、合作及应用转化平台。致力于医学人工智能技术、研发及科研,提供医学人工智能全方位服务。
    总阅读2.0k
    粉丝0
    内容78