01 摘要
全球放射科医师缺口持续扩大,胸部 X 光作为基础筛查影像阅片负荷极高,现有胸片 AI 存在参数量大、硬件要求高、报告书写不规范、缺乏真实临床前瞻性验证等痛点。本文提出 Janus-Pro-CXR 轻量化多模态放射系统,以 1B 参数 DeepSeek Janus-Pro 为基底,依托 MIMIC-CXR、CheXpert Plus 及国内 27 家医院 CXR-27 数据集分阶段微调,集成视觉编码器、病灶专家分支与报告生成模块。回顾测试中,模型病灶识别 F1、RadGraph 实体抽取指标优于通用大模型与主流胸片专用 AI;纳入 3 家医院 296 名患者的前瞻性随机对照试验证实:AI 辅助组报告质量分 4.36±0.50、RADPEER 一致性分 4.30±0.57,均显著高于纯人工组;单例书写平均 120.6 秒,较常规 147.6 秒缩短 27 秒,效率提升 18.3%。模型支持正侧位双片、历史对比片多输入场景,推理仅需普通 RTX4060 笔记本,开源架构降低基层部署成本,可有效缓解放射人力短缺、规范报告书写、缩短阅片工时。
02 研究背景
一、研究问题
-
全球放射医师资源分配不均,低收入地区百万人口仅 1.9 名放射医师,胸片海量阅片造成漏诊、报告书写不规范问题突出。
-
现有胸片 AI 多为单任务病灶分类模型,无法生成完整标准化放射报告;通用多模态大模型术语口语化、胸部病灶识别精度不足,且参数量巨大、云端部署存在数据隐私风险。
-
多数影像大模型仅完成回顾数据集评测,缺少真实门诊前瞻性人机对照证据,无法证实对医师阅片质量、工作效率的实际改善效果。
-
轻量化医学多模态模型稀缺,现有专用模型对高端 GPU 依赖强,基层、基层诊所难以部署,缺少低成本本地运行方案。
二、研究难点
-
多阶段领域适配微调:需融合海外公开胸片数据与国内多中心本土化影像,消除设备、人种、报告书写风格差异。
-
多任务协同架构设计:同步完成病灶检出、影像实体关系抽取、标准化放射报告生成三大任务,平衡识别精度与文本规范性。
-
前瞻性临床试验设计:采用盲法专家多维度打分,设置报告质量、一致性、阅工时多重客观评价指标,控制医师经验混杂变量。
-
轻量化性能平衡:在 1B 参数前提下,实现媲美大尺寸模型的胸部影像识别与报告生成能力,降低推理硬件门槛。
三、相关工作
-
传统胸片 AI:仅实现结节、积液等单一病灶分类,无完整报告生成能力,临床辅助场景受限。
-
通用多模态 LLM(GPT4o 等):跨领域通用性强,但胸部影像专业识别精度不足,放射术语不标准,不支持本地离线部署。
-
现有胸片专用多模态模型:识别效果尚可,但参数量大、闭源、依赖高性能工作站,难以下沉基层医疗机构。
-
既往影像生成类研究:大多仅做回顾指标对比,未开展真实临床前瞻性试验,缺少人机协同的循证支撑。
03 模型设计
一、总体思路
以 1B 参数 Janus-Pro 多模态基座为基础,搭建 Janus-Pro-CXR 系统:SIGLIP 视觉编码器提取胸片特征,搭配胸部病灶专家分类分支增强病灶感知,时序文本模块生成标准化放射报告;分三阶段监督微调(海外公开集→国内多中心集)。研究分为回顾模型评测、三中心前瞻性人机对照两大模块,定量对比模型识别指标 + 放射医师盲法主观打分,同时验证正侧位、历史对照多图像输入兼容性。
图 1 Janus-Pro-CXR 系统整体技术架构图
二、数据集划分
-
微调数据集:MIMIC-CXR、CheXpert Plus 合计 384208 张;国内 27 中心 CXR-27 共 11156 张用于本土化微调。
-
回顾测试集:CXR-7 内部测试 1240 例、MIMIC 官方测试集 2365 例,用于病灶识别、报告量化指标评测。
-
前瞻性临床队列:3 家医院 296 名需胸片检查患者,1:1 分为 AI 辅助组、纯人工对照组。
-
补充多图像测试集:50 例正侧位配对影像、50 例带历史随访对比影像。
三、模型核心模块
-
Siglip 视觉编码器:提取胸片全局与局部病灶视觉 token;
-
ET 病灶专家分支:独立输出胸部异常病灶分类结果,为文本生成提供病灶先验;
-
条件文本生成模块:融合影像特征、病灶标签、患者病史,输出结构化规范放射报告;
-
轻量化推理优化:单张胸片推理 1–2 秒,8G 消费级显卡即可本地离线运行。
图 2 全文研究试验整体流程图(数据集划分、回顾 / 前瞻性研究分支)
04 实验设置
一、硬件与训练参数
训练服务器搭载 RTX3090,推理环境普通笔记本 RTX4060(8G);微调分三阶段,Adam 优化器,分步衰减学习率。
二、对照基线模型
通用多模态:ChatGPT 4o、原生 Janus-Pro;专用胸片模型:MAIRA-2、CheXagent 等主流 SOTA。
三、回顾定量评价指标
-
病灶识别:Micro/Macro F1(Top5/14 类胸部征象)、AUC;
-
文本指标:RadGraph 实体抽取 F1;
-
主观评测:5 名 8–15 年放射专家盲法打分(5 分 Likert 报告质量、RADPEER 一致性、成对偏好测试)。
四、前瞻性临床主要结局
报告质量均分、RADPEER 一致性评分、单例阅片总耗时;次要结局:肺炎等病灶检出阳性率、专家成对偏好占比。
五、统计方法
配对 t 检验、重复测量方差分析、Cohen’s Kappa、Kendall 一致性系数,双侧 P<0.05 为差异有统计学意义。
05 结果与分析
一、回顾数据集模型性能
Janus-Pro-CXR 在 MIMIC、国内 CXR 双测试集所有 F1、RadGraph 指标全面优于 ChatGPT4o、原生 Janus-Pro;专家盲测中 30.4% 单模型报告、54.3% AI 辅助医师报告被 3 名以上专家优先选择;合成报告与真实临床报告视觉、术语相似度极高,评估人员难以区分。
图 3 各模型病灶识别指标小提琴图、专家主观偏好对比柱状图
二、前瞻性临床试验核心结果
-
报告质量:AI 组 4.36±0.50 vs 对照组 4.12±0.80(P<0.001);
-
RADPEER 一致性:AI 组 4.30±0.57 vs 对照组 4.14±0.84(P<0.001);
-
阅片效率:AI 平均 120.6s,人工 147.6s,缩短 27s,效率提升 18.3%;
-
亚组分析:复杂多病灶病例 AI 省时优势仍显著;AI 组肺炎诊断阳性率显著高于对照组
图 4 前瞻性试验两组报告得分、阅工时雨云对比图
三、多图像输入拓展验证
同时输入正位 + 侧位胸片、历史对比片时,模型生成报告质量显著优于单正位图像,前瞻性补充队列同样验证 AI 辅助可同步提升报告质量与阅片速度。
四、泛化与部署特性
仅 1B 参数,离线本地运行无需云端传输,规避患者影像隐私泄露;微调所需影像样本量少,不同地区医院仅少量本地数据即可完成适配,开源代码便于基层二次部署。
06 结论
本文提出 1B 轻量化多模态胸片专用系统 Janus-Pro-CXR,在公开与国内多中心数据集上病灶识别、标准化报告生成能力优于通用大模型及主流专用胸片 AI;三中心前瞻性临床试验证实,AI 辅助可显著提升低年资放射医师报告规范性、病灶判读一致性,大幅缩短单例阅片时长,减轻放射科工作负荷。模型消费级显卡即可离线推理、开源易部署,适配基层、医疗资源匮乏地区,支持正侧位、历史对比多模态输入,为胸部影像轻量化临床 AI 提供完整开源解决方案。但模型对水肿、胸膜增厚等细微征象识别精度不足,纵向随访历史片对比仅完成回顾测试,缺少长期前瞻性随访验证,当前仅能作为医师辅助工具,无法独立替代放射诊断。
07 论文评价
✅方法创新亮点
⚠方法不足
模型对胸膜增厚、轻微水肿等细微胸部征象识别效果有限,源于训练集轻度病灶样本不足;历史随访胸片动态对比功能仅做回顾验证,无长期前瞻性队列支撑;试验仅纳入国内单区域三家医院,人群、设备多样性有限;未与 MAIRA-2 等闭源顶尖胸片模型开展前瞻性真人对照;系统仅作辅助参考,无法独立出具最终诊断报告,人机双向实时交互问诊功能尚未开发完善。
08 参考资料
Article:
编辑:陈宣辰
审核:吴朝


