01 摘要
多模态大模型可仅凭文字提示生成高度逼真的深度伪造 X 光片,存在病历造假、数据集投毒、误诊诉讼等医疗安全风险,但目前缺少医师与主流 LLM 识别能力的对照验证。本研究分三阶段回顾性诊断准确性试验,纳入 6 国 17 名不同从业年限放射医师,设置两套平衡数据集:数据集 1 含 77 张 GPT-4o 多部位合成 X 光、77 张真实影像;数据集 2 含 55 张 RoentGen 专用合成胸片、55 张真实胸片。第一阶段医师盲试验研究目的,仅 41% 的医师自发察觉数据内存在 AI 伪造图像;第二阶段告知存在合成影像后,医师区分 GPT 伪造影像平均准确率 74.8%;第三阶段识别专用 RoentGen 胸片准确率 70.0%,二者无统计学差异。四款大模型中 GPT-4o 识别准确率最高(85.1%),但仍无法全部检出伪造图像;合成影像共性特征为均匀噪声、过度光滑骨骼、不对称软组织纹理、脊柱双侧过度对称。研究表明医师与现有多模态大模型识别深度伪造 X 光能力有限,亟需开展医师专项培训、部署影像溯源与自动检测工具防范医疗造假风险,同时开源伪造影像数据集供行业训练使用。
02 研究背景
一、研究问题
-
1.GPT-4o 等通用多模态大模型降低医学影像造假门槛,普通人仅文字描述即可生成各部位 X 光,伪造影像可混入电子病历、科研数据集,造成误诊、保险欺诈、AI 训练数据污染。 -
-
2.现有专用放射生成模型仅面向单部位、需要专业代码能力,而通用 LLM 操作门槛极低,造假风险大幅提升,但医师能否区分伪造影像尚无大规模多中心验证。 -
-
3.缺乏横向对比主流商用多模态大模型识别深度伪造 X 光的性能数据,不清楚通用模型与专用放射生成伪造影像的识别难度差异。 -
-
4.行业缺少统一的伪造影像鉴别特征、标准化识别训练数据集与医疗影像防伪管控方案。 -
二、研究难点
-
1.多中心多国受试者统筹:覆盖不同从业年限、亚专业放射医师,控制阅片显示器、图像缩放等标准化阅片条件。 -
-
2.两套差异化数据集构建:区分通用 LLM 全部位合成影像、专用胸部扩散模型影像,控制病灶、噪声、解剖分布匹配。 -
-
3.三阶段分层试验设计:盲态自发识别、知情区分、专用胸片对照三阶段分步开展,消除信息偏倚。 -
-
4.人机平行对照:统一输入图像给 4 款主流大模型,标准化提问提示,量化各项诊断指标。 -
三、相关工作
-
1.早期 GAN 伪造影像研究仅局限膝关节 X 光,医师识别准确率接近随机水平,未覆盖通用文生大模型。 -
-
2.RoentGen 等专用胸部生成模型仅针对单一解剖部位,技术门槛高,难以大规模造假。 -
-
3.现有 AI 文本检测工具成熟,但针对 X 光深度伪造的像素级检测工具稀缺,缺少医师人机对照循证研究。 -
-
4.合成影像多用于模型数据增强,但未系统评估其恶意滥用带来的临床与科研安全隐患。 -
03 模型设计
一、总体思路
三阶段平行对照阅片试验,搭建两套独立平衡 X 光数据集,招募多国放射医师完成分层阅片测试,同步将相同图像输入四款主流多模态大模型,量化医师与 LLM 的识别准确率、灵敏度、特异度,归纳伪造影像统一视觉特征,对比通用 LLM 与专用放射生成伪造影像的识别难度差异。
二、数据集构建
-
1.数据集 1(GPT-4o 多部位):77 张 AI 生成、77 张真实 X 光,覆盖胸、脊柱、手足多解剖区域,剔除明显解剖失真的劣质合成图,病灶、噪声分布与真实图像匹配。 -
-
2.数据集 2(RoentGen 胸部专用):55 张扩散模型合成胸片、55 张真实胸片,仅胸部单部位。 -
-
3.真实影像来源:公开胸部、脊柱、骨骼 X 光标准数据集。 -
三、受试人员与测试模型
-
1.医师:6 国 17 名放射医师,从业 0–40 年,涵盖骨骼、胸部、介入、核医学亚专业。 -
-
2.测试 LLM:GPT-4o、GPT-5、Gemini 2.5 Pro、Llama 4 Maverick,统一鉴别提示词。 -
四、三阶段试验流程
1.阶段 1:盲态试验目的,医师仅评估图像质量、书写诊断,结束后自主反馈是否存在异常图像;
2.阶段 2:告知数据集含 AI 伪造图像,对数据集 1 逐张区分真实 / 合成并标注置信度;
3.阶段 3:使用专用 RoentGen 胸部数据集重复鉴别任务。
图 1 两套数据集构建、筛选与试验整体流程图
04 实验设置
一、阅片平台
定制网页阅片系统,全屏灰度固定显示器,禁用窗宽调节、图像缩放,统一随机图像顺序消除顺序偏倚。
二、核心评价指标
准确率、灵敏度、特异度、阳性预测值 PPV、阴性预测值 NPV、医师间 Fleiss 一致性 κ、平均置信评分。
三、统计方法
McNemar 检验对比两组识别准确率,t 检验对比图像质量评分,Wilson 置信区间计算分类指标,线性回归分析从业年限与识别能力相关性。
四、基线控制
医师统一使用 1080p 以上医用显示器,阅片环境标准化,图像亮度、分辨率保持一致。
05 结果与分析
一、盲态阶段自发识别结果
仅 41%(7/17)医师在不知情前提下主动察觉图像包含 AI 伪造 X 光;合成图像人工伪影检出率 15.4%,显著高于真实影像 5.5%;医师对合成、真实病灶诊断准确率无显著差异。
表 1 合成与真实 X 光图像质量、伪影、诊断准确率对比表
二、知情后 GPT 多部位影像识别性能
医师整体鉴别准确率 74.8%,灵敏度 69.1%,特异度 80.4%;骨骼亚专业医师识别准确率显著高于其他亚专业;从业年限与识别准确率无显著相关性,医师间一致性仅轻度(κ=0.31)。
图 2 医师与各大模型准确率、灵敏度、特异度箱型对比图
三、大模型横向对比
GPT-4o 识别性能最优(准确率 85.1%),GPT-5 次之(82.5%),Gemini、Llama 不足 60%;所有模型均无法 100 检出伪造影像,模型普遍过度判定骨骼纹理、噪声异常。
四、RoentGen 专用胸片识别结果
医师识别准确率 70.0%,与 GPT 多部位影像 74.8% 无统计学差异(P=0.07);高年资医师识别效果小幅优于低年资,但无显著线性关联。
五、深度伪造 X 光典型视觉特征
统一鉴别标识:全图均匀颗粒噪声、骨骼表面过度光滑无自然皮质起伏、软组织纹理生硬、脊柱双侧完全对称;伪造骨折线条光滑单一、多为单侧皮质断裂;胸部影像肺纹理均匀无自然差异。
图 3 真实与 GPT 生成胸、脊柱、手足 X 光配对示例
06 结论
通用多模态大模型可生成高度逼真的深度伪造 X 光影像,无论放射医师还是主流商用多模态 LLM,均无法可靠区分真实与 AI 合成医学影像;医师从业年限、影像解剖部位对识别能力提升作用有限,专用胸部扩散模型伪造胸片识别难度与通用 GPT 生成影像接近。合成 X 光存在均匀噪声、过度光滑骨骼、完美对称等统一视觉破绽,但辨识度不足;行业需建立放射医师专项鉴别培训、部署影像数字水印 / 哈希溯源、开发像素级自动检测工具多层级防控机制,同时文中开源伪造 X 光数据集可供全球用于医师与检测模型训练。但本研究图像伪造样本占比 50% 远高于真实临床场景,实际临床中漏检风险会进一步升高。
07 论文评价
✅方法创新亮点
1.本研究为首个多国多放射医师 + 四大主流多模态大模型平行对照深度伪造 X 光识别试验,同时对比通用 LLM 与专用放射生成伪造影像识别难度;
2.分层设置盲态、知情两组阅片场景,真实还原临床不知情下的识别短板;
3.系统归纳 AI 伪造 X 光通用视觉鉴别特征,配套开源标准化伪造影像数据集,为行业防伪培训、检测模型开发提供统一基准;
4.完整量化人机识别各项诊断指标,统计设计严谨,直接为医疗影像安全监管提供循证依据。
⚠方法不足
数据集伪造图像占比 50%,远高于真实临床中伪造影像极低出现概率,真实场景下医师漏检风险更高;仅覆盖 X 光单类影像,未验证 CT、MRI 等模态深度伪造识别效果;仅纳入 17 名放射医师,样本规模有限;GPT-4o 同时作为图像生成与检测模型,存在自身识别偏向
08 参考资料
Article:
编辑:陈宣辰
审核:吴朝


