大数跨境

Radiology(一区,IF=11.1)深度伪造 X 光影像的风险研究:放射医师与多模态大模型识别 ChatGPT 生成合成胸片的诊断准确度

Radiology(一区,IF=11.1)深度伪造 X 光影像的风险研究:放射医师与多模态大模型识别 ChatGPT 生成合成胸片的诊断准确度 瓴智医学AI
2026-07-29
1
导读:Radiology(一区,IF=11.1)深度伪造 X 光影像的风险研究:放射医师与多模态大模型识别 ChatGPT 生成合成胸片的诊断准确度
本文开展多中心、多国放射医师对照试验,构建两套独立合成 X 光数据集(GPT-4o 通用多部位 X 光、RoentGen 专用胸部 X 光),对比 17 名不同年资放射医师与 GPT-4o/GPT-5/Gemini 2.5 Pro/Llama 4 四款多模态大模型识别 AI 伪造医学影像的能力,总结深度伪造 X 光典型视觉伪迹,证实医师与主流大模型均无法精准分辨真实与 AI 生成影像,揭示通用文生大模型带来医学影像造假安全隐患,提出医师培训、水印溯源、自动化检测多层级防控方案。

01 摘要

多模态大模型可仅凭文字提示生成高度逼真的深度伪造 X 光片,存在病历造假、数据集投毒、误诊诉讼等医疗安全风险,但目前缺少医师与主流 LLM 识别能力的对照验证。本研究分三阶段回顾性诊断准确性试验,纳入 6 国 17 名不同从业年限放射医师,设置两套平衡数据集:数据集 1 含 77 张 GPT-4o 多部位合成 X 光、77 张真实影像;数据集 2 含 55 张 RoentGen 专用合成胸片、55 张真实胸片。第一阶段医师盲试验研究目的,仅 41% 的医师自发察觉数据内存在 AI 伪造图像;第二阶段告知存在合成影像后,医师区分 GPT 伪造影像平均准确率 74.8%;第三阶段识别专用 RoentGen 胸片准确率 70.0%,二者无统计学差异。四款大模型中 GPT-4o 识别准确率最高(85.1%),但仍无法全部检出伪造图像;合成影像共性特征为均匀噪声、过度光滑骨骼、不对称软组织纹理、脊柱双侧过度对称。研究表明医师与现有多模态大模型识别深度伪造 X 光能力有限,亟需开展医师专项培训、部署影像溯源与自动检测工具防范医疗造假风险,同时开源伪造影像数据集供行业训练使用。

02 研究背景

一、研究问题

  1. 1.GPT-4o 等通用多模态大模型降低医学影像造假门槛,普通人仅文字描述即可生成各部位 X 光,伪造影像可混入电子病历、科研数据集,造成误诊、保险欺诈、AI 训练数据污染。

  2. 2.现有专用放射生成模型仅面向单部位、需要专业代码能力,而通用 LLM 操作门槛极低,造假风险大幅提升,但医师能否区分伪造影像尚无大规模多中心验证。

  3. 3.缺乏横向对比主流商用多模态大模型识别深度伪造 X 光的性能数据,不清楚通用模型与专用放射生成伪造影像的识别难度差异。

  4. 4.行业缺少统一的伪造影像鉴别特征、标准化识别训练数据集与医疗影像防伪管控方案。

二、研究难点


  1. 1.多中心多国受试者统筹:覆盖不同从业年限、亚专业放射医师,控制阅片显示器、图像缩放等标准化阅片条件。

  2. 2.两套差异化数据集构建:区分通用 LLM 全部位合成影像、专用胸部扩散模型影像,控制病灶、噪声、解剖分布匹配。

  3. 3.三阶段分层试验设计:盲态自发识别、知情区分、专用胸片对照三阶段分步开展,消除信息偏倚。

  4. 4.人机平行对照:统一输入图像给 4 款主流大模型,标准化提问提示,量化各项诊断指标。

三、相关工作


  1. 1.早期 GAN 伪造影像研究仅局限膝关节 X 光,医师识别准确率接近随机水平,未覆盖通用文生大模型。

  2. 2.RoentGen 等专用胸部生成模型仅针对单一解剖部位,技术门槛高,难以大规模造假。

  3. 3.现有 AI 文本检测工具成熟,但针对 X 光深度伪造的像素级检测工具稀缺,缺少医师人机对照循证研究。

  4. 4.合成影像多用于模型数据增强,但未系统评估其恶意滥用带来的临床与科研安全隐患。

03 模型设计


一、总体思路


三阶段平行对照阅片试验,搭建两套独立平衡 X 光数据集,招募多国放射医师完成分层阅片测试,同步将相同图像输入四款主流多模态大模型,量化医师与 LLM 的识别准确率、灵敏度、特异度,归纳伪造影像统一视觉特征,对比通用 LLM 与专用放射生成伪造影像的识别难度差异。

二、数据集构建


  1. 1.数据集 1(GPT-4o 多部位):77 张 AI 生成、77 张真实 X 光,覆盖胸、脊柱、手足多解剖区域,剔除明显解剖失真的劣质合成图,病灶、噪声分布与真实图像匹配。

  2. 2.数据集 2(RoentGen 胸部专用):55 张扩散模型合成胸片、55 张真实胸片,仅胸部单部位。

  3. 3.真实影像来源:公开胸部、脊柱、骨骼 X 光标准数据集。

三、受试人员与测试模型


  1. 1.医师:6 国 17 名放射医师,从业 0–40 年,涵盖骨骼、胸部、介入、核医学亚专业。

  2. 2.测试 LLM:GPT-4o、GPT-5、Gemini 2.5 Pro、Llama 4 Maverick,统一鉴别提示词。

四、三阶段试验流程


1.阶段 1:盲态试验目的,医师仅评估图像质量、书写诊断,结束后自主反馈是否存在异常图像;

2.阶段 2:告知数据集含 AI 伪造图像,对数据集 1 逐张区分真实 / 合成并标注置信度;

3.阶段 3:使用专用 RoentGen 胸部数据集重复鉴别任务。

图 1 两套数据集构建、筛选与试验整体流程图

04 实验设置


一、阅片平台


定制网页阅片系统,全屏灰度固定显示器,禁用窗宽调节、图像缩放,统一随机图像顺序消除顺序偏倚。

二、核心评价指标


准确率、灵敏度、特异度、阳性预测值 PPV、阴性预测值 NPV、医师间 Fleiss 一致性 κ、平均置信评分。

三、统计方法


McNemar 检验对比两组识别准确率,t 检验对比图像质量评分,Wilson 置信区间计算分类指标,线性回归分析从业年限与识别能力相关性。

四、基线控制


医师统一使用 1080p 以上医用显示器,阅片环境标准化,图像亮度、分辨率保持一致。

05 结果与分析


一、盲态阶段自发识别结果


仅 41%(7/17)医师在不知情前提下主动察觉图像包含 AI 伪造 X 光;合成图像人工伪影检出率 15.4%,显著高于真实影像 5.5%;医师对合成、真实病灶诊断准确率无显著差异。

表 1 合成与真实 X 光图像质量、伪影、诊断准确率对比表

二、知情后 GPT 多部位影像识别性能


医师整体鉴别准确率 74.8%,灵敏度 69.1%,特异度 80.4%;骨骼亚专业医师识别准确率显著高于其他亚专业;从业年限与识别准确率无显著相关性,医师间一致性仅轻度(κ=0.31)。

图 2 医师与各大模型准确率、灵敏度、特异度箱型对比图

三、大模型横向对比


GPT-4o 识别性能最优(准确率 85.1%),GPT-5 次之(82.5%),Gemini、Llama 不足 60%;所有模型均无法 100 检出伪造影像,模型普遍过度判定骨骼纹理、噪声异常。

四、RoentGen 专用胸片识别结果


医师识别准确率 70.0%,与 GPT 多部位影像 74.8% 无统计学差异(P=0.07);高年资医师识别效果小幅优于低年资,但无显著线性关联。

五、深度伪造 X 光典型视觉特征


统一鉴别标识:全图均匀颗粒噪声、骨骼表面过度光滑无自然皮质起伏、软组织纹理生硬、脊柱双侧完全对称;伪造骨折线条光滑单一、多为单侧皮质断裂;胸部影像肺纹理均匀无自然差异。

图 3 真实与 GPT 生成胸、脊柱、手足 X 光配对示例

06 结论

通用多模态大模型可生成高度逼真的深度伪造 X 光影像,无论放射医师还是主流商用多模态 LLM,均无法可靠区分真实与 AI 合成医学影像;医师从业年限、影像解剖部位对识别能力提升作用有限,专用胸部扩散模型伪造胸片识别难度与通用 GPT 生成影像接近。合成 X 光存在均匀噪声、过度光滑骨骼、完美对称等统一视觉破绽,但辨识度不足;行业需建立放射医师专项鉴别培训、部署影像数字水印 / 哈希溯源、开发像素级自动检测工具多层级防控机制,同时文中开源伪造 X 光数据集可供全球用于医师与检测模型训练。但本研究图像伪造样本占比 50% 远高于真实临床场景,实际临床中漏检风险会进一步升高。

07 论文评价

方法创新亮点

    1.本研究为首个多国多放射医师 + 四大主流多模态大模型平行对照深度伪造 X 光识别试验,同时对比通用 LLM 与专用放射生成伪造影像识别难度;

    2.分层设置盲态、知情两组阅片场景,真实还原临床不知情下的识别短板;

    3.系统归纳 AI 伪造 X 光通用视觉鉴别特征,配套开源标准化伪造影像数据集,为行业防伪培训、检测模型开发提供统一基准;

    4.完整量化人机识别各项诊断指标,统计设计严谨,直接为医疗影像安全监管提供循证依据。

    方法不足

    数据集伪造图像占比 50%,远高于真实临床中伪造影像极低出现概率,真实场景下医师漏检风险更高;仅覆盖 X 光单类影像,未验证 CT、MRI 等模态深度伪造识别效果;仅纳入 17 名放射医师,样本规模有限;GPT-4o 同时作为图像生成与检测模型,存在自身识别偏向

    08 参考资料

    Article:

    DOI:10.1148/radiol.252094

    图文:陈宣辰

    编辑:陈宣辰

    审核:吴朝


    Nature Medicine(一区,IF=50)人工智能在全国乳腺钼靶筛查中的落地应用研究
    Advanced Science(一区|IF=14.1)机器学习增强的超灵敏免疫CRISPR阵列通过检测多种血浆生物标志物,促进阿尔茨海默病的早期诊断
    Nature Medicine(一区 IF=50)基于大语言模型的临床医学文献系统综述
    Nature Communications(一区|IF=15.7)通过基于机器学习的增强采样工作流程,针对那些具有内在无序结构的AR-NTD进行建模.-

    【声明】内容源于网络
    0
    0
    瓴智医学AI
    分享医学人工智能前沿知识,搭建跨学科研究、合作及应用转化平台。致力于医学人工智能技术、研发及科研,提供医学人工智能全方位服务。
    内容 78
    粉丝 0
    瓴智医学AI 分享医学人工智能前沿知识,搭建跨学科研究、合作及应用转化平台。致力于医学人工智能技术、研发及科研,提供医学人工智能全方位服务。
    总阅读2.0k
    粉丝0
    内容78