本文基于 Gemini 2.0 Flash 搭建无领域微调的医学大语言模型 AM,通过分步推理 + 联网检索 + 自我校验机制适配遗传性心肌病专科场景,开展平衡随机对照试验。纳入 107 例真实心肌病病例,9 名普通心内科医师分为 AI 辅助组与无 AI 对照组,由 3 名心脏遗传专科盲审专家从 10 个维度打分评价诊疗文书质量。结果显示 AI 辅助下医师临床显著错误、信息遗漏大幅下降,专科专家更偏好 AI 辅助诊疗方案,同时医师自评问诊耗时缩短、临床信心提升,验证通用大模型可辅助全科医师处理罕见复杂遗传性心脏疾病,弥补专科医师资源短缺难题。
01 摘要
全球心脏专科医师缺口巨大,肥厚型心肌病等遗传性心肌病属于青年猝死高危罕见病,基层心内科医师难以精准完成分层诊断与长期管理。现有医疗大模型多依赖专科微调,缺少真实病例随机对照循证证据。本研究构建 AMIE 大语言系统,无需领域微调,依靠多步推理、文献检索、自我纠错适配遗传性心肌病临床场景。纳入斯坦福专科中心 107 例真实回顾病例,9 名普通心内科医师配对完成病例评估,分为 AI 辅助、常规诊疗两组,由盲法心脏遗传专科专家从分诊、诊断、诊疗方案等 10 维度评价。结果显示:专科专家整体更认可 AI 辅助产出方案(46.7% vs 32.7%,P=0.02);AI 组临床重大错误发生率 13.1%,对照组 24.3%(P=0.033),信息遗漏率 17.8% vs 37.4%(P=0.0021);57.0% 医师认为 AI 有效提升判断水平,50.5% 病例实现阅片时间缩短,仅 6.5% 存在具备临床意义的模型幻觉,且人机交互时 AI 可自我修正。该系统无需专项微调即可辅助普通心内科医师处理复杂遗传性心肌病,降低诊疗疏漏,缓解专科资源不足困境。
02 研究背景
1.心血管专科人才全球缺口显著,肥厚型心肌病等遗传性心肌病易致青年猝死,但多数地区无专属诊疗中心,基层全科心内科医师缺乏罕见病诊疗经验,漏诊、管理不当高发。
2.现有医学大模型研究多基于模拟试题、虚拟病例,缺少真实多模态心脏检查数据(超声、心脏核磁、运动试验)的前瞻性对照验证,临床落地有效性存疑。
3.既往专科 LLM 需大量标注数据微调,成本高、泛化差,缺少通用基座模型直接适配罕见心血管疾病的成熟方案。
4.普通医师面对多模态心脏影像报告时,易遗漏关键指标、制定不完善诊疗计划,缺少标准化智能辅助工具。
二、研究难点
1.罕见病场景适配:遗传性心肌病分型复杂,需整合心电图、心超、CMR、运动负荷、基因多类检查文本,通用大模型易出现专业幻觉。
2.试验设计约束:同一病例需两名医师分别在有无 AI 条件下评估,采用平衡随机,同时保证专科评审全程盲法,消除主观偏倚。
3.多维度量化评价:搭建 10 项标准化专科评分维度,兼顾分诊、鉴别诊断、检查规划、长期管理、信息完整性。
4.幻觉与遗漏量化:系统区分无意义偏差、有临床风险幻觉、关键信息缺失,定量评估模型安全边界。
三、相关工作
-
1.通用医疗 LLM 评测:多基于执业考题,仅测试问答能力,未结合真实患者完整诊疗流程。
-
-
2.心血管 AI 工具:多聚焦影像识别,缺少整合全套检查、生成完整诊疗方案的大模型系统。
-
-
3.既往 LLM 随机对照试验:多采用虚拟病例,无遗传性心肌病这类罕见复杂疾病真实队列验证。
-
-
4.专科微调模型缺陷:依赖大量专科标注样本,难以快速适配新型罕见心血管疾病。
-
03 模型设计
一、总体思路
以 Gemini 2.0 Flash 为基座搭建 AMIE,不做领域微调,通过提示工程、分步推理、联网检索、自我校验适配遗传性心肌病;收集 107 例真实患者全套心脏检查文本数据,开展配对平衡随机对照试验;普通心内科医师分有无 AI 辅助完成病例评估,3 名盲审心脏遗传专家使用 10 维度评分表对比两组文书,同步收集医师使用主观反馈、模型幻觉 / 遗漏统计。
二、AMIE 系统核心机制
1.输入:全套心脏检查文本(静息 / 运动心超、心电图、Holter、CMR、心肺运动试验报告);
2.推理链路:多步骤临床推理 + 权威文献检索 + 自我质疑纠错;
3.输出标准化文书:分诊建议、鉴别诊断、补充检查方案、长期管理计划;
4.交互功能:医师可对话追问模型,发现幻觉时 AI 自动修正结论。
三、试验分组规则
-
-
-
2.病例:107 例连续转诊疑似遗传性心肌病回顾病例;
-
-
3.配对设计:每例病例分配两名医师,一名使用 AMIE 辅助,一名纯人工评估;
-
-
4.盲审设置:3 名专科专家评审时屏蔽方案来源,随机打乱两份评估文本。
-
图 1 整体试验研究设计流程图
04 实验设置
一、数据集
107 例患者中位年龄 59 岁,涵盖肥厚型、左室致密化、扩张型等多类遗传性心肌病;配套心电图、心超、CMR、运动试验、Holter 文本报告,全部脱敏回顾临床数据,同时开源共享数据集供后续研究。
二、对照设置
对照组:医师仅查阅影像文本,独立完成全套诊疗评估;干预组:医师可查看 AMIE 完整评估报告,并通过对话界面交互提问。
三、评价体系
-
专家盲审指标:整体方案偏好、分诊 / 诊断 / 检查规划 / 管理计划优劣、重大临床错误、冗余内容、关键信息遗漏、推理合理性、人口学偏倚;
-
医师主观指标:AI 是否提升判断、是否增加信心、是否节省时间、幻觉 / 信息遗漏发生比例。
05 结果与分析
一、基线病例分布
病例涵盖各类遗传性心肌病,影像检查覆盖率充足,具备真实临床多样性,适合复杂心脏疾病诊疗评测。
表 1 入组病例疾病类型、各类检查数据占比统计表
二、专科专家盲审对比
全维度下专家更偏好 AI 辅助诊疗文书(46.7% vs 32.7%,P=0.02);诊疗方案、补充诊断检查两大维度差异显著;AI 组重大临床错误、关键信息遗漏发生率显著更低,冗余内容、推理逻辑两组无明显差异。
图 2 专科专家偏好比例柱状图、各维度缺陷占比对比图
三、医师使用主观反馈
57.0% 医师认为 AI 有效辅助判断,52.3% 提升诊疗信心,50.5% 病例缩短评估耗时;仅 6.5% 出现具备临床意义的模型幻觉,且人机对话后可修正。
图 3 医师使用体验饼图(AI 帮助度、信心、耗时、幻觉、遗漏统计)
四、模型缺陷定性分析
幻觉多为虚构影像征象、误判测量数值;信息遗漏多为忽略既往干预、未整合时序检查差异;但绝大多数缺陷可通过医师复核与交互对话修正,整体安全可控。
06 结论
基于通用 Gemini 2.0 Flash 搭建的 AMIE 大模型无需专科微调,即可辅助普通心内科医师完成肥厚型心肌病等复杂遗传性心肌病完整诊疗评估。随机对照试验证实 AI 辅助能显著降低临床重大错误与关键信息遗漏,专科专家更认可 AI 生成的诊断与管理方案,同时缩短医师评估时长、提升诊疗信心;模型仅少量存在可修正临床幻觉,人机协同模式安全可行。但本研究为单中心回顾病例试验,仅依托文本报告、无法读取原始影像,缺乏真实患者前瞻性随访结局,后续需多中心、前瞻性临床研究验证长期诊疗获益。
07 论文评价
✅方法创新亮点
1.本研究是遗传性罕见心血管疾病首个 LLM 配对随机对照试验,无需领域微调仅依靠推理校验机制实现专科适配,大幅降低模型落地成本;
2.搭建标准化十维度专科评审体系,采用盲法专家评价消除主观偏差;
3.公开完整心肌病多模态文本数据集,为同类 AI 评测提供基准;
4.同时定量、定性分析模型幻觉与信息缺陷,明确人机协同使用边界,为专科医疗大模型临床验证提供标准化范式。
⚠方法不足
试验数据仅来自美国单中心英文回顾病例,人群与诊疗体系外推性有限;模型仅读取影像文本报告,无法直接解析原始超声、核磁图像;受试均为心内科医师,未纳入基层全科医师,同时存在医师知晓分组带来主观评价偏倚。
08 参考资料
Article:
DOI:10.1038/s41591-025-04190-9
编辑:陈宣辰
审核:吴朝

npj Digital Medicine(一区|IF=18)利用深度学习技术实现对结直肠癌的可解释生存预测
Nature Medicine(一区,IF=50)生成式 AI 临床决策支持系统在基层医疗的实用整群随机对照试验
Nature Biomedical Engineering(一区|IF=26.7)基于自监督对比学习的心脏MRI通用深度学习系统
Nature Medicine(一区,IF=50)人工智能在全国乳腺钼靶筛查中的落地应用研究