摘要
我们提出 ClinFusion,一个面向整体性医疗理解的视觉为核多模态大模型系统。本工作的主要创新点如下:
组合式、级联式视觉编码器架构:我们不再依赖单一的视觉编码器,而是提出 CaSL Fusion(Cascade Spatial-Aware Locality Fusion)算子,让多个专家 2D 编码器以级联方式渐进增强一个基础且已与语言充分对齐的视觉表征;并进一步引入原生 3D 编码器与2D 锚定的深度感知 CaSL Fusion,在同一个融合编码器内统一 2D 与原生 3D 医学影像理解。
新的视觉锚定评测框架:我们提出MedIF-Bench,填补医疗场景下指令跟随能力评测长期缺失的空白——这是任何下游评测与临床部署的前置条件;并提出RoI-Grounded 报告生成评测方法,以患者特异性临床上下文为条件生成报告,再用LLM-as-a-Judge 把诊断论断分解为“命中 / 漏诊 / 幻觉”三类,从而给出精确且以事实性为导向的评价。
在公开数据集上,自动化指标与放射科专家双重验证的领先性能:ClinFusion 在 2D / 3D 多模态与纯文本医学基准上均取得SOTA,相较领先开源医疗 MLLMHulu-Med、Lingshu)在 24 个基准中20 项领先,多模态能力在16 个基准中13 项优于GPT-5.2、Gemini-3-Flash 等强闭源模型。6 位持证放射科医师在300 个临床病例上的盲评进一步确认:ClinFusion 报告排名第一,且我们的RoI-Grounded 指标在全部11 个自动指标中与专家判断相关性最高。配备 agentic 工具调用后,在纯文本与多模态临床场景中均获得一致提升。
代码仓库: https://github.com/alibaba-damo-academy/ClinFusion
模型权重(8B / 32B): https://huggingface.co/collections/Alibaba-DAMO-Academy/clinfusion
论文地址: https://arxiv.org/abs/2607.24743
在线体验:
https://huggingface.co/spaces/Alibaba-DAMO-Academy/clinfusion-medical-vlm

挑战一:异构视觉知识的吸收。单一的视觉编码器难以覆盖医学影像的全谱信息——从对病理至关重要的高频纹理细节,到刻画器官解剖的全局结构语义。但目前医疗 MLLM 的主流路线是数据驱动的:通过分阶段微调精心整理的图文数据来适配通用骨干,底层视觉架构基本未变。
已有架构策略可归为两类:2D为中心路线把所有数据都当作 2D 图像、从体数据中密集采样切片,不可避免地牺牲 3D 结构信息;3D为中心路线为 3D 数据配备专用编码器,却需要庞杂昂贵的对齐流程。通用领域虽有多编码器设计,但针对的是多分辨率或视觉锐度;最相关的 Cambrian-1 采用并行聚合,既无原生 3D 编码器,也缺少我们提出的引导式融合机制。
同时,现有指标要么做表层的词汇/语义匹配(BLEU、ROUGE、BERTScore),要么依赖小模型做实体级抽取、精度有限(RadGraph-F1、RaTEScore),要么用 LLM 打一个笼统总分、把准确性与完整性混为一谈(GREEN),没有一种能给出对“命中 / 漏诊 / 幻觉”的精确分解。
图2: ClinFusion 整体贡献总览。a,组合式视觉编码器(原生 3D + 多个 2D 编码器经CaSL Fusion 统一,由 2200 万样本数据链路与5 阶段渐进训练支撑);b,视觉锚定评测框架;c,agentic 工具调用扩展。

ClinFusion:视觉为核的医疗基础模型
组合式 2D 感知与 CaSL Fusion。我们为 Qwen ViT配备两个互补的专家编码器:ConvNeXt提供强空间局部性归纳偏置,擅长高频纹理与局部模式;DINOv2通过自监督学到更鲁棒、更少数据集偏置的高层语义表征。融合遵循两条原则:
1)信息密度优于 token 长度(不增加送入 LLM 的视觉 token 数,而是提升每个token 的信息密度);
2)由基础编码器引导对齐(Qwen ViT 与 LLM 之间已有很强的既成对齐,新编码器的表征应被引导进入该空间,而非打乱它)。
由此提出CaSL Fusion:以 Qwen ViT 的每个 token 为 query,只在第二张特征图上同一空间位置的 k×k 局部邻域内取 key/value 做交叉注意力,再经残差与 FFN 融合回 query。局部化既带来强空间归纳偏置,也把计算量从对 token 数的二次复杂度降为线性。多编码器时融合以级联方式逐级施加,且算子非对称、左结合——左操作数永远作为 query,保证已对齐的 Qwen ViT 表征始终是主干,被专家编码器渐进增强而非被替换。
2D 锚定的3D体数据理解。现有医疗 MLLM 把 3D 体数据当作一串独立 2D 切片,丢失了关键的切片间空间上下文与解剖连续性。ClinFusion 引入专用 3D 编码器(PE-3D,已通过体数据与放射报告的对比学习完成语言预对齐),并提出2D 锚定的深度感知 CaSL Fusion:从体数据采样 4 张 2D 锚定切片得到高度对齐的锚定特征,再把每个锚定 token 的注意力范围扩展为“k×k 空间邻域 × 完整深度维”,让每张切片吸收环绕它的体积上下文。这一设计的动机是双重的:
加速对齐——借助 2D 特征已有的强语言对齐作为锚点,3D 特征可快速收敛,无需海量 3D 专用对齐数据;
知识迁移——即使处理3D 数据,模型仍受益于2D编码器中丰富的预训练知识。
数据构建。训练语料共2220万样本(医疗多模态 1260 万、医疗文本 470 万、通用多模态 340 万、通用文本 150 万),并针对具体瓶颈开发了四条数据合成链路:Instruction Warping(120 条种子指令扩展为 21k 模板,防止领域微调侵蚀指令跟随)、Dense Caption 生成(61 万条视觉锚定密集描述)、交互式多模态 CoT 标注(6.7 万条推理轨迹)、大规模 CT Caption(20 万开源 CT + 110 万医院 CT 伪报告监督)。
渐进式训练。训练采用五阶段渐进式课程:浅层多编码器对齐 → 深层视觉-语言对齐 → 2D 指令微调 → 快速 3D 编码器对齐 → 2D/3D 整体指令微调。

图3: ClinFusion 架构细节。a,整体框架;b,组合式视觉编码器与原生 3D 通路;c,CaSL Fusion 的局部交叉注意力机制。

临床对齐的医疗评测新范式
我们的评测体系覆盖 2D / 3D 视觉理解、文本医学知识、临床报告生成与医疗指令跟随五个维度,且所有基准均使用训练中完全未见过的提示词重新跑分,以缓解 prompt 模板过拟合。两项核心创新如下:
MedIF-Bench:把“指令跟随“变成可测量的前置条件。医疗领域微调常损害指令跟随能力——即使医学知识正确,模型也频繁不遵守输出格式。这在真实临床中是致命的,因为落地往往要求特定结构化输出(对接电子病历的 JSON、带标准段落标题的报告等)。MedIF-Bench 共900 个样本,覆盖七个任务类别(MCQ、带上下文 MCQ、开放问答、预后、报告生成、SEER、治疗推荐),部分样本取自 SEER 癌症登记库的真实患者记录。该基准只评测格式合规性,不评测医学准确性。
RoI-Grounded 报告生成评测。流程分三步:从参考报告(GT)抽取临床上下文 → 用该上下文引导模型生成聚焦的 RoI 锚定报告 → 由 LLM 判官逐条比对论断。上下文感知的生成:用LLM 从 GT 中抽取“临床指征”与“关注解剖区域”注入待测模型提示词,并严格约束以确保绝不泄露任何具体异常。这样做有两个理由——贴合真实工作流(医师从不盲读);保证可核验性(模型输出只有落在参考报告覆盖范围内才可被严格核验,否则当模型描述 GT 未提及的区域时,无法客观判定它是幻觉,还是医师只是省略了一个正常表现)。事实性导向的评分:不给笼统总分,而是把论断分解为“[MATCHED]”(TP)、“[MISSED]”(FN)、“[HALLUCINATED]”(FP)三个显式列表,据此直接算出 Precision、Recall 与 F1。

实验结果与分析
对比对象包括通用MLLM(Qwen2.5-VL / Qwen3-VL / InternVL3 系列)、医疗 MLLM(Lingshu、Hulu-Med、MedGemma、HuatuoGPT-V等)与闭源模型(GPT-5.2、Gemini-3-Flash、Claude-Sonnet-4.5)。所有有官方权重的开源模型都在统一评测套件下由我们重新跑分。
2D 与 3D 多模态基准:ClinFusion超越开源基线与闭源API
2D 影像理解:ClinFusion在全部八个 2D VQA 基准上稳定排名第一或第二,8B 版本在其中七个上取得所有医疗 MLLM 的最高分,并在多数基准上超越 Gemini-3-Flash——说明专门设计的开源模型可以在领域任务上胜过最先进的通用 API。报告生成同样刷新 SOTA:8B 的 F1 大幅高于同量级最强开源医疗 MLLM,并与闭源模型持平或更优。
3D 体数据理解:得益于原生3D 编码器与 2D 锚定 CaSL Fusion,ClinFusion 的优势在 3D 上最为明显——8B在腹部 CT 问答上比同量级最强开源模型高出14.5 分,甚至超过参数量四倍于它的 32B 基线,并领先 Gemini-3-Flash 约16 分;32B 则在 CT 报告生成上取得所有被评模型中的最佳 F1。

图4: ClinFusion 在 2D 多模态医学基准上的表现。a,八个 2D 医学 VQA 基准;b,两个 2D 报告生成基准。

图5: ClinFusion 在 3D 多模态医学基准与MedIF-Bench 上的表现。a,3D 医学 VQA;b,3D 报告生成;c,MedIF-Bench 指令跟随得分。
MedIF-Bench 与纯文本基准:医疗适配后能力领先
ClinFusion 的 Overall-IF 达 98.1(8B)/ 98.9(32B),为医疗 MLLM 最佳,并超过全部闭源系统(GPT-5.2 96.0、Gemini-3-Flash 96.6、Claude-Sonnet-4.5 86.5)。关键对比在于:通用 MLLM 本身指令跟随很强,但基于同一骨干的既有医疗适配版本会大幅退化(Lingshu-7B 80.4、Lingshu-32B 82.6),而 ClinFusion 在完成医疗适配的同时保留了接近骨干水平的能力。
更重要的洞察:指令跟随是可靠评测的前置条件。MedGemma-1.5-4B-IT 的 Overall-IF 仅27.4,人工检查确认它持续无法按规定格式作答,使基于规则与基于 LLM 判官的评测都不再可靠——这直接表现为其他基准上人为偏低的分数(PMC-VQA 18.7、SuperGPQA 2.25)。该模型是在多样医疗数据上训练的,这说明若训练方法不显式注入稳健的指令跟随能力,仅靠数据整理是不够的。
纯文本方面,尽管ClinFusion 是视觉为核架构,32B 仍在八个基准中的七个上取得所有医疗 MLLM 最佳,说明医疗适配增强而非削弱了文本知识。
放射科专家盲评:同时验证模型与评测方法
我们邀请6 位持证放射科医师(临床经验均 ≥6 年)开展盲评,从报告生成基准随机抽取300 个病例(100 例胸部 X 光、100 例胸部 CT、100 例腹部 CT),收集四个系统的报告(ClinFusion + agentic、ClinFusion 独立、Gemini-3-Flash、Hulu-Med)。评估者同时查看原始影像与四份匿名输出,在事实准确性(幻觉越少越好)、完整性(漏诊越少越好)、临床可用性三个维度上排序。
专家确认了模型优势:ClinFusion + agentic 在全部维度排名第一,相对 Hulu-Med 与 Gemini-3-Flash 均有统计显著优势(p < 0.001)。值得注意的是,独立版 ClinFusion 已同时优于两者,加上工具后进一步一致提升。
RoI-Grounded 指标与专家判断相关性最高:在 11 个自动指标(含 METEOR、BLEU-4、ROUGE-L、RadGraph-F1、BERTScore、CIDEr、GREEN)中,我们的指标在三项一致性度量上全部第一(Kendall's τ = 0.511、Spearman's ρ = 0.572、Top-1 准确率 55.5%),且单病例层面的 τ 分布同时具有更高均值与更低方差,说明优势是系统性的而非离群值驱动。
标注可靠性:全维度 Kendall 协和系数 W = 0.665 ± 0.275(n = 300),跨模态一致(CT 0.678、X 光 0.641),说明观察到的模型差异反映真实质量差距而非标注噪声。

图6: 6 位放射科医师的盲评结果。a,专家对四个系统的排序;b–c,各自动指标与专家判断的相关性;d–e,标注者间一致性。
消融分析:为什么旧评测范式会失效,以及每个架构选择的贡献
临床上下文是让报告生成对比有意义的前提。去掉上下文后暴露两个问题:两个模型的指标都大幅下降;模型间差距被严重压缩——有上下文时 ClinFusion-8B 稳定优于 Lingshu-7B,无上下文时两者几乎相同。根因是:一张影像包含众多解剖结构,而医师报告只聚焦与指征相关的区域;缺少上下文时模型会描述 GT 未涉及的区域,此时无法判定是幻觉还是医师主动省略,却被一律记为 false positive,从而压低分数、抹平差距。
LLM-as-a-Judge 规避了同义不敏感与长度偏置。 RadGraph-F1 把报告解析为固定 schema 的实体关系再算 F1,这种闭式做法带来两个失效模式:同义不敏感——“the liver appears enlarged”与“hepatomegaly is present”临床完全等同,却因映射到不同 schema 条目而得零分;长度偏置——由于从整段文本抽实体,输出越长越可能与 GT 重叠。量化证据印证了这两点:RadGraph-F1 在前三个模型上得分挤在很窄区间(CheXpert-Plus 11.8–21.0),判别力弱,而我们的判官跨度更宽(16.8–37.8);“Long Output”变体输出质量更差,却让RadGraph-F1 虚高(11.8→18.8),而我们的判官正确地惩罚了冗长(16.8→15.1)。
架构消融。四种融合机制中局部交叉注意力平均性能最高;三个候选专家编码器中,DINOv2 是唯一在 VQA 与报告生成上都距最佳不超过 0.3 的;第二个专家编码器最多只带来 VQA +0.4 / 报告 +0.9,收益明显递减;相同编码器对下级联融合在报告生成上明显优于并行融合(28.8 vs 27.3),说明级联让表征被渐进富化,对开放式生成的收益大于闭式 VQA;推理时停用 3D 编码器后,3D VQA 平均下降3.0 分(65.8→62.8)、3D 报告 F1 下降4.0 分(15.7→11.7),证明原生 3D 编码器提取的体积特征无法被稀疏 2D 切片替代。

图7: 消融实验。a–b,RoI-Grounded 评测设计(临床上下文的必要性、LLM-as-a-Judge与 RadGraph-F1 的对比);c–f,架构设计(融合机制、专家编码器选择、级联与并行融合、原生 3D 编码器)。
Agentic 工具调用:把静态模型变成可追溯的临床助手
我们为 ClinFusion 配备工具生态与显式plan–act 工作流:先规划(分析问题、识别所需证据、产出有序工具调用计划),再顺序执行工具并把结构化输出作为可审计的中间证据收集,最后综合为一份临床回复。工具分两类:知识工具(RAG)基于向量检索 + 知识图谱概念召回的混合引擎,查询前用 UMLS 做概念归一化以应对同义词、缩写、商品名歧义,证据来自 PubMed、StatPearls、医学教科书等开放语料,以及自建的 1.8 万份中美临床指南与 10 万篇顶级期刊文献;感知专家工具包括多器官病灶分割(8 个器官 29 类病灶)、脂肪肝评估、腹部淋巴结分割、胸片所见分类与生成。
描述性与知识密集型任务收益最大。8B 上增益最大的是需要描述性输出的任务(CheXpert-Plus 2D 报告 +12.4、3D-RAD Open VQA +8.4),闭式选择题增益较小;纯文本上集中在知识密集型基准(SuperGPQA +12.8、MedQA-USMLE +11.1、MedXpertQA +7.7)。唯一例外是中文考试基准 MedQA-MCMLE 在 8B 上下降 4.8 分——归因于检索语料中文覆盖有限;该赤字在 32B 上不再出现(+0.7)。
决策变得可核验。纯文本场景中,模型把临床问题分解为互补检索查询,收集带溯源的异构证据并先汇总为可追溯的中间结论;多模态场景中,模型识别输入为 3D 胸部 CT,调用病灶分割器获得结构化发现(病灶数量、尺寸),再整合为带 Findings 与 Impression 的放射学报告。两种场景下中间工具输出始终暴露且可审计,使推理链条可核验,而非依赖隐式的参数化生成。

图8: 配备 agentic 工具后 ClinFusion 的性能增益。上下两行为 8B 与 32B,左右两列为多模态与纯文本医学基准,每个基准标出加装工具前后的得分差。

结论
将 MLLM 引入临床实践长期受制于三个根本障碍:异构医学数据的处理难题、学术评测与真实临床需求之间的落差,以及模型知识的静态性。本工作提出 ClinFusion 为其提供系统性解法:架构上跳出单一式编码器范式,提出带 CaSL Fusion 的组合式、级联式架构,通过“级联 + 2D 锚定”交互机制统一 2D 与原生 3D 处理;评测上提出 MedIF-Bench 保障可靠的指令跟随,并用 RoI-Grounded 报告生成把评价从粗糙的文本相似度转向临床对齐、事实性导向的判定;落地上以 agentic 工具调用接入动态知识检索与外部专家模型。
实验层面,ClinFusion 不仅在 2D、3D 与文本基准上超越领先开源模型,在多模态任务上也超过强大的闭源 API,支持了我们的架构假设:整体性医疗感知受益于能原生处理异构 2D/3D 数据的组合式视觉系统,而非单一编码器。与此独立的另一结论是:RoI-Grounded 评测与放射科专家判断之间的强相关性,证实了视觉锚定、事实性导向的指标比传统文本匹配更能反映真实临床需求。
我们也坦诚指出局限:当前工具集仍有限,未来应扩展到超声、MRI等更多模态;在知识密集型文本基准上与最强闭源模型仍存差距,主要源于模型容量与训练数据规模差异;走向临床仍需严格的 human-in-the-loop 评估。我们希望这项工作能推动社区在医疗专用架构设计与临床对齐的评测方法两个方向上做出更多探索。

