大数跨境

ClinFusion:视觉为核的医疗多模态大模型,与临床对齐的评测新范式

ClinFusion:视觉为核的医疗多模态大模型,与临床对齐的评测新范式 ScienceAl
2026-08-24
6
导读:把多模态大模型送进临床。
作者 | 论文团队
编辑丨 ScienceAI

多模态大模型临床落地的核心在于「视觉为核」,目前主要面临两大瓶颈:架构上缺乏原生吸收 X 光、病理、CT/MRI 等高度异构视觉知识的能力;评测上标准脱离放射科医师真实的读片逻辑,仍停留在文本表层匹配。

针对上述挑战,达摩院联合浙江大学、清华大学等机构提出 ClinFusion。这是一个以视觉为核心的组合式多模态大模型,并配套了一套临床对齐、事实性导向的评测框架。

论文地址:https://arxiv.org/abs/2607.24743

代码仓库:https://github.com/alibaba-damo-academy/ClinFusion

模型权重(8B / 32B):https://huggingface.co/collections/Alibaba-DAMO-Academy/clinfusion

在线体验:https://huggingface.co/spaces/Alibaba-DAMO-Academy/clinfusion-medical-vlm

图 1 a,医疗多模态基准性能对比;b,医疗纯文本基准性能对比。

现有方案的局限性

挑战一:单一视觉编码器难以吸收异构医学影像知识

医学影像信息谱跨度极大,从病理高频纹理细节到器官解剖的全局结构语义均有涉及。主流医疗模型多采用数据驱动路线,底层视觉架构固定,存在明显短板:以 2D 为中心的方案将体数据密集采样为切片,牺牲了 3D 结构信息;以 3D 为中心的方案需配备专用编码器,但对齐流程庞杂且成本高昂。

挑战二:评测标准与临床流程错位

现有基准往往忽略指令跟随能力,而该能力在领域微调中极易被削弱。报告生成评测存在根本性错位:现行做法要求模型生成「全面」报告并与参考报告比对,但医师读片是基于申请单指征与既往病史的关注区域聚焦,而非盲读。此外,BLEU、ROUGE 等指标仅停留于词汇匹配,RadGraph-F1 依赖小模型抽取实体精度有限,GREEN 仅提供笼统总分,均无法精确分解「命中、漏诊、幻觉」。

图 2 ClinFusion 贡献总览。a,组合式视觉编码器;b,视觉锚定评测框架;c,agentic 工具调用扩展。

ClinFusion:视觉为核的多模态大模型

组合式 2D 感知与 CaSL Fusion

研究为 Qwen ViT 配置了两个互补的专家编码器:ConvNeXt 提供强空间局部性偏置,擅长高频纹理;DINOv2 学习更鲁棒、少数据集偏置的高层语义。提出的 CaSL Fusion 机制以 Qwen ViT 的每个 token 为 query,仅在第二张特征图同一空间位置的 k×k 局部邻域内取 key/value 进行交叉注意力计算,再经残差与 FFN 融合。该设计不增加送入 LLM 的视觉 token 数,仅提升信息密度,并将计算复杂度从二次降为线性。算子采用非对称左结合方式,多编码器时级联施加,确保已与 LLM 对齐的表征为主干,由专家编码器渐进增强。

2D 锚定的 3D 体数据理解

针对 3D 体数据切片化处理导致空间上下文丢失的问题,ClinFusion 引入专用 3D 编码器 PE-3D(已通过对比学习完成语言预对齐),并提出 2D 锚定的深度感知 CaSL Fusion。该方法从体数据采样 4 张锚定切片,将注意力范围扩展为「k×k 邻域 × 完整深度维」。利用 2D 特征的强语言对齐作为锚点,3D 特征无需海量专用数据即可快速收敛,同时复用 2D 编码器的丰富预训练知识。

数据与训练策略

训练语料共 2220 万样本,并针对瓶颈自建四条数据合成链路:Instruction Warping(防止指令跟随能力退化)、61 万条视觉锚定密集描述、6.7 万条多模态 CoT 轨迹及 130 万条 CT Caption。训练采用五阶段渐进课程,涵盖从浅层多编码器对齐到 2D/3D 整体指令微调。

图 3 ClinFusion 架构。a,整体框架;b,组合式编码器与原生 3D 通路;c,CaSL Fusion 的局部交叉注意力。

临床对齐的医疗评测新范式

MedIF-Bench:量化指令跟随能力

医疗微调常导致模型虽具备医学知识却无法遵守输出格式,而临床落地往往要求结构化输出(如对接电子病历的 JSON)。MedIF-Bench 包含 900 个样本及七个任务类别(部分源自 SEER 癌症登记库真实记录),专门评测格式合规性,不涉医学准确性,将指令跟随变为可测量的前置条件。

RoI-Grounded 报告生成评测

该流程分三步:首先利用 LLM 从参考报告中抽取「临床指征」与「关注解剖区域」注入待测模型(严格约束不泄露具体异常);其次模型生成聚焦的 RoI 锚定报告;最后由 LLM 判官逐条比对,输出 [MATCHED]、[MISSED]、[HALLUCINATED] 三个显式列表,直接计算 Precision、Recall 与 F1。

实验结果与分析

对比对象涵盖通用多模态模型(Qwen2.5-VL/Qwen3-VL/InternVL3)、医疗多模态模型(Lingshu、Hulu-Med、MedGemma、HuatuoGPT-V)及闭源模型(GPT-5.2、Gemini-3-Flash、Claude-Sonnet-4.5)。所有开源模型均在统一套件下重新跑分。

2D 与 3D 多模态基准:3D 优势显著

在 2D 影像理解方面,ClinFusion 在八个 VQA 基准上稳定居前二,8B 版本在七个基准上取得医疗模型最高分,多数超越 Gemini-3-Flash;报告生成同样刷新 SOTA。在 3D 体数据理解方面优势最大:8B 版本在腹部 CT 问答上比同量级最强开源模型高出 14.5 分,甚至超越参数量四倍的 32B 基线,领先 Gemini-3-Flash 约 16 分;32B 版本在 CT 报告生成上取得最佳 F1。

图 4 2D 多模态医学基准结果。a,八个 2D VQA;b,两个 2D 报告生成。

图 5 3D 多模态基准与 MedIF-Bench 结果。a,3D VQA;b,3D 报告生成;c,指令跟随得分。

指令跟随与纯文本:医疗适配零代价

ClinFusion 的 Overall-IF 得分达 98.1(8B)/98.9(32B),优于所有闭源系统。相比之下,基于同一骨干的其他医疗适配版本能力大幅退化。纯文本方面,32B 版本在八个基准中的七个上取得医疗模型最佳,证明医疗适配增强了而非削弱了文本知识。实验还表明,指令跟随是可靠评测的前置条件,若模型无法按规定格式作答,将导致各项基准分数人为偏低。

专家盲评:验证模型与评测方法

研究邀请 6 位资深放射科医师开展盲评,对 300 个病例的匿名报告在事实准确性、完整性、临床可用性三个维度排序。结果显示,ClinFusion + agentic 在所有维度排名第一,且具有统计显著优势。在自动指标一致性度量上,RoI-Grounded 表现最佳,且标注者间一致性高,证实观察到的差异反映真实质量差距。

图 6 六位放射科医师盲评结果。a,系统排序;b–c,自动指标与专家判断的相关性;d–e,标注者间一致性。

消融分析:旧评测范式失效原因

临床上下文是报告生成对比有意义的前提。缺少上下文时,模型会描述参考报告未涉及的区域,导致误判为幻觉。此外,LLM 判官有效规避了传统指标的同义不敏感与长度偏置问题。架构消融实验进一步证实,局部交叉注意力性能最优,级联融合优于并行,且原生 3D 编码器不可或缺。

图 7 消融实验。a–b,RoI-Grounded 评测设计;c–f,架构设计(融合机制、专家编码器、级联与并行、原生 3D 编码器)。

Agentic 工具调用:构建可追溯的临床助手

ClinFusion 配备工具生态与显式 plan–act 工作流,通过有序调用工具收集可审计的中间证据。工具包括混合 RAG 知识工具(涵盖 PubMed、指南及顶级文献)及感知专家工具(病灶分割、脂肪肝评估等)。

增益主要集中在描述性与知识密集型任务。8B 版本在 CheXpert-Plus 报告及 3D-RAD 开放问答上增幅显著,纯文本知识密集型基准亦有大幅提升。中间工具输出的暴露使得推理链条可核验,增强了系统的可信度。

图 8 配备 agentic 工具后的性能增益。上下两行为 8B 与 32B,左右两列为多模态与纯文本基准。

结论

ClinFusion 系统性解决了多模态大模型临床落地的三大障碍:通过组合式、级联式架构统一处理异构 2D/3D 数据;利用 MedIF-Bench 与 RoI-Grounded 建立临床对齐、事实性导向的评测体系;借助 agentic 工具调用接入动态知识与外部专家模型。实验证实,整体性医疗感知受益于组合式视觉系统,而新的评测指标更能反映真实临床需求。

当前局限在于工具集覆盖模态有限,且在部分知识密集型文本基准上与最强闭源模型仍有差距。未来需扩展至超声、MRI 等更多模态,并通过严格的 human-in-the-loop 评估推动真正临床落地。

【声明】内容源于网络
0
0
ScienceAl
机器之心旗下媒体,关注人工智能与其他前沿技术、基础学科的交叉研究与融合发展。
内容 2085
粉丝 0
ScienceAl 机器之心旗下媒体,关注人工智能与其他前沿技术、基础学科的交叉研究与融合发展。
总阅读55.3k
粉丝0
内容2.1k