作者丨张 璐
编辑丨幸丽娟
在视觉语言大模型(VLM)落地少样本迁移任务时,高效参数微调(PEFT)是主流的低成本方案。然而,业界长期存在一种惯性思维:认为给图像编码器增加更多 Adapter 并进行深度微调,能提升模型对视觉细节的捕捉能力。
现实却呈现出尴尬的矛盾:在面对未知场景(域外数据/OOD)时,对图像编码器的微调越激进,模型的泛化能力破坏越严重。预训练大模型原本具备强大的通用视觉能力,强行局部微调反而导致其性能衰退。
这一矛盾引发了学界反思:VLM 微调是否必须对称更新双塔?浙江大学陈静远教授课题组与斯旺西大学联合团队提出了全新方案—— (自适应非对称适配器)。
该方案放弃了对图像分支的硬性微调,引入预测置信度机制,自动在适当时机为视觉塔“踩刹车”。这在保留预训练强泛化力的同时,实现了高效适配。
论文链接:https://arxiv.org/html/2605.13161v2
01
颠覆直觉的发现:文本放开改,图像看情况
研究团队在 11 个主流视觉数据集上展开严谨实验,通过给 CLIP 的图像塔和文本塔分别挂载基础 Adapter 进行交叉对比,总结出推翻传统范式的三大核心洞察:
▎实验试出来的三条“微调铁律”
洞察一:文本分支的改动收益更高。
在大多数任务中,微调文本编码器带来的性能提升显著高于图像编码器。文本包含高度抽象的高层语义,微调文本端能以极小参数代价快速对齐新类别概念。
洞察二:已知场景,双管齐下。
在分布内任务(如基类到新类的泛化)中,测试集与训练集分布一致,同时微调图像塔和文本塔能达到最佳表现,有助于捕捉特定领域的细粒度视觉特征。
洞察三:未知场景,图像微调是“毒药”。
一旦进入分布外任务(OOD)(如跨数据集迁移或域泛化),激进微调图像塔不仅无益,反而会严重破坏 CLIP 原本强大的通用视觉表达。
在跨数据集评估和域泛化等 OOD 任务中,仅微调图像分支的准确率大幅下滑,而仅微调文本分支则能维持较高水准。
这三条洞察直击工程痛点。在实际业务(如电商商品识别、工业质检、医疗遥感)中,模型常在测试集表现优异,但上线遇到长尾图片、异常光照或未见过品类(典型 OOD 场景)时,性能断崖式下跌。
问题根源往往不在于样本数量,而在于对图像塔的“过度侵入”。盲目微调破坏了预训练底座最珍贵的通用视觉表达。
▎陷入“开也不是,关也不是”的死局
实验数据颠覆了固有认知:过去被视为“加分项”的图像塔微调,在未知数据面前竟成了毁掉模型的“毒药”。
既然遇到未知场景有害,手动关闭图像塔 Adapter 是否可行?现实是,线上实时流入的数据不会自带标签。无法预判数据属性,导致无法手动切换开关。
不关开关,模型会被“改近视”;想关开关,又无法预判数据。这种进退两难的局面,是过往 VLM 微调范式难以逾越的天堑。
浙大团队提出颠覆性思路:既然人类无法预判,何不把决定权交给数据自己?由此诞生了 (Adaptive Asymmetric Adapter)。
02
拆解黑科技:两张架构图把机制讲透
理解该机制可聚焦两张结构图:先剖析单个模块内部分工,再纵观全局智能刹车机制。
▎组件内部:1 个精炼官带 N 个专项专家
Transformer 每一层挂载的 Adapter 内部包含两条并行通道:
第一步:信息压缩(Down Matrix)
输入特征经【Down Matrix】降维,如同“信息精炼官”,将高维冗余数据压缩并过滤噪声。
第二步:专家分工(Up Expert Matrices)
精炼后的数据被送至多个【Up Expert Matrix】。每个专家擅长恢复不同视角的特征,共同将低维数据还原回高维空间。
第三步:动态调度(Dynamic Router)
右侧【Dynamic Router】作为“调度员”,根据输入特征给各专家打分,加权汇总输出最终特征修改量 。
为何采用"1 个 Down + 多个 Up"结构?让所有专家共享同一个“信息精炼官”,能形成统一的信息瓶颈,避免多套降维矩阵互相干扰及梯度抵消。
▎全局调控:遇事不决,立刻退回原始底座
全景图展示了自动化“踩刹车”的全过程:
上图右上方汇聚点即为 ,其运作流程如下:
第一步:看置信度
模型计算分类概率分布,取最高概率值作为置信度得分 。低置信度意味着模型对图片困惑,极可能是“域外数据(OOD)”。
第二步:看修正量
图像塔每一层 Adapter 的修改意见汇总形成总修正向量 。
第三步:触发刹车(L_bias)
L_bias 机制如同“动态减震器”:
遇到熟客(高置信度):不干预,正常叠加图像 Adapter 计算结果,精细拟合。
遇到生客(低置信度):激活惩罚机制,强行将总修正量压向 0。相当于关掉图像 Adapter 影响,让模型退回到 CLIP 预训练好的原始图像特征。
03
雨露均沾:如何防止 MoE 出现“专家塌陷”?
多专家系统常出现路由器偏爱单一专家导致“专家塌陷”的现象。为此,论文在训练时加入约束:要求路由器在处理一批数据时,给各专家的平均派活概率不能偏离“均分线”太远,确保所有专家都能分到任务,维持认知多样性。
04
真实战力:11 个数据集硬碰硬
测试数据集涵盖丰富场景:从通用的 ImageNet,到细粒度的汽车、飞机、宠物,再到遥感卫星图、纹理识别及动作识别。
▎跨界打击:从没见过的场景也能跑
论文在三大微调评估任务中,将 与 CoOp、CoCoOp、MaPLe 等 11 种顶尖 Benchmark 方法正面交锋:
-
基类到新类泛化(Base-to-Novel):在 11 个数据集上,该方法在已知基类、未知新类及综合评价指标上均全面领先。 -
跨数据集评估(Cross-Dataset):在 ImageNet 训练后直接测试其他 10 个未见数据集。激进微调图像塔的方法表现惨淡,而专注于文本端或带有自适应约束的方法大幅领跑。 -
域泛化(Domain Generalization):在存在严重分布偏移的数据集上测试,该方法表现出极强鲁棒性,平均准确率高居第一。
的性能曲线全程稳定压制其他主流 Baseline。
▎拆解验证:任何一个零件都不能少
论文对各组件进行了剥离测试以验证设计必要性:
去掉刹车机制(w.o. L_bias):模型在未知新类上的表现显著下滑,证明强制“踩刹车”对保住泛化力至关重要。
给文本塔也装上刹车(w. bi-encoder L_bias):性能大幅下降,再次验证文本分支应放心修改,无需像图像分支那样拘束。
去掉路由器或更换 MoE 结构:无论是去掉动态路由器还是换成普通 LoRA,性能均有衰减,证明了“单下采样 + 多上采样专家”非对称结构的优越性。
▎跑得快又不挑设备:老牌 ResNet 和新贵 ViT 通吃
虽然引入 MoE 和动态刹车,但该 Adapter 极其轻量。在单张 A800 GPU 上,其训练和推理开销远低于复杂 Prompt 寻优方法,在性能与速度间取得极佳平衡。
该方法不仅在 Vision Transformer(ViT)上表现出色,在传统 ResNet-50 架构上同样大幅领先,具备广泛的模态骨干兼容性。
▎工程落地的“安全网”与适用边界
从工程落地角度看,该设计思路带来关键启发:
工业部署的防过拟合安全网。
在电商检索、遥感分类等真实业务中,模型常遭遇未知测试样本。传统模型易“硬猜”导致报错,而该方法“置信度低就自动退回预训练底座”的软约束,为工业级模型稳健运行搭建了天然安全网。
理性看待技术的适用边界。
该自适应机制最核心的优势场景是算力受限、标注样本匮乏的少样本(Few-Shot)快速迁移场景。
若面对拥有海量目标域标注数据的任务,强行压制视觉塔修改量可能会限制模型上限,此时全量微调或更激进的视觉塔重构可能取得更好绝对性能。
05
结语:大模型微调的“克制艺术”
这篇论文不仅取得了优异的实验成绩,更用优雅的数学解法为 VLM 微调范式指明了新路。它揭示了两个深刻真相:
尊重 VLM 的“非对称性”:预训练视觉塔的通用表达极其珍贵。在少样本场景下,对视觉塔的激进修改往往“破坏大于建设”。
用不确定性实现“软调控”:真正的智能调控应将控制权交给数据自身的“置信度”。熟悉则放开拟合,未知则及时退回底座。
在疯狂卷参数、卷架构的今天,这篇文章的核心启发在于:VLM 微调的最高境界,是在保留预训练底座原有灵性的同时,学会适时放手——在熟悉领地精准发力,在未知迷雾中优雅退避。
这种“文本常开、图像看情况踩刹车”的自适应思路,不仅破解了 CLIP 的分支偏置难题,更为未来海量 VLM 模型在边缘端、少样本工业场景下的高效落地提供了靠谱的工程解法。

