大数跨境

TPAMI 2026|韩军功教授团队提出半监督学习归一化新范式

TPAMI 2026|韩军功教授团队提出半监督学习归一化新范式 AI TIME 论道
2026-07-08
18

本文作者|Changrui Chen

本文编辑|李悦康瑞

TPAMI 2026

  • 论文题目:Exploring the Stochastic Regularisation in Normalisation Layers for Semi-Supervised Learning

  • 录用期刊:IEEE Transactions on Pattern Analysis and Machine Intelligence(TPAMI)

  • 作者:Changrui Chen(University of Warwick),Jungong Han*(清华大学),Kurt Debattista(University of Warwick)

  • 论文链接:https://ieeexplore.ieee.org/abstract/document/11568847

近日,韩军功教授团队在半监督学习与深度模型归一化机制方向取得重要进展。由 Changrui Chen、Jungong Han 和 Kurt Debattista 合作完成的论文被人工智能领域国际权威期刊 TPAMI 录用。

该研究从一个长期被忽视但至关重要的问题出发:当前深度模型中广泛使用的归一化层,真的适合半监督学习吗?

在半监督学习中,模型通常需要利用少量有标签数据和大量无标签数据进行训练。现有研究大多关注伪标签生成、数据增强、训练策略和损失函数设计,却较少回到模型结构本身,思考全监督学习中默认使用的 Batch Normalisation、Layer Normalisation、Group Normalisation 等模块,是否天然适配半监督场景?本文从这一基础问题切入,系统揭示了归一化层中的随机正则化机制对半监督学习稳定性、伪标签质量和泛化能力的深层影响。

从“训练策略”到“模型结构”:重新审视半监督学习的基础模块

半监督学习的核心挑战在于:无标签数据虽然规模大,但其类别分布、样本质量和数据域往往不可控。当有标签数据与无标签数据的标签分布不一致时,模型可能在错误伪标签的持续强化下产生 confirmation bias,导致性能下降。

当有标签数据与无标签数据的标签分布不一致时,模型性能会随着 label inconsistency ratio 的增加而明显下降。该实验直观展示了半监督学习中无标签数据分布不确定性带来的挑战。

研究团队发现,常用的 Batch Normalisation(BN)虽然在全监督学习中能够通过 mini-batch 统计量带来一定随机正则化,有助于提升模型泛化能力;但在半监督学习中,当无标签数据中混入大量分布不一致样本时,BN 的统计量会受到明显偏移,进而放大梯度不稳定性,使模型优化过程变得更加脆弱。

另一方面,Group Normalisation(GN)和 Layer Normalisation(LN)虽然避免了 BN 对 batch 内其他样本的依赖,能够缓解分布不一致带来的统计偏差,但它们也几乎消除了随机正则化效果,可能导致模型泛化不足,生成质量较低的伪标签。

由此,本文提出一个关键结论:半监督学习既不需要“过强且不可控”的随机正则化,也不应完全消除随机性;真正有效的是一种适度、可控的随机正则化机制。

为什么 BN 会失效?关键在于“统计量偏移”

BN 的核心机制是利用 mini-batch 内样本计算均值和方差,再对特征进行归一化。这一机制在样本分布相对一致时能够有效稳定训练,但在半监督学习中,无标签样本可能来自不同类别、不同域甚至分布外数据。当这些样本进入同一个 mini-batch 时,BN 计算出的统计量就可能无法准确反映目标样本本身的分布。

BN 与 GN 在统计量计算方式上的差异。BN 依赖 batch 内其他样本,容易受到分布外数据影响;GN/LN 针对单个样本内部计算统计量,因此更加稳定,但缺少随机正则化。

这意味着,BN 的随机性是一把“双刃剑”:适度随机性有利于泛化,过强且不可控的随机性则可能破坏训练稳定性。GN/LN 则走向另一个极端:它们更加稳定,但随机正则化不足。本文正是在这两类归一化机制之间,寻找适合半监督学习的平衡点。

Shuffle Normalisation:简单、有效、可插拔的新型归一化层

围绕上述发现,团队提出了两种新的归一化技术:

  • Shuffle Layer Normalisation(SLN)
  • Shuffle Group Normalisation(SGN)

其核心思想十分简洁:在 GN/LN 计算每个样本自身统计量的基础上,通过 batch 维度上的 shuffle 操作,引入来自其他样本统计量的可控扰动,并使用参数 α 控制扰动强度。这样,模型既能保留 GN/LN 不依赖 batch 统计、对分布偏移更加鲁棒的优势,又能重新获得适度随机正则化带来的泛化收益。

Shuffle Group Normalisation 与 Shuffle Layer Normalisation 的整体流程。方法通过打乱 batch 维度上的统计量,并以可控比例注入原始统计量中,从而实现适度随机正则化。

更重要的是,SLN/SGN 具有非常强的实用性:它们不引入额外可学习参数,不改变模型主体结构;可以直接替换现有模型中的 LN/GN;能够复用预训练模型参数;同时适用于 CNN 和 Transformer 等主流架构,计算开销也很小。

这意味着,该方法不仅是一个理论上有解释力的新发现,也具备较高的工程落地价值,可作为插件式模块嵌入现有半监督学习框架中。

多模态、多任务验证:图像、文本、音频全面提升

为了验证方法的有效性,研究团队在鲁棒半监督学习和传统半监督学习两类设置下进行了系统实验,覆盖图像、文本、音频等多个模态,并进一步扩展到语义分割、目标检测和全监督 ImageNet 分类任务。

  • 在鲁棒半监督学习场景中,当无标签数据中包含越来越多分布不一致样本时,普通 BN 的性能明显下降;而 SGN 能够稳定提升模型鲁棒性,在 CIFAR-10、CIFAR-100、Semi-Aves 等数据集上均取得更优表现。
  • 在传统半监督学习设置中,SLN/SGN 同样展现出稳定增益。例如,在图像分类任务中,基于 SoftMatch 的模型在 STL10 数据集上提升了约 3.72%;在文本分类任务中,模型在 Yahoo Answers 数据集上取得约 1.21% 的性能提升;在音频分类任务中,模型在 UrbanSound8K 数据集上提升约 3.07%。
  • 该方法还可以直接插入已有鲁棒半监督学习算法,如 Fix-a-Step 和 OpenMatch,并进一步提升其性能,表明 SLN/SGN 具有良好的兼容性和扩展性。

为什么有效?从梯度稳定性到伪标签质量的机制解释

本文不仅提出方法,还从优化机制层面对其有效性进行了深入分析。

研究表明,当 BN 的 batch 统计量受到分布外样本干扰时,归一化后的特征分布会产生偏移,进而增大梯度差异上界,破坏训练稳定性。而 GN/LN 虽然更稳定,却缺少随机扰动带来的泛化收益。

SLN/SGN 通过可控 shuffle 统计量,在稳定性与随机性之间建立平衡。一方面,它避免了 BN 在分布不一致场景下的严重统计偏差;另一方面,它又为模型训练引入适度扰动,使损失曲面更加平滑,提升模型泛化能力和伪标签质量,从而缓解半监督学习中的 confirmation bias 问题。这种“适度随机性”的思想,为半监督学习中的模型结构设计提供了新的视角:提升半监督学习性能,不仅可以从训练策略入手,也可以从模型基础模块本身寻找突破口。

研究意义

本工作将半监督学习研究从算法层面的“如何利用无标签数据”,推进到结构层面的“什么样的模型模块更适合无标签学习”,揭示了归一化层中随机正则化强度与半监督学习性能之间的关系,并提出了简洁、通用、无需额外参数的新型归一化方案。

在大规模人工智能模型快速发展的背景下,高质量标注数据依然昂贵且稀缺。如何更充分、更可靠地利用海量无标签数据,是构建高效、鲁棒、可泛化智能系统的关键问题。本文提出的 SLN/SGN 为半监督学习、鲁棒学习以及多模态模型训练提供了一种新的基础组件,也为未来面向低标注、弱监督和开放环境的模型设计提供了有价值的理论和实践参考。

关于 AI TIME

AI TIME 源起于 2019 年,旨在发扬科学思辨精神,邀请各界人士对人工智能理论、算法和场景应用的本质问题进行探索,加强思想碰撞,链接全球 AI 学者、行业专家和爱好者,希望以辩论的形式,探讨人工智能和人类未来之间的矛盾,探索人工智能领域的未来。

迄今为止,AI TIME 已经邀请了 2000 多位海内外讲者,举办了逾 800 场活动,超 1000 万人次观看。

【声明】内容源于网络
0
0
AI TIME 论道
AI TIME是一群关注人工智能发展,并有思想情怀的青年学者创办的圈子,旨在发扬科学思辨精神,邀请各界人士对人工智能理论、算法和场景应用的本质问题进行探索,链接全球AI学者,以辩论的形式探讨人工智能领域的未来
内容 2175
粉丝 0
AI TIME 论道 AI TIME是一群关注人工智能发展,并有思想情怀的青年学者创办的圈子,旨在发扬科学思辨精神,邀请各界人士对人工智能理论、算法和场景应用的本质问题进行探索,链接全球AI学者,以辩论的形式探讨人工智能领域的未来
总阅读41.7k
粉丝0
内容2.2k