题目:Parameter-Free Clustering via Self-Supervised Consensus Maximization(Extended Version))
论文地址:https://arxiv.org/abs/2511.09211
代码地址:https://github.com/ljz441/2026-AAAI-SCMax
创新点
・提出一体化闭环无参聚类框架 SCMax,融合层次凝聚聚类与自监督表征学习
・构建双表征校验机制,同步基于原始特征和自监督结构感知特征生成两组并行聚类序列
方法
本文提出名为SCMax的完全无参聚类框架,先借助自编码器将原始数据映射至低维隐特征空间,基于近邻图开展层次凝聚聚类生成多组候选聚类结构,在每轮聚类合并步骤中依托当前聚类结构执行自监督学习生成结构感知表征,设计近邻一致性指标衡量原始表征与自监督表征下近邻合并决策的匹配程度,以一致性最大化的节点作为自动判定最优聚类数量的依据,全程无需预先给定聚类数等人工超参,实现聚类生成与结构评估一体化。
一致性最大化方法动机示意图
本图直观阐释一致性最大化的核心动机,图中 代表原始特征生成的聚类结构、 代表自监督表征生成的聚类结构,流程同步对样本执行层次凝聚聚类逐步合并簇结构得到两组并行聚类序列 与 ,随着簇持续合并两种表征下的划分差异逐步扩大,一致性峰值对应的聚类划分即为最优聚类结构, 与 内不同形状符号代表最终区分开的独立类别集合,以此说明依靠原始与自监督双表征聚类结果匹配度自动筛选最优簇数的底层逻辑。
SCMax方法整体框架示意图
本图完整展示SCMax无参聚类全流程,原始输入数据X经自监督表征损失 得到特征后并行开展层次凝聚聚类,上方分支 为原始特征生成的聚类结构、下方 为自监督表征生成的聚类结构,每轮簇合并后通过一致性损失 衡量两组划分匹配度,随着合并推进聚类数量依次呈现小于真实簇数、等于真实簇数、大于真实簇数三种状态,在 时原始与自监督聚类划分达成最高一致性,以此峰值自动锁定最优聚类结构,实现无需人工指定聚类数量的全自动聚类。
所有数据集上对应 时序候选 的NNC指标得分变化图
本图包含MSRCv1、HW2、Wiki、MNIST、Cifar10、Cifar100、Fashion、YTF20共8组不同数据集的折线子图,每张子图以候选聚类数 为横轴、NNC近邻一致性得分为纵轴,能观察到各数据集的NNC得分均随候选聚类数增大先逐步上升至唯一峰值(该峰值标注的 即为算法判定的最优聚类数目),之后得分出现明显回落,直观验证了NNC指标可以精准定位最优聚类数、在多类数据集上具备稳定有效的最优聚类结构判别能力。
实验
该表格以MSRCv1、HW2、MNIST、Cifar系列等多类图像与文本数据集为测试对象,采用ACC、NMI、ARI等主流聚类评价指标横向对比SCMax与多种传统及前沿无参聚类基线算法的聚类精度,完整呈现各类方法自动识别最优聚类数的性能差异,数据结果显示本文SCMax在绝大多数数据集全部指标上取得最优数值,直观证明该一致性最大化无参聚类框架相比现有方案拥有更强的聚类划分准确度与跨数据泛化能力。

