作者丨幸丽娟
编辑丨齐铖湧
IJCAI-ECAI 2026 将于 2026 年 8 月 15 日至 21 日在德国不来梅举行。大会召开之际,AI 科技评论系统扫描本届顶会收录论文,捕捉技术趋势和行业风向。
在上一篇华为 IJCAI 2026 论文盘点中,我们观察到大厂在参数竞赛上的克制及对算力效率的追求。而蚂蚁集团入选的四篇论文,则指向了一条截然不同但同样重要的技术脉络:对动态环境适应能力的系统性探索。
算法模型在实验室精度不断刷新,但部署到真实世界往往性能衰减。根本原因在于真实世界从来不是静止的。蚂蚁集团的业务场景将这种“不静止”推向极致:超 10 亿用户、8000 多种服务,支付洪峰与凌晨低谷相差数个数量级,风控模型需小时级响应黑产策略迭代,全球化部署还需适配各国迥异的金融基础设施。
在此环境下,“一次训练、永久部署”的静态模型注定陷入困境。真正的智能,在于算法能否感知环境变化、主动调整策略、在动态中寻找最优解。蚂蚁集团这四篇论文共同回答了核心命题:如何让 AI 从“静态的求解器”进化为“动态的自适应者”?
01 MSRGC-Net:让时间序列聚类“自适应”数据密度分布
时间序列聚类是理解行为模式、监控异常信号的基础工具,旨在将海量行为序列自动归类。现有方法存在局限:相似度方法(如 k-Shape)计算复杂度高,难以应对大数据量;深度学习方法(如自编码器)训练成本高、调参困难;传统特征提取依赖人工设计,易丢失关键时间动态信息。此外,现实时序数据密度分布极不均匀,传统方法需预设聚类数目,与实际场景错位。
蚂蚁集团联合重庆邮电大学提出的 MSRGC-Net,采用一套“无训练”组合拳,解决了精准度与计算效率的两难问题。
其核心逻辑分为三步:
第一步,多尺度储备池编码(特征提取)。使用多个无需训练的回声状态网络(ESN)作为基本单元,仅通过调整谱半径即可从原始时序中同时提取局部波动和长期趋势,聚合形成视图特征矩阵。
第二步,“颗粒球”锚定图构建(结构建模)。算法不再关注单个数据点,而是根据局部密度自动划分“颗粒球”:高密度区域形成小而多的颗粒,低密度区域形成大而少的颗粒。数据规模从 N 压缩至 M(M<N),同时抑制噪声干扰。
第三步,基于共识的多尺度图优化。跨尺度锚定图通过共识策略融合,使模型既能捕获微观局部模式,又能把握宏观全局趋势,最终生成无需人工指定聚类数目的鲁棒结果。
实验显示,在 5 个多变量基准数据集、15 项评估指标上,MSRGC-Net 获得 12 项最优、2 项第二,最优率达 80%。更重要的是,它避开了 O(n²) 的成对计算,实现了近线性复杂度,兼具速度与精度,且无需预设分类数。在蚂蚁实际业务中,该系统能根据流量密度自动调整聚类粒度:高峰时精细分群抓异常,低谷时粗粒度概括省算力。
02 ROAD:让离线到在线强化学习“自适应”数据混合策略
强化学习面临著名的“分布偏移”问题:在离线数据上训练好的模型,上线后易因离线与在线数据分布差异而“失忆”。现有解决方案多采用固定混合比例或启发式规则,无法适应策略在不同阶段的需求——早期需更多离线数据稳住基本盘,后期需更多在线数据探索新可能。
蚂蚁集团联合上海交通大学提出 ROAD,将数据混合比例从“预设参数”转变为“动态决策变量”。
其核心思想是将数据选择视为双层优化问题:
- 内层(Inner-Level):标准 Q 学习更新,最小化贝尔曼误差;
- 外层(Outer-Level):将数据混合策略视为元决策变量,以最大化在线策略预期回报为目标。
两层通过多臂老虎机(MAB)算法近似求解,使混合策略在训练中实时调整:若模型开始“遗忘”离线知识,自动调高离线数据采样比例;若模型趋于保守,则增加在线数据占比鼓励试错。
团队在 AntMaze、MuJoCo 和 FrankaKitchen 三大经典基准上验证了算法泛化能力。为进一步验证普适性,研究将 ROAD 与 IQL、PEX、CQL 等多种主流离线算法结合。结果显示,无论底层算法如何,ROAD 均能稳定提升性能。
以 PEX+ROAD 为例,该方法在 D4RL 基准的 24 个连续控制任务中取得 71.12 的总体平均分,18 个任务排名第一,显著优于各类基线。ROAD 帮助模型在“保守继承”与“激进探索”间找到最优平衡,对风控模型上线、推荐系统实时优化等场景具有重要价值。
03 DSEBO:让高维贝叶斯优化“自适应”搜索子空间
贝叶斯优化是黑盒函数优化的经典方法,但在高维问题上表现不佳。常见解法是随机嵌入至低维子空间,但有效维度难以确定:传统方法依赖专家经验或试错,资源消耗大且难以适配不同任务。更复杂的是,有效维度可能随优化进程变化。
蚂蚁集团联合华东师范大学、南京大学提出的 DSEBO,让子空间维度成为优化进程中的“动态变量”,随搜索进度自主切换。
DSEBO 的核心机制是“从低到高,逐级跃升”:
- 从低维子空间出发,快速摸清目标函数轮廓,驱动高斯过程迭代更新;
- 观察到收敛后自动触发维度扩展,通过共享嵌入矩阵将低维解“继承”到高维;
- 初始化新子空间并继续优化,形成“低维探索→收敛触发→维度扩展→继续优化”的循环。
维度扩展幅度亦非固定,算法会根据当前最优值变化曲线自适应调整:曲线平缓则慢扩以节省开销,曲线陡峭则快扩以捕捉增益。
实验结果表明,在合成函数及三个真实任务上,DSEBO 与 REMBO、SIRBO 等十几种主流方法对比,几乎在所有任务上均拿下最优解,精度与收敛速度双双领先。这套“低维探路、高维精调”的打法,已应用于蚂蚁信贷模型超参数调优、风控策略阈值寻优等场景,实现了自动化、高效率运行。
04 VGA-BenchV2:让视频评估基准“自适应”AIGC 生态的进化
如果说前三篇论文讨论的是算法层面的自适应,那么 VGA-BenchV2 展示的是评估基础设施如何“自适应”AIGC 技术生态的迭代。这是四篇论文中唯一聚焦多模态内容理解的工作,映射了蚂蚁集团在数字生活、内容生态等非金融领域的战略储备。
AIGC 引发视频生产爆发,但系统性评估生成视频质量成为瓶颈。传统指标如 FVD、CLIP Score 主要关注清晰度、连贯性及语义一致性,难以评估构图、光影、色彩等关乎“美感”的感知品质。
此前 CVPR 2026 上,蚂蚁联合北京电影学院等机构提出 VGA-Bench,首次建立视频审美评估三维度框架。面对视频生成模型的快速迭代,团队在 IJCAI 2026 推出 VGA-BenchV2。
核心进化体现在三点:
第一,人工标注量级大幅增加。VGA-BenchV2 新增 36,000 条任务级人工标注,美学质量、美学标签及生成质量标注量分别扩展了 13.46 倍、11.15 倍和 1.55 倍,使评估器与人类审美判断对齐更准。
第二,评估器架构升级。团队设计混合架构:VAQA-Net 负责连续美学评分,VTag-Net 和 VGQA-Net 基于 Qwen 大视觉语言模型进行标签识别和质量评估。大模型的引入显著提升了对复杂视觉语义的理解能力。
第三,打通从“评估”到“优化”的闭环。VGA-BenchV2 将学到的美学评估器作为奖励信号,直接用于强化学习的生成模型微调。评估基准不再只是“裁判员”,其给出的分数可直接转化为优化信号,指导生成模型持续迭代。
从 VGA-Bench 到 VGA-BenchV2,评估体系不再是静态标尺,而是与生成生态“共进化”的活系统。对于蚂蚁的内容理解、安全审核、推荐优化等场景,视频质量评估能力不仅能跟上 AIGC 演进,还能反向驱动上游模型优化。
结束语:再聪明的算法,终归要回到动态环境中检验
四篇论文分别从无监督学习、强化学习、黑盒优化和多模态评估四个方向切入,共同指向从静态到动态的范式转换。实验数据印证了该路径的有效性:MSRGC-Net 在多项指标中夺魁;ROAD 在离线到在线强化学习中超越现有策略;DSEBO 在千维优化问题上实现量化改进;VGA-BenchV2 评估结果与人类判断高度一致。
纵观蚂蚁整体布局,呈现出清晰的“双轮驱动”结构:一面在金融核心场景深耕时序建模、强化学习和优化算法;一面在数字生活与内容生态中前瞻布局多模态理解与评估基础设施。
算法再聪明,终归要回到动态环境中检验。这四篇论文的真正价值,在于它们生长在真实的业务土壤里:蚂蚁的业务场景不仅是论文的“背景板”,更是问题的来源、数据的产地和效果的检验场。这正是工业界做 AI 研究的独特之处——不只是“做论文”,更是在为真实世界的问题寻找“能抗住动态变化”的解法。

