大数跨境

精度暴涨!小样本学习+多模态霸榜顶会!横扫少标注赛道

精度暴涨!小样本学习+多模态霸榜顶会!横扫少标注赛道 AI因斯坦
2026-09-14
4
导读:小样本学习与多模态的深度融合,是破解高标注成本场景下多模态理解与生成难题的核心技术路径,在少样本分类、跨模态检

小样本学习与多模态的深度融合,是破解高标注成本场景下多模态理解与生成难题的核心技术路径,在少样本分类、跨模态检索、低资源生成等任务中进展迅猛。


本文整理了10篇小样本学习结合多模态的最新前沿论文,正在做相关课题的伙伴可以直接下方领取论文及代码(部分包含),搭基线、找改进点、扩实验方向都能直接用上。


长按识别下方二维码,回复小样本多模态

无偿领全部论文合集及项目代码


Few-Shot Multimodal Medical Imaging: A Theoretical Framework

小样本多模态医学影像:一个理论框架


文章内容

针对医学影像标注数据稀缺、单模态诊断信息有限,且现有少样本方法缺乏系统理论支撑的问题,提出统一的低资源医学影像学习理论框架。基于PAC学习与VC维理论形式化少样本学习目标,推导样本复杂度边界以估算达到临床可靠精度所需的最小标注数据量;定义多模态协同项量化互补模态的信息增益,结合PAC-贝叶斯理论给出稀疏监督下的不确定性上界;提出解释方差指标量化低数据条件下的可解释性稳定性,为构建数据高效、可解释的可靠诊断系统奠定理论基础。



Few-shot Writer Adaptation Via Multimodal In-Context Learning

基于多模态上下文学习的小样本书写者适配方法


文章内容

针对手写文本识别模型对罕见书写风格泛化差,现有书写者适配方法需推理时梯度更新、计算开销高的问题,提出上下文驱动的少样本适配框架。受多模态上下文学习启发,仅利用目标书写者的少量图文上下文样本,无需参数更新即可实现推理时风格适配;设计仅800万参数的紧凑CNN-Transformer架构,结合置信度融合策略融合上下文驱动与标准OCR结果,在IAM和RIMES数据集上字符错误率分别达3.92%和2.34%,性能超越同类无参数更新的适配方法。



Knowledge is Power: Advancing Few-shot Action Recognition with Multimodal Semantics from MLLMs

知识即力量:利用多模态大语言模型语义推进小样本动作识别


文章内容

针对现有小样本动作识别的“特征-字幕-特征”管道存在信息损耗、仅在视觉空间度量学习的局限,提出FSAR-LLaVA端到端知识驱动框架。直接抽取多模态大模型解码器的中间隐藏特征,设计双分支多模态特征增强模块解耦并强化视觉与文本表征;提出复合任务导向原型构建方法缩小元训练与测试的分布差距,搭配多模态原型匹配度量自适应筛选关键线索。在多个基准数据集上取得最优性能,仅需极少可训练参数。



↓↓听说在下方一键三连的都Accept了🌝

点点赞
点分享
点喜欢

【声明】内容源于网络
0
0
AI因斯坦
人工智能领域论文干货
内容 98
粉丝 0
AI因斯坦 人工智能领域论文干货
总阅读527
粉丝0
内容98