大数跨境

Science Robotics-2026年最新论文20篇

Science Robotics-2026年最新论文20篇 AI新文
2026-07-20
5

由于微信公众号开始试行乱序推送,为了让您在第一时间获取AI新文,请将"AI新文"设为星标。

多样手语翻译

原标题:Diverse Sign Language Translation

作者:Amos Matsiko

期刊:Science Robotics

出版时间:2026/06/24

摘要:像口语一样,一种手语表达可能对应多个有效的文字解释。因此,对于手语翻译(SLT)模型来说,学习一个严格的逐一映射可能是不够的,特别是在数据有限的情况下。在这项工作中,我们引入了一个多样化的手语翻译任务(DivSLT),旨在生成多样且准确的手语视频翻译。首先,我们利用大型语言模型(LLM)为广泛使用的CSL-Daily和PHOENIX14T SLT数据集生成多个参考。这里,仅邀请母语者修正不准确的引用,从而显著提高标注效率。其次,我们提供了一个基准模型以促进此任务的研究。具体来说,我们研究了多参考训练策略,使我们的DivSLT模型能够实现多样化的翻译。然后,为了提高翻译准确性,我们采用最大化奖励驱动的强化学习目标来最大化翻译结果的奖励。此外,我们利用多个指标来评估DivSLT任务的准确性、多样性及语义精确度。实验结果表明,在增强的数据集上,我们的DivSLT方法不仅实现了更好的翻译性能,而且还获得了多样化的翻译结果。


原文链接



攻击强度与目标相关:针对视觉对象跟踪器的稀疏对抗攻击探索

原标题:Attack Intensity is Target-Related: Exploration of Sparse Adversarial Attack against Visual Object Trackers

作者:Florian Rothfischer;Lennart J. K. Weiß;Sonja K. Schinko;Niccolò Tedeschi;Rui Yee Loke;Michael Matthies;Matthias Vogt;Christoph Karfusehr;Alexer Hebel;Petr Šulc;Tim Liedl;Enzo Kopperger;Friedrich C. Simmel

期刊:Science Robotics

出版时间:2026/06/24

摘要:最近的研究强调了基于深度学习的模型对抗攻击的脆弱性。作为计算机视觉的基本任务之一,视觉目标跟踪也亟需在这一背景下进行深入研究。深度神经网络在此过程中发挥着越来越重要的作用)然而,多样化的跟踪场景对这类漏洞的影响仍然鲜少被探索。具体而言,具有不同视觉特征的目标误导追踪者的成本是否一致?否则,哪些属性调节所需的对抗强度?为了解决这些问题,我们提出了一种新的场景依赖时空稀疏对抗攻击框架(SD-STSAtt),该框架能够自适应地控制扰动的稀疏性。我们的分析表明扰动幅度受到目标的某些视觉属性的影响,例如其视觉复杂性和区域数量。此外,与帧级或像素级对抗生成方案不同,所提出的方法仅扰动视频第一帧中的一组稀疏的关键像素。这种方法在显著降低跟踪性能的同时大幅减少了整个视频中的扰动幅度。我们认为这项工作不仅提供了一种用于视觉目标跟踪的稀疏对抗攻击方法,而且还为深度神经网络对对抗样本的脆弱性提供了新的见解。代码可在https://github.com/DjangoChaogh/STSAtt-main获取。


原文链接



鼠标锁盒数据集:识别小鼠解决锁盒的行为

原标题:Mouse Lockbox Dataset: Behavior Recognition for Mice Solving Lockboxes

作者:Kerstin Göpfrich

期刊:Science Robotics

出版时间:2026/06/24

摘要:机器学习和计算机视觉方法对自然动物行为的研究产生了重大影响,因为它们能够使(半-)自动分析大量的视频数据。如此大规模的分析不仅对单纯的行为研究至关重要,其适用性还跨越了众多学科。小鼠是大多数行为研究领域的标准哺乳动物模型系统,但目前可用于改进此类方法的数据集要么侧重于孤立的行为,要么侧重于社会行为。相比之下,包含动物与物理装置互动的数据集(这对研究学习的各个学科都极为相关)目前尚不可用。在这项工作中,我们呈现了一个包含单个小鼠解决(multi-step)机械谜题的视频数据集,所谓的锁箱。超过110小时的总游戏时间展示了从三个不同视角记录下的他们的行为。作为帧级动作分类方法的基准,我们为两只不同小鼠的所有视频提供了人工标注标签,这些视频占我们数据集的13%。我们的动作标签提供了两个复杂度级别,要求对鼠标正在做什么以及目标对象进行分类。此外,作为与人工标注标签进行初始比较的一部分,我们使用了两个不同的关键点(pose)跟踪为基础的动作分类框架以及一个基于自动编码器的框架,这展示了自动化细粒度行为标记(如操作物体)所面临的挑战。我们希望我们的工作能够帮助加速在任务驱动环境中自动化动作和行为分类的发展。我们的数据集(包括视频和人工标注标签)可在https://doi.org/10.14279/depositonce-23850公开获取。


原文链接



图像和视频的推理分割:综述

原标题:Reasoning Segmentation for Images and Videos: A Survey

作者:Robin R. Murphy

期刊:Science Robotics

出版时间:2026/06/24

摘要:推理分割(RS)旨在根据隐含的文本查询来勾勒对象,其解释需要推理和知识整合。与依赖固定语义类别或显式提示的传统分割问题表述不同,RS 桥接了视觉感知与人类般推理能力之间的差距,通过自然语言促进了更直观的人机交互我们的工作首次全面调查了用于图像和视频处理的RS方法,考察了26种最先进的方法以及相应的评估指标综述,并且包括了29个数据集和基准测试。我们也探讨了RS在各个领域的现有应用,并识别出它们的潜在扩展方向。最后,我们确定当前研究空白并突出有前景的未来方向。


原文链接



自增强残差三维高斯点阵选择法(SA-ResGS)用于下一最佳视图选取

原标题:SA-ResGS: Self-Augmented Residual 3D Gaussian Splatting for Next Best View Selection

作者:Shelly Levy-Tzedek

期刊:Science Robotics

出版时间:2026/06/17

摘要:我们提出自增强残差三维高斯点阵(Self-Augmented Residual 3D Gaussian Splatting,SA-ResGS),一种新的框架用于稳定不确定性量化,并在主动场景重建中的最佳视图选择(next-best-view,NBV)中增强不确定性感知监督。SA-ResGS 通过在训练视图和栅格化外推视图之间进行三角测量生成自增强点云(SA-Points),从而提高不确定性估计的可靠性和其监督的有效性,实现高效的场景覆盖估计。通过物理引导的视图选择提高场景覆盖范围的同时,SA-ResGS 还解决了稀疏且基线较宽的视图所加剧的准监督高斯问题,引入了首个针对三维高斯点阵的残差学习策略。这种定向监督通过结合不确定性驱动的过滤与dropout和hard-negative-mining启发式的采样增强高不确定性高斯分布中的梯度流动。我们的贡献有三个方面:(1) 一种基于物理的视图选择策略,促进高效且均匀的场景覆盖;(2) 一种感知不确定性的残差监督方案,放大对弱贡献高斯分布的学习信号,提高不同摄像机分布场景中的训练稳定性和不确定性估计;(3) 作为受限视图选择和残差监督的结果,隐式地消除了不确定性量化偏差,两者共同缓解了宽基线探索和稀疏视图模糊性在NBV规划中的冲突效应。实验结果表明,在重建质量和视图选择鲁棒性方面,SA-ResGS均优于最先进的基准方法。


原文链接



批判驱动VLM:从验证者引导的强化学习到潜在思想提炼的自主驾驶

原标题:CritiqueDriveVLM: From Verifier-Guided Reinforcement Learning to Latent Thought Distillation for Autonomous Driving

作者:Melisa Yashinski

期刊:Science Robotics

出版时间:2026/06/17

摘要:端到端的视觉-语言模型(VLMs)在自动驾驶中展现出巨大的潜力。然而,标准的监督微调(SFT)常常遭受推理幻觉和保守偏见。传统的工具增强框架和Chain-of-Thought (CoT) 方法虽然缓解了这些问题,但它们导致高昂的令牌消耗和不可接受的延迟,使得实时部署变得不切实际。为了解决可靠性与效率之间的权衡问题,我们提出了CritiqueDriveVLM,一个新颖的统一三阶段框架,直接将推理内在化到视觉语言模型中。首先,我们介绍由多维验证器引导的批评驱动的多轮强化学习(RL)。通过提供细粒度的标量反馈和多轮惩罚,我们迫使策略内部化逻辑推理,培养出一个稳健的System-2教师,在没有脆弱的外部工具的情况下实现高精度。随后,我们提出隐式思想蒸馏来克服延迟瓶颈。通过将学生的潜在表示与教师完全收敛的推理状态对齐,我们将深度逻辑能力压缩成一个快速的、无CoT的System-1学生。广泛的实验表明,在广泛使用的DriveLMM-01基准上取得了显著的改进。与基础模型相比,我们的无工具Teacher显著提升了多项选择题质量(MCQ),从55.54%提升到了最先进的76.54%。至关重要的是,我们的蒸馏学生模型在大幅减少生成长度至平均仅为28个令牌的同时,保持了竞争性的推理深度。这将推理延迟降低了88%(从3482毫秒到416毫秒),为低延迟自主驾驶铺平了一条高度稳健的道路。我们的源代码可在https://github.com/MICLAB-BUPT/CritiqueDriveVLM获取。


原文链接



i-IF-Learn:迭代特征选择和无监督学习用于高维复杂数据

原标题:i-IF-Learn: Iterative Feature Selection and Unsupervised Learning for High-Dimensional Complex Data

作者:Emek Barış Küçüktabak;Matthew R. Short;Lorenzo Vianello;Daniel Ludvig;Levi Hargrove;Kevin Lynch;Jose Pons

期刊:Science Robotics

出版时间:2026/06/17

摘要:无监督学习高维数据具有挑战性,因为无关或有噪声的特征会掩盖潜在结构。只有少数几个特征,称为影响性特征,有意义地定义了聚类。恢复这些有影响力的特征有助于数据解释和聚类。我们提出i-IF-Learn,一个迭代的无监督框架,联合执行特征选择和聚类。我们的核心创新是一种自适应特征选择统计量,它可以有效地结合伪标签监督与无监督信号,在基于中间标签可靠性的动态调整下工作,从而减轻迭代框架中常见的错误传播。利用低维嵌入(PCA or Laplacian eigenmaps)后跟k均值聚类,i-IF-Learn 同时输出有影响力的特征子集和聚类标签。数值实验表明,在基因微阵列和单细胞RNA测序数据集上,i-IF-Learn显著超越了经典和深度聚类基准方法。此外,使用我们选择的有影响力的特征作为预处理显著增强了下游深度模型,例如DeepCluster,UMAP和VAE,突显了目标特征选择的重要性和有效性。代码可在以下位置获取:[https://github.com/mc25800852/i_if_learn].


原文链接



AppAgent:作为智能手机用户的多模态代理

原标题:AppAgent: Multimodal Agents as Smartphone Users

作者:Tianyue Wu;Guangtong Xu;Zihan Wang;Junxiao Lin;Tianyang Chen;Yuze Wu;Zhichao Han;Zhiyang Liu;Fei Gao

期刊:Science Robotics

出版时间:2026/06/10

摘要:最近在大型语言模型(LLMs)方面取得的进步导致了能够执行复杂任务的智能代理的创建。本文介绍了一种基于新型LLM的多模态代理框架,旨在操作智能手机应用程序。我们的框架使代理能够通过简化的行为空间操作智能手机应用程序,模仿人类般的交互行为,如点击和滑动。这一新颖的方法绕过了对系统后端访问的需求,从而使其在各种应用程序中具有更广泛的应用性。我们代理的功能核心是其创新的学习方法。智能体通过自主探索或者观察人类演示来学习导航和使用新应用。此过程生成一个知识库,该代理在执行不同应用程序中的复杂任务时参考该知识库。为了证明我们的代理程序的实际应用性,我们在10个不同的应用程序中进行了广泛的测试,包括50项任务,涉及社交媒体、电子邮件、地图、购物以及复杂的图像编辑工具。结果证实了我们代理人在处理各种高级任务方面的熟练程度。


原文链接



测量动态视频生成中的三维空间几何一致性

原标题:Measuring 3D Spatial Geometric Consistency in Dynamic Video Generation

作者:D. Hirano;M. Inazawa;M. Sutoh;M. Nagata;Y. Yoneda;K. Watanabe;H. Sawada;G. Sakoda;S. Abe;S. Homma

期刊:Science Robotics

出版时间:2026/06/10

摘要:最近的生成模型可以产生高保真视频,但它们经常表现出3D空间几何不一致性。现有的评估方法无法准确表征这些不一致之处:以保真度为中心的指标(如FVD)对几何失真不敏感,而侧重于一致性的基准测试通常会惩罚有效的前景动态变化。为了填补这一空白,我们引入了SGC,一个用于评估动态生成的视频中3D\textbf{S}patial \textbf{G}eometric \textbf{C}onsistency的度量标准。我们通过测量从不同局部区域估计的多个相机姿态之间的发散程度来量化几何一致性。我们的方法首先将静态区域与动态区域分离,然后将静态背景划分为空间上连贯的子区域。我们预测每个像素的深度,估计每个子区域的局部相机姿态,并计算这些姿态之间的发散程度以量化几何一致性。对真实视频和生成视频进行的实验表明,SGC 能够稳健地量化几何不一致,有效识别现有指标遗漏的关键故障。


原文链接



Robobench:用于具身大脑的多模态大型语言模型综合评估基准

原标题:Robobench: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models as Embodied Brain

作者:Liangfang Zhang;Joseph Wang

期刊:Science Robotics

出版时间:2026/06/10

摘要:构建能够在动态、非结构化环境中感知、推理和行动的机器人仍然是一个核心挑战。最近的具身系统通常遵循双系统范式,在这种范式中,System 2 负责高层次推理,而 System 1 处理低层次控制。我们将System 2称为具身大脑,操作中的决策认知核心尽管评估这种具身大脑至关重要,现有的基准主要衡量执行成功与否或仅涵盖高级认知和任务真实感的有限方面。我们介绍了RoboBench,一个用于评估作为具身大脑的多模态大型语言模型(MLLMs)的基准。RoboBench 包含五个维度:指令理解,感知推理,通用规划,可操作性预测,和故障分析。它涵盖了14种能力,25项任务和6,092个问答对。为了提高逼真度,它借鉴了大规模的真实机器人数据以及内部跨多种实体形态、属性丰富的物体、多视角场景和基于记忆的导航收集的数据。为了规划,RoboBench 引入了一个 MLLM-as-world-simulator 框架,评估预测的计划是否能够在物理和视觉约束下实现关键对象状态的变化,从而比符号匹配更真实地评价长期推理的能力。对18种最先进的多模态大型语言模型的实验揭示了其在隐式指令理解、时空推理、跨场景规划、细粒度可操作性理解和故障诊断方面存在持续存在的局限性。我们进一步分析了嵌入式认知能力如何与下游机器人控制相关联。RoboBench 提供了一个全面的框架来量化高级认知,并指导下一代MLLMs走向更强大的机器人智能。


原文链接



极端动态对称性使全方位多功能机器人成为可能

原标题:Extreme dynamic symmetry enables omnidirectional and multifunctional robots

作者:Jiaxun Liu;Boxi Xia;Boyuan Chen

期刊:Science Robotics

出版时间:2026/05/27

摘要:对称性是自然系统中的一个核心组织原则,然而将其用作机器人设计策略的统一方法却大多局限于几何形态。我们表明,对称性可以被利用在动态执行能力层面。我们介绍了动态对称性,即机器人可达到的质量中心加速度的一致性,并通过一个称为动态等向性的度量对其进行了形式化。在超过1000种模拟形态中,我们发现更高的动态对称性始终改善了轨迹跟踪、任务成功率、鲁棒性和能量效率,并且当动态同轴度接近其理论极限时,这些好处变得最为明显。为了系统地研究这一制度,我们开发了Argus,一个设计用来探索动态对称性增加效应的球形机器人系列。Argus家族的成员在驱动几何形状和动态对称性水平上有所不同,但共享一个共同的建筑原则:径向定向的线性执行器直接塑造机器人的质心动力学。其中,我们构建了一个物理的20腿Argus变种,实现了接近极限的动力学各向同性,并展示了方向不变的运动能力,敏捷穿越杂乱和可变形地形的能力,快速自我稳定以及对部分执行器故障的鲁棒性。其分布式传感进一步实现了在连续运动过程中全方位感知和物体交互。这些结果表明,在设计机器人时不仅在形态上而且在其可实现的动力学上追求对称性,提供了一条通往敏捷性、鲁棒性和多功能性的强大而通用的途径,在不确定的陆地和外太空环境中尤为如此。


原文链接



实体存在或虚拟呈现:在人机交互中的具身化争论导航

原标题:Embodied or virtually represented: Navigating the embodiment debate in human-robot interaction

作者:Connor Esterwood;Xin Ye;Ruijia Guan;Lionel Peter Robert

期刊:Science Robotics

出版时间:2026/05/27

摘要:在人机交互实验中,虚拟表示的机器人是否有效取决于它对谁来说重要,在哪里重要以及何时重要。


原文链接




融合激光雷达和视觉生成高质量重建

原标题:Fusing LiDAR and vision to generate high-quality reconstructions

作者:Amos Matsiko

期刊:Science Robotics

出版时间:2026/05/27

摘要:基于神经辐射场的融合激光雷达和视觉数据的重建框架实现了几何精度。


原文链接



一种用于前路腰神经减压的微创机器人脊柱手术系统

原标题:A minimally invasive robotic spinal surgical system for anterior lumbar nerve decompression

作者:Qingxiang Zhao;Xii Wang;Xin Zhong;Runfeng Zhu;Peizhi Zhou;Dan Pu;Baitao Lin;Tao Li;Shiyuan Sui;Haonan Zhou;Yuxi Cheng;Hao Zheng;Henry K. Chu;Jiancheng Zeng;Kang Li

期刊:Science Robotics

出版时间:2026/05/27

摘要:腰椎退行性疾病,主要由病理组织压迫脊髓神经引起,通常需要手术干预——具体来说是腰椎神经减压术——来缓解疼痛。尽管前路减压术相比传统的后路方法具有明显的优点,如减少出血和缩短术后住院时间,但由于各种器械上的不足,包括视野受限和远端灵巧度不足等原因,患者仍可能经历不完全减压。在这项研究中,我们提出了一种用于微创前腰神经减压的机器人手术系统,该系统包括三个细长的机器人手臂(外径为2毫米),具有高灵活性(18个自由度),便于通过狭窄的椎间盘空间到达后部区域。每个机器人臂基于同心推拉机器人结构,形成三个机器人化器械:一个用于可视化的内窥镜,一个用于止血和切除的激光光纤,以及一个用于组织操作的夹持器。这些组件通过一个细长套管的空心腔室集成在一起,并且多器械协调使得视野开阔的有效减压程序得以实现。系统性能首先通过三维打印的椎骨模型进行验证,以确认能够到达双侧关节突。随后,进行了在体动物实验和人体尸体测试,进一步展示了进行微创腰椎神经减压的全部能力。本研究展示了机器人系统在狭窄、受限和曲折的解剖空间中辅助手术程序的潜力,解决了传统器械在前路腰椎神经减压中的关键限制。


原文链接



可连续学习的形状变形超材料

原标题:Shape-morphing metamaterials with continuous relearning

作者:Melisa Yashinski

期刊:Science Robotics

出版时间:2026/05/20

摘要:一种超材料链使用物理学习框架来学习、遗忘和重新学习不同的形状变化。


原文链接



人形机器人接受度:一种心理视角

原标题:Acceptance of humanoid robots: A psychological perspective

作者:Stefano Puntoni

期刊:Science Robotics

出版时间:2026/05/20

摘要:机器人被接受取决于它们是否支持消费者的心理需求,因此需求方的见解至关重要。


原文链接



类人机器人将很快取代大多数人类工人:一场辩论

原标题:“Humanoids will soon replace most human workers”: A debate

作者:Hesheng Wang;Michael Wang;Frank Park;Lijun Han;Huichan Zhao;XingXing Wang;Andra Keay;Shigeki Sugano;Yi Guo;Tamim Asfour;Yu Sun;Ken Goldberg

期刊:Science Robotics

出版时间:2026/05/20

摘要:在中国浙江省举行的2025年智能机器人与系统国际会议(IROS)上,领先的研究人员和行业专家讨论了人形机器人是否会很快取代人类工人。辩论者就该主张提出的观点的总结如下高亮显示。


原文链接



交联集体:缠结的机器人物质具有协同运动

原标题:Cross-link collective: Entangled robotic matter with cohesive motion

作者:Danna Ma;Baxi Chong;Daniel I. Goldman;Kirstin H. Petersen

期刊:Science Robotics

出版时间:2026/05/20

摘要:机器人应用越来越需要具备韧性、适应性和可扩展性的系统。一种有希望的途径是通过简单模块的集合,在这种集合中,复杂的群体行为从局部交互中涌现出来。通过省略固定拓扑结构和紧密协调,这种方法牺牲了可预测性和传统工具,以实现通过随机机械相互作用内在优化的行为。保持凝聚力和功能性而不依赖固定连接和明确协调是关键挑战。我们介绍了交联集体(cross-link collective),一个受活性凝胶中交联现象启发的物理缠结机器人系统。通过形状变换和瞬态缠结,各个单独不可移动的模块产生持续的集体运动。具有机械智能的机器人材料倾向于减少关节扭矩的链状结构和相位关系,并在受到干扰时重新配置。我们表明可以向该基底添加分布式控制以进一步增强凝聚力。利用弱的、可逆的连接,交联集体具有适应性、可扩展性和容错性,为软物质和机器人技术的应用提供了见解。


原文链接



RAPTOR:四旋翼控制基础政策

原标题:RAPTOR: A foundation policy for quadrotor control

作者:Jonas Eschmann;Dario Albani;Giuseppe Loianno

期刊:Science Robotics

出版时间:2026/05/13

摘要:人类在适应前所未见的条件时表现出色的数据效率,比如驾驶一辆新车。相比之下,现代机器人控制系统,如使用强化学习(RL)训练的神经网络策略,对于单一环境高度专业化。由于这种过拟合,它们在诸如仿真到现实的差距等小差异下就会失效,并且即使系统发生最小的变化也需要进行系统识别和重新训练。这里,我们介绍了RAPTOR,一种用于四旋翼控制的高适应性基础策略训练的方法。我们的方法能够训练单一的端到端神经网络策略来控制各种四旋翼飞行器。我们测试了10种不同的真实四旋翼飞行器,重量从32克到2.4千克不等,它们在电机类型(有刷对无刷)、框架类型(软式对硬式)、螺旋桨类型(两叶、三叶或四叶)和飞控(PX4,Betaflight,Crazyflie,M5StampFly)方面也有所不同。我们发现一个仅有三个层次且包含2084个参数的小型策略足以实现对各种平台的零样本适应。通过在隐藏层中使用循环实现了上下文学习适应。该政策通过我们提出的元模仿学习算法进行训练,在此过程中,我们采样了1000个四旋翼,并使用RL对它们中的每一个都训练了一个教师策略。1000名教师被浓缩成一项单一的、适应学生的政策。我们发现,在毫秒之内,生成的基础政策适应了对未见过的四旋翼机的零样本学习。我们测试了该基础政策在多种条件下的能力(轨迹跟踪、室内/室外、风扰动、戳击以及不同的螺旋桨)。


原文链接



【声明】内容源于网络
0
0
AI新文
AI顶刊顶会新论文一号通,每天推送,助您时刻站在AI研究最前沿。包括:人工智能基础、交叉应用、脑认知与类脑智能、机器学习、模式识别与计算机视觉、自然语言处理、知识工程与数据挖掘、跨媒体与人机交互、智能机器人与系统、智能芯片与计算等。
内容 240
粉丝 0
AI新文 AI顶刊顶会新论文一号通,每天推送,助您时刻站在AI研究最前沿。包括:人工智能基础、交叉应用、脑认知与类脑智能、机器学习、模式识别与计算机视觉、自然语言处理、知识工程与数据挖掘、跨媒体与人机交互、智能机器人与系统、智能芯片与计算等。
总阅读2.7k
粉丝0
内容240