由于微信公众号开始试行乱序推送,为了让您在第一时间获取AI新文,请将"AI新文"设为星标。
用于气候分析的具有隐藏动态过程的学习通用因果结构
原标题:Learning General Causal Structures with Hidden Dynamic Process for Climate Analysis
作者:Minghao Fu; Biwei Huang; Zijian Li; Yujia Zheng; Ignavier Ng; Guangyi Chen; Yingyao Hu; Kun Zhang
期刊:arXiv每日人工精选
出版时间:2026/05/28
摘要:理解气候动力学需要超越观测数据中的相关性,揭示其中的因果过程。潜藏的驱动因素如大气过程在时间动态中发挥核心作用,而地理位置相近的观测变量之间也存在直接因果影响。传统的因果表征学习(CRL)通常侧重于潜在因素,但忽视了这样的可观测变量之间的因果关系,这限制了其在气候分析中的应用性。本文介绍了一个统一的框架,该框架同时揭示了(i)观察到的变量之间的因果关系以及(ii)潜在驱动因素及其相互作用。我们建立了在这些条件下,可以从时间序列数据中同时识别出隐藏动态过程以及观测变量之间的因果结构,并且通过上下文信息恢复潜在变量和因果关系,我们的保证在非参数设定下仍然成立。基于这些见解,我们提出了CaDRe(因果发现和表征学习),这是一种具有结构约束的时间序列生成模型,集成了CRL和因果发现。对合成数据集进行的实验验证了我们的理论结果。在真实世界的气候数据集上,CaDRe 提供了具有竞争力的预测准确率,并恢复了与领域专业知识一致的可视化因果图,从而提供了对气候系统的可解释见解。代码可在https://github.com/MinghaoFu/CaDRe获得。
原文链接
简单高效的视觉-语言模型用于病例级病理综合报告生成(Simple Token-Efficient Vision-Language Model for Case-level Pathology Synoptic Report Generation)
原标题:Simple Token-Efficient Vision-Language Model for Case-level Pathology Synoptic Report Generation
作者:Zhiyuan Yang; Jiahao Cheng; Vincent Quoc-Huy Trinh; Mahdi S. Hosseini
期刊:arXiv每日人工精选
出版时间:2026/05/28
摘要:生成来自全切片图像(WSIs)的病理病例的临床有用病理报告具有挑战性,原因是其千兆像素分辨率,长视觉标记序列以及案例层面推理的复杂性,其中单个案例可能包含多个WSIs,含有异质组织和模糊发现我们提出了一种简单的token高效的视觉—语言模型用于病例级别的概要报告生成,在受限的GPU内存条件下仍具有实用性。我们的架构遵循一个最小的三组件设计:一个冻结的病理补丁编码器,一个轻量级的两层MLP视觉-语言对齐器,以及一个大型语言模型解码器,并且包含一个明确的WSI标记令牌来分离病例中的幻灯片。训练分为两个监督阶段进行:(1) 使用异构的WSI-文本对进行aligner-only WSI描述,以及(2) 在病例报告对上进行结构化报告生成的病例级别监督微调。为了减少序列长度,我们使用(at)放大倍数下的每个幻灯片的补丁来表示,这使得平均序列长度相比于通常使用的补丁减少了(up to)倍。结合高效的训练技术,我们仅使用一半的NVIDIA H100 GPU就能实现实际训练。在整个训练阶段,我们的方法实现了高ROUGE-L/METEOR/BLEU-4得分,同时在内存和运行时间上效率显著更高。在基于AI的评估中,我们的模型一直优于强大的基准模型。详细的消融研究描述了性能与效率之间的权衡,并确定了一些简单的选择可以提高多张全滑动网格图像设置中的鲁棒性总体而言,这项工作为高效生成病理报告提供了坚实且可重复的基础,在计算资源有限的情况下降低了多全滑片图像视觉语言模型研究的门槛。
原文链接
当模型学会提问为什么:值得信赖的医疗视觉语言模型中的自适应因果推理
原标题:When Models Learn to Ask Why: Adaptive Causal Reasoning for Trustworthy Medical Vision-Language Models
作者:Jianxin Lin; Chunzheng Zhu; Peter J. Kneuertz; Yunfei Bai; Yuan Xue
期刊:arXiv每日人工精选
出版时间:2026/05/28
摘要:视觉语言模型(VLMs)通过融合视觉感知与语言推理实现了可解释的医学诊断。现有的医疗思维链(CoT)模型缺乏明确的机制来表示和强制因果推理,使它们容易受到虚假相关性的困扰,并限制了其临床可靠性。我们确定了医学因果推理中的三个核心挑战:如何自适应地触发因果修正,构建高质量的因果伪相关对比样本,以及保持推理轨迹间的因果一致性。为了解决这些挑战,我们提出了MedCausalX,一个端到端的框架,明确地对医学视觉语言模型中的因果推理链进行建模。我们首先介绍了CRMed数据集,该数据集提供了精细的解剖学标注、结构化的因果推理链以及反事实变体,这些都指导着学习超越表面相关性的因果关系。基于CRMed,MedCausalX采用了一个两阶段自适应反思架构,配备了因果和验证令牌,使模型能够自主决定何时以及如何执行因果分析和验证。最后,通过基于错误归因的强化学习优化的轨迹级因果校正目标精炼了推理链,使模型能够区分真正的因果依赖关系与捷径关联。广泛的基准测试实验表明,MedCausalX持续优于最先进的方法,提高了诊断一致性5.4个百分点,减少了幻觉超过10个百分点,并达到了顶级的空间定位IoU,从而为因果驱动的医学推理设定了新的标准。代码和数据集可在https://github.com/zhcz328/MedCausalX获得。
原文链接
基于注意力蒸馏的粗细领域增量学习在多光谱影像中采矿足迹分割
原标题:Coarse-to-Fine Domain Incremental Learning with Attentive Distillation for Mining Footprint Segmentation in Multispectral Imagery
作者:Alif Tri Handoyo; Vincent C. S. Lee; Rizka Widyarini Purwanto; Alex M. Lechner; Deanna Kemp; Muhamad Risqi U. Saputra
期刊:arXiv每日人工精选
出版时间:2026/05/28
摘要:利用遥感技术和深度学习自动绘制和分割全球采矿足迹对于监测采矿的社会环境风险和影响至关重要,然而其进展受到细粒度标注数据稀缺的阻碍。尽管具有粗略边界的大型数据集广泛可用,但由于显著的领域偏移,利用它们来改善细粒度分割是具有挑战性的。为了解决这个问题,我们提出了MineC2FNet,一个从粗到细的领域增量学习框架,利用丰富的粗数据来增强细粒度采矿足迹分割。MineC2FNet 采用了一种具有特征级和预测级注意力蒸馏的师生架构,在从粗域选择性地转移泛化知识的同时,利用有限的细粒度数据(fine domain)进行边界细化。我们进一步引入了一个经过专家验证的数据集,包含219张图像,这些图像具有精确的边界标注,并跨越不同的地理区域和商品。广泛的实验表明,与最先进的方法(包括领域适应和领域增量学习方法)相比,MineC2FNet 在有效处理领域偏移的同时实现了优越的性能。数据集和代码可在https://github.com/risqiutama/MineC2FNet获得。
原文链接
基于扩散的二维投影先验和带符号三维高斯的零样本CT超分辨率
原标题:Zero-shot CT Super-Resolution using Diffusion-based 2D Projection Priors and Signed 3D Gaussians
作者:Jeonghyun Noh; Hyun-Jic Oh; Won-Ki Jeong
期刊:arXiv每日人工精选
出版时间:2026/05/28
摘要:计算机断层扫描(CT)在临床诊断中非常重要,但获取高分辨率(HR)CT受限于辐射暴露风险。虽然基于深度学习的超分辨率(SR)方法在从低分辨率(LR)输入重建高分辨率(HR)CT方面显示出前景,监督方法需要配对的数据集,这些数据集往往不可用。零样本方法通过处理单个低分辨率输入来解决这一限制;然而,由于个体体积内的低分辨率信息有限,它们经常无法恢复精细的结构细节。为了克服这些限制,我们提出了一种新颖的零样本3D CT超分辨率框架,该框架将基于扩散的上采样2D投影先验整合到3D重建过程中。具体来说,我们的框架包含两个阶段:(1) 低分辨率CT投影超分辨,通过在大量的X射线数据上训练一个扩散模型来对低分辨率投影进行上采样,从而增强低分辨率输入中固有的稀缺信息。使用我们的新型负阿尔法混合(NAB-GS)三维高斯点扩散进行三维CT体积重建,该方法通过建模正负高斯密度来学习扩散生成的HR和上采样的LR投影之间的带符号残差。2)我们的框架在两个公共数据集上展示了优越的定量和定性性能,并且专家评估表明该框架具有临床潜力(4x)。
原文链接
基于可控性边界用于Chandrayaan-3月球着陆的实时重定位
原标题:Real-Time Retargeting Using Controllability Boundary for Chandrayaan-3 Lunar Landing
作者:Suraj Kumar; Debjyoti Chakrabarti; Aditya Rallapalli; Bharat Kumar GVP; Ashok Kumar Kakula
期刊:arXiv每日人工精选
出版时间:2026/05/28
摘要:本文介绍了为Chandrayaan-3月球着陆任务开发的实时重定向引导策略。基准指导生成近似燃油最优下降轨迹,而高级策略在名义目标位置变得不可行时使重新瞄准备用地点成为可能。重定位策略利用可控性边界的一种凸表示形式,允许快速可行性检查和实时目标更新。就作者所知,这代表了数据驱动重定向框架在操作性月球着陆任务中的首次应用。LLM_ERROR] LLM_JSON_PARSE_ERROR
原文链接
摄影测量重建方法与三维高斯点扩散法在路面粗糙度分析中的比较评估
原标题:Comparative evaluation of photogrammetric reconstruction methods and 3D Gaussian Splatting for road surface roughness analysis
作者:Marouane Elmegdar; Teng Xiao
期刊:arXiv每日人工精选
出版时间:2026/05/28
摘要:基于图像的三维重建为传统传感器技术提供了低成本的替代方案用于路面评估。本研究比较了四种重建流水线--COLMAP,Meshroom,Metashape 和 3D Gaussian Splatting(3DGS)--以评估它们从智能手机图像估计路面粗糙度的能力。所有点云都在CloudCompare中使用一致的工作流程进行处理,该工作流程包括定向对齐、分割、法线估计以及在0.2、0.4和0.6模型单位的邻域半径下的粗糙度计算。结果表明COLMAP提供了最高的微纹理敏感度,而Meshroom则在适度的粗糙度变化中实现了平衡的重建。Metashape 由于其内部过滤功能产生最平滑的几何形状,而 3DGS 捕捉可见的不规则性但表现出更高的噪声和更低的密度。对比表明,开源流水线可用于相对粗糙度评估,提供了一种低成本路面监测的实际方法。
原文链接
解析统一域中的雅可比网络:用于可微坐标变换的PINNs
原标题:Solved in Unit Domain: JacobiNet for Differentiable Coordinate-Transformed PINNs
作者:Xi Chen; Jianchuan Yang; Junjie Zhang; Runnan Yang; Xu Liu; Hong Wang; Tinghui Zheng; Ziyu Ren; Wenqi Hu
期刊:arXiv每日人工精选
出版时间:2026/05/28
摘要:基于物理的神经网络(PINNs)通过将物理定律嵌入到学习过程中提供了一个解决偏微分方程的强大框架。然而,在应用于具有不规则边界的领域时,PINNs 经常会出现不稳定和收敛缓慢的问题,这源于(1) 几何各向异性导致的归一化不一致,(2) 边界强制不准确,以及(3) 损失项竞争不平衡。常见的解决方法是将领域映射到常规空间。然而,传统的映射方法依赖于特定案例的网格,在预设的固定节点上定义雅可比矩阵,通过链式法则重新表述偏微分方程——使其与现代自动微分、张量基框架不兼容。为了填补这一空白,我们提出了JacobiNet,这是一种基于学习的坐标变换PINN框架,在端到端可微架构中统一了域映射和PDE求解。雅可比网(JacobiNet)通过自动微分实现直接雅可比计算,与下游PINNs共享计算图,从而避免了特定情况下的网格划分、显式雅可比计算/存储以及手动偏微分方程重写,同时解锁了几何编辑操作。分离物理建模与几何复杂性,JacobiNet (1) 解决了原始各向异性坐标中的归一化挑战,(2) 促进了边界条件的强制执行,(3) 缓解了损失项之间长期存在的不平衡问题。在各种PDE上进行评估,JacobiNet将相对L2误差从0.11-0.73降低到0.01-0.09,实现了平均15.6倍的精度提升。在形状各异的管状域中,JacobiNet 实现了毫秒级的未知几何映射推理,平均提高了预测准确度 3.65 倍,同时提供了超过 10 倍的速度提升——展示了强大的泛化能力、准确性及效率。
原文链接
OmniAID:解耦语义和工件以检测野外通用AI生成的图像
原标题:OmniAID: Decoupling Semantic and Artifacts for Universal AI-Generated Image Detection in the Wild
作者:Yuncheng Guo; Junyan Ye; Chenjue Zhang; Hengrui Kang; Haohuan Fu; Conghui He; Weijia Li
期刊:arXiv每日人工精选
出版时间:2026/05/28
摘要:真正通用的AI生成图像(AIGI)检测器必须同时在各种生成模型和不同的语义内容上进行泛化。当前的方法学习单一的、纠缠在一起的伪造表示,将与内容相关的缺陷与无关内容的艺术品混淆,并且进一步受到过时基准的限制。我们提出OmniAID,一个基于解耦的专家混合(MoE)架构的新型框架,该架构分离了:(1)通过可路由的专业语义专家在不同的内容领域中的语义缺陷,以及(2)通过固定通用缺陷专家从依赖于内容的缺陷中提取出无内容偏见的通用缺陷。两阶段训练策略首先通过领域特定的难例采样独立专业化专家,然后训练一个轻量级门控网络以实现有效的输入路由。通过将“生成的内容”(特定内容缺陷)从“如何生成”的问题(通用工件)明确分离出来,OmniAID 实现了稳健的泛化。我们还介绍了Mirage,这是一个大规模的现代数据集,包含一个现代训练集和一个具有挑战性的测试集。广泛的实验表明,OmniAID 超越了现有的检测器,建立了针对现代野外威胁的 AIGI 检测的新标准。代码可在https://github.com/yunncheng/OmniAID获得。
原文链接
MOO:一种用于牛再识别视角分析的多视图定向观测数据集
原标题:MOO: A Multi-view Oriented Observations Dataset for Viewpoint Analysis in Cattle Re-Identification
作者:William Grolleau; Achraf Chaouch; Astrid Sabourin; Guillaume Lapouge; Catherine Achard
期刊:arXiv每日人工精选
出版时间:2026/05/28
摘要:动物重新识别(ReID)面临视角变化的关键挑战,特别是在空地(AG-ReID)设置中,模型必须匹配在剧烈高度变化下的个体。然而,现有的数据集缺乏系统分析这些几何变化所需的精确角度标注。为了解决这个问题,我们引入了多视角定向观察(MOO)数据集,这是一个大规模的人工合成的AG-ReID牛个体数据集,从统一采样的视点捕获(标注图像)。利用这个受控数据集,我们量化了海拔的影响,并确定了一个关键的海拔阈值,在该阈值之上,模型在未见视图中的泛化性能显著更好。最后,我们在零样本和监督设置中验证了其在现实世界应用中的迁移性,展示了在四个真实世界的牛数据集上的性能提升,并确认合成几何先验有效地弥合了领域差距。这一数据集和分析共同为跨视角动物重识别模型的未来发展奠定了基础。MOO 在 https://github.com/TurtleSmoke/MOO 上公开可用。
原文链接
通过参考数据集的几何结构重新思考FID
原标题:Rethinking FID Through the Geometry of the Reference Dataset
作者:Yunghee Lee; Byeonghyun Pak
期刊:arXiv每日人工精选
出版时间:2026/05/28
摘要:弗雷歇 inception 距离(FID)被广泛用于评估图像生成器,但较低的 FID 并不一定对应更好的样本质量。我们表明这种不匹配在一定程度上取决于参考数据集的几何结构。在六个数据集上的控制研究中,分布密度和有效秩显著解释了随着样本质量提高FID是如何变化的。集中数据集倾向于产生更有利于FID趋势的结果,而更为分散的数据集可以使FID恶化,尽管样本质量更好。对精确度和召回率的归因以及使用替代特征空间和距离的消融实验支持相同的结论。这些结果表明,应该结合参考数据集的几何结构来解释分布度量,以便进行更可靠的基准测试。
原文链接
利用人工智能在教师和学生之间进行独立于结果的反馈调解以发现孤立学习者
原标题:Surfacing Isolated Learners with Outcome-Independent Mediation of Feedback between Teachers and Students Using AI
作者:Junsoo Park; Youssef Medhat; Htet Phyo Wai; Ploy Thajchayapong; Ashok K. Goel
期刊:arXiv每日人工精选
出版时间:2026/05/27
摘要:人工智能增强的课堂在评分结果公布之前就能生成丰富的教师和学生反馈,然而这些信号很难转化为及时的教学决策。我们提出一个可解释的决策层:一种透明机制,它在不使用成绩或事后结果标签的情况下对需要关注的课程主题进行排序。该方法结合了三种信号:学生学习困难的普遍性,学习者自我报告与观察到的困难之间的分歧,以及未解决的教师关注点。输出是一个按优先级排序的主题集合,并且每个主题都有决策记录解释其排名。在一门研究生计算机科学课程中(instructor interviews; survey responses),优先主题与教师关注点一致(top-5 overlap 3/5; Spearman),并与学生报告的主题难度(,)相符。多信号整合还揭示了一些仅通过单一信号来源无法识别的学习者(AUCvs. for gap prevalence alone)。反思性思维、寻求帮助和自我效能感提供了额外的证据表明学生的行为信号与学习相关联的概念相一致。这些发现初步表明,透明的协调机制可能有助于在反馈不完整的情况下支持人机共代理。
原文链接
一种基于LRP的剪枝在数据稀缺迁移学习中防止级联精度下降的精度感知扩展
原标题:An accuracy-aware extension to LRP-based pruning for CNNs to prevent cascading accuracy degradation in data-scarce transfer learning
作者:Daisuke Yasui; Toshitaka Matsuki; Hiroshi Sato
期刊:arXiv每日人工精选
出版时间:2026/05/27
摘要:卷积神经网络(CNNs),在大规模数据集如ImageNet上预训练的,被广泛用作特征提取器,从稀缺数据中构建特定任务的高精度分类模型。在这种情况下,由于数据稀缺,微调预训练的CNN很困难,需要使用固定权重。然而,在权重保持固定的情况下,许多不有助于目标任务的滤波器仍然保留在模型中,导致不必要的冗余和效率降低。因此,需要有效的方法通过剪枝不必要的推理滤波器来减小模型大小。为了应对这一问题,利用逐层相关性传播(LRP)的方法被提出。LRP 计量每个滤波器对推理结果的贡献,使得能够修剪相关性低的滤波器。然而,现有的基于LRP的剪枝方法已被观察到会导致精度下降级联。在这项研究中,我们引入了一种基于精度感知的剪枝控制机制,用于现有的LRP(局部相关性原理)基础滤波器剪枝方法,该机制通过使用类精度的谐均值动态调整剪枝率和剪枝顺序来抑制级联精度下降,并在小数据环境中压缩预训练模型的同时保持任务特定性能。我们证明了这种控制机制有效地缓解了级联精度下降,并且相比现有的基于LRP的剪枝方法实现了更高的分类精度,使VGG16的精度-剪枝率曲线下的面积均值(AUC)相较于传统基于LRP的方法提高了大约15%。
原文链接
可扩展的射频仿真在生成的4D世界中
原标题:Scalable RF Simulation in Generative 4D Worlds
作者:Zhiwei Zheng; Dongyin Hu; Mingmin Zhao
期刊:arXiv每日人工精选
出版时间:2026/05/27
摘要:射频(RF)感应已经作为一种强大的、保护隐私的替代方法出现,用于各种感知任务,以取代基于视觉的方法。然而,在动态和多样的环境中构建高质量的射频数据集仍然是一个重大挑战。为了解决这个问题,我们引入了WaveVerse,这是一个基于提示的可扩展框架,该框架能够从生成的室内场景中模拟出带有真实感射频信号的人类运动,这些运动由空间路径引导,从而在无需手动轨迹设计的情况下实现多样且可行的行为。WaveVerse 具备一种语言引导的4D世界生成器和一个基于物理的信号模拟器,能够实现在各种环境中对RF信号的真实模拟。它采用了一种保持空间和时间相位一致性的相干光线追踪器。模拟信号在相敏基准上表现出高保真度,并且与实际收集到的测量数据以及来自专有电磁求解器的仿真结果紧密一致。在用于数据增强时,WaveVerse 在下游任务如射频成像和人体活动识别中始终提升性能,其增益随着模拟数据量的增加而增长,并超越现有方法。代码及附加材料可在网页上获取。
原文链接
RHO:稳健的整体OSM基跨视图地理定位
原标题:RHO: Robust Holistic OSM-Based Metric Cross-View Geo-Localization
作者:Junwei Zheng; Ruize Dai; Ruiping Liu; Zichao Zeng; Yufan Chen; Fangjinhua Wang; Kunyu Peng; Kailun Yang; Jiaming Zhang; Rainer Stiefelhagen
期刊:arXiv每日人工精选
出版时间:2026/05/27
摘要:度量跨视图地理定位(MCVGL)旨在通过匹配地面和卫星图像来估计相机的3自由度姿态(位置和航向)在这项工作中,我们使用全景图和OpenStreetMap (OSM) 研究鲁棒的MCVGL,而不是针孔图像和卫星图像。为此,我们建立了一个大规模的MCVGL基准数据集,CV-RHO,包含超过2.7M张在不同天气和光照条件下以及传感器噪声下的图像。此外,我们提出了一种名为RHO的模型,该模型采用两分支Pin-Pan架构进行精确视觉定位。引入了一个Split-Undistort-Merge(SUM)模块来解决全景畸变问题,并设计了一种Position-Orientation Fusion(POF)机制来提高定位精度。大量的实验证明了我们CV-RHO数据集的价值以及RHO模型的有效性,在与最先进的基准相比时性能提升了高达20%。项目页面: https://github.com/InSAI-Lab/RHO.
原文链接
基于方位多普勒分解的Sentinel-1条带图增强深度学习迭代框架
原标题:A Deep Learning Iterative Framework for Sentinel-1 Stripmap Enhancement Based on Azimuth Doppler Decomposition
作者:Juan Francisco Amieva; Christian Ayala; Roberto Del Prete; Mikel Galar
期刊:arXiv每日人工精选
出版时间:2026/05/27
摘要:合成孔径雷达(SAR)图像能够实现全天候、昼夜地球观测;然而,由于斑点噪声和其他固有成像伪影,其解释仍然困难。哨兵-1(S1)构成了最广泛使用的星载SAR任务之一,提供系统性的全球覆盖,高时间分辨率,双极化成像以及免费的数据获取。在S1模式中,条带测绘(SM)提供最高的分辨率,然而斑点噪声和空间限制常常妨碍需要更精细空间细节的应用。这激发了有效图像增强策略的必要性。在这项工作中,我们提出了一种基于方位子孔径分解的S1 SM影像自监督增强框架。该方法利用子孔径重建与相应全孔径图像之间的物理一致性来生成配对训练数据,无需外部传感器、模拟真实情况或多时相堆栈。提出的框架集成了单帧和多帧学习,并纳入了一个迭代推理方案,该方案逐步提高图像质量。在真实S1 SM数据上的实验表明,所提出的方法在峰值信噪比(PSNR)和结构相似性(SSIM)方面始终优于广泛采用的自监督深度学习基准MERLIN,而MERLIN获得了更高的噪声等效亮度(ENL),突显了结构保真度和平滑斑点之间的权衡。总体而言,结果表明基于子孔径的监督提供了一种物理基础坚实、可重复且操作可行的方法,用于使用S1数据增强SAR图像。值得注意的是,所提出的方法可以扩展到其他SAR平台、极化方式和获取模式。
原文链接
GeRaF: 从射频信号重建神经几何
原标题:GeRaF: Neural Geometry Reconstruction from Radio Frequency Signals
作者:Jiachen Lu; Hailan Shanbhag; Haitham Al Hassanieh
期刊:arXiv每日人工精选
出版时间:2026/05/27
摘要:GeRaF 是第一个使用神经隐式学习从射频(RF)信号进行近程三维几何重建的方法。与RGB或LiDAR基于的方法不同,RF传感可以穿透遮挡物,但因其无透镜成像的特性而遭受低分辨率和噪声的影响。虽然RGB成像中的透镜将采样约束在一维射线上,RF信号却在整个空间中传播,引入了显著的噪声,并导致体积渲染的复杂度呈三次方增加。此外,射频信号通过镜面反射与表面相互作用,需要从根本上不同的建模。为了解决这些挑战,GeRaF (1) 引入基于滤波的渲染来抑制无关信号,(2) 实现了基于物理的射频体积渲染流水线,并且(3) 提出了一个新颖的无透镜采样和无透镜alpha混合策略,使得在训练期间进行全空间采样成为可能。通过多层感知机(MLPs)和可训练参数学习符号距离函数、反射率和信号功率,GeRaF 在真实环境中从射频信号重建毫米级几何形状方面迈出了第一步。
原文链接
回声领航员:通过尺度空间语义提示和可靠性门控记忆实现无训练超声视频分割
原标题:EchoPilot: Training-Free Ultrasound Video Segmentation via Scale-Space Semantic Prompting and Reliability-Gated Memory
作者:Ruiqiang Xiao; Zhaohu Xing; Yijun Yang; Zhenyan Han; Weiming Wang; Kaishun Wu; Lei Zhu
期刊:arXiv每日人工精选
出版时间:2026/05/25
摘要:超声视频分割在临床上很有价值但由于斑点噪声、弱边界以及快速解剖变形而难以实现。最近的可提示基础模型能够实现点引导分割,但它们直接部署在超声波中仍然不可靠:单个点提供的空间上下文不足以解决尺度模糊问题,并且贪婪内存更新会放大早期错误,导致严重的时序漂移。我们提出了EchoPilot,一个无训练需求的框架,用于在稀疏的第一帧交互下进行超声视频分割,只需要单点点击和解剖类别名称。EchoPilot 调度一个冻结的医学视觉-语言模型(VLM)用于语义定位,一个视觉基础模型(VFM)用于稠密几何特征提取,以及一个可提示的视频分割器用于掩码预测和传播。为了解决初始化的模糊性,我们提出了尺度空间语义提示法,首先通过无参数S.E.E.D.选择一个最优上下文视图。语义能量熵密度)准则,然后从密集的基础特征中几何精确地合成辅助点提示,无需额外的用户交互。为了减少传播漂移,进一步引入了可靠性门控内存更新,选择性地在不确定预测下冻结分割器的内存库,防止错误累积。我们还贡献了第一个动态胎儿胎盘超声视频分割数据集,包含671个标注帧。在三个超声视频数据集上,EchoPilot 在稀疏交互设置下达到了最先进的性能,始终优于无训练基线和微调专家。
原文链接
基于尺度感知注意力和特征扩散的不确定性估计增强乳腺MRI合成(SAFE-Diff)
原标题:SAFE-Diff: Scale-Aware Attention and Feature-Dispersive Diffusion with Uncertainty Estimation for Contrast-Enhanced Breast MRI Synthesis
作者:Tianyu Zhang; Xinglong Liang; Jarek van Dijk; Luyi Han; Chunyao Lu; Antonio Portaluri; Xinghe Xie; Yaofei Duan; Nika Rasoolzadeh; Xin Wang; Yuan Gao; Muzhen He; Yue Sun; Jonas Teuwen; Tao Tan; Ritse Mann
期刊:arXiv每日人工精选
出版时间:2026/05/25
摘要:高保真对比增强磁共振成像对于更安全高效的乳腺癌筛查具有临床价值,但由于病变纹理复杂及强化模式异质化,合成该技术仍然颇具挑战性。
原文链接
任意到任意:遥感任意模态统一转换(Any2Any)
原标题:Any2Any: Unified Arbitrary Modality Translation for Remote Sensing
作者:Haoyang Chen; Jing Zhang; Hebaixu Wang; Shiqin Wang; Pohsun Huang; Jiayuan Li; Haonan Guo; Di Wang; Zheng Wang; Bo Du
期刊:arXiv每日人工精选
出版时间:2026/05/25
摘要:多模态遥感图像提供了同一地理场景的互补观测,然而在实践中这样的观测往往是不完整的。现有的跨模态翻译方法将每一对模态视为一个独立的任务,导致二次复杂度并且限制了对未见过的模态组合的泛化能力。我们将任意到任意的翻译形式化为对场景共享潜在表示的推理,在此过程中不同的模态对应于同一底层语义的部分观察。基于此公式化方法,我们提出Any2Any,一个统一的潜在扩散框架,该框架将异构输入投影到几何对齐的潜在空间中。这样的结构执行带有共享骨干的锚定潜在回归,解耦了模式特定表示学习与语义映射。此外,使用轻量级的目标特定残差适配器来校正系统性的潜在不匹配,而不增加推理复杂度。为了在稀疏但相连的监督下支持学习,我们引入了RST-1M,这是第一个包含五种传感模式配对观测值的百万级遥感数据集,提供了任意到任意翻译的监督锚点。实验跨越了14种翻译任务显示,Any2Any始终优于成对翻译方法,并表现出强大的零样本泛化能力到未见过的模态对。代码和模型可在https://github.com/MiliLab/Any2Any获得。
原文链接

