大数跨境

ACM Transactions on Graphics -2026年最新论文14篇

ACM Transactions on Graphics -2026年最新论文14篇 AI新文
2026-09-15
4

由于微信公众号开始试行乱序推送,为了让您在第一时间获取AI新文,请将"AI新文"设为星标。

Q-DRFormer:具有逐步细化的查询位置映射流预测用于文档校正

原标题:Q-DRFormer: Query-Position Mapping Flow Prediction with Progressive Refinement for Document Rectification

作者:Jiajie Li;Jiaxin Zhang;Jianwei Guo;Qiuli Zhang;Xin Zheng;Qian Yin;Wenyi Zeng

期刊:ACM Transactions on Graphics

出版时间:2026/09/10

摘要:文档图像校正是为了修复受到几何失真损害的图像。现有的U形编码器-解码器方法依赖于层次上采样操作来恢复稠密的流场,这在单个网格位置对位移提供的控制有限,导致空间不一致性和细节恢复不佳。为了解决这个问题,我们提出了Q -DRFormer,一个将校正表述为集合预测任务的新颖框架。具体而言,我们设计了一组查询,其中每个查询对应流场网格中的一个位置,并负责回归一个二维锚点,该锚点指示扭曲输入中的采样位置。这种一对一设计建立了一个确定性的查询位置映射,使得可以实现细粒度控制,并提高预测流场的空间一致性。利用这种确定性对应关系,我们进一步提出了一种渐进式流细化策略,通过逐层偏移预测逐步精炼锚点以增强细粒度恢复。此外,鉴于现有研究中缺乏面向下游任务的评估,我们将校正方法应用于场景表格检测,并贡献了一组真实世界的测试集以及相应的评价指标,以填补这一空白。大量的实验表明,Q-DRFormer优于现有方法。代码可在https://github.com/vvvvvair/Q-DRFormer获得。


原文链接



ShapeLib:使用大型语言模型设计程序化三维形状抽象库

原标题:ShapeLib: Designing a library of programmatic 3D shape abstractions with Large Language Models

作者:R. Kenny Jones;Paul Guerrero;Niloy Mitra;Daniel Ritchie

期刊:ACM Transactions on Graphics

出版时间:2026/08/22

摘要:我们介绍了ShapeLib,这是第一种使用大型语言模型(LLMs)先验来设计程序化3D形状抽象库的方法。我们的系统接受两种形式的用户提供的设计意图:用于描述要包含在输出库中的功能的高级别文本描述以及一组少量的范例形状。我们发现了一个抽象库,它通过一个引导的大语言模型工作流程匹配了这一设计意图,该工作流程首先提出应用和实现函数的不同方式,然后验证这些函数有助于表示种子集形状。To extend beyond the seed set, we develop library-specific recognition networks that map shapes (represented as primitives, voxels, or point clouds) to programs that use these newly discovered abstractions.在多个建模领域(split by shape category),我们发现当大型语言模型与几何推理仔细结合时,可以引导它们生成能够跨形状分布泛化的抽象函数库。我们的框架朝着实现长期存在的形状分析愿望迈出了一步,即发现可重用的、程序化的形状抽象,同时揭示出可解释的、语义对齐的接口。我们的广泛评估表明,ShapeLib 在概括性、易用性和在操作下保持合理性方面优于先前的抽象发现工作。最后,我们证明了ShapeLib的抽象函数解锁了一系列下游应用,结合LLM对形状程序的推理与几何处理工具来支持形状编辑和生成工作流。


原文链接



最差情况非参数形状优化

原标题:Worst-Case Non-parametric Shape Optimization

作者:Yu Xing;Xiaoxuan Wang;Zherong Pan;Xifeng Gao;Lin Lu

期刊:ACM Transactions on Graphics

出版时间:2026/08/17

摘要:低成本制造硬件的进步使没有经验的用户能够内部创建3D产品原型然而作为一个常见问题,尽管这些生成的三维模型具有美学吸引力,通常缺乏实际使用所需的结构完整性。尽管在自动化形状调整技术方面已经进行了大量研究,这些方法依赖于额外的输入,例如参数化表示和特定的外部载荷条件,使得它们对于初学者用户不可用。为了解决这一挑战,我们提出了一种形状优化技术,该技术不需要额外的输入。从一个由一般三维网格表示的目标形状开始,我们的方法旨在生成一个既视觉上一致又结构上更坚固的优化形状。


原文链接



规范等变胶囊网络

原标题:Gauge Equivariant Capsule Networks

作者:Lisha Wang;Wenrui Dai;Junni Zou;Ziyang Zheng;Shaohui Li;Chenglin Li;Hongkai Xiong

期刊:ACM Transactions on Graphics

出版时间:2026/08/15

摘要:规范等变网络正在出现用于流形上的等变表示学习。然而,现有的规范等变网络面临着困境,在保证任意连续规范变换下的等变性的受限SO(2)不可约表示和在有限离散化规范变换下具有有限等变性的增强CN正则表示之间选择。在本文中,我们提出了一种用于流形的规范等变胶囊网络(GECN),该网络保证了SO(2)中的数学上可证明的规范等变性而不牺牲表达能力。我们开发了一种新颖的规范等变胶囊(GEC),利用空间胶囊动态路由算法在流形局部区域中同时挖掘胶囊级和空间依赖性,并基于SO(2)的真实不可约表示实现规范等变表示。此外,我们提出了一种用于流形的规范等变胶囊网络(GECN),通过设计初始姿态提取器,基于GEC的残差块以及基于GEC的规范等变池化和上采样。我们证明了GECN具有通用性,可以统一现有的规范等变网络,并在理论上证明它对SO(2)中的连续规范变换是等变的。实验结果表明,GECN在可变形形状分类和分割以及球形图像和三维物体的分类任务中达到了最先进的性能(无需主曲率方向)。


原文链接



可控制能量的时间积分法用于弹动力学接触

原标题:Energy-Controllable Time Integration for Elastodynamic Contact

作者:Kevin You;Juntian Zheng;Minchen Li

期刊:ACM Transactions on Graphics

出版时间:2026/08/12

摘要:弹性体的动力学模拟是工程和计算机图形学中的一个长期任务。在图形学中,由于其在大时间步长下的稳定性,隐式欧拉法和BDF2等数值积分器更受青睐,但它们往往会无控制地耗散能量。相比之下,像隐式中点法这样的辛方法可以保持能量守恒但不是无条件稳定的,并且在处理中等刚性问题时会失败。为了解决这些限制,我们提出了一类数值积分器用于哈密顿问题,这类积分器在线性问题上是辛的,在非线性问题上具有更优越的稳定性。通过这种方法,我们推导出一种可控能量的时间积分器A-search,它是隐式欧拉法的一个简单修改版本,能够跟随用户指定的能量目标,从而在保持稳定性和物理保真度的同时实现对能量耗散或守恒的灵活控制。我们的方法可以无缝集成到屏障型能量中,并且能够提供无反转和无穿透的保证,使其非常适合处理大变形和复杂碰撞。广泛的材料参数和场景评估表明,A-search倾向于保持低频运动的能量而不是耗散能量,并且在相似的总运行时间下,A-search通过维持能量优于传统方法如BDF2,从而产生更令人满意的视觉模拟效果。


原文链接



实时产品路径引导使用辐射级联(RCPG)

原标题:RCPG: Real-Time Product Path Guiding Using Radiance Cascades

作者:Julius Ikkala;Pekka Jääskeläinen;Markku Mäkitalo

期刊:ACM Transactions on Graphics

出版时间:2026/08/12

摘要:我们提出了一种名为Radiance Cascade Path Guiding (RCPG)的实时产品路径引导方法,该方法在质量和性能上都优于之前的最先进的实时路径引导方法。我们推导出光辐射区间界限,使得入射光的方向不会因光辐射级联而被误表。这使我们能够利用辐射级联的层次结构,在采样过程中考虑入射辐射与材料BSDF的乘积。也可以计算出RCPG采样在任意给定方向的概率分布函数,使其与其他采样方法(如多重重要性采样(MIS)和无偏ReSTIR)兼容。


原文链接



基于同时先验的神经帧流传输框架用于端云协同渲染

原标题:A Neural Frame Streaming Framework with a Simultaneous Prior for End-cloud Collaborative Rendering

作者:Hangming Fan;Yazhen Yuan;Yongyu Ding;Yuwen Chen;Hujun Bao;Yuchi Huo;Rui Wang

期刊:ACM Transactions on Graphics

出版时间:2026/08/08

摘要:云渲染最近获得了广泛关注,因为它通过在云端分配大部分的渲染任务来减轻客户端的计算成本,并将渲染好的帧压缩后流传输到客户端设备进行显示。然而,云渲染的可访问性仍然受到传输高分辨率帧的网络通信成本的限制。tool_call>คณะกรรม員:你的回答中存在一些小问题,包括标点符号使用不当以及未完全遵循指令要求。请根据指示重新调整答案,确保符合所有给出的要求。请特别注意标点符号的正确使用,并且在处理包含多个项目的列表时,要严格按照原句结构进行翻译。以下是需要你修正的内容示例:通过将神经网络引入视频压缩算法中,最先进的方法已经实现了比现有视频编码器如H.265更好的压缩率。然而,它们都不是专门为渲染内容设计的,在当今的渲染管道中,运动向量、基色和法线等特性一应俱全。我们提出了一种新的端云协作渲染和流媒体框架,在终端和云端同时生成这些辅助特征,并利用这种先验信息指导帧压缩的编码和解码。我们的框架可以使低端设备具备高端视觉效果,并降低建立高速网络连接的成本。结果表明,我们的流处理管道非常高效,并且与标准视频编解码器和其他神经压缩方法相比实现了更高的压缩比。


原文链接



具有保特征和边界功能的高效偏置网格生成

原标题:Efficient Offset Mesh Generation with Preserved Features and Boundaries

作者:Canjia Huang;Juan Cao;Bailin Deng;Jiangbo Huang;Ge Yin;Zhonggui Chen

期刊:ACM Transactions on Graphics

出版时间:2026/07/27

摘要:网格偏置在CAD/CAM应用中起着核心作用。本文介绍了一种从三角网格生成高精度且主要拓扑正确的偏置网格的有效方法,采用直接偏置和点表示法。通过沿多个法线偏移输入三角网格的采样点,我们在偏移表面的超集上创建点。后续特征增强捕获并增强了点集上的特征,便于基于偏置表面和特征的定制受限功率图重构。在公共数据集上的基准测试,以及与最先进的方法进行全面比较,展示了我们方法的准确性、有效性和鲁棒性。实验结果展示了其处理多种模型的能力,并支持任意偏移距离,在保持锐利特征和开放边界的同时,生成主要拓扑正确的偏移网格,具有小的近似误差——即使在薄板和薄管状结构等挑战性区域中也能实现。


原文链接



投影的陷阱:增量势能牛顿型求解器的研究

原标题:Pitfalls of Projection: A study of Newton-type solvers for incremental potentials

作者:Andreas Longva;Fabian Löschner;José Fernández-Fernández;Egor Larionov;Uri Ascher;Jan Bender

期刊:ACM Transactions on Graphics

出版时间:2026/07/22

摘要:来自时间积分器如向后欧拉的非线性系统有时可以重新表述为优化问题,称为增量势能。我们通过全面的实验分析表明,广泛使用的Projected Newton方法,它依赖于Hessian贡献的无条件半正定投影,通常表现出比经典Newton方法更低的收敛速度。我们展示了分辨率、元素顺序、投影方法、材料模型和边界处理等因素如何影响Projected Newton和Newton的收敛性。


原文链接



基于动态运动控制的混合模仿学习(HIL)

原标题:HIL: Hybrid Imitation Learning for Dynamic Athletic Control

作者:Jiashun Wang;Yifeng Jiang;Haotian Zhang;Chen Tessler;Davis Rempe;Jessica Hodgins;Xue Bin Peng

期刊:ACM Transactions on Graphics

出版时间:2026/07/15

摘要:基于数据的方法利用深度强化学习已成为开发控制器的主导范式,这些控制器使物理模拟角色能够产生自然的人类行为。然而,这些数据驱动的方法往往难以适应新的环境,并组合多样化的技能来执行更复杂的与环境互动的任务。为了解决这些挑战,我们提出了一种混合模仿学习(HIL)框架,该框架结合了运动跟踪(用于精确的技能复制)与对抗性模仿学习,以增强适应性和技能组合能力,从而实现对高度体育行为的稳健动态控制。这种混合学习框架通过平行多任务环境和统一的观察空间实现,并利用目标条件表示促进知识在混合平行环境中共享。我们展示了HIL在跑酷风格障碍穿越任务和航向控制任务上的有效性。我们的框架能够实现一个统一的控制器,它不仅保持了参考运动数据的自然性,而且还有效地推广到了具有挑战性的新环境中。评估结果表明,在程序生成的任务和基准线中,我们的方法提高了运动质量,增加了技能多样性,并且在任务完成方面达到了与以前基于学习的方法相当的水平。结果最佳的可视化方式通过https://jiashunwang.github.io/HIL实现。


原文链接



高斯点染中物理准确的浅景深闭式卷积

原标题:Closed-Form Convolution for physically-accurate defocus in Gaussian Splatting

作者:Weichen Dai;Kangcheng Ma;Wanzeng Kong

期刊:ACM Transactions on Graphics

出版时间:2026/07/10

摘要:最近在三维高斯点喷射(3DGS)方面取得的进步实现了令人印象深刻的逼真效果;然而,其基于完美锐利且全部聚焦图像的基本假设在现实场景中常常失效。镜头引起的离焦模糊,在自然拍摄中很常见,可以显著降低重建质量。先前的工作虽然试图解决这个问题,现有的解决方案要么依赖于隐式去模糊技术,限制了拍摄后的艺术灵活性,要么采用物理上不准确的模糊近似,特别是在大光圈下。我们提出了一种渲染管线,该管线无缝地将物理准确且可微分的景深模型整合到三维高斯点喷射(3DGS)光栅化过程中。我们的方法的核心是通过将每个投影的三维高斯函数与由相机弥散圆(CoC)决定的核卷积来建模景深。为了保持效率,我们利用误差函数(erf)为此卷积推导出封闭形式的解析解。我们的方法进一步扩展到各向异性高斯,并通过将其分解为不重叠的矩形来近似任意多边形孔径。因此,我们的方法能够从模糊的多焦点图像集实现高保真度的三维重建,同时支持现实的拍摄后效果,例如重新聚焦和光圈操控。在散焦对焦基准测试中显示,我们的技术能够产生更清晰的对焦细节,并且提供更平滑的散焦过渡,其结果可与当前最佳方法相媲美。


原文链接



鲁棒约束四面体化(无Steiner点边界)

原标题:Robust Constrained Tetrahedralization with Steiner-point-free Boundaries

作者:Yifu Wang;KaiXin Yu;Haonan Ni;Bohan Wang;Hang Si;Jianjun Chen

期刊:ACM Transactions on Graphics

出版时间:2026/07/09

摘要:我们介绍了一种稳健的算法,用于生成严格符合有效且不自相交的分段线性复合体(PLCs)几何和连通性的四面体网格。此任务中的一个关键挑战是控制Steiner点的位置。虽然优化斯坦纳点的位置是NP难题,消除边界斯坦纳点对于保持边界拓扑结构和界面连通性仍然具有实际重要性。为了解决这一挑战,我们引入了翻转硬配置(FHCs)的概念,该概念描述了在仅使用翻转操作的情况下无法进行约束恢复的局部情况。基于这一观察,我们通过FHC引导的内部Steiner点插入、鲁棒边界Steiner点重新定位以及浮点运算下的局部网格优化增强了经典的边界恢复流水线。这些机制减少了对边界斯坦纳点的依赖,并减轻了由于有限精度舍入导致的数值故障。我们对来自Thingi10K数据集的全部5,468个有效模型评估了所提出的算法。在这些实验中,实现成功地为所有模型生成了受约束的四面体剖分,并且所生成的所有网格都包含不含Steiner点的边界,同时保持输入PLC拓扑。


原文链接



可导向运动重定向通过运动释义(DMP)

原标题:DMP: Directable Motion Retargeting through Motion Paraphrasing

作者:Sunmin Lee;Davis Rempe;Yifeng Jiang;Haotian Zhang;Tingwu Wang;Jungdam Won;Xue Bin Peng

期刊:ACM Transactions on Graphics

出版时间:2026/07/09

摘要:创建多样且逼真的人体动作是计算机动画的基础支柱,在游戏、电影以及AR/VR中有着广泛的应用。虽然运动捕捉对于捕获不同体型的运动轨迹是一项宝贵的工具,但为各种角色获取独特的运动数据往往费用高昂。运动重定向通过将现有的动作适应不同的角色形态来解决这一限制,然而,现有方法通常在动作逼真度、用户控制和适应艺术需求方面存在权衡。在这项工作中,我们提出了可导向运动同义替换(Directable Motion Paraphrasing,DMP),这是一种基于运动同义替换概念的新型运动重定向框架,类似于文本同义替换,在此过程中,运动的核心语义得以保持,同时允许表达性的用户导向变化。我们的框架构建了一个大规模的动作同义表达数据集,该数据集捕捉了不同体型的人类动作的多样性,并训练了一个基于扩散的生成模型,该模型学习动作中的不变性和变异性。为了在推理过程中实现用户控制,我们引入了一种灵活的机制来指定空间-时间约束,例如关节位置、旋转以及物体交互,这些可以通过掩码修复和损失引导纳入生成过程。我们通过各种示例展示了该框架的有效性,表明了其能够生成符合动画流水线艺术需求的逼真、多样且可控的目标运动。大量的实验展示了系统的灵活性、运动合理性以及可控性,突显了其作为直观且高质量运动重定向工具的潜力。


原文链接



Hi-SPAD:使用单光子相机进行视频速率高光谱成像和推理

原标题:Hi-SPAD: Video-Rate Hyperspectral Imaging and Inference with Single-Photon Cameras

作者:Haejoon Lee;Mohit Gupta;Vijayakumar Bhagavatula;Aswin Sankaranarayanan

期刊:ACM Transactions on Graphics

出版时间:2026/07/08

摘要:我们介绍了Hi-SPAD,一种结合推扫式架构与单光子雪崩二极管(SPAD)传感器的高光谱成像系统,能够在被动环境光下实现高空间、光谱和时间分辨率。虽然基于SPAD的光谱传感和推扫式配置分别已被研究过,我们的关键贡献在于结合这些技术的同时解决SPAD特有的挑战。我们提供了一个理论分析表明,尽管SPAD测量具有高度量化和非线性的特性,随着测量次数的增加,可以实现材料分类和全光谱重建,并且误差界限呈指数级减小。这些结果通过模拟和我们实验室原型的真实数据得到了验证,确立了光子计数高光谱视频在动态场景中的可行性。此外,我们评估了支持在被动环境照明下稳健成像的Hi-SPAD重建方法。我们自制的Hi-SPAD相机能够在环境光下每秒26帧的速度生成具有123个光谱通道的高光谱视频。


原文链接




【声明】内容源于网络
0
0
AI新文
AI顶刊顶会新论文一号通,每天推送,助您时刻站在AI研究最前沿。包括:人工智能基础、交叉应用、脑认知与类脑智能、机器学习、模式识别与计算机视觉、自然语言处理、知识工程与数据挖掘、跨媒体与人机交互、智能机器人与系统、智能芯片与计算等。
内容 262
粉丝 0
AI新文 AI顶刊顶会新论文一号通,每天推送,助您时刻站在AI研究最前沿。包括:人工智能基础、交叉应用、脑认知与类脑智能、机器学习、模式识别与计算机视觉、自然语言处理、知识工程与数据挖掘、跨媒体与人机交互、智能机器人与系统、智能芯片与计算等。
总阅读5.1k
粉丝0
内容262