给 AI 一张照片,指定新机位,它能精准“脑补”出新视角画面!快手可图联合南洋理工开源 MetaView,重塑单图新视角合成标杆。
近日,快手可图团队联合南洋理工大学、港科大(广州)提出了一种基于扩散模型的单图新视角合成(NVS)框架 MetaView,针对现有方法在大视角变化下易出现几何崩坏或空间感缺失的痛点,MetaView 巧妙地将“隐式几何先验”与“显式尺度锚定”相结合。它无需繁琐的 3D 重建流水线,即可在极大视角变化下保持卓越的几何一致性与精确的相机可控性。目前,该项目已全面开源代码、模型权重及在线 Demo,为 3D 生成与具身智能仿真提供了强有力的新基座。
相关链接
-
论文 PDF:https://arxiv.org/pdf/2607.12000 -
代码:https://github.com/KlingAIResearch/MetaView -
主页:https://prototypenx.github.io/MetaView -
试用:https://huggingface.co/spaces/hugging-apps/metaview-lightning
论文介绍
新视角合成(NVS)旨在根据单张 2D 图像和指定的相机参数,生成对应新视角的画面。其核心难点在于:2D 图像在拍摄瞬间已丢失深度与遮挡信息,AI 必须“脑补”出合理的 3D 空间结构。 现有方案往往陷入两难:
-
显式 3D 重建派:先重建点云或网格再渲染。视角变化较小时效果尚可,但一旦视角跨度大,建模遗漏的细节就会暴露,导致画面模糊、扭曲甚至破洞。 -
隐式生成派:直接学习视角到画面的映射。虽然灵活,但模型缺乏真实的 3D 空间感知,容易导致方向感错乱和几何不一致。 MetaView 的核心洞察在于:无需在非此即彼中妥协,而是通过引入轻量且必要的 3D 线索,在生成灵活性与几何严谨性之间找到完美平衡。
方法概述
MetaView 基于 MM-DiT 架构,为预训练图像生成模型注入了两把关键的“空间厨具”:
隐式几何先验注入 (Implicit Geometry Priors)
团队利用前馈几何感知网络提取中间层特征,这些特征包含了丰富的空间关系“直觉”。通过非侵入式的平行注意力流(Split Stream),MetaView 将这些隐式几何信号注入 DiT 的自注意力机制中,在保留基础模型强大语义生成能力的同时,赋予了其精准的 3D 空间感知,且不限制重建流水线。
尺度感知的位置编码 (Scale-Aware RoPE)
针对大视角生成中常见的“尺度漂移”(Scale Drifting)顽疾(即 AI 对“移动 1 米”缺乏绝对物理尺度概念),MetaView 引入度量深度(Metric Depth)作为锚点。通过修改旋转位置编码(RoPE),为其分配专属的 Z 轴子空间,显式对齐图像的物理尺度与相机位姿尺度,确保无论视角如何旋转,场景中物体的大小比例始终稳定。
实验结果
-
全面刷榜 SOTA:在 DL3DV、RealEstate10K 和 Sekai-Real-Walk-HQ 三大权威数据集上,MetaView 与 7 个前沿基线模型(如 ViewCrafter, GEN3C, Voyager 等)进行了对比。在 12 项核心评估维度中,MetaView 强势斩获 11 项 SOTA。
-
首创 DMD 评估指标:针对极端视角变化下传统指标(如 PSNR)易偏好模糊伪影的问题,团队引入了 密集匹配距离 (Dense Matching Distance, DMD)。该指标能更准确地评估空间对齐度并与人类偏好保持一致。MetaView 在 DMD 指标上大幅领先(数值越低越好),例如在 DL3DV 上达到 10.29,远超次优的 20.01。
-
卓越的泛化能力:在极具挑战的单图大视角变化场景下,MetaView 展现出极强的结构稳定性和细节保真度,有效避免了传统方法的破洞与形变
结论
MetaView 打通显式重建与隐生成方案的固有短板,隐式几何特征 + 尺度感知 RoPE 两大创新,彻底解决单图转视角漂浮、尺度漂移两大行业痛点。同时推出更贴合真实观感的 DMD 评测标准,完善新视角合成评估体系。完整开源代码、模型权重与在线 Demo 降低科研与创作门槛,室内设计、影视、VR 内容、机器人仿真领域均可落地。
感谢你看到这里,添加小助手 AIGC_Tech 加入官方 AIGC读者交流群,下方扫码加入 AIGC Studio 星球,获取前沿AI应用、AIGC实践教程、大厂面试经验、AI学习路线以及IT类入门到精通学习资料等,欢迎一起交流学习💗~

