大数跨境

一个场景吃掉700MB显存!3DGS存储焦虑怎么解?这篇综述划了五个方向

一个场景吃掉700MB显存!3DGS存储焦虑怎么解?这篇综述划了五个方向 量子位
2026-07-27
13
导读:3DGS的未来,更取决于光栅化器如何与算法、内存和硬件协同演进。

导读

过去三年,3D Gaussian Splatting(3DGS)已成为实时 3D 场景重建与新视角合成的主流方案。然而,当应用场景从静态房间扩展至城市级动态环境,并部署于移动端或边缘设备时,显存、带宽与功耗成为新的制约瓶颈。限制 3DGS 上限的关键,往往在于由投影、分块、排序、混合及梯度回传构成的整条光栅化流水线。

近日,香港科技大学(广州)、南洋理工大学、阿里巴巴集团及其域创新科技联合发布综述《3D Gaussian Splatting Rasterization: A Survey》。该研究跳出传统按下游任务分类的框架,将可微光栅化器视为核心计算引擎,从底层数据流视角重新梳理技术版图,旨在回答"3DGS 的瓶颈究竟在哪里”以及“如何在系统层面实现效率与质量的共赢”。

从“做什么”转向“在哪里改”:重构 3DGS 技术演进逻辑

现有综述多围绕应用场景展开,虽便于定位特定任务方案,却容易掩盖不同工作背后的共性难题。无论是稀疏视角重建、抗锯齿还是大场景渲染,其本质均涉及投影误差、可见性排序、透明度混合及梯度传播等核心问题。

联合团队提出“光栅化中心”分类法,不再单纯关注方法的应用领域,而是聚焦于其对流水线具体环节的改动、缓解的系统瓶颈,以及对画质、速度、显存和存储成本的综合影响。

△ 论文提出的三层光栅化分类体系:表示与优化、光栅化流水线、场景驱动扩展。

该技术版图划分为三个层级:

  • 表示与优化层:涵盖高斯内核参数化、几何投影、致密化、正则化、剪枝及压缩;
  • 光栅化流水线层:聚焦α混合、特征场与着色、硬件线程调度、可见性及排序机制;
  • 场景驱动扩展层:探讨底层改动如何支撑 4D 动态场景、超大规模环境、稀疏视角、无位姿输入及 3DGS-SLAM 等复杂应用。

拆解实时渲染“黑盒”:五大环节与对应瓶颈

标准 3DGS 的高速渲染依赖于高度优化的基于瓦片(Tile-based)可微光栅化流水线。其流程包括:将 3D 高斯基元投影至二维屏幕,判定覆盖的图像分块并复制至对应瓦片;在瓦片内按深度排序,利用 CUDA 线程块逐像素完成α混合;训练阶段则沿此路径反向传播梯度,更新高斯位置、尺度、旋转、不透明度及球谐函数颜色等参数。

△ 基于瓦片的光栅化流程:投影后复制到多个瓦片,按深度排序,再进行逐像素α混合。

流水线各环节均面临特定工程挑战:投影阶段需处理混叠与几何畸变;瓦片分配引发大量复制与内存访问;逐瓦片深度排序增加计算延迟并可能导致画面跳变;α混合需兼顾透明度、语义特征与物理材质;反向传播则依赖大规模梯度累积与频繁原子操作。该综述的核心价值在于将这些分散的优化方法纳入统一框架,系统评估其作用位置、性能收益与额外代价。

四大典型问题与光栅化优化落地策略

投影与深度:二维化带来的近似误差

将 3D 高斯压缩为二维虽增强了表面表达,但引入了深度近似误差。相机旋转可能改变光线方向上的相对次序,导致可见性翻转和画面跳变。

△ 3D 高斯压缩为 2D splat 后的深度简化问题。

瓦片分配:削减无效复制与访存

宽松的包围区域会导致大量未与椭圆相交的高斯被错误复制至瓦片中。Speedy-Splat 等方法通过 SnugBox 和 AccuTile 策略逐步收紧候选区域,从源头减少无效分配与内存访问。

△ 不同瓦片分配策略。SnugBox 与 AccuTile 逐步缩小候选区域,减少无效高斯复制。

α混合:迈向体渲染一致性

传统 3DGS 利用高斯在采样点的函数值近似不透明度。Vol3DGS 改为沿相机光线积分一维高斯密度,使α值与真实覆盖更一致,显著提升了半透明结构与几何表面的稳定性。

△ Vol3DGS 沿相机光线积分高斯密度,计算体渲染一致的α。

致密化:控制高斯数量膨胀

标准致密化策略易导致像素数量急剧膨胀。Taming 3DGS 结合多视角显著性、梯度及高斯属性进行评分,并通过可预测增长曲线控制新增数量,实现了训练前即可设定的模型预算。

△ Taming 3DGS 通过显著性评分和可预测增长曲线控制致密化预算。

统一评测:寻求效率与质量的共赢

为建立公平的比较基准,联合团队在 Mip-NeRF 360、Tanks&Temples 和 Deep Blending 三个数据集的 11 个场景中,使用统一实现的 3DGS 光栅化器评估了 27 种代表性方法。

实验表明,不存在全指标领先的“万能冠军”,但在特定子方向上存在专精方案:

  • 灵活的几何内核通常能改善重建质量;
  • 多种效率方法可在微小质量损失下显著减少高斯数量;
  • 部分方法将训练时间压缩至 5 分钟以内;
  • 特定压缩方法在部分数据集上实现超 8 倍的高斯数量压缩,且重建指标正向提升。

整体趋势显示,多数效率导向方法可减少约 40%—70% 的像素数量,但极端压缩伴随质量风险。存储方面,标准 3DGS 全分辨率场景约占 700—800MB,而 HAC++、PyramidGS 等方法在特定设置下可实现 15—20 倍压缩,层级或锚点式方案通常可达 3—5 倍缩减。

从理论到实践:构建可复现的系统比较框架

为降低复现门槛,团队开源了 Github 仓库,提供统一的训练、渲染和评测流程。该框架支持数据集配置、资源检查及多维度指标汇总,并持续接入新方法。

对研究者而言,该框架有助于快速定位工作的改进环节(表示、投影、排序、混合或存储);对工程团队而言,它提供了一份贴近部署现实的检查清单,强调需综合考察训练时长、峰值显存、高斯数量、排序延迟、模型体积及设备能耗,而非仅关注重建指标。

未来展望:从“视觉更好”迈向“系统更优”

基于光栅化分析,论文提出五个关键发展方向:

  • 摆脱逐瓦片强制排序,探索免排序(Sort-free)或顺序鲁棒的可见性建模;
  • 原生支持 4D 动态与在线更新的动态可见性光栅化;
  • 面向移动 GPU、张量核心及专用加速器的硬件感知像素设计;
  • 单次前向同时输出颜色、深度、法线、语义及材质的统一多输出高斯点;
  • 建立覆盖显存、排序延迟、压缩率和能耗的系统级标准评测体系。

3DGS 技术的下一阶段竞争将下沉至系统层:谁能以更少的排序、更低的访存和更稳定的梯度,在同等硬件预算下承载更大场景、更多属性及更复杂动态。3DGS 的未来不仅取决于高斯表示的设计,更取决于光栅化器如何与算法、内存和硬件协同演进。

作者团队

本综述由横跨 3D 视觉研究、基础模型研发及产业化部署的联合团队完成,成员来自香港科技大学(广州)、南洋理工大学、阿里巴巴集团及其域创新科技。

  • 赵北震:香港科技大学(广州)博士生,主攻 3D/4D 重建与大规模场景算法压缩加速。
  • 付博亦:香港科技大学(广州)硕士生,研究方向为空间智能与 3D/4D 场景重建。
  • 于思成:香港科技大学(广州)博士生,专注 3D/4D 场景重建和生成。
  • 王子建:香港科技大学(广州)硕士生,研究 3D 重建/生成与世界模型。
  • 赵开勇:其域创新科技创始人兼 CEO,拥有 16 年 AI 与三维空间计算经验,国内早期 CUDA 推广者,长期推动 3DGS 产业化。
  • 吴鹏程:南洋理工大学高级研究科学家,研究领域涵盖机器学习、计算机视觉及联邦学习等。
  • 王浩:香港科技大学(广州)助理教授,曾在 TikTok 和地平线机器人任职,主攻多模态数据感知与生成算法。
  • 许主洪:阿里巴巴集团副总裁、IEEE Fellow,曾任 Salesforce Research Asia 创始董事总经理,在多模态人工智能领域发表数百篇论文。
  • 熊辉:香港科技大学(广州)讲座教授、AI+ 实验室主任,AAAS/IEEE Fellow,曾任百度研究院副院长,在数据挖掘与人工智能领域成果丰硕。

论文链接:https://www.preprints.org/manuscript/202607.0776
代码仓库:https://github.com/3DAgentWorld/Advanced3DGS

【声明】内容源于网络
0
0
量子位
各类跨境出海行业相关资讯
内容 16308
粉丝 1
量子位 各类跨境出海行业相关资讯
总阅读343.4k
粉丝1
内容16.3k