大数跨境

浙大 × 字节 × 港中深最新研究:告别高斯堆砌,终结 3D 冗余|ECCV 2026

浙大 × 字节 × 港中深最新研究:告别高斯堆砌,终结 3D 冗余|ECCV 2026 AI科技评论
2026-09-10
7
导读:为什么字节要把“空间表示”的体积压掉 90%?
为什么字节要把“空间表示”的体积压掉 90%?

    作者丨吴思梦

    编辑丨岑   峰

                                                                                                       

当沉浸式直播中的主播拥有实时跟随的 3D 分身,观众可从任意角度交互并观察细节时,这个 3D 分身的体积应当多大?这已从一个概念性问题演变为具体的工程挑战。
近年来,3D Gaussian Splatting(3DGS)技术实现了从多视角图像中快速重建照片级 3D 场景的能力,兼具高视觉质量与实时渲染特性。
3D Gaussian Splatting 从多视角图像重建场景,并支持新视角合成。
图源:Kerbl et al., SIGGRAPH 2023
3DGS 的核心在于利用带相机位姿的照片构建 3D 高斯表示,从而渲染出未拍摄视角的画面(Novel View Synthesis)。然而,当应用场景从离线建模转向实时直播、动态人物追踪及大规模设备传输时,核心矛盾转变为:该 3D 世界能否在有限的存储、带宽和算力下高效运行?
在 ECCV 2026 上,由浙江大学、字节跳动与香港中文大学(深圳)联合团队提出的PointSplat论文,正是针对这一痛点,聚焦于面向人体的紧凑型 Gaussian Splatting 研究。
该研究旨在优化 3D 人体表示的紧凑性,服务于沉浸式直播场景。随着 3D 成为 AI 理解现实世界的关键表示,“表示本身的紧凑性”已成为不可回避的核心议题。

01


高斯的代价:越真实,就越重

理解 PointSplat 的前提是厘清 3DGS 的机制。3DGS 将场景分解为数十万个高斯椭球,每个记录位置、尺度、旋转、透明度及外观信息。这种表示虽具备真实、可渲染、速度快三大优势,但也带来了显著的存储与计算成本。
高斯数量直接决定显存占用、计算开销及传输带宽需求。当场景复杂度从静态物体升级为动态人物或城市级环境时,成本呈指数级放大。
图片来源:Papantonakis et al., I3D 2024
当前 3D 研究领域存在两股力量:一股追求更高质量的几何与光影还原;另一股则致力于用更少的 3D primitives 表达相同世界。PointSplat 属于后者,其创新之处在于不依赖后端的剪枝或量化,而是从生成源头减少高斯数量。

02


从视角中心,

到“围绕一个人只建一次”  

传统的 view-centric(以视角为中心)方法存在隐蔽缺陷:同一主体在不同视角下被独立编码,导致肩膀、侧面、背面等几何与外观信息被重复存储,产生严重的跨视角冗余(inter-view redundancy)。
PointSplat 的核心思路是从 view-centric 转向 human-centric(以人为中心),改变高斯的预测逻辑。具体流程分为三步:
首先,模型先生成一个围绕人物的粗糙几何代理体(proxy),确立空间轮廓;其次,基于该 proxy 进行光线投射(ray casting),筛选掉非人体或不可见的 3D 点;最后,利用 Point-Image Transformer 融合多视角信息,直接预测高斯属性。
图源:Guo et al., ECCV 2026
这一流程将预测空间从“图像→像素→高斯”的各自为政,转变为“多视角图像→共享 3D 点集→高斯”的统一表示。本质上,PointSplat 解决了 AI 因多次观察同一对象而重复存储的问题,将 3D 表示的组织单位从“视角”回归到“主体”本身。
图源:Guo et al., ECCV 2026

03


一项工作与一个方向:

3DGS 的范式迁移 

PointSplat 不仅是压缩算法的改进,更代表了 3DGS 技术演进的趋势。传统 per-scene optimization(单场景优化)需对每个场景单独训练,难以泛化且无法实时。而 PointSplat 采用 feed-forward reconstruction framework(前馈式重建框架),输入稀疏多视角图像即可直接预测紧凑的高斯表示。
这意味着 3DGS 正从“场景级别的优化结果”转向“模型级别的生成能力”。模型学会了如何从图像中读取 3D 信息,并可泛化至新主体与新设备。在此过程中,human-centric 的预测方式进一步消除了跨视角冗余。
该技术路线可概括为:per-scene optimization → feed-forward prediction → human-centric / subject-centric prediction。PointSplat 是这一链条中针对人体表示的具体实践。
参与研究的团队包括浙大胡军、彭思达、周晓巍等深耕 3D 视觉与图形学的学者,字节的 Jing Zhang、沈先超等研究员,以及港中大(深圳)的邱凌腾。三方合作明确指向沉浸式直播场景,同时也为数字人、VR/AR 及空间智能提供了技术想象空间。

04


更轻的表示:3D 的未竟之问

PointSplat 揭示了 3D 表示作为 AI 基础设施必须面对的多维指标平衡:视觉质量、场景复杂度、计算效率、传输带宽及泛化能力。该研究通过将“紧凑性”与“泛化能力”绑定,提供了一种更高效的解决方案。
随着图像和视频成为互联网的主要载体,3D 表示(高斯、点云、网格等)正成为下一阶段 AI 基础设施的关键。未来的竞争焦点将从“还原逼真度”转向“如何用更少、更合理的表示组织 3D 世界”。
PointSplat 与其他方法的新视角合成结果对比  
图源:Guo et al., ECCV 2026
PointSplat 的价值在于,在行业普遍追求“更真实”时,率先提出了“够不够轻”的工程命题。当 3D 技术全面进入直播、机器人及空间智能领域,这一问题的优先级将显著提升。

05


最后 

3DGS 让世界变为可实时渲染的高斯,而 PointSplat 进一步探索了在大规模传输与交互场景下,如何让 3D 表示更轻量化。这标志着 3D 表示进入新阶段:当画质与渲染速度逼近瓶颈,竞争焦点将转向表示的组织效率。
中国研究力量通过这篇 ECCV 2026 论文,在具体工程问题上给出了有力回应。小问题的突破,往往是大趋势的起点。
论文链接:https://arxiv.org/abs/2606.32036
【声明】内容源于网络
0
0
AI科技评论
聚焦AI前沿研究,关注AI工程落地。
内容 8942
粉丝 0
AI科技评论 聚焦AI前沿研究,关注AI工程落地。
总阅读237.6k
粉丝0
内容8.9k