1975 年,Martin Newell 用手工测量了一把茶壶,将坐标逐一敲入计算机,由此创建了人类历史上最早的 3D 模型之一。Newell 用它来检验一个问题:计算机能否将物品“显示”出来?五十年后,这个测试早已通过。生成式 AI 可以画出精美图片、渲染出以假乱真的视频,但人们仍然无法把它们像放进游戏、打印出来握在手中,或者用它教一个机器人倒茶。原因很简单:它们背后根本不存在一个真正的茶壶。
在 SIGGRAPH 2026 的大会主题演讲中,VAST 首席科学家曹炎培博士和算法团队将借同款茶壶,为生成式 AI 提出新的测试标准:生成的东西能用吗?能造出来吗?机器人能拿它训练吗?你不看它的时候它还在吗?
AI 早就学会了“展示”,现在该教它们“创造”了。
SIGGRAPH 2026 将于 7 月 19 日至 7 月 23 日在美国洛杉矶召开(注:本文列出的所有活动时间均为洛杉矶当地时间)。作为计算机图形学领域全球公认的最顶级学术会议,SIGGRAPH 每年汇集全球顶尖高校、研究机构与产业界的研究者、艺术家与工程师,聚焦渲染、几何建模、动画与仿真、神经渲染及生成式 AI 等前沿方向,兼具科研深度与产业前瞻性。
今年 VAST 共有5 篇论文入选,覆盖 3D 表征、原生网格生成、骨骼绑定、跨拓扑动画及纹理生成等三维资产创作的核心环节。SIGGRAPH 以严格的同行评审与极高的学术标准著称,其 Technical Papers 录用率约 25%,且投稿门槛极高,入选论文的单篇含金量在计算机科学各顶会中居于最高梯队。
SIGGRAPH Keynote 是大会开幕或核心日程中面向全体参会者的演讲,代表这一年计算机图形学/视觉计算领域最值得全场听的声音。今年将是 VAST 第二次站上 SIGGRAPH 的主会场发表主题演讲。三年前,VAST 创始人兼 CEO 宋亚宸与黄仁勋等世界级企业家同台,成为第一位在该会议发表主题演讲的中国企业家。
除了主题演讲,我们还将在 SIGGRAPH 期间带来一场 Real-Time Live! 展演、两场 Stage Session 演讲、一场 World Model & GenAI 黑客松、以及多场面向研究者、开发者、艺术家的社交活动——这将是 VAST 前沿能力与学术成果的一次集中展示和公开亮相,我们诚邀海内外研究者、开发者与艺术家们来现场相会。
01
入选论文:从几何表征
到可动画资产的全链路突破
01:
PixTex: Consistent
3D Texturing via Pixel-Space
Multi-View Diffusion
📍 7月21日(周二)· 9:40 – 9:50 AM PDT · Room 403 B(Technical Paper Session)
背景与挑战:
在现有的 3D 生成管线中,如何为生成的几何体赋予具备高度多视角一致性、物理准确且细节丰富的高分辨率纹理,一直是阻碍 3D 资产达到现代工业级可用标准的核心挑战之一。
核心方法:
PixTex 提出首个Pixel-Space Multi-View Diffusion框架,将多视角纹理生成从 latent space 推进到 pixel space,在保留高频纹理细节的同时,实现更精确的跨视角对应与一致性建模。
(1) Pixel-Space Multi-View Diffusion:直接学习像素级多视角对应,而非在 latent 空间隐式建模,使高频纹理细节和复杂纹理结构得到更完整保留。
(2) 3D Position Guided Consistency:将几何位置信息贯穿 Transformer 的 patch-level attention与像素解码两个阶段,并引入显式一致性监督,让对应位置在不同视角生成一致纹理,实现 SOTA 的跨视角一致性。
(3) Multi-View Inpainting:对于自遮挡造成的纹理缺失,联合多个视角协同生成不可见区域,使最终纹理更加完整、连续且符合整体几何结构。
结果与应用:
极大提升了 3D 纹理生成的保真度与视觉连贯性。该技术无缝接入了 VAST 的全栈生成生态,直接赋予了 AI 生成的 3D 资产无缝导入现代游戏与影视引擎的高清材质。
视频链接:
https://www.youtube.com/watch?v=GFDOeS_vmuI
02:
Generative 3D Gaussians
with Learned Density Control
📍 7月21日(周二)· 9:50 – 10:00 AM PDT · Room 403 B(Technical Paper Session)
背景与挑战:
3D 高斯泼溅(3DGS)在传统优化流程中依赖密度控制机制,在欠拟合区域增补高斯、在冗余区域删除,以实现对不均匀几何复杂度的自适应表达。然而该机制本质上是离散、启发式且不可微分的,无法被 Diffusion 等端到端生成模型直接继承。现有生成方法因此退而求其次:将高斯绑定于固定体素网格(GaussianCube)、为每个体素/像素分配固定数量(TRELLIS、LGM),牺牲了 3DGS 最核心的灵活性。这导致生成结果的复杂度被写死——复杂边缘与大块平面获得相同计算资源,且无法在同一模型内按需输出不同精度的资产。
核心方法:
提出 Density-Sampled Gaussians(DeG),将 3D 高斯的密度控制重新建模为端到端可学习的概率采样过程。
(1) 首创渲染损失贡献梯度 (render loss contribution gradient) ,将原本离散、启发式的增删点规则转化为可微的端到端密度优化过程;
(2) 引入 VecSeq 机制,通过最优传输将无序潜变量对齐至确定性空间序列(3D Sobol sequence),将集合生成问题转化为序列生成问题,解决扩散模型训练中的排列歧义(permutation ambiguity)导致的收敛慢、质量下降问题。
结果与应用:
在相近高斯预算下,DeG 的视觉质量显著优于 TRELLIS、UniLat3D 等代表性方法;在相近视觉质量前提下,其所需高斯数量可压缩至 TRELLIS 的一半以下。该方法可直接服务于游戏与 XR 多设备 LoD 适配、3D 内容平台的多精度资产交付、机器人仿真与数字孪生中有限资源的优先分配等场景。同时,论文成果已作为开源项目 TripoSplat发布,上线后即登顶 HuggingFace Space Trending 榜单,并获得 ComfyUI 官方首发工作流支持。
论文链接:
https://arxiv.org/abs/2605.16355
代码:
https://github.com/VAST-AI-Research/TripoSplat
HuggingFace 在线试玩:
https://huggingface.co/spaces/VAST-AI/TripoSplat
ModelScope 在线试玩:
https://modelscope.cn/studios/VAST-AI-Research/TripoSplat-Demo
ComfyUI 工作流接入:
https://docs.comfy.org/tutorials/3d/triposplat
03:
Nexus:
Native Mesh Generation with Diffusion
📍 7月21日(周二)· 10:45 – 10:55 AM PDT · Room 403 B(Technical Paper Session)
背景与挑战:
当前,主流的网格生成方法严重依赖自回归过程与序列化排序,不仅推理效率低下,且对误差累积极为敏感:早期的预测错误会导致后续生成的网格彻底崩溃,极难生成具有复杂且连贯拓扑结构的工业级原生网格。
核心方法:
Nexus 彻底摒弃了序列化,提出了一种将顶点与拓扑生成解耦的全局网格扩散框架。
(1) 将顶点视为八叉树中的稀疏体素,采用分层扩散模型由粗到细地全局生成顶点;
(2) 提出“时空区间 (Spacetime Interval) ”,将任意边缘和非流形表面拓扑编码为连续的每顶点嵌入,随后利用拓扑自编码器和扩散模型在潜空间中生成拓扑。
结果与应用:
实现了完全无需排序 (sort-free) 的原生网格生成。在 Objaverse 和 Toys4K 等数据集上全面超越现有的自回归基线,成功生成高达两万面、具有极高结构完整性和清晰拓扑边缘流 (edge flow) 的复杂场景级资产。
论文链接:
https://dl.acm.org/doi/10.1145/3811344
04:
AniGen: Unified S³ Fields
for Animatable 3D Asset Generation
📍 7月21日(周二)· 11:25 – 11:35 AM PDT · Room 403 B(Technical Paper Session)
背景与挑战:
当前主流的可动画 3D 资产生成方案采用“先生成、再绑骨”的串行路线——先由生成模型输出静态几何,再调用自动绑骨方法推断骨架与蒙皮权重。然而 AIGC 产出的网格往往存在局部黏连、拓扑不稳定、姿态歧义等问题,使得后置绑骨极易出现骨架缺失、连接错误和蒙皮分配失真,导致资产“能看不能动”。更根本地,将形状与可动性拆开处理,意味着两者之间缺乏结构一致性约束,无法端到端优化动画质量。如何从单张图片直接生成几何、骨架、蒙皮三者联合一致的可动画资产,是将 3D AIGC 推向动画、游戏、仿真与具身智能工作流的核心瓶颈。
核心方法:
AniGen 提出 S³ Fields(Shape, Skeleton, Skin)统一表示,将几何、骨架与蒙皮定义在同一共享空间域中联合生成,而非串行拆解。
(1) 置信度衰减骨骼场(Confidence-Decaying Skeleton Field):在预测骨骼位置的同时显式建模 Voronoi 边界处的几何歧义——离骨骼中心越远、多骨交界越模糊的区域,置信度自动衰减,避免边界噪声污染骨架拓扑,使生成的骨架更干净稳定;
(2) 对偶蒙皮特征场(Dual Skin Feature Field):将蒙皮权重解耦于具体关节数量,改写为一种与关节计数无关的特征表示,使固定架构网络能够预测任意复杂度的绑定——从鱼、鸟到人、机械臂均可覆盖,无需为不同类别设计专用分支;
(3) 两阶段 Flow Matching 生成流程:第一阶段以单张图像为条件,通过条件流匹配生成稀疏结构脚手架(Sparse Structure),确立整体骨架轮廓与空间组织;第二阶段在此脚手架基础上,于结构化潜空间中生成密集几何与关节细节(Structured Latent),补全高分辨率形状与 articulation 信息;
(4) 端到端统一训练:几何、骨骼、蒙皮三场共享编解码器与生成网络,渲染损失与结构损失联合回传,确保生成资产在几何准确的同时天然具备动画可用性。
结果与应用:
在 ArticulationXL 数据集上,AniGen 与TRELLIS+UniRig/Anymate/Puppeteer/RigAnything 等强基线进行系统对比,在拓扑正确性、蒙皮分布等指标上均取得最优并显著领先。其泛化能力覆盖动物、人物、卡通角色、植物及机械臂等多元类别,生成结果可直接导入标准 3D 管线并由现成动捕数据驱动。该方法可直接服务于动画角色快速创建、游戏引擎可交互资产批量生产、VR/AR 数字人驱动、具身智能中带结构先验的可操作对象构建,以及数字孪生场景中需要可控关节运动的仿真实体生成。
论文链接:
https://www.youtube.com/watch?v=GFDOeS_vmuI
代码:
https://github.com/VAST-AI-Research/AniGen
HuggingFace 在线试玩:
https://huggingface.co/spaces/VAST-AI/AniGen
05:
TOPOCAP: Learning Topology-Agnostic
Motion Priors for Monocular
Video-to-Animation
📍 7月23日(周四)· 2:10 – 2:20 PM PDT · Room 403 A(Technical Paper Session)
背景与挑战:
现有的单目动作捕捉技术高度依赖特定物种的参数化模板。而在面对生成式 AI 创造的、拓扑结构千奇百怪的 3D 角色,如多足生物、奇幻异兽时,这些基于模板的先验方法面临失效。
核心方法:
构建首个“拓扑无感 (Topology-Agnostic) ”的视频到动画提取框架。
(1) 预训练 Graph CVAE 提取通用运动流形,将异构的运动链压缩为固定长度的共享潜码,实现运动动态与特定骨骼结构的彻底解耦;
(2) 将视频到动画转化为条件流匹配问题,从视觉特征中预测拓扑无关的潜码;
(3) 发布了包含超过 5000 种独特骨骼拓扑、200 万帧动画的超大规模多样性数据集 MOBJAVERSE。
结果与应用:
实现了惊艳的零样本 (Zero-shot) 运动重定向。模型能够直接从单目视频中提取运动,并流畅地赋予给拥有任意未知拓扑的 3D 角色,无需任何测试时优化。这为打通大规模 3D 内容生成的动画化瓶颈提供了通用解法。
论文链接:
https://arxiv.org/abs/2606.12153
02
演讲、代码、鸡尾酒:
在 SIGGRAPH 遇见 VAST 的七种方式
论文之外,VAST 在 SIGGRAPH 2026 期间还带来了一系列覆盖学术、产业与社区的线下活动——包括 SIGGRAPH 主会场 Keynote 演讲、Real-Time Live! 实时展演、两场 Stage Session 技术分享、一场面向全球 XR 开发者的 Worlds in Action 黑客松,以及两场面向研究者与行业伙伴的特邀社交活动。无论你是关注前沿算法的研究者、寻找生产力工具的开发者,还是希望探索 AI 原生创作可能性的艺术家,都能在这里找到属于你的接口。
7 月 18、19 日(周六 、周日)
Worlds in Action 黑客松
SIGGRAPH 开幕前最大规模的黑客松,已有 500+ 创作者参与。参赛者将在两天内搭建下一代 AI 原生 3D 交互体验原型。评审团包括来自 VAST、World Labs、狮门影业、索尼、Meta、NBA 等机构的行业专家。优胜作品将在 SIGGRAPH 2026 大会现场展示。
📍 9:00 AM – 5:00 PM PDT · 报名成功后可查看地址
报名链接:
https://luma.com/u7pmhw92?utm_source=partners
7 月 20 日(周一)
World Models & GenAI Mixer
VAST 与 World Labs 联合发起的行业社交之夜,聚集约 200 位来自 AI 平台、基础模型公司、VFX 工作室、虚拟制片团队与创意机构的从业者。当晚设有 VAST、World Labs 与 Manycore Tech 三方 Panel,共同探讨 AI 驱动的下一代 3D 内容生产;同时活动亦将展出来自黑客松的优胜作品及最新 3D GenAI Demo。受邀制,参会名单经主办方逐一筛选。
📍 5:30–9:00 PM · Hotel Figueroa — The Unbound Collection by Hyatt
报名链接:
https://luma.com/sensai-01ew
7 月 21 日(周二)
Stage Session 演讲
主题为 Building the Interactive Future: Inside Tripo's Full-Stack 3D Generation Ecosystem,VAST 团队将系统介绍展示 Tripo 全栈 3D 生成生态的技术架构与最新进展。
📍 4:00–4:30 PM · Hall A Stage
SIGGRAPH Real-Time Live! 展演
VAST 算法科学家们将在大会主舞台现场演示如何用生成式 AI 在数秒内创建可交互的 3D 资产。展演结束后在大厅设有 Meet & Greet 环节,来现场即可直接与我们面对面交流。
📍 6:00–7:45 PM ·Hall K Lobby
活动详情:
https://s2026.conference-schedule.org/session/?sess=sess315
7 月 22 日(周三)
Stage Session 演讲
Tripo × Prana Labs 联合呈现 Stage Session 演讲 —— Seeing is Believing, Grasping is Physics,探讨 3D 感知与物理交互的前沿融合。Prana Labs是一家多模态通用智能公司,致力于构建物理精确、可交互的规模化世界生成系统,并基于此训练下一代多模态基础模型。
📍 10:30–11:30 AM · Hall A Stage
⭐SIGGRAPH 主会场 Keynote 演讲⭐
主题为The Teapot Test: First It Tested Showing. Now It Tests Making,由 VAST 首席科学家曹炎培领衔算法团队联合呈现,全面展示 VAST 团队全栈 3D 生成与世界模型的最新突破。
📍 2:30–3:30 PM · Main Stage, Hall K
Tripo Happy Hour
面向 3D 视觉、图形学、AI 与世界模型方向研究者的特邀社交酒会。名额有限,速速申请。
📍 5:30–9:30 PM · 主场馆附近
报名链接:
https://luma.com/cs2fk923?utm_source=partners
03
列车即将发车,
来 743 号车站会合
会议期间,我们在洛杉矶会展中心 Booth 743,以「The Station to Anywhere」为主题,采用四面全开放空间布局,搭建了一个通往无数世界的“中转枢纽”。
中心导览区:我们精心准备了导览折页与独家实体周边,包含主题贴纸、三角金属徽章、黄色随行杯、Tripo VIP月度会员专属卡等丰富礼品等你来拿!
核心装置区:世界模型「车窗装置」——通过模拟列车车窗的屏幕,呈现由 VAST 世界模型驱动生成的无限 3D 世界。观众可以从第一视角体验一场穿越 AI 生成世界的沉浸式旅程。
Studio 体验区:现场配备了多台终端设备,支持实机体验全球首个 AI 驱动的一站式 3D 工作站 Tripo Studio,VAST 的伙伴们将在一旁实时讲解,带你直观感受从文字 / 图片到完整 3D 模型的全流程创作。
诚挚期待你的到来,列车即将发车,我们 SIGGRAPH 现场见。
关于 VAST AI Research
VAST AI Research 致力于构建通用 AI 3D 基础模型与世界模型。更多信息请访问 www.tripo3d.ai/research,或关注 X @VastAIResearch。
如果你对以下方向感兴趣,欢迎和我们聊聊:
工业级资产与场景生成:突破纯视觉表达的局限,确立从单体资产到复杂场景、直通现代引擎的工业级可交互生成标准。
下一代神经图形学:跳出传统图形渲染的框架,以 AI 原生神经表征与端到端推演,重构高效的空间计算法则。
可交互世界模型:求解时空因果与长时序推演命题,为下一代原生互动内容构筑基础大模型底座。
我们提供极具竞争力的薪酬、核心技术方向的主导权、专属大规模算力,以及面向长期高价值研究的专注科研环境。
在 SIGGRAPH 现场提交简历,即可获得活动专属 Tripo 周边大礼包,若后续成功拿到 Offer 并入职,更有神秘大奖可以领取。

