大数跨境

30亿融资背后,VAST正在叩开XR时代的内容入口

30亿融资背后,VAST正在叩开XR时代的内容入口 VR陀螺
2026-09-03
10
导读:空间内容生产方式大革新

空间内容生产方式大革新

文/VR 陀螺 小鱼

近日,3D 原生智能企业 VAST 宣布完成约 30 亿人民币 B 轮和 B+ 轮融资。至此,不到半年的时间里,VAST 累计融资约 50 亿人民币,刷新了 3D 原生智能领域融资额纪录。

本轮融资由经纬创投领投,完美世界、蓝色光标、芯动能投资、延趣游戏、中科创达、广电投资、三七互娱等一线产业资本,鼎晖 VGC、中金资本、CMC 资本、洪泰基金、三正健康投资、中平资本、福建产投基金、福创投、卓源亚洲、江西金控等一线财投联合参投,老股东达晨财智、春华资本、四三九九、慕华科创、绿洲资本、渶策资本、华控基金持续超额追投。

从投资阵容来看,本轮投资不仅有顶级 VC,还有 XR、游戏、文旅、影视、广告等产业资本的入局。其中,芯动能投资背后的京东方等企业和机构,位于 XR 供应链的上游,中科创达亦是 XR 行业的重要玩家。他们的加入,也侧面印证了 VAST 的价值在 XR 场景中正不断凸显。

眼下,XR 行业的硬件基础正在逐渐成熟。从今年公布的新一代设备来看,部分 VR/MR 头显的重量已经可以降到 260 克以内,且近眼显示效果明显提升,最新一代 MR 设备还采用了 Micro-OLED 等高分辨率显示方案,单眼分辨率达到 4K 级,像素密度进一步提高。与此同时,Spatial AI 开始支持 3D 生成、空间锚定和物体识别,头显对现实环境的感知与理解能力也在继续提高。

但硬件就绪后,内容供给便成为 XR 发展的一大难点。不同于传统互联网内容,XR 需要的是一个三维世界。从游戏场景、虚拟角色,到数字人、工业仿真和沉浸式体验,都需要大量 3D 资产支撑。但传统 3D 制作依赖专业团队,成本高、周期长,难以满足未来 XR 应用规模化发展的需求。


伴随着这轮融资,VAST 推出 Tripo P2.0 3D 原生基础模型和 StereoWorld 双目世界模型,分别覆盖 3D 资产生成和立体世界生成等环节,将其产品能力进一步延伸到 XR 的「内容生产」。

01 在头显里「说」出世界,Tripo 把创作搬进空间计算

过去的 XR 内容生产,很多时候是先要在电脑端完成建模,再经过材质、贴图、引擎导入、场景搭建和交互开发,最后才被送进头显。

等用户真正进入 VR/MR 空间时,看到的基本都是开发团队提前「预制」的内容,鲜少能自己直接参与到内容创作当中去。当 3D 生成模型被搬进了头显,用户无需研究复杂的 3D 软件,仅需直接在设备中提出需求,就可以实时生成自己想要的 3D 内容。

可究竟该怎么在头显里输出需求呢?目前不少 VR/MR 设备已经支持手柄、手势和眼动等交互方式,这些方式在选择、点击、拖拽和空间操控上已经相对成熟,但面对较长的 Prompt 输入,虚拟键盘的点击体验仍然谈不上顺畅。

针对这类痛点,Tripo 将语音直接接入 3D 生成流程,用户戴上 MR 设备后,只需要说出需求,如「生成一盏台灯」或者「给我一座中世纪城堡」,内置 Agent 便会理解用户意图,并调用 Tripo 模型生成相应内容,从而将自然语言表达、3D 生成与空间操作串联在同一个交互环境中。

不过,当 3D 模型真正进入 XR 环境之后,光会「生成」还远远不够。网页中的模型只要在视觉上成立基本就完成了任务,而 MR 中的虚拟物体的「空间关系」,也会直接影响虚拟内容能否真正融入现实空间。

对此,Tripo 进一步接入空间锚定、环境感知和物体识别等 Spatial API,并结合原生 GPU 渲染,让生成内容能够与现实桌面、地面等环境建立相对稳定的位置关系,同时支持放置、堆叠和碰撞等物理交互。

在此基础上,Tripo 还支持用户将多个生成物体组合成完整场景并发布到社区,让其他用户直接进入体验,3D 生成的单位也由单个 Asset 进一步向 Scene 延伸。对于 XR 而言,这意味着过去高度依赖专业团队完成的部分场景搭建工作,开始出现由普通用户通过语音生成、摆放和组合内容的可能,从而为 UGC 内容生产提供一条门槛更低的路径。

02 数秒生成原生四边面,Tripo P2.0 直面 XR「可用」难题

在头显里通过一句话生成一个物体,听起来挺爽的。但对于 XR 开发者来说,生成的东西能不能用,是更为关键的事情。

相比传统 PC 游戏或者离线渲染,XR 设备对 3D 资产的要求更为苛刻。一方面,头显受到算力、功耗和散热限制,还需要同时渲染左右眼画面;另一方面,场景中的物体经常需要被抓取、移动、缩放,甚至进一步进行骨骼绑定和动画驱动。因此,一个模型除了外形和纹理,还要考虑面数、Mesh 结构以及后续编辑能力。

P2.0 选择从面数控制入手,其支持 500 至 50000 个三角面,以及 500 至 25000 个四边面的范围控制,开发者可以根据移动 VR、MR 或者 PC VR 等不同终端调整模型复杂度,这项能力会直接影响同一场景能够承载多少物体,以及设备能否保持稳定帧率。

在控制模型面数之外,P2.0 还把重点放在生成资产能否直接用于生产上。

过去不少 AI 3D 模型主要关注几何外形和视觉相似度,生成结果经常是结构杂乱的三角面碎网。这类模型虽然可以用于展示,却往往难以直接导入引擎,也无法顺利完成骨骼绑定和动画制作。美术人员仍要花费数小时重新整理 Mesh 和拓扑结构,AI 缩短了生成模型的时间,却没有省去后续繁琐的加工过程。

P2.0 将拓扑整理前移到模型生成阶段,可以在数秒内生成布线较为规整的四边面网格。四边面是影视和游戏制作中普遍采用的网格形式,更适合模型平滑、角色变形、骨骼绑定和动画制作。配合完整的 UV、PBR 材质和最高 8K 贴图,生成的模型可以直接导入 Unity、Unreal 等引擎,继续添加动画、物理效果和交互功能。

这使 XR 开发者拿到的 3D 模型从一份预览素材变成了可以继续投入生产的资产,也缓解了过去 AI 3D 模型「能看不能用」的问题。模型生成后可以更快进入引擎,随后完成动画绑定和交互开发,开发者无需在每一个环节重新加工资产。对于需要大量角色、道具和场景的 XR 内容生态来说,资产可用性的提升,才有可能把 AI 3D 的速度优势转化为更大规模的内容供给。

生成速度同样影响着 AI 3D 能否进入 XR 的实时交互场景。传统方式从零制作一个 3D 资产,往往需要数小时甚至数天,很难回应用户在虚拟空间中的即时需求。P2.0 将四边面拓扑网格的生成时间压缩到数秒,用户输入语言指令后,模型可以迅速生成相应的 3D 物体。

当 3D 资产能够在数秒内完成生成并进入交互,XR 内容也从开发者提前制作,走向用户在体验过程中即时创造。

03 让 AI 拥有「双眼」,StereoWorld 处理空间一致性

当 AI 生成内容真正进入 XR,空间稳定性会成为另一个绕不开的问题。

目前大量视频生成和世界模型仍以单目 RGB 内容作为训练和生成基础。但仅凭单张二维图像,很难唯一确定物体真实的距离和尺寸。

普通视频中,轻微的物体漂移、尺度变化或者局部形变,有时并不会立刻影响观看体验。但在 XR 环境里,用户会不断转头、移动,甚至绕到物体侧面和背后观察。一旦同一个物体在不同视角下出现位置漂移、结构变化或者深度关系错乱,用户很容易察觉,沉浸感也会随之被打断。

△左:单目 depth warp+inpaint;右:StereoWorld 双目生成

为了解决这些问题,VAST 算法团队联合香港大学、PICO 等机构开源了双目世界模型 StereoWorld,相关论文发表于 CVPR 2026。它可以根据单张图像、文字描述和相机运动指令,同时生成后续的左眼与右眼视频,让画面内容和双目几何关系在同一模型中共同演化。

双目视觉的价值来自左右视图之间细微的位置差异。相机焦距和双目基线已知时,视差可以直接对应真实尺度下的深度,相当于给生成过程加入一个稳定的三维「物理锚点」,从根本上缓解了模型的漂移和变形问题。

训练过程中,StereoWorld 无需额外的深度图监督,仅使用 RGB 双目视频即可从左右视图之间的视差中学习几何关系。

同时通过 Camera-Frame RoPE 对相机内外参数和相对位姿进行建模,可支持相机汇聚,以及水平、垂直和深度方向上的不同双相机轨迹。

这套能力除了用于直接生成双目内容,也延伸出了一项比较实际的「视图补全」能力。给定一段完整的左视图视频和目标相机轨迹,StereoWorld 可以生成与之对应的右视图。这意味着,部分已有的单目视频未来存在通过生成方式补齐另一侧视角的可能,不必全部重新进行双目拍摄。对于立体视频和 XR 内容制作而言,将有机会降低部分双目采集、素材制作和后期处理成本。

不过,要让这类模型进入 XR,实时性是一道门槛。原始 StereoWorld 采用双向注意力,一次最多生成 81 帧。研究团队随后把模型蒸馏为四步生成的因果自回归模型,并为左右视图分别维护带有相机位置编码的 KV Cache。蒸馏后的模型可以生成约 10 秒的双目视频,速度从约 0.25 FPS 提高到约 3 FPS,快了约 10 倍。

可见,StereoWorld 已经开始把双目世界生成从短片段验证,向更长时、更连续的空间内容生成推进,也为后续交互式立体世界生成提供了技术基础。

04 写在最后

过去,XR 行业最大的挑战,是如何让用户进入一个更真实的数字世界;而未来,更大的挑战是如何持续创造足够丰富的内容,让用户愿意长期留在其中。

从这个角度看,AI 3D 带来的价值,除了提高建模效率,还有改变了空间内容的生产方式。当 3D 模型生成速度从小时级缩短到秒级,当普通用户也能够通过语言直接创造物体、搭建场景,当 AI 能够理解现实空间并生成具有几何一致性的立体内容,XR 的内容生产将不再完全依赖专业开发者,而有机会形成类似移动互联网时代 UGC 内容生态。

对于 XR 产业而言,硬件决定了空间计算能走多远,而 3D 模型能力拓展了这个空间里的可能性。

随着 AI 3D 技术不断成熟,未来的 XR 设备或许会逐渐成为每个人创造和体验数字世界的新入口。而 3D 能力的提升,也将推动 XR 从小众群体迈入更大规模的消费市场。


  第一时间了解 XR 资讯  
  关注 VR 陀螺官网(vrtuoluo.cn)

推荐阅读



【声明】内容源于网络
0
0
VR陀螺
VR陀螺,是关注VR/AR的头部产业服务平台,在这里我们会持续分享最新业内消息、深度文章、行业报告等,欢迎业内志同道合者一起交流分享。
内容 2150
粉丝 1
VR陀螺 VR陀螺,是关注VR/AR的头部产业服务平台,在这里我们会持续分享最新业内消息、深度文章、行业报告等,欢迎业内志同道合者一起交流分享。
总阅读80.7k
粉丝1
内容2.1k