来源 | 首席数字官
字节跳动拟推实时空间视频 AI 模型,张一鸣亲自挂帅
9 月 8 日消息,字节跳动正筹备推出实时空间视频生成 AI 模型。该项目由创始人张一鸣亲自统筹,协调工程、业务及 AI 算力资源,预计最快于下个月面世。
云端渲染重构硬件门槛,差异化对标 Google DeepMind
该模型具备 20 帧/秒、50 毫秒延迟及云端渲染三大核心特性,将“实时空间视频”从预渲染长视频升级为按语音和手势即时生成。其产品逻辑对标 Google DeepMind Genie,但采取了显著的差异化策略:将全部渲染置于云端。
通过云端算力分担,该方案有效降低了 Pico VR 一体机的本机算力门槛,从而压低硬件成本曲线。字节的战略意图在于将竞争壁垒从传统的“显卡 + 光学 + 续航”硬件维度,转移至其擅长的“模型 + 云 + 内容分发”领域,以此避开与 Meta Quest 及苹果 Vision Pro 在硬件正面战场的直接消耗。
世界模型列为第一优先级,四大齿轮协同咬合
张一鸣的亲自挂帅凸显了该项目的战略地位。作为已退出日常管理数年的创始人,他今年直接调度了抖音、电商及 AI 算力中最核心的链路。在字节 2026 年 AI 四大优先级中,“世界模型”位列第一,超越守住 Seedance 视频领先优势、提升编程能力及 Doubao 货币化。据悉,世界模型的训练数据预算达八位数人民币,是竞争对手的 3 至 4 倍。
字节将此役赌注压在"Pico VR+ 抖音内容生态 + 火山引擎云+Seedance 模型”四大齿轮的协同上。若四者高效运转,字节有望拿下“全球首次实现生成式世界模型 50ms 低延迟”的产业身位。
依托海量内容生态,构建天然护城河
当前空间视频赛道竞争激烈,Fei-Fei Li 创立的 World Labs、Yann LeCun 在 Meta 推动的 JEPA 路线以及 Google DeepMind 的 Genie 均已上线 Demo。字节面临的挑战不仅在于技术突破,更在于内容生态的构建——即从“做出低延迟模型”到“做出高频使用模型”的跨越。
将渲染移至云端,本质上是从“硬件分发”转向“模型分发”。字节依托 TikTok 和 Douyin 每天超 1 亿条短视频上传量的内容生产流水线,拥有天然的训练数据池与发布场,这是其脱胎于内容基因的独特优势。
数据来源:新华社、光明网、Bloomberg、The Next Web(AI 辅助整理)
作者介绍
陈庆:资深 CIO,锦囊专家副总经理兼研究院院长。曾任中粮可口可乐、中国食品(HK0506)、万达主题娱乐、融创文旅、中国文旅、奥园集团悦康板块 CIO,埃森哲(中国)有限公司咨询总监。

