商派获得腾讯云企业版 WorkBuddy 代理授权,零售数智化进入“对话即操作”新时代
“世界模型不是 AI 行业的下一个风口,是下一个战场。”——重构零售实验室
9 月 1 日,李飞飞的 World Labs 发布 Atlas 世界模型;9 月 7 日,彭博社独家披露字节跳动正在筹备一款实时空间视频生成模型。两大动作几乎同步落地,标志着世界模型赛道已正式延伸至中国。
01 一周两次重锤:字节手里那张叫「实时空间视频」的暗牌
彭博社 9 月 7 日的报道揭示了字节跳动的最新布局:一款旨在让用户通过语音和手势,在 PICO 头显中实时生成可交互 3D 虚拟世界的 AI 模型。其核心逻辑在于,无需将世界建模为几何或语义结构,而是让模型学会将用户的语音和动作直接翻译为下一帧合理的画面。
该项目的关键参数如下:
- 性能指标:帧率 20 fps,延迟约 0.05 秒,接近实时交互可用线。
- 架构模式:渲染全部在云端完成,头显仅负责显示和输入。
- 技术底座:基于字节现有的电影级视频生成模型 Seedance 构建。
- 资源投入:创始人张一鸣亲自督导,协调各业务单元集中 AI 资源与算力。
- 发布时间:最快于 10 月发布,具体时间待定。
结合 9 月 1 日李飞飞 World Labs 发布 Atlas 模型(融资 10 亿美元)的背景,世界模型已成为中美 AI 巨头必争之地。本文将深入解析字节在此赛道的底气及其产品“豆包”的战略角色。
— 云端实时生成 3D 世界——字节空间视频模型的核心视觉隐喻
02 为什么是视频而不是语言:Seedance 撑起的,是字节最舒服的一场仗
在通用大语言模型赛道,字节暂时落后于海外领先模型。然而,在视频生成领域,字节凭借 Seedance 模型占据了绝对优势。
Seedance 在多项权威评测中表现卓越:
| 评测项目 | Seedance 2.0 成绩 | 主要竞品对照 |
|---|---|---|
| Best AI Video Generators 2026 | 9.6/10 第一 | Runway Gen-4(9.5)、Kling 2.1(8.8)、Google Veo 3(8.6) |
| Artificial Analysis T2V 榜(Q1-Q2) | Elo 1221 第一 | HappyHorse 1218 |
| Artificial Analysis I2V 榜(Q1-Q2) | Elo 1181 第一 | HappyHorse 1165 |
| 6 个文本到视频维度 | 全部第一 | 业内称「导演级 AI」 |
7 月 31 日发布的 Seedance 2.5 版本,支持一次性生成 30 秒视频,并可参考最多 50 张图片、视频和音频素材。该模型已应用于徐工集团的工业培训视频、小鹏汽车的内部设计平台以及微分智飞的飞行机器人训练场。
字节在视频领域的优势源于抖音、TikTok、剪映等产品十余年的数据积累与工程经验。数据显示,Seedance 在工作日的调用量远高于周末,表明其正从娱乐工具转化为生产力工具。字节选择从视频侧切入世界模型,是基于自身数据资产和模型积累的必然战略。
— 字节 AI 飞轮:AI 模型 × 云计算 × 内容平台 × XR 硬件
03 搬到云上的代价:VR 的成本结构要重写了
字节此次技术路线的核心突破在于“把算力搬到云端”。传统 VR/AR 行业受限于本地芯片性能,导致头显设备昂贵、体积大且续航短,难以普及。
字节的解决方案重构了成本结构:
- 终端轻量化:头显仅需负责接收输入(语音、动作、眼动)和显示画面,无需搭载顶级芯片。
- 云端渲染:所有高算力的内容生成均在云端完成,以 20 fps、0.05 秒延迟推流至头显。
- 边际成本递减:随着用户规模扩大,云端算力摊薄内容生成成本。
这一策略将竞争焦点从“芯片性能”转向"AI 模型对世界的理解能力”,有望打破 XR 行业“硬件贵 - 用户少 - 内容缺”的死循环。对于累计销量约 210 万台的 PICO 而言,这是扭转市场颓势的关键机遇。
“张一鸣把这套组合视为飞轮:AI 模型 + 云计算 + 抖音/TikTok 内容生态 + PICO 硬件——他不是押一个产品,是押一个完整的产业闭环。”
04 豆包不是聊天机器人:3.8 亿月活背后的真正底牌
QuestMobile 数据显示,2026 年 6 月豆包 APP 月活达 3.82 亿,日活破亿,是国内唯一日活破亿的独立 AI 应用,用户渗透率高达 79%。
关键数据指标:
3.82 亿
2026.6 月活 / 同比 +172.1%
1.4 亿
日活 / 国内唯一破亿
180 万亿
日均 Token 调用 / 2026.6
自 2026 年 6 月推出付费订阅及飞书并入后,豆包已从单纯的聊天机器人演变为字节 AI 战略的应用层入口。其构建了“抖音引流 - 豆包沉淀 - 飞书办公 - 交易变现”的完整闭环。日均 Token 调用量两年增长 1500 倍,意味着豆包具备将底层模型迅速推向庞大用户群并反哺训练数据的能力。未来的实时空间视频模型可直接嫁接于豆包对话流中,形成独特的体验闭环。
05 2000 亿与那 10% 的差距:张一鸣在赌什么
字节近期动作彰显了其在 AI 领域的决心:
- 资金投入:获 300 亿美元贷款,2026 年资本开支计划超 2000 亿元人民币,重点投向 AI 算力。
- 基建布局:在马来西亚、宁夏、山西、内蒙古等地加速建设智算中心,筑牢国内外算力基本盘。
- 技术路线:坚持“拒绝蒸馏、闭源自研”,虽短期可能落后,但旨在掌握 AGI 终局。
尽管通用 LLM 与海外仍有差距,但字节将“世界模型”列为 2026 年四大 AI 重点之首,目标是在年底前发布性能达到全球最佳水平的世界模型。内部测试显示,目前距离该目标尚差约 10%。张一鸣赌的是:AGI 的终局不是大语言模型,而是能理解物理世界的模型。
06 对手桌:Genie 3、Atlas、Cosmos,这场仗有多挤
世界模型赛道竞争激烈,主要玩家包括:
- Google DeepMind Genie 3:主打 24 fps 实时交互 3D 环境,已应用于自动驾驶仿真。
- World Labs Atlas:从单张照片重建 3D 世界,获 Nvidia 等巨头投资。
- Nvidia Cosmos:开源世界基础模型,服务于机器人和自动驾驶开发。
- AMI Labs & Adobe Wonder:分别押注 JEPA 架构和创作者工具。
字节的差异化路径在于“云端实时生成 + PICO 头显消费场景 + 抖音/TikTok 内容生态托底”的飞轮闭环。目前看,字节是少数同时具备模型质量、云端成本结构和内容生态密度这三项要素的公司之一。
07 三个还没解的问题
尽管前景广阔,世界模型赛道仍面临挑战:
- 延迟问题:20 fps 和 50 ms 延迟在虚拟现实场景中可能引发眩晕,需提升至 60 fps 以上或通过插帧算法优化。
- 技术差距:最后 10% 的性能提升往往最难,需在数据红利耗尽前通过自研追平全球领先水平。
- 内容生态:如何让用户愿意每天佩戴头显体验 AI 生成的世界,是 Meta 和苹果尚未解决的难题,也是字节需要验证的关键。
结语:世界模型的战场,在中国也在美国
从 Atlas 到字节的实时空间视频模型,全球科技巨头都在押注下一个计算平台——能理解物理世界的 AI 助手。豆包、Seedance、巨额资本开支及 PICO 硬件,这些看似零散的布局已被串联成一条清晰的战略主线:字节正在将所有资产押向世界模型。
虽然最终成效需待 10 月发布会揭晓,但可以确定的是,“豆包只是一个聊天机器人”的旧叙事已被彻底改写。

