大数跨境

世界模型不是终点,短剧先拿到了入场券

世界模型不是终点,短剧先拿到了入场券 短剧自习室
2026-09-20
3
导读:⠀还差10年

最近,字节又有新动作了,这回动静不小。

据彭博社9月7日报道,一款基于Seedance的实时空间视频生成模型正在推进,按披露的规格,能做到每秒20帧、约50毫秒延迟的实时生成。

也就是说,只要开口说话,画面就会当场生成,不用再等渲染。彭博社还提到,发布最早可能在10月。

其实在这之前,方向就已经定了。字节把世界模型列进了2026年四项AI重点的首位,据36氪等多家媒体报道,Seed团队的内部目标,是年底前至少推出一款世界模型,并与谷歌的Genie 3做对标测试。

不只是字节。生数、智象未来,几乎所有的头部文生视频玩家,都在讲同一个词:世界模型。现在,大家已经不满足于生成一段好看的视频了,而是开始聊怎么让AI理解这个世界。

对于做短剧的人来说,这件事不只是看个热闹。短剧和世界模型共用同一套底层能力——视频生成,而短剧恰好是视频生成最先落地的场景。

那么,世界模型到底是什么?为什么巨头都在押注?它离做内容的人到底有多远?带着这些问题,我翻完了智象未来创始人梅涛的一期3小时深度访谈。

他是全球最早一批文生视频论文的作者,也是最早探索文生视频的人之一,更是把世界模型讲得最直白的人。这篇文章,就是那3小时的精华。

  图片、视频、世界模型,三级台阶  

梅涛的模型世界观,其实一句话就能说完:图片是入口,视频是过程,世界模型是终局。这不是三个模型,而是同一件事的三个台阶。

第一级,是图片

图片是二维信号,里面藏着空间关系、逻辑关系,甚至物理规律。人获取世界的信号,80%都是来自视觉。

另外,梅涛还观察到一个现象:绝大多数用户在创作时,50%60%时间,其实都花在制作一张图上所以,想要做好视频,就得先把图片模型做好;如果连图片都做不好,那视频就是空中楼阁。

第二级,是视频。

图片在时间轴上延伸,就是视频。这不是让图片动起来那么简单,而是从二维信号走向三维信号的关键一跃。

今天的视频生成主流架构是DiT,和图片模型的底层几乎没有什么区别,所以图片做得好的公司,理论上视频也能做得好。

第三级,才是世界模型。

视频再往前走,会是什么?不是更长的视频,也不是更清晰的视频,而是一个可以交互的世界。

在梅涛的规划里,世界模型的底层只有一个统一架构,但上面长出了三个方向的模型:

往左,消费级视频生成。大家现在看到的AI短剧、AI广告,就是这一路;中间,交互式视频生成。你可以在视频里调整角度、改变剧情走向,画面听你的;往右,具身智能的高精度视频生成。毫米级精度,还要满足物理规律。

这不是三个的独立模型,而是在同一个底座上的三个开关。

那么问题来了:世界模型,到底要怎么造?这个问题圈内吵得不可开交,但掰开看,主要两派。

一派以李飞飞为代表,主张复刻世界。把物理世界用AI原封不动地建模出来,1:1还原,要真,要像,要能跑。

另一派以杨立昆为代表,主张不必复刻。世界模型不需要完全真实,只要能预测、能推理,够用就行。

而梅涛选的是第三条路。

他说:我希望从世界中学习,把世界重构一遍。不是创造世界,而是mold这个世界。按照我们的想象,去构建、改造、编辑它。

他用的词是mold(塑造),不是copy(复制),也不是create(创造),这个区别很重要。

如果只是复刻现实,价值上限就是仿真,游戏、影视、数字孪生,天花板一眼能看到头。但如果是重构和编辑,想象力就会大得多:你可以在虚拟世界里,测试一个还不存在的产品可以让AI预演一个决策的后果。

这也就解释了,为什么世界模型和短剧、互动内容天然相关。短剧本质上就是一种轻量级世界模型:有人物,有场景,有因果,有选择。

只不过,今天的短剧是人类写出来的;未来的短剧,可能是世界模型自己长出来的。

  现在的世界模型,还只是个半成品  

但是,如果你以为世界模型马上就能用了,那就错了。梅涛的判断很冷静:现在的世界模型,其实非常早期。

一方面,模型还太小。

现在所有的世界模型,包括具身智能模型,体量大概只有70B到一两百B参数,跟语言模型动不动上千亿的参数比,差了一个数量级。

说到底还是数据不够。智象一年的数据是100PB1PB=1000TB),但距离训练一个真正通用的世界模型,还差得远。

另一方面,精度不够。

现在的视频生成模型,看上去符合物理规律,实际上并没有物理规律。

梅涛举过一个例子:他们和具身智能公司合作,第一版生成的视频,视觉上看,手把东西捡起来了,挑不出毛病。但仔细看,手指的精度是不够的,并且会和物体的交互有偏差。

人在抓东西的时候,有时候三个手指,有时候五个手指。但AI生成的视频,一定是用五个手指抓,因为在给它的训练数据里,五个手指抓的场景最多。

三个手指抓到底对不对?AI并不知道。这就是当前世界模型存在的问题:它看起来对,但你不能真的用它来控制机器人。

还有一个更关键的点算力差了100倍。

真正通用的世界模型,需要多少算力?梅涛的估算:今天的10倍到100倍。

他算过一笔账,要把具身智能的所有数据(XYZ坐标、六个自由度、触觉、温度),连同视频、图片、语言,全部塞进同一个模型里一起训练。

但这需要三个前提:足够多的数据、足够强的架构、足够多的算力。而今天,没有一家公司同时拥有这三样。

所以他的判断是:真正意义上的通用世界模型,可能还要510年。

所以,字节们急着发布世界模型版本,和梅涛说的510年并不矛盾。一个抢的是阶段性身位,一个看的是通用世界模型的终局。

只不过,这两者之间还横着数据和算力两座大山。

但别急着失望。终局很远,路上的生意已经开始了。智象现在做的一门生意很有意思:给具身智能公司卖数据。

具身智能行业有个共同的痛点那就是缺高质量数据。需求量级是千万小时到亿小时级,采集成本高得吓人。

智象的解法是数据增广:客户给一份真人遥操数据,智象用生成模型把它变成100份、1万份。背景可以换,肤色可以换,场景可以换,但精度不变这个误差可以控制在两三个毫米以内。

一份变一万份,这不就是某种程度的世界模型吗?

梅涛很清楚自己的定位:“铲子”的人。不管具身智能最后剩下几家,所有公司都需要数据。这就是最确定的生意。淘金的人来来去去,卖铲子的从来不愁。

  世界模型和短剧,关系比你想的大得多  

看到这里,你可能会问:世界模型这么高大上的话题,跟我一个做短剧、做内容的,到底有什么关系?

说实话,关系比你想象的大。

第一,短剧是视频生成最先商业化的场景之一。智象的客户里,很大一部分就是短剧和电商商家。AI把视频制作成本打下来之后,短剧率先跑通了商业模式。但这只是第一步。

第二,互动短剧,是交互式视频的试验场。梅涛说的交互式视频生成,在视频里可以做选择、调整方向、改变命运,这不就是互动短剧吗?

今天的互动短剧,还是分支树结构:编剧提前写好几条线,观众选AA线,选BB线。但分支树有个绕不开的代价:每一条线都要提前写好、提前制作,选择越多,成本越高。

而世界模型成熟之后,互动短剧就不需要提前写分支了。你说一句话、做一个动作,世界模型就能实时生成接下来的剧情,这才是真正的互动内容。

第三,实时,是这场变革的另一半。梅涛把实时列为视频生成最重要的目标之一不是等几分钟才出片,而是几乎当下就能生成。就算不能一步到位,也可以先给你一个预览版看看,方向对了,再精修成片。

实时意味着什么?简单来说,就是互动不再只是选分支,而是对话式追剧;这样一来,直播、游戏、短剧之间的边界就会开始模糊。

文娱行业现在关注的互动内容、实时内容,本质上就长在这条路上。

第四,AI短剧的终局,可能是世界模型的一个子集。当世界模型能生成符合物理规律、有逻辑因果、有人物性格的连续视频时,短剧就不再是拍出来的,而是长出来的。

你输入一个设定,它给你一整部剧,而且每一遍都不一样。到那时候,内容生产者的角色也会跟着变:从写剧本,变成写世界设定。

这个未来可能还远,但路径已经非常清晰了:图片→视频→交互式视频→世界模型。

而且你会发现,字节在做实时生成,谷歌在做全模态统一,生数、智象在做世界模型底座。巨头们抢的,正是这条路径上的关键卡位。

而短剧行业的人,可能是最早感知到这条路径变化的一群人。因为你们离钱最近,离用户最近,也离内容的生产端最近。所以,别等世界模型成熟了才动手。等它成熟的时候,牌桌早坐满了。

采访最后,主持人问梅涛:你相信超级人工智能会实现吗?他说"超级人工智能一定会实现的。"

世界模型不是终点,而是新的起点。图片是入口,视频是过程,世界模型是终局。而终局不是终点,当你真的站在那里,就会看到更远的路。


【声明】内容源于网络
0
0
短剧自习室
各类跨境出海行业相关资讯
内容 400
粉丝 3
短剧自习室 各类跨境出海行业相关资讯
总阅读55.7k
粉丝3
内容400