大数跨境

越大越强,不再是 LLM 的专利:PixVerse R2 攻克实时世界模型 Scaling 难题

越大越强,不再是 LLM 的专利:PixVerse R2 攻克实时世界模型 Scaling 难题 AI科技评论
2026-09-23
5
导读:AI 视频的下一战:谁能让世界保持运行

AI 视频的下一战:谁能让世界保持运行

作者丨Reah

编辑丨李娜 岑峰

大语言模型已经用 Scaling 证明,模型、数据和算力可以持续换来更强能力。那么,必须一边生成、一边回应用户的实时世界模型,能否也走上这样一条路?

2026 年 1 月,爱诗科技提出“通用实时世界模型”产品方向并推出 R1。目前,PixVerse R2 已全量上线,用户可直接在网页端体验动作指令和互动影游交互。

01 实时世界模型,能走上 LLM 的 Scaling 之路吗

过去几年,Scaling 最具确定性的成功故事来自大语言模型(LLM)。随着模型容量、训练数据和计算规模扩大,语言模型获得了更强的理解、推理与泛化能力,“越大越强”成为产业共识。

但若将此经验迁移到世界模型,问题则复杂得多。语言模型可集中计算后作答,而实时世界模型必须一边运行,一边接收用户的动作、文字和声音,同时持续输出连贯的音视频内容。

这形成了一组长期矛盾:实时要求模型快且高效,通用要求模型强且见多识广。能力提升会增加计算负担;若为速度压缩能力,体验又会局限于专项模型。

为什么实时世界模型不能简单复制 LLM 的 Scaling?PixVerse R2 给出的答案是:将能力与效率拆成两层推进。

R2 将五类增长纳入同一可扩展框架,使生成质量、长程一致性和多模态控制能够共同提升

02 一次生成,怎样变成一个持续运行的世界?

进入 PixVerse R2 实时生成的“冬日宫殿”世界,用户面对的是一个真实运行的环境。WASD 和方向键控制移动与视角,新指令可继续改变体验。用户始终留在同一世界,决定下一刻的发生。

技术报告的 Scaling 最终需回归产品检验:它能否让用户进入一个世界,而非仅仅在视频上叠加控制按钮?

通过分析会话的 HAR(浏览器网络活动飞行记录仪)记录,我们发现关键事实:客户端全程只观察到一次 session_init 和一次 generation_started。八轮推荐 Prompt 共享同一条内容流,所有操作均在同一条持续 session 中完成。

这意味着,八轮 Prompt 并非独立的视频任务,而是当前世界下一步变化的连续控制输入。一次生成不再以交付文件为终点,而是成为后续行动不断发生的环境。

多轮输入持续发生在同一产品会话;该数据反映客户端协议

在同一会话中,HAR 记录到 3,355 条结构化 action_frame,发送间隔中位数约 29.9 毫秒(约 33.4Hz)。用户操作时,客户端持续发送高频、低层控制流,而非偶尔触发的文字命令。

这对应着世界模型产品化的分水岭:传统 AI 视频的 Prompt 决定内容形态,而在持续世界里,Action 决定用户此刻的行为。当 Prompt 和 Action 进入同一运行过程,用户与模型的关系将从“提出要求、等待结果”变为“进入环境、持续行动”。

WASD 以高频结构化 Action 流进入实时会话,而不是被转写成一条文字 Prompt

语言与动作无需轮流占用世界。处理语义指令时,WASD 通道仍保持开放。两类输入可同时进入运行中的世界会话。这是“多模态控制”走向产品体验的关键,用户无需在动作和语言模式间反复切换。

Prompt 处理期间,Action 仍持续进入同一会话

延迟数据显示,Prompt 发出后 prompt_updated 中位耗时约 1.33 秒,prompt_generated 约 4.27 秒。这表明从接收、审核到世界流更新,R2 已建立起一套秒级 Prompt 协议链路。

R2 的 Prompt 响应分为多个协议阶段;1.33 秒是协议更新时间

初始化消息显示,“冬日宫殿”由首帧和 345 个字符的 world setting 启动。页面未播放预置底片,而是通过 pipeline=r2 返回持续生成的实时媒体。World 层已将控制信号与时间尺度 Scaling 外化为同一会话里的 Text、Action 和持续媒体。更多输入不再意味着割裂的生成任务,而是共同作用于一个运行中的世界。

Winter Palace 从首帧和世界设定启动,由 R2 pipeline 持续返回实时媒体

03 世界能力,怎样被组织成一段更长的叙事?

如果说“冬日宫殿”展示了“世界如何持续回应”,那么互动影游 Zero Mark 则展示了该能力“如何进入更长、更有结构的内容产品”。

两者分工明确:World 提供 WASD、镜头和 Prompt,强调自由移动与即时变化;Story 以结构化剧情和电影化演出组织长叙事。

HAR 确认两者采用不同 pipeline。Zero Mark 使用 director pipeline,维持了约 20 分钟的长 session,状态保持 ACTIVE,并出现多次媒体轨道分段切换与结构化剧情选择。

World 强调持续生成和低层控制,Story 强调长叙事的编排与节奏

Zero Mark 通过 Director 维持长叙事,在同一会话中结合结构化选择、实时媒体及预置的关键电影资产。这种分工让生成式内容更接近可稳定交付的互动产品。World 提供开放性,Director 负责将变化组织进剧情结构,关键资产确保重要演出的完成度。任务与时间尺度的 Scaling,体现为模型能力被组织进更长、更完整的互动叙事。

Zero Mark 以 Director 长会话组织关键电影资产、结构化选择与实时媒体

04 技术解法:R2 如何让能力与效率不再互相妥协?

PixVerse R2 上线后迅速登上 Twitter 热度总榜

过去多阶段路线往往在不同模型和训练目标间反复迁移,增加系统复杂度并折损已有能力。PixVerse R2 的答案是将能力与效率拆到两个层次分别推进:

Omni Causal AR(能力引擎):负责抬高世界模型能力上限。将文字、参考图、声音和 Action 纳入统一的因果世界模型,通过 Dynamic Chunk、分层历史与对象状态机制及 Error Bank 等设计,持续吸收更多维度,做高能力上限。

Real-Time Acceleration(加速引擎):负责将上游能力带回低延迟运行区间。通过同源蒸馏、稀疏计算和金字塔式少步生成,将生成、控制和长程能力完整带入实时区间,并试图将模型压缩至消费级单卡可实时运行的范围。

这就是从五层接力到两步直达:先穷尽能力边界,再攻克效率边界。让能力与效率分工,而非在质量和速度间做静态妥协。

R2 先扩展世界模型能力上限,再通过独立加速层将能力带入低延迟运行区间

PixVerse 为什么走向实时世界?

爱诗走向 R2,源于对问题的重新定义:如何让生成内容成为用户可进入、可行动的世界。R1 将生成视频转为持续交互,R2 将能力扩展与实时运行分层,同时解决了模型与产品问题。

PixVerse 拥有全球 1.5 亿用户,C 端和出海基因让实时世界模型更早进入真实使用场景,持续为迭代提供反馈。同时,爱诗积累了生成算法与大规模实时系统工程,将实时世界模型从研究能力转化为普通用户可直接体验的环境。

R2 同时面向普通用户、开发者和内容创作者开放

世界模型正在竞争什么?

世界模型正沿不同路线抬高能力边界:Genie 3 强调高分辨率与一致性;Decart Oasis 3 侧重低延迟与多视角;World Labs Marble 聚焦可编辑的显式 3D 世界等。

传统方案需在能力与效率曲线上寻找静态坐标。R2 通过 Omni Causal AR 与 Real-Time Acceleration,让能力和效率分别推进,使整条曲线具备向右上方移动的可能。其差异不仅来自新模型,更来自将模型、运行时和消费产品共同设计的路径。

更强的模型可能运行得更慢,更快的模型又可能只覆盖少量任务

当内容从文件变成 Session,生成式娱乐会怎样变化?

AI 视频的产品单位是文件:用户输入、等待、获得结果。实时世界模型的产品单位是 Session:用户进入、行动、世界持续回应。视频从最终目的变为共同经历的记录。

当内容单位从文件变为 Session,行业关注指标将发生变化:输入反馈延迟、状态维持时长、持续行动能力及多参与者支持等,将成为新的竞争变量。

一套生成式娱乐技术栈正逐渐清晰:World Model 提供生成与模拟能力,Agent/Director 维持叙事结构,Runtime 管理状态与实时反馈,Assets/Rules 守住内容完成度与安全性。基础模型决定上限,产品架构决定能力能否被稳定消费。

该图用于说明世界模型从能力走向内容产品所需的系统分工

未来,API 和创作工具将让游戏、互动影视等团队定义自己的世界。生成能力不仅减少素材制作,更让同一份内容面对不同用户时当场生长出不同过程。长远来看,世界模型有望从内容工具演变为生成式数字世界的基础设施。

05 R2 还没有解决什么?

目前,R2 并非完善的游戏引擎或完全开放世界。实测中,从点击 Explore 到首帧可见耗时约 7.86 秒;进入世界后,Prompt 更新中位耗时约 1.33 秒,完整生成耗时约 4.27 秒。首次进入与指令响应已成为两条可分别优化的链路。

从模型 Demo 走向大规模产品,下一阶段的考题将转向冷启动、资源调度、长会话稳定性和单位算力效率。Scaling 的意义在于让能力在真实约束中持续服务更多用户。

06 当一次生成不再结束,实时世界模型会走向哪里?

“冬日宫殿”证明 R2 将动作帧和指令组织进同一持续 session;Zero Mark 展示了 Director 如何为开放能力补上叙事结构。

PixVerse WASD 实时世界体验录屏

AI 视频是工具:输入、等待、得结果。实时世界模型是环境:进入、行动、世界回应。当这套能力沿统一架构吸收更多任务与时间尺度,它将成为下一代生成式数字世界的基础设施。

真正改变时代的技术,是找到一条可以持续变强的路。R1 让视频开始实时回应人,R2 让这个世界拥有继续变强的路径。越大越强不再是 LLM 的专利,世界模型也终于走到了自己的 Scaling 时刻。

【声明】内容源于网络
0
0
AI科技评论
聚焦AI前沿研究,关注AI工程落地。
内容 8971
粉丝 0
AI科技评论 聚焦AI前沿研究,关注AI工程落地。
总阅读255.4k
粉丝0
内容9.0k