大数跨境

实时世界模型进入“全科生”阶段,PixVerse R2先交卷!

实时世界模型进入“全科生”阶段,PixVerse R2先交卷! 量子位
2026-09-23
14
导读:实时性和通用能力全拿下

当前,实时世界模型在画面表现与控制精度上不断进步,但行业始终面临“能力越强,实时越难”的增长瓶颈。相比大语言模型(LLM),世界模型的能力沿稳定路径持续扩展也面临共性难题。

近日,爱诗科技发布全新实时世界模型 PixVerse R2,成功验证了“实时性”与“通用能力”可以兼得。该模型上线即冲上 X 平台热度总榜。

R2 将 LLM 的 Scaling 逻辑真正引入实时世界模型,基于统一可扩展的框架,将完整的时空关系压入模型,使场景能够沿时间持续演化,让世界“记得住”;同时统一文字、图像、声音与动作,实现边生成边响应、音画同步,让世界“控得动”。

从Scaling到能力预算,实时世界模型连撞两堵工程墙

实时世界模型的能力增长长期受限于两道技术工程门槛:

第一道门槛:视觉信息的统一表征难题。相比 LLM 中语言可被压缩为离散的 Token,图像和视频是连续、高维且高度冗余的信息形态。视觉领域长期缺乏一套紧凑、统一且可持续扩展的表征体系,导致视频模型难以沿单一稳定路径持续增长。

△ AI生成

第二道门槛:模型容量与实时计算预算的拉扯。维持实时生成每帧仅有几十毫秒计算窗口,而理解复杂物理关系与长程时空变化需要更大的模型容量。以 Google DeepMind Genie 2 为例,场景与物理能力的增强往往需要以蒸馏为代价,并牺牲部分画质与实时性。

△ Google DeepMind Genie 2报告

对实时世界模型而言,核心难点在于让通用能力与实时运行同时成立。

PixVerse R2:实时世界模型终于有了自己的增长曲线

PixVerse R2 的关键突破在于,将视觉、动作、音频、时序及控制信号统一纳入一套可持续扩展的因果建模框架,为复杂动态世界构建了一套类似语言 Token 的“统一计算坐标系”。

R2 将 Scaling 拆分为模型、数据、任务、控制信号和时间尺度五个协同增长的维度。任意维度的资源增加都能增益其他维度,使模型真正从“参数规模扩展”迈入“世界状态空间扩展”。

在实际体验中,R2 支持赛博世界探索、互动影游及实时数字人等场景。用户可通过键盘与 Prompt 实时控制视角、角色动作与剧情走向,画面生成丝滑无延迟,实时性、画质与交互控制均达到较高水准。

△ AI生成

能力先拉满,实时再追回来

R2 摒弃了传统的“在固定计算预算内做减法”的思路,采用“能力与实时分头强化”的技术架构:

1. Omni Causal AR(全因果自回归框架)负责拉高能力上限。将多模态信号统一进因果自回归框架,通过动态 Chunk 适配不同时间尺度,解决长程生成中的误差累积与状态断裂问题。

2. Real-Time Acceleration(实时加速层)负责保障实时性。将通用能力蒸馏进实时加速层,在维持世界理解逻辑的同时,将能力完整压进实时计算预算。

爱诗科技凭借长期服务亿级用户的实践,沉淀出这套“先放大能力、再单独解决实时效率”的技术路线。

未来,该架构的外溢价值将赋能内容生产、具身智能、虚拟人和游戏实时渲染等领域。在互动娱乐市场,剧情与场景将从预设的固定内容,转变为随用户行为动态演化的系统,推动数字世界迈向“内容不再被完成”的新纪元。

【声明】内容源于网络
0
0
量子位
各类跨境出海行业相关资讯
内容 16473
粉丝 1
量子位 各类跨境出海行业相关资讯
总阅读448.7k
粉丝1
内容16.5k