谷歌推出Genie
引领生成式交互环境的革命
开启虚拟世界的新纪元
Sora 刚面市不久,谷歌便推出了其世界模型,显示出了更为强大的功能,具备「自主可控」的虚拟世界生成能力。
谷歌最近推出了生成式 AI 的新范畴——生成式交互环境(Genie,Generative Interactive Environments)。Genie 是一个拥有 110 亿参数的基础世界模型,能够根据单个图像提示创建出可互动的游戏环境。
我们可以用它从未见过的图像进行提示,然后与自己想象中的虚拟世界进行互动。
不论是合成图像、实拍照片还是手绘草图,Genie 均能够基于这些内容创造出无限的互动世界。
Genie 由三个部分组成:一个潜在动作模型,用于推断每对帧之间的潜在动作;一个视频 tokenizer,用于将原始视频帧转换为离散 token;一个动态模型,用于在给定潜在动作和过去帧 token 的情况下,预测视频的下一帧。
这项技术的发布让许多人认为,谷歌再次引领了 AI 技术的发展。
此外,谷歌指出,通过 Genie 学习的潜在动作能够迁移到真实世界中人类设计的环境,为机器人领域的潜在世界模型应用提供了一个概念验证。
这项技术可能对游戏、设计、XR、机器人等行业产生颠覆性影响。
Genie 的革命性意义可以从四个方面理解:
首先,Genie 能够在无动作标签的情况下学习控制。通过大量的公开互联网视频数据集训练,而无需任何动作标签数据,Genie 能够学习到精细的控制细节。
其次,Genie 为下一代「创作者」提供了工具。仅需一张图像即可创造出全新的互动环境,开启了进入虚拟世界的新途径。
再次,谷歌认为 Genie 是实现通用智能体的关键。过去的研究显示,游戏环境是开发 AI 智能体的有效平台,现在有了 Genie,未来的 AI 智能体可以在不断生成的新世界中进行无限的训练。
最后,谷歌提到,Genie 是一种通用方法,适用于多个领域,无需任何额外的领域知识。尽管主要使用的是 2D 平台游戏和机器人视频数据,但这种方法具有广泛的适用性,可扩展至更大的互联网数据集。
谷歌在 RT1 的无动作视频上训练了一个较小的 2.5B 模型。与 Platformers 的情况一样,具有相同潜在动作序列的轨迹通常会表现出相似的行为。
这表明 Genie 能够学习一致的动作空间,这可能适合训练机器人,打造通用化的具身智能。


