Google AI推出了一款全新的视频生成模型VideoPoet ,与以往的视频生成模型不同,VideoPoet基于大语言模型(LLM)的自回归架构来实现视频生成,为用户带来了更加丰富多样的视频创作体验。
传统的视频生成模型,如Stable Video Diffusion和Video Diffusion,使用了扩散架构来生成视频。而VideoPoet则通过将多种视频生成能力无缝集成于一个LLM模型中,为用户提供了更为便捷高效的创作选择。下图展示了VideoPoet的多种能力,包括文本生成视频、图像生成视频、视频风格化、视频场景拓展等功能。

VideoPoet的出现,给用户带来了诸多的创作可能性。首先,用户可以通过输入文本,借助VideoPoet生成与文本内容相关的视频素材,实现文本生成视频的功能。这对于广告创意、影视剧本创作 (小姐姐拍抖音/个人Vlog 旅行视频) 等方面具有重要意义。其次,VideoPoet还能够将图像转化为视频,用户只需输入一张图片,即可生成与该图像相关的动态视频,极大地拓宽了图像创作的想象空间。
-图片生成视频
-文本生成视频
-视频场景拓展
LLM(Language-Conditional Large Language Models)通过处理离散的tokens来实现生成,这种方法已经被广泛用于自然语言处理和生成领域。结合MAGVIT V2和SoundStream作为Tokenizer来处理视频和语音数据,对于实现多模态生成确实是一个非常有前景的方法。


Prompt:
Left: “A woman turning to look at the camera.”
Right: “A woman yawning.”
左: “一个女人转向镜头。”右: “一个女人打哈欠。
这个问题的主要原因之一是训练素材的限制,这在某种程度上让人感到遗憾。
然而,VideoPoet采用了一种巧妙的方法来解决这个问题,它通过重复的方式延长了视频长度。具体来说,它让AI在前一个视频的最后一秒的基础上预测下一秒的内容,从而实现了视频长度的显著增加。更令人印象深刻的是,这种方法还能够保持对原始视频内容的高保真呈现。
Prompt: Two raccoons on motorbikes on a mountain road surrounded by pine trees, 8k
提示词:两只骑着摩托车的浣熊在松树环绕的山路上,8公里。
扩展视频:
提示词:两只骑摩托车的浣熊。一场流星雨落在浣熊身后。流星撞击地球并爆炸。
交互式编辑:

当用户输入原始视频(即左侧第一段)后,VideoPoet就能自动生成中间三段不同动作的视频。如果用户想要更丰富的效果,还可以添加新的提示词,如“在背景中加入烟雾”,来生成更丰富的效果。
风格化 Stylization
Prompt: Teddy bears ice skating on a crystal clear frozen lake.
提示词:泰迪熊在清澈的冰冻湖面上滑冰。

Prompt:
Left: “Wombat wearing sunglasses holding a beach ball on a sunny beach.”
Middle: “Teddy bears ice skating on a crystal clear frozen lake.”
Right: “A metal lion roaring in the light of a forge.”





人类在火星上建造高速公路,电影感
Prompt: Humans building a highway on Mars, cinematic.
Prompt: An astronaut waving a sparkler, high contrast.
提示词:一位宇航员挥舞烟花,高对比度
来点炸裂的:

Prompt: An astronaut starts dancing on Mars. Colorful fireworks then explode in the background.”
提示词:一个宇航员开始在火星上跳舞,五颜六色的烟花在背景中爆炸。
应用视觉样式和效果 (同一组主题,不同风格化)
样式和效果可以很容易地在文本到视频生成中组合。我们从一个基本提示开始,并在其上附加一个样式。
提示词:“一名宇航员在郁郁葱葱的森林中骑马”。 (改变提示词的场景细节,宇航员在不同视频风格场景下骑马)

课后题:小姐姐拍抖音/个人Vlog 旅行视频 是否可用上此功能?
摄像机运动是视频制作中不可或缺的一部分,它可以给观众带来丰富多样的视觉体验。而通过在文本提示后附加所需的摄像机运动类型,VideoPoet可以精确控制摄像机的运动,让你的视频更加引人注目和生动。 还有缩放、无人机拍摄等多种视角可供选择。

VideoPoet也可以输入带mask的视频,来实现视频的Inpainting和outpainting

Google将VideoPoet与其它模型进行了人工评测,从text fidelity和motion interestingness上VideoPoet有明显优势:
勤奋如Google,一个月内连发好几款新模型。也有蓄势待发的Midjourney,时隔9个月后终于要发布V6版本。根据实测反馈,V6在处理图片的层次、光影和皮肤纹理等细节上都有了质的提升,让人不由期待即将发布的正式版本

Google的开发团队认为,LLM(Large Language Model)在多种模式上具有出色的学习能力。他们选择将多种不同的视频生成功能集成到一个大型语言模型中。这些功能包括文本生成视频、图像生成视频、视频风格化以及视频修补等
VideoPoet的推出,标志着视频生成技术的一次重要突破。其基于大语言模型的自回归架构,不仅提供了更多样化的创作能力,而且在生成效果上也更加出色。通过深度学习和大数据技术的结合,VideoPoet能够更好地理解用户的创作意图,并生成出高质量、逼真度更高的视频内容。
未来,视频生成技术将在广告、娱乐、教育等领域发挥巨大作用。而VideoPoet作为视频生成领域的新秀,必将为用户提供更加丰富多样的创作可能性。期待着VideoPoet在未来的发展中,继续推动视频生成技术的创新,为用户创造更多惊喜和价值。
屏幕前的小伙伴在做什么呢?
🎉 喂,朋友们!我有一个超级棒的账号要向大家推荐!这个账号的主人就是
科林!他专注于分享关于跨境电商和生成式人工智能(Generative AI)相关的知识和见解,绝对是该领域的魔鬼战斗士!想要获取科林老师的最新动态和深度解读,一定不能错过他的推文!等等,在接下来的文章中,科林将继续实际操作各种实用且有趣的生成式人工智能 (Generative AI)应用和独特见解。请大家务必保持关注。
随着新年的钟声即将敲响,科林满怀期待地迎来了新的一年。在这个充满喜悦和希望的时刻,向大家致以最诚挚的新年祝福。愿大家在新的一年里心想事成、万事如意。

