大数跨境

Google AI发布新视频生成模型,生成超酷惊艳视频 10秒+自动音效

Google AI发布新视频生成模型,生成超酷惊艳视频 10秒+自动音效 电商运营人工智能艺术天才科林
2024-01-09
3
导读:Google AI发布新视频生成模型,生成超酷惊艳视频 10秒+自动音效

Google AI推出了一款全新的视频生成模型VideoPoet ,与以往的视频生成模型不同,VideoPoet基于大语言模型(LLM)的自回归架构来实现视频生成,为用户带来了更加丰富多样的视频创作体验。

传统的视频生成模型,如Stable Video Diffusion和Video Diffusion,使用了扩散架构来生成视频。而VideoPoet则通过将多种视频生成能力无缝集成于一个LLM模型中,为用户提供了更为便捷高效的创作选择。下图展示了VideoPoet的多种能力,包括文本生成视频图像生成视频视频风格化视频场景拓展等功能。

VideoPoet的出现,给用户带来了诸多的创作可能性。首先,用户可以通过输入文本,借助VideoPoet生成与文本内容相关的视频素材,实现文本生成视频的功能。这对于广告创意、影视剧本创作 (小姐姐拍抖音/个人Vlog 旅行视频) 等方面具有重要意义。其次,VideoPoet还能够将图像转化为视频,用户只需输入一张图片,即可生成与该图像相关的动态视频,极大地拓宽了图像创作的想象空间。

-图片生成视频

-文本生成视频

-视频场景拓展

LLM(Language-Conditional Large Language Models)通过处理离散的tokens来实现生成,这种方法已经被广泛用于自然语言处理和生成领域。结合MAGVIT V2和SoundStream作为Tokenizer来处理视频和语音数据,对于实现多模态生成确实是一个非常有前景的方法。


01




图片生成视频





蒙娜丽莎打哈欠
通过文本提示词来控制输入图像的motion以生成不同的视频
用户还可以精确控制从图像生成视频的过程,就像下面这样让蒙娜丽莎转头并打哈欠一样。这种精细的控制使得创造出令人印象深刻的自定义视频成为可能

Prompt:

Left: “A woman turning to look at the camera.” 

Right: “A woman yawning.” 

左: “一个女人转向镜头。”右: “一个女人打哈欠。





02




文本生成视频





骷髅喝苏打

Prompt: A skeleton drinking a glass of soda.
提示词: 一个骷髅在喝一杯苏打水。

木乃伊走出卢浮宫
Prompt: A mummy walking outside the Louvre with the pyramid
in the background.  
提示词:一具木乃伊在卢浮宫外行走,背景是金字塔
视频延长
当涉及到AI视频生成工具时,一个主要问题是视频长度通常仅为2-4秒。就像Stability AI的AI视频生成模型Stable Video Diffusion一样,它也面临这个挑战。

这个问题的主要原因之一是训练素材的限制,这在某种程度上让人感到遗憾。

然而,VideoPoet采用了一种巧妙的方法来解决这个问题,它通过重复的方式延长了视频长度。具体来说,它让AI在前一个视频的最后一秒的基础上预测下一秒的内容,从而实现了视频长度的显著增加。更令人印象深刻的是,这种方法还能够保持对原始视频内容的高保真呈现。






03





视频场景拓展



        

机车浣熊流星雨地球爆炸效果
输入视频

Prompt: Two raccoons on motorbikes on a mountain road surrounded by pine trees, 8k

提示词:两只骑着摩托车的浣熊在松树环绕的山路上,8公里。

扩展视频

Prompt: Two raccoons on motorbikes. A meteor shower falls 
behind the raccoons. The meteors impact the earth and explode.

提示词:两只骑摩托车的浣熊。一场流星雨落在浣熊身后。流星撞击地球并爆炸。

交互式编辑:

当用户输入原始视频(即左侧第一段)后,VideoPoet就能自动生成中间三段不同动作的视频。如果用户想要更丰富的效果,还可以添加新的提示词,如“在背景中加入烟雾”,来生成更丰富的效果。





04




风格化





泰迪熊冰冻湖面上滑冰

风格化 Stylization

Prompt: Teddy bears ice skating on a crystal clear frozen lake.

提示词:泰迪熊在清澈的冰冻湖面上滑冰。

视频风格化,我们在将一些额外的输入文本送入VideoPoet之前,先预测输入视频的光流和深度信息,然后转成风格化的视频

Prompt:

Left: “Wombat wearing sunglasses holding a beach ball on a sunny beach.” 

Middle: “Teddy bears ice skating on a crystal clear frozen lake.” 

Right: “A metal lion roaring in the light of a forge.”






05




熊猫博士








熊猫博士做化学试验
Prompt: Panda mad scientist mixing sparkling chemicals, 
art station, cinematic.
提示词:熊猫疯狂科学家混合闪闪发光的化学物质,艺术站,电影感
科林教授像熊猫药剂师一样调配不同Generative AI组合




06




加入音效




AI 距离电影动画更近一步




加入音频效果:加入电影级的音效,效果逼真。告别“默片时代”,AI生成视频离电影和动画距离又近一步,有种科幻大片《后天》的既视感.





07




电影级画面





火星高速公路 电影质感

人类在火星上建造高速公路,电影感

Prompt: Humans building a highway on Mars, cinematic.




           

08




交互式编辑





火星上的科目三

Prompt: An astronaut waving a sparkler, high contrast.

提示词:一位宇航员挥舞烟花,高对比度

来点炸裂的:



Prompt: An astronaut starts dancing on Mars. Colorful fireworks then explode in the background.”

提示词:一个宇航员开始在火星上跳舞,五颜六色的烟花在背景中爆炸。

应用视觉样式和效果 (同一组主题,不同风格化)

样式和效果可以很容易地在文本到视频生成中组合。我们从一个基本提示开始,并在其上附加一个样式。

提示词:“一名宇航员在郁郁葱葱的森林中骑马”。 (改变提示词的场景细节,宇航员在不同视频风格场景下骑马

课后题小姐姐拍抖音/个人Vlog 旅行视频 是否可用上此功能?






09




运动拍摄




准确控制摄像机的运动

摄像机运动是视频制作中不可或缺的一部分,它可以给观众带来丰富多样的视觉体验。而通过在文本提示后附加所需的摄像机运动类型,VideoPoet可以精确控制摄像机的运动,让你的视频更加引人注目和生动。 还有缩放、无人机拍摄等多种视角可供选择。






10




输入带遮盖的视频



总之,通过在文本提示后附加所需的摄像机运动类型,VideoPoet可以帮助你精确控制摄像机的运动,让你的视频更具有视觉冲击力和吸引力。不论是旅游、体育、音乐还是其他类型的视频,合理运用摄像机运动可以让你的作品更加生动有趣,给观众留下深刻的印象。让我们利用VideoPoet的强大功能,创作出令人惊叹的视频吧!

输入带遮盖的视频

VideoPoet也可以输入带mask的视频,来实现视频的Inpainting和outpainting






     


对比测评
     

Google将VideoPoet与其它模型进行了人工评测,从text fidelity和motion interestingness上VideoPoet有明显优势:


   

                   




                                  



2024 展望


勤奋如Google,一个月内连发好几款新模型。也有蓄势待发的Midjourney,时隔9个月后终于要发布V6版本。根据实测反馈,V6在处理图片的层次、光影和皮肤纹理等细节上都有了质的提升,让人不由期待即将发布的正式版本

Google的开发团队认为,LLM(Large Language Model)在多种模式上具有出色的学习能力。他们选择将多种不同的视频生成功能集成到一个大型语言模型中。这些功能包括文本生成视频图像生成视频视频风格化以及视频修补

VideoPoet的推出,标志着视频生成技术的一次重要突破。其基于大语言模型的自回归架构,不仅提供了更多样化的创作能力,而且在生成效果上也更加出色。通过深度学习和大数据技术的结合,VideoPoet能够更好地理解用户的创作意图,并生成出高质量、逼真度更高的视频内容。

未来,视频生成技术将在广告、娱乐、教育等领域发挥巨大作用。而VideoPoet作为视频生成领域的新秀,必将为用户提供更加丰富多样的创作可能性。期待着VideoPoet在未来的发展中,继续推动视频生成技术的创新,为用户创造更多惊喜和价值。

屏幕前的小伙伴在做什么呢?


🎉 喂,朋友们!我有一个超级棒的账号要向大家推荐!这个账号的主人就是

科林!他专注于分享关于跨境电商和生成式人工智能(Generative AI)相关的知识和见解,绝对是该领域的魔鬼战斗士!想要获取科林老师的最新动态和深度解读,一定不能错过他的推文!等等,在接下来的文章中,科林将继续实际操作各种实用且有趣的生成式人工智能 (Generative AI)应用和独特见解。请大家务必保持关注。





随着新年的钟声即将敲响,科林满怀期待地迎来了新的一年。在这个充满喜悦和希望的时刻,向大家致以最诚挚的新年祝福。愿大家在新的一年里心想事成、万事如意。



HELLO  2024
新年伊始,万象更新


【声明】内容源于网络
0
0
电商运营人工智能艺术天才科林
1234
内容 66
粉丝 0
电商运营人工智能艺术天才科林 1234
总阅读0
粉丝0
内容66