作为一个热爱电影的创作者,奥斯卡,我向来都觉得遥不可及。
但今天我离它又近了一点。
这一切,起源于两年前,我在视频 AI 模型上,第一次按下的生成键。
00
序章
今年 3 月份,为了参与某站的 AI 创作大赛,我一个人花了两周时间,创作了一部 8 分钟的创意短片:《带你去玩球!》
半年过去了,截至今日,除了入围具有奥斯卡资格的德黑兰国际短片电影节之外,这只小狗还拿到了美国 Token AI 电影节的最佳分镜奖、韩国济州 AI 电影节的决赛奖、以及数十个海内外电影节的入围资格。
(然而当时某站的比赛,它甚至都没有入围)
虽然这半年里,AI 技术和工具都在飞速发展,但我仍然认为:
影视创作的终点,还是“创作”本身。
所以今天,这篇被无数人催更的【万字复盘】幕后故事,终于来了。
和以往一万字不一样的是,这次有整整两万多字,并且干货密度不降反增。
我会从创作的起点、落地的技术、以及参与电影节的经验这几个角度,来跟各位分享整部片子的创作过程。
这其中有很多超越技术的、真正宝贵的底层逻辑,是十分值得借鉴的。
如果你有真正想讲的故事、想创作第一部高质量短片、想获得第一个电影节荣誉,我相信,这篇文章一定会对你有帮助。
搬好板凳,我们开始。
01
《母猪的产后护理》
谈起这个短片,时间需要先回到去年。
国内四大电影节之一:海南岛国际电影节,在去年举办了第一届 AI 电影黑客松。
电影黑客松,就是把一堆创作者关在屋子里,随机抽一个主题,然后创作者们围绕主题进行几天几晚的现场创作,最终每人交付一个电影短片,并进行评奖。
这次,据说有一百多支顶级创作者队伍,去角逐最终参赛名额,而很幸运的,我的队伍作为 10 强顺利入围。
实话说,那会儿我一边满怀期待,一边又很头疼,因为此行要离开杭州长达 7 天之久。
而我家里,还有一只 4 岁的小狗:刘阿呆
即使有两只猫作为她的宠物,我也给她找了上门寄养,每天会准时来遛她两次,但我仍旧为此焦灼。
这应该是她跟主人分别最久的一次了。
毕竟一只小狗怎么会明白,爸爸出门是要做什么呢?
但最终,在寒风凌冽的 12 月,我还是去了 28 度的三亚。
比赛当天,紧张的备战完全掩盖了我的忧虑。
国内最顶尖的一批创作者,乖乖的在大屏幕前排队罚站,等待“开题”。
随机抽题的规则也设计的非常有意思,主办方分别给了:道具、角色、台词,这三个固定的元素,其中每个元素都有一大堆选项,也就是说,可能抽出来的结果驴头不对马嘴。
但不管多离谱,你都必须将这三个元素组合进自己的故事中。
举个例子:
· 道具:一本《母猪的产后护理》
· 角色:一个外星人
· 台词:“这是我们文明最后的希望。”
这能搭配出什么奇怪的故事...你们自己想去吧。
随着主办方的一声令下,结果出来了:
对我来说,好消息是这些选项没那么离谱。坏消息是,我其实更喜欢抽象和无厘头的东西(比如上面外星人的例子)。
无论是不是 AIGC 影片,剧本都是最重要的因素之一,而“母题”,是重中之重。
因此我们决定在这上面要多花时间,至少找到一个能打动自己的 idea,连自己都打动不了,谈何打动观众呢?
就这样几个小时过去了,毫无进展。
要知道,这部从 0 到 1 的片子,我们需要在 24 小时之内做完。
有经验的朋友们都知道,没头绪的时候,就抽根烟。
一根不够,就再来一根。
02
小狗越狱
不知道第多少根烟的时候,我突然想打开监控看看刘阿呆自己在家里怎么样了。
不出所料,她静静的趴在走廊,紧贴大门,眨巴着眼,不知道在想什么。
我往回翻了翻,除了吃饭和上厕所,几乎所有的时间,她都在那安静的趴着等我回家。
我心头一紧。
之后我不敢再打开监控,心疼。
回到电脑前,我忍不住的想:
我在担心小狗,小狗肯定也在担心我,她能不能猜到爸爸出门做什么呢?
她肯定猜不到。
头狼出门,狼群应该知道头狼是去捕猎了,狗是狼变的,那狗的眼中,我大概率也是去捕猎了。
但阿呆为什么看起来不开心呢?难道不是应该期待我带好吃的给她吗?
我出门这么久还没回家,她会不会以为我出意外了?
但她的脑袋这么简单,可能想不了太复杂的意外,只会认为我被怪兽吃掉了。
Oh shxt !
已经过去了 5 个小时!我还没想出来点子... 算了,先认真比赛。
但是等等,主角,是“送信人”...
谁说送信人送的就必须得是一封真正的信件?
如果阿呆因为担心而想尽办法出门找我,那她对我的那份爱,又何尝不是一封最好的信...
Oh God !
有了!
此时,我脑海中已经有了画面:
一只狗打不开家门,只能翻窗“越狱”,千里迢迢去寻找它的主人。
人类嘈杂的世界对它而言,可能危机四伏。
比如呼啸而过的车流、胡同里的野猫、或路边调皮的男孩... 对一只小狗来说,都是极大的挑战。
那一刻,我有一万份冲动要讲这样一个故事!
不知道你怎么看,但至少这样的话题对我而言是绝对的杀招,甚至在比赛现场,我居然当着这么多人的面,被脑海中构思的画面,给感动哭了。。。
说“感动”也不太严谨,更多的可能还是“心疼”。
如果你也有小狗,想必你一定能理解我的感受。
但此刻,倒计时仍在跳动,比赛仍在继续,需要我解决的问题,还有很多。
03
“带你去玩球!”
比如,最大的一个问题是:
故事有了情绪,不代表情绪就有了故事。
小狗因为担心主人,所以出门找主人。
逻辑没问题,动机也成立。
但如果只是把“出门、遇险、重逢”串起来,那份爱有多深,观众很难感受到。
故事的张力,来自于狗想要完成的事,与挡在它面前的困难。
而有力量的情感,就在于它面对这些困难时,做出的选择。
我需要给小狗一个具体的“信件”来承载那份爱。
这样,它一路上要做的,就不只是找到主人,还要把这封信完好地送到他手里。
当危险来临,它明明可以丢下信件,独自逃走,却最终还是选择回头。
这样观众就能看到,它舍不得丢下一件东西,也就能感受到,它舍不得放下一个人。
为了保护这封信,本来胆小的它,有了挑战全世界的勇气。
这就是我所说的“故事”。
那么问题来了,她到底会带着什么去找主人呢?
给主人擦眼泪的纸巾?一大块骨头?
不不不,都太俗了。
刘阿呆最喜欢什么呢?
毫无疑问,喜欢球。
每次陪她玩球,阿呆开心的能把尾巴甩成鞭子,甩脸上生疼。
“球”这个字就跟开关似的,我一说“球”,她上一秒还在打呼噜,下一秒就已经歪头盯着我看了。
但问题又来了:
正确的逻辑,不应该是“狗喜欢什么”。
而是狗认为“人最喜欢什么”,然后把人喜欢的东西送出去,才对。
毕竟,你不能因为喜欢打游戏,就在情人节送女神一个机械键盘,还嘚瑟的跟她讲:“青轴,特别响”
所以阿呆会认为我喜欢什么呢?
我也不知道。
没头绪就抽烟,一根不够就两根。
偶然间,一个突如其来的想法,瞬间把脑子里所有杂乱的线都串起来了。
这是一个令我起鸡皮疙瘩的逻辑。
我之所以得出“阿呆喜欢球”的结论,是因为她对待球的表现和反应。
而每次陪她玩球,我也会被她逗得很开心,毕竟,如果心情不好,谁会有心思陪小狗扔球玩?
也就是说,在她眼里,是不是意味着我也喜欢球?
等等...
如果我选择玩球,是为了让她开心,那她选择玩球,有没有一种可能...
是为了让我开心?
她或许也没那么喜欢球?
只是因为她爱我、喜欢看到我开心的样子,所以才一直拉着我玩球?
即使距离我最终做完片子已经半年,但写到这里,这个逻辑依旧让我起了一身的鸡皮疙瘩。
我们以为是在陪狗玩球,但可能在狗的世界中,她其实是在陪人玩球!
带你去玩球,是我常说的一句话,但在这个设定下,这句话是狗的主观表达。
因此毫无疑问的,“球”就成了我选定的那封信。
刘阿呆,就是我的送信人。
想到这,距离比赛结束,还剩十来个小时。
04
“我必须把它拍出来!”
没有一秒犹豫,我们迅速投入了制作。
不知道你有没有听说过,狗和人眼中的世界并不一样。
它们能分辨的颜色比我们少,远处的细节也没有我们看得那么清楚。
所以在视觉风格上,我设计了一种具有特殊美感的质感和影调:
看起来像低饱和度的世界、但又有独特的颜色变化,像近视的世界、但又有超现实的虚实变化。
是不是觉得还挺好看的?
但我可是大羽,不出意外的话我还是我吗?
因此吭吭唧唧干了一个小时之后,我们意识到一个重要问题:
做不完。
又要完美的视觉效果,又要完整的故事,比赛还剩十来个小时,铁做不完的。
不管东西好不好,先做出来才是王道,做不出来就一切都是零。
犹豫再三,忍痛割爱,换一个简单剧本!艹!
好在最终,我们在第一轮比赛中顺利交稿,第二轮决赛,也跟几个队友一起,拿到了海影节黑客松的第三名。
而这个关于狗的故事,就此埋在我心里。
从它诞生的那一刻,到后面的几个月中,我都坚定的知道一件事:
“早晚有一天,我必须把它拍出来!”
片子的起源讲完了,比我设想中写的多,但我觉得还是挺有必要的,其一确实是有感而发,其二,很多朋友经常问我同一个问题:
你的灵感到底哪儿来的?
事实上你看,就是这么来的,并不神奇。
所谓灵感,有时候就是某个很普通的瞬间,让你多想了一步,又多想了一步。
但从“被触动”到“把它拍成作品”,中间还有一段路。
所以面对上述那个问题,我通常给出去的答案有两个:
其一,多看片子,积累表达的经验。
这些经验,会慢慢变成你创作时能够调动的东西。
某一天生活真的触动了你,你脑海里浮现的,就可能不再只有一句“我很难过”,而是一个动作、一个场景,甚至一整段动人的故事。
其二,认真生活。
创作来源于生活,你愿意留意自己的感受,关心身边的人、事、景,才更容易发现值得讲述的故事。
而这些故事之所以能打动观众,是因为他们也有过相似的情感。
他们不一定养过狗,但应该都懂得思念、担心,应该都想让在乎的人开心。
05
先放松,再对自己狠一点
使我正式立项的契机,开头简单说过,是今年三月份,某站的一个比赛,毕竟一百万的奖金太诱人了。
但从 idea 诞生之后,我其实一直在构思这个故事,这种状态很像是软件在手机后台“常驻”,需要时随时可以调用。
我很喜欢开车,因为开车的时候我脑子经常蹦出来一堆奇妙的想法,具体原理我也不得而知。
为此我甚至做了一个插件,只需要喊 siri 唤醒,然后说出我的想法,就可以将文本自动发送给我的飞书 AI 助手,接着助手自动帮我把想法碎片,整理到飞书文档《点子库》中。
比如成片中间狗和猫的黑白画风打架、结尾球被小男孩抢走等,都是在开车路上突然想出来的。
当然,这种碎片化的想法,最终仍需要合理的编排和取舍,否则也只是碎片。
但至少,它比你固定几天坐在那里硬想,要来的轻松且富有更多可能性。
毕竟灵感之所以称之为灵感,不就是灵光一现的感想嘛,它是需要长期积累、需要契机的。
三月的某天,我决定正式开始创作,因为要赶比赛的截止日期,以及不让片子因自己的拖延症和完美主义而流产,我定了个两周的工作节点:
可以看到,我非常具体的规定了第几场戏在几号内完成,而不是用“完成 AI 镜头”这样宽泛的说法来描述任务。
因为我试过,至少对我来说,只要宽泛,我就拖延。
当然,你看到的是最终版本的节点,一开始剧本还没定的时候,肯定是没法写的这么具体的,它需要随着你的制作进度动态优化。
我很建议大家在做片子之前,给自己定时间节点,除了我上述的原因,还有一个很重要的因素,就是“状态”。
创作需要状态,状态好的时候可能有如卡梅隆附体,状态不好的时候,我跟一条死狗没啥区别。
所谓“闭关”这种说法的由来,我认为就是为了让自己能够在一段时间内,持续保持创作的状态。
相比于避免拖延症,“维持状态”的意义会更大一些。
06
编导团队 VS 甩手掌柜
人的脑子很多时候是没有 AI “清醒”的,所以在剧本的创作阶段,我会持续跟 AI 对话,将其当做我的编导团队。
事实上我一直以为大家在创作剧本的时候,都跟我的思路差不多,但后来才发现很多朋友都是把自己的零星想法丢给 AI 之后,就祈祷它一口气就能吐出一个完美且完善的剧本。
很显然,多数时候这不会奏效,所以他们会来跟我吐槽说:AI 还是太菜了,写出来的剧本一坨屎。
但这事,真不能全赖 AI。
我认为剧本质量和 AI 聪不聪明,其实是两码事,因为即使是世界上最好的编剧,你也不能用这种方式和他协作。
就算卡梅隆,也不能说跟御用编剧打个电话,就能收到几百页的完美剧本。
这不是一个技术问题,这是一个协作问题。
从这个角度来说,只要你有审美,知道什么是好的,就总能从一堆沙子里挑出一粒金子,所以模型聪明与否,其实构不成对作品质量的影响,顶多是影响你的工作效率:好挑一点、或难挑一点。
你可能觉得我在胡扯,如果这沙子里压根就没有一粒金子呢?
很简单,没有就不做,反正我不会把一坨屎放进自己的作品中。
所以如果剧本阶段的 AI 不如你意,本质上,我认为是你将 AI 的定位,给定错了。
那时候,我还在用此刻已被戏称为“美国豆包”的 Gemini,半年过去,AI 的智能水平真是天差地别。
但即使如此,如果用合理的方式与 AI 协作,它依旧能成为你的得力助手。
比如上述的那一堆灵感碎片,如果需要形成一个完整的故事,而你又没有头绪,就可以大白话告诉它你的想法,让它给你一些不同的方向:
不得不说,美国豆包确实很豆包,我复盘的时候总心疼自己:当时用的都是什么玩意儿...
但这里 AI 给的具体内容,对我来说,其实并不重要。
真正重要的是:
“我读了它的想法”——“我自己思考和感受”——“判断好不好、以及引发我新想法” 的这个过程。
在这个从阅读到思考的过程中,我原本模糊的想法会逐渐被清晰化,因为我会感受到:
“ 哦!我一定不要这样;哦!那样似乎不错。”
这件事,我称之为“范围收束”。
相信大家在创作前期,都很难一开始就想得非常透彻,一定会有迷茫、模糊的阶段。
究其原因,我觉得就是因为选择过多了:
你的故事可以有一万种讲法,每个镜头可以有一万种拍法,一万乘一万、再乘更多的一万,选择就多到你无法选择了。
而“范围收束”,指的就是将无数个可能性,逐渐收缩到一千个、一百个,最后剩下一个最适合的选择。
本质上就是将创作的填空题,变成选择题,这些选项不一定能直接用,但它们会帮我发现:
我到底不满意什么,又真正想要什么。
而选择的核心依据,则是你自己的经验、感受,和审美。
有了范围更窄的方向之后,我和 AI 会进行更加细致的沟通,注意,这里仍然远未触及到最终剧本的撰写环节。
在剧本之前,我还需要彻底想清楚整个故事的框架、每个段落和每场戏的作用等。
就像一家公司,你能看到员工有张三李四王二麻子,但在那之前,首先有的是这家公司的组织架构,比如管理部、市场部、产品部、财务部等等。
是合适的组织架构让一家公司顺利运转,而不是具体某个员工。
在纠结用张三还是李四之前,你需要先想清楚到底这个部门,存在的目的和必要性。
剧本也一样,每场戏都应该有它存在的叙事目的。
比如,我先让 AI 帮我写一个经典的三幕式结构,去概括每一幕在整个片子中,分别都起到什么作用:
当然,这时候我也会站在更底层的视角,去与其探讨:
最终打磨出一个及格的“地基”之后,我才会进行下一步更加细节的沟通,比如某场戏的节奏是快还是慢。
所以你可以看到,这个打磨的过程,其实还是跟传统影视一样的创作过程:
先想清楚母题、定好结构、最最后才会去纠结每颗镜头到底是什么样的。
我按照与 AI 的沟通顺序,列了个从前往后的截图,你可以更加直观的感受到这一点:
除此之外,AI 还非常适合当做“灵感宝箱”。
(其实人类的编导团队对于 leader 而言,不也是一样吗)
比如我会让 AI 来想象:狗狗眼中的世界,到底是怎样的。
AI 给了我很多好玩的点子,像路边扫地工人的吸尘机器,在狗的眼中是一个“会将全世界吸进去的怪兽”;洒水车又可能是“会喷水的巨型机器人,朝狗狗呼啸而来”。
以及最终成片中用到的,“狗将自己代入到抓娃娃机的狗玩偶”等等,都是 AI 提出的。
但这些点子或多或少,有点过于“童话”了。
一开始我甚至想,要不要将狗眼中的世界,干脆就彻底变成一个“异世界”,用超现实的画面来呈现,然后通过交叉剪辑的方式,来突出这个反差感。
就像胡同里猫狗大战的这段,是不是观感还蛮有意思的:
但最终我还是决定,全片还是保持写实,只在该强化的地方强化,避免为了有趣而有趣。
因此只选择了像娃娃机这种既写实又有趣的点。
总结一下,在前期创意阶段,我使用 AI 的核心思维并不是把它当做一个“神灯”,奢求摸一摸它,就能一句话满足我的愿望。
而是当成一个能把他们拉过来开会的编导团队,将团队杂七杂八的想法,用于启发我自己、提供多种选择,以及激发我的想象力。
真正对方向的把握、故事的感受、情节的设计,仍完全取决于人的判断。
在具体工作过程中,我会像下图这样,准备一个想法碎片库,不管是我想的还是 AI 想的,只要我觉得好,都给它贴进去。
然后时不时的回来看一眼,仍有必要保留的就保留,不合适的就舍弃。
还是那句话:首先要打动自己。
在这种情况下,我完成了最终的剧本。
07
分镜,没有商量的余地
有了剧本之后,我们就要具体构思每颗镜头的样子了,到底是仰视还是俯视、长焦还是广角、固定机位还是推拉摇移等等等等。
这是多数人最头疼的一个环节。
因为你即使没有专业编剧能力,但人物在什么时间发生了什么事,谁都能整两句。
而分镜,你如果不会,那是真不会。
就说看起来最简单的“对话戏”,比如两个人面对面对话,最基础的分镜方式,就是用中景或近景过肩镜头来拍摄正反打,谁说话就拍谁:
看起来非常简单,但想都不用想,你也一定会觉得这样来回切镜头很无聊。
无法想象看五分钟这样的对话,和看五分钟 PPT 有什么区别。
因此没有头绪的你,决定为它们加上一些景别和角度的变化,比如一会儿切两人侧面的全景,一会儿切一下表情特写,至于在哪里切,就全凭感觉:
实话说,这样观感确实好多了,但并不能解决本质问题。
我认为分镜要解决的,是情绪、节奏、观感、叙事等多方面的综合问题,而上面所说“让镜头切的更丰富一些”,则是一个最不重要的问题。
切得更多,不等于讲得更好。
关键是每一个分镜的设计,是否影响了观众获得的信息和感受。
同样是对话戏,我最喜欢来自昆汀《无耻混蛋》的这场戏,看视频:
不知道你看完什么感觉,反正我每次看,都得再起一次鸡皮疙瘩。
当然,能完成这种观感,肯定不全是分镜的功劳,情节本身、演员表演、台词、剪辑节奏、以及音乐和音效等,都在“共同发力”。
但在设计分镜时,导演就已经在主动去把控,这些镜头组合起来之后,会给观众带来怎样的体验。
“ 哪个阶段让观众先慢慢进入情绪?什么时候吊他们胃口?什么时候让他们爽一下?”
分镜里的景别、角度和运动等,都是这些创作判断的具体体现。
理解这个逻辑,你就理解了,为什么 AI 做出来的分镜看似正确,但平平无奇。
因为顺序错了。
你寄希望于 AI 理解你的剧本,并给出一套分镜,用这套分镜就可以讲好这个故事。
但好的结果反而是来自于:
你自己清晰的知道这个故事该怎么讲,哪个部分需要带给观众什么感受,然后调用“分镜”这个工具,就和调用“摄影/剪辑/灯光/美术/声音”等所有工具一样,去统一完成你的表达。
所以这一章节的标题,叫做“分镜,没有商量的余地”,我在个人创作类的作品中,始终坚持手动设计分镜。
当然,随着视听感受逐渐被量化为数学公式和规律,它们或许可以被大模型学习和掌握。
但那可能也只是一份“大家都这么拍”的分镜,而不是一份“我想这么拍”的分镜。
和剧本一样,我觉得理想情况下,人应该做的是一个“选择题”,比如 AI 把所有选项给我列出来、或者给我一万种方案,我来做选择。
我并不排斥“只做选择题、完全不动手”这件事。
但最终的成果一定是“我就想这么拍”才行。
举一个很有趣的例子,本片的前两场戏都发生在主角的家中,一个是在卧室里、一个是在客厅里。
为了确保最终的空间连续性,以及让自己更加直观的去想象:
我到底该如何在这个空间中进行拍摄。
我搭建了一个房间布局的“顶视图”,将主人和狗的位置摆好,然后顺着剧本想象每一颗镜头该放在哪儿:
这样是不是很直观?
其实这个习惯来自传统影视制作,在传统实拍中,导演和摄影指导等主创都要参与一个重要环节:勘景。
简单说就是导演带着一帮子人,来到即将要拍摄的实景中,走一走、看一看、做一做爱做的事。
而勘景中的一大重点任务,就是身临其境的去思考,在当前这个空间中,演员怎么走、摄影机怎么放、怎么打光等等。
比如你应该经常见到有导演比划着手指头、或拿一个镜头一样的东西,跟打狙击似的到处瞄准:
其实他们此时的脑子中,就是在构思:最终的镜头到底长什么样。
只不过实拍可以勘景,AIGC 就只能脑渲了,因此上面我制作的那种场面调度图,就可以很大程度上帮助我完成分镜的步骤。
提到这一点,重要的倒不是说你非得做一个顶视图才行,我更想强调的是:
即使要做这么麻烦的顶视图,我也要仔细的、具体的、清晰的思考清楚,分镜到底怎么拍。
提到分镜在 AIGC 创作和传统影视之间的区别,就不得不提下一个有意思的例子。
在传统影视中,基本是团队协作为主,各部门都需要知道导演大概要怎么拍,因此分镜就需要比较具象和直观,因此多为手绘分镜或参考图分镜(或称故事板)。
而 AIGC 时代,一个人负责全流程制作,会更加常见,甚至成为主流。
(比如我其实就不太擅长团队协作,尤其遇到不专业的团队,有那个沟通时间我都搓俩片子了)
另外在制作流程上,分镜图本身不再只起到“参考”的作用,而是直接作为最终生成 AI 视频的关键资产。
因此在前期构思分镜的时候,“图片类分镜”存在的必要性将极大减少。
比如我这次的分镜,实际上就是纯粹的文字描述:
因为我脑子中已经有清晰的最终效果,不需要再让我之外的任何人来理解,我确保自己在生图的时候,知道是什么意思即可;
等于是构思时,我先用文字把镜头记下来;进入制作后,再去把需要精确控制的镜头做成图片,直接用于后续生成。
这样,我就不必在构思每颗镜头的时候,立刻停下来处理人物一致性、修图和各种工具操作:
因为理想情况下,构思分镜的过程更需要想象和创意,以及“一口气拍完”的创作状态,所以用简约的文字来定分镜,对我来说就是最好的方案。
至于具体分镜构思细节,展开说能说个一天一夜,所以后面有机会再跟大家分享。
最后丢一张美国 Token AI 电影大会,给本片颁发的“最佳分镜奖”,它给了我很多信心。
对了,如果你对我前期创意的工作原文档感兴趣,这里也分享给大家:
https://wdhsud7eok.feishu.cn/wiki/NvZowkgPRisAxbkBtf5ct7B4npf
(仅代表个人工作习惯/仅适用于本片,请按需观看)
08
为成片夯实地基:AIGC 资产
有了分镜,我就清晰的知道每个场景是什么样子、在什么角度拍,就可以统一制作各种资产了。
故事起源于我和阿呆,所以人物自然是以我为原型,而狗狗就以我家阿呆为原型了。
但比较麻烦的一点是,我对本片中小狗“笨笨”的想象,是一只小小的、乖乖的小狗。
而我家阿呆是一只大边牧,贼聪明,敢明目张胆的偷吃猫粮,被抓到还会装作无事发生。
这和故事的气质不太相符,所以最终我用 AI 重新做了个毛色相似的小土狗:
至于制作过程,也有一些值得分享的点。
AI 生图,仅通过提示词毕竟还是有很多随机性的,即使你文本写的再详细,但“感觉”这个东西,就跟你追不到的女孩一样,你说不出喜欢她哪里,但就是喜欢。
所以我建议干脆直接找一个“有感觉”的视觉参考,然后再做调整。
比如这是我在 Tapnow 中,生出笨笨的过程:
可以看到前面三张其实是现实中的小狗,是我在某书上刷到的,我不认识它是谁,只是感觉特可爱,特符合片子要的感觉,就拿它们作为起始参考图了。(谢谢无名小狗的贡献,祝你健康)
然后在生成过程中,感觉体型不对就调一调体型、毛色不对就调一调毛色,这一点相信对能看到这里的朋友来说,都是基操了,我就不再赘述。
做完狗狗的基础形象三视图,我还为它们制作了几组不同表情的资产:
原因有二:
其一是因为这片子中,狗是主角,所以它的表演和情绪很重要,我不想把情绪的随机性交给在视频中抽卡来解决,最好是图片的时候,我就找到最正确的情绪(毕竟生图可便宜太多了...)
其二,则是因为视频模型训练的过程,必然吃了大量的人类表演,所以人类演员我不担心,但动物的表演和情绪,我觉得应该没有太多训练数据吧,毕竟实拍时代有一句流传已久的话:
动物小孩,狗都不拍。
至于人物资产的制作,也是同理,我用自己的 AI 形象照作为起始参考图,然后依次生成不同服装的全身/近景三视图:
但与多数 Tapnow 工作流不同的是,你可以看到:
我并非从起始参考图直接生成为三视图,而是中间先生成了类似剧照一样的图片,最后才生成三视图。
如果你做过很多片子的话应该有这种经验:
最终成片要的是超写实的质感,但其中的人物总感觉油腻、AI 感重,甚至像个 CG 人物一样。
这类情况的原因有很多,其中一种,就是因为参考图提供给视频模型的不只有长相,也包括皮肤质感、光照和整体风格。
而如果参考图已经带着明显的塑料感或 CG 感,后续生成也可能把这些特征带进去。
所以我会先做一张接近成片效果的剧照,确认人物放进这种光线和环境里是对的,再以它为基础生成三视图,这样效果就会好很多,不信你看:
对了,提到风格和质感,对成片影调的把控,也非常重要,我一般称之为“风格资产”。
在前期创意阶段,相信你脑海中已经有大概的风格方向了,但真落实到具体制作,方向就必须要更加具象,这时候一套具体的风格资产就十分有必要。
简单说一下我的做法:
首先,我会在剧本或分镜的基础上,提炼出片子中的几个关键场景。
比如狗和人在卧室的床上、狗在街上跑、以及漫画风格的猫狗大战等。
这一步就完全可以交给 AI 来做,因为我前面跟 Gemini 聊了很多剧本和创意,在这个上下文中,AI 可以很轻易的帮我提取关键场景,并且帮我写出 Midjourney 的提示词:
可以看到,这里我特意强调说不要“风格提示词”,因为风格这事儿等下会集中在 Midjourney 来解决,而别的提示词内容其实就无所谓了,构图是什么、场景准不准,都不重要。
接下来来到 Midjourney 官网,在首页中找到“Styles / 风格”的功能,就可以看到,数不清的风格库了:
你要做的事情非常简单:
在顶部输入框中,输入那段固定的关键镜头提示词,然后在风格库里找你喜欢的风格,找到之后,只需要点击 “Try Styles / 尝试风格” 按钮。
这样,你的提示词就会自动套用这个风格,自动在后台开始库库生成了。
整个操作非常简单粗暴,一阵狂点,你就能获得风格各异的关键镜头。
比如本片的下面这些截图:
接着你要做的,就是找到那个最合适的、你最有感觉的影调和风格,把它当做后面的主风格来使用。
如果找不到,就继续找,十次不行就一百次,像上面截图,可能都只是我工作记录中的百分之一。
当然,Midjourney 的控制性肯定还是没有 banana 或 image2 来得好,所以最终的精细控图还是交给后面两个模型,但选一个独特的风格,我认为还是十分有必要在 Midjourney 中花费一番精力的。
有了风格,场景资产的制作相对就复杂多了,尤其是本片的一些场景,除了提供故事发生的环境之外,也起到辅助叙事的作用。
像前面提到的,我做了俯瞰调度图的那场戏:
笨笨需要躲在卧室的床底下(这源自我家阿呆的习惯),还必须能偷偷看到客厅的主人。
他们俩身处在一个大空间下的两个小空间,有关联,但氛围不同:
这样的叙事要求,就需要场景的一致性和连贯性更加严谨,但这对 AIGC 来说,并非一件易事。
那到底要怎么做到呢?
说来话长...V 我 50 解锁全部内容
开个玩笑,其实之前为了提交电影节相关资料,我就已经做过本片的技术白皮书,并且开源了。
其中就分享了三种我半年前尝试过的场景制作方案,在今天,这些方案或多或少有了更多的落地性,感兴趣可以前往这篇文章的第三章去看一看:《带你去玩球!》技术白皮书
另外,如果你对我的 Tapnow 画布感兴趣,我也开源了,感兴趣可以直接复制下面的链接,看我的幕后工程:
https://app.tapnow.ai/home/taptv/6/fffe3cf6-dc06-4baf-aa56-23fe24bf618f
这样会更加直观。
09
从文字分镜,到图片分镜
有了人物、场景和道具资产之后,就可以按照之前的文字分镜,进行最终分镜图片的制作了。
本片大概 200 颗镜头,其中 90% 的镜头是精细制作了分镜图片的。
可能有部分朋友会好奇:
为什么要有分镜图片?
不是拿人物/场景资产,直接用“多参”就能生成视频了吗?
其实所谓的“多模态参考”,我认为是技术角度下的概念,是类似“文生图”、“首尾帧”之类的技术概念。
即使我九成的镜头都制作了分镜图片,但这并不意味着我拿分镜图用“首尾帧”来生成视频,更多的还是用“多参”。
所以这不是个技术问题,是创作问题。
上面“分镜章节”中其实讲得比较清楚了:
我必须精准把控每个分镜的构图、调度、节奏。
这时候分镜图就极有必要了,仅有角色和场景参考,很难锁定我想要的具体构图。
你可以简单理解为,我是为每颗镜头,制作了“关键帧”。
至于具体的制作方法,我之前的文章讲过无数次,无非就是不断的“修图”,所以这次,主要讲一讲更加底层的逻辑:
如何更高效的精准控制分镜。
将这个制作过程拆解开,可以分为三个步骤:
将人物放进场景中。
修改为想要的视角(包括角度、焦段、构图等)。
修改 BUG。
其中的 1 和 2 ,则需要视情况来调整顺序。
先举一个默认顺序的例子。
在本片第三场戏中,狗狗决定出门之后,有一个“从窗户内探出头向下看”的仰拍镜头:
要制作这颗镜头,我首先需要从场景资产中,截取一扇窗,然后让狗从窗户中探出头(将角色放进场景中):
接着,我主要调整摄影机视角,使图片的景别和角度达到我的预期,最终再修一修 BUG:
这是一个比较典型的精准控图的例子。
那接下来再举一个先调整机位、再放人物的例子。
狗狗出门后,被保安给吓到的那场戏中,有这样一颗低机位的全景镜头:
这次的第一步,我则是先调整出了我想要的视角:
然后在正确视角下,我用红笔画了一个人物站位的参考草稿:
最后,我才用小狗和保安的参考图,将人物按照我的草稿,放进场景中:
可以看到,无论是先调整视角、还是先摆放人物,只要能达到目的,其实都可以。
但之所以会有这两种不同的顺序,是因为在实际制作中,“将人物放进场景中”,并非听起来这样容易,“调整视角”也是。
偶尔甚至会被“AI 不听使唤”这件事折磨的憋一肚子火儿。
你或许也有类似的经历,无论如何就是调不准确。
这时候,或许你换个操作的顺序,一切就迎刃而解了,这里面涉及到一些 AI 生图的底层逻辑,不再赘述。
逻辑解决了,有朋友可能又会发现一个问题:
在你精准控图的过程中,随着生图次数越来越多,图片也会变得越来越脏、有很多奇怪的纹理。
其实这种情况的解决方案很简单,就是“重新绘制纹理”。
我称之为“ AO 白模大法 ”
AO 白模,是 3D 领域中的一种渲染方式,简单来说就是把三维场景的材质和颜色全部去掉,只保留一个类似石膏一样的形体和环境光影:
所以核心逻辑,就是把材质已经废掉的图片,干脆就直接不要材质了,转换成白模,然后再用 AI 重新制作材质,这样的材质和纹理就是全新的。
具体实操也很简单,将废图加上一句提示词:
“转成 AO 白模图”,
生成一个白模图:
再将废图和白模,一起当做参考图并加上提示词:
“细化 AO 白模 @图 1,影调配色和画面风格参考 @图 2”,
融成一张新图:
就这样,在技术和艺术、创作和制作的综合操作下,最终我完成了近两百颗分镜图片。
10
AI 视频,其实不难控制
有了分镜图,就可以去做一颗颗的视频镜头了。
但有一点值得说明:本文按照这个流程来复盘,是为了方便你更加清晰的理解我的创作思路。
而在我实际的制作过程中,严格来说,并不是真的把所有镜头全部生完图之后,才进入生视频环节。
很多时候,我其实是按照单场戏甚至单颗镜头,一口气完成图片到视频的流程。
为啥呢?
从技术的角度来说,是因为生成图片或视频,都并非一帆风顺,可能有些复杂镜头,在有限的时间和成本下,无论如何就是无法落地,这时候我就需要改分镜。
从创意的角度来说,哪怕我已经定下了文字分镜,但制作过程中我还是会时不时的蹦出来新点子,可能也会去改分镜。
从流程的角度来说,我个人习惯边生视频边进剪辑,一组镜头制作完成后,我会直接将它们丢到剪辑时间线上,如果镜头衔接有问题、节奏不舒服,我会立马来看看有没有增减或换镜头的必要。
上面这三种情况都涉及到“改分镜”,但改分镜是牵一发动全身的事情。
镜头 B 改了,它前后的镜头 A 和镜头 C,可能就都要改。
这时候如果我费老大劲把图片全部生完了,那就等于浪费了很多前置工作。
因此我会更乐意边生图、边生视频、边进剪辑,这也是 AIGC 相比于传统实拍的一大优势,我可以实时看到我成片的效果,对于创作者而言,那可太爽了。
至于 AI 视频生成的具体操作,经常有朋友向我求助,说怎么都生不出想要的效果。
我觉得这件事的核心解决方案,就是“对症下药”。
没有不好的技术,只有没用对位置的技术,比如即使强如“多参”,也不是所有情况都适用的。
接下来跟各位分享下我的经验和思考。
在本片中,我用到了几乎所有主流技术。
比如“图生视频(特指首尾帧)”、“多模态参考生视频”、“视频编辑”等,其中前两者用得最多。
1、首尾帧
首尾帧,我主要用于两种情况。
其一是简单的镜头,比如下图这种固定机位、或运动幅度很小的镜头。
它最重要的是人物表演,所以我用多个模型同时生成视频,最终选择情绪最细腻的表演即可:
其二,是对起始帧和结束帧要求比较严格的镜头。
像结尾狗狗找到主人之后,我需要以狗狗的第一人称视角,呈现从“地面的球”抬头看向“主人的脸”,这么一个自然的长运镜。
同时,我还需要在剪辑阶段,为主人头顶添加一个小太阳,所以结尾帧的构图就必须十分精准:
因此如下图所示,我分别制作了起始帧图片和结尾帧图片,然后用“首尾帧”的逻辑,来帮我更加精准的控制摄影机运动和构图,以此达到我用视听来叙事的目的:
可能你会注意到,右下侧视频生成的参数,我用的并非是“首尾帧”,而是“多参”,但其中提示词的描述,却又是首尾帧的逻辑,所以我再次强调一下:
所谓的这些分类,都是技术领域的概念,我强调的是创作本身的逻辑、解决问题的思路,所以这里到底选多参功能还是首尾帧功能,都不重要,重要的是面对上述这种情况,你能迅速提出“用开头和结尾才能精准控制镜头”的解决思路。
2、多参生视频
多模态参考生成视频,是我用的最多的方式。
再次感慨技术发展之快...
这个东西从无人问津到成为主流,还不到一年的时间。
它的核心逻辑是可以参考文本、图片、视频、音频等多种形式的内容,来生成视频。
如果对构图精准性的要求没那么高的话,那确实没必要先搞出一张分镜图。
比如这个镜头:
我只需要低机位拍摄小狗在公园里跑,至于这个背景中有几棵树、景别是 90% 还是 80%,则没有那么重要。
所以其实不需要花半个小时去修图,而是直接把狗的形象和场景参考给到多参模型,告诉它我要一个怎样的镜头就好。
另外,多参也可以应付非常复杂的运镜和调度,相比于图生视频,多参我认为更像是真正的导演在片场去导戏的过程,只需要告诉 AI:
谁在哪儿,做什么,镜头怎么动。
举个例子,狗狗和野猫打完架之后,顺利逃出小胡同,它经过了家楼下,朝楼道里望去,驻足了一下,最终还是决定要继续踏上旅程:
这颗镜头是一颗长镜头,中间的场景必须保持连贯性,并且起幅和落幅并非是具有“形式感”的关键帧,而更像是从某个运动过程中进行的剪辑。
更重要的是,整个摄影机调度和人物调度之间的配合。
即使在实拍时代,它也是一颗需要费点劲的镜头。
那这种情况用简单的图生视频,就显然不合适了。
所以如下图所示,我给到模型一个全景、一个关键帧的构图、以及狗狗的角色资产,然后用文字提示词和“引用图片”的方式,来告诉 AI ,我到底想要怎样的调度:
就像视频所示,我觉得生成效果还是很不错的,当然,也需要一定的抽卡。
3、视频编辑
理论上这种纯 AI 作品,其实不太用得到视频编辑功能,这功能更多的还是在“实拍+AI”的工作流中,用于修改视频的。
比如替换背景啊、抠掉穿帮啊、或者换个天气之类的。
但很巧,本片有一段特殊效果,就是小狗穿街走巷的一段过场戏。
我想要镜头的视点牢牢定死在狗头上,就像是给狗头绑了个运镜相机一样,然后背景不断切换,以此展示小狗走过了大街小巷:
本来我以为,这种效果可以用提示词来轻松实现,但后来发现行不通,这时候,就得换个思路了。
这种特殊效果其实细节很多,比如切换背景的节奏必须要准确(最好能灵活调整节奏以便于剪辑)、狗的位置必须要固定、狗的光影必须要随着背景而变化等等。
抽了根烟,我想出一个绝妙的点子。
首先,我先生成一段狗正常奔跑的视频,然后用后期特效的方式(达芬奇跟踪+稳定),将运动中的狗头牢牢锁定在画面中:
可以看到,这时候狗头是保持在固定的视点了,但由于画面中其它像素的相对运动,导致像素无法填满整个画幅。
这时候,我用到第一次视频编辑功能,将缺失的背景用 AI 填充上,同时也顺便优化一下,后期处理所带来的不自然的观感:
这样,我就获得了一个“锁定狗头”完美镜头:
但很显然,它的背景是不会变的,因此以这颗新镜头为基础,我第二次使用视频编辑功能,保留狗的主体,只替换背景,接着生成 8 个不同背景的视频即可:
由于它们的“基础视频”都是同一条,所以这 8 条不同背景中的狗,奔跑的姿势、细节和节奏,就完全一致,只有背景和光影各自有所区别:
最后,将这几条视频依次摆放在时间线上,在正确的节奏点剪开,就完成了这种效果特殊、又高度可控的镜头:
以上,就是几个主要的视频生成方式,你应该可以感受到:
虽然我钻研技术,但从来不纠结技术。
技术固然重要,没有技术,可能很多想法就不好落地,但我认为技术永远只是服务于内容的。
这意味着,我会把大部分的精力,包括学习的精力,都放在内容而非技术上,尤其是对工具的钻研。
如果把精力量化的话,可能我只有 1%的精力放在工具上,60%的精力放在内容和创作上,40%的精力放在商业和运营上。
强调这一点,是因为看过去看到有太多观众为此困扰,将精力过多的分配给了工具和技术。
要知道,技术迭代太快了,你追不上的,即使追得上,也并没有用工具产出什么有价值的内容,那工具就不再有其存在的意义。
本末倒置了属于是。
但工具和技术毕竟是要学习和熟练的,我只用 1% 的精力,为何能如此精通技术呢?
答案很简单:项目导向。
简单说,就是“做中学”,首先你有一个片子要做、有一个 idea 要落地,其次才是过程中需要用到什么技术,再去学什么技术,这样不但能最高效的学习和掌握,也更能将技术用在对的地方,而不是纸上谈兵。
久而久之,你的技术能力就能内化为你的武器,服务于你的内容。
话说回来,趁这篇文章,我也刚好数了一下:
成片大概 200 个镜头,我下载下来当做备选的,大概 500 条素材,而加上抽卡啥的就不好估计了,可能接近 1000 条吧。
算下来,平均一个镜头抽卡 2~5 次。
加上图片生成之类的算力成本,我大概估算过,这条片子的成本接近一万人民币。
(不过还好 Tapnow 赞助了大部分成本,他们对好片子一直都很慷慨,感兴趣你也可以去了解一下他们的创作扶持政策。)
顺便也提一下,你能看到其实绝大多数素材生成出来之后,我都会下载下来丢进素材库,即使它不是我满意的素材。
这也是传统影视留下来的习惯,所有素材我们都视若珍宝。
因为真正剪辑的时候,很有可能那条看起来好的素材,放进去的感觉不对,而那条看似失败的素材,反而是对的。
11
后期,不止剪辑
有了视频素材,我们就要将它们丢到剪辑时间线上了。
前面也说过,从我的习惯来说,基本上视频生成完,时间线也差不多完整了。
后期这个东西,我没法拆开成各种方法论来分享,那样可能 10 篇文章也讲不完。
就说一些我觉得有价值的点。
首先,是软件。
有点害臊的说,其实在以前,我是戴了些有色眼镜的,比如我觉得达芬奇天下无敌,premiere 是老登才用的东西、剪映是外行才用的东西。
但后来,随着参与各种活动和比赛越来越多,我发现有很多大佬真的就只用剪映,这让我无地自容(人家用剪映搓的片子都比我好)
不过即是如此,我自己仍一直使用达芬奇创作、并且仍会建议你用达芬奇。
因为即使剪辑本身无非就是素材的拼接,用哪个软件都一样,但后期还涉及到特效、调色、声音设计和项目管理及交接等更加专业的环节。
而专业软件,会让你事半功倍。
就拿本片来说,涉及到大量的后期合成、专业调色,这在剪映里、甚至 pr 里,是不可能全流程完成的。
再比如,之前做过一些要上爱奇艺之类正规流媒体平台的片子,它们对交付出来的视频规格参数、字幕文件、色彩配置等,都有比较专业的要求,那基本也只有达芬奇才能做到。
总之,为了满足创作的天花板,我认为去学习和使用更专业的软件,还是一件十分有必要的事情。
至于这次具体的后期内容,第一个非常有趣的例子,就是动画部分。
比如其中的猫狗大战、最后一段的小男孩大战,它们的节奏都很快,镜头数量也非常多。
相比于说“我用精准的画面来叙事”,这里则更像是用分镜以及炫酷的调度来烘托情绪,简单说就是“看起来爽就行”,这也是我决定用动画的原因之一。
因此,我采用了一种与前面截然不同的创作方式:
先用 AI 来帮我创作,然后我后期来重新拼接剪辑。
看这张图的提示词,你就明白了:
可以看到,我没有给具体的分镜,甚至没有给具体的表演提示词,而是用一种非常宽泛的描述,比如“一场爽快的打斗”,来让 Seedance 自己给我设计一场戏。
由于给了 AI 极大的自主性,所以每条生成结果的分镜、构图、调度都不同,有的是人物快速冲过去攻击、有的是人物跳起攻击、有的是两人对打。
这样,我就获得了大量的单镜头素材。
接着,在剪辑软件中,我将它们拆分成一颗颗的单镜头,然后按镜头类型做了分类,比如有的适合用在开头、有的是狗狗攻击、有的是男孩惨败。
而每个种类下,又都有不同感觉的单镜头,比如光一个男孩惨败,可能就有飞出去、甩出去、滚出去、或原地倒下(好惨一熊孩子)
最终,我再将这些镜头按照动势、节奏、表演等,重新组合成一段全新的戏即可,包括前面的猫狗大战,其实也是用了这种方式:
这样做,可以极大的提升工作效率,整个过程也很有意思,我很开心做了这个尝试。
还有一处很有意思的设计,就是这段男主崩溃、以及小狗幻想的动画部分:
这里的“现实与超现实”的闪现效果,我其实有担心过会不会被观众感觉“为了做效果而做效果”,但最终还是决定大胆一点,因为:
在我的脑海和记忆中,濒临崩溃的时候,我脑子里确确实实,就是一团五颜六色的杂乱线条、抽线且诡异扭曲的图案。
我只是把自己脑子里抽象的东西,具象的表达出来而已。
至于观众感觉怪不怪的,让观众自己感觉去吧,哈哈。
像上图这种闪了几帧的眼睛,其实来源于很多年前,在一个情绪接近崩溃的夜里,我躺在床上,抱着手绘板闭着眼,任凭情绪主导我的手,画出的一些画。
⚠️ 前方高能:
做片子的时候,我就在回忆自己有没有特崩溃的阶段,然后就想到了几年前的那一夜(别问我发生了什么)
随后我将留下的画翻出来,发现特适合这一段的情绪,所以就稍作调整,放进片子中了。
这些画就是我真实感受的切片,所以我觉得就应该这么剪。
至于小狗的幻想,也是差不多的道理:
在我的想象中,狗狗心里的世界应该很简单:
它分得清家里和外面、它害怕闪电和雷声、它觉得外面可能有怪兽,此外可能也想不到更多东西了,所以我用这种简单又夸张的、黑白蓝黄配色的画面,来呈现它脑海中的世界。
当然,除了夸张的画面,这些段落也加强了相关音效、视觉特效等,来辅佐节奏和情绪,共同来达成同一个叙事目标。
与之相似的,是本片的另一种偏趣味性的包装,比如球砸到某处、狗落到垃圾桶之类的“小元素”:
这些元素,其实也是用 AI 做的,只不过经过了后期处理来细化效果。
我先用图片 AI 模型生成我想要的元素素材:
然后在达芬奇中,单独调整每一个元素的大小位置、动画、透明度等参数,使其形成一种有趣的二维贴图效果:
同理,小狗眼中,男主头上的天气,也是一样的原理。
不同点在于,这些天气是动态的,而不是上面那种静帧图片,所以需要让 AI 帮我生成带绿幕的视频素材:
然后在达芬奇的 fusion(专门处理特效的板块)中,再进行抠绿、跟踪、调色、发光等特效部分即可:
说到调色,我觉得很有必要多分享一点,它可能比你想象得重要的多。
实话说,AIGC 生成的素材其实没有太多调色的空间,像以往摄影机实拍的素材,能达到极高的色彩空间,以便于你灵活控制画面色彩。
而 AIGC 素材,你稍微拉一拉曲线可能就色彩断层了。
但,这不意味着 AIGC 影片不需要调色。
调色,可以简单分为两个步骤:一级调色、以及二级调色。(不存在什么三级四级调色,别听不专业的博主瞎说)
一级调色,主要解决这么几个问题:
1、单颗镜头是否正确:反差和色彩对不对,比如死黑、死白、太灰、过饱和、白平衡偏移等。
2、镜头之间是否正确:就是色彩匹配,前后镜头是否接得上。
对 AIGC 来说,这些问题尤其常见,每颗镜头单看都不错,但上一颗是暖黄感,下一颗突然变成阴冷感,那前后铁接不上的。
二级调色,则主要解决这几个问题:
1、局部颜色是否正确:比如肤色、天色、植物色等固有色,或者同一个东西的颜色前后是否保持一致。
2、视觉重心是否明确:比如乱七八糟的颜色太多,抢画面,那这时候就需要去控制杂乱的颜色弱一点,主体则对比强一点、清晰一点。
3、其他 BUG:比如磨皮、抠像等。
简单说,一级调色主要调整画面的整体曝光、色彩和反差,并让不同镜头接起来足够统一;
二级调色就深入到画面局部,比如单独修正狗狗的毛色、压暗抢眼的背景,或让那颗球更突出。
前者建立整体基调,后者进一步控制细节和观众的注意力。
我来举几个具体的例子,像这两个画面:
你应该能感受到,镜头 A 有点灰,而镜头 B 的对比度又太高、锐化效果太严重。
我们先不去深究在素材生成阶段发生了什么,如果最终剪辑我们确实选用了这两个素材,那么就需要去单独调色来修复问题。
比如将镜头 A 的反差拉高、加强光感和饱和;弱化镜头 B 的反差,去掉一些锐化:
你看,左侧的镜头 A 和 B,就有点跳脱,而右侧的 A B 就更加匹配和统一。
我们其实并没有做什么过多的调整,只是进行了一点点微调,解决了问题,就够了。
调色并非是大刀阔斧的动参数,恨不得加一百个节点,节点越多显得越专业,那是幼稚的想法。
再一个更加直观的例子,是下面这组镜头,其中镜头 B 的原始素材里的光,是发暖的,很显然接不上戏:
所以我们需要调整它光线的白平衡,使其色调能够衔接前后镜头:
再举一个二级调色的例子,下面这颗镜头是原始素材,在前期 AI 阶段,我已经将其影调尽可能统一,构图也做了设计,但效果我觉得仍然不够准确:
所以,我首先进行一级调色,使其影调和这场戏的前后镜头比较匹配:
但这时候你会发现,“偏冷/偏暗”的处理,不但使画面变“闷”了,同时也使得狗狗和球也变弱了,画面中的颜色和元素太多,以至于视觉一下子抓不到重点。
所以,我单独对球和狗进行处理:
我使球和狗的反差更加强烈、饱和也稍高一些,这样观众一下子就会被球所吸引,画面也更加通透。
最后一个例子,则是结尾处,我对整体影调的处理:
可以看到调整前的原素材,差不多是“傍晚”的感觉,但还不够,显得灰蒙蒙的。
而调整后,我加强了冷暗的影调,使其情绪更浓。
这样处理还有另一个好处,前面也提到过,就是 AIGC 素材的色彩空间没那么广,如果是一段偏暗色的画面,AI 给你的素材就很可能“死黑”,简单说就是暗部没有细节了。
而如果你生成的素材稍微先亮一点,到后期阶段再去压暗,这样暗部的细节仍然是可控的,不至于一团死黑。
这也是源自实拍的经验,没人真的在黑灯瞎火的夜里拍戏,摄影机宽容度可比人眼差多了,实拍的时候天色都不会太暗,等后期的时候再去压暗。
12
声音值得专门学
最后,就是声音设计了,这也是一个比想象中重要得多的环节。
实话说,本片的声音我认为做得完全不够好,尤其是音效,当时赶时间参加比赛,交了片之后我又懒得继续优化,所以就这样了。
我觉得市面上这么多 AI 片子,声音真的是一大硬伤,包括我也是,都值得专门去学一学声音制作。
如果你没有概念,我简单分享一下:一部片子的声音,可以粗略分成四类:
人声、环境声、动作音效,以及音乐。
人声不光是台词,也包括呼吸、叹气、笑声,甚至本片小狗的喘息。
比如同样是小狗趴在地上,安静地呼吸,和带着一点委屈的哼唧,传递出来的情绪就完全不同。
环境声,则负责告诉观众:角色身处一个怎样的世界。
比如即使是一个安静的房间,也能听到白噪音和窗外隐约的车流,你给了这个环境音,可能也没什么明显的改善,但如果你没给,那画面就一定会干巴巴的,总感觉缺了点什么。
尤其是 AI 画面,本来就没有同期录下来的现场声,那如果只配音乐和几个明显的音效,你构建的世界就会显得空。
动作音效,是让画面里的动作具有触感。
小狗的爪子踩在地板上和地毯上,发出的声音是不一样的;狗钻出窗户时身体蹭过窗框、球落地后弹了几下,这些声音都在帮助观众相信:
它真的在这里,真的碰到了这些东西。
这也是我认为本片做得不好的一大问题,如果音效我再认真做一做,想必沉浸感和代入感又会完全不一样。
不过也得强调一下,“根据画面配上对应的响声”只是最基础的要求。
我认为声音更重要的目的,仍然是辅助叙事。
比如同样是一辆车经过,客观地还原,那它就是普通的车声;
但我想让观众带入的是一只胆小的狗的感受,就可以将车流声故意做的失真一点、甚至难听一点,这就达到了我的叙事目的。
至于音乐,大家最熟悉,但也最容易依赖。
悲伤的戏就放悲伤的音乐,紧张的戏就放紧张的音乐,当然有用,但这个度其实不好把控,加多了会很“腻”。
有时候让音乐停下来,反而可能更有情绪。
最后,还需要把上面这些声音放在一起,完成“混音”。
简单说,就是去决定和操作:
此刻谁该突出,谁该退后;声音从哪来,离我们有多远等等。
所以声音制作,并不是在剪完画面之后,找几个音效拖进去,再铺一首歌就结束了。
它和镜头一样,需要取舍、需要设计,如果必须用一最重要的句话来总结思路的话,我认为还是那个老问题:
这一刻,我希望观众注意什么,感受什么?
那说到本片具体的制作,我也专门邀请了这次帮我做音乐的伙伴:达子,来分享一部分他的经验,实话说音乐我还是比较满意的,不知道你觉得怎么样?
以下是达子的分享(让我们热烈鼓掌欢迎👏):
这次配乐中,既有纯人工编写的部分,也有人工先完成旋律和节奏等关键内容,再由 AI 继续完善的共创部分,当然,也有通过纯提示词生成的部分。
粗略估算,整体人工与 AI 创作比例大约是一半一半。
围绕这几种制作方式,我想分享两点感受比较深的经验。
第一个是:准确锚定你想要的风格,往往就成功了一半。
对于 AI 配乐来说,风格方向是否准确,会直接影响后续的生成效率。
很多非音乐专业出身的创作者,其实知道自己想要什么感觉,只是不知道应该用什么词来描述。
即使借助大语言模型,也可能只是在大量看似合理的描述中反复打转,花了很长时间,才找到一个准确的关键词。
一个很直接的例子,就是本片中猫狗大战、转为黑白漫画的那一段:
在和 GPT 的探讨中,我准确捕捉到了一个风格关键词:Spy-Fi
确定这个方向后,这一段基本只抽了一两次卡,就拿到了满意的音频。
要找到这样的方向,我觉得最直接有效的方法,仍然是传统音乐制作里一直在使用的——找参考曲,用实际听感确认方向。
如果暂时没有参考曲,也不熟悉音乐风格,可以先把 Suno 官方的提示词指南、曲风介绍和音乐术语资料交给自己常用的 Agent,再描述画面、剧情和情绪,让它推荐两三个风格方向,同时给出各自具有代表性的成熟作品,供自己试听。
先亲自听一听,确认哪种声音接近预期,再让 Agent 整理生成提示词,这样就会准确很多。
毕竟文字只是辅助,自己的直观听感才是最重要的判断依据。
而如果你已经有一首理想的参考曲,则可以反过来:把曲名和作者提供给 Agent,让它结合能够查到的资料,梳理作品的风格、配器、节奏和音色特征,再整理成提示词。
不论从哪一端开始,都是在把“我想要的感觉”与具体的音乐表达对应起来。
这对非音乐专业创作者来说,应该是最难、但也是最应该先做的一步。
第二个经验,就是人工先搭骨架,再让 AI 补充血肉。
确定风格方向之后,接下来要解决的,是音乐如何与画面配合。
我认为,把传统配乐工作流与 AI 生成结合起来,是一种非常有效的方式。
比如,小狗从窗户跳出来、落到垃圾桶的那一段,就是用这种方法完成的:
我先在 DAW(数字音频工作站)里用 MIDI 写好主旋律,再用一个最基础、最简单的钢琴音色导出音频,放到 Suno 里做 Cover,将它发展成具有史诗感的管弦影视配乐。
对于不会作曲的朋友,这个思路也可以从更简单的一步开始:
先不写旋律,而是明确音乐的起止时间、情绪和进出方式。
比如:“第 20 秒到第 30 秒是追逐镜头,音乐直接进入,持续紧张推进,最后配合撞击动作戛然而止。”
把这样的描述交给 Agent,让它建议合适的 BPM(速度)、拍号和简单结构,再整理成提示词。
我是大羽,我回来了。
感谢达子老师的分享,我觉得还是非常干的,希望能帮到你,如果你也想关注更多干货或跟达子合作,可以去视频号找到他,这是他的 ID:
13
电影节到底怎么参与
整个片子的制作,到这里就要告一段落了,在我尽可能不展开的情况下,仍然已经达到了恐怖的两万字之多,大羽斗帝,恐怖如斯。
如果我称它为市面上最干的复盘,不知道你同不同意。
最后,除了片子本身,我被问到的最多的问题,应该就是电影节了:
大羽,你这么多比赛都是哪里找的?
国内外都有哪些电影节?
怎么投递电影节?
其实我在一年前,也曾被这些问题困扰,但后来发现,其实参与电影节,并没有想象得那么遥不可及。
关于电影节的基础科普,什么 A 类 B 类之类的东西,大家可以自己去搜,不多说了。
真正麻烦的,其实是找到适合自己作品的电影节,以及弄清楚它们各自的规则。
这里先给大家介绍一个我很常用的平台:FilmFreeway
像我这些入围、获奖的通知,都是这个平台发来的:
你可以把它理解为电影节的“征片平台”。
很多电影节会在上面发布征片信息,我们创作者就可以在上面建立作品档案、上传资料,再向不同电影节统一去提交作品。
当然,这个平台上主要还是国外的电影节居多,至于国内的各种比赛,我其实基本都是通过社媒平台获取到的信息,有一些账号他们专门发 AI 相关电影节和比赛的内容,你刷的多了,平台自然就会推给你。
如果你不知道该投哪些好,那我建议就不要纠结,挑个一两天的时间去“海投”,库库投,然后坐等惊喜。
那如果你有明确想冲的电影节,就最好在公开发布你的完整作品之前,先去仔细看看它的规则。
因为有些电影节能接受已经公开的作品,有些却有严格限制,它们只接受你的“第一次”,这被称作“首映要求”。
至于到底投递些什么东西,其实每个电影节要求可能都不一样,但总得来说,你至少需要准备这些资料:
影片信息: 中英文片名、片长、完成年份等基础信息。
剧情梗概: 一句话简介之类的。
导演资料: 简介、照片、导演阐述等。
视觉物料: 海报、剧照,甚至预告片。
审片版本: 符合要求的视频文件或链接。
字幕: 按要求准备英文字幕或其他语言字幕。
AI 使用说明: 使用了哪些工具、分别负责什么环节,哪些工作由人完成。(比如我上次的白皮书,就属于这类)
为了避免每次报名都重新翻文件,我建议提前整理这么一个“电影节投递资料包”,应对不同的投递要求,就会方便很多。
其实说了这么多,我的投递工作后来都是外包给我朋友的,因为除了考虑上面这些,在实操等环节还有特别多的细节,所以我干脆就找这种专业的代投递服务商,能省巨多事儿。
帮我代理的这个朋友很专业,如果你需要的话,也可以去某书联系他:
对我来说,参加电影节的意义,除了得到一个结果、获得一些背书,也是让这个原本只存在于自己脑子里的故事,有机会去见一见更多的人。
前段时间,最触动我的,是一个叫 Cinétoile International Short Film Festival 的电影节发来的现场图片:
这个节日在突尼斯举办,实话说,我在地球上找了半天,都不确定有没有找对这个国家。
使我万般感触的,是第一次看到这么“简陋”的电影节,观众坐在塑料板凳上或地上,荧幕甚至是破桌子上摆的一个小投影仪投上去的:
通常,电影节好像都在追求高大上,请一堆的明星、搭更大的舞台、打印更好的物料,我作为参与者也因此变得只关注那些盛大的、华丽的部分。
参与电影节,我脑子里其实只有对红毯和名流的渴望。
因此,这个 Cinétoile 的电影节,一下子把我拉回到创作本身。
这是一种很奇妙的体验,看到节日现场图片,你可以想象到:
一堆镜头,从我电脑里被提示词所驱动生成,然后在我电脑的达芬奇里被拼接、被导出。
最后这个 mp4 文件数据,经过互联网,以光速流向了地球的另外一端,被激光投射在那块布上。
接着,一群我不了解他们、他们也不了解我们的人,坐在地上认真看你的故事,甚至可能有人再不会忘记一只来自中国的小狗。
我们文化不通、习俗不通,但作为人,我们有相同的情感,我们都会被真情感动。
而这些,我认为才是自己的作品,最大的意义和价值。
随后我脑子里,不再有那些肤浅的功利心,创作其实很简单,就是讲一个你想讲的故事,喜欢的观众与你跨越文化和距离,进行精神和情感共鸣,不喜欢的也无妨,因为总有人会喜欢你的作品。
没有不好的作品,只有迟来的观众。
这篇文章终于结束了,不知道你看了多久,反正我写了很多天,如果你能看到这里,请在评论区留言,我会为此感到开心。
下一条片子,我会继续去讲一只小狮子的故事,其实吧,我是准备做一个系列:用 AI 拍一百种动物。
听起来是不是很有意思,因为拍人的作品太多了,我对人也没什么兴趣,人类太复杂。
动物不会说话,所以我多数片子里可能也不会有台词,但它们的品质和精神,我认为是值得讲述的。
在这个系列中,我有信心创作更多的牛逼到爆的作品,欢迎你关注。
这阵子,就先把线下课认真办好,还不了解我们 AIGC 线下集训的伙伴,可以去看这篇文章:
⬆️(点击图片查看课程详情)⬆️
过几天就停止招生了,如需报名需要抓紧了!
广告打完,
就这样,
下次见!
历史精选文章推荐(点击标题查看):
影视飓风的AI高能片段,是怎么做的?【万字复盘!AIGC制作幕后】
万字复盘!电影周金奖AI短片 创作幕后与AIGC干货教学:如何48小时完成一部AI获奖短片
狂揽国际电影节入围 AIGC 短片《带你去玩球》技术白皮书【葵花宝典级干货】
Tapnow 全球最大 AI 黑客松,作为评委,说点干货
最骚邪修秘法,AI做图效率飙升十倍,有手就行!(Midjourney 情绪板进阶用法 10分钟建立素材库)
普通人学 AI,该如何开始?
我是大羽,一位创意导演 / 自媒体创作者 / 3 家影视、广告公司创始人 / AIGC艺术家 。
专注于 IP-私域-知识付费 / AI / 个人成长、思维升级 / 艺术创作。
扫码 ⬇️ 查看《大羽的个人说明书》,以便了解更多关于我的信息(如果你感兴趣的话)
在这里,我将用谁都能听懂的话,带你进入 AI 时代。
如果你对我精心制作的课程感兴趣,欢迎扫码 ⬇️ 进入我的小程序,查看我的知识付费产品:
如果你想链接我/加入我们的千人社群,请扫码添加我的微信⬇️,但请务必备注来意,否则不予通过:

