『写在前面』
DiDi_OK 是小僧最喜欢的 AI 视频创作者之一。
最开始关注他是在今年 3 月因为他的作品《Sign》,从那时候就很明显可以发现:他的作品不是单纯的炫技,而是充满着对人类命运的哲学思考。
他的每部片子都尝试着去讨论一个宏大的议题,然后把这个世界置身于一个特别荒诞,但是又能自圆其说的困境之中,然后像一个旁观者一样,仔细地观察人类的反应。
昨晚,火山引擎邀请DiDi_OK就他的最新作品《Candy》聊了聊创作的事情,小僧全程跪着听完的。毫不夸张地说,DiDi_OK不但是一个在创作上很有自己想法和风格的人,而且在对于内容和 AI 的理解上,有着自己独到的方法论。
PS1:如果你还没看过《Candy》,请先去 B 站搜索DiDi_OK 看看这部作品;
PS2:特别说明,本文不是一篇直播回顾稿,而是小僧跪着看完DiDi_OK这次直播的一些感受。真的全是干货,受益终身。
——短剧研究僧

『梦到哪里做到哪』
看DiDi_OK作品的最大感受在于:你根本不知道接下来会发生什么事情。
他整个故事的设定天马行空,表面看起来荒诞至极。但是当你看完以后,又会因他荒诞外壳之下隐藏的哲思而陷入沉思。
DiDi_OK说他最喜欢网友对他的评价是:「梦到哪里做到哪」,这句看起来有些冒犯的话,对他来说,是他创作的真实写照,也是观众对他的最高褒奖。
在直播中,DiDi_OK分享了他在制作《Candy》这部短片时从创意策划到成片制作的全部流程。
Didi_OK 在创作过程中,与所有人最不一样的点在于:他的故事起点是一段情绪。
他花费了大量的时间在 Figma 上记录和打磨自己想要的情绪变化。就像《Candy》,整个故事的内核其实用一句话就可以说清楚:「企图主动伤害别人的人就会原地爆炸」。但这句看似简单的话,却可以引来无限的遐想。
《Candy》的剧情都是围绕着这个主题而来的:怎么样才算伤害别人?为什么伤害别人就会爆炸?这个设定会不会引起观众的不适?创作者应该如何解释这个设定背后的原因?爆炸这件事情会对世界秩序产生什么样的影响?
以上所有的一切,在DiDi_OK 心里都有答案。我们表面上看到的是一个近 9 分钟的短片,但实际上,他构思的、他设计的,远比我们看到的要多得多得多得多。
在 AI 时代,创作变成了一件非常简单的事情,很多红极一时的作品,在小僧看来他们并不是在创作,而是在炫技。他们利用他们掌握的 AI 工具使用的信息差,把它通过视觉奇观的方式呈现在观众面前。本质上只是利用了观众对于新鲜事物的「好奇心」罢了。
所以我们可以看到,很多大片画面华丽、炫酷,但是内核空洞,没有思想。就像一个人,空有皮囊,没有灵魂,总觉得少了点什么,也算不上好作品。
而 DiDi_OK 的作品的最大的特点在于:它在有大量视觉奇观的同时,还能让整个故事天马行空,并且最终能收束在一个有一定思想深度的命题之上,这也是他的作品显得如此独一无二的重要原因。
『不做分镜的导演』
当DiDi_OK说「我不做分镜」的时候,小僧第一反应是吃惊。
要知道,他的作品中有大量的复杂镜头变换和特殊运镜。
DiDi_OK也分享了他之所以能完成这样创作的核心秘籍,是住进故事里。
这是一个非常生动形象的比喻。他在创作的过程中,会把自己完全代入到整个故事的情景设定之中,哪怕他走在街上,他也会思考,这个人该不该爆炸?会不会爆炸?只有当他最终完全把自己沉浸在作品之中,一切的故事才能够水到渠成,所以他根本不需要画分镜来辅助自己创作。整个 Candy 的创作过程是二十几天,但他将自己住进故事里这个步骤,就花了差不多两个星期。
我觉得这一点其实也是值得大家借鉴的。很多时候我们做故事为什么卡壳?是因为我们以为我们已经想清楚了整个故事,但其实我们并没有真正地把自己放进那个故事当中。所以我们在实际创作的过程中会遇到很多过不去的坎,或者是不合理的地方。这一切问题的根源其实还是在于我们对故事不了解,对故事的探索不够深。
DiDi_OK把自己住进故事里,听起来有点抽象,但确实是一个行之有效的方法。
『独家 SD 2.5 使用技巧』
DiDi_OK的整场直播全程高能,干货满满,甚至还毫无保留地分享了不少创作实战中的小技巧。
这是独属于他的创作方式。
他分享的一些技巧,学会了以后觉得简单,但在第一耳听到的时候真的满脑子只有「卧槽?还能这样搞?」。特别是对 Seedance 2.5 的创作者来说,有着非常大的启发及想象空间。
DiDi_OK秘籍一:视频生图
这是一个非常反直觉但实用的技巧,特别是在创作一个架空世界或者一个没有现成参考图的内容的时候。以往我们都是去找一个参考图,有的人会选择通过文生图的方式让 AI 把脑海中的画面具象出来,但是效果往往也差强人意。
DiDi_OK 也曾经深受其害,但他找到了「视频生图」这个解决办法。
用那场枪战的戏来举例子。
整场戏有 13 秒,他只用了一张图作为参考图。而这张图是怎么来的呢?是通过视频抽帧而得来的。而视频是怎么来的呢?是通过文生视频生出来的。
DiDi_OK 也介绍了他的心路历程。一开始,他也不知道这个场景是怎么样的,所以他选择用非常模糊的词语向 AI 描述了他心目中的那个场景。
他用提示词告诉 AI 一个非常宽泛的范围,比如「在战场」,你也不用纠结这是什么战场,反正就是「有人在打仗,有战火,是一场现代的战争」。然后便和 AI 说,「你在这个战场里随便拍就好了」。就这样,DiDi_OK 得到了一个战场中的环境的描写视频,他把这种方式形容成在 AI 里采风。虽然生成的画面最后不一定会用,但是能给到创作者一个解决方案,特别是针对一些抽象的场景,可以让它先跑一下,形成一个视觉固定。
小僧从来没有想过「倒反天罡」通过图片去生成视频,然后从视频里抽帧作为参考的图片。这个思路仿佛打开了新世界的大门,解决了我们美术的风格化确定的一大难题。
我相信,只要自己亲手手搓过视频的人,都知道这个「独门秘籍」的含金量有多高。
DiDi_OK秘籍二:Seedance 比你想象中要强
第二个其实严格上来说算不上是一个秘籍,更像是DiDi_OK和 Seedance 2.0 之间博弈后的一个经验总结和心得。
DiDi_OK 是 Seedance 的重度用户,他有着非常丰富的模型使用经验。在直播中,DiDi_OK 表示:Seedance 2.5 相较于 Seedance 2.0 或之前的版本最大的一个进步点在于:它对于提示词的理解能力强了很多。
以往我们在使用Seedance 2.0创作的时候,都需要通过大量的参考图来进行辅助,才能把我们想要的内容阐述清楚。但是到了 Seedance 2.5 的时代,AI 对于提示词的理解已经达到了一个新的境界,我们可以通过非常口语化、直白的语言来跟 AI 交流,它同样是能听得懂的。
《Candy》中很多长镜头都是单纯通过文生视频的方式直接创作出来的。
以警察局的那个长镜头为例。
你仔细看就会发现,这个仅有 13 秒的镜头,其实非常复杂,技术难度极高。首先,这是一个长镜头,可以看作一镜到底,并且在叙事中还伴随着高难度的镜头焦段切换;此外,在长镜头的同时,整个场景分为前中后景三个景别,并且同时发生着不同的故事。
比如说一开始是一个近景,警察正在通过对讲机和同事聊天。然后中景就迎来了两个被抓住的犯人,同时后面还有其他的犯人,每个人都有着自己的动作和任务。随着时间的推移,中景的犯人一拳把近景的警察打倒在地,然后整个画面发生了一个非常强烈的翻转。与此同时,远景的各个犯人角色保持着自己独立的处事逻辑,有的人在躲藏,有的人试图一起来围攻警察。整个画面,所有的人都有着自己的合理的行为逻辑和完整的戏剧目的。假如这个镜头是通过实拍来实现,可以说有难度,但并不算大。但如果这个镜头是用 AI 生成,我们要同时控制这么多人的行为逻辑和行动轨迹,以及考虑到期间的镜头变化。最后,发生爆炸的犯人是定制化的,特定几个,并且爆炸完全符合物理学的逻辑。这个难度真的是几何级上涨,这也是为什么这个镜头是这部片子中最有难度和最精彩的镜头之一。
很难想象是通过怎么样的提示词,将 13 秒的连续画面中的近景、中景、远景都控制得这么好。大家一定会好奇,这个提示词到底是怎么写的?DiDi_OK 同样无私分享了他的方法和心得。
正如前面所说的,Seedance 2.5对于提示词的理解能力已经到了一个非常厉害的境地。所以我们的创作思维应该要发生改变,从「以参考图为主的Seedance 2.0 时代」,转变成为「以提示词为主的Seedance 2.5 时代」。
DiDi_OK 的提示词到底有多夸张?他的一个镜头,用了超过 2000 个字的提示词来进行约束,而且这些提示词他是全部手写的,除了部分生僻资料的查询借助 Ai 以外,在剧本创作过程中几乎完全没有 AI。
小僧也知道,现在很多人都习惯了通过 GPT 或者 Deepseek 在生图生视频时按照自己的想法输出成一套非常完整的提示词。现在大部分 AI 模型都有着这个能力,并且能完成得非常好。也正因为如此超出预期,我们其实写归写,但实际上并不了解这个提示词意思和专业构成是如何。这就导致了一个问题:生成的画面和我们想要的画面存在差距时,我们并不知道提示词是哪里出了问题,更别说下手进行修改。
而 DiDi_OK的手搓提示词,其实就是将提示词的所有细节掌握在自己手中。这样子,一旦画面中的哪个部分发生了问题,他就可以迅速地定位到提示词可能存在问题的地方,从而进行修改和调整。看起来好像是一种浪费的行为,但实质上节约了大量的时间和抽卡次数。
开头的小女孩在太空站吃糖果,我们能清晰地看到人物在表情上的微妙变化,这些都是设计过的。剧中每一个角色他们是如何运动的,他们的目的是什么,都有一个非常详细的描述,这样才能保证故事可以持续推动下去。
包括那个惊艳了小僧很久的蚂蚁搬运糖果的镜头,也是完全通过提示词控制 AI 直接生成出来的。原视频没有进行任何的修改,甚至连参考图都没有给。而因此付出的代价,则是DiDi_OK 为这段内容纯粹手写了 4000 多字的提示词,详细地记录了真格创作的过程。
说实话,这对于小僧来说,是一个沉重的打击。
因为小僧一度以为,在 AI 大模型日益变强的时候,终于可以不用像 Midjourney 时代那样写详细的提示词了。结果到头来发现,伴随着视频大模型 Seedance 的不断进步,提示词变得越来越重要,最终还是摆脱不了手搓提示词的命运。
『小僧说』
DiDi_OK的这次分享,让小僧看到了Seedance 2.5 的无限可能。
小僧相信,哪怕是DiDi_OK,也远没能达到 Seedance 2.5 的能力上限。新版本推出的白膜、局部修改以及提示词的理解能力等提升,真的极大地提高了 AI 视频创作的上限。
说真的,用 Seedance 2.5 去做短剧,甚至是那些跑量的短剧,小僧觉得都有些暴殄天物。Seedance 2.5 乃至未来的 3.0、3.5。他们的目标一定是电视剧、电影这种需要更加精细、高质量的内容创作使用场景。
伴随着模型能力的不断增强,AI 剧也将在越来越多的应用场景越来越不重要。
小僧大胆预测,竖屏短剧只要不是走精品的,大概率最高最高也就用到 2.5 了,未来的 3.0 乃至更后面的版本,只要提价格,对于短剧来说,性价无限比趋近于零。假如短剧行业创作者的思维不改变。依旧保持着通过 AI 降低成本,从而赚差价的这么一个目的。
短剧永远无法实现精品化,并且没有未来。
都看到这了,如果觉得小僧写的还不错,随手点个赞、在看、转发三连吧!如果想第一时间收到小僧的推送也可以点个⭐~
谢谢你看小僧的原创文章,咱们下次再见!


