大家好,我是萝卜哥~
前几天刷到一条 39 秒的古装视频,一个汉服美女,对着镜头把同一个"滚"字说了六遍。
笑骂着说,委屈着说,失望着说,愤怒着说,崩溃着说,最后心如死灰地说。
同一个字,六种人生,表现的相当细腻了,我真的是来回看了不下十遍,原来 AI 生成的人物,也可以拥有这么顶级的演技啊。
说实话,做 AI 视频这么久,我最头疼的一直是人脸。场景可以真实,运镜可以电影级,但人物一开口,完蛋,嘴在动,眉毛纹丝不动,眼睛里空空的,就是我们常说的 AI 僵尸脸。
所以我把视频逐帧拆了一遍,又跟 AI 来回折腾了好几轮,最后把整套方法沉淀成了一个 Skill,名字就叫"表情导演"。
来看一个我生成的视频,有没有帝王的那种从容和狠厉。
今天把拆解过程和这个 Skill 都分享出来。
先说我拆出来的三个秘密
把那条视频一帧一帧过完,我发现打动人的从来都是一些特别小的瞬间。眼神什么时候躲开,嘴角什么时候微颤,情绪什么时候彻底撑不住,这些小小的瞬间,让我们的 AI 视频更加真实。
相对来说,哭得多大声反而不重要,微表情更能打动人。
顺着这个往下,我总结出三个编写重点。
一、先写动机,再写表情。
很多人写提示词,上来就是"她很伤心"。但我们想一想真的演员是怎么干活的,演员拿到一场戏,第一件事想的从来都是"我为什么会有这个反应",想清楚了,表情自己就出来了。
AI 也一样,你不给它前置条件,它就只能做表面的肌肉运动,眼睛里没内容。
但是如你告诉它"她等这个人等了很久,等来的却是一句敷衍的借口,而且这不是第一次了",它的眼神立刻就不一样了。
二、情绪必须递进,禁止瞬移。
开头那条视频里的崩溃版就是这么演的,先是眼神停住,还没反应过来。然后强撑,想维持平静,但呼吸已经乱了。最后才撑不住,眼泪掉下来。
三段,一段都不能少。如果你直接写"她崩溃大哭",生成出来的就是上一帧还好好的,下一帧突然嚎啕,假得离谱。真实的人不会瞬移情绪,都是在不断的清晰积累里面慢慢爆发的。
三、镜头也要参与表演。
这个是我拆到后面才反应过来的。愤怒的时候镜头缓慢推近,压迫感就出来了。心如死灰的时候镜头缓缓拉远,那个感觉叫"整个世界正在离开她"。还有一个我特别喜欢的写法,人物崩溃后退时,镜头原地不动,让她在画框里一点点变小,被抛下的孤立感直接拉满。
镜头不只是个记录工具,它是替角色说潜台词的第二演员。
七个元素,一个都不能漏
拆完视频,我把一段合格的表情提示词压缩成了一个公式。
动机,眼神,呼吸,身体,声音,脸部,收尾。
前面几项好理解,我重点说两个最容易被漏掉的。
一个是呼吸。委屈的时候呼吸会卡住一下,那种委屈感一半来自喉咙。崩溃的时候呼吸是乱的,短促抽气,胸口起伏没有节奏。愤怒是呼吸变重,鼻翼扩张。
真的建议大家都去在提示词里写一下呼吸相关的内容,你会回来感谢我的。
另一个是收尾。话音落下之后的那半秒余韵,才是表情视频的高光帧。笑骂着说完"滚",咬住下唇。崩溃着说完,整张脸垮掉。愤怒着说完,继续死瞪着一言不发。这半秒最容易被忽略,但它有时候又正好是最容易打动观众的那一帧。
实测两个例子
方法说完了,来看两个具体案例,我拿两个模糊到不能再模糊的需求测了一下这个 Skill。
第一个输入,现代职场女性,得知自己被裁员了。
得到的完整提示词如下
单镜头连续表演,写实人物视频。专业纪录片式观察视角,使用会议室现有光线,保留真实皮肤纹理和轻微呼吸起伏。
【人物设定】
一位30岁左右的成年东亚职场女性,清晰自然的面部轮廓,眼下有轻微工作疲惫感,真实皮肤毛孔,深色长发整齐束在脑后,额前有少量自然碎发。淡雅通勤妆,穿深灰色修身西装和白色衬衫,佩戴银色细耳钉与公司工牌。
她平时理性克制,习惯在公开场合保持专业。全程保持年龄、脸型、五官比例、发型、服装和妆容一致。
【场景与环境】
现代公司玻璃会议室,工作日下午。她坐在长桌一侧,面前放着笔记本电脑、打印材料、黑色签字笔和半杯冷咖啡。背景有投影幕布、百叶窗、磨砂玻璃隔墙、深色办公椅、墙面时钟以及几位轻微虚化的参会同事。
投影幕布上展示着她参与完成的项目方案。画外上司正在把成果归到自己名下,同时暗示项目失误由她负责。幕布内容保持模糊,不出现可辨识文字。
窗外冷白自然光从她左侧照入,会议室顶灯提供平淡补光。空调吹动她耳边的一缕碎发,投影光轻微落在她脸侧。
【人物动机】
触发事件:她突然确认自己的核心成果被上司占用,责任也被推到了她身上。
当前目标:控制情绪,确认自己没有听错,并准备维护自己的成果与尊严。
现实障碍:会议室里有部门领导和多位同事,她不能立刻失控,也不能显得缺乏职业素养。
保护策略:先保持沉默,通过重新查看材料和控制呼吸争取思考时间。
隐藏潜台词:“原来你早就计划好了。你拿走我的成果,还想让我承担后果。”
【表演控制】
内在情绪压力从2/5迅速升至5/5。
外在表达幅度从1/5逐步升至3/5。
自我控制从5/5下降至3/5,但始终没有彻底失控。
震惊由眼睛和呼吸率先表现,悲伤通过失焦的视线、下眼睑和嘴角渗出,愤怒通过重新聚焦的目光、压低的眉毛、收紧的下眼睑和稳定的下颌完成。
【镜头语言】
平视三分之四近景,接近50毫米人像透视,镜头高度与人物眼睛齐平。女性位于画面左侧,右侧保留指向画外上司的负空间。她的视线目标位于镜头右侧靠近镜头的位置。
焦点始终锁定她靠近镜头一侧的眼睛,景深较浅,背景人物与投影内容自然虚化。
前半段保持固定机位。悲伤开始转化为愤怒时,镜头进行一次极缓慢的小幅物理推进。当她重新抬眼直视上司时,镜头立即停止移动并锁定画面。
【9秒表演时间线】
0.0至1.0秒:
她保持普通会议状态,低头看着打印材料,右手自然握笔,嘴唇放松,呼吸平稳。听到画外上司提到项目归属时,笔尖逐渐停住。
镜头保持固定,会议室只有低沉的空调声和远处投影仪风扇声。
1.0至2.5秒,震惊:
她的眼睛先停止移动,随后视线迅速抬向画面右侧的上司。上眼睑明显抬起,下眼睑仍保持轻微紧张,嘴唇无意识分开一点。她吸入半口气后突然停住,握笔的手僵在纸面上。
头部没有立即转动,眼睛先完成确认。大约半秒后,她才缓慢抬起下巴。避免夸张张嘴和突然后仰。
2.5至4.3秒,震惊沉入悲伤:
她重新低头看向材料,仿佛希望从文件中找到自己听错的证据。眼神逐渐失去焦点,眨眼速度放慢。眉毛内侧轻微上提并靠拢,下眼睑出现湿润感,但眼泪没有掉落。
她的嘴唇先轻轻闭合,随后下唇出现一次很短的颤动。下颌微微松开,肩膀下沉少许。握笔的手慢慢放松,签字笔在纸面上滚动一小段距离。
4.3至5.6秒,悲伤被压住:
她吞咽一次,把即将涌出的情绪压回去。嘴唇收紧成一条较薄的线,呼吸从停滞变成一次缓慢而克制的鼻腔呼气。
她闭眼不到半秒,像是在重新整理思绪。睁眼后,眼中的湿润仍然存在,悲伤开始被明确的判断取代。镜头从此刻开始极缓慢靠近。
5.6至7.5秒,愤怒形成:
她重新抬眼看向画面右侧的上司。视线变得稳定、集中,不再躲避。眉毛逐渐压低并向中间收紧,下眼睑变得结实,鼻翼伴随一次较重的呼吸轻微张开。
她慢慢挺直背部,将双肩重新打开。下颌收紧,牙关保持闭合,嘴唇压住即将说出口的话。右手停止追逐滚动的签字笔,手指缓慢收拢,压住桌面上的文件。
镜头在她目光彻底稳定时停止推进。
7.5至9.0秒,克制的愤怒与余韵:
她持续直视画外上司,没有大声质问,也没有拍桌。眼睛保持锋利稳定,嘴角出现极轻微且不对称的紧绷,表现出失望和冷怒。
她缓慢把属于自己的材料拉回面前,动作平稳而坚决。最后轻轻吸气,身体略微前倾,呈现即将开口反击的状态。画面停留在她坚定的目光上结束。
【光线变化】
震惊阶段保持平淡冷白光线。她低头进入悲伤时,百叶窗投下的柔和阴影落到眼睛上方。她重新抬眼进入愤怒时,侧光勾勒出眼睛、颧骨和下颌轮廓,面部整体曝光保持稳定,不改变光源颜色。
【声音设计
保留会议室空调声、投影仪风扇声、纸张轻响、签字笔滚过桌面的声音、她突然停止的吸气、克制的吞咽以及逐渐加重的呼吸。
画外上司的声音只保留模糊语气,不出现清晰对白。无背景音乐,无旁白,无字幕。
【负面约束】
避免三个情绪瞬间切换,避免一开始就达到最大愤怒,避免夸张瞪眼、长时间张嘴、嚎哭、快速落泪、咬牙嘶吼、拍桌和指着他人。
避免悲伤阶段使用明显皱脸哭相,避免愤怒阶段持续睁大眼睛。愤怒主要通过目光重新聚焦、眉毛压低、下眼睑收紧、下颌稳定和身体重新挺直表现。
避免全脸肌肉同时变化,避免完美对称表情、规律机械眨眼、橡胶嘴、五官漂移、年龄变化、发型变化、服装变化、手指畸形和身体冻结。
避免无动机环绕、突然变焦、反复失焦、强烈手持抖动、随机路人、可辨识投影文字、品牌标识和水印。
【灵魂锚点】
她的愤怒来自被伤害后的清醒。震惊让她停住,悲伤让她短暂低头,最终重新抬起的目光意味着她决定保护自己的成果和尊严。
Skill 没有直接给我一段表情描述,它先补了环境、动机等等外部因素,这样的好处是可以让大模型更好的理解整个视频所偏向的氛围。
然后是时间轴里我最喜欢的一段。她的下睫毛快速湿润,她立刻抬眼望向天花板方向把眼泪逼回去,再低头时脸上已恢复平静,只有坚定的目光。
全程没有一滴眼泪掉下来,负面约束里甚至专门写了一条,禁止泪水滑落。因为这一版的张力就在于泪始终没掉,模型很容易忍不住让她哭出来,得提前摁住。
第二个更短,现代职场女性,看到暗恋的同事走过来。
完整提示词如下
人物锁定段。一位二十六岁左右的中国职场女性,浅杏色圆领针织衫,锁骨处一条细银链,黑发披肩微卷,耳侧碎发自然垂落,淡妆,唇色是温柔的豆沙色。皮肤纹理真实,细节清晰可见。整个视频中保持一致的身份、服装、发型和外貌。
场景与光线段。工作日上午的办公室工位,靠窗位置,柔和的自然光从她侧后方的窗户漫进来,在发丝边缘形成一层浅浅的轮廓光,她面前是电脑和一杯冒着热气的咖啡,背景过道方向虚化,浅景深。
人物动机段。她用余光捕捉到暗恋了半年的同事正从过道那头朝这边走来,大概率只是去打印机取文件,但路线会经过她的工位。她想看,又怕被发现在看,还想在他经过的三秒里显得毫不在意又恰好好看。
情绪递进段。从余光锁定目标时的心跳漏拍,到假装专注工作的克制表演,再到人走近时藏不住的那一点点笑意泄露。
表情时间轴段(6秒)。00:00–00:02 她的视线飞快地朝过道方向瞟了一眼又立刻收回屏幕,睫毛轻颤,呼吸有一次小小的屏住,随后她下意识地抬手把耳侧碎发别到耳后。00:02–00:04 她挺直了一点坐姿,眼睛盯着屏幕假装专注,但眼神的焦点明显不在屏幕上,视线虚虚地飘着,嘴角开始不受控制地单侧微微上扬,她抿了一下嘴想把笑意压回去。00:04–00:06 脚步声接近,她的视线终于没忍住又偷偷抬起来瞟了第二眼,正好那一瞬她脸颊微热,笑意彻底藏不住地从眼睛里漫出来,她赶紧低下头对着屏幕抿嘴笑,手指无意识地摩挲着咖啡杯耳。全程无台词。
镜头语言段。中近景侧位机位,从她工位斜前方拍摄,能同时看到她的侧脸和她偷瞄的视线方向,镜头带极轻微的手持呼吸感,暖调柔光,焦点全程在她脸上,暗恋对象始终不入画,只以脚步声和她的视线反应存在。
负面约束段。禁止面部僵硬,禁止眼神空洞无神,禁止对称假笑,禁止直勾勾盯着镜头,禁止暗恋对象出现在画面里,要求全脸肌肉协同运动与自然的微表情。
这个生成出来的视频我是真的喜欢,大家看一下是不是那种少女的娇羞感立刻就出来了。
Skill 做了一个我觉得很妙的决定,暗恋对象全程不出现在画面里,只用脚步声和她的视线反应来演出这个人的存在。观众脑补出来的那个人,永远比模型生成的更帅。
然后是两次偷瞄的设计。第一眼是确认,飞快瞟一眼立刻收回。第二眼是没忍住,笑意彻底藏不住地从眼睛里漫出来。真实的暗恋都是两段式的,一次到位反而假,有过暗恋的朋友来说一下,是不是这样呀。
写在最后
看到这里你可能会想,装上这个 Skill,我是就能量产影后级的 AI 视频了吗?
那肯定不行啊。
Skill 能保证的是下限,它让你写出来的提示词不会犯面瘫、死眼、情绪瞬移这些低级错误,让人物看起来在"演戏"而非"摆表情"。
但一条视频真正打动人的东西,是你决定让她为什么而崩溃,为谁而心动。这个判断 Skill 给不了你,得你自己从生活里观察而来,这方面,Skill 能帮助的有限。
工具是导演助理,导演还是你。
别光收藏,找个情绪,现在就去生成一条试试。
以上就是今天的分享,觉得有帮助,帮请帮一键三连:点赞、转发,再看和留言,你的反馈对我很重要!

