大数跨境

我看了一条39秒的视频,把演员的脸拆成了一个Skill

我看了一条39秒的视频,把演员的脸拆成了一个Skill 萝卜AI笔记
2026-07-20
7
导读:终于没有AI僵尸脸了~

大家好,我是萝卜哥~


前几天刷到一条 39 秒的古装视频,一个汉服美女,对着镜头把同一个"滚"字说了六遍。

笑骂着说,委屈着说,失望着说,愤怒着说,崩溃着说,最后心如死灰地说。


同一个字,六种人生,表现的相当细腻了,我真的是来回看了不下十遍,原来 AI 生成的人物,也可以拥有这么顶级的演技啊。


说实话,做 AI 视频这么久,我最头疼的一直是人脸。场景可以真实,运镜可以电影级,但人物一开口,完蛋,嘴在动,眉毛纹丝不动,眼睛里空空的,就是我们常说的 AI 僵尸脸。


所以我把视频逐帧拆了一遍,又跟 AI 来回折腾了好几轮,最后把整套方法沉淀成了一个 Skill,名字就叫"表情导演"。


来看一个我生成的视频,有没有帝王的那种从容和狠厉。

今天把拆解过程和这个 Skill 都分享出来。


先说我拆出来的三个秘密

把那条视频一帧一帧过完,我发现打动人的从来都是一些特别小的瞬间。眼神什么时候躲开,嘴角什么时候微颤,情绪什么时候彻底撑不住,这些小小的瞬间,让我们的 AI 视频更加真实。


相对来说,哭得多大声反而不重要,微表情更能打动人。


顺着这个往下,我总结出三个编写重点。


一、先写动机,再写表情。


很多人写提示词,上来就是"她很伤心"。但我们想一想真的演员是怎么干活的,演员拿到一场戏,第一件事想的从来都是"我为什么会有这个反应",想清楚了,表情自己就出来了。


AI 也一样,你不给它前置条件,它就只能做表面的肌肉运动,眼睛里没内容。


但是如你告诉它"她等这个人等了很久,等来的却是一句敷衍的借口,而且这不是第一次了",它的眼神立刻就不一样了。


二、情绪必须递进,禁止瞬移。


开头那条视频里的崩溃版就是这么演的,先是眼神停住,还没反应过来。然后强撑,想维持平静,但呼吸已经乱了。最后才撑不住,眼泪掉下来。


三段,一段都不能少。如果你直接写"她崩溃大哭",生成出来的就是上一帧还好好的,下一帧突然嚎啕,假得离谱。真实的人不会瞬移情绪,都是在不断的清晰积累里面慢慢爆发的。


三、镜头也要参与表演。


这个是我拆到后面才反应过来的。愤怒的时候镜头缓慢推近,压迫感就出来了。心如死灰的时候镜头缓缓拉远,那个感觉叫"整个世界正在离开她"。还有一个我特别喜欢的写法,人物崩溃后退时,镜头原地不动,让她在画框里一点点变小,被抛下的孤立感直接拉满。


镜头不只是个记录工具,它是替角色说潜台词的第二演员。


七个元素,一个都不能漏

拆完视频,我把一段合格的表情提示词压缩成了一个公式。


动机,眼神,呼吸,身体,声音,脸部,收尾。


前面几项好理解,我重点说两个最容易被漏掉的。


一个是呼吸。委屈的时候呼吸会卡住一下,那种委屈感一半来自喉咙。崩溃的时候呼吸是乱的,短促抽气,胸口起伏没有节奏。愤怒是呼吸变重,鼻翼扩张。


真的建议大家都去在提示词里写一下呼吸相关的内容,你会回来感谢我的。


另一个是收尾。话音落下之后的那半秒余韵,才是表情视频的高光帧。笑骂着说完"滚",咬住下唇。崩溃着说完,整张脸垮掉。愤怒着说完,继续死瞪着一言不发。这半秒最容易被忽略,但它有时候又正好是最容易打动观众的那一帧。


实测两个例子

方法说完了,来看两个具体案例,我拿两个模糊到不能再模糊的需求测了一下这个 Skill。


第一个输入,现代职场女性,得知自己被裁员了。

Image

得到的完整提示词如下

  
单镜头连续表演,写实人物视频。专业纪录片式观察视角,使用会议室现有光线,保留真实皮肤纹理和轻微呼吸起伏。

【人物设定】

一位30岁左右的成年东亚职场女性,清晰自然的面部轮廓,眼下有轻微工作疲惫感,真实皮肤毛孔,深色长发整齐束在脑后,额前有少量自然碎发。淡雅通勤妆,穿深灰色修身西装和白色衬衫,佩戴银色细耳钉与公司工牌。

她平时理性克制,习惯在公开场合保持专业。全程保持年龄、脸型、五官比例、发型、服装和妆容一致。

【场景与环境】

现代公司玻璃会议室,工作日下午。她坐在长桌一侧,面前放着笔记本电脑、打印材料、黑色签字笔和半杯冷咖啡。背景有投影幕布、百叶窗、磨砂玻璃隔墙、深色办公椅、墙面时钟以及几位轻微虚化的参会同事。

投影幕布上展示着她参与完成的项目方案。画外上司正在把成果归到自己名下,同时暗示项目失误由她负责。幕布内容保持模糊,不出现可辨识文字。

窗外冷白自然光从她左侧照入,会议室顶灯提供平淡补光。空调吹动她耳边的一缕碎发,投影光轻微落在她脸侧。

【人物动机】

触发事件:她突然确认自己的核心成果被上司占用,责任也被推到了她身上。

当前目标:控制情绪,确认自己没有听错,并准备维护自己的成果与尊严。

现实障碍:会议室里有部门领导和多位同事,她不能立刻失控,也不能显得缺乏职业素养。

保护策略:先保持沉默,通过重新查看材料和控制呼吸争取思考时间。

隐藏潜台词:“原来你早就计划好了。你拿走我的成果,还想让我承担后果。”

【表演控制】

内在情绪压力从2/5迅速升至5/5。

外在表达幅度从1/5逐步升至3/5。

自我控制从5/5下降至3/5,但始终没有彻底失控。

震惊由眼睛和呼吸率先表现,悲伤通过失焦的视线、下眼睑和嘴角渗出,愤怒通过重新聚焦的目光、压低的眉毛、收紧的下眼睑和稳定的下颌完成。

【镜头语言】

平视三分之四近景,接近50毫米人像透视,镜头高度与人物眼睛齐平。女性位于画面左侧,右侧保留指向画外上司的负空间。她的视线目标位于镜头右侧靠近镜头的位置。

焦点始终锁定她靠近镜头一侧的眼睛,景深较浅,背景人物与投影内容自然虚化。

前半段保持固定机位。悲伤开始转化为愤怒时,镜头进行一次极缓慢的小幅物理推进。当她重新抬眼直视上司时,镜头立即停止移动并锁定画面。

【9秒表演时间线】

0.0至1.0秒:

她保持普通会议状态,低头看着打印材料,右手自然握笔,嘴唇放松,呼吸平稳。听到画外上司提到项目归属时,笔尖逐渐停住。

镜头保持固定,会议室只有低沉的空调声和远处投影仪风扇声。

1.0至2.5秒,震惊:

她的眼睛先停止移动,随后视线迅速抬向画面右侧的上司。上眼睑明显抬起,下眼睑仍保持轻微紧张,嘴唇无意识分开一点。她吸入半口气后突然停住,握笔的手僵在纸面上。

头部没有立即转动,眼睛先完成确认。大约半秒后,她才缓慢抬起下巴。避免夸张张嘴和突然后仰。

2.5至4.3秒,震惊沉入悲伤:

她重新低头看向材料,仿佛希望从文件中找到自己听错的证据。眼神逐渐失去焦点,眨眼速度放慢。眉毛内侧轻微上提并靠拢,下眼睑出现湿润感,但眼泪没有掉落。

她的嘴唇先轻轻闭合,随后下唇出现一次很短的颤动。下颌微微松开,肩膀下沉少许。握笔的手慢慢放松,签字笔在纸面上滚动一小段距离。

4.3至5.6秒,悲伤被压住:

她吞咽一次,把即将涌出的情绪压回去。嘴唇收紧成一条较薄的线,呼吸从停滞变成一次缓慢而克制的鼻腔呼气。

她闭眼不到半秒,像是在重新整理思绪。睁眼后,眼中的湿润仍然存在,悲伤开始被明确的判断取代。镜头从此刻开始极缓慢靠近。

5.6至7.5秒,愤怒形成:

她重新抬眼看向画面右侧的上司。视线变得稳定、集中,不再躲避。眉毛逐渐压低并向中间收紧,下眼睑变得结实,鼻翼伴随一次较重的呼吸轻微张开。

她慢慢挺直背部,将双肩重新打开。下颌收紧,牙关保持闭合,嘴唇压住即将说出口的话。右手停止追逐滚动的签字笔,手指缓慢收拢,压住桌面上的文件。

镜头在她目光彻底稳定时停止推进。

7.5至9.0秒,克制的愤怒与余韵:

她持续直视画外上司,没有大声质问,也没有拍桌。眼睛保持锋利稳定,嘴角出现极轻微且不对称的紧绷,表现出失望和冷怒。

她缓慢把属于自己的材料拉回面前,动作平稳而坚决。最后轻轻吸气,身体略微前倾,呈现即将开口反击的状态。画面停留在她坚定的目光上结束。

【光线变化】

震惊阶段保持平淡冷白光线。她低头进入悲伤时,百叶窗投下的柔和阴影落到眼睛上方。她重新抬眼进入愤怒时,侧光勾勒出眼睛、颧骨和下颌轮廓,面部整体曝光保持稳定,不改变光源颜色。

【声音设计
保留会议室空调声、投影仪风扇声、纸张轻响、签字笔滚过桌面的声音、她突然停止的吸气、克制的吞咽以及逐渐加重的呼吸。

画外上司的声音只保留模糊语气,不出现清晰对白。无背景音乐,无旁白,无字幕。

【负面约束】

避免三个情绪瞬间切换,避免一开始就达到最大愤怒,避免夸张瞪眼、长时间张嘴、嚎哭、快速落泪、咬牙嘶吼、拍桌和指着他人。

避免悲伤阶段使用明显皱脸哭相,避免愤怒阶段持续睁大眼睛。愤怒主要通过目光重新聚焦、眉毛压低、下眼睑收紧、下颌稳定和身体重新挺直表现。

避免全脸肌肉同时变化,避免完美对称表情、规律机械眨眼、橡胶嘴、五官漂移、年龄变化、发型变化、服装变化、手指畸形和身体冻结。

避免无动机环绕、突然变焦、反复失焦、强烈手持抖动、随机路人、可辨识投影文字、品牌标识和水印。

【灵魂锚点】

她的愤怒来自被伤害后的清醒。震惊让她停住,悲伤让她短暂低头,最终重新抬起的目光意味着她决定保护自己的成果和尊严。

Skill 没有直接给我一段表情描述,它先补了环境、动机等等外部因素,这样的好处是可以让大模型更好的理解整个视频所偏向的氛围。


然后是时间轴里我最喜欢的一段。她的下睫毛快速湿润,她立刻抬眼望向天花板方向把眼泪逼回去,再低头时脸上已恢复平静,只有坚定的目光。

全程没有一滴眼泪掉下来,负面约束里甚至专门写了一条,禁止泪水滑落。因为这一版的张力就在于泪始终没掉,模型很容易忍不住让她哭出来,得提前摁住。


第二个更短,现代职场女性,看到暗恋的同事走过来。

Image

完整提示词如下

  
人物锁定段。一位二十六岁左右的中国职场女性,浅杏色圆领针织衫,锁骨处一条细银链,黑发披肩微卷,耳侧碎发自然垂落,淡妆,唇色是温柔的豆沙色。皮肤纹理真实,细节清晰可见。整个视频中保持一致的身份、服装、发型和外貌。

场景与光线段。工作日上午的办公室工位,靠窗位置,柔和的自然光从她侧后方的窗户漫进来,在发丝边缘形成一层浅浅的轮廓光,她面前是电脑和一杯冒着热气的咖啡,背景过道方向虚化,浅景深。

人物动机段。她用余光捕捉到暗恋了半年的同事正从过道那头朝这边走来,大概率只是去打印机取文件,但路线会经过她的工位。她想看,又怕被发现在看,还想在他经过的三秒里显得毫不在意又恰好好看。

情绪递进段。从余光锁定目标时的心跳漏拍,到假装专注工作的克制表演,再到人走近时藏不住的那一点点笑意泄露。

表情时间轴段(6秒)。00:00–00:02 她的视线飞快地朝过道方向瞟了一眼又立刻收回屏幕,睫毛轻颤,呼吸有一次小小的屏住,随后她下意识地抬手把耳侧碎发别到耳后。00:02–00:04 她挺直了一点坐姿,眼睛盯着屏幕假装专注,但眼神的焦点明显不在屏幕上,视线虚虚地飘着,嘴角开始不受控制地单侧微微上扬,她抿了一下嘴想把笑意压回去。00:04–00:06 脚步声接近,她的视线终于没忍住又偷偷抬起来瞟了第二眼,正好那一瞬她脸颊微热,笑意彻底藏不住地从眼睛里漫出来,她赶紧低下头对着屏幕抿嘴笑,手指无意识地摩挲着咖啡杯耳。全程无台词。

镜头语言段。中近景侧位机位,从她工位斜前方拍摄,能同时看到她的侧脸和她偷瞄的视线方向,镜头带极轻微的手持呼吸感,暖调柔光,焦点全程在她脸上,暗恋对象始终不入画,只以脚步声和她的视线反应存在。

负面约束段。禁止面部僵硬,禁止眼神空洞无神,禁止对称假笑,禁止直勾勾盯着镜头,禁止暗恋对象出现在画面里,要求全脸肌肉协同运动与自然的微表情。

这个生成出来的视频我是真的喜欢,大家看一下是不是那种少女的娇羞感立刻就出来了。

Skill 做了一个我觉得很妙的决定,暗恋对象全程不出现在画面里,只用脚步声和她的视线反应来演出这个人的存在。观众脑补出来的那个人,永远比模型生成的更帅。


然后是两次偷瞄的设计。第一眼是确认,飞快瞟一眼立刻收回。第二眼是没忍住,笑意彻底藏不住地从眼睛里漫出来。真实的暗恋都是两段式的,一次到位反而假,有过暗恋的朋友来说一下,是不是这样呀。


写在最后

看到这里你可能会想,装上这个 Skill,我是就能量产影后级的 AI 视频了吗?


那肯定不行啊。


Skill 能保证的是下限,它让你写出来的提示词不会犯面瘫、死眼、情绪瞬移这些低级错误,让人物看起来在"演戏"而非"摆表情"。


但一条视频真正打动人的东西,是你决定让她为什么而崩溃,为谁而心动。这个判断 Skill 给不了你,得你自己从生活里观察而来,这方面,Skill 能帮助的有限。


工具是导演助理,导演还是你。


别光收藏,找个情绪,现在就去生成一条试试。



以上就是今天的分享,觉得有帮助,帮请帮一键三连:点赞、转发,再看留言,你的反馈对我很重要!


【声明】内容源于网络
0
0
萝卜AI笔记
做有温度的AI人
内容 174
粉丝 1
萝卜AI笔记 做有温度的AI人
总阅读8.3k
粉丝1
内容174