如何住进故事里
从AI 短片《糖果》看,创作者如何先住进世界,再把观众搬进去
写在前面:这篇文章不写影评,也不写技术评测。我想借一部 9 分钟的 AI 短片,回答一个更朴素的问题——当"生成"变得几乎免费之后,一个人到底要具备什么,才配得上"讲故事"这件事。
引子:一个只有十个字的故事
2026 年 9月 10 日,一部 9 分钟的 AI 短片《糖果》(Candy)上线 B 站。没有热搜,没有推荐位,几天之内播放突破 300 万,外网播放破 68 万。
它讲的故事,创作者 DiDi_OK 自己只用十个字就概括完了:
"坏人会爆炸,好人就没事。"
设定是这样的:人类能源使用能力抵达一级文明的门槛,土星的卫星"潘"突然离开轨道,出现在地球上空。此后,只要一个人起心动念要伤害他人——砰,他就在原地爆炸。血肉不剩,只留下一大堆五颜六色的糖果。糖化的人七天后会变回人,但再次伤人,又会重新糖化。
世界因此变得"文明"了。最后,人类拟定了一个"反牧羊人计划":把三次变成糖果的人送上月球基地,去吸引"潘"的注意,从而降低它对地球的影响。
十四个字讲完的设定,撑起了 9 分钟,也撑起了一个所有人都无法轻易回答的追问。
我想说的第一件事就是:一个故事能被讲得这么"短",恰恰是因为它被想得足够"长"。
第一部分 · 拆解《糖果》——它凭什么成立
我用三个维度来拆:情节、人物、对白。但我想先给你一个总的判断。
《糖果》的成就,不在于它"用 AI 做出来了",而在于它用一个极简的规则,撬开了一个极复杂的人性追问。这在剧作上叫"高概念"(high concept)——用一句话就能让人产生好奇,且这句话本身自带冲突。情节
一、一条"规则",三次翻转
它的叙事结构其实非常古典,是三段式的:
第一段:规则降临 → 世界变好。外星卫星降临,暴力者糖化,人类社会肉眼可见地变好了。这是一段"爽"的段落——观众看到恶人受到惩罚,情绪被满足。
第二段:代价显现 → 秩序异化。但糖化带来了新问题。这里 DiDi_OK 埋了一个非常关键的转向:看起来是文明,其实是恐惧在统治。人们不再作恶,不是因为变得善良,是因为害怕爆炸。这不是道德,这是威慑。
第三段:集体裁决 → 暴政成形。"反牧羊人计划"登场。全人类集体同意,把不合规的人送去月球。这个决定,所有人都觉得"这一定是对的"——而这,恰恰是最大的危险。
三次翻转,每一次都在拆掉上一段建立的合理性。
这就是它最了不起的地方:它没有把"暴力"当作一个可以被简单消灭的东西。它让你先爽,再让你怀疑自己的爽。
反暴力的故事,最大的爽点却是看坏人被更强大的力量干掉。这件事本身暴力吗?
DiDi_OK 没有回答。他把这个问题留给了观众——这是作品的层次,也是作品最不像"AI 作品"的地方:它不急于给答案。人物
二、主角不是人,是那条规则
这里我要说一个反直觉的判断:《糖果》里没有传统意义上的主角。
真正的主角是那条规则——"潘"带来的、以"起心动念"为判定标准的外星法则。所有人类都是配角,是这条规则的实验对象。
这是刻意的设计。当主角是一条不可谈判的规则时,故事的张力就不再来自"人物要什么",而来自"人在规则之下会变成什么"。
在少数有血有肉的人物里,有两个设计特别值得说:
其一,那位代表性发言人。DiDi_OK 说,他花了很长时间设计这个角色,要让她拥有"特别容易被大众信任的气质"——有点像《三体》里的程心。
为什么?因为"把违规者集体送去月球"这个决策,本身带着一种"所有人都觉得这一定是对的"的危险。如果发言人不讨人喜欢,这个危险就传递不到观众身上。她的可信,恰恰是作品的刀刃——你信任她,你才会跟着人类一起做出那个可怕的集体决定,然后在事后感到不安。
这是一个极其高级的人物功能设计:她不是为了被喜欢而存在,她是为了让观众"共谋"而存在。
其二,那个脸上有小痘痘的女孩。这是全片我最喜欢的一个细节。DiDi_OK 特意保留了她脸上那颗小痘痘,把它当作一个"信息锚点"。他的原话是:这个极小的信息点,会让观众第一眼觉得——这是一个真实存在的人。
当演员的脸本身能提供信息量的时候,导演才敢把镜头停在那里,才敢给观众时间去感受。
一颗痘痘,决定的不是画面好不好看,而是观众信不信这个世界。对白
三、让"安静"承担叙事
我必须说实话:这部片子的对白是克制到近乎吝啬的。它不像很多 AI 短剧那样用台词填满每一秒,反而用了大量"安静的叙事"——长镜头、微表演、环境的沉默。
这里有一个行业性的大背景,我认为是《糖果》真正的成就所在:
过去的 AI 影像创作者"不敢慢"。
五秒一个场景、三分钟一反转——我们过去把这归因于"短剧节奏方法论"。但 DiDi_OK 说了一句大实话:"以前不敢慢,是因为模型能力完全达不到。"过去的模型无法支撑长镜头里细节的稳定,所以只能不断用新的视觉刺激,把模型来不及暴露的问题掩盖过去。
快切从来不是美学选择,是技术妥协。我们管它叫"节奏",其实叫"遮丑"。
《糖果》第一次让 AI 短片"敢慢下来"。教科书级别的长镜头、实验室里年轻研究员被官员搭理一句时"身体微微再弯一点、眼神亮一下"的微表演、手指甲超近特写下皮肤与指甲的质感——当画面敢被暂停和慢放时,叙事才第一次从"信息传递"升级为"体验营造"。
DiDi_OK 说,这个模型至少帮他省掉了 60% 的叙事成本。
请注意这个词——不是制作成本,是叙事成本。他的原话是:
"过去你只能绕着模型的缺陷去讲我们的故事。但现在,模型开始允许我们,按我们脑海中的想法去讲故事。"—— DiDi_OK 谈 Seedance 2.5
这就是《糖果》在剧作层面的真正成就:它证明了 AI 短片不必靠"打脸—反转—打脸"活着。当镜头敢慢下来、表演有了微表情、脸能提供信息量,AI短片就从"量产"走向了"调度"。
第二部分 · 导演是谁——他凭什么敢这么拍
如果只看作品,你会以为创作者是个技术极客。但了解DiDi_OK 之后,你会发现,《糖果》的每一处"敢",背后都是一段很长的"不敢"。背景
一、一条绕了很远的路
DiDi_OK,河南郑州人,本硕都是动画专业,毕业于伦敦艺术大学,现在长期在伦敦,任职于 WPP Production(WPP 是全球最大的广告传播集团,奥美是它的子公司),职位被特设为"AI 导演"。
他出国的理由特别有意思——不是因为什么宏大规划,是因为他和朋友以前拍完片,半夜会一起看影视飓风的视频,Tim 是他的"赛博偶像"。而 Tim 以前在英国。那就去英国吧。
然后他真的回家学了半年英语,申请伦敦艺术大学。他妈一开始觉得他绝对考不上,连名都没帮他报,他自己偷偷报的,结果考上了。
几年后,这个当年半夜看影视飓风的小伙,受邀坐进了影视飓风的 AI 课程,给大家分享自己的创作心得。
我特别喜欢这段。因为它说明一件事:一个人的审美不是天上掉下来的,是被什么东西反复喂养出来的。他喂给自己的,是好的影像、好的叙事、好的判断。
还有一个细节值得所有从业者注意:他最初是抵制 AI 的。早期 AI 工具学习成本太高、操作繁琐,他因此和公司要求僵持了约三年。直到 2025 年 4 月 Runway 推出 Gen-4,他意识到 AI 视频已经能用于叙事,才决定投入。
这一点非常关键。一个从"原教旨主义者"转变过来的人,对 AI 的理解,和一个一开始就想用 AI 走捷径的人,是完全不同的——他始终知道什么是对的,只是终于等到了能实现它的工具。理念
二、一个叫"力道"的词
在 AI 出现以前,DiDi_OK 就一直在创作。2021 年,他在伦敦艺术大学做过一部《Moth》(飞蛾):一个被雾笼罩的封闭世界,中央有一座巨塔,所有人都说那里不能碰,主角却像飞蛾扑火一样一定要上去——哪怕真相让人失望,哪怕会死,也想看一眼世界真正的样子。
那时候他就已经很"Di 味"了。他脑子里关于科技、未知、文明的东西太多了。真正卡住他的,是那个时代的生产力。
传统动画的流程太长了:建模、绑定、动画、后期……流程一多,人就多;每多一个人,你脑子里的想法转化成语言传达出去,就损耗一点。到最后,那个让你起鸡皮疙瘩的创意落在屏幕上时,可能连一半都不剩。
所以他这些年一直在研究一件事,他自己给这件事起了个名字,叫——
力道。怎么让自己脑海中的创意和感觉,以最低的损耗传递给观众
这是我在这整套访谈里最喜欢的词。因为"力道"这个词,精准地指向了所有创作者最深的痛:我想说的、和我最终说出来的,中间那道无法闭合的缝。
他对"创作"的定义,也和这个理念一脉相承。有人质疑"AI创作不就是抽卡吗",他讲了 2023 年参与 F1 赛车宣传片的经历——实拍加虚拟制作,一个镜头可能 NG 500 多次,一天场地费就是 10 万英镑。赛车漂移、轮胎擦地、烟冒出来,导演说那个烟不好看,所有调度归位,再来一遍。直到第 397 次的烟最好。
"真正的创作,是那个'不要'。为什么这个导演要第 397 次?前面那 396 次,为什么都不要呢?这个'不要',才是审美,才是判断,才是经验,才是真正的创作。"—— DiDi_OK 谈什么是创作
传统影视也是抽来抽去的逻辑。AI 只是把抽卡的速度变快了、质量变高了。但从 300 个结果里挑哪一个,依然是人的事。过程
三、推翻,是一切的前提
第一,他推翻了自己 40% 的成品。
这部片子他先用 Seedance 2.0 做了将近 40% 的内容,试用 2.5 之后,毅然决然,全部推翻重来。
他还讲了一件更残酷的事:过去他做 AI 影像有一条明确的优先级——参考图 > 提示词 > 模型选择。为了让模型完成它能力之外的动画,他要垫好几张图、用 Blender 建模做参考、一个字一个字追踪修复,"基本都是能工智人"。
而到了《糖果》,这套逻辑整个反了过来:参考图的重要性下降,提示词的重要性疯狂上升。很多过去必须先做好关键帧才能做的动画,现在"可以直接用嘴说了"。
他说:
"当模型开始吞掉工作流,创作者剩下来的,才是真正属于创作者的东西。"—— DiDi_OK
那些苦心经营半年的技巧、那些保持一致性的工作流,可能被一次模型发布直接吞噬。他把这些称为"小数点后面的技术"。
第二,他把自己逼得更狠了。
反常识的是,模型越强,他越痛苦。
"以前两三天一个镜头,因为你知道模型就那样了,上限在那,可以安慰自己这不是我的问题。但现在,第三次就能给你一个特别牛逼的结果——那说明,它能做。这时候压力就全部给到我身上了:为什么我调度不出来?为什么没想到那个机位?"—— DiDi_OK
他甚至可能为一个镜头磨一个星期。他说:"模型是明显能做到的,但我却做不出,那明显就是我自己的问题——我还是太菜了。"
第三,他给作品留了"不回答"的权利。
他花长时间设计那个可信的发言人,却拒绝在片尾给出答案。文明?秩序?暴政?还是一个比现在稍微好一点的世界?
他不回答。因为一个被创作者回答完了的作品,观众就没有地方可住了。
第三部分 · 做 AI 短剧,需要创作者哪些素质
好,现在说最实际的部分。
先摆一组数据,让这件事的难度有真实的刻度:
指标( 2026 年上半年) |
数值 |
全网新上线 AI 短剧/漫剧总量 |
超 22.19 万部 |
播放量破亿作品 |
1055 部(破亿率约 0.47% ) |
以 5000 万播放为回本线,过线作品 |
2886 部(占比约 1.3% ) |
AI 短剧占全部微短剧产量比例 |
95% 以上 |
相关从业者/个人创作者 |
超 50 万人 |
AI 降低了制作的门槛,但没有降低创作的门槛。
一位从业者说得很准:"AI 把'生成'变得便宜,把'判断'变得昂贵。"
那么,在这个"生成免费、判断昂贵"的时代,一个人要具备什么?我从《糖果》里提炼出六项素质。前三项是"手艺",后三项是"心法"。
手艺一:判断力——那个"不要"
这是所有素质里最核心的一项。
AI 时代最稀缺的不是"生成能力",而是从 300 个结果里挑出那一个、同时说出 299 个"不要"的能力。
为什么?因为绝大多数团队的流程里只有"生成",没有"不要"——素材出来就剪,剪完就投,投完就忘。量产逻辑的尽头不是爆款,是废片率。
练法:不要问"这个能不能用",要问"为什么这个比那个好"。每一次取舍都逼自己说出理由,判断力就是在这无数次"说出理由"里长出来的。
手艺二:审美——一个稳定的"视觉系统"
DiDi_OK 的片子有一个共同点:低饱和度的写实风格,和极强的个人辨识度(网友管这叫"Di 味")。半遮脸的虚拟主持人、"骑自行车的小熊"、平行宇宙世界观里的渡渡鸟和大海雀——他有一套自己的符号系统。
这也是评奖的关键:"能生成"已经是基础能力,真正稀缺的是明确的作者表达、稳定的视觉系统、完整的叙事逻辑。
练法:先别急着用 AI,先去建立你的视觉参考库。游戏概念设计、3D 动画、古典艺术、电影史——DiDi_OK 的审美底子来自这些地方。他有一个观点我很认同:创作者不应在 AI 圈内卷,而应回归传统影视和古典艺术本源。
手艺三:叙事结构——AI 唯一没有重塑、反而更依赖人的部分
这一点必须单独拎出来,因为它是唯一一块 AI 没有吞掉、反而变得更贵的能力。
从业者的判断很一致:"结构——多支线逻辑闭环、分支互穿、情绪连续性——这些是纯模型解决不了的,需要人来搭骨架。"
《糖果》的结构为什么强?因为它"规则—代价—异化"三段式,每一步都在推翻上一步建立的合理性。这个骨架,模型给不了。
练法:不要从"画面"开始你的创作,要从"规则"开始。《糖果》的起点不是"我想拍糖果爆炸",而是"我想看看,当暴力被一条外部规则强行禁止时,人类会变成什么"。
所有伟大的故事,都是从一句"如果……会怎样"开始的。
心法四:对人的兴趣——你要真的对人好奇
这一条听起来最软,其实最硬。
《糖果》最狠的地方,不在于它想象了糖果爆炸,而在于它对人性有一整套看法:善良的人往往就是被欺负的人;所以从西方骑士到中国侠客,人类几千年一直在幻想同一件事——正义最好拥有力量。
也正因为它对人这么有兴趣,它才能设计出"可信的发言人""带痘痘的女孩"这种只有真的观察过人的人才能想出来的细节。
AI 可以用数据模拟人,但它无法替你好奇人。你观察过多少次真实的人?你记得几张真实的脸?你为陌生人的处境动过几次心?——这些问题,决定了你的作品里有没有"人味"。
心法五:把"限制"当素材的能力
这一条是我认为最有启发的。《糖果》整个故事的诞生逻辑,本身就是"把限制变素材"的典范:
它的底层判定标准是四个字——"起心动念"。这是极具中国味的设定:判定暴力的,不是行为,是意图。这个设定,恰恰把"内心"变成了整个故事最不可见的战场。
而在技术上,他做得更有意思:因为模型能力提升了,他反过来主动设计"让大家暂停看看"的镜头——比如警察局那场戏,画面里同时有十几个人,他给后面一个黑人角色单独设计了一条故事线:先挣脱、然后推桌子、拿起电视、准备攻击警察,随后灯光闪烁,所有人的动作短暂停顿,特定的人同时炸成糖果。
他不是在"用"AI,他是在"设计"AI 的能力边界。
练法:别问模型能做什么,问你想让观众看到什么,然后倒推怎么实现。限制是创作的敌人,也是创作的原料——关键看你是否把它当原料。
心法六:直面"那个问题"的勇气
DiDi_OK 说,他自己是一个"极度的悲观主义者",而且坦承有很严重的存在主义危机:
"当 AI 能帮我做所有事情的时候,我到底,是否真的是一个有意思的人呢?"—— DiDi_OK
公司里的新人也总问他:"老师,以后应该学什么?"——他说他也不知道。
但我觉得,正是这个"危机",让他成了真正的创作者。
因为他的作品底色,是一种奇怪的希望。他嘴上悲观,心里不希望人类输——像《三体》里的维德。
"很多伟大的创作者,他们创作,很少是因为觉得这个世界已经很好了,恰恰是觉得它还不够好。所以才会创造另外一个世界——那个让很多人能跟他一起感受美好的、美妙的世界。"
当你问出"我自己还剩什么"的时候,你就已经在回答它了。
因为那个会为此焦虑的人,是模型永远替代不了的。模型不会为"我是否平庸"而失眠。
结语:住进故事里,是一场双向的搬迁
如何住进故事里?
第一步,是创作者自己先住进去。
DiDi_OK 不是在"讲"一个糖果爆炸的故事。他是先住进了那个世界——住进了"潘"降临后的人类社会,住进了那条以起心动念为判据的规则,住进了每一个即将被送走的人的处境。他必须在那个世界里待得足够久,久到能看见一颗痘痘、能听见一句冷漠的搭理、能感受到集体鼓掌时的那一点不安。
第二步,是用"力道",把观众搬进去。
他做的一切技术上的努力,本质上都是为了让那道"我想说的和我说出来的"之间的缝尽量小。他推翻 40% 的成品,是因为那个版本传递不出他要的力道;他研究长镜头和微表演,是因为只有慢下来,观众才有时间住进去。
第三步,是留出空间,让观众自己安家。
他不回答"这是文明还是暴政",因为答案一旦给出,房门就关上了。
住进故事里,从来不是观众单方面的能力,而是创作者与观众之间的一次接力。
我今天说这些,其实不只是在说 AI 短剧。
在这个"生成变得几乎免费"的时代,我们每一个人,无论做什么,都正在面对同一道题:当工具接管了执行,你还剩下什么不可替代的东西?
下图是DiDi_OK为了一个镜头写的提示词。
附:文中核心事实与数据来源
项目 |
信息 |
作品 |
《糖果》( Candy )2026 年 9 月 10 日发布,时长约 9 分钟 |
播放数据 |
B 站超 300 万播放;外网播放破 68 万 |
技术 |
使用字节跳动 Seedance 2.5 制作 |
创作者 |
DiDi_OK ,河南郑州人,伦敦艺术大学动画专业,任职于伦敦 WPP Production |
前作 |
《牌子》( B 站 2000 万 + 播放,全网近亿, B 站首届 AI 创作大赛一等奖)、《网站》(威尼斯 Reply AI Film Festival 双奖)、《箭头》《垃圾站》《绿幕》《我不是外星人》 |
行业数据 |
2026上半年全网新增AI短剧22.19万部,破亿率 0.47% ,回本率约 1.3% ,从业者超 50 万 |
本文事实部分基于 DiDi_OK 公开专访(数字生命卡兹克)、百度百科词条,以及 DataEye/中国网络视听协会行业数据整理。观点部分为作者个人分析

