嗨大家好!我是娜姐!
今天测一个不用逐帧画分镜,把一张宫格图丢给 MiniMax H3,它按宫格读、按宫格出,一条 15 秒的彩椒剧情视频,自己就跑出来了。
以前拍这种"带角色、带场景、还带对话"的剧情片,脚本改三稿、约拍摄、剪片子来回调,一礼拜打底;现在一张宫格图 + 一段提示词,十几分钟就出来一条能用的成片。
下面两张。一张是是九宫格(3×3)——红椒、黄椒两个彩椒玩偶,从厨房开场,一路演到寿光大棚;一张是四格(2×2)——彩椒玩偶加一个小孩,在寿光大棚里互动。都是我提前用文生图生成好的分镜图。
这里有个关键点先说透:H3 走"参考图生视频"时,不是看一张图瞎发挥,是"按格执行"——你告诉它"从左到右、从上到下",它就老老实实一格一格当镜头拍,格子的顺序就是视频的顺序。所以你画分镜草图这一步,等于把导演的活儿先干了。
上传宫格图、点生成之前,提示词就是核心。我跑了两版下来,发现真要写对的就两块——
第一块:锁图。一句话把"按哪张图、什么顺序"钉死。我九宫格那版开头就这么写的:
这句话的用处你们品品:"唯一视觉依据"=别让它乱加戏;"从左到右从上到下"=镜头顺序我说了算;"固定人物形象"=红椒永远是红椒、黄椒永远是黄椒。锁住这些,成片才不会跑偏。
第二块:按秒写对白和动作。这是最见功夫的地方。比如我九宫格版里这几段——
一个经验我必须单拎出来说:H3 生成视频,对白越短、越口语化,口型越容易对上。你写"家人们谁懂啊"它说得倍儿自然;你要写一长串书面解说,口型就容易对不上、嘴型飘。所以别贪多,一句话一个镜头,够用。
另一版四格我换了个写法——用英文的 Ref2VA 结构,先把红椒黄椒的"长相设定"锁死,再按格写镜头。逻辑一模一样,就是换了种语言。
下面直接看两版成片👇
感受一下:红椒从开场挥手,到沙拉竖大拇指,到黄椒躺平甩一句"我躺平也是寿光来的"——角色没串、脸没崩,节奏还挺顺。九宫格九个镜头它一气跑完,出来 15 秒整。
这版加了小孩角色,红椒黄椒跟小朋友在寿光大棚里互动,咬一口彩椒"甜甜脆脆的,真不辣"——温馨感出来了。两个成片时长都落在 13 到 15 秒区间,主页发、挂车投流,都够用。
片出来别急着用,这种 AI 视频建议多跑两三版、挑最稳的一条再投。怎么算稳?就四条——人物不变形、动作不抽搐、光影自然、画面稳定。
提示词模板:开头那句=锁图(顺序+比例+风格);中间"固定人物设定"=把角色长相钉死,防止串脸;后面每一段=按秒写动作+对白。换产品就改三处:角色长相、对白卖点、场景(厨房→你的店铺/大棚)。骨架一模一样,照着填就行。
画面稳、两个角色从头到尾没串脸、没变样,比我自己用剪辑软件拼强太多。最关键的是——你不用会画画、不用会剪、不用约拍摄,一张分镜草图就能换一条带剧情带对白的成片。对中小商家,这是真能落地的效率。
宫格图,是目前我把"分镜 + 角色 + 场景"一次性喂给 AI 最省事的办法——你宫格图生成好,让它来当导演。
适合谁:做剧情短视频、产品种草,手里有系列角色,但不想逐帧做动画、也请不起拍摄团队的中小商家——这条路就是给你准备的。
好了,今天的分享就到这里啦。如果大家也在使用这款工具,欢迎在评论区分享你的使用感受和案例。
如果觉得内容有帮助,欢迎点赞、推荐和转发,这对我真的很重要~
我是娜姐,下期见。

