大数跨境

Opus 5.5做视频的新手路线,我把坑踩完整理好了。

Opus 5.5做视频的新手路线,我把坑踩完整理好了。 萝卜AI笔记
2026-10-02
5

大家好,我是萝卜哥~

这几天朋友圈和 X 上满屏都是 Opus 5.5 做的动画,群里也一直有人问,这玩意儿到底怎么弄,新手能不能上手。

我正好前几天拿它给一首 40 秒的歌做了支动漫风 MV,从第一版的火柴人一路改到第六版,中间还拿 Remotion 做了个对比版,坑基本都踩过一遍了。

这篇不聊行业会不会被颠覆,只讲一件事,你照着做,能不能出一支片子。

01先花一分钟搞懂它在干嘛代码画帧,ffmpeg 拼片

很多人第一次看到都会愣一下,Opus 5.5 连一张图都生成不了,视频哪来的。

原理其实很朴素,它会写一段程序,程序负责把每一帧画面用前端技术画出来,存成一张张图片,最后用 ffmpeg 这个工具把图片和音乐拼成 MP4。

我这支 40 秒的 MV,每秒 30 帧,一共 1716 张图,全是代码画的。

**把这件事想明白,后面所有步骤你都知道为什么要这么做了。**比如为什么要先分析音乐,因为画面要卡在拍子上。为什么要先看设定图,因为改代码比重画便宜,但改之前你得先知道问题出在哪里。

02正经出片,用 Claude Code用 Opus 5.5 + Agent 做

如果要想真的做出网上那些优质的视频,那还是要上 Claude Code,它能在后台默默的帮你完成大部分需求所需要的事情。你用普通的网页对话模式,能做的事情非常有限,说白了就是要使用 Opus 5.5 + Agent 的形式来做。

如果你本地没有安装 Claude Code 或者电脑配置不太行,那我建议直接用 Claude Code 的网页版,也就是 claude.ai/code。它跑在云端的容器里,Python、Node 这些它自己会装,你电脑上什么都不用配。

想在自己电脑上跑,装好 Node.js 和 ffmpeg,终端里执行下面这句,进入以后输入 /model 选 Opus 5.5 就行了。

Bash

npm install -g @anthropic-ai/claude-code

如果你像我一样是为已经存在的一段音频增加 MV 视频,那么准备工作就一件事,把音乐文件传上去,剩下的都靠你怎么跟它说话。

第一句话就把想要的说清楚

我最开始第一版只说了一句"给这首歌配个动漫风的视频",它确实做出来了,但人物就是个剪影火柴人,还是非常粗糙的。

Image

后来我发现,就算 Opus 5.5 想象力再丰富,你给的提示词如果太简单,它也只能根据自己的理解去做视频,但是这种理解很大程度是都不是我们需要的。

所以提示词里面必要的约束还是必要的,所以我优化了提示词,现在是下面这样。

MV 提示词模板滑动查看
附件是一首歌,请给它做一支动漫风格的 MV,1920x1080,30 帧。

开工顺序请按这个来
1. 先分析音频,把节拍、段落、能量高低整理成一张时间表,后面所有剪辑点和特效都卡在这张表上。
2. 参考这个作品的做法 [换成你的参考仓库或视频链接],先总结它为什么好看,哪些能借鉴,哪些在我们的环境里要换方案。
3. 主角做成可复用的角色骨架,表情用连续参数控制,能在不同表情之间平滑过渡。
4. 正式渲染前,先出角色三视图、表情对照图、几个关键时间点的画面拼图给我确认,你自己也对照检查一遍。
5. 先测一帧要渲染多久,估算整片时间,太慢就换更快的方案。
6. 分镜用 1 到 4 秒的短镜头,每个镜头有一个明确的动作,切换点落在节拍上。

画面要求
主角有完整的情绪变化,至少出现难过、惊讶、开心、大笑、害羞这几种表情。
站着不动时也要有呼吸和轻微摆动,跳跃前要蓄力,头发和裙摆要有跟随。
MV 包装用上宽银幕黑边、卡点推镜、甩镜头转场、跟随节拍出现的大字、一两秒的特写插入。
背景要分远中近景,复杂的背景层先画好反复使用,保证渲染速度。
最后导出一个 30MB 以内的压缩版给我。

说几个提示词里非常值得关注的点。

参考作品那块我觉得还是非常必要的,我第二轮给了它一个 GitHub 仓库,是 JohnHeibel 大神开源的的 PDoomVideo,是他用 Claude 做的 MV 全部源码。它去拆了一遍,学会了把角色写成能调参数的骨架,人物质量一下子上了一个台阶。你做什么类型的片子,就去找一个同类里做得好的,开源仓库最好,视频链接也行。让它去参考学习一下,那质量肯定要好很多。

设置人物或者其他主要事物的定妆照也非常重要,可以省下很多不必要的返工。就比如它第一次画的角色,头发把眼睛整个盖住了,膝盖手肘像木偶关节。后面我让它先设计三视图,然后渲染的时候都参考这些设计图片,那效果就好太多了。

Image

还有就是渲染速度,这个也不能忽视。就比如我参考的那个仓库,用的水彩笔刷是需要靠显卡跑的,如果你本地没有显卡,或者用的云端 Claude Code,也是没有显卡,那 Opus 5.5 实测一帧要 44 秒,整片得十几个小时,这还玩啥。所以当它发现这个问题后,立刻换了个画布把同样的画法重写了一遍,一帧 0.1 秒左右,整片三分钟渲完。

一轮只改一件事

一条指令发出去之后,剩下的就是一轮一轮根据生成的产物提意见。这个过程,我是推荐每一次尽量只做一件事情,正所谓贪多嚼不烂。

先出一版能看的,然后找参考把人物形象优化好。人物立住了,再加 MV 的包装。接着调动作和表情,再去丰富背景,最后才抠细节。

每一轮只管一个方向,它能把那一块做深。如果非要一次把十个要求全堆上去,它会平均用力,每样都做一点,每样都不到位。

比如我在扣人物表情的时候,就是让它专门优化表情,它把脸拆成十几个能连续调的数,每种表情就是一组数,切换时平滑过渡,一口气做出了 12 种,还是非常细致的。

Image

还有调整人物动作的时候,它出了一组跳跃的连续逐帧,蓄力、起跳、落地一帧帧看下来,哪里断了立刻就改,一点也不敷衍。

Image

每次只改一个地方,看起来可能比较浪费时间,其实这就是在保护大模型的注意力,从而让它工作起来更专注。

提意见要带秒数和部位

这个也是我测试了这么多案例之后,得出的比较实用的经验。

前面几轮我在调整的时候,说的是"再流畅一点""再丰富一点",它能改,但改成什么样全靠它自己猜,我没有明确指出哪里不流畅,它其实也是比较懵的。

后来我把这个说法固定成了一个句式,每轮照着填就行。

Plain Text

[秒数] 那段的 [哪个部位或哪个元素] 看起来 [哪里不对],先把那几帧放大检查,找到原因再改,改完给我看改前改后的对照。

使用这个方法,我终于让人物跑动的时候变得更自然了,说实话,要是能早点发现这个方法,可能还能节省不少 Token。

Image
想更精致,可以再挂一个框架

片子做完以后我又试了一件事,装上 Remotion 的官方 skill,把副歌那 12 秒用它重做一遍,人物和背景不动,只换包装。

Remotion 是一个用网页技术做视频的框架,做视频非常厉害。hyperframes 框架也不错,总之这两个选择任意一个就可以了。

Image

对比下来,文字、转场和质感三处明显更好。大字的弹跳和描边更精致,转场有滑入、擦除、扇形擦除好几种,纸张纹理也更细。人物一点没变,因为人还是原来那套代码画的。

代价就是渲染会慢一些。如果没有 GPU,那 Remotion 的特效渲染全在 CPU 上跑,12 秒渲了 28 分钟,还是挺漫长的。

所以我的建议是,一般的视频先别急着上框架,电脑有显卡、又想要更精致的包装,再挂 Remotion。

03更多优秀案例有提示词的参考合集

说实话,我上面做的视频和网上大佬知道作品相比,差距还是有点大的,不过还好有很多人把网上的各种优质作品都整理好了,下面是一些优秀作品合集,大多数都是有提示词的,大家可以参考。

作品集短片提示词滑动查看
请制作并实际渲染一支 15 秒的原创动态设计作品集短片。把它当成一位顶尖动态设计师的展示卷:用作品本身展示节奏控制、动态图形、字体动画、形态变化、空间感和视听配合。请自主完成创意、实现、渲染与检查,不要只交付方案、代码或预览。

创意方向:
以“设计元素从秩序中爆发,再重新汇聚”为核心。开头一秒就建立鲜明的视觉钩子;中段让字体、几何图形、线条和空间结构相互转化,每次变化都有清楚的运动原因;结尾形成一个有记忆点的完整画面,并留出短暂的视觉停顿。画面要有统一的美术语言、清晰的信息层级和丰富的节奏变化。避免套用现成模板、无意义的粒子堆砌、随机闪切和虚构的客户品牌。文字保持简短,由你创作。

音乐与同步:
自行用代码合成原创立体声配乐,包括鼓点、低频、旋律或音色层及必要的转场音效。不得使用现成样本、外部音频文件、音效库或 VST 乐器。允许在制作过程中生成临时 PCM/WAV 文件用于混音与封装,但所有声音必须由本项目的代码产生。

采用 144 BPM、4/4 拍。15 秒共 36 拍;60 fps 下每拍正好 25 帧。建立同一条时间轴驱动画面与音乐,所有剪切点和转场起点安排在第 25 帧的整数倍位置。运动可以跨拍延续,但关键视觉动作应与鼓点、重音或音乐变化呼应。音乐要有开场、推进、高潮与收束,不能只是一段重复循环。

交付规格:
- 1920 × 1080,恒定 60 fps,时长精确为 15 秒,共 900 帧。
- 最终交付带混音的 MP4,视频使用 H.264,音频使用 AAC。
- 检查实际导出的文件:确认能播放、有画面和声音、时长与分辨率正确;抽查开头、中段、高潮和结尾的画面,并检查明显的爆音、削波、黑帧和音画错位。发现问题后修复并重新导出。
- 最终回复给我 MP4 的实际绝对路径,简述创意构思,并说明你完成了哪些实际检查。

Plain Text

卡点的3D球体下坠的动画视频:对标专业的Blender做的效果,音乐是多首经典的纯音乐,场景按音乐切换,3D球体下坠时在3D场景的物件中弹跳,按音乐的节奏点亮物件。带一些幽默的元素。
使用three.js制作,不要使用Blender制作

更多案例,因为现在不方便放链接,大家后台回复“视频”来获取这些参考案例吧~

Image
04写在最后先挑一首你喜欢的歌

Opus 5.5 已经非常强了,通过各路大神的作品,我们也见识到了这个大模型可以给到的无边的创造力。

但是它也不是万能的,远景里的人物细节是糊的,写实质感基本没有,想要一张有毛孔的脸,还是得交给视频模型。

已经有人在研究,怎么把 Opus 5.5 和 Seedance 或者 Kling 这类视频大模型结合到一起使用了,相信很快我们就能看到更多更好的作品。

当然对于现在的 Opus 5.5 大模型,已经可以把我们日常的很多工作都接手过去了,比如口播视频的粗剪,甚至是各种 b-roll 的增加都是能完成的,感觉以后剪辑师这碗饭不太好端了。

无论如何,先挑一首你喜欢的歌。

把开场那段话复制过去,出第一版再说。


以上就是今天的分享,觉得有帮助,帮请帮一键三连:点赞、转发,再看和留言,你的反馈对我很重要!


【声明】内容源于网络
0
0
萝卜AI笔记
做有温度的AI人
内容 197
粉丝 1
萝卜AI笔记 做有温度的AI人
总阅读13.4k
粉丝1
内容197