大数跨境

10万人收藏的Vox风格视频,我拆解出了它的六个视觉动作

10万人收藏的Vox风格视频,我拆解出了它的六个视觉动作 免费PPT模板和软件
2026-07-21
25
导读:视频模型越贵,画面越乱?实测发现真正决定成败的不是模型,而是那张静帧——六个视觉动作+三条路线成本实测,一篇讲透
TUTORIAL · AI 视频实战

2026.07

视频模型越贵,画面越好?

别管模型,先看静帧

四项检查


六个视觉动作 · 三条路线成本实测 · 静帧四项检查

ray-broll 实测

GEMINI开源

📦 3 Parts + Conclusion

👉 滑动

PART 01

视觉语法

六个动作学会

PART 02

静帧决定成败

四项检查清单

PART 03

三条路线怎么选

成本实测对比

PART ///

写在最后

别做模板垃圾

拼贴视频的灵魂不在视频模型里,而在那张完成态静帧里

最近你可能刷到过很多这种视频:一块纯色纸面上,人物、胶片、卡片和箭头一张张滑进来。没有复杂场景,也没有炫技运镜,但只用五秒钟,就把一句抽象的话讲明白了。

以前想做这种画面,通常要会抠图、排版、After Effects 和关键帧。现在最夸张的演示是:给 AI 一句口播,几分钟后就能拿到第一条拼贴片段。

经过最佳实践整理成了一个开源 Skill:ray-broll。这篇文章把最快的做法完整交给你,也会把“五分钟”这个标题里最容易误导人的部分先讲清楚。


模型会变,今天最好用的未必是下个月最好用的,但“观点—隐喻—静帧—动效—验收”这条链路才是真正值得留下来的东西。

01

PART


这波风潮为什么突然火了

WHY IT'S TRENDING

7 月中旬,狗哥 @pyang1235005 开源的 gbro-collage-broll 获得了近 10 万浏览和 792 次收藏;知识猫图解的一条四步教程,三天内获得10.4 万浏览和 1753 次收藏。同期三支英文 YouTube 教程合计超过 10 万播放。

收藏明显高于点赞。很多人看到的显然不只是一支好看的视频,还有一套准备回去复刻的方法。

ray-broll 就是基于 gbro-collage-broll 做的实测工作流:既可以把一句口播做成五秒 B-roll,也可以把一个完整选题拆成8 到 10 个段落,继续生成旁白、字幕和 45 到 60 秒的讲解片。

不过收藏之前,有件事要说清楚。

02

PART


把“五分钟”的水分先挤掉

MANAGE EXPECTATIONS

这里的五分钟,指的是:工具已经装好、账号和密钥已经配置好以后,从一句口播出发,做出第一条 5 到 8 秒的竖版拼贴片段。

它不包括第一次安装环境,不包括你来回改三轮画面,也不包括把八条片段配上旁白、字幕和音乐拼成一支完整视频。生成模型还要排队,繁忙时究竟等三分钟还是十分钟,也不是任何教程可以保证的。

所以“五分钟”不是服务承诺,更不是零基础第一次打开电脑就能稳定实现的成绩。

但我仍然保留这个标题,因为真正的变化在于:以前最容易让人放弃的那段工作——想画面、找素材、抠图、搭时间线、试动作——第一次被压成了一条可以重复运行的流程

真正变便宜的不是视频,而是把一句抽象的话变成画面的过程

03

PART


真正该复制的是一套视觉语法

SIX VISUAL MOVES

“Vox 风格”是大家最容易搜索和理解的叫法。但如果把品牌名字拿掉,这种画面其实可以拆成六个很具体的动作:

1

用一个强烈、均匀的纯色做背景

2

用黑白半调照片做主体,保留报纸印刷的网点感

3

加少量彩色卡纸、奶油白描边、纸张阴影和颗粒

4

一句话只做一个隐喻,画面里不超过四组主要物件

5

从空场开始,让纸片逐件滑入、落下或卡位

6

镜头锁死,不慢慢推近,不让所有东西一起漂浮


— 六个视觉语法动作图解

举个例子,“AI 不是替你思考,而是替你的判断找到执行路径”,可以画成一个人把印章压下去,几条原本散乱的传送带随即接通。“工具越多,工作越乱”,则可以画成一只手抱着越来越高的软件图标纸牌,脚下的流程线反而打成了结。

好隐喻不需要字幕解释。观众即使静音,也能大概看懂你在说什么。

在 ray-broll 里,这套视觉语法被统一叫作“编辑隐喻拼贴”——这样既更准确,也能避免把所有作品做成同一个模板的仿制品。

04

PART


装好 ray-broll,交给它一句口播

GET STARTED

STEP 01

安装 RaySkills

ray-broll 已经放在开源的 RaySkills 里,支持 Claude Code、Codex 等可以读取 Skill 的工具。

...bash

npx -y skills add imraywang/rayskills -g --all

STEP 02

交给它一句真实口播

PROMPT用 ray-broll 给这句话做一条 9:16 的拼贴 B-roll:“你以为自己缺的是更多工具,其实缺的是一条能跑完的工作流。”

它不会立刻花钱生成视频,而是先给你一份画面方案:这句话的核心意思是什么、应该用什么视觉隐喻、画面里有哪些物件、用什么底色,以及这些纸片按什么顺序出现。

确认隐喻后,它才生成完成态静帧;静帧再次确认以后,才进入视频生成。


— 三道确认门:隐喻确认 → 静帧确认 → 视频生成

自动化最有价值的地方,是把人的确认放在代价最低的位置

如果你只想快速体验,可以明确告诉它“直接跑完,不用每一步停下来”。但第一次使用,我建议保留前两次确认——你会很快发现,省掉一次错误的视频生成,比省掉一次点击更重要。

05

PART


真正决定成败的,是那张静帧

THE STILL FRAME

很多人会把注意力全放在 Veo、Omni、可灵或 Seedance 上,仿佛换一个更强的视频模型,画面就会自动变高级。

我的实测结论正好相反:视频模型负责的是让已经成立的关系动起来。静帧里如果物件太多、主体不清、隐喻读不懂,后面再贵的模型也只能把混乱做得更流畅

一张适合拿去做动画的静帧,至少要过四个检查:一眼能看懂这句话在比喻什么;主要物件不超过四组,彼此能分开移动;背景留白足够,主体集中在画面中间约七成区域;没有假字、Logo、水印、界面和不必要的装饰。


— 静帧四项检查清单

!踩坑提示 🕳

尤其要小心便签、书页、文件夹这类物件——图片模型很喜欢在上面生成似是而非的文字。一旦出现假字,直接回到静帧重做,不要指望视频提示词在运动中把它修好。

另一个常见错误,是把一句话拆成六七个符号:时钟、灯泡、箭头、齿轮、奖杯、硬币全部塞进去。看起来信息很多,实际没有重点,动画时还会互相穿插和漂移。

一句话只做一个关系,一张图只承担一个判断

06

PART


三条路线,分别解决速度、成本和控制力

THREE ROUTES

静帧确认以后,ray-broll 有三条主要实现路线,各自解决一种问题。

TOOL 1

Gemini 原生,最省手

默认路线。静帧、视频和旁白共用一套 Gemini 配置,适合日常单条和批量生成。默认五秒、9:16、720×1280,交付前自动去掉音轨并检查首尾帧。

有个边界要说清楚:Gemini Omni 官方目前不承诺严格的首尾帧插值,第二张图更像“请尽量到达这里”的软目标。物件被重排到破坏原意就要回头简化画面或换路线。

Google 当前公开价格估算,720p 视频约每秒 0.10 美元;我的本地实测约0.3 美元一条

TOOL 2

Google Flow,最省预算

如果你有 Google AI Pro,Flow 每月提供 1000 积分。实测用 Veo 3.1 Lite 做一条 8 秒竖版首尾帧视频,消耗 10 积分,理论上一个月可以生成约 100 次。

操作不复杂:打开 Google Flow → 新建项目 → 上传纯色空首帧和完成态静帧 → 粘贴 ray-broll 生成好的动画描述 → 选择 Veo 3.1 Lite → 确认积分生成。为什么强调 Veo?因为 Flow 当前的功能表里,Omni 的首尾帧能力仍显示“即将推出”,而 Veo 3.1 已经支持。

Flow 的缺点是半自动:上传本地图片通常还需要人手动点两下,生成也要在网页里排队。优点是同样素材的实测结果与原生路线处在同一档,订阅积分不用也是浪费。

TOOL 3

HyperFrames,最可控

如果动作只是滑入、落下、卡位和轻微回弹,其实不一定要调用视频模型。HyperFrames 会把确认静帧里的纸片分离出来,按写好的位置和时间逐帧组装,相同输入得到相同输出。

我用同一组素材实测,本地渲染约 7.5 秒,不消耗视频生成额度,可以无限修改和重跑。特别适合天平、卡片、硬币、标签这类刚体滑入的镜头。

代价也很明确:如果想要纸张迸裂、胶片穿透、物体形变或更自然的物理呼吸感,确定性动画会显得太规整,这时视频模型更合适。


— 三条路线对比

路线
自动化程度
成本
适用场景
Gemini 原生
最高
~0.3美元/条
日常单条、批量生成
Google Flow
半自动
订阅积分内
已订阅 AI Pro、预算敏感
HyperFrames
需手动搭建
本地渲染,零额外成本
刚体滑入类简单动作

07

PART


我真正建议的组合,不是三选一

MIX, DON'T PICK ONE

如果只看教程,很容易陷入“到底哪个模型最好”的争论。但真实生产里,最省钱也最稳定的办法,是按镜头分流:


日常单条 / 批量口播

优先走 Gemini 原生路线


已订阅 AI Pro、预算敏感

走 Flow + Veo Lite


滑入、卡位、落下

交给 HyperFrames


迸裂、穿透、弯折

留给视频模型

ray-broll 最新版还增加了可灵 O3 和 Seedance 2.0 的备用通道。我用同一套首尾帧与同一段描述做了第一轮对比:可灵 O3 Standard 的硬币逐枚落下很自然,五秒约0.42 美元;Seedance 2.0 结果合格,但同次测试约1.51 美元,因此暂时只留作对照。

不要把工作流绑死在一个模型上,要把模型放回它最擅长的镜头里

08

PART


从五秒片段到一分钟完整视频

GOING FULL LENGTH

跑通第一条以后,可以把同样的方法扩展到完整讲解片。ray-broll 会先把选题拆成 8 到 10 个段落。每个段落有一句口播、一个叙事任务、一个视觉隐喻和一种底色——相邻画面主动换色,开头负责提问,中段负责解释和冲突,最后负责合题或留下反问。


— 完整视频段落结构

然后每个段落分别走“隐喻—静帧—动效”三道门,再生成旁白和字幕。最终时长以旁白为准:话说完得慢,就把尾帧多停一会儿;过渡句可以稍快;真正的判断句要慢下来,留一点停顿。

我用“两种 PMF”做过一支8 段、46.8 秒的完整片:静帧 7 张一次通过,8 段视频全部一次通过。按当时的原生模型成本,整支约3.5 美元。这个结果不能保证每个选题都复现,但它证明这条链路已经不只适合做零散的五秒素材。

完整视频真正增加的工作,是让每一段承担不同的叙事任务。只把八条 B-roll 首尾相接,即使画面都很好看,观众也会在第三个相似镜头后失去注意力。

短片靠一个好隐喻,完整片靠一串有分工的隐喻

09

PART


别让自动化制造新的模板垃圾

AVOID TEMPLATE SLOP

这波拼贴视频会流行,也一定会迅速同质化。同一个 Skill、相似的提示词、同一批人物剪影和箭头,很快就会让所有视频看起来像出自同一个模板。工具门槛降低以后,能不能做已经不稀缺,你自己的判断和视觉习惯才稀缺

我建议至少保留三样东西:


建立自己的隐喻库

记录哪些抽象概念适合用天平、传送带、门、档案柜或断裂胶片表达,也记录哪些画面已经被用烂了


固定一套视觉习惯

属于自己的颜色、人物、纸张质感和构图习惯——不需要复杂,但需要稳定


保留人工验收

生成后检查它是不是真的从空场开始,有没有逐件组装,有没有假字,末帧是否还在表达原来的关系

AI 可以批量生产画面,但不能替你决定什么值得被观众记住。

///

LAST


写在最后

SUMMARY


— 核心链路与三条长期建议

我不太在意最终用的是 Gemini、Veo、可灵还是 HyperFrames——它们都会继续更新,价格和积分也会继续变化。真正值得留下来的,是“观点—隐喻—静帧—动效—验收”这条链路

它真正省下的,是每一次做视频时从零想画面、从零找素材、从零搭时间线的重复劳动。

你可以先从一句自己真的想说的话开始。不要先做一分钟,也不要先建一套宏大的内容工厂。先做出一条五秒片段,看它能不能在静音时仍然讲清楚你的观点。

如果能,剩下的就只是把这件事稳定地再做一次。

既然看到这里了,如果觉得有用,随手点个赞、在看、转发三连吧。

点赞
在看
转发

THANKS FOR READING

【声明】内容源于网络
0
0
免费PPT模板和软件
分享精美、高端、大气的PPT模板及素材; 分享常用的办公软件和小工具下载; 分享我的分享,感受你的感受。 我们一起前行,未来成长的路,我们携手共进。 我一直在路上,将持续不间断的更新你的需求。
内容 248
粉丝 0
免费PPT模板和软件 分享精美、高端、大气的PPT模板及素材; 分享常用的办公软件和小工具下载; 分享我的分享,感受你的感受。 我们一起前行,未来成长的路,我们携手共进。 我一直在路上,将持续不间断的更新你的需求。
总阅读2.1k
粉丝0
内容248