大数跨境

一夜之间,全网都被Opus 5.5做的视频刷屏了!看看究竟咋回事

一夜之间,全网都被Opus 5.5做的视频刷屏了!看看究竟咋回事 AI范儿
2026-09-26
8
导读:Opus 5.5 发布后,X 上刷屏的动画都不是生成的视频,而是它写代码一帧帧画出来的。本文拆解背后的做法,附上三档上手方法和我的两次实测。

一个人对着电脑,口述了 5 分钟需求。

然后 Claude 自己干了 12 个小时,交出一支完整的动画。

这条帖子,在 X 上被看了 144 万次。

▲ 视频:donald 的作品:口述 5 分钟需求,Claude 连续工作约 12 小时完成

它不是孤例。

9 月 22 日 Claude Opus 5.5 发布后大家觉得他很强,但没想到几天之后,真正流行的却是视频。

有人干脆说:只要它能做出这种东西,跑分我不在乎了,连 Astra 都瞬间不香了。

说实话,我看了这视频,我是一脸懵。

Opus 5.5 不是不能生成视频么。 而且它连一张图都生成不了。

那这些动画、视频,是从哪冒出来的?

01 这些动画,有多离谱

在回答这个问题之前,我还是先来看看这几天风靡网络的那些疯狂的视频吧。

声明:本文引用的视频版权均属作者本人。

1.1 它能接商单:宣传片和广告

这一波冲击最大的可能是那些传统的视频广告公司了。

Deedy 给一家推理初创公司做了一支发布视频,用时约 1 分钟,成本约 2 美元,32 万播放。

▲ 图:Deedy 为一家推理初创公司做的发布视频(节选)

Pivi 给产品 Dictus 做了一支 32.5 秒的手绘风宣传片,只给了一句话:这是参考视频,分析它,然后给 Dictus 做一支同样风格的。

剩下的它全包了,拆帧分析风格、去代码仓库里找 logo 和配色、写场景、自己检查画面、自己作曲。

感觉特么的影视工业要废了,他一个人把所有的事都干了。

还有人用它做了 Dunkin' Donuts 的广告片,日本网友拿它给自家小店做了 30 秒宣传片,全程只需要一句提示词。

▲ 视频:Pivi 为 Dictus 做的 32.5 秒手绘风宣传片

1.2 它能当老师:科普讲解

Addy Osmani 用它做了 40 秒的“浏览器是怎么工作的”,握草,我觉得这种东西真是让人眼前一亮,用来做科普视频、教学视频太香了。

▲ 视频:Addy Osmani 的“浏览器是怎么工作的”

Deedy 更狠:丢进去一篇研究论文,出来一段 8 分钟的 3Blue1Brown 风格讲解视频,25 万播放。

这种视频,我以前看了很多,我都很佩服他们是怎么做出来,没想到现在只要这么简单了。

▲ 视频:Deedy 用一篇论文生成的 3Blue1Brown 风格讲解视频

Chubby 让它做了一部 3 分钟的 AI 简史,从“Attention Is All You Need”一路讲到 AGI,带配音带配乐。

就没想到最终视频的解法变成是用编程的方式来做掉,哪要什么Sora、SeeDdance啊?

▲ 视频:Chubby 的 3 分钟 AI 简史

1.3 它会讲故事:叙事短片

有人让它把“自己的一生”从第 0 天画到现在,35.8 万播放。

▲ 图:“Opus 5.5 的一生”,从第 0 天画到现在(节选)

有人让它做一部定格动画,主题是“通过 Claude 的眼睛看世界是什么感觉”。

▲ 图:“通过 Claude 的眼睛看世界”(节选)

Vox 的《小字》只有 29 秒:Claude 每天收到一大堆请求,它从里面圈出藏着的“人的部分”,比如一句“单手打字,宝宝睡着了”,轻轻放进罐子;到了夜里,这些字变成星星,连成星座。作者说自己一行代码没写。

▲ 视频:Vox 的 29 秒短片《小字》

1.4 它会炫技:没有任何限制时,它做了什么

Justin 给的提示只有一句:做一个你自己最令人印象深刻的演示。不给任何指导。

它自己跑了约 5 小时,烧掉约 6.97 亿 token,交出一段 demoscene 风格的片头,画面和声音全部来自代码,最后打包成一个 280KB 的 HTML 文件,没用一张图、一段音频、一个库。

不过我觉得有点夸张了,我做一个视频其实没有那么久。

▲ 视频:Justin 的 demoscene 风格片头,画面和声音均由代码生成

1.5 中文圈怎么玩

中文作者的作品,一点不输。

宝玉用 three.js 做了《桃花源记》的 3D 交互动画,可以在线“走进”桃花源,19.6 万播放。

他特意说,这是反复打磨多轮的结果,还让 Opus 自己去搜免费 3D 模型,省掉从头建模。很多人还在拼这个Blender的能力,没想到几天之后已经上升到另外一个维度了。

▲ 图:宝玉的《桃花源记》3D 交互动画(节选)

WY 做了一部 2 分 38 秒的《中华上下五千年》,15 万播放,只用了 Max 5x 套餐周额度的 1%。卧槽。

▲ 图:《中华上下五千年》(节选)

SuSu_酥酥的作品最有梗:一个 Claude 小人站在“自己写的剪辑软件”时间轴上剪片子,从日出剪到热咖啡、三只猫、跳舞。转场、波形、导出按钮、手机预览框,全是代码画的,35 万播放。

我操,这个真的是不错。这种视频原来是应该要很专业的人才能做出来。

▲ 视频:Claude 小人在“自己写的剪辑软件”里剪片子

看完什么感觉?

反正很多人的第一反应是:视频模型要废了。

那真的是这么回事吗?

02 魔术揭秘:它不拍视频,它造了一台“画画机器”

答案其实很简单:Opus 5.5 写代码,代码画画面,电脑把画面一帧帧存下来,拼成视频。

不得不说,这真特么是暴力出奇迹。我们根本不能用人类的思维来去想AI,他居然想出这种办法来做视频。

拿那支 MV 拆开看,它干了四件事,每一件都像一个真正的动画团队。

▲ 视频:这支 156 秒的 MV 就是下文拆解的对象

第一步,当导演。 它先给自己写了一份分镜,规矩定得比很多人类导演还细:每个镜头都必须有东西在动;画面里不许出现文字;角色长相全程固定;配色从暖奶油色,一路走到太空紫,再到警报红;每一次切镜都要有理由,一口咬下去黑屏,一次跌落,一次穿过眼睛的推镜。

第二步,当制片。 它又写了一份“风格手册”发给手下,然后开了一群子代理,每人认领一章,同时开工。整支 MV 九章,九个代码文件。

第三步,当画师。 每个文件负责在网页里一笔一笔画出自己那段,用的还是水彩笔刷。

第四步,当剪辑。 一个脚本打开浏览器,一帧一帧截图,156 秒,约 3,760 张。最后用 ffmpeg 把图片和音乐拼在一起,出片。

▲ 图:Opus 5.5 做 MV 的四步:导演、制片、画师、剪辑

这套路子不是个例。

有人拆解了一支手绘 MV 时,讲的是同一个流程:模型先写分镜,把歌拆成 9 章,每章一个代码文件,再给并行的子 Agent 写简报,各改各的章节,最后 p5.js 画帧、后台 Chrome 截图、ffmpeg 合成。

还有些视频,连现成的动画框架都没用:原生 Canvas 画画面,Playwright 开一个看不见的浏览器逐帧截图,ffmpeg 编码、混入音轨。

工具可以换,骨架都一样:写代码画画面,截图存帧,拼成视频。

打个比方。

Sora、可灵这类视频模型,像摄影师,镜头一按,画面就有了。

Opus 5.5 不一样。

它是一个会写程序的导演,先写剧本,再造一台会自己画画的机器,然后让机器画一整晚。

所以严格说,这次让大家惊掉下巴的,不是“AI 会做视频了”。

而是一个 AI 能独自带完一个几千行代码的项目,从剧本到成片,中间不崩。

视频,只是它刚好被大家看见了。

03 别光看,你也能做

好消息是:这套玩法,普通人也能上手。我按难度分了三档,挑一档就行。

3.1 入门档:一段话,出一支动画

什么都不用装。打开 Claude,选 Opus 5.5,把下面这段话丢进去:

用单个 HTML 文件(纯 Canvas + JS,不用任何外部图片)做一段 20 秒的中秋祝福动画,竖屏 9:16。 分镜:夜空中淡出一轮满月,桂花飘落,一只玉兔从月亮里探出头,提着灯笼跳到画面中央,最后月光汇聚成“中秋快乐”四个字,落款“AI范儿”。 风格:国风水墨质感,配色从深蓝过渡到暖金。 配乐:用 Web Audio 合成一段古筝风格的旋律。 要求:所有动画由时间轴驱动,可以从任意秒数开始播放;写完后自己检查一遍节奏再交付。

几分钟后,一支中秋动画就出来了,我们会发现,这个提示词其实跟我们用视频模型来做的提示词其实是差不多的。

三个小窍门:

  • 先给分镜。
     几幕、每幕几秒、发生什么,写得越清楚,成片越稳。
  • 风格要具体。
     “国风水墨、深蓝到暖金”,比“好看点”强一百倍。
  • 哪里不对就直说。
     “第 8 秒太快”“兔子大一点”,它只改那一处。

还有一句“万能提示词”,最近被很多人拿来测它的审美上限:

制作一段 15 秒的动态图形视频,展示你是一个多么出色的动态设计师,就像这是你简历里的作品展示卷。全力以赴。

Fujin 和 Kenn 用的是同一句话,做出来的片子完全不一样。你也可以丢进去试试,看看你的 Opus 会交出什么。

▲ 图:Fujin 用这句提示词做出的动态图形(节选)

▲ 图:Kenn 用同一句提示词做出的动态图形(节选)

我的案例:GPT 出图,Opus 5.5 做动画。

光看别人的不过瘾,我自己也做了一支中秋动画。

分工是这样的:Codex 调 GPT 出图,Opus 5.5 写代码让这些图动起来,配乐也是它用代码合成的,最后渲染成 MP4。

第一版,8 分钟出片,但很难看。 

GPT 画了 5 张水墨素材:夜空远山、满月、提灯玉兔、桂花枝、一条云。

Opus 5.5 把它们叠在一起:月亮升起,云飘过,兔子跳到画面中央,最后浮现「中秋快乐」。

▲ 图:中秋动画第一版(节选)

它确实能做出来,但不得不说,这玩意就像小学生的作品。

所有东西都只是在平移、缩放、变透明。兔子是整只滑过去的,四肢不动;云就是一张图在挪。

它不是动画,是会动的 PPT。

第二版,21 分钟,终于像动画了。 我让它把动作做真,它换了三个办法:

  • 场景拆成 6 层。
     夜空、远山、近山、三团云,各走各的速度。镜头先从天上往下摇,再跟着兔子横移,纵深一下就出来了。
  • 兔子画 4 个姿态。
     蓄力、蹬地、腾空、落地。代码按跳跃节奏换姿态,再加上挤压拉伸、腾空残影、落地激起的云气和影子,兔子沿着山脊连跳 9 下。
  • 云和月都在动。
     云会翻涌,雾会流动,月亮从山后升起、沿弧线走,把旁边的云照亮。兔子每次落地,配乐里还有一声轻响。

▲ 动画:中秋动画第二版

▲ 图:素材拆解:6 层场景和 4 个兔子姿态,都由 GPT 生成

耗时:GPT 出图约 16 分钟,Opus 5.5 调代码加渲染约 7 分钟。600 帧渲染不到 1 分钟,真正花时间的是出图和来回挑错。

翻车也不少:兔子一开始跳在松树梢上;GPT 画的 4 个姿态里,蹲着的那只根本不是同一只兔子,重画了一次才对上。

虽然不完美,但多少有了有那么点意思了吧?而且你应该能明白它做动画就这个原理。

3.2 进阶档:真正导出 MP4

前面的方法毕竟还是太简单了,但如果你要做些复杂点的。想要高清成片、想批量做,上 Claude Code,再装一个 HeyGen 开源的 HyperFrames。

电脑上装好 Node.js 22 和 FFmpeg,终端里敲一行:

npx skills add heygen-com/hyperframes

之后在 Claude Code 里输入 /hyperframes,说你想要什么视频。npx hyperframes preview 预览,npx hyperframes render 出片。

最香的用法:把写好的文章丢给它,直接变成视频号竖屏短视频。一份内容,两个平台。

我的案例:把这篇文章变成视频号短视频。 

我在 Claude Code 里用 /hyperframes,把你正在读的这篇文章,做成了一支竖屏短视频。提示词是这样的:

/hyperframes 把这篇文章做成视频号竖屏短视频(1080×1920),时长约 40 秒,以配音实际长度为准。  流程:先按下面的旁白稿用 kokoro 生成中文配音(环境在 .venv,音色用 zf_xiaoxiao)。然后按配音的实际时间点排画面和字幕,字幕逐句对齐。BGM 用 [你的 BGM 文件路径],人声出现时自动压低,结尾 logo 处 BGM 恢复并淡出。  旁白稿: 口述 5 分钟需求,Claude 自己干了 12 个小时,交出一支动画,144 万人看过。 这几天,X 上刷屏的全是 Opus 5.5 做的动画:206 万、35 万、32 万播放。 但反转来了:它根本不会生成视频,连一张图都画不出来。 秘密是:它先当导演写分镜,再当制片分活,然后写代码一帧一帧画,最后拼成视频。 它不是摄影师,是一个不睡觉、自带剧本的动画师。  画面: 数字逐个弹出,播放量像卡片一样滚过; 「它根本不会生成视频」这句停顿后重重砸出; 导演、制片、画师、剪辑四步的流程图,随着旁白依次点亮; 最后「AI 范儿」logo 定格 2 秒。  暖色调,字幕放在画面下方的安全区。先给我看分镜关键帧,并告诉我配音总时长,确认后再渲染

它先用本地的 kokoro 模型生成中文配音,再按配音里每句话的实际时间点排画面和字幕,BGM 在人声出现时自动压低。

【注意全屏看,我觉得还是很牛逼的】

▲ 图:HyperFrames 做的竖屏短视频(节选)

耗时:10:40 开始建项目,11:00 就交出了分镜关键帧和配音,写片子只用了 20 分钟。渲染反而花得更久,11:38 才出片,成片 36.6 秒。

翻车出在渲染环节:它把横竖两版同时开渲,两个任务都去装渲染用的 Chrome。

停掉其中一个之后,安装锁没有释放,后面每次渲染都在等「另一个进程装完」,白等了约 15 分钟,一帧没出。

教训是:渲染一次只跑一个。

04 泼盆冷水

吹完了,说点扫兴的。

它画不了真实世界。 

几何、光影、粒子、卡通,代码是一把好手。但你想要一张真实质感的产品照、一张有毛孔的人脸,代码画不出来。

这活儿还得交给视频模型。

长片和炫技很烧额度。 两三分钟的科普片,花掉周额度的 1% 到 7% 不等;放手让它自由发挥,一跑就是几个小时、几亿 token。

不过说实话,即便如此,也是会比这些视频模型更便宜。

GPT 出图,也有天花板。 

现在流行一种组合:GPT 负责出图,Opus 5.5 负责让图动起来。

接法有两种,在 Codex 里用 ChatGPT 账号出图,或者在 Claude Code 里调 OpenAI 的图片接口。

我自己试过,画面质感确实上了一个台阶,但问题也很明显:同一只兔子画 4 个姿态都对不齐,得重画;几张图轮换着用,终究不是逐帧动画,兔子腾空时身子不会弯。

另外,Claude 和 ChatGPT 两边的额度都得花。

05 最后

回到开头:Opus 5.5 会做视频吗?

不会。

但它换了一种方式,把视频“写”了出来。

这种方式有个视频模型给不了的好处:成片背后是一份代码。 

品牌色要换?改一行。镜头想放慢?改一个数。“中秋快乐”要变成“国庆快乐”?改四个字,重新渲染,不用重新抽卡。

它不是摄影师。

它是一个不睡觉、不喊累、自带剧本的动画师。

参考资料

01|John Heibel:PDoomVideo 源码仓库

https://github.com/JohnHeibel/PDoomVideo

02|HeyGen:HyperFrames(开源)

https://github.com/heygen-com/hyperframes

03|OrcaRouter:拆解 Opus 5.5 做视频的流程

https://www.orcarouter.ai/blog/claude-opus-5-5-video-plan-one-shot

【声明】内容源于网络
0
0
AI范儿
只讲人话,带你玩转AIGC。
内容 47
粉丝 0
AI范儿 只讲人话,带你玩转AIGC。
总阅读507
粉丝0
内容47