剪辑对很多人来说,是件很专业的事。即便会剪,我也常常觉得麻烦。
出去旅游,相机、无人机、运动相机录了一堆,回来看到这些素材,懒癌立马就犯了。
一拖再拖,几个月过去,片子还没动。
都到 AI 年代了,难道不能让 AI 帮忙剪视频吗?
现在还真能了。这次我用Codex Astra + 达芬奇 MCP,剪了一条新疆旅行短片和一条口播。
看着它自动选素材、排时间线,效率快得让我一度觉得,自己这双剪片子的手快用不上了。
目前用 AI 操作达芬奇,有两种方式:Computer Use 直接操控界面,或者通过达芬奇官方提供的 MCP。
后者做批量操作更快,本文就以它为主。
下面按剪辑顺序,以口播串起流程,穿插旅行案例,提示词可以直接复制。
这套 MCP 功能需要先把达芬奇升级到21.1。我用的是 Mac 和 DaVinci Resolve Studio 21.1。
MCP 是让 AI 调用外部软件功能的接口协议,有了它,Codex、Claude 等就能向达芬奇发出操作指令。
在达芬奇里打开File → Setup AI Assistant,按提示安装配置,完成后重启对应客户端,在 Codex 中选择 Astra。

▲ 图:配置成功,列表里出现 Codex in ChatGPT
还不会用 Astra 的,可以先看我之前的新手教程(文末有链接)。配置好后,发一句确认连上了正确项目:
通过 Resolve MCP,读取当前项目名称、素材数量和时间线,确认连接正常。只检查,不修改。
我第一次调用 MCP 时,弹出了下面这个工具执行确认。核对它要做的操作,再选择允许,才会继续读取项目。

▲ 图:本次首次调用 MCP 时的执行确认
为了避免 Astra 改用 Computer Use 点界面,我在操作达芬奇的提示词前都加上了“通过 Resolve MCP”。后面默认保留已确认内容,做不了的地方直接说明。
选素材就是剪辑的第一个头疼事,口播也不例外。
我经常 NG 好多次,录完却记不清哪一版最好,有时还得从几个版本里各取一段,费时又费力。
这次我把多条口播交给 AI 比较,让它自己挑,最后它分析完挑了一个,再加入时间线。
通过 Resolve MCP,分析这几条口播的实际画面和音频,挑出表达完整、流畅的录制,说明建议保留哪条或哪几段。先不剪。
跨好几天的旅行 Vlog 更麻烦。
我这次新疆游以拍照为主,视频也拍了235 条,约 3 小时 22 分钟,行车、航拍、湖泊、夜市什么都有。回来快两个月了,一直没心情剪。
这么长的素材,即使 2 倍速连续看,也要约1 小时 41 分钟,还没算暂停、比较和做标记。
光是想到要从头翻一遍,就已经不想动了。
通过 Resolve MCP,查看旅行素材的画面,选出适合短片的片段并说明理由。避免重复风景,不虚构路线;无法查看的素材请列出。

▲ 图:AI 整理出的新疆候选画面
它没有只挑漂亮风景,还选了孩子做表情、同行人拿着食物互动、花田里走动等片段。地面的人物和航拍的环境放在一起,更像“我们出去玩了一趟”。
我特别喜欢它给的选片清单:选了哪些镜头,为什么选,都写出来了。我可以沿着理由判断,而不是对着一堆文件名猜。

▲ 图:Codex 给出的旅行选片清单,包含代表素材和选择理由
这次主要通过抽帧初筛,再细看候选区间,并没有完整看完三个多小时。选出来之后,我再检查一遍,比自己从头翻起轻松。
说实话这个过程真的爽到炸裂,太适合我这种懒人了,而且它选的片我真的觉得非常不错!
选好素材,就让它建时间线。旅行片先做一版,看看整体感觉:
通过 Resolve MCP,用选出的片段新建时间线,剪成约 3 分钟的横屏旅行短片。避免重复风景,保留有意思的现场声,先不加配乐和特效。

▲ 图:旅行初剪调整版:改为公路开头,增加游玩与人文镜头
即便是 AI 选片也不可能一步到位,检查完之后我们可以让它进行调整。比如我后来又让它改成高速行驶开头,多放游玩和人文镜头,把湖边的片段归到一起。
这些修改直接说出来就行。
口播的重点则是删掉重复录制、口误和无意义停顿,同时保留自然换气:
通过 Resolve MCP,新建“口播初剪”时间线,以选好的 C0708 为主,删掉重复、口误重说和无意义长停顿,保留完整表达与自然换气。别切掉字头字尾,标记明显跳切,先不加字幕、配乐和特效。

▲ 图:片段批量进入时间线,原速节选(视频预览)
▲ 视频:播放高清视频:片段批量进入时间线,原速节选

▲ 图:口播初剪后的时间线与剪口标记
最后留下约4 分 38 秒、33 个片段。这一步我挺满意,基本把不需要的内容剪掉了,还留下了待处理的剪口。
这里特别值得一提的是,这种方式剪出来的片子,居然比剪映里的一键剪口播还要好。因为剪映这个功能虽然很快,但它会把所有气口全剪掉,所以最终看起来很不自然。
标记也不是只写“这里有问题”。它会记下源素材位置、需要复听什么,以及适合用什么画面覆盖,后面接着做就很方便。

▲ 图:剪口备注包含源素材位置、复听提示和补充画面建议
看到时间线自动排出来,真的很爽。
素材和选段确认后,这次执行初剪、排进时间线,我感觉不到一分钟就完成了。原来最耗我时间的活,竟然就这样做完了。这个时间不包括前面的素材分析。
如果你经常做发布会、活动现场的快剪,应该会很喜欢这种批量排时间线的功能:素材和选段确认后,能更快做出一版初剪。
先把这版看顺,再往上加东西,免得后面删一句话,字幕、动画和音乐都得跟着挪。
初剪完,我通常会立刻调整一下画面衔接。单机位口播删掉中间一段话后,人物动作会突然跳一下,就可以在合适的地方切换中景、近景:
通过 Resolve MCP,根据段落和剪口标记,适量调整中景、近景,保持构图自然,不频繁推拉。适合用演示画面覆盖的位置加标记,保留原声。

▲ 图:中景切近景的衔接效果(成片节选)
旅行片还可以在地点或段落切换处加一点叠化,口播的普通剪口就保留直接切换。
通过 Resolve MCP,在地点或段落切换处适量添加简短叠化,其余保留直接切换。检查重复帧和黑帧,保留现有剪辑与音频。
手持素材则按需防抖。我通常在调色里面用稳定器来处理,但 MCP 没法操作这个功能。
后来 Astra 告诉我调用Stabilize()可以。别因为某个面板不好控制,就认定整个功能做不了。
剪辑里遇到不会处理的问题,也可以随时问 AI:这个剪口为什么不顺,有没有更合适的处理方法?先听它解释,再决定怎么改,不必一开始就会写完整指令。
通过 Resolve MCP,对 C0742 调用 Stabilize() 测试防抖,检查裁切和扭曲,保留正常运镜。先做一段,无法验证的说明。
先看一个镜头的前后效果,确认没有过度裁切或扭曲,再让它检查其余片段、按需处理。
后面的调色、声音,我也基本按这个顺序:先做一个,确认效果,再批量应用。
不能只看接口返回“成功”。
一个人一直对着镜头说话,很容易枯燥。讲解或教程里加点动画,既生动,也容易看懂。
但做动画要用专门的软件,或者达芬奇里的 Fusion,我不会,以前常常就只能干讲。
这次终于能试了。不过第一次只说“做个流程动画”,结果很丑。后来先让它出静态稿,才有了方向:
先不改时间线,为“工程系统”做两种静态效果稿。配合暗调口播,用深蓝灰背景、彩色文字和图标,突出当前环节,避免六个等大方框机械排列。
确认样子后,再让它在 Fusion 里实现:
通过 Resolve MCP,按确认的效果在 Fusion 制作流程动画,跟随讲解出现,保留原声和可编辑节点,避免字幕遮挡,不用外部视频替代。

▲ 图:口播中的流程动画,按讲解突出相应环节
以前看别人旅行 Vlog 的酷炫片头,我也想做,可惜不会,往往只能找 AE 之类的模板。
这次直接把想法交给 AI:“新疆游”三个字里面播放旅行镜头,再放大穿过文字,进入公路画面。
通过 Resolve MCP,在 Fusion 做约 6 秒“新疆游”片头。三个字内都播放动态旅行镜头,背景压暗虚化;第 1 秒开始逐渐放大,平滑加速穿过文字接公路。保留可编辑节点。

▲ 图:文字内部填充旅行镜头
▲ 视频:播放新疆片头高清版
看到效果时,我真的很震撼。剪了这么多年都没学会的东西,现在说清楚想法,它就能很快搭出来,让我做到了原来做不到的事。
当然,最早那版只有一个字明显在动,放大也太突然,后来又改过,不能说是一次完成。
配色、布局和节奏说具体一点,比“高级一点”管用。到这里,内容和主要画面的时间线基本定下来了。
做过视频的人都知道,字幕很磨人。
剪映的自动字幕帮我省过不少事,这次换到达芬奇,也想看看能不能一句话让 AI 做完:
通过 Resolve MCP,为当前口播生成中文字幕,合理断句,每屏最多两行,列出可疑识别结果。

▲ 图:整条字幕轨道生成,原速节选(视频预览)
▲ 视频:播放高清视频:整条字幕轨道生成,原速节选
没想到真能自动创建。但这次识别结果,比我平时用剪映的体验差不少:“大毛巾”“SARS”都出来了,DeepSeek 也被拆开。
逐条纠正太费时间,MCP 又没找到直接改字的接口。好在它默认生成的是SRT字幕,可以自己直接导出。于是换个办法,把整条字幕 SRT,交给 Codex 集中校对:
通过 Resolve MCP 读取字幕和时间,整理成 SRT,列出“原文 → 建议修改”,我确认后另存校对版,保留时间对应。
它把问题列出来,有些是名称、术语识别错了,有些则需要结合上下文判断。
下面从当时的两张表里各节选几条,保留原文。第二张表里的问号和回听提醒也一起留下,能看到它当时哪些地方还拿不准:

▲ 图:原始校对输出节选:当前字幕与建议修改

▲ 图:原始校对输出节选:可能想表达的内容,保留待确认提示
我确认修改后,自己把校对版导回达芬奇。这个动作手工比 Computer Use 快,也省去了在时间线上逐条找错字的麻烦。
让我意外的是,这种方式比之前在剪映里面快多了。之前剪映我都是手工去校正。。。当然,剪映也能借助导出 SRT 这样处理。
字体也没法通过 MCP 改,不过手工操作也非常快。选中任意一条字幕,在检查器的“轨道”里进行相关设置,使用轨道样式的字幕就会统一更新。

▲ 图:在轨道中统一设置字幕字体
术语和人名仍要对照原声,不能把 AI 校对当成零错误。
调色是达芬奇的强项,也是我觉得最专业、最费功夫的环节之一。
我日常很多素材用 HLG 拍摄,放进 SDR 成片前得先正确还原,之后还要一个片段一个片段地调整。
这次先拿拍摄条件一致的口播试:选一个代表画面,让脸亮一点,同时保留背景的暗调和蓝绿色灯光。
通过 Resolve MCP,保持色彩管理,在已有 Color 节点上调整一个人物镜头,让肤色自然、人物稍亮,保留背景暗调,避免白衬衣过曝。先做前后对比。

▲ 图:同一帧调色前后对比,左为修改前,右为修改后
确认后,再让它按参考效果逐镜匹配。这次用的是已有空节点做全画面校正,没有新增节点,也不是单独抠出人脸提亮。

▲ 图:调色时逐镜切换与查看,8 倍速,无声(视频预览)
▲ 视频:播放高清视频:调色时逐镜切换与查看,8 倍速,无声
新疆更复杂,相机有 HLG 素材,无人机又有 Rec.709 素材。要先核对色彩空间、完成还原,再调曝光和颜色,不能统一套 LUT。
通过 Resolve MCP,先核对各设备素材的色彩空间和现有转换,以 SDR Rec.709 为目标给出还原方案。无法确认的列出,先不改设置。
新疆这次还留下了一份逐镜校正对比清单:哪些改了、哪些保留原样,都能对照着看。
下面只取两个镜头;这份记录检查的是同一时间点的静帧,全片动态效果仍要另外检查。

▲ 图:逐镜校正对比节选:左为修改前,右为修改后
调色这块,本次通过 MCP 跑通的能力还比较有限,主要是在已有节点上做基础校正;自动添加并控制 CST 没跑通,也遇到过设置覆盖和卡住。(主要是 MCP 目前还不支持这么多功能)
批量处理能省时间,但要精细调整,我还是更愿意逐个镜头手工看。
另一种值得试的配合是:先手工调好代表片段,保存到画廊,再批量应用并微调。这里是后续思路,本次没有验证整套自动套用流程。
口播要发出去,我通常还会看看需不需要美颜、瘦脸。以前这部分我更习惯放到剪映里处理,达芬奇用起来没那么顺手。
达芬奇原来就有Face Refinement(面部修饰)等工具,现在这版还可以用AI Face Reshaper,面部重塑器来调整脸型。
不过本次 MCP 没找到直接控制它的参数和跟踪的方法,我就手工设置,再让 Codex 保留效果继续做。

▲ 图:手工加入的 Face Reshaper
几步能完成的操作,不必非让 AI 绕一圈。
看视频时,画面差一点,可能还能看下去;但如果噪音刺耳、讲话听不清,就很难有耐心继续看了。声音处理是剪辑里很重要的一步。
个人博主的收音条件往往没那么专业:房间里有杂音,口播时声音忽大忽小,加上 BGM 后,音乐又把人声盖住了。
这些问题听得出来,真要调好,却需要一些技巧。
这次口播的声音比较一致,主要平衡轻声、重音,检查剪口;旅行里的车内、集市、湖边现场声差异大,更需要分段处理。

▲ 图:旅行初剪的部分音轨,不同片段的现场声波形有明显差异
通过 Resolve MCP,分析实际音频,按需平衡各段音量、检查峰值和剪口。对白优先,保留重要现场声,不统一套相同增益、不强行降噪。导出试听。
口播实际用的是片段级对白电平器,并没有在 Fairlight 轨道上新增压缩器。本次能改片段音量和淡化,但没找到精细控制轨道压缩器、EQ 等参数的接口。
处理得是否自然,最终还是要听。

▲ 图:口播成片混音试听,原速 20 秒,包含人声与配乐(视频预览)
▲ 视频:播放高清视频:口播成片混音试听,原速 20 秒,包含人声与配乐
找配乐也是个耗时间的事。有时不知道片子该配什么音乐;就算心里有方向,翻曲库、挨个试听,也能找上很久。
这次 Codex 不仅给了配乐方向,还提供了可免费下载的链接。我下载后放进媒体池,再让它放到独立音轨。
根据这条口播的内容和节奏,推荐几首不抢人声的背景音乐,先不要加进时间线。
选好后再发:
通过 Resolve MCP,将媒体池中的 Minimal Tech 加到独立音轨,不要盖住口播。平滑处理起止和循环,检查混音峰值,保留人声处理。

▲ 图:全片配乐的循环与衔接调整,4 倍速,无声(视频预览)
▲ 视频:播放高清视频:全片配乐的循环与衔接调整,4 倍速,无声

▲ 图:全片配乐,循环处重叠淡化
我们先试听约 30 秒,确认后铺满全片。
一条片子准备交付前,通常还要做些基本包装:主标题、章节提示、片头片尾,以及适量的转场音效。这次也一起补上:
通过 Resolve MCP,根据口播补齐主标题、必要的章节标题和片尾。字稍大、稍粗,不要厚重黑底,避开人物和字幕。只在动画进入处加少量轻柔音效。
这次标题也翻车了:“01”出了画框。原来人物镜头放大了 1.2 倍,Fusion 标题也跟着被裁切。后来补偿位置和字号、去掉底板,才改成下面这样。

▲ 图:修正后的章节标题
音效只放了几处,不给每个剪口配“嗖”的一声。短音由 Codex 在本地合成后通过 MCP 导入,最终听感仍要检查。
终于走到导出这一步了。
我会先出一版预览,看看前面分开处理的画面、字幕和声音,放到一起有没有问题。
通过 Resolve MCP,导出完整时间线为 1080p H.264 MP4,帧率跟随时间线,包含全部音频和烧录字幕,保存到 outputs。检查文件、时长和可播放性,给我路径。
▲ 视频:播放口播全片预览
以前导出的时候还要研究一堆的东西,比如码率等,这回什么都不用管。
这个视频完全由 AI 选材、剪辑、调色、配乐、调音、上字幕、加标题,没有任何一个地方是我手动操作的,你觉得如何?(旅行 Vlog 剪辑得也不错,涉及家人隐私就没放出来了。)
实际上还是有一些小瑕疵,但直接发其实也没啥问题,我不得不服!
剪了这么多年视频,真的没想到,有一天能看到一直想要的 AI 自动剪辑。选素材、初剪、批量调整,连原来不会的动画,现在都能让它帮忙做。
看到这些,有人会焦虑:剪辑还值得学吗?
我至少在这次测试里,没有觉得自己的经验变得多余。恰恰是因为懂一点剪辑,才知道哪里跳得难受、哪段声音盖住了人声,也知道应该让它怎么改。
AI 的短板还不少,技术会继续进步,但我更在意的是自己还要作出的判断:这个故事怎么讲,哪个镜头最打动我,颜色往哪边调,配什么音乐才贴合这段经历。
这些选择,决定了片子最后是什么样子。
至少目前,我还不愿意把它们全交出去。
所以,懂剪辑的人有了一个能替自己干活的帮手;不懂的人,也能先做出简单的片子,再边做边学。
AI 越方便,专业知识越容易用起来。
我的办法仍然是AI 加手工(人工+智能🤣),省下重复操作的时间,多看几遍画面,多听几遍声音。
那堆拖了快两个月的新疆素材,终于剪起来了。
你也可以拿一个小项目试试,从“帮我选素材、做一版初剪”开始。
欢迎留言说说,你最希望 AI 替你省掉哪一步;也可以把这篇转给同样被剪辑拖住的朋友。
GPT-6 Astra 实测:什么软件它都会用,临界点已经到了!
GPT-6 Astra 完全新手教程,看完你也能用起来

