你好,我是郭震。
许多人渴望尝试视频自媒体,却因露脸压力、脚本撰写、素材搜集及后期渲染耗时等门槛而迟迟未动。为此,我探索了一套低成本、易上手的解决方案:利用豆包工作 Agent 的云电脑环境,通过三个自动化工作流,仅输入一个主题即可生成一条完整的不露脸视频。整个过程将耗时的素材生成与渲染移至云端,无需占用本地算力。
1 旁白稿生成工作流
视频制作始于内容规划。旁白决定叙事核心,分镜则定义视觉呈现。本次测试主题为:“只给 AI Agent 一个主题,它能否自动做出一条不露脸视频?”
在豆包工作 Agent 云电脑中,我输入了以下指令,要求输出核心观点、口语化旁白(220-260 字)、前 3 秒钩子、8-10 个镜头的分镜表及素材清单:
我要制作一条 60 秒左右、不露脸的竖屏知识视频。视频主题是:只给 AI Agent 一个主题,它能不能自动做出一条不露脸视频?目标受众是关注 AI 工具、自媒体创作和效率提升的普通用户。请完成以下任务:1. 提炼一个明确的核心观点;2. 写一份 220 至 260 字的口语化旁白稿;3. 前 3 秒设置钩子,快速告诉观众这条视频能解决什么问题;4. 根据旁白拆分成 8 至 10 个镜头;5. 使用表格整理镜头编号、时长、旁白、字幕、画面内容和素材形式;6. 素材形式从真实截图、录屏、Seedream 图片、Seedance 视频、HTML 动画中选择;7. 单独整理一份素材清单,标明每项素材需要生成图片、视频还是动画;8. 检查旁白与镜头时长,将成片控制在 60 秒左右。本次只生成旁白稿、分镜表和素材清单,暂时不要生成图片或视频。
Agent 并未直接生成视频,而是先交付了三份关键文档:旁白稿、逐镜头分镜表及素材清单。同时,它还生成了一份可视化的"60 秒分镜时间轴”,清晰展示了每个镜头的时长分布、素材类型、语速节奏及平均线,帮助创作者直观判断节奏快慢。
分镜表将旁白逐段拆解,并明确指定每句话对应的视觉形式(如产品截图、AI 绘图、动态视频或 HTML 动画)。这种结构化输出避免了边剪边想的低效模式,也防止了无效素材的过量生成。

该流程可保存为名为"Doubao Faceless Video Plan"的 Skill。后续只需更换主题、时长或受众,即可一键复用此方案生成全新的视频策划案。
2 素材生成工作流
传统手工制作需频繁切换工具进行找图、录屏及 AI 生成,流程零散。本环节继续由豆包工作 Agent 接管,依据前述分镜表,自动调用 Seedream(生图)和 Seedance(生视频)准备素材。
执行指令如下:
请读取前面生成的 60 秒视频分镜表和素材清单,为这条不露脸知识讲解视频准备画面素材。执行要求:1. 将素材分为真实截图或录屏、Seedream 图片、Seedance 视频、HyperFrames 动画。2. 不使用数字人、人物主播、麦克风和虚拟演播厅。3. 主要使用动态文字、流程图、信息卡片、节点连线和抽象图形讲解内容。4. 静态背景和关键帧使用 Seedream 生成。5. 需要明显动作或镜头变化的部分,先生成关键帧,再用 Seedance 制作 3 至 5 秒视频。6. 适合文字、流程和数据展示的镜头标记为 HyperFrames 动画,不要生成图片。7. 所有素材统一为 16:9 横屏,保持画风、配色和光线一致。8. 画面中不要出现文字、字幕、Logo 和水印,并为后续字幕预留空间。9. 成品播放画面暂时留空,后续使用 HyperFrames 真实渲染结果。10. 文件按照镜头编号命名,例如 shot-01.png、shot-02.mp4。11. 更新素材清单,记录镜头编号、素材类型、文件名和保存路径。本次只准备素材,暂时不要合成视频。
Agent 在一个任务内连续执行:先调用 Seedream 生成静态图与关键帧,再将动态需求交由 Seedance 处理。全程自动保留上下文,无需人工干预文件传输。此外,系统具备自检能力,若发现生成物包含水印等不符项,会自动修复。
示例中,Agent 首先生成了神经网络关键帧静态图,随即调用 Seedance 将其转化为 5 秒动态视频。
对于涉及动态文字、流程图及数据展示的镜头,则预留由 HyperFrames 在合成阶段统一制作,确保风格一致性。
3 合成视频工作流
最后一步是利用 HyperFrames(第三方 Skill)在云电脑环境中完成视频合成与渲染。该 Skill 负责读取脚本与素材,执行faceless-explainer工作流。
具体指令如下:
请读取前面生成的旁白稿和分镜表,并使用我提供的一张神经网络图片和 shot-06.mp4,制作一条 60 秒的不露脸知识讲解视频。制作要求:1. 使用 HyperFrames 的 faceless-explainer 工作流。2. 视频采用 16:9 横屏、1920×1080、30fps。3. 不使用数字人、人物主播和虚拟演播厅,也不要继续生成新的图片或视频素材。4. shot-06.mp4 用于展示"Agent 处理信息”的动态过程。5. 神经网络图片作为关键视觉、局部卡片或转场素材,避免与视频画面重复。6. 其余镜头使用动态文字、流程图、信息卡片、节点连线、时间轴和数据图表完成。7. 按照旁白稿安排镜头节奏和字幕,不要做成简单的图片轮播。8. 使用统一的字体、配色、字幕和转场风格。9. 完成后执行 lint 和渲染检查,确认没有黑帧、遮挡、文字截断和音画不同步。10. 最终导出 H.264 编码的 MP4,并返回文件路径、时长、分辨率、文件大小和渲染耗时。
任务启动后,Agent 自动检查云电脑环境,加载工作流并按分镜编排动画与渲染视频。由于全过程在云端运行,本地电脑可在渲染期间关闭。用户可随时通过手机查看进度、管理文件或补充修改指令。
最终生成的 60 秒不露脸知识讲解视频效果如下:
总结
实测表明,仅需向豆包工作 Agent 提供一个主题,即可完成从旁白分镜规划、素材自动化生成(Seedream/Seedance)到最终视频合成(HyperFrames)的全链路操作。
该方案的优势在于:
- 全流程一体化:所有步骤在同一任务中闭环,无需切换工具或配置 API。
- 云端算力释放:耗时的生成与渲染在后台运行,不占用本地资源,支持多端协同管理。
- 降低创作门槛:特别适合不便露脸但希望制作知识科普、AI 工具讲解类视频的创作者。
这套工作流显著提升了视频生产效率,为内容创作者提供了新的可能性。

