7 月 31 日,MiniMax H3 与字节跳动 Seedance 2.5 同日发布。随后,H3 于 3 天后开源,Seedance 2.5 于 8 月 7 日开放 API。
H3 主打开源与高性价比,支持最长 15 秒、2K 视频生成,API 定价为每秒 0.8 元;Seedance 2.5 则将单次生成时长延伸至 30 秒,支持一次性输入 30 张图片、10 段视频及 10 段音频(共 50 份多模态素材),并强化了时间戳控制、定向编辑和白模参考能力。
模型性能日益精进,但产品能否有效驾驭?
某种程度上,这两款模型的发布反向印证了一个观点:视频模型越强,产品层创造价值的空间反而越大。
我们将通过「AI 产品市集」、内容报道、社群分发等方式,助力团队触达早期用户、获取真实反馈并建立关键连接。
如果您正在从事 AI 相关领域,欢迎与我们交流。
01
模型变强了,
产品层要做的事反而更多了
MiniMax 近期在 Reddit 社区举办 AMA,分享了关于 H3 模型的诸多信息。团队指出一个训练现象:随着模型泛化能力增强,仅训练过“根据首帧和文字描述预测末帧”任务的模型,在未接受专项图像编辑训练的情况下,也能在多项图像编辑测试中表现优异。
换言之,模型在训练单一任务时,自发掌握了其他相关任务的能力。
这意味着,过去需依赖专项模型或复杂工作流才能实现的功能,正逐渐被通用模型吸收。单纯依靠接入多个模型来构建产品差异化的策略,随着模型泛化能力的提升,已难以为继。
抢先接入新模型以赚取时间差的优势,如今也已不复存在。
H3 开源后,主流模型托管平台、开源工具及多家芯片厂商在数日内即可完成适配。而作为业界瞩目的旗舰视频模型,Seedance 2.5 的同步接入已成为各类视频 Agent 产品的标配。
LibTV 同步上线了 H3 和 Seedance 2.5
据 LibTV 反馈,H3 上线后,部分原本调用 Seedance 2.0 的电商和影视任务开始尝试 H3,主要考量在于成本与特定任务的表现。创作者会根据生成结果、价格及生产效率,在不同模型间灵活切换。
部分用户已摸索出一套跨模型工作流:先利用 H3 生成草稿,确认构图与节奏后,再切换至 Seedance 2.5 输出终稿。虽然画面本身未必能直接迁移,但这种在草稿阶段确定提示词、素材组合及节奏的做法,能有效降低试错成本。
显然,模型选择本身正成为一项需要产品层承接的核心能力。
何种任务需调用高价模型,何种场景仅需低成本模型,均需精准判断。产品还需考量现有项目的迁移成本:更换底层模型后,原有的角色、场景及历史素材能否复用,直接影响决策。目前,这些判断多由创作者手动完成。长远来看,模型选择不应是创作者的负担,而应由产品及模型编排层解决。
除模型选择外,随着模型能力提升,创作者还需管理更多变量。
首先是素材管理。一支广告、短剧或 MV 可能涉及不同角色的正侧面参考,以及服装、场景、道具等大量元素。Seedance 2.5 单次可接收 50 份素材。用户需先筛选正确版本,再将其精准嵌入剧本与提示词。输入上限的提升,使素材管理成为新的瓶颈。
一个测试视频的素材管理,复杂任务所需素材更多
其次是任务返工。视频时长从 15 秒延长至 30 秒,修复局部错误的代价随之增加。若重新生成整条视频,不仅消耗 Token,原本正确的部分也可能发生变动。
单条视频越长,一次返工浪费的时间与费用越高。能否仅修改出错片段,或在正式生成前以低成本验证方向,直接影响项目成本。Seedance 2.5 虽已支持按时间戳定向编辑并尽量保持连续性,但模型仅提供能力,产品需将其转化为顺畅的修改流程。
生成长视频还面临另一重复杂度。H3 社区有开发者分享经验:先生成一段视频,再将上一段尾部作为下一轮参考,持续提供同一张主体图片以维持角色一致性,最终拼接出约 60 秒的连续视频。
MiniMax 技术团队回应称,这种续写能力确实存在。但模型尚未原生训练过多段续写的长视频,真正的连续长视频生成仍未实现。
这意味着,现阶段使用 H3 或 Seedance 2.5 生成长视频,仍需应用层拆分片段、管理前后衔接,并维持角色与场景的一致性。模型提供续写能力,应用负责将片段组织为完整项目。
模型扩大了生成空间,而由此带来的工程复杂度,本应由视频 Agent 和产品层解决。
02
比起更快接入模型,
更好驾驭模型才是壁垒
当前的视频 Agent 已在尝试解决这些实际生产问题。
LibTV 上的 AI 短剧《被裁掉的女孩》上线不足 30 天,第一季累计播放量破亿。前 6 集主要由 3 人完成,每集平均耗时 2 至 3 天。技术门槛虽已降低,但生产环节出现了新瓶颈。
导演菲菲飞表示,最耗时的环节往往是场景、服装、妆造及视觉基调的建立。团队需逐一确认光比、色彩搭配、场景元素和人物服饰,反复测试直至画面符合预期。为确保同一批角色连续出演十余集,电脑桌面常堆积数千张图片、数百条视频,仅查找某套服装或场景便需耗费大量精力。
一旦项目进入连续生产阶段,核心瓶颈便从“能否更快生成”转向“能否更好管理”。
SD2.5 和 H3 发布后,LibTV 的核心产品动作也围绕这些生产痛点展开。
首先是生成前的素材组织。“逐帧拉片(Shot Breakdown)”功能可分析参考视频的画面风格、关键帧、运镜、叙事节奏及背景音乐,整理成可复用的参考素材组,且该过程不扣除视频生成积分。
AutoLink 功能会读取剧本和画布素材,自动将角色、场景和道具对应的参考填入提示词。用户仍可检查替换,但无需从数十份素材中逐个查找手动引用。其核心价值在于替用户准备好输入,再交付给模型。
第二个环节是生成后的局部修改。Seedance 2.5 提供按时间段定向编辑的接口,LibTV 将此能力封装为时间轴上的选区、修改和回填流程。用户选中需调整区间,重新描述人物、动作或画面要求,即可将新片段回填至完整视频。
若 30 秒视频中仅 2 秒出错,只需重做这 2 秒,无需整条重跑。单条视频越长,局部修改能力的价值越显著,能大幅降低重复生成成本。
第三个环节是将多个片段组织成完整作品。Seedance 2.5 单次生成上限为 30 秒,官方支持多轮延长。LibTV 则支持将长任务拆分为多个片段,保留中间节点和生成关系。用户可展开、修改任一镜头并同步回最终作品,最终可生成长达 5 分钟的视频。
用户可以展开查看、单独修改任一镜头,再同步更新最终视频
Seedance 2.5 API 上线当天,LibTV 即交付了上述功能。之所以能同步上线,是因为其画布、节点关系、资产库和时间线等底层架构早已就绪,新模型只需接入既有结构。
反之,若产品仅有一个对话框和模型下拉列表,那么无论新模型多强,最终呈现的变化仅仅是选项列表中多了一项而已。
模型之上的竞争,关键不在于谁先接入新模型,而在于谁能在新模型发布时,已备好配套的生产系统,让模型能力快速转化为用户所需的结果。
03
视频 Agent 之间的竞争,
开始走向模型层之上
面对如此快速的模型迭代,行业难免担忧:Agent 应用是否会沦为模型的二道贩子?现有能力是否会被模型逐步吸收?
H3 和 Seedance 2.5 从不同维度拓展了模型能力空间:更强的任务泛化、更长的视频时长、更多的参考输入、更细的编辑控制。这些能力既增强了单个镜头的生成效果,也增加了完整项目管理的复杂度。从这个角度看,视频 Agent 的竞争优势与壁垒也在随之演变。
新模型上线后,平台需迅速判断其适用任务、流量迁移策略及旧模型保留场景。H3 上线后的任务迁移考验的正是这层响应速度。快很重要,但快是可以被追赶的。
模型真正投入生产后,许多摩擦才会暴露。Seedance 2.5 支持更多参考,产品就需解决素材组织与匹配问题;视频时长增加,产品就要降低局部错误带来的返工成本;生成素材增多,产品还得承接混剪与交付。
第三层涉及项目资产与团队流程的持续积累。项目结束后,会沉淀下角色、场景、道具及历史镜头。团队还会形成审核与修改习惯,积累不同模型在具体任务上的效果数据。这些信息有助于加速下一个作品的完成,且难以被复制。
视频 Agent 的素材管理在模态和复杂度上均高于代码 Agent。代码有 Git,项目可随时克隆迁移,而视频生产至今缺乏通用的状态格式。主角面部参考、不同情绪的表情设定,以及十几集积累的服装场景资产,往往与具体工具绑定。单个功能或许随时被模型厂商吸收,但这套持续积累的生产状态很难在一夜之间被取代。
过去的视频编排多在图像、视频、配音之间传递结果。随着 H3、Seedance 2.5 等模型的出现,编排内容得以扩展。Agent 还需处理剧本拆解、模型选择、素材继承、镜头状态、局部返工,以及决定人工介入的时机。
未来模型定会吸收部分产品功能,单纯依靠接入模型形成的差异也将继续缩小。但创作者最终交付的内容不变,他们面临的难题——素材组织、成本控制、局部修改和项目管理,也不会随模型升级而自动消失。
模型在变强,但模型编排并未消失,只是编排对象从模型转向了作品。
今天视频 Agent 之间的竞争,已真正进入模型层之上。好的模型决定了第一条片子有多惊艳,而一款优秀的 Agent 产品,最终决定了作品能否准时、高质量地交付。

和四位一线创业者聊聊:ToC Agent 那么卷,ToB 的机会在哪、落地卡点在哪?
对话刘靖康:镜头之外的「智能」和「审美」,才是 Camera Agent 的主战场
对话景鲲:AI 产品的 All in One,是上下文的 All in One

