作者丨Rhea
编辑丨马晓宁 李娜
7 月 18 日,在 2026 世界人工智能大会(WAIC)现场,智象未来正式发布全球首个无限时长内容创作多模态智能体 vivago R1。同期,智象未来宣布完成 C 轮融资,近三个月累计融资超 20 亿元人民币。
01 编排即护城河:AI 视频的新共识
伯克利哈斯商学院近期专栏文章指出,随着模型和编排框架的商品化,纯软件 Agent 的护城河日益薄弱,竞争焦点正从“大脑”(模型)向“物理体验”迁移。
- 模型与编排框架趋于商品化;
- 纯软件 Agent 易被克隆,护城河脆弱;
- 核心竞争力转向 Physical Experience(物理体验)。
资本市场上,Cursor、Manus 等项目的巨额并购印证了编排层的价值。Manus 证明了聚合仅是手段,编排出的体验才是产品核心。面对开源模型的普及,平台型 AI 产品的关键在于:在人人皆可聚合的前提下,其 Agent 编排层是否构建了难以复制的验证壁垒。
vivago R1 作为全球首个具备无限时长视频生成与编辑能力的多模态创作智能体,其核心卖点“长、长、稳”(无限时长、长任务思考、高稳定生成)正是对这一行业命题的回答。
02 vivago R1 是谁?从 Video Agent 到无限时长
vivago 母公司智象未来(HiDream.ai)由前微软亚洲研究院高级研究员、京东前高级副总裁梅涛创立。智象定位为“全球唯一同时支持文本、图像、视频、3D 四模态的基础模型厂商”,vivago 则是其面向专业创作者的智能体平台。
两个月前,智象推出的 Vivago Video Agent 曾登顶 Product Hunt 榜首,但受限于单条视频 3 分钟的时长上限。vivago R1 的发布标志着技术范式的转移:从辅助生成单点素材,进化为能自主规划、调度并完成长链路创作任务的“智能搭子”。
vivago R1 三大核心特质:
无限时长,全场景适配
打破行业 15-30 秒短镜头限制,支持长视频连续连贯生成,覆盖短剧、专题片、品牌宣传片等长周期创作场景。
▎长任务思考,保障逻辑连贯
具备长程推理能力,自主完成精细化逻辑构思、镜头排布与风格校准,解决画面跳变、人设崩塌、叙事断层等痛点。
▎高稳定生成,赋能商业交付
依托 AgentOS 全流程调度,内容有效可用成功率提升至 85% 左右,大幅降低调试成本,满足商业化交付标准。
03 方向对了:长视频编排为何是正道?
▎编排是主流解法,而非偷懒
受物理限制,单个视频模型一次稳定生成长度有限(约 8-12 秒)。当前长片生成的主流学术与工程路径均为“编排现有 SOTA 模型 + 跨镜头缝合”,而非训练巨型单体模型。
▎填补长片生成市场空白
主流 AI 视频产品多卡在秒级至两分钟区间。若 vivago R1 能稳定产出五分钟以上且连贯的成片,将精准击中真实市场需求。
▎解决叙事统一性难题
长视频并非短视频的简单拼接,其难点在于人物、风格与叙事的统一。vivago R1 的产品决策旨在解决这一核心痛点,方向明确且经过深思熟虑。
04 自研还是聚合?拆解 R1 的技术底牌
vivago R1 并非单纯的“自研”或“套壳”,而是“自研模型 + 聚合第三方模型 + 上层 Agent 编排”的混合体。
- 聚合侧:平台集成 Sora 2、可灵、Veo 等顶尖模型,自称多模型平台。
- 自研侧:拥有 HiDream-O1-image 系列及 Vivago 2.0/2.1 等自研多模态底座。
逆向分析显示,vivago R1 采用技能驱动的编排架构:
- 服务端路由:模型调用全在服务端完成,前端仅与网关交互,用户感知不到底层模型切换。
- 技能抽象:提供 17 个功能技能(如 cinematic-story-director),用户选择的是“能力”而非“模型”。
- 分段生成:单段生成时长细化为 4-15 秒,长视频通过多段拼接实现,默认配置音频。
这种架构让用户无需纠结模型供应商,专注于创作需求本身,由平台路由最优资源。
05 无限时长实测:一场土耳其山寨星战
为验证“无限时长”与“一致性”,测试设计了一部“叶什尔查姆风格的荒诞科幻烂片”。该测试要求维持廉价美学、多镜头切换及跨场景长叙事,极具挑战性。
实测结论:成片惊艳,完成度高达 95 分。
一分十一秒的成片中,叙事流畅,人物(阿里队长)、道具(纸板怪兽)从头到尾形象统一,成功守住了“廉价美学”未发生风格漂移。仅在个别片段出现轻微画质波动,整体表现优异。
技术揭秘:工程编排造就一致性
日志显示,R1 运行了cinematic-story-director技能,执行了从任务理解、剧本创作、场景拆分到参考图锁定的完整流水线(Node0→Node9)。
- 锁定参考图机制:在生成视频前,先单独生成角色、场景、道具的“定妆照”(Node5),后续每个镜头均基于此参考图生成(Node8),从而确保全片一致性。
- 长任务规划:非模板填空,而是真正的结构化规划,将长视频拆分为多个场景独立生成后无缝拼接。
所谓“无限时长”,实则是通过将形象、道具固化为可复用资产,实现故事的持续延展。实测续集生成中,人物与场景保持高度统一,验证了这一逻辑。
06 更多实测:形象、理解力与批量生产
除长片一致性外,进一步测试了形象可控性、复杂理解力及批量生产能力。
▎案例二:《狗狗特工队》
验证复杂动作下的生物形象一致性。结果显示狗狗肢体无漂移,虽个别段落风格略有波动,但总体严格遵循提示词,质量上乘。
▎案例三:不存在的产品宣传片
测试对虚构硬件的理解与演示能力。虽在空间逻辑上偶有瑕疵(受限于世界模型认知),但整体完成了从无到有的产品演示,完成度较高。
▎案例四:十二星座与魔法果实
验证批量串联场景能力。R1 自动规划并生成了全部十二星座场景(甚至包含隐藏彩蛋),无需人工拼接,极大提升了系列视频的生产效率。
07 一个创作 Agent 到底卖的是什么?
视频生成模型正逐渐成为像水电一样的基础设施。当 Sora、可灵、Veo 等头部模型能力趋同且开放 API 时,稀缺性已从“模型本身”转移至“谁能将模型编排成可交付的系统”。
vivago R1 的价值不在于底层模型的独家性,而在于它打通了从“想法”到“成片”的最脏、最累的环节。如同超市不仅售卖商品,更提供选品、动线与服务体验,聚合是手段,编排才是产品,最终的用户体验才是护城河。
实测表明,vivago R1 在长视频编排、一致性控制及自动化工作流上已建立起显著优势,为 AI 视频创作提供了新的范式。
WAIC 深度观察:具身数据,进入「开箱即用」时代
走访 100+ 机器人展台:拐点已至,具身智能进入千行百业|WAIC 2026
未经「AI 科技评论」授权,严禁以任何方式在网页、论坛、社区进行转载!
公众号转载请先在「AI 科技评论」后台留言取得授权,转载时需标注来源并插入本公众号名片。

