大数跨境

AI短剧的导演部倒闭了,新offer在哪里?

AI短剧的导演部倒闭了,新offer在哪里? 亿欧网
2026-09-20
5
导读:智象未来HiDream、生数科技Motus2、爱诗科技PixVerse,同时亮牌!

智象未来 HiDream、生数科技 Motus2、爱诗科技 PixVerse,三家文生视频巨头同时亮出新牌。

作者丨刘政鑫
编辑丨刘欢

过去两年,文生视频公司的核心商业模式多为充当"AI 导演部”,为抖音短剧、品牌定制内容提供从剧本到成片的全流程交付。然而进入 2026 年,这一模式正发生根本性转变。爱诗、生数、智象三家头部企业不约而同地转向了更具想象空间的“世界模型”赛道。

它们的战略重心已从单纯的“生成画面”升级为“推演状态”和“运行世界”。业务逻辑从售卖生成次数,转向售卖模拟能力与决策工具。三家企业的新动向揭示了行业下一阶段的竞争格局。

三家同时亮牌,技术路线截然不同

尽管同为世界模型,三家企业的切入点与技术路径各有侧重:

智象未来:具身感知与抗扰动

智象 HiDream-O1-Embodied 聚焦于解决真实环境中的不确定性。基于全模态底座,该模型统一建模图像、视频、3D 及动作数据,重点攻克光照变化、视角偏移及物体遮挡等难题。通过多视角冗余机制与生成式数据扩增(利用动捕数据批量生成不同训练样本),其在 RoboColiseum 评测的扰动适应子榜中登顶,展现了极强的环境鲁棒性。

生数科技:机器人操作与规划

生数科技 Motus2 直指真实物理操作。其架构集成了动作建议、执行预测与进度评估三大功能,共享同一套模型参数。基于约 13 万小时的第一视角操作视频训练,该模型在灵巧操作任务上表现卓越:预训练后成功率提升至 51%,结合中间训练与强化学习后达 75%,触觉相关任务成功率亦提升至 72.5%。

爱诗科技:实时交互虚拟世界

爱诗科技 PixVerse R2 致力于构建“边生成、边控制”的实时虚拟世界。不同于传统游戏引擎的代码搭建,它利用模型实时计算场景状态。支持 WASD 移动、语音指令驱动场景变化及音画同步调整。其核心优势在于维持持续更新的世界状态,确保角色记忆、位置及持有物品的连贯性,避免生成式 AI 常见的“失忆”现象。

综上所述,三家企业的战略可概括为:智象未来让机器人在复杂真实环境中稳定感知,生数科技赋予机器人自主规划动作的能力,爱诗科技则在虚拟世界中实现人类的实时深度互动。

文生视频厂商切入世界模型的天然优势

早期文生视频产品主要服务于影视分镜与短视频素材,商业模式局限于按量售卖。随着平台化竞争加剧,单纯卷画质与时长的边际效益递减。转向世界模型,意味着将“渲染能力”升级为“状态推演能力”,从而打开游戏交互、机器人训练及工业仿真的广阔市场。

李飞飞团队将世界模型分为渲染器、模拟器与规划器。文生视频厂商正从“渲染器”向“模拟器/规划器”演进。这一转型具备三大核心优势:

第一,视觉先验的复用。传统机器人训练需从零构建三维空间理解,而文生视频模型已在互联网级视觉数据中习得了物体形态、遮挡关系及运动规律等隐性知识,无需重新教导基础物理常识。

第二,多模态控制的延伸。文生视频模型原生支持文本、图像、音频的组合输入。在此基础上增加动作信号、本体状态及触觉反馈,即可自然升级为“按指令运行世界”的系统。HiDream、Motus2 与 PixVerse 均在沿此路径扩展。

第三,强大的数据扩增能力。针对高质量真实物理交互数据稀缺的行业痛点,视频生成模型可利用合成数据批量生成不同光照、背景及形态的训练样本。智象未来实现了百倍级数据扩展,生数科技则成功将人类第一视角数据迁移至机器人领域。

此外,这些厂商已建成大规模视频清洗、时空建模及算力调度的底层管线,转型世界模型并非从零开始,而是原有能力的重组与升级。

从“看得到”到“摸得着”的工程挑战

尽管前景广阔,但视频模型理解的“视觉合理性”与真实物理世界的“物理正确性”之间仍存在本质鸿沟。模型可能生成看似合理的画面,却未真正理解重力、摩擦力或材质属性。目前三家企业虽各显神通,但均未宣称完全解决“视觉模型替代物理引擎”的难题。

当前主要面临三大工程挑战:

1. 长程运行的状态漂移
自回归模型在持续运行中容易累积误差,导致场景崩塌。各家虽采用多视角冗余、混合记忆或错误回收机制进行修补,但这仍是亟待突破的技术瓶颈。

2. 力觉与触觉的跨硬件迁移
触觉信号高度依赖特定硬件,不同设备间的信号差异导致“手感”难以通用迁移。若不解决此问题,操作类世界模型将止步于“看得懂”,难以实现“抓得稳”。

3. 数据回流管线的缺失
世界模型需具备持续进化能力,即从真实部署中回收失败案例与交互日志反哺训练。目前行业整体尚处于早期,缺乏成熟的自动化回流机制。

缺乏有效的数据回流,世界模型只能停留在演示阶段,无法成为随真实世界共同进化的产业系统。

竞争终局:拼的是闭环而非单点模型

智象、生数与爱诗的布局表明,文生视频的下一站是深度嵌入游戏引擎、机器人系统及工业仿真中。真正的竞争壁垒不在于模型本身,而在于系统级的闭环能力:物理信号的闭合、长程状态的校正以及部署数据的稳定回流。

未来 3 至 5 年,产业形态将是视频生成、仿真器、机器人控制与数据管路的协同协作。谁能率先打造出可审计、可回流、可部署的产业系统,谁才能真正跨越世界模型的门槛。

更深层的悬念在于商业模式的演变。初期这些公司或将作为软件服务商出售模型能力与数据服务。但随着对物理世界嵌入程度的加深,从算法到硬件仅隔一层窗户纸。它们是否会进一步涉足机器人本体制造,甚至成为软硬一体的巨头?历史经验表明,凡意图“运行世界”者,终将渴望“拥有世界”。

END
【声明】内容源于网络
0
0
亿欧网
各类跨境出海行业相关资讯
内容 29753
粉丝 0
亿欧网 各类跨境出海行业相关资讯
总阅读222.0k
粉丝0
内容29.8k