大数跨境

形界智能:沿用两段式架构,是市场对 AI 实时视频的最大误判

形界智能:沿用两段式架构,是市场对 AI 实时视频的最大误判 极客公园
2026-08-21
26
导读:投资人广撒网式布局,但真正的全域沉浸式生成,还少之又少。
投资人广撒网式布局,但真正的全域沉浸式生成,仍属稀缺。

作者|Cynthia

编辑|郑玄

2024 年 8 月 27 日,DOOM 里的一声枪响,在 2026 年年中的资本市场引发了震耳欲聋的回响。

当日,Google Research、Google DeepMind 与特拉维夫大学联合发布的演示中,出现了《DOOM》的游戏画面:棕红墙壁、幽暗走廊、像素枪口。玩家移动、怪物现身,扣动扳机,枪声响起。

若不加细察,这段演示与过往三十年的游戏录像无异。但屏幕背后已无传统游戏引擎,所有画面均由模型在毫秒内自行推演生成。

互联网时代“短视频 vs 直播”的叙事,正在 AI 视频生成赛道重演。

受限于成本及内部策略,那声枪响很快被离线生成视频的掌声掩盖。此后一年,行业焦点集中于 Sora、可灵、Seedance 等离线模型,致力于提升分辨率、镜头语言及人物一致性,力求将十秒视频打造得如电影般精致。

然而枪声未歇,穿越两年时光,实时视频生成终于在 2026 年年中迎来爆发。

01 一张拥挤的牌桌,与行业的第三条路线

2026 年 8 月 13 日,Anthropic 被曝正洽谈以约 60 亿美元收购实时视频生成初创公司 Decart。

消息迅速扩散,实时生成视频成为行业焦点。2026 年前七个月,融资消息频传,从 Runway 到 World Labs,再到 Decart 与 Odyssey,单轮融资额达数亿美元已成常态。

美国,产业投资人倾向于多头下注。

比金额更值得关注的是出资方阵容:英伟达、AMD 同时现身 World Labs 与 Runway 股东席;Adobe 押注 Runway 与 Decart;亚马逊及自动驾驶玩家支持 Odyssey;丰田、红杉、Benchmark 则围聚 Decart。

这张拥挤的牌桌上,坐满了焦虑的投资人、野心勃勃的创业者、新一代技术极客,以及来自游戏、直播、教育、自动驾驶与具身智能行业的期待者。

众人都在等待一个信号:大门何时开启,由谁开启。

关键在于,三派玩家各自押注何种技术路线。

第一类以字节跳动 Seedance、快手可灵、生数科技 Vidu 为代表,在替代实拍、剪辑与特效的基础上,不断追求清晰度与时长的极致。但这仅改变了生产方式,视频仍是预制的成品,观众始终处于屏幕之外。

第二类玩家试图打破这面墙。World Labs、Odyssey 及国内的爱诗科技、智象未来,正走向实时流式生成。它们旨在构建可实时演化的数字世界:用户可操控视角、改变环境、指令生成新地貌。这虽将人从观众变为玩家,但仍需通过键盘、鼠标或 Prompt 驱动,进入门槛依然存在。

在此基础上,第三条路线应运而生:全域沉浸式生成(Immersive)。该概念恰呼应《头号玩家》中“绿洲”(OASIS)的核心精神。

形界智能的 Rise 系列是此路线的代表。其核心逻辑在于:交互的终极形态是模型适应人,而非人适应模型。用户无需学习指令,仅凭摄像头捕捉的自然动作、表情与姿态,即可进入并影响视频世界。世界开始主动理解用户本身。

三条路线并无绝对对错:第一条旨在打造更好的生产工具,第二条通往实时互动的数字世界,第三条则志在成为低门槛的世界入口。

每条技术路线背后,都蕴含着一套关于时间、成本和模型架构的精密算术。

02 一位典型技术型创始人,与一个仍被低估的蓝海

技术路线尚未形成共识,资本已率先涌入。

形界智能不仅是全域沉浸式生成赛道的少数玩家,其融资进度亦引人注目。这家成立于 2026 年 5 月的公司,首月即完成数千万元天使轮融资。成立不足三月,排队入场的投资人已角逐至第二轮乃至第三轮。

投资人的看好逻辑各异。

其一,看重全域沉浸式生成在内容与游戏领域的潜力。

早期抖音、快手等短视频社区依靠内容加广告模式起家,而直播带来了新的流量入口与粉丝粘性,并通过带货、打赏等玩法实现了高效商业转化。

AI 视频演进正复刻此路径:当离线生成的画质、时长逼近商业化临界点,实时交互成为下一个要塞。唯有实时,才能催生更紧密的互动,生长出超越纯内容生产的广阔商业模式。

其二,看重创始人的背景及技术积累。

形界智能 CEO 王裕鑫系中科大博士,五年间发表二十余篇顶会论文,是标准的技术型创始人。此前作为元石科技 007 号员工,他牵头组建了国内较早的 MoE 架构大模型预训练团队,曾被海外知名评论人 Simon Willison 评为 2025 年中国 Top6 大模型团队之一。

这是一支在大模型战场 proven 的团队,带着对产品落地、技术周期判断及商务经验的积淀,投身新战场。

2026 年初洞察到沉浸式视频生成的机遇后,王裕鑫于当年 5 月集结一群中科大院长优秀奖获得者、华为天才少年及大厂顶尖人才创立形界智能,并在当月拿下数千万元融资。

团队成果 Stream-R1 与 Stream-T1 同期登顶 Hugging Face 每日论文榜前二,获联合创始人及知名研究者 AK 公开推荐。

这两篇论文直击行业痛点:Stream-R1 从训练侧改造流式视频蒸馏过程,优化奖励信号分配;Stream-T1 转向推理侧,通过候选搜索与记忆管理探索 Test-Time Scaling。两者分别从训练和推理两端提升流式生成质量

形界智能更关注如何降低交互成本,让人轻松进入虚拟世界。王裕鑫认为需翻越三座大山:

第一,视频流原生输入:实现端到端的视频输入输出,无需独立理解模型转换指令,以达到极低延迟。

第二,理解与生成联合建模:用户输入与生成输出在同一时序内共同建模,支持通过摄像头连续输入直接影响生成。

第三,统一 Scaling:理解与生成在同一模型范式下共同扩展,实现智能的同时涌现。

基于上述标准,2026 年 7 月上海 WAIC 期间,形界智能正式发布「Era」系列首个面向社交场景的互动视频生成模型——Genesis。此次发布标志着形界智能正式坐上资本与竞争的牌桌。

Genesis 是一款全双工视频生成模型:支持随时打断、感知摄像头输入、对观众动作实时反应。实时理解、生成与响应的闭环首次跑通,类人交互体验从概念变为可操作的 Demo。

展会三天,Genesis 体验队列从未中断,累计体验超 10 小时,意向团队名单长达百余个。

Genesis 仅是起点。不到一个月,形界智能发布「Era」系列第二个全域沉浸式生成基础模型 Rise,以每秒一分钱的定价及 500 毫秒无感延迟,实现了低时延的开放世界自由探索。

这一低成本进入世界、社交及开放场景探索的里程碑,令人联想起电影《头号玩家》中的虚拟世界愿景。尽管上一波元宇宙浪潮中巨头 Meta 未能摆脱其“极客玩具”的命运,但在 AI 时代,形界智能有望成为例外。成本、效率及背后的模型架构是关键。

03 一个每秒一分钱的端到端架构,与一个 10B 的模型

近期,王裕鑫常在演示中邀请体验者参与类似赛车游戏的画面。用户只需站在摄像头前做出开赛车动作,画面中的赛车便会同步转弯、漂移、加速。虚拟方向盘可是手机、笔,甚至双手虚空操作。

在高速运转的赛车场景中,用户动作被实时捕捉并映射,整个过程流畅度媲美预渲染的游戏 CG,这对多模态大模型而言是难以想象的突破。

此演示清晰展示了其与前几代行业路线的区别。

首先是架构。此前行业实时视频生成通常将动作理解与画面生成拆分为两个独立模型:摄像头画面先经理解模型转为指令,再喂给生成模型。这种串行处理带来翻译损耗与通信开销,导致延迟往往超过 4 秒。一旦反馈超过人类感知阈值,沉浸感便荡然无存。

形界智能认为,去除翻译与串行,以 Native Interactive Representation Scaling 方式将理解与生成置于同一模型进行端到端处理,是实现沉浸式视频实时生成的唯一解法。

下图展示了 Rise 实时沉浸式视频生成基础模型的运行流程。

以赛车场景为例,系统接收持续的视频流输入,将摄像头采集的真实视觉观测切分为连续的 500 毫秒片段,连同任务提示词送入基础模型。

在每个 500 毫秒窗口内,模型同时接收新的视频片段及上一轮推理继承的噪声块。基于继承的隐状态继续扩散推理:一方面解码生成像素级干净视频片段作为输出,另一方面保留部分去噪隐张量作为噪声块回传,供下一窗口使用。

基于此架构,Rise 在 Pre-training 阶段同时学习视频理解、生成及联合建模任务,实现了精准的用户行为理解与视频生成。Post-training 阶段,仅用 300 小时赛车数据即达成逼真互动效果。

这套设计带来了三个显著结果:

一是用户可通过摄像头这一最直接的交互语言,直接影响视频生成结果。

二是借助 10B 级参数规模,将时延压低至接近无感水平。形界智能是国内首家将体感延时控制在 500 毫秒的玩家。

三是推理效率指数级上升,算力成本从传统两段式方案的每秒 0.7 元降至 0.01 元,且供应商仍有利润空间。

每秒 1 分钱的定价意味着:企业一场两小时的 AI 直播互动成本从过去的五千元至八千元骤降至 72 元。随着架构迭代与芯片适配,成本仍有下探空间。

此后,模型将进一步应用于情感陪伴、教育及具身模型训练数据采集等场景,大规模落地只是时间问题。

04 沉浸式视频生成,一个还不是世界模型的新世界入口

采访中,针对形界智能所做之事酷似世界模型却未以此自居的疑问,王裕鑫列举了物理仿真、记忆、多人参与及画面精细度等方面的差距。

类比而言,当前技术尚处 GPT-3 前夜,但这并不意味着产品是半成品。

对于直播、陪伴、教育等行业而言,我们正见证数字内容从“被观看的对象”向“可进入的空间”的历史性跨越:屏幕彼端不再是他人拍好的故事,而是一个等待用户走进的世界。

终局尚未到来,但下一个时代的入口已清晰可见。

*头图来源:AI 生成

【声明】内容源于网络
0
0
极客公园
用极客视角,追踪你最不可错过的科技圈。
内容 950
粉丝 0
极客公园 用极客视角,追踪你最不可错过的科技圈。
总阅读44.8k
粉丝0
内容950