新智元报道
过去两年,AI 展现出惊人的创造力。下一步,人类该如何与所创造的世界交互?这正是 Noiz 团队持续探索的核心命题。
与他们的实时交互模型
行业变局:从「生成内容」转向「理解世界」
2024 年以来,AI 内容生成迎来商业爆发。OpenAI、Midjourney、Runway 等模型快速崛起,完成了视频、图片及音频的商业验证。随着 AI 内容生成进入增长快车道,资本开始押注下一代 AI 方向。
李飞飞创办的 World Labs 与杨立昆的 AMI Labs 相继完成超 10 亿美元融资;Google DeepMind、Meta、NVIDIA 等巨头纷纷布局。行业焦点正逐渐从单纯的「生成内容」转向更深层次的「理解世界」。
然而,当这些模型真正落地产品时,面临全新挑战:当前大多数多模态模型擅长生成(Generate),却无法实现沉浸式交互(Interact)。它们能按指令输出静态结果,却无法持续理解环境变化或随用户行为实时响应。AI 更像内容生成器,而非能持续参与世界的智能体。
更关键的是,交互远比生成昂贵。一次生成仅需单次推理,而实时交互要求模型持续感知、推理并在几十毫秒内响应。GPU 需持续在线运行,导致推理成本比传统生成高出一个数量级。这也是实时可交互多模态难以真正产品化的核心原因。
在此背景下,成立数月的 Noiz 团队选择了一条差异化路线:
他们训练出了新一代实时可交互多模态模型,推理成本仅为当前主流音视频模型的百分之一。
技术突破:实时交互的 AI 生成
从创作到交互,技术上并非简单的延伸,而是全新的命题。传统多模态模型只需回答“几秒内画面应是什么样”,交付单一结果即可。而可交互内容要求模型同时处理更多变量:当前场景状态、操作带来的改变、下一秒的反馈逻辑,以及所有变化如何低延迟连续发生。
运行可交互内容时,模型需在每一次操作后重新计算。用户的移动、转向或碰撞都会改变后续轨迹。系统既要记忆历史状态,又要让当前选择真正影响未来内容。
因此,实时交互的难点不仅是速度。若模型无法理解动作、维持状态并组织反馈,即便延迟再低,用户体验仍只是一段快速生成的成片。Noiz 的目标正是弥合单次生成与实时运行之间的鸿沟。
Noiz 团队采取了三个反常识的技术策略:
第一,将内容视为持续更新的状态,而非文本映射。
传统音视频在生成结束时即封闭终点。可交互内容则无预设终点,用户的每次输入都会改变运动、镜头及空间关系。这要求系统在同一条链路上完成动作理解、状态维护、生成调度和低延迟推理,任何环节滞后都会导致“交互”退化为等待。
第二,不再让语言充当所有信息的总翻译。
多数多模态模型先将画面转为 Caption、动作拆为 Token 再交由语言中枢处理,这会压缩材质、距离、力度等关键信息。Noiz 选择直接围绕事件建立表征:谁在移动、处于何位置、作用于何对象、引发何种连续变化。这一步确保了实时内容能在动作发生的同时抓住核心关系,无需等待解释。
第三,不争夺基座,构建实时交互层。
Noiz 不在基础音视频模型上与大型实验室正面竞争,而是在现有基座之上构建实时交互层。其模型负责理解输入、保持状态连续、调度生成过程,将操作转化为即时反馈。这意味着 Noiz 不受限于特定基座模型的胜负,行业画质提升与成本下降均成为其红利。
Noiz 建立的壁垒在于解决基础模型未触及的问题:如何将一次性生成改造为持续运行,如何让内容记忆状态,以及如何在条件改变后给出合理的新分支。
此外,该能力产生了稀缺的交互数据。传统数据仅有“提示词—成片”,而交互数据包含完整过程:移动轨迹、停留位置、视听反馈及操作后的预期变化。这些数据记录了用户希望内容如何回应自己,使模型学会根据连续行为不断修正结果。
成本控制:NOIZ 的判断与创新
NOIZ 的判断与创新
Noiz 判断:随着各类音视频模型质量提升与价格下降,多模态生成将逐渐成为标准化能力。仅靠生成更漂亮的成片难以构成长期壁垒。因此,他们致力于搭建一层介于基础模型与最终体验之间的系统。
该系统向下接入不同音视频模型与资产,避免技术路线锁定;向上封装复杂的推理、状态和调度能力,让开发者直接构建可控、可持续运行的内容。这套路线概括为「感知—生成—交互—推演」:
- 感知:判断用户行为与环境变化;
- 生成:调用合适模型补全内容;
- 交互:确保每次输入得到即时连贯响应;
- 推演:在条件改变后计算多个可能分支。
前两步解决内容呈现,后两步决定内容是否可被操控与反复体验。而系统落地的关键在于对成本的极致控制。
训练数据端:针对稀缺的空间音视频数据,团队自建覆盖空间、材质与距离变量的采集管线,并将物理仿真数据成本压至极低。真实采集保真,物理仿真穷举,从源头降低专用模型训练成本,实现了类似“取用自来水”般的低成本数据采集。
推理端差距更为显著。目前,Noiz 新一代实时可交互音视频模型的推理成本约为当前主流模型的百分之一。
这一路径已获验证。上半年,团队将高质量多模态音频基座 AudioX 优化为可实时运行的 AudioX-Turbo 版本,计算量下降近两个数量级,效果反而提升。在横跨文本、图像、音视频等十余项公开基准上,AudioX 刷新多项 SOTA,领先第二名近一倍。
这并非边际优化,而是源于技术架构创新。通过多模态高效对齐、极致蒸馏加速及最新推理优化技术,系统能以更低开销维持连贯、同步的实时生成。只有成本降至该量级,实时生成才能从演示走向规模化产品。
商业模式:沉浸式交互与真实需求共生
与真实需求共生
当视觉、空间与声音在同一模型中共同演化,新的沉浸式交互内容基座随之诞生。它不再只是为画面配音,而是让人进入一个可感知、可交互、实时响应的世界。
Noiz 团队组建于 2025 年底,核心成员背景深厚:
- 创始人陈伟嘉(Vega):曾在 Meta Video team 主导 FAIR 的 ASR 模型落地,后创业被腾讯收购,曾任腾讯及 TikTok Agent 方向技术负责人,也是 GitHub 37k Stars 开源项目 Mockingbird 作者。
- 联合创始人陈前:北大元培学院出身,曾通过 PLG 模式将产品做到近千万付费用户、数亿年收入。
- 首席科学家 Zeyue Tian:港科大音频博士,开源音乐模型 ChatMusician 作者,最早系统研究音视频联合生成的研究员之一。
|
|
团队成员来自 Google、Dolby、清华、北大、CMU 等机构,累计发表顶会文章超 20 篇,引用过万,开源项目获数万 Stars。
与研究型实验室不同,Noiz 从第一天起就追求商业化闭环。创始人 Vega 认为:“收入是验证,闭门造车才是风险。”
目前,产品 noiz.ai 已聚集约两百万创作者,以专业音视频用户为主。在无大规模投放情况下,产品收入连续数月保持高双位数环比增长,年化收入达数百万美元;其 Voice Skill 长期占据 Skills.sh TTS 类榜首。
除创作者产品外,同一套模型已通过 API 集成进入多家大型内容平台生产管线。下游已有两家估值数十亿元的 3D 生成平台接入其多模态能力,实现 3D 场景与空间声场的自动匹配。
Noiz 已形成闭合循环:超两百万创作者的真实使用沉淀高质量偏好信号,专有采集管线与低成本仿真补齐数据另一半;数据反哺研究,研究优化产品。商业化与研究在此互为支撑,用今日可规模化的产品,供养十年尺度的目标。
未来展望:下一代 Seedance?
当前,大多数多模态模型仍停留在 Prompt 驱动的一次性生成。但真实世界永不停止,环境与事件不断变化。真正的 AI 不应等待下一次指令,而应持续理解环境并实时响应。
实时可交互多模态模型改变的或许不是生成速度或质量,而是AI 在内容中的角色。它首次从内容的创造者转变为参与者。
从游戏、AI Companion 到数字人、互动影视乃至教育领域,当 AI 能够持续理解事件、推演变化并在几十毫秒内响应,它与人的关系将发生根本转变——从旁观世界,到参与世界。
编辑:摩西

