大数跨境

Z Waves|专访SigmaZ AI联创团队:23岁连续创业者联手前亚马逊AGI核心研究员,豪赌下一代AI Interface

Z Waves|专访SigmaZ AI联创团队:23岁连续创业者联手前亚马逊AGI核心研究员,豪赌下一代AI Interface Z Finance
2026-08-31
5
导读:终结聊天框,赌一场人机界面的范式跃迁

如果说大语言模型拉开了人工智能革命的序幕,那么当前人机交互的瓶颈已不再是模型的智能水平,而是人类接收信息的生理带宽。

一个严峻的事实是:人类的阅读极限约为每秒 5 个 Token,而前沿模型的输出速度正迈向每秒上千 Token。当数十个 Agent 协同工作时,庞大的生成内容往往沦为无人能读完的“字符废墟”。

正如 Andrej Karpathy 所言,盯着 ChatGPT 对话框聊天,本质上如同在上世纪 80 年代敲击终端命令行。属于 AI 时代的“图形用户界面(GUI)”尚未真正诞生。文字这根狭窄的“吸管”,正在倒逼人机界面发生彻底的范式跃迁。

创立于 2025 年末的SigmaZ AI,正试图填补这一空白。不同于主流的“数字人视频通话”或高成本、低可控的纯像素扩散路线,这家初创团队提出了一条反共识的技术路径:Coding as Backbone(以代码为骨架)

利用扩散语言模型(DLM)极高的并发生成速度,SigmaZ AI 让模型直接输出可执行的视觉代码,交由浏览器完成高效渲染。这种架构创新将视频生成的推理成本降至传统像素视频模型的1/100,更让视频从静态消费品转变为“可点击、可提问、实时重塑每一帧”的原生交互界面。

本期深度对话邀请了 SigmaZ AI 两位联合创始人——23 岁的连续创业者 William,以及曾在亚马逊剑桥实验室及 AGI Lab 亲历语音智能与 Generative UI 演进的 CTO Derek,完整拆解了他们从 Chatbot、无限画布试错到确立“实时交互视频”的思考闭环:

  • 为何聊天框终将退回 Terminal 的极客角落,而 Interactive Video 才是终局?
  • 为何在自回归模型上优化延迟是死胡同,而 DLM 才是打开实时交互大门的钥匙?
  • 如何通过“代码高维抽象 + 浏览器免费渲染”实现数量级维度的降本?
  • 年轻团队如何在巨头林立的生成式 AI 战场构筑审美偏好与 RSI 壁垒?

以下为对话实录:

从 Chatbot 到实时交互视频:一场人机交互界面的范式跃迁

ZF:欢迎两位。首先请简单介绍自己。

William:我是 SigmaZ AI 的 Founder and CEO William。作为一名 23 岁的连续创业者,我曾创立三家 Startup。我们目前致力于用"Coding as Backbone"打造实时交互视频生成模型。我们认为,未来回顾今天将文字作为 AI 主要交付物的方式会显得很奇怪,因为 AI 默认将以实时视频形式与人类交流。

Derek:我是 SigmaZ AI 的 CTO 兼 Founder Derek。我的职业生涯经历了三代人机交互形态:十年前在 Amazon Alexa 参与第一代语音智能;随后在 Amazon Nova 模型中将 Generative UI 落地,让大模型直接输出可视化 HTML;而现在,我们要做的下一代是实时交互视频。

ZF:创业之初就确定要做实时视频交互吗?

William:我们确定 AI 时代的交互体验会被重塑,但具体形态经历了探索。最初我们做过 Chatbot,但文本限制太大;后来尝试无限画布,但边界太宽,用户难以掌控,连国内头部画布公司 Kuse 也转向了列表管理。

第三次尝试中,我们推出了“交互视频”功能,将课件变为交互式视频课堂。这一形态理解成本低、用户掌控感强,且将生成式页面降维为内容,留存率极高。虽然最早定位为 AI 教育产品,Alpha Launch 后在海外获得千万级曝光,用户平均停留时长达 11 分钟,是同类产品的三四倍。

但我们发现,超 50% 的用户将其用于通用场景,如将小说、商品变为交互式视频。用户反馈生成速度快、准确性强、成本低,适合清晰传达任务。最终,应用户对“实时性”的强烈需求,我们演变成了今天的实时视频形态。

ZF:为什么 Chatbot 不是终极 Interface?

Derek:每一代界面最终都会成为人与 AI 之间的瓶颈。成年人阅读速度约每秒 5 个 Token,而模型输出已达每秒 80 到 240 个 Token,未来专用芯片更可达数千。若未来使用 Agent 团队,输入输出差距将达几百倍,导致大量输出无人阅读。

算力不再是天花板,人才是。Karpathy 曾比喻,跟大语言模型聊天就像使用上世纪 80 年代的 Terminal。GUI 的出现让电脑智能变得可视、可操控,我们现在要做的,就是给 AI 补上这一课。Karpathy 在 2026 年指出,HTML 是当下大模型理想模态,终点是交互式视频(Neural Video)。聊天框不会消失,但会像 Terminal 一样留给极客。

ZF:如何判断一个 Interface 是 Work 的?

Derek:入口型产品应是人使用起来最不费劲的模态。交互范式迁移的开关从来不是“能不能”,而是“快不快、贵不贵”。当现场生成界面比预先做好的更快、更便宜时,范式就会翻页。

需求端是算力和信息过剩,逼着界面升级带宽;供应端则是 AI 需具备驾驭高带宽视觉界面的能力,写出承载信息的视觉代码。供需两端同时到位,范式才会改变。

实时交互视频的定义:一个状态公式,而不是一次生成

ZF:为什么选择现在这个时间点创业?

Derek:2024 年行业缺的是智能;2025 年 Agent 爆发,智能和信息过剩,问题转为规模化落地;2026 年,问题变成了如何让人类不再成为 AI 发展的瓶颈。

同年两件关键事促成了我们的选择:功能性编程相对解决,视觉编程兴起;DLM(扩散语言模型)研究起步,为实时交互提供足够快的计算范式。如今 DLM 商用落地,代码生成速度达每秒一两千个 Token,比自回归 LM 快一个数量级。我的论文也在 ICLR 2026 发表了视觉代码领域的递归自迭代框架(RSI)。

前两年不做是因为自回归 AR 大模型的延迟问题注定被淘汰。我们将精力放在无论换什么模型都值钱的基础设施上,把速度问题留给 DLM 解决。

ZF:你们如何定义“实时视频交互”?

Derek:我们将其实时视频交互定义为状态公式:下一个画面 = 当前画面 + 你的动作 + 上下文。每一次交互都在重塑媒介本身。这与传统一次性生成的视频有本质区别。

ZF:怎么理解视觉代码渲染?

William:主流 Visual AI 分两类:一是 Pixel Diffusion(像素扩散),真实但成本高、可控性低;二是 Visual Code(视觉代码),以代码为核心,成本低、高可控、准确性强。过去受限于自回归模型速度,无法实现实时交互。如今基于 DLM 技术,我们能用代码作为实时交互视频的 Substrate,在新闻等场景中精准呈现 3D 内容或图表。

ZF:与普通用户的体感区别是什么?

William:我们早期没有数字人,不像跟 AI 打视频电话。我们的输出更像 AI 开了一个共享屏幕,展示干活过程并实时生成有信息量的内容。例如健身时实时纠正动作,或解题时实时生成深入讲解。我们称之为“好用又好玩的实时交互视频”。

类比来看,它像一个 AI 原生、实时交互版的 YouTube。用户可对视频内容实时提问,AI 直接用视频方式回复。

ZF:这种形态确实很适合自适应教育。

William:最早我们界面左边是视频,右边是 Chatbot。用户默认 Chatbot 应该能控制视频,这是一个巨大的 Aha Moment。我们发现用户不仅用它学习,还用来理解 AI 输出、看小说、生成商品介绍等,具备很强的泛化性。

Code 负责真实,Diffusion 负责“好看”,双轨技术架构

ZF:完整的技术链路是什么?

Derek:以用户点击视频中耳机为例:第一步是“意图反演”,系统结合点击元素和上下文判断意图。若是事实性问题,推理层异步检索;若是交互,交互层继续视觉演化。

推理层返回新信息后,模型推导出 T+1 状态,对当前场景代码 Template 进行继承式编辑,而非推倒重来,保证场景连续。随后用 DLM 并行起草代码,浏览器执行新场景。状态显式存储在用户的 Exploration Graph(探索图)上,模型本身 Stateless。

ZF:模型本质是代码模型?

Derek:是的,它是一个“写代码的模型”,输出可渲染成视觉内容的代码,类似不断自迭代、更新且带动画的网页。

ZF:代码渲染会限制视觉表现力吗?

Derek:目前审美偏好排名确实靠后,但代码表现力上限很高(WebGL、Shader 等)。问题在于模型还没学会把代码写得美,这是训练问题。DLM 的高速度让我们能通过 RSI 系统在线实时多轮迭代,用速度兑换美感。

终局架构中,会有连续扩散的像素头负责氛围和质感。Code Token 负责真实,Diffusion 负责好看。代码限制了模型撒谎的能力,方程写在代码层就不会渲染错。

ZF:代码生成与传统图生视频逻辑有何区别?

Derek:代码是高维抽象。例如篮球弹跳,代码只需 Import 物理库并设置初速度,渲染引擎免费完成物理计算且符合规律;像素模型需逐帧推理,耗时且不保证物理正确。

ZF:为何代码能做到这些?

Derek:物理规律是硬逻辑,可写入物理库。代码组件可缓存、复用、Remix,而像素世界无组件概念,每次需从头计算。

ZF:为何不选自回归路线?

William:自回归模型上限受硬件显存带宽限制。为突破限制,必须更换解码架构。

Derek:实时交互需要极低延迟。自回归写代码约每秒 100 Token,复杂场景需几分钟,这对实时交互是死刑。我们选择在自回归上抠延迟,还是等待新范式?我们选择了后者,先解决质量和评测,把速度交给 DLM。

DLM 解码不受内存带宽限制,消费级 GPU 即可跑出高吞吐量,且单人单卡即具经济性,无需拼_batch_。

ZF:为何更看好 DLM 的工程优化曲线?

Derek:自回归优化已进入下半场,提升空间有限;DLM 刚进入上半场,处于指数增长早期,一次优化可能就是几倍提升。我们押注的是这条曲线的斜率。

ZF:DLM 会挑战自回归模型地位吗?

William:两者将是分层共存。LLM 处理长程复杂推理,DLM 负责实时 AI 和人眼可见的结构化生成。

Derek:未来技术分层会更精细。激进来看,DLM 在调度效率提升后,吞吐量也将与自回归持平,而用户体验到的延迟将大幅降低,市场自然会选择更快的模型。

1/100 成本不是优化结果,是结构优势

ZF:DLM 对 RSI 有什么作用?

William:DLM 擅长快速生成 Token,可加速 AI 递归自进化(RSI)过程。我们用 VLM 作为奖励信号,DLM 作为 Improver 修改生成的 Artifacts。由于 DLM 速度快,Latency 增加不多。长期看,编辑轨迹可通过知识蒸馏和强化学习进入模型权重,实现自我进化。

ZF:1/100 推理成本的数据准确吗?

Derek:这是实测结果,主要来自四个结构性变化:

  1. 表示层级:代码是高维抽象,精简表达世界状态。
  2. 渲染外包:真正的渲染工作交给用户设备上优化最好的免费引擎——浏览器。
  3. 零编辑帧:代码生成一次即可自行运行,仅在新交互时调用模型,而非每帧消耗算力。
  4. 代码复用:组件可缓存、复用和 Remix,规模越大缓存空间越大。

ZF:最核心的技术壁垒是什么?

Derek:核心壁垒是视觉代码领域的后训练架构,特别是 RSI Loop 中的 Evaluator(视觉 Judge)。如何让模型理解人类审美和偏好,拥有 Expressiveness 和 Taste,是关键。此外,异步训练系统让 GPU 不因渲染打分而闲置,以及保证 RL 训练 Rollout 时沙盒的稳定性,也是重要壁垒。

ZF:目前产品进展如何?

William:主要在推进三个方向:建立行业缺乏的交互视频 Benchmark;围绕模型和产品做基础能力建设(数据、训练、工程);与早期合作用户试点,验证真实业务表现。阶段性 Benchmark 和 Demo 已在 X 发布并获得反馈。接下来将整合能力至 production-ready 环境。

ZF:收到过哪些有趣的用户反馈?

William:除了 C 端用户,硬件厂商(桌面智能硬件、机器人公司)主动联系我们,希望将实时交互视频作为物理世界 Agent 的动态界面,如智能健身镜、AI 缝纫机等。硬件难做到千人千面,但界面可以。

ZF:最终产品形态是什么?

William:现阶段优先优化模型。产品路径上,先做 C 端平台建立用户认知和数据飞轮,再向 B 端延伸,成为商业基础设施。商业模式早期降低门槛,后期探索 Premium 订阅和原生广告。

招聘第一标准:好奇心,不是履历

ZF:融资过程中有何故事?

William:首位投资人小小基金(Solo GP)在两小时内决定投资。她并未纠结细节,而是判断方向潜力、团队能力及早期信号。她看到了我们正在 Build 一种可能成为下一代人机交互最优解的新产品形态。

ZF:向投资人解释技术路线有门槛吗?

William:解释新品类重在阐述现有产品缺失。从 YouTube、TikTok 和 Chatbot 切入,说明文本交互效率低,实时交互视频价值易懂。技术路线上,DLM 虽名字含 Diffusion,本质仍是 Language Model,需解释其更快、更低成本的原理。该方向正从非共识走向共识。

ZF:招聘原则是什么?如何吸引资深人才?

William:第一标准是好奇心。在 AI 时代,好奇心和 Agency 比经验更重要。吸引人才靠的是解决足够重要且有挑战的问题、清晰自洽的技术路线,以及足够大的责任Scope。早期团队能让人才定义问题而非仅优化模块。

ZF:团队规模和地点?

William:约 20 人,基本在中国杭州。这里人才密度高,吸引了不少阿里、字节背景的工程师。

ZF:接下来的关键里程碑?

William:一是完成模型训练,上线基于代码的视频生成模型;二是推出 C 端平台,预计明年 Q1 前上线,让用户看到视频从静态变为共同参与的体验。同时招募早期创作者建立内容管线,并展开新一轮融资。

快问快答

ZF:最喜欢的创业者?
William:Steve Jobs。

ZF:因年轻受到质疑吗?
William:我长得比较老,大家常怀疑我是否已经 30 岁了。

ZF:MBTI?
William:ENTJ。

ZF:推荐一本书或电影。
William:推荐《Why Nations Fail》。这本书以建模方式理解人生和社会,对创业和理解技术演变很有帮助。

ZF:最喜欢的 AI 产品?
William:Claude Code。

ZF:希望 SigmaZ AI 成为什么样的公司?
William:希望成为实时交互技术的核心提供方。即使未完全成功,也希望被视为在该领域做出最早核心贡献的公司,对人类未来如何与 AI 交流做出独特且巨大的贡献。

【声明】内容源于网络
0
0
Z Finance
我们相信认知能够跨越阶层,致力于为年轻人提供高质量的科技和财经内容。
内容 897
粉丝 0
Z Finance 我们相信认知能够跨越阶层,致力于为年轻人提供高质量的科技和财经内容。
总阅读100.8k
粉丝0
内容897