大数跨境

创业一年即被收购,他想让高效Token成为AI时代的基础资源|对话Nebius王瀚锐

创业一年即被收购,他想让高效Token成为AI时代的基础资源|对话Nebius王瀚锐 DeepTech深科技
2026-10-05
57
导读:“我们的目标就是把模型产品做到更好、更深。”

GTC舞台的高光时刻:从MIT博士到AI独角兽核心

2026年3月,英伟达GTC大会主题演讲中,黄仁勋展示了一张幻灯片:在中国开源模型Kimi K2.5的推理速度排名中,一家名为Eigen AI的公司位列第一。对于Eigen AI创始人兼CEO王瀚锐而言,这是一次意外的惊喜。“我们事先并不知情,直到那一刻才发现自己做到了最快。”他回忆道。

彼时,成立仅9个月、团队约20人的Eigen AI已展现出惊人的技术实力。不久后,上市AI云服务商Nebius宣布以超10亿美元对价收购Eigen AI,消息带动Nebius股价连续大涨。面对资本市场的狂热,王瀚锐心情复杂:“股价上涨是认可,但也意味着肩上的重担更重了。”

王瀚锐毕业于麻省理工学院(MIT)电子工程与计算机科学系,是韩松教授的“开门弟子”。自2017年起,他聚焦Transformer和GPT架构的高效计算,其主导开发的稀疏注意力系统SpAtten成为HPCA引用最高的论文之一,并完成台积电28nm工艺流片。2024年毕业后,他推迟UCLA助理教授入职,联合两位MIT校友创办Eigen AI,致力于让开源大模型在GPU上运行得更快、更省,并按Token对外出售服务。截至被收购前,Eigen AI在独立评测平台Artificial Analysis上的25个主流开源模型推理性能均位列第一。

凭借在AI推理效率上的突出贡献,王瀚锐入选亚太区《麻省理工科技评论》“35岁以下科技创新35人”。加入Nebius后,他出任高级副总裁(SVP),全面负责涵盖推理、后训练和智能体系统的Token Factory业务。7月底,Nebius Token Factory成为2.8万亿参数混合专家(MoE)模型Kimi K3的Day 0首发合作伙伴。

从学者到创业者:解决GPU空转的真实痛点

从学者到创业者,再到大厂管理者,王瀚锐的身份转换始终围绕一个核心驱动力:解决领域内尚未被攻克的关键问题。创业初衷源于他发现GPU大部分时间都在空等数据;而展望未来,他关注的是自动为用户挑选最合适模型,以及突破人与智能体交互的速度限制。

高效AI计算的早期探索

DeepTech:请介绍一下您的背景及当前工作。

王瀚锐:我目前在Nebius负责Token Factory业务,包括推理、后训练和智能体系统。本科就读于复旦大学,2018年进入MIT成为韩松教授的首位博士生,研究方向为高效AI计算,核心是通过跨层级的硬件-算法协同设计提高效率、降低成本和内存消耗。

我从2017年开始研究Transformer相关的稀疏化技术,包括Token剪枝和量化,并早期涉足缩放定律研究。我们还曾开发稀疏注意力芯片SpAtten,采用台积电28nm工艺流片,实现了从算法到底层硬件的全栈打通。2024年博士毕业后,我全职筹备并于2025年正式成立Eigen AI,专注于企业级开源模型的优化部署。2026年春并入Nebus,旨在将技术最大化部署至更多GPU,惠及更广泛客户。

为何选择Transformer方向?

DeepTech:作为韩松教授的开门弟子,为何选择当时尚属小众的Transformer方向?

王瀚锐:韩老师是高效AI方向的先驱。读博前我便与他有合作。当时高效AI计算已受关注,但我是实验室首位专注Transformer的人,其他同学多聚焦视觉或3D点云模型。

选择该方向主要基于两点:一是其架构不同于传统卷积网络,更具并行计算潜力;二是Transformer展现出的生成能力令人兴奋。当时BERT类模型流行,GPT架构仅在实验中作为对照。但我们看到Transformer既能并行加速,又能解决以往难题,甚至具备突破图灵测试的潜力。

规模化远未触顶

DeepTech:ChatGPT爆发后,Transformer成为主流,你们预料到如此快的规模化吗?

王瀚锐:未预料到规模化速度如此之快,也未想到零样本学习能力如此强大。早期机器学习需针对特定任务准备数据、设计损失函数,模型只能从单一任务扩展至有限任务。直到GPT-4前后,所有任务才统一为文字输入/输出形式。

如今,智能已成为模型自带属性,泛化能力强到足以忽视“学习”过程。原始Transformer仅千万级参数,而网传GFT-6参数超10万亿,6年间增长6个数量级,硬件算力需求也随之剧增。

DeepTech:这种规模化是否接近极限?

王瀚锐:远远没有。预训练虽受数据限制,但在后训练和强化学习阶段,模型可在复杂环境中自我演化。若仅提供网络文本,能力上限限于人类智能;若提供如数学般复杂的客观环境,模型智商可能远超人类,提出人类无法理解但具启发性的想法。

推理服务的商业逻辑:训练证明能力,推理落地应用

2025年创业之际,正值训练热潮。王瀚锐团队却选择切入推理赛道,认为训练证明了模型能力,而推理才是让能力真正产生经济价值的关键。

云端推理的技术壁垒

DeepTech:为何选择做推理而非训练?

王瀚锐:训练在资本市场火热,因为它展示了前所未有的能力。但到2024年,这种证明已充分,滞后的是应用。模型能力越高,可解锁的任务和行业越多。真正发挥能力的应用必须在经济上可行。我们此前的研究正是为了让模型更实用、高效,推动用户从观望走向使用。

DeepTech:创业的契机是什么?

王瀚锐:技术层面发现Token生成是内存受限的,GPU大量时间在等待数据搬运。若聚合多用户请求,计算可从矩阵与向量乘法转为矩阵与矩阵乘法,大幅提升GPU利用率。结合稀疏注意力和AWQ量化技术,我们将其应用于大规模云端,处理高吞吐量流量。

图 | Eigen AI在NeurIPS 2025展览(来源:受访者提供)

云端与端侧的博弈

DeepTech:云端和端侧推理各有优劣吗?

王瀚锐:CNN时代,手机端模型与前沿模型差距不大。但6年来模型规模增长10万倍,手机内存未同步增长,最前沿模型难以在端侧运行。虽然轻量级模型如Qwen-3.8-27B的出现缩小了差距,但目前端侧主要满足隐私需求,占比不大。从增长速度看,云端依然快于边缘推理。

英伟达实习带来的思维影响

DeepTech:2020年在英伟达实习的经历对您有何影响?

王瀚锐:两点影响深远。一是研究需从真实问题出发,思考技术转化。项目启动前需明确成功后的影响,这促使我们创办Eigen AI时紧扣真实需求。二是“光速”理念,既指做事要快,也代表第一性原理。我们通过计算GPU理论上限,反推各环节差距,确立明确优化目标。

DeepTech:推理最大的技术壁垒是什么?

王瀚锐:一是系统需不断适应规模增长,谁能最快将服务能力提高10倍谁就能领先。二是在大规模GPU上稳定、快速且经济地部署开源模型。三是技术演进的自动化,如利用递归式自我改进(RSI)优化服务引擎和内核设计。

开源模型的商业竞争力

DeepTech:开源与闭源模型差距多大?

王瀚锐:与最顶尖闭源模型相比,开源模型在基准测试和最难推理任务上仍有差距,但差距正迅速缩小,目前可能不到6个月。客户并不在意模型来源,而是关注在特定任务、调用框架和运行环境下,经过后训练的开源模型能否超越闭源模型。

DeepTech:客户如何看待价格?

王瀚锐:成本约占决策权重的50%,准确率提升占30%,可控性占10%-20%。大流量企业对成本极度敏感,即使降低5%也是巨大金额。此外,开源模型能满足数据隐私和定制化需求,帮助客户建立竞争壁垒。

并购背后的考量:寻找最佳组织形态

Eigen AI成立一年即被收购,王瀚锐认为这是技术积累与市场需求匹配的结果。他并不视独立发展为唯一路径,而是追求最能促进技术落地的组织形态。

为何选择Nebius?

DeepTech:为何最终选择Nebius?

王瀚锐:首先,GPU是瓶颈,需选择拥有GPU资源的新型云服务商。Nebius源自Yandex,重视软件全栈,企业文化契合。其次,Nebius规模大但保持灵活性,行动速度快,且拥有强大的市场团队补足我们短板。最后,双方在并购前已有长期合作,彼此信任。

DeepTech:对被收购后股价大涨的心情如何?

王瀚锐:心情复杂。股价上涨是对团队的认可,但也带来更高期待和压力,需尽快交付成果。

整体收购 vs 人才收购

DeepTech:为何选择整体加入而非仅核心团队被挖角?

王瀚锐:默认即为整体收购。部分收购虽能规避审批流程,但会对剩余员工、投资人及客户造成困扰。对于平台型公司,整体并购更为稳妥。部分收购仅是特殊时期的权宜之计,非标准模式。

AI系统公司的生存之道

DeepTech:AI系统初创公司保持独立是否困难?

王瀚锐:存在选择性偏差。AI系统软件位于价值链中段,易受挤压。独立生存需绑定高增长大客户,或保持中立,支持多种GPU和模型。另一种路径是深耕垂直行业,如专为药企提供合规云服务,积累行业知识以维持独立性。

Token Factory愿景:让智能像水和空气一样便宜

加入Nebius后,王瀚锐的角色从“首席什么都管官”转变为专注于产品打磨和全球协调的管理者。他强调基础设施的核心在于可靠、可复现,如同空气般不被察觉却不可或缺。

智能体时代的挑战与机遇

DeepTech:智能体与之前推理有何不同?

王瀚锐:智能体涉及规划、工具调用、纠错等多步骤,KV缓存命中率高达90%-95%,对缓存管理提出更高要求。评价指标也从每秒Token数转向任务成功率和端到端耗时。我们正探索模型自动选择路由,根据任务难度切换模型,优化工作流。

DeepTech:面临哪些新风险?

王瀚锐:一是模型不支持工具发现导致“幻觉”调用;二是系统节点宕机导致KV缓存丢失,恢复时间长影响体验。

递归式自我改进(RSI)的应用

DeepTech:基础设施层在RSI中能做什么?

王瀚锐:关键在于定义验证器。我们致力于让RSI在基础设施上跑得更快,利用更强模型进行验证。虽然核心瓶颈在于验证闭环设计,但我们可以提供高效的运行环境。

基准测试的演变

DeepTech:未来竞争比的是什么?

王瀚锐:除了速度,算力的稳定供应是重要壁垒。基准测试正引入准确率指数及API前端表现评估,如工具调用稳定性、结构化输出准确性等。客户注意力正从聊天转向智能体,指标从Token层面转向任务层面。

DeepTech:用户对速度的容忍度变化?

王瀚锐:首Token响应时间仍关键,但高吞吐下每秒Token数达到300-500后,人眼已难分辨差异。然而,智能体任务的端到端速度至关重要,如将文档生成时间从10分钟缩短至1分钟,体验提升显著。

不急于自研芯片

DeepTech:是否有自研推理芯片计划?

王瀚锐:目前没有。底层算子仍在快速变化,如注意力机制变体众多,模型规模和KV缓存分配方式未定。此时造芯,3年后可能不适配。若做芯片,需提前预留余量以实现向前兼容。

物理AI与具身智能

DeepTech:Token Factory是否涉及物理AI?

王瀚锐:内部有团队专门支持机器人方向,包括自动训练物理AI模型和使用云端仿真器。虽然具身智能面临数据收集瓶颈,自由度高于自动驾驶,但我们正为此做准备。

未来的职业与梦想

DeepTech:未来职业规划?

王瀚锐:目前专注Nebius,做好Token Factory。学术与产业并非单选题,关键看哪种形态最利于技术落地。我不为创业而创业,若未来有新方向需创业形式,我会考虑。目前感兴趣的方向包括系统化模型路由及突破人机交互速度限制。

DeepTech:Token Factory的长期目标?

王瀚锐:成为“万物工厂”。Token控制的智能资源不受人口限制,可无限增长。我们的目标是让智能变得像水和空气一样便宜,探索其构建出的无限可能。

(来源:X@Eigen_AI_Labs)

注:首图/封面由 AI 辅助生成

【声明】内容源于网络
0
0
DeepTech深科技
DeepTech 是一家专注新兴科技的资源赋能与服务机构,以科学、技术、人才为核心,通过科技数据与咨询、出版与影响力、科创资本实验室三大业务板块,推动科学与技术的创新进程。DeepTech 同时是《麻省理工科技评论》中国区独家运营方。
内容 5695
粉丝 2
DeepTech深科技 DeepTech 是一家专注新兴科技的资源赋能与服务机构,以科学、技术、人才为核心,通过科技数据与咨询、出版与影响力、科创资本实验室三大业务板块,推动科学与技术的创新进程。DeepTech 同时是《麻省理工科技评论》中国区独家运营方。
总阅读136.3k
粉丝2
内容5.7k