过去一个多月,机器人学习的风向正发生微妙变化。从英伟达 GEAR 实验室的 RoboTTT 到 Generalist AI 的 GEN-1.5,行业焦点逐渐转向:机器人学习新任务,是否还必须经历“采数据—重新训练—再部署”的传统循环?
本溯智能(Basal Intelligence)创始人李健雄对此思考已久。2024 年,当 VLA(视觉 - 语言 - 动作)成为具身智能主流路线时,还在清华 AIR 攻读博士的他便意识到:若每遇新任务均需重训,模型再强也难以规模化部署。团队将目标锁定在 In-Context Learning(上下文学习),期望机器人能像大模型一样,通过示范、历史交互和环境反馈快速习得新技能。
早期尝试因前置条件不足而暂缓,团队转而分模块攻坚:UniAct 构建通用动作表示,X-VLA 实现跨本体模型落地,ODEWorld 压缩物理时空信息以延长 Context。如今,这些积累汇聚成本溯智能的创业基石。公司由 7 名核心成员组成,均来自清华 AIR、UC Berkeley 等顶尖高校,曾获多家头部美元机构投资。
图|X-VLA 团队在 IROS 2025 智元机器人操作挑战赛上取得世界冠军(来源:本溯智能)
七人团队创业:放弃大厂 offer,聚焦具身智能第一性原理
DeepTech:为何选择创业而非加入大厂?
李健雄:本科毕业于西安交大机械专业,保送清华后师从张亚勤院士攻读博士。2025 年毕业时虽获字节、小米等大厂 offer,但发现集团化作战难容高风险、非确定性的技术探索。具身智能尚未收敛,更需要小而尖锐的团队去定义新范式,而非跟随现有路径。
DeepTech:团队氛围与学术时期有何不同?
李健雄:保留 AIR 早期开放包容的讨论氛围,但更加专注。公司内部无严格上下级,以证据说话。导师张亚勤院士对年轻团队给予充分支持,视具身智能为一场长达二十年的长跑,鼓励我们在实战中淬炼能力。
图|BASAL Intelligence 团队在公司工区(来源:本溯智能)
重新定义机器人学习:In-Context Learning 与端侧自进化
DeepTech:当前 VLA 与 World Model 路线存在哪些局限?
李健雄:行业争论多集中于模型架构,却忽视了核心问题——规模化部署成本。Zero-shot(零样本)过于理想化,而依赖后训练(RL/SFT)的模式则退化为“工业自动化 Plus",随场景增加导致运维成本飙升。我们主张通过 In-Context Learning,将适配成本从云端训练转移至端侧,利用 Context 实现低成本泛化。
DeepTech:如何理解“端侧自进化”?
李健雄:区别于仅能“看一遍就会”的模型,我们强调机器人需利用端侧产生的 Context(成功或失败的执行记录)自我调整。无需梯度更新或参数重训,机器人即可在下一次执行中优化行为,形成单体“小闭环”。海量小闭环积累的高质量经验,进而反哺通用模型,构建数据“大闭环”。
从决策第一性原理出发
机器人本质是决策问题:在给定观测或 Context 下做出合理 Action。跳出具体架构之争,回归问题定义本身,才能解决跨场景、跨任务、跨本体的泛化难题。人类适应新环境依赖足够信息而非预存所有答案,机器人亦应如此。
构建全闭环生态:硬件协同与数据策略
DeepTech:模型结构与传统路线有何区别?
李健雄:我们采用以 Action 为中心的模型,优先建立与物理世界交互的能力,再关联语言知识,类似动物先学会生存再发展高级智能。此外,通过高效压缩物理信息,我们将 Context 长度从分钟级拓展至小时级,为长程任务提供支持。
DeepTech:如何处理硬件与数据环节?
李健雄:公司不造本体,而是与中国丰富的供应链及本体厂商深度协同,发挥“大脑”优势。数据方面,重点关注 Ego(第一视角)数据及针对性高质数据。相比美国在数据设计上的成熟,中国在本体供给和成本上更具优势,需结合技术指导挖掘高价值数据。
DeepTech:评测体系如何设计?
李健雄:摒弃单一的 Zero-shot 评测,转而关注 Few-shot 能力下的部署成本下降趋势。即衡量人类演示次数或机器人尝试次数是否随迭代减少,这才是具身智能规模化落地的关键指标。
未来展望:寻找正确的 Scaling Law
DeepTech:如何看待机器人领域的 Scaling Law?
李健雄:Scaling 必然存在,但关键在于维度选择。盲目堆砌数据追求 Zero-shot 并非最优解。应找到斜率最陡的有效维度,如提升 Few-shot 适应能力。GEN-1.5 展现了曙光,但距离真正的物理世界通用智能,仍需实现基于 Context 的举一反三与持续自进化。
DeepTech:首选落地场景有哪些?
李健雄:初期聚焦工厂及部分消费场景,验证模型在既有环境中快速适应新任务的能力。长期来看,只有当部署成本足够低,机器人才能真正进入充满长尾任务的家庭场景。

